歌詞をそのまま描かないミュージックビデオ

ここしばらく、Hermesと一緒にミュージックビデオ生成のパイプラインを組んでいる。仕組みはシンプルだ。メタデータ付きの音声ファイルを放り込むと、エージェントが脚本を書き、フレームとクリップを生成し、全体を編集する。夜のうちに終わる仕事で、ミニPCのGPUがレンダリングして、朝には完成した動画ができている。

でも今日は1フレームもレンダリングしなかった。レンダリングそのものより大事なことに取り組んだ。「あるジャンルの本物のミュージックビデオとは実際どんな見た目なのか」を突き止めることだ。

問題:AIは歌詞をそのまま絵にする

AIでミュージックビデオを作ったことがある人なら誰でも知っている。モデルは歌詞を受け取って、一対一の画像を作る。「夜のハイウェイを走る」とあれば高速道路の車が出てくる。「目に炎が宿る」とあれば炎の目が出てくる。

でも本物のミュージックビデオはそうは動かない。歌詞の内容をそのまま撮る人はいない。ミュージックビデオはそれ自体が一つの映像言語で、独自の約束事・ショット・照明・テンポを持っている。そしてその約束事はジャンルによって違う。

Hermesがやったこと

当てずっぽうの代わりに、きちんと調べさせた。指示は具体的だった。カントリー、アメリカーナ、フォーク/アコースティック、バラード、シンガーソングライター、インディーフォークという6つの穏やかで物語的なジャンルについて、それぞれを突き止めること:

  • どのタイプのビデオが主流か(アーティストの演奏か、俳優による物語か)、
  • 典型的なショットと構図(顔にどれだけ寄るか、ギターを持つ手が見えるか、広い風景か)、
  • 照明と色調、
  • 典型的なロケ地とモチーフ、
  • 編集のテンポ、
  • アーティストの顔の見せ方、
  • 加えて、実際に機能するリンク付きの具体的な実在ビデオを2〜3本。

エージェントは情報源を探し、約束事の記事やビデオのランキング、AI生成のガイドなどを集めて、一つの文書にまとめた。驚いたことがいくつかあった。

一つ目、カントリーとフォークは「ギターを持った人」だけではない。大部分は映像で語られる物語だ。道路、実家、ゴールデンアワー、暖かいセピア。演奏はあるが、しばしば物語と交互に出てくる。

二つ目、編集テンポを秒単位で示す情報源はどこにもなかった。そしてここが一番ありがたかった点だ。Hermesは「1ショット約4秒」と書かなかった。どの情報源にも書いていなかったからだ。「未確定」と書いた。まさに私が指示した通りに。データをでっち上げるな、と。

これは何のための作業か

この文書は見せびらかしではない。パイプラインの入口だ。GPUがレンダリングするものを受け取る前に、脚本は正しいジャンルの言葉を話さなければならない。バラードはバラードらしく、インディーフォークはインディーフォークらしく見えなければならない。そうでなければ、誰もが一目で見抜く例のありきたりな「AIルック」が出てくるだけだ。

そしてここで、エージェントの第二の役割が姿を見せる。声に出して言う価値のある役割、助言者としての役割だ。私はエネルギー業界で働いていて、発電のことはそれなりに知っている。でもカントリーのビデオとインディーフォークのビデオで構図がどう違うかなんて、まったく分からない。Hermesは映画の約束事を知っている者のようにテーマに入り込み、本物の情報源を探し、私が一人では長い時間をかけて集めるしかなかった知識を持ち帰ってきた。

もちろん、目は光らせている。「データをでっち上げるな」という指示は自分にも課して、リンクが本当に動くか確認している。でも仕事の大半、情報源探しから一つのノートに整理するところまで、ほとんどひとりでに片付いた。

ミュージックビデオは後から来る。まずは文法からだ。