このページの本文へ

新清士の「メタバース・プレゼンス」 第174回

AIでMVを作るのは想像以上に大変だった 制作34時間、繰り返した“ダメ出し”でわかったこと

2026年09月21日 07時00分更新

文● 新清士

  • この記事をはてなブックマークに追加
  • 本文印刷

長文の計画書を“構成案”に変えることに

 どうしてこんなことになったのかを、筆者がGPTに問い詰めるわけですが、「MV v02計画」を筆者が承認して進行させてしまったことが最大の原因でした。とはいえ、かなりの長文で、眠気が強いときには読む気になりにくい内容でした。

 MV v03の計画案を改めて検討させることにしました。まず、3つの世界の設定についての意見を明確に伝え、演出方針を「歌で伝える」「世界を見渡す」「未来を選ぶ」としました。そのうえで、3つの世界それぞれの参照画像を、画像AIモデル「Krea2」で作成した画像に固定しました。

3つの世界の演出方針

3つの世界それぞれに対応する固定参照画像。左から「歌で伝える」「世界を見渡す」「未来を選ぶ」

 そのうえで、90秒の流れを設計した計画案が出てきます。計画案を承認すると、MV v02の失敗を受けて、GPT-6 Astraが作業工程を修正してきました。計画文の量が多く、完成形をイメージできないと筆者が不満を述べていたため、実際の動画生成を始める前に、構成案の仮動画を作成したのです。

 仮動画に使用されているカットは、リファレンス画像の作成時に参考として用意したものです。見た目が幼すぎたりリアルすぎたりして不採用にした画像も含まれており、36カットに再編した各シーンのタイミングを筆者が把握しやすいよう、GPTが用意したものです。仮動画を使えば、長文を読み落としてミスする事態を防げます。

MV v03の構成案

Astraが作成したMV v03の構成チェック用動画より。静止画でほとんどを構成

△MV v03の構成チェック用動画。動かないのが正しい

 こうして、できあがった最初の90秒は筆者にとって満足のいくものになりました。

 ただし、前半だけでは、まだ動きが控えめでした。後半で再び現れるサビでは、全体の動きを激しくすることにします。それぞれの場所で意思を示す象徴として、3人のキャラクターが走り出し、3人の姿をオーバーラップさせていくようにします。ここでも計画を立て、カットを作らせました。90秒版を先に完成させたことで、筆者の意図を高い精度で読み取れるようになり、その後の意図のずれはほとんどありませんでした。そして、一度完成した後は、どんどん微修正をかけていきます。

 走り出す演出で動きが出たものの、カメラの動きが小さく、ダイナミックさに欠けていたため、特に「世界を見渡す」役のシーンでは、カメラが動き回り、様々な角度から撮影することで、動きをつけるようにしました。

 そして、曲の終わりには意思の象徴として手を空に掲げ、遠くで鳥が飛び上がるシーンを追加しました。

 最後に、リップシンクに対応させます。MiniMax H3にはCarasibanaさんの「Face Refine」とShrek3OnVH5さんの「H3 NativeAudioLock」というカスタムノード技術があり、2つの技術を組み合わせることで、音声に合わせて口元を再生成し、リップシンクを実現できます。

 GPTに、カスタムノードの適用が必要なカットを検出させ、対応する音声と歌詞を入力して生成させることで、精度の高いリップシンク動画を作ることができます。リップシンクの作業もほぼGPTに任せられます。

後半の田中さんが走り出すカット、手を伸ばすカット、鳥が飛び上がるカット

△完成した『設計と意思』のフルバージョンMV

カテゴリートップへ

本記事はアフィリエイトプログラムによる収益を得ている場合があります

この連載の記事
ピックアップ