このページの本文へ

新清士の「メタバース・プレゼンス」 第174回

AIでMVを作るのは想像以上に大変だった 制作34時間、繰り返した“ダメ出し”でわかったこと

2026年09月21日 07時00分更新

文● 新清士

  • この記事をはてなブックマークに追加
  • 本文印刷

まず90秒分のMVを設計する

 AIエージェントにうまく作業させるには、いきなりすべての作業を始めさせず、まず計画を立てさせて全体像を把握できる状態にし、細かく作業を分割して進めると比較的成功しやすい傾向があります。曲全体は3分52秒あるため、1番と間奏部分の1分30秒までをまず作成させることにしました。

 GPTにはコンセプトを伝えます。キャラクターには本連載のゲストキャラである“田中さん”を起用し、3人の現在・人工性・未来を示す3枚のコンセプト画像を基に構成を検討させることにします。参照画像は「GPT-Image 2.5」を利用して準備します。

 どのタイミングでカットを切り替えるのかを正確に把握させるために、まず音と歌詞を分析させました。GPTは音楽をそのまま聴くことはできませんが、音を分解してどのタイミングでどう変化しているのかを分析することはできます。音量の推移を分析させ、歌詞が切り替わるタイミングと照らし合わせながら、シーンの分割案に落とし込みました。分析結果を基に、GPTが最初の構成案を提案しました。

曲のスタートから90秒までをGPTが分析した結果。上段は音量の変化、下段はカットの切り替え位置。緑色は画面内の動きを示し、位置が高いほど動きが大きくなる計画

GPTが提示した最初の構成案。時間ごとの大まかな展開が書かれている

 提案されたプランを見直して、何度も修正を指示し、v04まで進んだところで納得できたため、次に、仮の構成を細かいカットに分けていきます。全49カットで、1カットは数秒単位で構成されており、ローカル環境のMiniMax H3に一つずつ指示を出して生成していくことになります。

49カットのプラン案の一部

 すでにMiniMax H3の環境は用意してあるので、生成作業もGPTを通じてCodexから制御していきます。Omniリファレンス機能を使い、シーンごとに、キービジュアルとプランを基にプロンプトが作られ、960×1280の高速化設定で生成が進んでいきます。各カットは3秒程度の動画で、RTX 4090搭載PCでは生成に約1分30秒かかります。作業用のプログラムをGPTがPythonで作成して一括で処理するため、一度開始すれば、49カットすべての生成が90分ほどで完了するのを待つだけで済みます。生成したそれぞれの動画は、GPTが自動で結合し、元の楽曲と組み合わせて動画ファイルとして出力してくれます。

カテゴリートップへ

本記事はアフィリエイトプログラムによる収益を得ている場合があります

この連載の記事
ピックアップ