生成時間は4090搭載機で約50秒
Qwen3-TTSは、2種類の違うサイズのモデルとその派生モデルが公開されています。0.6B(6億パラメータ)はストリーミング用途などを想定した軽量モデルで、1.7B(17億パラメータ)は品質を追求したモデルです。ただし、ファイルサイズは0.6Bで1.7GB、1.7Bが4.4GB程度で、比較的小さなサイズです。対応言語は10言語。日本語も含まれており、プロンプト指定も日本語で可能です。NVIDIA RTX 4090搭載のPCで1.7Bを使用した場合、30秒の音声を生成するために必要な時間は約50秒でした。
ローカルPC用の生成AIアプリ「ComfyUI」で動作するのですが、ファイルの依存環境のバージョンが最新のComfyUI環境では動作しないという問題があります。そのため、普段使っている環境とは別に新しくComfyUIをインストールした上、DarioFTさんが公開している動作環境を構築して、ワークフローを起動したところ、簡単に動作しました。以下の作例はいずれも1.7Bで生成したものです。
AIクラウドサービス等も利用できます。「FAL」では1.7Bで1分あたり0.0008ドル(約0.12円)と、非常に格安な設定で提供されています。
実在の人物やアニメの音声などを使って生成した音声を公開すると様々な問題が生まれる可能性があるため、良い参照音声がないかと考えるなか、動画AIが生成した音声を使うことを思いつきました。以前、AIキャラクターの“田中さん”を使って新年の挨拶動画を作成していたのですが、その音声を切り出して使ってみることにします。Bytedanceの動画生成AI「Seedance 2」で生成した動画です。この音声は気に入っていたのですが、動画AIは新しく生成するたびに声質が変わるため、固定する方法がないかと模索していました。
以下の動画は、前半が「あけましておめでとうございます」という元の音声です。後半がやはりこの連載の原稿を読み上げる32秒の音声です。イントネーションの不自然さは少しあるものの、元々の音声をかなりうまく再現しており、普通に読み上げている音声になっていることがわかります。全体的に美しくやわらかい音声で、人間の実際の声が話しているような臨場感も感じられます。
テキストプロンプトでも生成される音声の方向を若干調整できるのですが、リファレンスの音の影響力が強く、たとえばハキハキと話す田中さんを、ささやき声にするほどに極端に変えることはできません。
▲田中さんを使った読み上げの作例
本記事はアフィリエイトプログラムによる収益を得ている場合があります

この連載の記事
-
第169回
AI
もはやローカル動画生成AIの枠におさまらない。MiniMax H3の奥が深すぎる -
第168回
AI
とんでもない動画生成AIが出てきた 無料で試し放題の「MiniMax H3」を徹底検証 -
第167回
AI
“Fable級が無料”は本当か AI市場を震撼させた「Kimi K3」を試した結果 -
第166回
AI
社内WebサービスをAIで開発 完成後に直面した運用の壁 -
第165回
AI
AIがBlenderを勝手に操作 3D制作のハードルが一気に下がった -
第164回
AI
AIはすでに、私たちの心を内部で再現しているのかもしれない -
第163回
AI
無料の画像生成AI「Krea 2」が話題 実写もアニメもこなす新勢力 -
第162回
AI
ローカルAIで“しゃべる推理ゲーム”を作ったら、思ったよりちゃんとゲームになってきた -
第161回
AI
わずか3日で停止された新AI「Claude Fable 5」は何がすごかったのか -
第160回
AI
寝不足になるほど面白い ローカルAIと音声合成をつないだら、キャラが普通にしゃべり始めた -
第159回
AI
AIを使える人と使えない人で、とんでもない差が出ると実感した理由 - この連載の一覧へ





