高性能化する音声系のオープンモデルが話題になっています。1月22日に、アリババが「Qwen3-TTS Family」をオープンモデルとして公開しました。TTSは「Text-to-Speech」の略で、テキストを音声に変換するためのモデルです。わずか4秒ほどの音声ファイルを参考音声として読み込めば、かなりの精度で音声を再現できるという恐ろしく高性能なものです。筆者の声、動画AIから抽出した声などを使って、再現精度を検証しました。
Qwen3-TTSの強力さをわかりやすく理解できる例として、まず、筆者の音声で作例を作ってみました。2022年、YouTube Liveでの筆者の講演から、7秒分の音声を抽出しました。オンラインであることもあって若干音がこもっていますがよしとします。音声をQwen3-TTSに読み込ませ、過去の連載の冒頭を読み上げさせました。生成された音声は25秒となりました。たった7秒の声から生み出したにも関わらず、筆者の声真似を見事に実現しています。
▲筆者の声を使った作例。動画冒頭の7秒は筆者の元々の講演時の声、後半25秒がAI生成の声。
本記事はアフィリエイトプログラムによる収益を得ている場合があります

この連載の記事
-
第172回
AI
ついにAIキャラクターと“ビデオチャット”へ 「MiniMax H3」がリアルタイム生成に接近 -
第171回
AI
5秒の動画を3秒で出せる 動画生成AI「MiniMax H3」が爆速に進化 -
第170回
AI
「うわ、すげえ!」Unreal EngineをCodexに操作させたら制作の常識が変わった -
第169回
AI
もはやローカル動画生成AIの枠におさまらない。MiniMax H3の奥が深すぎる -
第168回
AI
とんでもない動画生成AIが出てきた 無料で試し放題の「MiniMax H3」を徹底検証 -
第167回
AI
“Fable級が無料”は本当か AI市場を震撼させた「Kimi K3」を試した結果 -
第166回
AI
社内WebサービスをAIで開発 完成後に直面した運用の壁 -
第165回
AI
AIがBlenderを勝手に操作 3D制作のハードルが一気に下がった -
第164回
AI
AIはすでに、私たちの心を内部で再現しているのかもしれない -
第163回
AI
無料の画像生成AI「Krea 2」が話題 実写もアニメもこなす新勢力 -
第162回
AI
ローカルAIで“しゃべる推理ゲーム”を作ったら、思ったよりちゃんとゲームになってきた - この連載の一覧へ






