音声付きAI動画とは、セリフ、口の動き、効果音、環境音が後付けではなく動画と一緒に生成され、クリップそのものが話して音を出す動画のことです。VIBEでは動画モデルの半数以上が音声を生成でき、常にオンのもの、オン/オフを切り替えられるもの、自分の音声録音を使えるものがあります。このガイドでは、どのモデルに何ができるのか、プロンプトの書き方、そして音声がうまくいかない理由を紹介します。
VIBEは、テキストのプロンプトや画像から、Kling、Sora、Veoなどの最新AIモデルを使って見事な動画を作れるAI動画生成アプリです。iOSとAndroidで複数のAIモデルが使えるため、音声付きクリップで最初に決めるのは、音声の挙動が目的に合うモデルを選ぶことです。
音声付きAI動画とは?どのような仕組みですか?
音声付きAI動画とは、映像に合わせた音声トラックも同じモデルが生成する動画のことで、話し声、足音、風の音、音楽が映像と一緒に作られます。モデルはテキストのプロンプトを読み、見えるものだけでなく聞こえるものも判断して、両方を一度に生成します。そのため、唇の動きや衝撃音、効果音がほぼ同じタイミングで揃います。
クリップに音声が付く方法は3通りあり、それぞれ挙動が大きく異なります。
- ネイティブ音声(常にオン): モデルが常にサウンドトラックを生成します。オフにはできず、プロンプトで方向づけます。
- オプション音声: アプリに音声のトグルが表示されます。オンにするとセリフと効果音が加わり、オフにすると無音のクリップになります。
- 音声入力: 声や音楽の録音をアップロードすると、モデルがそれを軸に動画を作り、口の動きやタイミングをファイルに合わせます。
モデルがどの方式なのかを知っておくと、試行錯誤の大半を省けます。方式ごとに必要なプロンプトの種類が違うからです。
音声を自動生成するVIBEのモデルはどれですか?
VIBEで常に音声を生成するモデルは、Sora 2、Sora 2 Pro、WAN 2.6、WAN 2.7、Happy Horse 1.1、Vidu Q3、Google Veo 3 Fast、Google Veo 3.1 Lite、Grok Imagine 1.5、Seedance 2.5、LTX 2.5 Fast、Flux 3、PRUNA Vです。Talking Avatarも、写真と音声録音から話す動画を作ることが目的なので、常に音声を生成します。
このうち、名前を覚えておく価値があるものを挙げます。
- Sora 2 は、同期したセリフと効果音を生成し、クリップの長さは4秒、8秒、12秒から選べます。Sora 2 Proは高品質版で、1080pにも対応しています。
- Seedance 2.5 は、セリフを含む同期した音声を生成し、4秒から30秒のクリップに対応します。アプリ内の音声対応モデルの中で最も長い範囲です。
- Happy Horse 1.1 は常に音声がオンで、720pまたは1080pの3秒から15秒のクリップを作れます。
- Grok Imagine 1.5 は画像から動画への変換専用で、同期した音声が加わります。旧バージョンのGrok Imagine 1.0にはこの機能がありません。
- LTX 2.5 Fast は、720pから4Kまでで標準で音声を生成します。

音声のオン/オフを切り替えられるモデルはどれですか?
VIBEで音声トグルを備えたモデルは、Google Veo 3.1、Veo 3.1 Fast、Kling v2.6、Kling 3 StandardとPro、Kling O3 StandardとPro、Seedance 1.5 Pro、Seedance 2.0、Seedance 2.0 Mini、LTX 2 Fast、LTX 2.3 Fast、PixVerse 6です。あとから音楽や録音を追加するつもりの場合や、静かな映像だけが欲しい場合に、トグルが役立ちます。
押さえておきたい点は次のとおりです。
- Kling 3 Pro は、多言語音声と、最大6ショットまでの構成ストーリー(ショットごとに専用のプロンプト)に対応しています。
- Kling O3 Pro はボイスバインディングを備えており、別々の生成をまたいでもキャラクターの声を保つのに役立ちます。このモデルファミリーの映像面については、Kling O3ガイドで解説しています。
- Seedance 2.0 は、同期したセリフ、効果音、音楽を生成します。
- PixVerse 6 は、音声トグルが最初はオフになっているため、意図的にオンにする必要があります。
オプション音声のモデルの多くでは、音声をオフにすると1秒あたりのトークンコストが下がります。無音のドラフトは、フルバージョンに支払う前に映像を確認する安上がりな方法です。
自分の声の録音をAI動画に使えますか?
はい、VIBEでは3つのツールが自分の音声を受け付けます。WAN 2.7は、wavまたはmp3形式で3秒から30秒、最大15 MBの声または音楽トラックを受け取り、動画をそれに同期させます。出力は720pに固定されます。PRUNA Vは、mp3、wav、flacに対応し、1枚の写真からリップシンクしたトーキングアバター風の動画を作れます。Talking Avatarは写真と音声録音から動画を作り、テキストのプロンプトはまったく不要です。
正確なセリフ、アクセント、言語が重要なときは、この3つが答えになります。モデルが声を作り出すのではなく、アップロードしたファイルに従うからです。静かな部屋でスマートフォンにセリフを録音し、長さの上限内に収めて、正面を向いた鮮明な写真から始めてください。手順はAIトーキングプレゼンター動画のガイドで順を追って説明しています。
ナレーションを組み込める無料のAI動画ジェネレーターはどれですか?
VIBEでナレーションに使える無料の選択肢は、無料枠で音声を扱えるモデルです。自分の録音を使えるPRUNA V、標準で音声を生成するLTX 2.5 Fast、音声トグルのあるLTX 2 FastとPixVerse 6が該当します。無料枠には制限があり、たとえばLTX 2.5 Fastは無料ユーザーだと720pの短いクリップに限られるため、現在お使いのアカウントで何が使えるかはピッカーで確認してください。
本格的なナレーションのワークフローには、PRUNA Vが最も強力な無料の出発点です。自分でナレーションを録音し、モデルがそれに合わせて映像を作るからです。音声入力に対応した有料モデル(WAN 2.7とTalking Avatar)は、より長い動画や高い忠実度が必要になったときに検討する価値があります。そもそも有料にするかどうか迷っている場合は、無料のAI動画メーカーで何ができるかをまとめた解説でメリットとデメリットを取り上げています。
セリフと効果音のプロンプトはどう書けばよいですか?
セリフと効果音のプロンプトを書くには、話し手を描写し、話す言葉を引用符で囲み、音と環境音は別の行にします。セリフ、効果音、背景を短いフレーズに分けると、モデルには絡み合った1文ではなく明確な指示が伝わります。
確実な構成は4つの部分からなります。
- 映像: 画面に映る人や物、場面設定、カメラの動き。
- セリフ: 引用符で囲んだ正確な言葉と、誰がどのように言うか(「静かに言う」「通りの向こうへ叫ぶ」など)。
- 効果音: 見える動作に結びついた1〜2個の具体的な音。ドアが閉まる音、ブーツの下で鳴る砂利の音など。
- 環境音または音楽: 遠くの車の音やゆったりしたピアノなど、背景となる音。
話す言葉は短くしてください。4〜8秒のクリップには、おおよそ1文のセリフが収まります。それより長い文は、早口になったり、途切れたり、もごもごしたりします。Veoのプロンプトガイドでも、セリフは引用符で囲み、効果音と環境音は別々にラベルを付けるという同じ書き方が使われており、このパターンは他の音声対応モデルにもよく当てはまります。

音声の指示を入れた8つのプロンプト例は?
セリフと音を説明に書き込んだ、応用できる8つのプロンプトを紹介します。
- 小さなキッチンでシェフがソースを味見して、「塩が足りないな」と言う。音:スプーンが鍋を軽く叩く音、背景で低く響くジュージューという音。
- 日の出の尾根でハイカーが立ち止まり、「着いた」とささやく。環境音:強い風、遠くの鳥の声。
- 電車の高架下でストリートミュージシャンがアコースティックギターを弾く。音:ギターをかき鳴らす音、頭上を走る電車の轟音。
- 店主が看板を「OPEN」にひっくり返し、「おはようございます」と言う。音:ドアベル、金属のシャッターが巻き上がる音。
- ロボット犬が金属のボディについた雨を振り払う。音:舗装路に落ちる雨、かすかなサーボ音。
- 車の中で2人の友人が笑い、1人が「音量上げて」と言う。環境音:穏やかなラジオの音楽、走行音。
- バリスタがラテアートを注ぐクローズアップ。音:ミルクを注ぐ音、陶器が静かに触れ合う音。セリフなし。
- 夕暮れの海岸線をナレーション風に撮ったショット。環境音:波、カモメ、ゆったりしたアンビエントシンセのパッド。
7番のような、静かでクローズアップの、音を主役にしたクリップについては、AI ASMR動画ガイドでそのスタイルをさらに深める方法を紹介しています。
音声付きAI動画がうまくいかないことがあるのはなぜですか?どう直せばよいですか?
音声付きAI動画が失敗する最も多い原因は、プロンプトの詰め込みすぎです。話し手が多すぎる、セリフが多すぎる、場面と食い違う音の指定がある、といった場合です。どの失敗にも簡単な対処法があります。
- セリフが途切れる、または早口になる: 文を短くするか、より長い尺を選んでください。言葉はクリップの中に収まる必要があります。
- 唇と言葉が合わない: 見える話し手は1人にし、カメラのほうを向かせ、セリフ中の速いカメラワークは避けてください。
- 効果音が違う、または出ない: 「リアルな音を追加して」と書くのではなく、音とそれを起こす動作を具体的に書いてください。
- 頼んでいない音楽が入る: プロンプトに「音楽なし」と書くか、音声トグルのあるモデルを使って自分でトラックを追加してください。
- クリップごとに声が変わる: シリーズものでは、ボイスバインディングのあるモデル(Kling O3 Pro)を使うか、毎回同じ録音をアップロードしてください。
- 画面内の文字が崩れる: 音声対応モデルでも、読める文字の表現は苦手なので、読ませたい看板やキャプションは避けてください。

トグルのあるモデルなら、まず短い無音のドラフトを生成して映像を確認し、それから音声をオンにして再生成してください。この順番のほうが、音と映像を同時に直すよりトークンの消費が少なくなります。

よくある質問
AIで音声付きの動画を生成できますか?
はい。VIBEのSora 2、Seedance 2.5、Happy Horse 1.1などの複数のモデルが、セリフ、効果音、環境音を映像と一緒に生成するため、最初から仕上がったような音のクリップができあがります。
音声を生成するAI動画モデルはどれですか?
VIBEでは、13のモデルが常に音声を生成し、さらに13のモデルに音声トグルがあります。全リストは上記のとおりで、各モデルの音声の挙動はモデルピッカーで確認できます。
AI動画に自分のナレーションを追加できますか?
はい、WAN 2.7、PRUNA V、Talking Avatarで可能です。録音をアップロードすると、それに合わせて動画が作られます。ほかのモデルは独自の音声を生成し、録音は受け付けません。
ドイツ語の音声付きAI動画を作れるアプリはありますか?
Kling 3 Proは多言語音声に対応しているため、ドイツ語でセリフを書いて、まず短いクリップで試せます。言葉を確実に指定したい場合は、ドイツ語のナレーションを自分で録音し、ファイルに従うWAN 2.7、PRUNA V、Talking Avatarを使ってください。
ナレーション機能のあるAI動画エディターはありますか?
VIBEはジェネレーターであり、タイムラインエディターではありません。内蔵の音声付き、またはお手持ちの録音に同期したクリップを生成します。複数のクリップを1本の動画にまとめる方法は、スマートフォンでの編集ガイドで説明しています。
音声をオフにするとトークンを節約できますか?
オプション音声のモデルの多くでは、節約できます。音声をオフにすると1秒あたりのトークンコストが下がるため、無音のドラフトはショットを試す安上がりな方法です。
iOSとAndroidで使える、音声付きのAI動画生成アプリはありますか?
はい。VIBEは、テキストのプロンプトや画像から、Kling、Sora、Veoなどの最新AIモデルを使って見事な動画を作れるAI動画生成アプリで、iOSとAndroidの両方で動作します。
まとめ
音声付きAI動画は、適切なモデルを選び、セリフと音を書き込んだプロンプトを用意することに尽きます。常に音声がオンのモデルなら1ステップで仕上がったクリップが得られ、トグルのあるモデルなら細かく調整でき、音声入力に対応したモデルなら正確な言葉を自分で指定できます。まず短いドラフトから始め、セリフは1文に収め、欲しい音をひとつずつ書いてください。iOSとAndroid向けのAI動画生成アプリVIBEで、これらのモデルをダウンロードセクションから試してみましょう。



