VIBE ブログ8分で読める

AIアバター動画:話すプレゼンター動画の作り方

1枚の写真と短い音声録音があれば、VIBEのAIアバター動画でリップシンクされた話すプレゼンター動画に変換できます——カメラも俳優も、テキストプロンプトも不要です。

Jiyeon Kim

Jiyeon Kim

VIBE AI動画エディター

VIBE内で1枚の写真から生成された、話すAIアバター動画のプレゼンター
目次
  1. AIアバター動画とは?どのように機能するのか
  2. Talking AvatarはVIBEの他のAI動画モデルと同じものですか?
  3. AI動画生成アプリで説明動画を作成する方法
  4. AIアバター動画は、UGC風広告やスポークスパーソン動画に使えますか?
  5. AIアバター動画はどんな言語でも話せますか?
  6. AIアバター動画はどの解像度・長さで出力できますか?
  7. 標準的なAI動画モデルではなくAIアバター動画を使うべきタイミングは?
  8. よくある質問
  9. まとめ

AIアバター動画とは、1枚の写真と短い音声録音を、カメラも俳優も使わずに、口の動きを音声に同期させた「話す」動画に変換する技術です。VIBEのTalking Avatarモデルは、アップロードされた音声クリップのリズムを読み取り、それに合わせて静止画を動かすことで、録音されている言語のまま480pまたは720pのスポークスパーソン風のクリップを生成します。このガイドでは、このモデルに必要な入力データ、出力されるもの、そしてAIアバター動画がVIBEの他のテキストから動画・画像から動画モデルとどのように使い分けられるのかを詳しく解説します。

VIBEは、Kling、Sora、Veoといった最新のAIモデルを使って、テキストプロンプトや画像から見事な動画を作成できるAI動画生成アプリです。その中でもTalking Avatarは、たった一つの特定の役割のために作られたモデルです。それは、何も撮影することなく、静止画を「話す人物」に変えることです。

AIアバター動画とは?どのように機能するのか

AIアバター動画とは、顔写真と別に用意した音声録音を組み合わせ、その音声に合わせて口・目・頭の動きをアニメーション化することで、リップシンクした「話す」動画を生成する動画生成モデルです。VIBEではこれがTalking Avatarモデルにあたり、アプリ内の他のどのモデルとも異なる仕組みで動作します。テキストプロンプトの入力欄が一切ないのです。言葉でシーンを説明する代わりに、写真と音声録音という2つのファイルを用意するだけで、あとはモデルが処理してくれます。

Talking AvatarはPremium(プレミアム)ランクのモデルであるため、一部のテキストから動画・画像から動画モデルのようにVIBEの無料ローテーションには含まれていません。解像度は480pまたは720pで生成され、720pの方が生成あたりのトークン消費量が多くなります。VIBEの他のほとんどのモデルのように秒単位で課金されるのではなく、Talking Avatarは音声録音の長さに関わらず、生成ごとに一定数のトークン(480pで35トークン、720pで60トークン)を消費します。そのため、スクリプトが長いほど、完成した動画1秒あたりのコスト効率が短いスクリプトよりも高くなります。Talking Avatarは、VIBEの他のAI動画生成モデルと同じモデルラインナップに含まれています。ぜひVIBEをダウンロードして、自分のスクリプトで試してみてください。

AIアバター動画に必要な入力は、次の2つだけです。

  • 1人の顔がはっきり写った正面向きの写真——出力される動画のフレームはこの写真とまったく同じになるため、照明が良く、サングラスや遮蔽物がないもの
  • ファイルとしてアップロードする音声録音(ナレーション、広告の読み上げ、コースの導入部など、話し言葉であれば何でも可)——その長さがそのまま完成するクリップの長さになります
  • テキストプロンプトや台本の入力欄はありません。モデルはテキストを一切読み取らず、写真と音声のみを参照します
  • 生成前に選択する480pと720pの解像度オプション

Talking AvatarはVIBEの他のAI動画モデルと同じものですか?

いいえ、異なります。Talking Avatarは画像から動画への変換専用で、テキストプロンプトを受け付けません。一方、セルフィーを動画に変換するガイドで紹介しているモデルを含め、VIBEの他のほとんどのモデルは、写真に加えて動き・カメラワーク・シーンを説明するテキストプロンプトを必要とします。標準的な画像から動画へのモデルは、入力したテキストに従って写真をアニメーション化しますが、Talking Avatarはシーンの指示に従う代わりに、音声録音の内容に合わせて口の動きを同期させながら写真をアニメーション化します。

また、アスペクト比を選択する機能もありません。VIBEの標準モデルは生成ごとに複数のアスペクト比を選べますが、Talking Avatarの出力フレームはアップロードした写真に固定されます。そのため、最終的な形状をコントロールするには、事前に元の写真を9:16、1:1、16:9などにトリミングしておく必要があります。

話すAIアバター動画を生成するためにアップロードされる台本と音声録音
話すAIアバター動画を生成するためにアップロードされる台本と音声録音

AI動画生成アプリで説明動画を作成する方法

AI動画生成アプリで説明動画を作成するには、まず台本を書き、その台本どおりにクリアなナレーションを録音(または生成)し、正面を向いたプレゼンターの写真をアップロードして、VIBEのTalking Avatarモデルにその2つを同期させ、1本の話す動画にまとめてもらいます。このモデルにはテキストプロンプトの入力欄がないため、完成した動画は音声ファイルの内容をそのまま忠実に話します。これは、製品説明や、言い換えが許されない開示文言など、正確な言葉遣いが求められる場面で役立ちます。

  1. 実際に話される通りに台本を書く——出力される動画の長さは単語数ではなく録音の長さに一致します
  2. ナレーションを録音する(または既存の録音を使う)。背景ノイズを最小限に抑えたクリアな音声ファイルとして書き出します
  3. 最終的な動画に必要なアスペクト比にトリミングした正面向きの写真を選ぶ(または撮影する)——ShortsやReelsには9:16、YouTubeには16:9
  4. VIBEのTalking Avatarモデルに写真と音声ファイルをアップロードし、480pか720pを選択する
  5. 完成したクリップをトリミングしてキャプションを付け、公開先のプラットフォーム向けに書き出す

AIアバター動画は、UGC風広告やスポークスパーソン動画に使えますか?

はい、使えます。Talking Avatarのクリップは、AI UGC動画広告におけるスポークスパーソンや体験談風の読み上げに適しています。1人の人物がカメラに向かって直接話しかけるというフォーマットは、フィードやストーリーズの配置でまさに成果を出しやすい形式だからです。1本の話す動画を軸にフック・オファー・行動喚起(CTA)をどう構成するかについては、AI UGC動画のガイドを参考にしてください。また、同じ単一プレゼンター形式が製品広告動画にどう応用できるかもあわせてご覧ください。

話される言葉はアップロードされた音声ファイルから言い換えなしでそのまま使われるため、AIアバター動画は、価格情報、訴求内容、必須の開示文言など、言葉遣いを正確にする必要がある場面でも役立ちます。各プラットフォームは、この種のコンテンツに対するラベル表示要件を年々明確にしています。例えば、YouTubeはクリエイターに対し、AIを使ってリアルなコンテンツを大きく改変または生成した動画である場合に開示を義務付けていますが、開示してもリーチや収益化資格が制限されるわけではありません。公開前に、投稿先のプラットフォームの最新のポリシーを必ず確認してください。

60秒で、はじめてのAI動画を。

Kling、Veo、SoraなどでAI動画を生成 — iOS・Androidで無料。

App StoreGoogle Play
台本のセリフを話す、リップシンクされたAIアバター動画のクローズアップ
台本のセリフを話す、リップシンクされたAIアバター動画のクローズアップ

AIアバター動画はどんな言語でも話せますか?

はい、話せます。Talking Avatarはアップロードされた音声ファイルに合わせてリップシンクするため、ドイツ語、スペイン語、日本語、韓国語など、どの言語の音声録音であっても、言語設定を切り替えることなく同じように処理できます。このモデル自体は音声を生成したり翻訳したりすることはなく、すでに録音済みの音声に合わせて写真をアニメーション化するだけです。

そのため、同じ台本を複数の言語で公開したいクリエイターにとっても便利です。各言語で同じセリフを録音し、毎回同じ元写真をアップロードすれば、撮影し直すことなく言語ごとに1本のTalking Avatarクリップを生成できます。

AIアバター動画はどの解像度・長さで出力できますか?

VIBEのAIアバター動画は、標準では480pで生成され、720pは追加コストのかかるオプションとして選択できます。また、長さを個別に指定する機能はなく、クリップの長さは常にアップロードした音声録音の長さと正確に一致します。20秒の台本なら20秒の動画に、90秒の台本なら90秒の動画になります。

Talking Avatarには選択できるアスペクト比の一覧がないため、出力フレームも入力した写真と1対1で一致します。後から形状を選べると期待するのではなく、正方形・縦長・横長のいずれにするか、アップロード前に元写真のトリミングを計画しておきましょう。

480pと720pのAIアバター動画出力を並べて比較
480pと720pのAIアバター動画出力を並べて比較

標準的なAI動画モデルではなくAIアバター動画を使うべきタイミングは?

説明動画、コースの導入部、体験談風広告、スポークスパーソンのクリップなど、動画の役割が「人物が視聴者に直接語りかけること」である場合はAIアバター動画を使い、風景、製品のBロール、話すプレゼンターが登場しないカットには標準的なテキストから動画・画像から動画モデルを使いましょう。この2つはまったく異なる役割のために作られています。Talking Avatarはシーンのコントロールを一切行わず写真を音声に同期させるのに対し、VIBEの画像から動画生成の背後にあるモデルは、写真や文章のプロンプトを、カメラワーク・アクション・変化するシーンへとアニメーション化します。

完成した動画の多くは、この両方を組み合わせて使用しています。冒頭のフックや説明部分にはTalking Avatarのクリップを使い、補足カットにはVIBEの他のモデルで生成したBロールをつなぎ合わせるのです。どちらのモデルも互いを代替するものではなく、同じプロジェクトの両端をそれぞれ担っています。

ソーシャルメディア向けに縦長9:16のショート動画に編集された、話すAIアバター動画のクリップ
ソーシャルメディア向けに縦長9:16のショート動画に編集された、話すAIアバター動画のクリップ

よくある質問

AIアバター動画とは何ですか?

AIアバター動画とは、1枚の写真と短い音声録音を、カメラも俳優も使わずに、口の動きを音声に同期させた「話す」動画に変換する技術です。VIBEは、Kling、Sora、Veoといった最新のAIモデルを使って、テキストプロンプトや画像から見事な動画を作成できるAI動画生成アプリであり、そのTalking Avatarモデルは、この「写真+音声」形式専用に作られています。

VIBEのようなAI動画生成アプリは複数言語に対応していますか?

はい、対応しています。Talking Avatarモデルはアップロードされた音声ファイルに合わせてリップシンクするため、ドイツ語、スペイン語、日本語など、どの言語の音声録音であっても、言語設定を切り替えることなく利用できます。

AIアバター動画に自分の写真を使えますか?

はい、使えます。顔がはっきり写った正面向きの写真であれば、どんなものでもアップロードできます。出力される動画のフレームはその写真とまったく同じになるため、アップロード前に希望のアスペクト比(ShortsやReelsには9:16、YouTubeには16:9)にトリミングしておいてください。

AIアバター動画には台本やテキストプロンプトが必要ですか?

いいえ、必要ありません。Talking Avatarモデルはテキストプロンプトを一切受け付けず、アップロードされた写真と音声録音だけを読み取ります。話される言葉は、その音声ファイルの内容そのものです。

AIアバター動画のクリップはどのくらいの長さにできますか?

長さを個別に指定する機能はなく、クリップの長さはアップロードした音声録音の長さと正確に一致します。30秒の台本なら30秒の動画になります。

AIアバター動画モデルは無料で使えますか?

いいえ、無料では使えません。Talking AvatarはVIBEのPremium(プレミアム)ランクのモデルであり、一部のテキストから動画・画像から動画モデルとは異なり、無料ローテーションには含まれていません。

まとめ

AIアバター動画は、カメラも俳優もテキストプロンプトも使わずに、写真と音声録音を「話す」リップシンク動画に変換するという、一つの特定の課題をうまく解決します。VIBEは、Kling、Sora、Veoといった最新のAIモデルを使って、テキストプロンプトや画像から見事な動画を作成できるAI動画生成アプリであり、そのTalking Avatarモデルは「写真+音声」形式に特化して対応し、480pまたは720pで生成され、クリップの長さは録音に合わせて固定されます。シーン、Bロール、カメラワークを伴うものについては、VIBEの他のテキストから動画・画像から動画モデルがTalking Avatarの後を引き継ぎます。次のスクリプトを話す動画に変えるには、iOSまたはAndroidでVIBEをダウンロードしてください。

この記事をシェア

60秒で、はじめてのAI動画を。

Kling、Veo、SoraなどでAI動画を生成 — iOS・Androidで無料。

App StoreGoogle Play