Grok Imagine 1.5は、xAIの画像から動画を生成するモデルです。静止画を1枚渡すと、音声が同期した4〜15秒のクリップが返ってきます。VIBEでは、Grok Imagine 1.5はPremiumモデルとして写真からの生成のみに対応しており、写真が見た目を決め、任意のプロンプトで動きを指示します。このガイドでは、得意なこと、元のGrok Imagineとの違い、スマートフォンできれいな結果を出す方法を紹介します。
VIBEは、テキストプロンプトや画像から、Kling、Sora、Veoなどの最新AIモデルを使って魅力的な動画を作成できるAI動画生成アプリです。iOSとAndroidのアプリで複数のAIモデルを使えるため、Grok Imagine 1.5は数ある選択肢のひとつです。この記事では、用途によっては別のモデルのほうが向いている場面についても説明します。
Grok Imagine 1.5とは?どのように動くのか
Grok Imagine 1.5は、2026年6月にリリースされたxAIの動画モデルで、開始画像をアニメーションにし、同じ処理の中でサウンドトラックも生成します。写真をアップロードし、必要に応じて動かしたい内容を書き、長さと解像度を選ぶと、動き、環境音、効果音、場合によっては音声も含んだ完成クリップが返ってきます。
VIBEでのこのモデルの特徴は次の3点です。
- 画像から動画のみ: テキストだけで生成するモードはありません。すべてのクリップは、写真または生成した画像から始まります。
- ネイティブ音声は常にオン: サウンドは結果の一部です。オフにはできないため、プロンプトで方向性を指示します。
- Premiumプラン: 無料プランではなく、Premiumユーザー向けです。

写真が開始フレームになるため、構図、被写体、照明、スタイルはモデルが動く前にほぼ決まっています。そのためGrok Imagine 1.5は予測しやすいモデルです。写真に写っているものが、0秒目のクリップの見た目になり、プロンプトではその後に何が起こるかだけを書きます。アプリ内の全モデルを見たい方は、モデル一覧をご覧ください。
Grok Imagine 1.5とGrok Imagine 1.0はどう違う?
最大の違いはサウンドです。Grok Imagine 1.5は音声を生成しますが、元のGrok Imagineには音声トラックがまったくありません。古いモデルもVIBEに別項目として残っているので、選ぶ前に違いを把握しておくと便利です。
- 音声: 1.5は常に同期したサウンドを生成します。Grok Imagine 1.0は無音のクリップになります。
- 入力: 1.5は画像から動画のみです。Grok Imagine 1.0はテキストから動画と画像から動画の両方に対応します。
- 長さ: 1.5は4、6、8、10、12、15秒から選べます。Grok Imagine 1.0は6、8、10秒です。
- 解像度: どちらも480pと720pに対応し、デフォルトは720pです。
- アスペクト比: どちらも16:9、9:16、1:1、4:3、3:4、3:2、2:3の7種類に対応します。
xAIは、1.5を動き、物理表現、音声が向上したアップグレードと説明しており、クリップ全体で動きが安定し、音声も聞き取りやすくなったとしています。これはあくまでメーカーの主張なので、ご自身の画像で確かめてください。実用的な確認ポイントは、最初のフレームから最後のフレームまで被写体の形が保たれているかどうかです。
Grok Imagine 1.5は写真からAI動画を作れる?
はい。写真から動画を作ることがGrok Imagine 1.5のできることのすべてで、しかも1ステップで完了します。開始画像を選ぶと、モデルがそれをアニメーションにします。VIBEでは、このモデルにテキストから動画のモードはありません。
元にする写真には、次のような共通点があります。
- 人物、ペット、商品、乗り物など、輪郭がはっきりした被写体が1つある。
- ピントが合っていて照明が均一なので、モデルが動かしやすい細部がきれいに残っている。
- 動きのための余白がある。たとえば歩く被写体の進行方向に空間がある。
- 中央付近に文字、ロゴ、細かい模様がない。動きの中で細部が崩れやすいためです。
写真がない場合は、先に生成してください。VIBEには画像モデルがあり、生成した静止画もカメラで撮った写真と同じように開始フレームとして使えます。写真を動かす方法をより詳しく知りたい方は、写真をAI動画にする方法をお読みください。複数のクリップで同じキャラクターを使いたい場合は、参照画像で作る一貫したキャラクターのガイドで手順を説明しています。

Grok Imagine 1.5は音声も生成する?
はい。Grok Imagine 1.5は常に音声を生成し、環境音、効果音、シーンによっては音声(セリフ)も含まれます。音声は映像と一緒に作られるため、足音、風、水しぶき、衝突音などが、後から重ねたものではなく動きにきちんと合いやすくなります。
知っておきたい制限が2つあります。1つ目は、このモデルではVIBEに自分の音声録音をアップロードできないため、サウンドは常にモデルが生成したものになることです。2つ目は、音声をオフにできないため、音についてプロンプトで触れないとモデルが判断し、意図しない環境音が加わる場合があることです。欲しい音は短く一言で書きましょう。たとえば「窓に当たる静かな雨音、遠くの車の音、音楽なし」のようにします。
ダイアログ、効果音、環境音がモデルごとにどう違うかは、音声付きAI動画ガイドで並べて比較しています。
Grok Imagine 1.5の長さ、解像度、アスペクト比は?
Grok Imagine 1.5は、4〜15秒の6種類の長さ、2種類の解像度、7種類のアスペクト比に対応しています。VIBEでの全リストは次のとおりです。
- 長さ: 4、6、8、10、12、15秒。
- 解像度: 480pまたは720p(デフォルトは720p)。
- アスペクト比: 16:9、9:16、1:1、4:3、3:4、3:2、2:3。
- 入力: 開始画像1枚と、任意の動きのプロンプト。
- 音声: 常にオン。
生成する前に、投稿先に合わせて比率を選びましょう。縦型のショート動画には9:16、ワイド画面には16:9、フィード投稿には1:1または3:4が向いています。開始用の写真も近い形にしておかないと、想像以上に構図が変わることがあります。どの比率がどのプラットフォームに合うかは、アスペクト比ガイドで確認できます。
長ければよいとは限りません。15秒のクリップは元の画像から崩れる時間が長くなりますが、4〜8秒のクリップのほうが被写体が保たれやすく、コストも抑えられます。まず短い長さでアイデアを試し、気に入ったものだけ長くするのがおすすめです。

VIBEでGrok Imagine 1.5を使う手順は?
VIBEでGrok Imagine 1.5を使うには、画像から動画のフローを開き、モデルを選び、開始画像を追加して、長さと解像度を設定し、生成します。iOSでもAndroidでも、数回のタップで完了します。
- アプリを開き、画像から動画のセクションから画像から動画のプロジェクトを始めます。
- モデル一覧からGrok Imagine 1.5を選びます。Premiumプランが必要です。
- フォトライブラリ、またはアプリで生成した画像から開始画像を追加します。
- コントロールしたい場合は短い動きのプロンプトを書きます。任意ですが、動きと音について1文書くだけで結果がよくなることが多いです。
- アスペクト比、長さ、解像度を選びます。まずは720pで6〜8秒から始めましょう。
- 生成して、確認し、調整します。動きがおかしければ、全部を書き直すのではなく、プロンプトの1点だけ変えてもう一度実行します。
コストはクリップの長さに応じて増えるため、短いテスト生成が、モデルが画像をどう解釈するかを知る最も安い方法です。うまくいったクリップは、ダウンロードして投稿したり、次のシーンのベースとして使ったりできます。
Grok Imagine 1.5で効果的なプロンプトは?
Grok Imagine 1.5で効果的なプロンプトは、画像がすでにシーンを示しているため、絵ではなく動きと音を書くものです。短い文を1〜3つ書き、何が動くか、カメラがどう動くか、何が聞こえるべきかを伝えます。
確実な構成は、被写体の動き、カメラ、音の順です。
- 被写体の動き: 「女性が窓のほうを向いて微笑む。」
- カメラ: 「ゆっくりとしたプッシュイン、手持ち撮影の雰囲気。」
- 音: 「静かな足音、静かな室内の空気感、音楽なし。」
ジャンルを問わず使えるプロンプト例をいくつか紹介します。
- 「犬が体の水を振り払い、カメラに向かって走ってくる。水しぶきの音、うれしそうな鳴き声。」
- 「コーヒーカップから湯気が立ちのぼり、カメラが左へゆっくり流れる。カフェの雰囲気、低いざわめき。」
- 「濡れた道路をヘッドライトが照らしながら、車がゆっくり走り去る。エンジンの低い音、雨。」
1つのクリップに多くの動きを詰め込まないこと、「ぼかしなし」のような否定形だけのプロンプトを避けること、画面上に読める文字を求めないことがポイントです。アレンジできるアイデアがほしい方は、AI動画プロンプト例ライブラリに検証済みのパターンがあります。Grok Imagine 1.5が他のモデルの中でどの位置にあるかは、今月のおすすめAI動画モデル比較で確認できます。

よくある質問
Grok Imagine 1.5とは?
Grok Imagine 1.5は、静止画を、音声が同期した4〜15秒のクリップに変えるxAIの画像から動画のモデルです。VIBEは、テキストプロンプトや画像から、Kling、Sora、Veoなどの最新AIモデルを使って魅力的な動画を作成できるAI動画生成アプリで、Grok Imagine 1.5はその中の画像から動画のモデルのひとつです。
Grok Imagine 1.5は写真から動画を作れますか?
はい。写真から動画を作ることが唯一のモードです。開始画像を選び、必要に応じて動きのプロンプトを加えると、モデルが画像をアニメーションにして音を加えます。
Grok Imagine 1.5は音声を生成しますか?
はい。音声は常にオンで、映像と一緒に生成され、環境音、効果音、シーンに必要な場合は音声(セリフ)も含まれます。このモデルでは、オフにすることも、自分の録音をアップロードすることもできません。
Grok Imagine 1.5はモバイルのAI動画生成アプリで使えますか?
はい。Grok Imagine 1.5は、VIBEのiOS版とAndroid版で、Premiumの画像から動画のモデルとして、Kling、Sora、Veoなどのモデルとともに利用できます。
Grok Imagine 1.5はテキストだけで動画を作れますか?
いいえ。VIBEでは、Grok Imagine 1.5に開始画像が必要です。テキストから動画にしたい場合は、モデル一覧から別のモデルを選ぶか、テキストから先に画像を生成してそれをアニメーションにしてください。
Grok Imagine 1.5の動画は何秒まで作れますか?
クリップの長さは4、6、8、10、12、15秒から選べ、解像度は480pまたは720p、アスペクト比は9:16から16:9までの7種類です。
Grok Imagine 1.5は無料ですか?
いいえ。VIBEではPremiumモデルです。なお、アプリ自体はダウンロード無料で、無料プランで試せるモデルも含まれています。
まとめ
Grok Imagine 1.5は、用途がはっきりしたツールです。常にオンの音声、4〜15秒の6種類の長さ、7種類のアスペクト比を備えた、画像から動画のモデルです。ピントの合った写真から始め、動きのプロンプトを短くし、長くする前に6〜8秒でテストすると、最も力を発揮します。テキストから動画、無音のクリップ、自分の音声録音が必要な場合は、アプリ内の別のモデルのほうが向いています。VIBEなら、これらのAI動画モデルをiOSとAndroidの1つのAI動画生成アプリにまとめて使えるので、ご自身の画像で比較できます。ぜひダウンロードセクションから試してみてください。



