AI ASMR動画とは、ガラス細工のようなキャンディフルーツをナイフで切る、石鹸をハサミで切る、スプーンでクレームブリュレの表面を割るといった、極端なクローズアップの短いクリップのことです。音声は編集ソフトで後から重ねるのではなく、映像と同じレンダリングの中で最初から組み込まれて生成されます。最も早く作る方法は、音声トラックが常にオンになっているモデルを選び、質感とその音を同じプロンプトの中で描写し、ショットをひとつの連続したアクションにまとめることです。すべてのAI動画モデルが自動的に音声を生成するわけではないため、どのモデルを選ぶかによって、完成したクリップに本物の音声が入るか、別工程が必要になるかが決まります。
VIBEは、Kling、Sora、Veoといった最新のAIモデルを使い、テキストプロンプトや画像から見事な動画を作成できるAI動画生成アプリで、いくつかのモデルは映像と同じ工程でネイティブに同期した音声を生成します——満足感のあるAI動画が実際に「満足できる音」を出すために必要な、まさにその機能です。
パッケージがくしゃっと音を立てる、石鹸を切る、キネティックサンド、そしてTikTokで広まったガラスフルーツカットのトレンドなど、この「なぜか気持ちいい」ジャンルはAI動画が登場するずっと前から存在していましたが、生成AIモデルの登場によって、マイクもスタジオも編集ソフトも使わずに誰でも作れるものになりました。このガイドでは、AI ASMR動画ジェネレーターに実際に必要なもの、VIBEのどのモデルが自動的に音声を生成し、どのモデルがオプションなのか、質感と音を一緒に描写するプロンプトの書き方、そしてクリップをきれいにループさせる方法を解説します。ショート動画プラットフォームで拡散する他の要素についてより幅広く知りたい場合は、AI動画クリップが本当にバズる理由をご覧ください。
AI ASMR動画ジェネレーターとは何ですか?
AI ASMR動画ジェネレーターとは、質感のあるものを切る・潰す・注ぐ・叩くといった様子をクローズアップで捉え、映像と同じ工程で音声を生成するAI動画モデルのことです。これが通常のAI動画生成アプリとの違いです。音声はその出来事が起こる正確なフレームに同期していなければならず、後から追加したのでは満足感のある効果がすぐに崩れてしまいます。ASMRという言葉自体は2010年に作られた造語で、タッピング、ささやき、くしゃくしゃという音、カットといった特定の音や映像に対するゾクゾクするようなリラックス反応を指します。AI版も同じ一握りのトリガーに頼っていますが、撮影ではなく生成によって作られる点が異なります。
AI動画生成アプリの中でも、すべてのモデルが音声を同じように扱うわけではありません。オフにする方法がないまま毎回自動的に同期した音声トラックを生成するモデルもあれば、生成前にオンに切り替える必要があるオプションのトグルになっているモデルもあり、まったく音声を生成しないモデルもあります。このフォーマットに関しては特に、解像度や長さよりもこの違いの方が重要です。無音の「ASMR」クリップは本当の意味でのASMRとは言えず、このジャンルそのものが音声を軸に成り立っているからです。
AIでASMR動画を作るにはどうすればいいですか?
AIでASMR動画を作るには、4つのステップにまとめられます。ネイティブに、または確実に切り替えられる音声機能を持つテキストから動画モデルを選ぶこと、質感とその音をひとつのプロンプトで描写すること、カメラを近づけてほぼ固定すること、そしてループできるほど短いクリップを生成することです。マイクも録音機材も編集ソフトも必要ありません。音声は映像と同じ生成プロセスから生まれます。
- オプションのトグル付きモデルだけでなく、すべてのクリップで音声を生成するモデルを選びましょう。音のない満足感のある動画は満足感を与えません。以下で紹介するいくつかのモデルは、スイッチを切り替える必要なく自動的に音声を生成します。
- 極端なクローズアップでフレーミングします。刃、手、質感そのものなど、被写体が画面の大部分を占めるようにしましょう。ASMRコンテンツは広い状況説明ショットではなく、目に見える細部に左右されるからです。
- 素材と音を、2つの別々の指示ではなくひとつのプロンプトの中で一緒に描写しましょう。何でできているか、それに何が起きているか、そしてどんな音がするべきかです。
- カメラはほぼ静止させたままにします。ゆっくりとした最小限のプッシュインは意図的な演出として伝わりますが、動いたりパンしたりするカメラは質感と音から注目をそらしてしまいます。
- 4秒から8秒程度の短いクリップを、ひとつの連続したアクションを軸に生成しましょう。そうすることで、はっきりとしたカットなしにループできます。

本物の音声付きAI ASMR動画を生成できるAIモデルはどれですか?
VIBE内の一握りのモデルは、最初にトグルを切り替える必要なく、すべてのクリップでネイティブな音声付きAI動画を生成します。ASMR制作に特に向いている、まず試す価値のあるモデルは次の通りです。
- Sora 2(OpenAI)— 720p、4秒・8秒・12秒のクリップ、すべてのクリップでネイティブに同期したセリフと効果音を生成、トグル不要。
- Seedance 2.5(ByteDance)— 480pまたは720p、4秒から30秒までの任意の1秒単位、セリフを含む同期音声、さらに複数のクリップにわたって小道具の見た目を統一できる最大4枚の参照画像に対応。
- Veo 3.1 Lite(Google DeepMind)— 720p、4秒・6秒・8秒、VIBEが提供する3つのVeo 3.1ティアの中で最も安価で、音声は常にオン。標準のVeo 3.1とVeo 3.1 Fastは、代わりに音声がオプションのトグルになっています。
- WAN 2.7(Alibaba)— 720p、2秒から15秒までの任意の1秒単位。ここに挙げたモデルの中で唯一、最大30秒・15MBまでのアップロードした音声または音楽トラックにも対応しており、ゼロから音を生成する代わりに、特定の音にクリップの動きを同期させられます。
- Happy Horse 1.1(Alibaba)— 720pまたは1080p、3秒から15秒、音声は常にオンでトグルなし。
- PRUNA V(Pruna AI)— 音声が常にオンになっているVIBE唯一の無料プランモデルで、720p、2秒から10秒。ここに挙げたモデルの中で唯一、自分の音声ファイルをアップロードして動画を同期させられます。
Kling v2.6、Kling O3、Kling 3、標準のVeo 3.1など、音声がオプションになっているモデルでもASMR用途は問題なく使えますが、先にトグルを確認せずに生成すると無音のクリップができてしまい、このフォーマットの意味がまったくなくなってしまいます。

質感と音のためのASMRプロンプトはどう書けばいいですか?
AI動画向けのASMRプロンプトには、順番通りに3つの要素が必要です。素材とその物理的な状態、それに対して行われるアクション、そしてそのアクションが立てる具体的な音——これらは別のメモとしてではなく、同じ文の一部として書きます。「ナイフでフルーツを切る」のように映像だけを描写するプロンプトでは、モデルが音を推測することになりますが、「鋭い割れる音と、湿った切る音」のように音を直接指定すれば、モデルに具体的にレンダリングできる情報を与えられます。
- ガラス細工のようなキャンディフルーツをナイフでスライスする極端なクローズアップ、鋭い割れる音に続いて湿った切る音、スタジオ照明、スローモーション。
- 手が1枚のホイルをゆっくりと丸めていき、折るたびにくしゃくしゃ・かさかさという音が重なる、柔らかいトップダウンの光。
- 石鹸のバーをハサミでひと続きに切る、低く抵抗感のあるこすれる音、極端なマクロ撮影、固定カメラ。
- スプーンがクレームブリュレのキャラメリゼされた表面を割る、鋭く脆いパキッという音、湯気が立ちのぼる、暖かいサイドライト。
- キネティックサンドをナイフでひとなでに切る、柔らかく崩れる音、パステルカラーの砂、トップダウンのクローズアップ。
- 手が光沢のある表面からステッカーをゆっくりと剥がす、かすかに破れて剥がれる音、ステッカーの端にマクロフォーカス。
- パンケーキの上にハチミツをゆっくりと注ぐ、とろりとした注ぐ音と垂れる音、暖かい朝の光、固定された真上からのショット。
- 小さなナイフでロウソクを削る、ロウの削りくずがスローモーションで落ちる、柔らかくこすれる音、単一のスポットライト。
- 葉を滑り落ちる水滴の極端なマクロ撮影、それぞれの雫が着地する際にかすかなタップ音を伴う、自然光。
- 手がドライでカラフルな粘土ビーズが入ったボウルにゆっくりと沈み込む、柔らかいザクザクという音、近い真上からのアングル、抑えたスタジオ照明。
素材・アクション・音という同じ公式の10通りのバリエーションで、この種のクリップを成立させる要素のほとんどをカバーできます。同じ構造を保ったまま素材と描写する音を入れ替える方が、毎回ゼロから新しいプロンプトを書くより速いのが普通です。

最適な無料AI ASMR動画ジェネレーターはどれですか?
最適な無料AI ASMR動画ジェネレーターとは、無料プランに音声が常にオンのモデルを備えているものです。無音の無料モデルでは、プロンプトを書き始める前からこのフォーマットが成立しなくなってしまうからです。VIBEの中では、PRUNA Vがすべてのクリップで音声を生成する唯一の無料プランモデルです。720pのクリップを2秒から10秒まで生成でき、無料モデルの中で唯一、アップロードしたMP3、WAV、FLACファイルに対応しているため、モデルが考え出す音ではなく特定の音にクリップを同期させられます。LTX 2.5 Fastも無料プランで利用でき、トグルなしで自動的に音声を生成しますが、一度も課金していないアカウントでは720pの5秒クリップに制限されます。同じモデルはプレミアムプランでは4Kまで対応します。どちらの無料オプションも、Seedance 2.5のようなプレミアムモデルが持つ参照画像の一貫性や長い長さには及びませんが、何かを支払う前に、この種のAI動画ジェネレーターが自分のワークフローに合うかどうかを試すには十分です。
AI ASMR動画をシームレスにループさせるにはどうすればいいですか?
シームレスなループは、後から適当なカットポイントをトリミングすることではなく、クリップの最初と最後のフレームを一致させることから生まれます。VIBE内では3つのアプローチが有効です。
- 一度きりの出来事ではなく、繰り返し可能なアクションを描写しましょう。瓶をスプーンで繰り返し叩く、液体を継続的に注ぐといった動きは、明確な始まりと終わりを持つ一度きりの割れる音やパキッという音よりも、よりきれいにループします。
- LTX 2.5 Fastのように、最初のフレームと最後のフレームの両方を入力として受け付ける、最終フレーム補間機能を持つモデルを使いましょう。最後のフレームを最初のフレームに近づけて設定すると、継ぎ目の見えないループが得られます。
- 書き出し後、スマートフォンの動画編集アプリで両端を数フレームずつトリミングしましょう。ほとんどのモデルはクリップの最初と最後に一瞬の「落ち着き時間」をレンダリングするため、トリミングせずにループするとカクつきのように見えてしまいます。
短いクリップは長いクリップよりもループの許容度が高くなります。ひとつの繰り返し可能な動きを軸にした4秒から6秒のクリップは、複数の明確な展開を持つ15秒のクリップよりもシームレスに仕上げやすいのです。
ガラス・フルーツ・石鹸カットのASMRにはどのモデルが向いていますか?
ガラスフルーツ、石鹸、キネティックサンド、ホイルなど、カットする質感のASMRは、近く連続したカメラワークと、刃が接触する正確な瞬間に合った音に左右されるため、モデル選びは解像度よりも音声のタイミングと小道具の一貫性がほとんどを占めます。TikTokで広く広まったガラスフルーツカットのトレンドは、半透明でキャンディのような小道具と、鋭い割れる音・切る音を組み合わせたものです。上記の音声が常にオンのモデルであればどれでもうまく機能しますが、特にSeedance 2.5やVeo 3.1 Liteが適しています。どちらも、上に重ねたループ効果としてではなく、カットが起こる正確なフレームで音を生成するからです。複数の角度から同じ小道具に見える必要があるクリップ群——ひとつの果物として認識されるべきものへの複数のカット——には、Seedance 2.5の4枚の参照画像が、別々の生成をまたいで形と色の一貫性を保ちます。特定の録音済みの音、たとえばナイフがガラスに当たる特定の録音を使って動画を主導させたい場合は、モデルが自ら考え出す音の代わりにWAN 2.7の方が適した選択です。

よくある質問
AI ASMR動画ジェネレーターとは何ですか?
クローズアップで音声主導のクリップをレンダリングし、映像と同じ工程で音声を生成するAI動画モデルのことです。VIBEは、Kling、Sora、Veoといった最新のAIモデルを使い、テキストプロンプトや画像から見事な動画を作成できるAI動画生成アプリで、いくつかのモデルはこのようなネイティブで同期した音声を自動的に生成します。
AIは映像だけでなく、本物の音声付きでASMR動画を生成できますか?
はい、そのために作られたモデルであれば可能です。Sora 2、Seedance 2.5、Veo 3.1 Lite、Happy Horse 1.1、PRUNA Vはいずれも、トグルを切り替える必要なくすべてのクリップで同期した音声を生成するため、音声は映像と同じ生成プロセスから生まれます。
最適な無料AI ASMR動画ジェネレーターはどれですか?
音声が常にオンで、アップロードした音声ファイルにも対応しているVIBEの無料プランモデルPRUNA Vが、最も有力な無料の出発点です。LTX 2.5 Fastも自動音声付きで無料プランから利用できますが、無料アカウントでは720pの5秒クリップに制限されます。
VIBEでは、ASMRクリップに自分の音声をアップロードできますか?
はい、2つのモデルで可能です。WAN 2.7とPRUNA Vはどちらも、アップロードした音声または音楽ファイルに対応しており、プロンプトだけから音を生成する代わりに、クリップの動きをその音に同期させます。
AI ASMR動画クリップの長さはどれくらいがよいですか?
ほとんどの場合、4秒から8秒の間が最も効果的です。ひとつの完結したアクションとその音を見せるには十分な長さでありながら、複数の異なる展開が注目を奪い合うことなくきれいにループできるほど短い長さです。
AI ASMR動画は、TikTokのガラスフルーツカットのトレンドと同じものですか?
ガラスフルーツカットは、より広いAI ASMR動画のカテゴリの中のひとつの具体的なフォーマットです——半透明でキャンディのような小道具と、鋭いカット音を組み合わせたものです。同じ音声が常にオンのモデルとプロンプト構成は、石鹸からキネティックサンドまで、他のどんな質感にも当てはまります。
まとめ
AI ASMR動画は、他の満足感のあるコンテンツと同じ仕組みで機能します——近いカメラ、ひとつの明確なアクション、そしてそれに正確に合った音です。唯一の違いは、音声と映像が別々の収録セッションではなく、同じ生成プロセスから生まれるようになったことです。Sora 2やSeedance 2.5から無料プランのPRUNA Vまで、音声が常にオンのモデルを選ぶことは、どんなプロンプトのテクニックよりも重要です。映像がどれだけ良く見えても、無音のクリップはASMRとは言えないからです。VIBEは、これらの音声対応モデルすべてを、iOSとAndroid向けのひとつのAI動画生成アプリにまとめています。VIBEをダウンロードして最初のASMRクリップを生成し、ネイティブ音声がもたらす違いを実際に聴いてみてください。



