Grok Imagine 1.5 ist das Bild-zu-Video-Modell von xAI: Du gibst ihm ein einzelnes Standbild und bekommst einen 4 bis 15 Sekunden langen Clip mit synchronem Ton zurück. In VIBE ist Grok Imagine 1.5 ein Premium-Modell, das nur mit einem Foto arbeitet. Das Bild bestimmt also den Look, und ein optionaler Prompt steuert die Bewegung. Dieser Guide zeigt, was das Modell gut kann, worin es sich vom ursprünglichen Grok Imagine unterscheidet und wie du auf deinem Smartphone ein sauberes Ergebnis bekommst.
VIBE ist eine KI-Video-Generator-App, mit der du beeindruckende Videos aus Text-Prompts oder Bildern erstellen kannst – mit den neuesten KI-Modellen wie Kling, Sora und Veo. Da die App auf iOS und Android mehrere KI-Modelle anbietet, ist Grok Imagine 1.5 nur eine von vielen Optionen, und dieser Artikel erklärt auch, wann ein anderes Modell besser zur Aufgabe passt.
Was ist Grok Imagine 1.5 und wie funktioniert es?
Grok Imagine 1.5 ist ein im Juni 2026 veröffentlichtes Videomodell von xAI, das ein Startbild animiert und den Soundtrack im selben Durchgang erzeugt. Du lädst ein Bild hoch, beschreibst optional die gewünschte Bewegung, wählst Dauer und Auflösung, und das Modell liefert einen fertigen Clip mit Bewegung, Atmosphäre, Soundeffekten und manchmal Sprache.
Drei Fakten definieren das Modell in VIBE:
- Nur Bild-zu-Video: Es gibt keinen reinen Text-Modus. Jeder Clip beginnt mit einem Foto oder einem generierten Bild.
- Nativer Ton, immer aktiv: Der Soundtrack ist Teil des Ergebnisses. Du kannst ihn nicht abschalten und steuerst ihn deshalb über den Prompt.
- Premium-Stufe: Das Modell steht Premium-Nutzern zur Verfügung, nicht in der kostenlosen Stufe.

Weil das Bild das Startbild ist, stehen Komposition, Motiv, Licht und Stil größtenteils schon fest, bevor das Modell etwas tut. Das macht Grok Imagine 1.5 berechenbar: Was du auf dem Foto siehst, ist in Sekunde null auch im Clip zu sehen, und der Prompt beschreibt nur, was danach passiert. Einen breiteren Überblick über alle Modelle der App findest du in der Modellübersicht.
Was unterscheidet Grok Imagine 1.5 von Grok Imagine 1.0?
Der wichtigste Unterschied ist der Ton: Grok Imagine 1.5 erzeugt Audio, während das ursprüngliche Grok Imagine gar keine Tonspur hat. Das ältere Modell gibt es in VIBE weiterhin als eigenen Eintrag, deshalb lohnt sich ein Vergleich, bevor du dich entscheidest.
- Audio: 1.5 erzeugt immer synchronen Ton. Grok Imagine 1.0 erzeugt stumme Clips.
- Eingabe: 1.5 kann nur Bild-zu-Video. Grok Imagine 1.0 unterstützt Text-zu-Video und Bild-zu-Video.
- Dauer: 1.5 bietet 4, 6, 8, 10, 12 und 15 Sekunden. Grok Imagine 1.0 bietet 6, 8 und 10 Sekunden.
- Auflösung: Beide unterstützen 480p und 720p, wobei 720p der Standard ist.
- Seitenverhältnisse: Beide decken sieben Formate ab, von 16:9 und 9:16 bis 1:1, 4:3, 3:4, 3:2 und 2:3.
xAI beschreibt die Version 1.5 als Verbesserung bei Bewegung, Physik und Audio, mit ruhigeren Bewegungen im gesamten Clip und klarerer Sprache. Sieh das als Aussage des Herstellers und prüfe es an deinen eigenen Bildern: Der praktische Test ist, ob das Motiv vom ersten bis zum letzten Frame seine Form behält.
Kann Grok Imagine 1.5 aus einem Foto ein Video erstellen?
Ja, aus einem Foto ein Video zu erstellen ist das Einzige, was Grok Imagine 1.5 macht, und das Modell erledigt es in einem Schritt. Du wählst ein Startbild, und das Modell animiert es. Einen Text-zu-Video-Modus gibt es für dieses Modell in VIBE nicht.
Gute Ausgangsfotos haben einige Dinge gemeinsam:
- Ein klares Motiv mit gut erkennbarer Silhouette, etwa eine Person, ein Haustier, ein Produkt oder ein Fahrzeug.
- Scharfer Fokus und gleichmäßiges Licht, damit das Modell saubere Details zum Animieren hat.
- Platz im Bild für Bewegung, zum Beispiel Freiraum vor einem laufenden Motiv.
- Kein Text, keine Logos und keine feinen Muster in der Bildmitte, denn kleine Details können sich verziehen, sobald sich etwas bewegt.
Wenn du kein Foto hast, generiere zuerst eins. VIBE enthält Bildmodelle, und ein generiertes Standbild funktioniert als Startbild genauso wie ein Kamerafoto. Eine ausführlichere Anleitung zum Animieren von Bildern findest du unter So machst du aus einem Foto ein KI Video. Wenn du dieselbe Figur über mehrere Clips brauchst, erklärt der Guide zu konsistenten Charakteren mit Referenzbildern den Workflow.

Erzeugt Grok Imagine 1.5 ein KI Video mit Ton?
Ja, Grok Imagine 1.5 erzeugt immer Audio, darunter Atmosphäre, Soundeffekte und, wenn die Szene es verlangt, Sprache. Der Ton entsteht zusammen mit dem Bild, sodass Schritte, Wind, Spritzer und Aufprälle meist genau auf die Handlung fallen, statt nachträglich darübergelegt zu werden.
Zwei Grenzen solltest du kennen. Erstens kannst du in VIBE für dieses Modell keine eigene Sprachaufnahme hochladen, der Ton ist also immer modellgeneriert. Zweitens lässt sich der Ton nicht ausschalten: Ein Prompt, der den Ton ignoriert, überlässt dem Modell die Entscheidung, und es fügt womöglich Atmosphäre hinzu, die du nicht erwartet hast. Beschreibe den gewünschten Ton in einem kurzen Satzteil, zum Beispiel „leiser Regen am Fenster, entfernter Verkehr, keine Musik".
Wie sich Dialoge, Soundeffekte und Atmosphäre bei verschiedenen Modellen verhalten, vergleicht der Guide zu KI Video mit Stimme und Ton im direkten Nebeneinander.
Welche Dauer, Auflösung und Seitenverhältnisse unterstützt Grok Imagine 1.5?
Grok Imagine 1.5 unterstützt sechs Clip-Längen von 4 bis 15 Sekunden, zwei Auflösungen und sieben Seitenverhältnisse. Die vollständige Liste in VIBE sieht so aus:
- Dauer: 4, 6, 8, 10, 12 oder 15 Sekunden.
- Auflösungen: 480p oder 720p, wobei 720p der Standard ist.
- Seitenverhältnisse: 16:9, 9:16, 1:1, 4:3, 3:4, 3:2 und 2:3.
- Eingabe: Ein Startbild, optional mit einem Bewegungs-Prompt.
- Audio: Immer aktiv.
Wähle das Format passend zum Ziel, bevor du generierst: 9:16 für vertikale Short-Form-Feeds, 16:9 für Breitbild, 1:1 oder 3:4 für Feed-Beiträge. Dein Startfoto sollte bereits eine ähnliche Form haben, sonst kann sich der Bildausschnitt stärker verändern als erwartet. Der Guide zu Seitenverhältnissen zeigt, welches Format zu welcher Plattform passt.
Länger ist nicht automatisch besser. Ein 15-Sekunden-Clip gibt dem Modell mehr Zeit, sich vom Ausgangsbild zu entfernen, während ein Clip von 4 bis 8 Sekunden das Motiv meist zuverlässiger zusammenhält und weniger kostet. Eine gute Gewohnheit: Teste eine Idee zuerst mit kurzer Länge und verlängere nur die Version, die dir gefällt.

Wie nutzt du Grok Imagine 1.5 in VIBE Schritt für Schritt?
Um Grok Imagine 1.5 in VIBE zu nutzen, öffnest du den Bild-zu-Video-Ablauf, wählst das Modell, fügst ein Startbild hinzu, stellst Dauer und Auflösung ein und generierst. Der ganze Vorgang dauert auf iOS oder Android nur ein paar Taps.
- Öffne die App und starte ein Bild-zu-Video-Projekt im Bild-zu-Video-Bereich.
- Wähle Grok Imagine 1.5 aus der Modellliste. Dafür brauchst du einen Premium-Plan.
- Füge dein Startbild hinzu, entweder aus deiner Fotomediathek oder von einem Bild, das du in der App generiert hast.
- Schreibe einen kurzen Bewegungs-Prompt, wenn du Kontrolle willst. Er ist optional, aber ein einzelner Satz zu Bewegung und Ton verbessert das Ergebnis meist.
- Wähle Seitenverhältnis, Dauer und Auflösung. Starte mit 720p und 6 bis 8 Sekunden.
- Generiere, prüfe und verfeinere. Wenn die Bewegung nicht stimmt, ändere nur eine Sache im Prompt und starte neu, statt alles umzuschreiben.
Die Kosten steigen mit der Clip-Länge, kurze Testläufe sind also der günstigste Weg, um zu lernen, wie das Modell deine Bilder liest. Wenn ein Clip funktioniert, lade ihn herunter und poste ihn oder nutze ihn als Grundlage für die nächste Szene.
Welche Prompts funktionieren bei Grok Imagine 1.5 am besten?
Die besten Prompts für Grok Imagine 1.5 beschreiben Bewegung und Ton, nicht das Bild, denn das Bild zeigt die Szene bereits. Schreibe ein bis drei kurze Sätze: was sich bewegt, wie sich die Kamera verhält und was zu hören sein soll.
Eine verlässliche Struktur ist Handlung des Motivs, dann Kamera, dann Ton:
- Handlung des Motivs: „Die Frau dreht sich zum Fenster und lächelt."
- Kamera: „Langsamer Push-in, Handkamera-Gefühl."
- Ton: „Leise Schritte, ruhiger Raumton, keine Musik."
Einige Beispiel-Prompts, die in verschiedenen Genres funktionieren:
- „Der Hund schüttelt das Wasser aus dem Fell und rennt auf die Kamera zu. Spritzendes Wasser, fröhliches Bellen."
- „Dampf steigt aus der Kaffeetasse auf, während die Kamera nach links driftet. Café-Atmosphäre, leises Stimmengemurmel."
- „Das Auto fährt langsam los, während Scheinwerfer über die nasse Straße streichen. Motorbrummen, Regen."
Vermeide es, viele Aktionen in einen Clip zu packen, vermeide rein negative Prompts wie „keine Unschärfe", und verlange keinen lesbaren Text im Bild. Mehr Ideen zum Anpassen liefert die Bibliothek mit KI-Video-Prompt-Beispielen mit getesteten Mustern, und der Vergleich der besten KI-Video-Modelle dieses Monats zeigt, wo Grok Imagine 1.5 im Vergleich zu den anderen steht.

Häufig gestellte Fragen
Was ist Grok Imagine 1.5?
Grok Imagine 1.5 ist ein Bild-zu-Video-Modell von xAI, das ein Standbild in einen 4 bis 15 Sekunden langen Clip mit synchronem Audio verwandelt. VIBE ist eine KI-Video-Generator-App, mit der du beeindruckende Videos aus Text-Prompts oder Bildern erstellen kannst – mit den neuesten KI-Modellen wie Kling, Sora und Veo. Grok Imagine 1.5 gehört dort zu den Bild-zu-Video-Modellen.
Kann Grok Imagine 1.5 aus einem Foto ein Video erstellen?
Ja. Aus einem Foto ein Video zu machen ist der einzige Modus. Du wählst ein Startbild, fügst optional einen Bewegungs-Prompt hinzu, und das Modell animiert das Bild und ergänzt Ton.
Erzeugt Grok Imagine 1.5 Audio?
Ja. Der Ton ist immer aktiv und entsteht zusammen mit dem Video. Er umfasst Atmosphäre, Soundeffekte und Sprache, wenn die Szene sie braucht. Du kannst ihn nicht abschalten und für dieses Modell auch keine eigene Aufnahme hochladen.
Gibt es Grok Imagine 1.5 in einer mobilen KI Video Generator App?
Ja. Grok Imagine 1.5 ist in VIBE auf iOS und Android als Premium-Bild-zu-Video-Modell verfügbar, neben Modellen wie Kling, Sora und Veo.
Kann Grok Imagine 1.5 ein Video nur aus Text erstellen?
Nein. In VIBE braucht Grok Imagine 1.5 ein Startbild. Für Text-zu-Video wähle ein anderes Modell aus der Modellliste oder generiere aus deinem Text zuerst ein Bild und animiere es anschließend.
Wie lang kann ein Grok Imagine 1.5 Video sein?
Clips können 4, 6, 8, 10, 12 oder 15 Sekunden lang sein, in 480p oder 720p und in sieben Seitenverhältnissen von 9:16 bis 16:9.
Ist Grok Imagine 1.5 kostenlos?
Nein. Es ist ein Premium-Modell in VIBE, während die App selbst kostenlos heruntergeladen werden kann und Modelle enthält, die du in der kostenlosen Stufe ausprobieren kannst.
Fazit
Grok Imagine 1.5 ist ein fokussiertes Werkzeug: ein Bild-zu-Video-Modell mit immer aktivem Ton, sechs Clip-Längen von 4 bis 15 Sekunden und sieben Seitenverhältnissen. Am besten funktioniert es, wenn du mit einem scharfen Foto startest, den Bewegungs-Prompt kurz hältst und mit 6 bis 8 Sekunden testest, bevor du länger gehst. Wenn du Text-zu-Video, stumme Clips oder deine eigene Sprachaufnahme brauchst, passt ein anderes Modell der App besser. VIBE vereint alle diese KI-Video-Modelle in einer KI Video Generator App für iOS und Android, sodass du sie an deinen eigenen Bildern vergleichen kannst. Im Download-Bereich kannst du es ausprobieren.



