Hallo zusammen,
heute muss ich euch mal etwas zeigen, auf das ich ziemlich stolz bin: Unter meinem Künstlernamen Nachtwache habe ich den Song "Stronger Than the Storm" gemacht, und dazu ein komplettes Musikvideo. Alles mit KI. Sämtliche Modelle für Musik, Bilder und Video liefen lokal auf meinem eigenen Rechner, keine Cloud-Generatoren, keine Credits.
Hier ist das Ergebnis:
DIE ECKDATEN
- 3:56 Minuten, 37 Einstellungen, realistischer Kino-Look
- Full-HD direkt aus dem Videomodell, bei YouTube in 4K hochgeladen
- Schnitte exakt auf dem Takt (78 BPM), Überblendungen, Titelzeilen, Filmkorn, eigene Farbstimmung je Songteil
- Produktionszeit fürs Video: ein Nachmittag - rund 4 Stunden vom Modelltest bis zur fertigen Upload-Datei... aber eigentlich mit allem ca 8 Stunden insgesamt.
DIE HARDWARE
- RTX 4090 (24 GB) und RTX 5060 Ti (16 GB), beide parallel im Einsatz
- 128 GB Arbeitsspeicher - den braucht man wirklich (siehe unten)
DIE WERKZEUGE
- Musik: ACE-Step 1.5 XL – kompletter Song mit englischem Gesang
- Engine: Maestro (über Pinokio), ohne Oberfläche per Skript im Stapelbetrieb
- Schlüsselbilder: Z-Image Turbo – knapp 190 Bilder (4 Varianten je Szene), ca. 9 Sekunden pro Bild auf der 4090
- Animation: LTX-2.5 (22B) – über 120 Videoclips in Full-HD, ca. 1,5 Minuten für 7 Sekunden Video auf der 4090; auf der 5060 Ti lief parallel die NVFP4-Variante
- Schnitt, Farbe, Titel: ffmpeg per Skript
- Regie und Auswahl: ich. Die Umsetzung - Skripte, Steuerung beider Grafikkarten und Qualitätskontrolle, hat Claude Code übernommen, der KI-Programmierassistent von Anthropic. Ein KI-Agent, der zwei Grafikkarten mit KI-Modellen füttert: Das war für mich fast das Spannendste am ganzen Projekt.
DER MODELLTEST
Vor dem Start sind vier Videomodelle mit demselben Startbild gegeneinander angetreten (Reiterin im Galopp unter Sturmwolken):
- LTX-2.5 (int8): echter Galopp, Kamera folgt sauber, 1,8 Minuten pro Clip - klarer Sieger
- LTX-2.5 NVFP4: ebenso sauber, etwas freier in der Umsetzung - ideal als Zweitmaschine
- MiniMax H3 Full (33B): sehr natürlich, aber 3,5-mal langsamer, und das Pferd trabte nur
- Wan 2.2 Enhanced Lightning: in meinem Setup leider nur Pixelsalat
WAS ICH GELERNT HABE (vielleicht hilft es jemandem)
1. Keine Verneinungen im Prompt! „The girl never turns her face towards the camera“ führte dazu, dass sie sich umdreht und direkt in die Kamera schaut. Positiv formuliert („we see only her back and her long hair“) war das Problem weg.
2. Start- und Endbild gleichzeitig vorgeben: Wenn eine Figur einfach ruhig stehen bleiben soll, das Schlüsselbild auch als letztes Bild setzen - dann bleibt die Komposition stabil.
3. Automatische Qualitätskontrolle lohnt sich: Jeder Clip lief durch Gesichts-, Sprung- und Flackererkennung. Die Hauptfigur ist bewusst nie von vorn zu sehen - so gibt es auch kein KI-Gesicht, das von Szene zu Szene anders aussieht.
4. Der Engpass war nicht die Grafikkarte, sondern der Arbeitsspeicher: Zwei große Modelle belegen gleichzeitig schnell 100 GB RAM.
5. Metadaten prüfen! Manche KI-Tools schreiben die kompletten Prompts versteckt in die Ausgabedateien (bei WAV zum Beispiel in einen eigenen Datenblock, den normale Programme nicht anzeigen). Vor dem Veröffentlichen alles entfernen.
6. YouTube: in 4K hochladen, dann bekommt das Video die bessere Kodierung, auch für Zuschauer in Full-HD. Und bei realistisch wirkenden KI-Videos das Häkchen "Veränderte oder synthetische Inhalte" setzen.
Mich interessiert: Wer von euch macht schon Videos mit lokalen Modellen, und womit? Fragen beantworte ich gern hier im Thema.
Viele Grüße
Alex