Fortgeschrittene Tipps 2 Min. Lesezeit Seedance Team
Multimodale Eingabe-Tipps: Die KI versteht Ihre „Regie-Absicht"
Beherrschen Sie Kombinationsstrategien für Text, Bild, Audio und Video, um kreative Absicht präzise zu vermitteln.
Multimodal ist kein simples Stapeln
Multimodale Eingabe bei Seedance 2.0 heißt nicht „mehr Assets = besser“. Jede Modalität braucht eine klare Rolle. Ein starker multimodaler Prompt ist wie ein knappes Storyboard.
Vier-Modalitäten-Modell
| Modalität | Beste Nutzung | Empfohlene Anzahl |
|---|---|---|
| Text | Narrativ, Details, emotionaler Ton | 1 prägnante Anweisung |
| Bild | Visueller Stil, Aussehen, Komposition | 3–5 Bilder |
| Video | Kamerabewegung, Aktionsrhythmus, Übergänge | 1–2 Clips |
| Audio | Musikstil, Klang, Sprechrhythmus | 1 Clip |
Szenario 1: Markenwerbung
Ziel: 15-Sekunden-Produktshowcase
- Bilder: 3 HD-Produktfotos (Front, Seite, Nutzung)
- Video: Kameratempo aus bestehender Markenwerbung
- Audio: Referenz-Soundtrack der Marke
- Text: «Minimal premium — Produkt leuchtet langsam aus Dunkelheit, 360°-Rotation, Hold auf Logo»
Szenario 2: Narratives Kurzvideo
Ziel: 12-Sekunden-Clip mit Story
- Bilder: 2 Character Sheets + 2 Szenenkonzepte
- Video: Kinematografische Kamerareferenz
- Text: Vollständige Szenenbeschreibung mit Anfang, Mitte, Ende
Szenario 3: Musik-MV-Segment
Ziel: AV-Sync für Tanz/Performance
- Audio: Songausschnitt (Modell liest Rhythmus)
- Video: Referenz für Choreografie oder Stil
- Bilder: Bühnen-/Szenenreferenzen
- Text: Beleuchtung und Atmosphäre
„Regie-Denken” für Prompts
- Ton zuerst: Welche Emotion?
- Struktur: Wie viele Einstellungen? Wie lang?
- Details: Konkret pro Einstellung
- Stil: Visueller und akustischer Charakter
Debugging-Tipps
Bei Abweichung in dieser Reihenfolge prüfen:
- Widersprüche zwischen Modalitäten
- Referenzen reduzieren, einzeln hinzufügen
- Text in spezifischere Beschreibungen teilen
- Video-Editing statt kompletter Neugenerierung