Fortgeschrittene Tipps 2 Min. Lesezeit Seedance Team

Multimodale Eingabe-Tipps: Die KI versteht Ihre „Regie-Absicht"

Beherrschen Sie Kombinationsstrategien für Text, Bild, Audio und Video, um kreative Absicht präzise zu vermitteln.

Multimodal ist kein simples Stapeln

Multimodale Eingabe bei Seedance 2.0 heißt nicht „mehr Assets = besser“. Jede Modalität braucht eine klare Rolle. Ein starker multimodaler Prompt ist wie ein knappes Storyboard.

Vier-Modalitäten-Modell

ModalitätBeste NutzungEmpfohlene Anzahl
TextNarrativ, Details, emotionaler Ton1 prägnante Anweisung
BildVisueller Stil, Aussehen, Komposition3–5 Bilder
VideoKamerabewegung, Aktionsrhythmus, Übergänge1–2 Clips
AudioMusikstil, Klang, Sprechrhythmus1 Clip

Szenario 1: Markenwerbung

Ziel: 15-Sekunden-Produktshowcase

  • Bilder: 3 HD-Produktfotos (Front, Seite, Nutzung)
  • Video: Kameratempo aus bestehender Markenwerbung
  • Audio: Referenz-Soundtrack der Marke
  • Text: «Minimal premium — Produkt leuchtet langsam aus Dunkelheit, 360°-Rotation, Hold auf Logo»

Szenario 2: Narratives Kurzvideo

Ziel: 12-Sekunden-Clip mit Story

  • Bilder: 2 Character Sheets + 2 Szenenkonzepte
  • Video: Kinematografische Kamerareferenz
  • Text: Vollständige Szenenbeschreibung mit Anfang, Mitte, Ende

Szenario 3: Musik-MV-Segment

Ziel: AV-Sync für Tanz/Performance

  • Audio: Songausschnitt (Modell liest Rhythmus)
  • Video: Referenz für Choreografie oder Stil
  • Bilder: Bühnen-/Szenenreferenzen
  • Text: Beleuchtung und Atmosphäre

„Regie-Denken” für Prompts

  1. Ton zuerst: Welche Emotion?
  2. Struktur: Wie viele Einstellungen? Wie lang?
  3. Details: Konkret pro Einstellung
  4. Stil: Visueller und akustischer Charakter

Debugging-Tipps

Bei Abweichung in dieser Reihenfolge prüfen:

  1. Widersprüche zwischen Modalitäten
  2. Referenzen reduzieren, einzeln hinzufügen
  3. Text in spezifischere Beschreibungen teilen
  4. Video-Editing statt kompletter Neugenerierung