Avancerade tips 2 min läsning Seedance Team

Multimodala inmatningstips: få AI att förstå din "regi-intention"

Behärska kombinationsstrategier för text, bild, ljud och video för att förmedla kreativ avsikt exakt.

Multimodal är inte enkel stapling

Multimodal inmatning i Seedance 2.0 betyder inte «fler assets = bättre». Varje modalitet behöver en tydlig roll. En stark multimodal prompt är som ett koncist storyboard.

Fyrmodalitetsmodell

ModalitetBäst användningRekommenderat antal
TextNarrativ logik, detaljer, emotionell ton1 koncis instruktion
BildVisuell stil, utseende, komposition3–5 bilder
VideoKamerarörelse, actionrytm, övergångar1–2 klipp
LjudMusikstil, ljud, talrytm1 klipp

Scenario 1: Varumärkesreklam

Mål: 15-sekunders produktshowcase

  • Bilder: 3 HD-produktfoton ( fram, sida, användning)
  • Video: Kameratempo från befintlig reklam
  • Ljud: Referens-soundtrack
  • Text: «Minimal premium — produkt tänds långsamt från mörker, 360° rotation, hold på logo»

Scenario 2: Narrativ kortfilm

Mål: 12-sekunders klipp med berättelse

  • Bilder: 2 character sheets + 2 scenkoncept
  • Video: Cinematisk kamerareferens
  • Text: Fullständig scenbeskrivning med början, mitt, slut

Scenario 3: Musik-MV-segment

Mål: AV-sync för dans/performance

  • Ljud: Sångfragment (modellen läser rytm)
  • Video: Referens koreografi eller stil
  • Bilder: Scenreferenser
  • Text: Belysning och atmosfär

«Regi-tänk» för prompts

  1. Ton först: Vilken emotion?
  2. Struktur: Hur många shots? Hur långa?
  3. Detaljer: Specifikt per shot
  4. Stil: Visuell och auditiv karaktär

Debugtips

Om output avviker, kontrollera i ordning:

  1. Motsägelser mellan modaliteter
  2. Minska referenser, lägg till en i taget
  3. Dela text i mer specifika beskrivningar
  4. Videoredigering istället för full regenerering