Avancerade tips 2 min läsning Seedance Team
Multimodala inmatningstips: få AI att förstå din "regi-intention"
Behärska kombinationsstrategier för text, bild, ljud och video för att förmedla kreativ avsikt exakt.
Multimodal är inte enkel stapling
Multimodal inmatning i Seedance 2.0 betyder inte «fler assets = bättre». Varje modalitet behöver en tydlig roll. En stark multimodal prompt är som ett koncist storyboard.
Fyrmodalitetsmodell
| Modalitet | Bäst användning | Rekommenderat antal |
|---|---|---|
| Text | Narrativ logik, detaljer, emotionell ton | 1 koncis instruktion |
| Bild | Visuell stil, utseende, komposition | 3–5 bilder |
| Video | Kamerarörelse, actionrytm, övergångar | 1–2 klipp |
| Ljud | Musikstil, ljud, talrytm | 1 klipp |
Scenario 1: Varumärkesreklam
Mål: 15-sekunders produktshowcase
- Bilder: 3 HD-produktfoton ( fram, sida, användning)
- Video: Kameratempo från befintlig reklam
- Ljud: Referens-soundtrack
- Text: «Minimal premium — produkt tänds långsamt från mörker, 360° rotation, hold på logo»
Scenario 2: Narrativ kortfilm
Mål: 12-sekunders klipp med berättelse
- Bilder: 2 character sheets + 2 scenkoncept
- Video: Cinematisk kamerareferens
- Text: Fullständig scenbeskrivning med början, mitt, slut
Scenario 3: Musik-MV-segment
Mål: AV-sync för dans/performance
- Ljud: Sångfragment (modellen läser rytm)
- Video: Referens koreografi eller stil
- Bilder: Scenreferenser
- Text: Belysning och atmosfär
«Regi-tänk» för prompts
- Ton först: Vilken emotion?
- Struktur: Hur många shots? Hur långa?
- Detaljer: Specifikt per shot
- Stil: Visuell och auditiv karaktär
Debugtips
Om output avviker, kontrollera i ordning:
- Motsägelser mellan modaliteter
- Minska referenser, lägg till en i taget
- Dela text i mer specifika beskrivningar
- Videoredigering istället för full regenerering