Zaawansowane wskazówki 2 min czytania Seedance Team

Wskazówki wejścia multimodalnego: niech AI zrozumie twoją „intencję reżysera"

Opanuj strategie łączenia tekstu, obrazu, audio i wideo, aby precyzyjnie przekazać intencję twórczą.

Multimodalność to nie proste nakładanie

Wejście multimodalne Seedance 2.0 to nie «im więcej assetów, tym lepiej». Każda modalność musi mieć jasną rolę. Dobry prompt multimodalny to jak zwięzły storyboard.

Model podziału czterech modalności

ModalnośćNajlepsze zastosowanieZalecana liczba
TekstLogika narracji, detale, ton emocjonalny1 zwięzła instrukcja
ObrazStyl wizualny, wygląd, kompozycja3–5 obrazów
WideoRuch kamery, rytm, przejścia1–2 klipy
AudioStyl muzyki, dźwięk, rytm mowy1 klip

Scenariusz 1: Reklama marki

Cel: 15-sekundowe wideo produktu

  • Obrazy: 3 zdjęcia HD ( przód, bok, użycie)
  • Wideo: Tempo kamery z istniejącej reklamy
  • Audio: Referencyjna ścieżka dźwiękowa
  • Tekst: «Minimal premium — produkt powoli rozświetla się z ciemności, obrót 360°, hold na logo»

Scenariusz 2: Krótki narracyjny

Cel: 12-sekundowy klip z historią

  • Obrazy: 2 character sheet + 2 koncepty sceny
  • Wideo: Kinowa referencja kamery
  • Tekst: Pełny opis sceny z początkiem, rozwinięciem, finałem

Scenariusz 3: Segment teledysku

Cel: Sync AV dla tańca/występu

  • Audio: Fragment utworu (model czyta rytm)
  • Wideo: Referencja choreografii lub stylu
  • Obrazy: Referencje sceny
  • Tekst: Oświetlenie i atmosfera

„Myślenie reżysera” przy promptach

  1. Najpierw ton: Jaka emocja?
  2. Struktura: Ile ujęć? Jak długie?
  3. Detale: Konkretna treść ujęć
  4. Styl: Cechy wizualne i dźwiękowe

Wskazówki debugowania

Gdy wynik odbiega, sprawdź kolejno:

  1. Sprzeczności między modalnościami
  2. Zmniejsz referencje, dodawaj pojedynczo
  3. Podziel tekst na bardziej szczegółowe opisy
  4. Edycja wideo zamiast pełnej regeneracji