Introduzione
Il 10 febbraio 2026 il team Seed di ByteDance ha rilasciato Seedance 2.0. A differenza di generazioni precedenti e concorrenti, non è uno schema «generazione video + post-processing audio», ma un’architettura unified multimodal AV joint generation progettata da zero.
Architettura centrale: Unified Multimodal AV Generation
Le pipeline tradizionali di video IA si dividono tipicamente in:
- Testo/immagine → generazione di frame video
- Frame → audio (o TTS/musica esterna)
- Allineamento e compositing post
Seedance 2.0 unifica i tre passaggi in un modello end-to-end, realizzando generazione AV nativa sincronizzata.
Encoder multimodale
Il modello usa un encoder unified che mappa testo, immagine, video e audio nello stesso spazio semantico:
- Testo: codifica di istruzioni in linguaggio naturale
- Immagine: estrazione di caratteristiche visive (fino a 9 immagini)
- Video: caratteristiche visive temporali + movimento camera (fino a 3 clip)
- Audio: caratteristiche spettrali + ritmiche + semantiche (fino a 3 tracce)
Decoder congiunto
La fase di decoding genera simultaneamente sequenze di frame video e forme d’onda audio con rappresentazioni intermedie condivise, garantendo:
- Lip sync preciso con il parlato (8+ lingue)
- Sincronizzazione di azioni e suoni (passi, impatti)
- Cambi di inquadratura coordinati al ritmo musicale
Svolte chiave
1. Coerenza temporale lunga
Negli output multishot di 15 secondi, aspetto dei personaggi, elementi di scena e stile di illuminazione restano altamente coerenti — grazie a temporal attention migliorato e cross-shot consistency loss.
2. Instruction following da regista
Il modello comprende istruzioni complesse molto meglio, supportando:
- Descrizioni stile copione multishot
- Terminologia camera precisa (push, pull, pan, tilt, track, crane)
- Orchestrazione di eventi sulla timeline
3. Realismo fisico
In scene sportive collettive, fluidi, tessuti e simili, Seedance 2.0 si avvicina alla fisica del mondo reale.
Prestazioni benchmark
Su Artificial Analysis Video Arena:
- Punteggio Elo: 1269 (n. 1 mondiale)
- Davanti a: Google Veo 3, OpenAI Sora 2, Runway Gen-4.5
- Punti di forza: sync AV, instruction following, coerenza temporale lunga
Prospettive
Seedance 2.0 segna il passaggio dalla «generazione di clip» alla «generazione di opere audiovisive complete». Le iterazioni future potrebbero portare durata maggiore, risoluzione più alta e capacità di editing più forti.