Présentation
Le 10 février 2026, l’équipe Seed de ByteDance a officiellement lancé Seedance 2.0. Contrairement aux générations précédentes et aux concurrents, ce n’est pas un assemblage « génération vidéo + post-traitement audio », mais une architecture unifiée de génération conjointe audiovisuelle multimodale conçue from scratch.
Architecture centrale : Unified Multimodal AV Generation
Les pipelines vidéo IA traditionnels se divisent généralement en :
- Texte/image → génération de frames vidéo
- Frames → audio (ou TTS/musique externe)
- Alignement et composition postérieure
Seedance 2.0 unifie ces trois étapes dans un modèle end-to-end, réalisant une génération native audio-visuelle synchronisée.
Encodeur multimodal
Le modèle utilise un encodeur unifié qui mappe texte, image, vidéo et audio dans le même espace sémantique :
- Texte : encodage d’instructions en langage naturel
- Image : extraction de caractéristiques visuelles (jusqu’à 9 images)
- Vidéo : caractéristiques visuelles temporelles + mouvement de caméra (jusqu’à 3 clips)
- Audio : caractéristiques spectrales + rythmiques + sémantiques (jusqu’à 3 pistes)
Décodeur conjoint
Le décodage génère simultanément des séquences de frames vidéo et des formes d’onde audio avec des représentations intermédiaires partagées, garantissant :
- Une synchronisation labiale précise avec la parole (8+ langues)
- Des actions synchronisées avec les sons (pas, impacts)
- Des changements de plan coordonnés au rythme musical
Percées clés
1. Cohérence temporelle longue
Sur des sorties multishot de 15 secondes, l’apparence des personnages, les éléments de scène et le style d’éclairage restent hautement cohérents — grâce à un temporal attention amélioré et à un cross-shot consistency loss.
2. Suivi d’instructions niveau réalisateur
Le modèle comprend les instructions complexes bien mieux, en prenant en charge :
- Des descriptions style scénario multishot
- Une terminologie caméra précise (push, pull, pan, tilt, track, crane)
- L’orchestration d’événements sur la timeline
3. Simulation physique réaliste
Dans les scènes sportives collectives, les fluides, les tissus et similaires, Seedance 2.0 se rapproche de la physique du monde réel.
Performances benchmark
Sur Artificial Analysis Video Arena :
- Score Elo : 1269 (n° 1 mondial)
- En avance sur : Google Veo 3, OpenAI Sora 2, Runway Gen-4.5
- Points forts : synchronisation AV, suivi d’instructions, cohérence temporelle longue
Perspectives
Seedance 2.0 marque le passage de la « génération de clips » à la « génération d’œuvres audiovisuelles complètes ». Les itérations futures pourraient apporter une durée plus longue, une résolution plus élevée et des capacités d’édition renforcées.