Introducción
El 10 de febrero de 2026, el equipo Seed de ByteDance lanzó oficialmente Seedance 2.0. A diferencia de generaciones anteriores y competidores, no es un esquema concatenado de «generación de vídeo + postprocesado de audio», sino una arquitectura unificada de generación conjunta audiovisual multimodal diseñada desde cero.
Arquitectura central: Unified Multimodal AV Generation
Las tuberías tradicionales de vídeo IA suelen dividirse en:
- Texto/imagen → generación de fotogramas
- Fotogramas → audio (o TTS/música externa)
- Alineación y composición posterior
Seedance 2.0 unifica los tres pasos en un modelo extremo a extremo, logrando generación nativa con audio y vídeo sincronizados.
Codificador multimodal
El modelo usa un codificador unificado que mapea texto, imagen, vídeo y audio al mismo espacio semántico:
- Texto: codificación de instrucciones en lenguaje natural
- Imagen: extracción de características visuales (hasta 9 imágenes)
- Vídeo: características visuales temporales + de movimiento de cámara (hasta 3 clips)
- Audio: características espectrales + rítmicas + semánticas (hasta 3 pistas)
Decodificador conjunto
La decodificación genera simultáneamente secuencias de fotogramas y formas de onda de audio con representaciones intermedias compartidas, garantizando:
- Alineación precisa de labios y voz (8+ idiomas)
- Sincronización de acciones y efectos sonoros (pasos, impactos)
- Coordinación de cambios de plano con el ritmo musical
Avances técnicos clave
1. Consistencia temporal larga
En salidas multishot de 15 segundos, la apariencia de personajes, elementos de escena y estilo de iluminación se mantienen altamente consistentes gracias a temporal attention mejorado y cross-shot consistency loss.
2. Seguimiento de instrucciones a nivel de director
El modelo comprende instrucciones complejas mucho mejor, soportando:
- Descripciones estilo guion multishot
- Terminología precisa de cámara (push, pull, pan, tilt, track, crane)
- Orquestación de eventos en la línea temporal
3. Simulación física realista
En escenas con múltiples personas, fluidos, telas y similares, Seedance 2.0 se acerca a la física del mundo real.
Resultados de evaluación
En Artificial Analysis Video Arena:
- Puntuación Elo: 1269 (n.º 1 mundial)
- Por delante de: Google Veo 3, OpenAI Sora 2, Runway Gen-4.5
- Fortalezas: sincronización AV, seguimiento de instrucciones, consistencia temporal larga
Perspectivas
Seedance 2.0 marca el paso de la «generación de clips» a la «generación de obras audiovisuales completas». Con iteraciones futuras, podemos esperar mayor duración, resolución y capacidades de edición.