Pengenalan
Pada 10 Februari 2026, pasukan Seed ByteDance melancarkan Seedance 2.0 secara rasmi. Berbeza daripada generasi terdahulu dan pesaing, ia bukan skim «penjanaan video + pasca-proses audio», tetapi seni bina unified multimodal audio-video joint generation yang direka dari awal.
Seni bina teras: Unified Multimodal AV Generation
Pipeline video AI tradisional biasanya:
- Teks/imej → penjanaan bingkai video
- Bingkai → audio (atau TTS/muzik luaran)
- Penjajaran dan kompositing pasca
Seedance 2.0 menyatukan ketiga-tiga langkah dalam satu model end-to-end, mencapai penjanaan native audio-visual diselaraskan.
Encoder multimodal
Model menggunakan encoder unified yang memetakan teks, imej, video dan audio ke ruang semantik yang sama:
- Teks: pengekodan arahan bahasa semula jadi
- Imej: pengekstrakan ciri visual (sehingga 9 imej)
- Video: ciri visual temporal + pergerakan kamera (sehingga 3 klip)
- Audio: ciri spektral + ritma + semantik (sehingga 3 trek)
Decoder bersama
Peringkat decoding menjana bingkai video dan bentuk gelombang audio serentak dengan representasi perantaraan kongsi, memastikan:
- Lip sync tepat dengan pertuturan (8+ bahasa)
- Aksi diselaraskan dengan bunyi (langkah, impak)
- Pertukaran syot selaras dengan irama muzik
Terobosan utama
1. Konsistensi temporal panjang
Dalam output multishot 15 saat, penampilan watak, elemen adegan dan gaya pencahayaan kekal sangat konsisten — terima kasih kepada temporal attention yang dipertingkat dan cross-shot consistency loss.
2. Pematuhan arahan tahap pengarah
Model memahami arahan kompleks jauh lebih baik, menyokong:
- Penerangan gaya skrip multishot
- Terminologi kamera tepat (push, pull, pan, tilt, track, crane)
- Orkestrasi peristiwa pada garis masa
3. Simulasi fizikal realistik
Dalam adegan sukan berbilang orang, bendalir, kain dan seumpamanya, Seedance 2.0 menghampiri fizik dunia sebenar.
Prestasi benchmark
Di Artificial Analysis Video Arena:
- Skor Elo: 1269 (tempat pertama dunia)
- Mengatasi: Google Veo 3, OpenAI Sora 2, Runway Gen-4.5
- Kekuatan: penyelarasan AV, pematuhan arahan, konsistensi temporal panjang
Pandangan ke hadapan
Seedance 2.0 menandakan peralihan daripada «penjanaan klip» kepada «penjanaan karya audiovisual lengkap». Iterasi akan datang mungkin membawa tempoh lebih panjang, resolusi lebih tinggi dan keupayaan editing yang lebih kukuh.