บทนำ
10 กุมภาพันธ์ 2026 ทีม Seed ของ ByteDance เปิดตัว Seedance 2.0 อย่างเป็นทางการ แตกต่างจากรุ่นก่อนและคู่แข่ง: ไม่ใช่ «สร้างวิดีโอ + ประมวลผลเสียงภายหลัง» แต่เป็นสถาปัตยกรรม unified multimodal AV joint generation ที่ออกแบบจากศูนย์
สถาปัตยกรรมหลัก: Unified Multimodal AV Generation
Pipeline วิดีโอ AI แบบดั้งเดิมมักแบ่งเป็น:
- ข้อความ/ภาพ → สร้างเฟรมวิดีโอ
- เฟรม → เสียง (หรือ TTS/ดนตรีภายนอก)
- จัดแนวและ compositing ภายหลัง
Seedance 2.0 รวมสามขั้นตอนในโมเดล end-to-end เดียว บรรลุ การสร้าง AV แบบ native ที่ซิงค์กัน
Multimodal encoder
โมเดลใช้ encoder แบบ unified ที่แมปข้อความ ภาพ วิดีโอ และเสียงไปยัง semantic space เดียวกัน:
- ข้อความ: การเข้ารหัสคำสั่งภาษาธรรมชาติ
- ภาพ: การสกัดคุณลักษณะภาพ (สูงสุด 9 ภาพ)
- วิดีโอ: คุณลักษณะภาพตามเวลา + การเคลื่อนกล้อง (สูงสุด 3 คลิป)
- เสียง: คุณลักษณะสpectrum + จังหวะ + ความหมาย (สูงสุด 3 แทร็ก)
Joint decoder
ขั้นตอน decoding สร้างเฟรมวิดีโอและคลื่นเสียงพร้อมกันด้วยตัวแทนกลางที่แชร์กัน รับประกัน:
- lip sync กับคำพูดอย่างแม่นยำ (8+ ภาษา)
- ซิงค์การกระทำกับเสียง (ฝีเท้า การชน)
- ประสานการตัดกับจังหวะดนตรี
ความก้าวหน้าหลัก
1. ความสอดคล้องระยะยาว
ในผลลัพธ์ multishot 15 วินาที รูปลักษณ์ตัวละคร องค์ประกอบฉาก และสไตล์แสงคงความสอดคล้องสูง — ด้วย temporal attention ที่ปรับปรุงและ cross-shot consistency loss
2. การทำตามคำสั่งระดับผู้กำกับ
โมเดลเข้าใจคำสั่งที่ซับซ้อนได้ดีขึ้นมาก รองรับ:
- คำอธิบายแบบสคริปต์ multishot
- ศัพท์กล้องที่แม่นยำ (push, pull, pan, tilt, track, crane)
- การจัดเหตุการณ์บน timeline
3. การจำลองฟิสิกส์
ในฉากกีฬาหลายคน ของเหลว ผ้า และคล้ายกัน Seedance 2.0 เข้าใกล้ฟิสิกส์โลกจริง
ผล benchmark
ใน Artificial Analysis Video Arena:
- คะแนน Elo: 1269 (อันดับ 1 โลก)
- นำหน้า: Google Veo 3, OpenAI Sora 2, Runway Gen-4.5
- จุดแข็ง: ซิงค์ AV การทำตามคำสั่ง ความสอดคล้องระยะยาว
แนวโน้ม
Seedance 2.0 ทำเครื่องหมายการเปลี่ยนจาก «สร้างคลิป» สู่ «สร้างงาน AV สมบูรณ์» การพัฒนาในอนาคตอาจนำมาซึ่งความยาวมากขึ้น ความละเอียดสูงขึ้น และความสามารถในการตัดต่อที่แข็งแกร่งขึ้น