Giới thiệu
Ngày 10/2/2026, đội Seed ByteDance phát hành chính thức Seedance 2.0. Khác biệt lớn nhất so với thế hệ trước và đối thủ: không phải «tạo video + xử lý âm thanh hậu kỳ» mà kiến trúc unified multimodal audio-video joint generation thiết kế từ đầu.
Kiến trúc cốt lõi: Unified Multimodal AV Generation
Pipeline video AI truyền thống thường chia thành:
- Văn bản/hình ảnh → tạo khung hình video
- Khung hình → âm thanh (hoặc TTS/nhạc bên ngoài)
- Căn chỉnh và compositing hậu kỳ
Seedance 2.0 hợp nhất ba bước trong một mô hình end-to-end, đạt tạo sinh AV đồng bộ native.
Bộ mã hóa đa phương thức
Mô hình dùng bộ mã hóa unified ánh xạ văn bản, hình, video và audio vào cùng không gian ngữ nghĩa:
- Văn bản: mã hóa chỉ dẫn ngôn ngữ tự nhiên
- Hình ảnh: trích xuất đặc trưng thị giác (tối đa 9 hình)
- Video: đặc trưng thị giác theo thời gian + chuyển động camera (tối đa 3 clip)
- Audio: đặc trưng phổ + nhịp + ngữ nghĩa (tối đa 3 track)
Bộ giải mã liên hợp
Giai đoạn giải mã tạo đồng thời chuỗi khung hình và dạng sóng âm thanh với biểu diễn trung gian chia sẻ, đảm bảo:
- Lip sync chính xác với lời nói (8+ ngôn ngữ)
- Đồng bộ hành động và hiệu ứng âm thanh (bước chân, va chạm)
- Cắt cảnh phối hợp với nhịp nhạc
Đột phá then chốt
1. Nhất quán thời gian dài
Trong output multishot 15 giây, ngoại hình nhân vật, yếu tố cảnh và phong cách ánh sáng giữ độ nhất quán cao — nhờ temporal attention cải tiến và cross-shot consistency loss.
2. Tuân thủ chỉ dẫn cấp đạo diễn
Mô hình hiểu chỉ dẫn phức tạp tốt hơn nhiều, hỗ trợ:
- Mô tả kiểu kịch bản multishot
- Thuật ngữ camera chính xác (push, pull, pan, tilt, track, crane)
- Sắp xếp sự kiện trên timeline
3. Mô phỏng vật lý
Trong cảnh thể thao nhiều người, chất lỏng, vải vóc, Seedance 2.0 gần với vật lý thế giới thực.
Hiệu suất benchmark
Tại Artificial Analysis Video Arena:
- Điểm Elo: 1269 (số 1 thế giới)
- Vượt: Google Veo 3, OpenAI Sora 2, Runway Gen-4.5
- Điểm mạnh: đồng bộ AV, tuân thủ chỉ dẫn, nhất quán thời gian dài
Triển vọng
Seedance 2.0 đánh dấu bước chuyển từ «tạo clip» sang «tạo tác phẩm AV hoàn chỉnh». Các phiên bản tương lai có thể mang lại thời lượng dài hơn, độ phân giải cao hơn và khả năng chỉnh sửa mạnh hơn.