مقدمة
في 10 فبراير 2026، أطلق فريق Seed في ByteDance Seedance 2.0 رسمياً. يختلف عن الأجيال السابقة والمنافسين: ليس حلاً مركباً من «توليد فيديو + معالجة صوت لاحقة»، بل بنية موحدة لتوليد صوت وفيديو مشترك متعدد الوسائط صُممت من الصفر.
البنية الأساسية: Unified Multimodal AV Generation
خطوط أنابيب الفيديو AI التقليدية عادة:
- نص/صورة → توليد إطارات
- إطارات → صوت (أو TTS/موسيقى خارجية)
- محاذاة وتركيب لاحق
يوحد Seedance 2.0 الخطوات الثلاث في نموذج end-to-end، محققاً توليداً أصلياً متزامناً للصوت والصورة.
مُرمّز multimodal
يستخدم النموذج مُرمّزاً موحداً يُ映射 النص والصورة والفيديو والصوت إلى فضاء دلالي واحد:
- النص: ترميز تعليمات اللغة الطبيعية
- الصورة: استخراج الميزات البصرية (حتى 9 صور)
- الفيديو: ميزات بصرية زمنية + حركة الكاميرا (حتى 3 مقاطع)
- الصوت: ميزات طيفية + إيقاعية + دلالية (حتى 3 مسارات)
فك الترميز المشترك
يولّد مرحلة فك الترميز إطارات فيديو وموجات صوتية معاً بتمثيلات وسيطة مشتركة، مما يضمن:
- محاذاة دقيقة للشفاه والكلام (8+ لغات)
- مزامنة الحركة والأصوات (خطوات، تصادمات)
- تنسيق تبديل اللقطات مع إيقاع الموسيقى
اختراقات تقنية رئيسية
1. اتساق زمني طويل
في مخرجات multishot لمدة 15 ثانية، تبقى مظهر الشخصيات وعناصر المشهد وأسلوب الإضاءة متسقة بفضل temporal attention المحسّن وcross-shot consistency loss.
2. اتباع تعليمات بمستوى المخرج
يفهم النموذج التعليمات المعقدة بشكل أفضل، ويدعم:
- أوصاف multishot بأسلوب السيناريو
- مصطلحات كاميرا دقيقة (push, pull, pan, tilt, track, crane)
- ترتيب الأحداث على المحور الزمني
3. محاكاة فيزيائية واقعية
في مشاهد رياضة جماعية وسوائل وأقمشة، يقترب Seedance 2.0 من قوانين الفيزياء الحقيقية.
أداء التقييم
في Artificial Analysis Video Arena:
- Elo: 1269 (الأول عالمياً)
- يتفوق على: Google Veo 3, OpenAI Sora 2, Runway Gen-4.5
- نقاط القوة: مزامنة AV، اتباع التعليمات، اتساق زمني طويل
نظرة مستقبلية
يمثل Seedance 2.0 انتقالاً من «توليد المقاطع» إلى «توليد أعمال سمعية بصرية كاملة». قد تجلب التكرارات المستقبلية مدة أطول ودقة أعلى وقدرات تحرير أقوى.