مقدمه
در 10 فوریه 2026، تیم Seed بایتدance Seedance 2.0 را بهطور رسمی منتشر کرد. برخلاف نسلهای قبل و رقبا، طرح «تولید ویدیو + پسپردازش صدا» نیست، بلکه معماری unified multimodal AV joint generation است که از ابتدا طراحی شده.
معماری اصلی: Unified Multimodal AV Generation
خط لولههای سنتی ویدیوی AI معمولاً به سه بخش تقسیم میشوند:
- متن/تصویر → تولید فریم ویدیو
- فریم → صدا (یا TTS/موسیقی خارجی)
- تراز و compositing پس از تولید
Seedance 2.0 هر سه مرحله را در یک مدل end-to-end یکپارچه میکند و تولید native AV همگام را محقق میسازد.
Encoder چندوجهی
مدل از encoder یکپارچهای استفاده میکند که متن، تصویر، ویدیو و صدا را به فضای معنایی واحد نگاشت میکند:
- متن: رمزگذاری دستور زبان طبیعی
- تصویر: استخراج ویژگیهای بصری (تا 9 تصویر)
- ویدیو: ویژگیهای بصری زمانی + حرکت دوربین (تا 3 کلیپ)
- صدا: ویژگیهای طیفی + ریتمی + معنایی (تا 3 ترک)
Decoder مشترک
مرحله decoding همزمان فریمهای ویدیو و موج صوتی را با نمایشهای میانی مشترک تولید میکند و تضمین میکند:
- lip sync دقیق با گفتار (8+ زبان)
- همگامسازی حرکت و صدا (قدمها، برخوردها)
- هماهنگی برش با ریتم موسیقی
پیشرفتهای کلیدی
1. سازگاری زمانی طولانی
در خروجی multishot 15 ثانیهای، ظاهر شخصیتها، عناصر صحنه و سبک نورپردازی بسیار سازگار میماند — به لطف temporal attention بهبودیافته و cross-shot consistency loss.
2. پیروی دستور سطح کارگردان
مدل دستورات پیچیده را بسیار بهتر درک میکند و پشتیبانی میکند:
- توصیفات سبک فیلمنامه multishot
- اصطلاحات دقیق دوربین (push, pull, pan, tilt, track, crane)
- orchestration رویدادها روی timeline
3. شبیهسازی فیزیکی
در صحنههای ورزش چندنفره، سیالات، پارچه و موارد مشابه، Seedance 2.0 به فیزیک دنیای واقعی نزدیک میشود.
عملکرد benchmark
در Artificial Analysis Video Arena:
- امتیاز Elo: 1269 (رتبه 1 جهان)
- جلوتر از: Google Veo 3, OpenAI Sora 2, Runway Gen-4.5
- نقاط قوت: همگامسازی AV، پیروی دستور، سازگاری زمانی طولانی
چشمانداز
Seedance 2.0 گذار از «تولید کلیپ» به «تولید آثار AV کامل» را نشان میدهد. تکرارهای آینده ممکن است مدت طولانیتر، وضوح بالاتر و قابلیتهای ویرایش قویتر به همراه داشته باشند.