什麼是 Elo 評分?
Elo 評分體系源自国際象棋,後被 Artificial Analysis 引入 AI 模型評測。其核心機製是:
- 兩個模型的輸出进行盲評對比
- 評委(人類或 AI)選擇更好的輸出
- 根據勝負結果動態調整 Elo 分數
這意味著 Elo 分數反映的是相對實力,而非絕對指標。1269 分意味著 Seedance 2.0 在與任何其他模型的對比中,勝率顯著更高。
當前排名(2026 年 2 月)
| 排名 | 模型 | Elo 分數 |
|---|---|---|
| 1 | Seedance 2.0 | 1269 |
| 2 | Google Veo 3 | 1241 |
| 3 | OpenAI Sora 2 | 1228 |
| 4 | Runway Gen-4.5 | 1205 |
| 5 | Kling 2.0 | 1198 |
Seedance 2.0 勝在哪裡?
1. 音畫同步是降維打擊
在 Elo 盲評中,有原生音頻的視頻幾乎總是優於無聲視頻。Seedance 2.0 是唯一能在評測中 consistently 輸出高質量同步音視頻的主流模型。
2. 长时序一致性
15 秒的多鏡頭輸出中,Seedance 2.0 的角色和場景一致性明顯優於只能生成 4–8 秒片段的競品。在 Elo 對比中,「哪個視頻更像一個完整的作品」成為關鍵評判標准。
3. 物理真實感
在包含運動、碰撞、流體等物理場景的 prompt 中,Seedance 2.0 的勝率最高。評委普遍反饋其「看起來像是真實拍攝的」。
4. 指令遵循的精確度
復雜 prompt 場景下,Seedance 2.0 更少出現「忽略了 half of the instructions」的問題题。
Elo 分數的局限性
需要指出的是,Elo 評分並非完美:
- 主觀性:盲評依賴評委審美偏好
- Prompt 偏差:測試 prompt 集合可能偏向某些模型的強項
- 不反映速度/成本:Elo 只評質量,不評生成速度和 API 价格
行業意義
Seedance 2.0 登頂 Elo 榜,標誌著 AI 視頻生成競賽进入新階段。競爭焦點從「誰能生成視頻」轉向「誰能生成完整的視聽作品」。對於开發者和创作者而言,這是一個明確的信號:多模態聯合生成是未來的方向。