引言:為什麼「只會寫 Prompt」在 Seedance 2.5 裡不夠用?
搜尋「Seedance 圖生視頻」「AI 多模態參考」「Seedance 參考圖」「Seedance 視頻參考」的創作者,通常已經會寫分鏡文字,卻仍卡在三件事:
- 角色/產品每次都漂:純文字描述再細,外觀仍不穩定
- 運鏡學不來:想要「像某條廣告那樣推鏡頭」,文字很難說清
- 參考一多反而崩:圖片、視頻、音頻全塞進去,模型「聽不懂誰說了算」
Seedance 2.5 支持文字 + 圖片 + 視頻 + 音頻的多模態輸入,並把單條時長拉到約 20 秒、強化跨鏡頭一致性。本文不是「多模態概念科普」(本站教程區另有入門文),而是一份可執行的 Seedance 圖生視頻與參考組合手冊:何時用哪類參考、怎麼配比、怎麼迭代、怎麼排錯。
與《分鏡 Prompt 模板庫》側重文字結構不同,本文聚焦 參考素材如何鎖定畫面;與 2.0 教程《多模態輸入技巧》相比,面向 2026 Seedance 2.5 更長時長與更強一致性 的實戰配方。
先建立分工:四種模態各自管什麼?
| 模態 | 最佳職責 | 不宜指望它做的事 |
|---|---|---|
| 文字 Prompt | 敘事、時間線、運鏡術語、禁止項 | 精確復現某張臉/某款包裝細節 |
| 圖片參考 | 角色外觀、產品外形、場景 mood、構圖風格 | 傳達連續動作與鏡頭速度 |
| 視頻參考 | 運鏡軌跡、動作節奏、轉場氣質 | 複製其中角色身份(應用圖片鎖身份) |
| 音頻參考 | 配樂節奏、環境底噪、口播語氣感 | 替代清晰台詞腳本(台詞仍寫進 Prompt) |
一句話原則:文字管「故事與指令」,圖片管「長什麼樣」,視頻管「怎麼動鏡頭」,音頻管「怎麼聽起來」。職責重疊時,模型更容易混亂。
圖生視頻 vs 純文字:什麼時候必須上參考圖?
| 場景 | 純文字 | 建議加圖片參考 | 原因 |
|---|---|---|---|
| 氛圍概念片 / 情緒片 | ✅ 可先試 | 可選 mood 圖 | 文字夠表達氣質 |
| 固定角色連載 / IP | ❌ 不穩 | ✅ 必須 | 外觀連續性優先 |
| 電商產品 / 包裝還原 | ❌ 易走形 | ✅ 必須 | 形狀、配色、logo 區 |
| 品牌調性統一 | ⚪ | ✅ 推薦 | 主色與材質語言 |
| 複雜雙人戲 | ⚪ | ✅ 每人 1–2 張 | 降低串臉 |
| 一次性抽象特效 | ✅ | 常不需要 | 參考反而限制發散 |
Seedance 圖生視頻的核心價值,不是「把靜態圖變成會動的圖」這麼簡單,而是:用圖片把身份與產品釘死,再用文字/視頻把導演意圖說清楚。
參考素材準備清單(開工前)
1. 圖片參考(最常用)
| 類型 | 數量建議 | 要求 |
|---|---|---|
| 角色正面半身 | 1–2 張 | 同髮型、服裝、年齡感 |
| 產品白底 / 主視覺 | 2–3 張 | 同色同比例,無競品入鏡 |
| 場景 mood | 1–2 張 | 固定時間與光影關鍵詞 |
| 風格參考(可選) | 0–1 張 | 只取光影/調色,勿混入第二主角 |
鐵律:
- 一張圖只承擔一個職責(正面 / 細節 / 場景分開)
- 同一角色或同一 SKU 的參考圖集,整條 campaign 不變
- 避免拼貼圖、含水印大字、多人混在一張裡
2. 視頻參考(可選但很強)
- 時長建議:3–8 秒清晰運鏡片段即可
- 用途:推鏡頭、環繞、跟拍節奏——學鏡頭,不學換臉
- Prompt 中寫明:「運鏡參照參考視頻;角色外觀嚴格參照圖片」
3. 音頻參考(可選)
- 用於節奏廣告、MV 感短片、環境氛圍
- 有對白時:音頻給語氣,台詞正文仍寫短句進 Prompt
Seedance 2.5 多模態組合配方(可直接套)
配方 A:角色短片(圖 + 文)
- 圖片:角色設定 × 2
- 文字:三鏡時間線(建立 → 衝突 → 定格)
- 視頻/音頻:先不加
適合:短劇鉤子、人設測試、身份錨定條。
配方 B:產品展示(圖 + 文,可選視頻)
- 圖片:產品 × 2–3 + 可選場景 × 1
- 文字:亮相 → 賣點特寫 → CTA 留白
- 視頻:品牌既有廣告運鏡 1 段(可選)
適合:電商主圖視頻、資訊流產品片。
配方 C:導演級廣告(圖 + 視頻 + 文,可選音頻)
- 圖片:產品/角色鎖定
- 視頻:運鏡氣質
- 音頻:BGM 節奏
- 文字:分鏡 + 禁止項 + 「外觀以圖片為準」
適合:品牌短 TVC、提案概念樣片。
配方 D:口播/表演(圖 + 文 + 音頻)
- 圖片:出鏡人設定
- 音頻:語氣或節拍
- 文字:短台詞 + 景別;避免長獨白
適合:多語言口播前的單語母版(再做語言擴展)。
推薦 Prompt 骨架(圖生視頻專用)
【任務】豎屏/橫屏短片,電影感調色,時長約 16–20 秒。
【外觀鎖定】主體外觀嚴格參照參考圖片:不得換臉、改髮型、改包裝比例或主色。
【運鏡】[若有視頻參考] 鏡頭運動參照參考視頻的推拉/環繞節奏;[若無] 寫明推鏡頭/跟拍/固定機位。
【鏡頭 1 | 0–5s】建立:[場景],[主體入畫]。
【鏡頭 2 | 5–13s】發展:[動作/利益點],中景或特寫。
【鏡頭 3 | 13–20s】收束:[表情/產品定格],留白乾淨;不生成可讀小字。
【音頻】[氛圍描述或「參照音頻節奏」];對白不超過 1–2 短句。
【禁止】背景亂碼文字、額外路人搶戲、中途更換服裝/產品。
關鍵句請幾乎每條都保留:「外觀嚴格參照參考圖片」。這是 Seedance 多模態參考裡最便宜、最有效的一致性開關。
三大完整案例
案例 1:人物 IP 錨定(12 秒 → 18 秒)
目標:先確認「同一個人」,再上敘事。
- 僅上傳角色圖 × 2 + 文字:「中近景,緩慢推鏡頭,中性表情,乾淨背景」
- 通過後再加三鏡故事,同一圖集不變
- 失敗時減事件密度,而不是加更多雜圖
案例 2:耳機產品圖生視頻(16 秒 · 9:16)
敘事:白台亮相 → 耳罩材質特寫 → 佩戴定格留白。
參考:白底產品圖 × 2、細節圖 × 1。 Prompt 要點:外觀鎖定句 + 三鏡時間線 + 「不生成包裝小字」。 可選:加 5 秒環繞運鏡參考視頻,並寫明「只學運鏡」。
案例 3:雨夜情緒片(圖 + 視頻 + 音頻)
圖片:雨夜街道 mood × 1、角色 × 1 視頻:緩慢跟拍參考 音頻:潮濕環境底噪或低頻 pad 文字:三鏡鉤子;短信/屏幕避免清晰小字
這是典型的 Seedance 多模態參考滿配,但仍保持「身份看圖、鏡頭看視頻、故事看文字」。
迭代四步法(多模態專用)
- 文字-only 跑結構(10–12 秒):鉤子是否可讀
- 只加圖片鎖定外觀(仍 12 秒):是否還像同一個人/同一產品
- 再加視頻或音頻之一:不要一次加滿
- 延長至 16–20 秒:檢查後半是否崩外觀、崩運鏡
若第 4 步失敗:拆成兩段生成再剪,或回到第 2 步減少參考數量。
常見誤區(比「不會寫 Prompt」更致命)
- 參考越多越好:超過職責所需就會互相打架
- 用視頻參考鎖人臉:應用圖片鎖身份,視頻只借運鏡
- 一張拼貼圖塞多個角色:模型難以解析
- 要求畫面內寫出清晰 slogan/參數:易亂碼,改後期字幕
- 第一次就上滿 20 秒 + 全模態:先短後長、先圖後音視頻
- 中途更換參考圖集:等於換演員/換貨
常見翻車與修復
| 現象 | 可能原因 | 修復 |
|---|---|---|
| 換臉 / 產品走形 | 圖衝突或未寫鎖定句 | 固定 1–3 張核心圖 + 重複鎖定句 |
| 有圖仍不像 | 圖清晰度差/妝髮不一致 | 換同妝髮正面圖,去掉側面雜圖 |
| 運鏡與參考無關 | 未聲明「運鏡參照視頻」 | Prompt 明確分工 |
| 雙人串臉 | 參考過多 | 每人最多 1–2 張,文字區分角色名 |
| 音頻搶戲導致口型飄 | 台詞過長 | 縮到 1 句;音畫意圖對齊 |
| 加視頻後身份漂 | 視頻裡另一張臉被學習 | 強調「外觀以圖片為準」或去掉視頻 |
與純文字工作流怎麼選?
| 你的目標 | 推薦路徑 |
|---|---|
| 快速試想法 / 抽象氛圍 | 純文字 → 再決定是否加 mood 圖 |
| 可連載角色 / 可投放產品 | 圖生視頻為主(配方 A/B) |
| 要「像某條片」的鏡頭感 | 圖鎖身份 + 視頻鎖運鏡(配方 C) |
| 節奏/口播驅動 | 圖 + 文 + 音頻(配方 D) |
對 SEO 與實際產能而言:「Seedance 圖生視頻」和「Seedance 多模態參考」往往是同一條生產線的兩個搜索說法——本質都是用參考降低隨機性。
SEO 與素材管理建議
- 標題與封面點明「圖生視頻 / 多模態參考」,匹配高意圖搜索
- 正文自然覆蓋 Seedance 2.5、圖生視頻、參考圖、視頻參考、音頻參考
- 為每個角色/SKU 建「參考包」文件夾(圖集版本號),禁止隨意替換
- 通過質檢的配方沉澱為內部模板,與 Prompt 模板庫交叉複用
常見問題
Q:Seedance 2.5 圖生視頻必須上傳圖片嗎? A:不是必須。但角色連載、產品還原、品牌調性場景強烈建議上傳;否則一致性成本會顯著上升。
Q:最多能塞多少張圖? A:以「職責清晰」為準,通常角色 1–2、產品 2–3、場景 1–2 足夠。寧少勿雜。
Q:視頻參考會不會把參考片裡的人物也學進來? A:有可能。務必在 Prompt 寫明外觀以你的圖片為準,或改用無主角的純運鏡片段。
Q:和 Seedance 2.0 多模態有何不同? A:流程兼容;2.5 更長時長與更強跨鏡頭一致性,更適合「參考鎖定後一口氣講完 16–20 秒鉤子」。
Q:圖生視頻生成後還能再改運鏡嗎? A:可保留同一圖集,只改文字運鏡或替換視頻參考重跑;不要同時大改外觀描述與參考圖。
結語:讓參考成為 Seedance 的「場記板」
多模態不是素材堆疊競賽,而是給 Seedance 2.5 一張清楚的場記板:
- 圖片釘死身份與產品
- 視頻借來鏡頭語言
- 音頻穩住節奏與氣息
- 文字寫出時間線與禁止項
建議今天就做一次對照實驗:同一段三鏡故事,先純文字出一條,再加 2 張參考圖出一條——當你明顯感到「後一條才像可連載資產」時,你的 Seedance 圖生視頻生產線才算真正開工。