引言:为什么「只会写 Prompt」在 Seedance 2.5 里不够用?
搜索「Seedance 图生视频」「AI 多模态参考」「Seedance 参考图」「Seedance 视频参考」的创作者,通常已经会写分镜文字,却仍卡在三件事:
- 角色/产品每次都漂:纯文字描述再细,外观仍不稳定
- 运镜学不来:想要「像某条广告那样推镜头」,文字很难说清
- 参考一多反而崩:图片、视频、音频全塞进去,模型「听不懂谁说了算」
Seedance 2.5 支持文字 + 图片 + 视频 + 音频的多模态输入,并把单条时长拉到约 20 秒、强化跨镜头一致性。本文不是「多模态概念科普」(本站教程区另有入门文),而是一份可执行的 Seedance 图生视频与参考组合手册:何时用哪类参考、怎么配比、怎么迭代、怎么排错。
与《分镜 Prompt 模板库》侧重文字结构不同,本文聚焦 参考素材如何锁定画面;与 2.0 教程《多模态输入技巧》相比,面向 2026 Seedance 2.5 更长时长与更强一致性 的实战配方。
先建立分工:四种模态各自管什么?
| 模态 | 最佳职责 | 不宜指望它做的事 |
|---|---|---|
| 文字 Prompt | 叙事、时间线、运镜术语、禁止项 | 精确复现某张脸/某款包装细节 |
| 图片参考 | 角色外观、产品外形、场景 mood、构图风格 | 传达连续动作与镜头速度 |
| 视频参考 | 运镜轨迹、动作节奏、转场气质 | 复制其中角色身份(应用图片锁身份) |
| 音频参考 | 配乐节奏、环境底噪、口播语气感 | 替代清晰台词脚本(台词仍写进 Prompt) |
一句话原则:文字管「故事与指令」,图片管「长什么样」,视频管「怎么动镜头」,音频管「怎么听起来」。职责重叠时,模型更容易混乱。
图生视频 vs 纯文字:什么时候必须上参考图?
| 场景 | 纯文字 | 建议加图片参考 | 原因 |
|---|---|---|---|
| 氛围概念片 / 情绪片 | ✅ 可先试 | 可选 mood 图 | 文字够表达气质 |
| 固定角色连载 / IP | ❌ 不稳 | ✅ 必须 | 外观连续性优先 |
| 电商产品 / 包装还原 | ❌ 易走形 | ✅ 必须 | 形状、配色、logo 区 |
| 品牌调性统一 | ⚪ | ✅ 推荐 | 主色与材质语言 |
| 复杂双人戏 | ⚪ | ✅ 每人 1–2 张 | 降低串脸 |
| 一次性抽象特效 | ✅ | 常不需要 | 参考反而限制发散 |
Seedance 图生视频的核心价值,不是「把静态图变成会动的图」这么简单,而是:用图片把身份与产品钉死,再用文字/视频把导演意图说清楚。
参考素材准备清单(开工前)
1. 图片参考(最常用)
| 类型 | 数量建议 | 要求 |
|---|---|---|
| 角色正面半身 | 1–2 张 | 同发型、服装、年龄感 |
| 产品白底 / 主视觉 | 2–3 张 | 同色同比例,无竞品入镜 |
| 场景 mood | 1–2 张 | 固定时间与光影关键词 |
| 风格参考(可选) | 0–1 张 | 只取光影/调色,勿混入第二主角 |
铁律:
- 一张图只承担一个职责(正面 / 细节 / 场景分开)
- 同一角色或同一 SKU 的参考图集,整条 campaign 不变
- 避免拼贴图、含水印大字、多人混在一张里
2. 视频参考(可选但很强)
- 时长建议:3–8 秒清晰运镜片段即可
- 用途:推镜头、环绕、跟拍节奏——学镜头,不学换脸
- Prompt 中写明:「运镜参照参考视频;角色外观严格参照图片」
3. 音频参考(可选)
- 用于节奏广告、MV 感短片、环境氛围
- 有对白时:音频给语气,台词正文仍写短句进 Prompt
Seedance 2.5 多模态组合配方(可直接套)
配方 A:角色短片(图 + 文)
- 图片:角色设定 × 2
- 文字:三镜时间线(建立 → 冲突 → 定格)
- 视频/音频:先不加
适合:短剧钩子、人设测试、身份锚定条。
配方 B:产品展示(图 + 文,可选视频)
- 图片:产品 × 2–3 + 可选场景 × 1
- 文字:亮相 → 卖点特写 → CTA 留白
- 视频:品牌既有广告运镜 1 段(可选)
适合:电商主图视频、信息流产品片。
配方 C:导演级广告(图 + 视频 + 文,可选音频)
- 图片:产品/角色锁定
- 视频:运镜气质
- 音频:BGM 节奏
- 文字:分镜 + 禁止项 + 「外观以图片为准」
适合:品牌短 TVC、提案概念样片。
配方 D:口播/表演(图 + 文 + 音频)
- 图片:出镜人设定
- 音频:语气或节拍
- 文字:短台词 + 景别;避免长独白
适合:多语言口播前的单语母版(再做语言扩展)。
推荐 Prompt 骨架(图生视频专用)
【任务】竖屏/横屏短片,电影感调色,时长约 16–20 秒。
【外观锁定】主体外观严格参照参考图片:不得换脸、改发型、改包装比例或主色。
【运镜】[若有视频参考] 镜头运动参照参考视频的推拉/环绕节奏;[若无] 写明推镜头/跟拍/固定机位。
【镜头 1 | 0–5s】建立:[场景],[主体入画]。
【镜头 2 | 5–13s】发展:[动作/利益点],中景或特写。
【镜头 3 | 13–20s】收束:[表情/产品定格],留白干净;不生成可读小字。
【音频】[氛围描述或「参照音频节奏」];对白不超过 1–2 短句。
【禁止】背景乱码文字、额外路人抢戏、中途更换服装/产品。
关键句请几乎每条都保留:「外观严格参照参考图片」。这是 Seedance 多模态参考里最便宜、最有效的一致性开关。
三大完整案例
案例 1:人物 IP 锚定(12 秒 → 18 秒)
目标:先确认「同一个人」,再上叙事。
- 仅上传角色图 × 2 + 文字:「中近景,缓慢推镜头,中性表情,干净背景」
- 通过后再加三镜故事,同一图集不变
- 失败时减事件密度,而不是加更多杂图
案例 2:耳机产品图生视频(16 秒 · 9:16)
叙事:白台亮相 → 耳罩材质特写 → 佩戴定格留白。
参考:白底产品图 × 2、细节图 × 1。
Prompt 要点:外观锁定句 + 三镜时间线 + 「不生成包装小字」。
可选:加 5 秒环绕运镜参考视频,并写明「只学运镜」。
案例 3:雨夜情绪片(图 + 视频 + 音频)
图片:雨夜街道 mood × 1、角色 × 1
视频:缓慢跟拍参考
音频:潮湿环境底噪或低频 pad
文字:三镜钩子;短信/屏幕避免清晰小字
这是典型的 Seedance 多模态参考满配,但仍保持「身份看图、镜头看视频、故事看文字」。
迭代四步法(多模态专用)
- 文字-only 跑结构(10–12 秒):钩子是否可读
- 只加图片锁定外观(仍 12 秒):是否还像同一个人/同一产品
- 再加视频或音频之一:不要一次加满
- 延长至 16–20 秒:检查后半是否崩外观、崩运镜
若第 4 步失败:拆成两段生成再剪,或回到第 2 步减少参考数量。
常见误区(比「不会写 Prompt」更致命)
- 参考越多越好:超过职责所需就会互相打架
- 用视频参考锁人脸:应用图片锁身份,视频只借运镜
- 一张拼贴图塞多个角色:模型难以解析
- 要求画面内写出清晰 slogan/参数:易乱码,改后期字幕
- 第一次就上满 20 秒 + 全模态:先短后长、先图后音视频
- 中途更换参考图集:等于换演员/换货
常见翻车与修复
| 现象 | 可能原因 | 修复 |
|---|---|---|
| 换脸 / 产品走形 | 图冲突或未写锁定句 | 固定 1–3 张核心图 + 重复锁定句 |
| 有图仍不像 | 图清晰度差/妆发不一致 | 换同妆发正面图,去掉侧面杂图 |
| 运镜与参考无关 | 未声明「运镜参照视频」 | Prompt 明确分工 |
| 双人串脸 | 参考过多 | 每人最多 1–2 张,文字区分角色名 |
| 音频抢戏导致口型飘 | 台词过长 | 缩到 1 句;音画意图对齐 |
| 加视频后身份漂 | 视频里另一张脸被学习 | 强调「外观以图片为准」或去掉视频 |
与纯文字工作流怎么选?
| 你的目标 | 推荐路径 |
|---|---|
| 快速试想法 / 抽象氛围 | 纯文字 → 再决定是否加 mood 图 |
| 可连载角色 / 可投放产品 | 图生视频为主(配方 A/B) |
| 要「像某条片」的镜头感 | 图锁身份 + 视频锁运镜(配方 C) |
| 节奏/口播驱动 | 图 + 文 + 音频(配方 D) |
对 SEO 与实际产能而言:「Seedance 图生视频」和「Seedance 多模态参考」往往是同一条生产线的两个搜索说法——本质都是用参考降低随机性。
SEO 与素材管理建议
- 标题与封面点明「图生视频 / 多模态参考」,匹配高意图搜索
- 正文自然覆盖 Seedance 2.5、图生视频、参考图、视频参考、音频参考
- 为每个角色/SKU 建「参考包」文件夹(图集版本号),禁止随意替换
- 通过质检的配方沉淀为内部模板,与 Prompt 模板库交叉复用
常见问题
Q:Seedance 2.5 图生视频必须上传图片吗?
A:不是必须。但角色连载、产品还原、品牌调性场景强烈建议上传;否则一致性成本会显著上升。
Q:最多能塞多少张图?
A:以「职责清晰」为准,通常角色 1–2、产品 2–3、场景 1–2 足够。宁少勿杂。
Q:视频参考会不会把参考片里的人物也学进来?
A:有可能。务必在 Prompt 写明外观以你的图片为准,或改用无主角的纯运镜片段。
Q:和 Seedance 2.0 多模态有何不同?
A:流程兼容;2.5 更长时长与更强跨镜头一致性,更适合「参考锁定后一口气讲完 16–20 秒钩子」。
Q:图生视频生成后还能再改运镜吗?
A:可保留同一图集,只改文字运镜或替换视频参考重跑;不要同时大改外观描述与参考图。
结语:让参考成为 Seedance 的「场记板」
多模态不是素材堆叠竞赛,而是给 Seedance 2.5 一张清楚的场记板:
- 图片钉死身份与产品
- 视频借来镜头语言
- 音频稳住节奏与气息
- 文字写出时间线与禁止项
建议今天就做一次对照实验:同一段三镜故事,先纯文字出一条,再加 2 张参考图出一条——当你明显感到「后一条才像可连载资产」时,你的 Seedance 图生视频生产线才算真正开工。