进阶技巧 7 分钟阅读 Seedance Team

Seedance 2.5 图生视频完全手册:图片、视频、音频参考如何组合锁定画面

面向创作者与制作团队,详解 Seedance 2.5 图生视频与多模态参考:图片/视频/音频如何分工、组合配方、常见误区、与纯文字 Prompt 对比,并附完整案例与排错清单。

引言:为什么「只会写 Prompt」在 Seedance 2.5 里不够用?

搜索「Seedance 图生视频」「AI 多模态参考」「Seedance 参考图」「Seedance 视频参考」的创作者,通常已经会写分镜文字,却仍卡在三件事:

  • 角色/产品每次都漂:纯文字描述再细,外观仍不稳定
  • 运镜学不来:想要「像某条广告那样推镜头」,文字很难说清
  • 参考一多反而崩:图片、视频、音频全塞进去,模型「听不懂谁说了算」

Seedance 2.5 支持文字 + 图片 + 视频 + 音频的多模态输入,并把单条时长拉到约 20 秒、强化跨镜头一致性。本文不是「多模态概念科普」(本站教程区另有入门文),而是一份可执行的 Seedance 图生视频与参考组合手册:何时用哪类参考、怎么配比、怎么迭代、怎么排错。

与《分镜 Prompt 模板库》侧重文字结构不同,本文聚焦 参考素材如何锁定画面;与 2.0 教程《多模态输入技巧》相比,面向 2026 Seedance 2.5 更长时长与更强一致性 的实战配方。

先建立分工:四种模态各自管什么?

模态最佳职责不宜指望它做的事
文字 Prompt叙事、时间线、运镜术语、禁止项精确复现某张脸/某款包装细节
图片参考角色外观、产品外形、场景 mood、构图风格传达连续动作与镜头速度
视频参考运镜轨迹、动作节奏、转场气质复制其中角色身份(应用图片锁身份)
音频参考配乐节奏、环境底噪、口播语气感替代清晰台词脚本(台词仍写进 Prompt)

一句话原则:文字管「故事与指令」,图片管「长什么样」,视频管「怎么动镜头」,音频管「怎么听起来」。职责重叠时,模型更容易混乱。

图生视频 vs 纯文字:什么时候必须上参考图?

场景纯文字建议加图片参考原因
氛围概念片 / 情绪片✅ 可先试可选 mood 图文字够表达气质
固定角色连载 / IP❌ 不稳✅ 必须外观连续性优先
电商产品 / 包装还原❌ 易走形✅ 必须形状、配色、logo 区
品牌调性统一⚪✅ 推荐主色与材质语言
复杂双人戏⚪✅ 每人 1–2 张降低串脸
一次性抽象特效✅常不需要参考反而限制发散

Seedance 图生视频的核心价值,不是「把静态图变成会动的图」这么简单,而是:用图片把身份与产品钉死,再用文字/视频把导演意图说清楚。

参考素材准备清单(开工前)

1. 图片参考(最常用)

类型数量建议要求
角色正面半身1–2 张同发型、服装、年龄感
产品白底 / 主视觉2–3 张同色同比例,无竞品入镜
场景 mood1–2 张固定时间与光影关键词
风格参考(可选)0–1 张只取光影/调色,勿混入第二主角

铁律:

  • 一张图只承担一个职责(正面 / 细节 / 场景分开)
  • 同一角色或同一 SKU 的参考图集,整条 campaign 不变
  • 避免拼贴图、含水印大字、多人混在一张里

2. 视频参考(可选但很强)

  • 时长建议:3–8 秒清晰运镜片段即可
  • 用途:推镜头、环绕、跟拍节奏——学镜头,不学换脸
  • Prompt 中写明:「运镜参照参考视频;角色外观严格参照图片」

3. 音频参考(可选)

  • 用于节奏广告、MV 感短片、环境氛围
  • 有对白时:音频给语气,台词正文仍写短句进 Prompt

Seedance 2.5 多模态组合配方(可直接套)

配方 A:角色短片(图 + 文)

  • 图片:角色设定 × 2
  • 文字:三镜时间线(建立 → 冲突 → 定格)
  • 视频/音频:先不加

适合:短剧钩子、人设测试、身份锚定条。

配方 B:产品展示(图 + 文,可选视频)

  • 图片:产品 × 2–3 + 可选场景 × 1
  • 文字:亮相 → 卖点特写 → CTA 留白
  • 视频:品牌既有广告运镜 1 段(可选)

适合:电商主图视频、信息流产品片。

配方 C:导演级广告(图 + 视频 + 文,可选音频)

  • 图片:产品/角色锁定
  • 视频:运镜气质
  • 音频:BGM 节奏
  • 文字:分镜 + 禁止项 + 「外观以图片为准」

适合:品牌短 TVC、提案概念样片。

配方 D:口播/表演(图 + 文 + 音频)

  • 图片:出镜人设定
  • 音频:语气或节拍
  • 文字:短台词 + 景别;避免长独白

适合:多语言口播前的单语母版(再做语言扩展)。

推荐 Prompt 骨架(图生视频专用)

【任务】竖屏/横屏短片,电影感调色,时长约 16–20 秒。
【外观锁定】主体外观严格参照参考图片:不得换脸、改发型、改包装比例或主色。
【运镜】[若有视频参考] 镜头运动参照参考视频的推拉/环绕节奏;[若无] 写明推镜头/跟拍/固定机位。
【镜头 1 | 0–5s】建立:[场景],[主体入画]。
【镜头 2 | 5–13s】发展:[动作/利益点],中景或特写。
【镜头 3 | 13–20s】收束:[表情/产品定格],留白干净;不生成可读小字。
【音频】[氛围描述或「参照音频节奏」];对白不超过 1–2 短句。
【禁止】背景乱码文字、额外路人抢戏、中途更换服装/产品。

关键句请几乎每条都保留:「外观严格参照参考图片」。这是 Seedance 多模态参考里最便宜、最有效的一致性开关。

三大完整案例

案例 1:人物 IP 锚定(12 秒 → 18 秒)

目标:先确认「同一个人」,再上叙事。

  1. 仅上传角色图 × 2 + 文字:「中近景,缓慢推镜头,中性表情,干净背景」
  2. 通过后再加三镜故事,同一图集不变
  3. 失败时减事件密度,而不是加更多杂图

案例 2:耳机产品图生视频(16 秒 · 9:16)

叙事:白台亮相 → 耳罩材质特写 → 佩戴定格留白。

参考:白底产品图 × 2、细节图 × 1。
Prompt 要点:外观锁定句 + 三镜时间线 + 「不生成包装小字」。
可选:加 5 秒环绕运镜参考视频,并写明「只学运镜」。

案例 3:雨夜情绪片(图 + 视频 + 音频)

图片:雨夜街道 mood × 1、角色 × 1
视频:缓慢跟拍参考
音频:潮湿环境底噪或低频 pad
文字:三镜钩子;短信/屏幕避免清晰小字

这是典型的 Seedance 多模态参考满配,但仍保持「身份看图、镜头看视频、故事看文字」。

迭代四步法(多模态专用)

  1. 文字-only 跑结构(10–12 秒):钩子是否可读
  2. 只加图片锁定外观(仍 12 秒):是否还像同一个人/同一产品
  3. 再加视频或音频之一:不要一次加满
  4. 延长至 16–20 秒:检查后半是否崩外观、崩运镜

若第 4 步失败:拆成两段生成再剪,或回到第 2 步减少参考数量。

常见误区(比「不会写 Prompt」更致命)

  1. 参考越多越好:超过职责所需就会互相打架
  2. 用视频参考锁人脸:应用图片锁身份,视频只借运镜
  3. 一张拼贴图塞多个角色:模型难以解析
  4. 要求画面内写出清晰 slogan/参数:易乱码,改后期字幕
  5. 第一次就上满 20 秒 + 全模态:先短后长、先图后音视频
  6. 中途更换参考图集:等于换演员/换货

常见翻车与修复

现象可能原因修复
换脸 / 产品走形图冲突或未写锁定句固定 1–3 张核心图 + 重复锁定句
有图仍不像图清晰度差/妆发不一致换同妆发正面图,去掉侧面杂图
运镜与参考无关未声明「运镜参照视频」Prompt 明确分工
双人串脸参考过多每人最多 1–2 张,文字区分角色名
音频抢戏导致口型飘台词过长缩到 1 句;音画意图对齐
加视频后身份漂视频里另一张脸被学习强调「外观以图片为准」或去掉视频

与纯文字工作流怎么选?

你的目标推荐路径
快速试想法 / 抽象氛围纯文字 → 再决定是否加 mood 图
可连载角色 / 可投放产品图生视频为主(配方 A/B)
要「像某条片」的镜头感图锁身份 + 视频锁运镜(配方 C)
节奏/口播驱动图 + 文 + 音频(配方 D)

对 SEO 与实际产能而言:「Seedance 图生视频」和「Seedance 多模态参考」往往是同一条生产线的两个搜索说法——本质都是用参考降低随机性。

SEO 与素材管理建议

  • 标题与封面点明「图生视频 / 多模态参考」,匹配高意图搜索
  • 正文自然覆盖 Seedance 2.5、图生视频、参考图、视频参考、音频参考
  • 为每个角色/SKU 建「参考包」文件夹(图集版本号),禁止随意替换
  • 通过质检的配方沉淀为内部模板,与 Prompt 模板库交叉复用

常见问题

Q:Seedance 2.5 图生视频必须上传图片吗?
A:不是必须。但角色连载、产品还原、品牌调性场景强烈建议上传;否则一致性成本会显著上升。

Q:最多能塞多少张图?
A:以「职责清晰」为准,通常角色 1–2、产品 2–3、场景 1–2 足够。宁少勿杂。

Q:视频参考会不会把参考片里的人物也学进来?
A:有可能。务必在 Prompt 写明外观以你的图片为准,或改用无主角的纯运镜片段。

Q:和 Seedance 2.0 多模态有何不同?
A:流程兼容;2.5 更长时长与更强跨镜头一致性,更适合「参考锁定后一口气讲完 16–20 秒钩子」。

Q:图生视频生成后还能再改运镜吗?
A:可保留同一图集,只改文字运镜或替换视频参考重跑;不要同时大改外观描述与参考图。

结语:让参考成为 Seedance 的「场记板」

多模态不是素材堆叠竞赛,而是给 Seedance 2.5 一张清楚的场记板:

  1. 图片钉死身份与产品
  2. 视频借来镜头语言
  3. 音频稳住节奏与气息
  4. 文字写出时间线与禁止项

建议今天就做一次对照实验:同一段三镜故事,先纯文字出一条,再加 2 张参考图出一条——当你明显感到「后一条才像可连载资产」时,你的 Seedance 图生视频生产线才算真正开工。