进阶技巧 2 分钟阅读 Seedance Team
多模态输入技巧:让 AI 听懂你的"导演意图"
掌握文字、图片、音频、视频四种模态的组合策略,精准传达创作意图。
多模态不是简单叠加
Seedance 2.0 的多模态输入并非「素材越多越好」,关键在于每种模态承担明确的分工。优秀的多模态 prompt 就像一份精简的分镜脚本。
四模态分工模型
| 模态 | 最佳用途 | 建议数量 |
|---|---|---|
| 文字 | 叙事逻辑、细节补充、情感基调 | 1 段精炼指令 |
| 图片 | 画面风格、角色外观、场景构图 | 3–5 张 |
| 视频 | 运镜方式、动作节奏、转场风格 | 1–2 段 |
| 音频 | 配乐风格、音效特征、语音节奏 | 1 段 |
场景一:品牌广告
目标:生成 15 秒产品展示视频
- 图片:产品高清图 3 张(正面、侧面、使用场景)
- 视频:参考品牌已有广告的运镜节奏
- 音频:参考品牌广告配乐
- 文字:「简约高端风格,产品从暗处缓缓亮起,360 度旋转展示,最后定格在 logo 上」
场景二:叙事短片
目标:生成有故事感的 12 秒短片
- 图片:角色设定图 2 张 + 场景概念图 2 张
- 视频:参考电影片段的运镜
- 文字:完整的场景描述,包含起承转合
场景三:音乐 MV 片段
目标:音画同步的舞蹈/表演片段
- 音频:目标歌曲片段(模型将理解节奏)
- 视频:参考舞蹈动作或表演风格
- 图片:舞台/场景视觉参考
- 文字:补充灯光和氛围描述
指令撰写的「导演思维」
- 先定基调:这段视频的情绪是什么?
- 再定结构:几个镜头?每个镜头多长时间?
- 然后定细节:每个镜头的具体内容
- 最后定风格:视觉风格和音频特征
调试技巧
如果生成结果偏离预期,按以下顺序排查:
- 检查模态之间是否存在矛盾
- 减少参考素材数量,逐一添加定位问题
- 将文字指令拆分为更具体的描述
- 利用视频编辑功能微调而非完全重新生成