进阶技巧 2 分钟阅读 Seedance Team

多模态输入技巧:让 AI 听懂你的"导演意图"

掌握文字、图片、音频、视频四种模态的组合策略,精准传达创作意图。

多模态不是简单叠加

Seedance 2.0 的多模态输入并非「素材越多越好」,关键在于每种模态承担明确的分工。优秀的多模态 prompt 就像一份精简的分镜脚本。

四模态分工模型

模态最佳用途建议数量
文字叙事逻辑、细节补充、情感基调1 段精炼指令
图片画面风格、角色外观、场景构图3–5 张
视频运镜方式、动作节奏、转场风格1–2 段
音频配乐风格、音效特征、语音节奏1 段

场景一:品牌广告

目标:生成 15 秒产品展示视频

  • 图片:产品高清图 3 张(正面、侧面、使用场景)
  • 视频:参考品牌已有广告的运镜节奏
  • 音频:参考品牌广告配乐
  • 文字:「简约高端风格,产品从暗处缓缓亮起,360 度旋转展示,最后定格在 logo 上」

场景二:叙事短片

目标:生成有故事感的 12 秒短片

  • 图片:角色设定图 2 张 + 场景概念图 2 张
  • 视频:参考电影片段的运镜
  • 文字:完整的场景描述,包含起承转合

场景三:音乐 MV 片段

目标:音画同步的舞蹈/表演片段

  • 音频:目标歌曲片段(模型将理解节奏)
  • 视频:参考舞蹈动作或表演风格
  • 图片:舞台/场景视觉参考
  • 文字:补充灯光和氛围描述

指令撰写的「导演思维」

  1. 先定基调:这段视频的情绪是什么?
  2. 再定结构:几个镜头?每个镜头多长时间?
  3. 然后定细节:每个镜头的具体内容
  4. 最后定风格:视觉风格和音频特征

调试技巧

如果生成结果偏离预期,按以下顺序排查:

  1. 检查模态之间是否存在矛盾
  2. 减少参考素材数量,逐一添加定位问题
  3. 将文字指令拆分为更具体的描述
  4. 利用视频编辑功能微调而非完全重新生成