進階技巧 2 分鐘閱讀 Seedance Team

多模態輸入技巧:讓 AI 聽懂你的「導演意圖」

掌握文字、圖片、音訊、影片四種模態的組合策略,精準傳達創作意圖。

多模態不是簡單疊加

Seedance 2.0 的多模態輸入並非「素材越多越好」,關鍵在於每種模態承擔明確的分工。優秀的多模態 prompt 就像一份精簡的分鏡腳本。

四模態分工模型

模態最佳用途建議數量
文字敘事邏輯、細節補充、情感基調1 段精煉指令
圖片畫面風格、角色外觀、場景構圖3–5 張
影片運鏡方式、動作節奏、轉場風格1–2 段
音訊配樂風格、音效特徵、語音節奏1 段

場景一:品牌廣告

目標:生成 15 秒產品展示影片

  • 圖片:產品高清圖 3 張(正面、側面、使用場景)
  • 影片:參考品牌已有廣告的運鏡節奏
  • 音訊:參考品牌廣告配樂
  • 文字:「簡約高端風格,產品從暗處緩緩亮起,360 度旋轉展示,最後定格在 logo 上」

場景二:敘事短片

目標:生成有故事感的 12 秒短片

  • 圖片:角色設定圖 2 張 + 場景概念圖 2 張
  • 影片:參考電影片段的運鏡
  • 文字:完整的場景描述,包含起承轉合

場景三:音樂 MV 片段

目標:音畫同步的舞蹈/表演片段

  • 音訊:目標歌曲片段(模型將理解節奏)
  • 影片:參考舞蹈動作或表演風格
  • 圖片:舞台/場景視覺參考
  • 文字:補充燈光和氛圍描述

指令撰寫的「導演思維」

  1. 先定基調:這段影片的情緒是什麼?
  2. 再定結構:幾個鏡頭?每個鏡頭多長時間?
  3. 然後定細節:每個鏡頭的具體內容
  4. 最後定風格:視覺風格和音訊特徵

調試技巧

如果生成結果偏離預期,按以下順序排查:

  1. 檢查模態之間是否存在矛盾
  2. 減少參考素材數量,逐一添加定位問題
  3. 將文字指令拆分為更具體的描述
  4. 利用影片編輯功能微調而非完全重新生成