進階技巧 2 分鐘閱讀 Seedance Team
多模態輸入技巧:讓 AI 聽懂你的「導演意圖」
掌握文字、圖片、音訊、影片四種模態的組合策略,精準傳達創作意圖。
多模態不是簡單疊加
Seedance 2.0 的多模態輸入並非「素材越多越好」,關鍵在於每種模態承擔明確的分工。優秀的多模態 prompt 就像一份精簡的分鏡腳本。
四模態分工模型
| 模態 | 最佳用途 | 建議數量 |
|---|---|---|
| 文字 | 敘事邏輯、細節補充、情感基調 | 1 段精煉指令 |
| 圖片 | 畫面風格、角色外觀、場景構圖 | 3–5 張 |
| 影片 | 運鏡方式、動作節奏、轉場風格 | 1–2 段 |
| 音訊 | 配樂風格、音效特徵、語音節奏 | 1 段 |
場景一:品牌廣告
目標:生成 15 秒產品展示影片
- 圖片:產品高清圖 3 張(正面、側面、使用場景)
- 影片:參考品牌已有廣告的運鏡節奏
- 音訊:參考品牌廣告配樂
- 文字:「簡約高端風格,產品從暗處緩緩亮起,360 度旋轉展示,最後定格在 logo 上」
場景二:敘事短片
目標:生成有故事感的 12 秒短片
- 圖片:角色設定圖 2 張 + 場景概念圖 2 張
- 影片:參考電影片段的運鏡
- 文字:完整的場景描述,包含起承轉合
場景三:音樂 MV 片段
目標:音畫同步的舞蹈/表演片段
- 音訊:目標歌曲片段(模型將理解節奏)
- 影片:參考舞蹈動作或表演風格
- 圖片:舞台/場景視覺參考
- 文字:補充燈光和氛圍描述
指令撰寫的「導演思維」
- 先定基調:這段影片的情緒是什麼?
- 再定結構:幾個鏡頭?每個鏡頭多長時間?
- 然後定細節:每個鏡頭的具體內容
- 最後定風格:視覺風格和音訊特徵
調試技巧
如果生成結果偏離預期,按以下順序排查:
- 檢查模態之間是否存在矛盾
- 減少參考素材數量,逐一添加定位問題
- 將文字指令拆分為更具體的描述
- 利用影片編輯功能微調而非完全重新生成