고급 팁 1분 읽기 Seedance Team

멀티모달 입력 팁: AI가 당신의 "감독 의도"를 이해하게 하기

텍스트, 이미지, 오디오, 영상 조합 전략을 익혀 창작 의도를 정확히 전달하세요.

멀티모달은 단순 쌓기가 아닙니다

Seedance 2.0 멀티모달 입력은 «소스가 많을수록 좋다»가 아닙니다. 각 모달리티에 명확한 역할이 핵심입니다. 좋은 multimodal prompt는 간결한 스토리보드와 같습니다.

4모달리티 분담 모델

모달리티최적 용도권장 수량
텍스트서사, 디테일, 감정 톤1개의 간결한 지시
이미지비주얼 스타일, 외형, 구도3–5장
영상카메라, 동작 리듬, 전환1–2개
오디오음악 스타일, 사운드, 발화 리듬1개

시나리오 1: 브랜드 광고

목표: 15초 제품 쇼케이스 영상

  • 이미지: HD 제품 사진 3장(정면, 측면, 사용 장면)
  • 영상: 기존 브랜드 광고 카메라 pacing
  • 오디오: 브랜드 광고 BGM 참조
  • 텍스트: «미니멀 premium — 어둠에서 제품이 천천히 켜짐, 360° 회전, logo에서 hold»

시나리오 2: 서사 단편

목표: 스토리감 있는 12초 클립

  • 이미지: 캐릭터 설정 2장 + 씬 컨셉 2장
  • 영상: 영화 클립 카메라 참조
  • 텍스트: 기승전결을 포함한 완전한 장면 설명

시나리오 3: 뮤직 MV 구간

목표: 댄스/퍼포먼스 AV 동기화

  • 오디오: 대상 곡 구간(모델이 리듬 이해)
  • 영상: 안무 또는 퍼포먼스 스타일 참조
  • 이미지: 무대/씬 비주얼 참조
  • 텍스트: 조명과 분위기 보충

프롬프트 작성의 «감독 사고»

  1. 먼저 감정 톤을 정한다: 이 영상의 감정은 무엇인가?
  2. 구조를 정한다: 몇 개의 샷? 각 샷의 길이는?
  3. 디테일을 정한다: 각 샷의 구체적 내용
  4. 스타일을 정한다: 비주얼 스타일과 오디오 특성

디버깅 팁

결과가 기대와 다르면 다음 순서로 확인:

  1. 모달리티 간 모순이 있는지 확인
  2. 참조 소스 수를 줄이고 하나씩 추가하며 문제 지점 파악
  3. 텍스트 지시를 더 구체적인 설명으로 분할
  4. 전면 재생성보다 영상 편집 기능으로 미세 조정