서론: Seedance 2.5에서 「Prompt만 잘 쓰면 된다」가 왜 부족한가?
「Seedance 이미지-투-비디오」「AI 멀티모달 참조」「Seedance 참조 이미지」「Seedance 비디오 참조」를 검색하는 크리에이터는 보통 스토리보드 텍스트는 쓸 줄 알지만, 세 가지에 막힙니다:
- 캐릭터/제품이 매번 흔들림: 텍스트를 아무리 세밀하게 써도 외형이 불안정
- 운镜을 따라하기 어려움: 「어떤 광고처럼 푸시」를 원해도 글로 표현하기 힘듦
- 참조가 많을수록 붕괴: 이미지·비디오·오디오를 다 넣으면 모델이 「누가 우선인지」 혼란
Seedance 2.5는 텍스트 + 이미지 + 비디오 + 오디오 멀티모달 입력을 지원하고, 단일 클립 길이를 약 20초까지 늘리며 샷 간 일관성을 강화합니다. 본문은 멀티모달 개념 입문이 아니라 실행 가능한 Seedance 이미지-투-비디오·참조 조합 매뉴얼입니다: 언제 어떤 참조를 쓸지, 비율, 반복, 트러블슈팅.
《스토리보드 Prompt 템플릿 라이브러리》가 텍스트 구조에 초점을 둔 것과 달리, 본문은 참조 소재로 화면을 잠그는 방법에 집중합니다. 2.0 튜토리얼 《멀티모달 입력 팁》과 비교하면 2026 Seedance 2.5의 더 긴 길이와 더 강한 일관성을 위한 실전 레시피입니다.
먼저 역할 분담: 네 가지 모달이 각각 무엇을 담당하나?
| 모달 | 최적 역할 | 기대하면 안 되는 것 |
|---|---|---|
| 텍스트 Prompt | 서사, 타임라인, 운镜 용어, 금지항 | 특정 얼굴/포장 디테일 정확 복제 |
| 이미지 참조 | 캐릭터 외형, 제품 형태, 장면 mood, 구도 스타일 | 연속 동작과 렌즈 속도 전달 |
| 비디오 참조 | 운镜 궤적, 동작 리듬, 전환 분위기 | 그 안의 캐릭터 정체성 복사 (이미지로 잠금) |
| 오디오 참조 | BGM 리듬, 환경 노이즈, 내레이션 톤 | 명확한 대사 스크립트 대체 (대사는 Prompt에) |
한 줄 원칙: 텍스트는 「이야기와 지시」, 이미지는 「어떻게 생겼는지」, 비디오는 「렌즈가 어떻게 움직이는지」, 오디오는 「어떻게 들리는지」. 역할이 겹치면 모델이 더 혼란스러워집니다.
이미지-투-비디오 vs 순수 텍스트: 언제 참조 이미지가 필수인가?
| 시나리오 | 순수 텍스트 | 이미지 참조 권장 | 이유 |
|---|---|---|---|
| 분위기 컨셉 / 감정 필름 | ✅ 먼저 시도 | mood 이미지 선택 | 텍스트로 분위기 표현 가능 |
| 고정 캐릭터 연재 / IP | ❌ 불안정 | ✅ 필수 | 외형 연속성 우선 |
| 이커머스 제품 / 포장 복원 | ❌ 형태 흔들림 | ✅ 필수 | 형태, 색, logo 영역 |
| 브랜드 톤 통일 | ⚪ | ✅ 권장 | 메인 컬러와 재질 언어 |
| 복잡한 2인극 | ⚪ | ✅ 각 1–2장 | 얼굴 섞임 감소 |
| 일회성 추상 이펙트 | ✅ | 보통 불필요 | 참조가 오히려 발산 제한 |
Seedance 이미지-투-비디오의 핵심 가치는 「정적 이미지를 움직이게」가 아니라 이미지로 정체성과 제품을 고정하고, 텍스트/비디오로 감독 의도를 명확히 하는 것입니다.
참조 소재 준비 체크리스트 (착수 전)
1. 이미지 참조 (가장 흔함)
| 유형 | 수량 권장 | 요구사항 |
|---|---|---|
| 캐릭터 정면 반신 | 1–2장 | 동일 헤어, 의상, 나이감 |
| 제품 화이트 / 메인 비주얼 | 2–3장 | 동색·동비율, 경쟁 제품 금지 |
| 장면 mood | 1–2장 | 시간·조명 키워드 고정 |
| 스타일 참조 (선택) | 0–1장 | 조명/그레이딩만; 제2 주인공 혼입 금지 |
철칙:
- 한 장은 하나의 역할만 (정면 / 디테일 / 장면 분리)
- 동일 캐릭터·동일 SKU 참조 세트는 전 campaign 불변
- 콜라주, 워터마크 대문, 여러 인물 한 장 혼합 금지
2. 비디오 참조 (선택, 강력)
- 길이: 3–8초 선명 운镜 클립이면 충분
- 용도: 푸시, 서클, 팔로우 리듬—렌즈만 배우고, 얼굴 바꾸기는 안 함
- Prompt에 명시: 「운镜은 참조 비디오; 캐릭터 외형은 이미지 엄격 준수」
3. 오디오 참조 (선택)
- 리듬 광고, MV 느낌 숏, 환경 분위기에 사용
- 대사 있을 때: 오디오는 톤, 대사 본문은 짧은 문장으로 Prompt에
Seedance 2.5 멀티모달 조합 레시피 (바로 적용)
레시피 A: 캐릭터 숏 (이미지 + 텍스트)
- 이미지: 캐릭터 설정 × 2
- 텍스트: 3샷 타임라인 (구축 → 갈등 → 정지)
- 비디오/오디오: 우선 추가 안 함
적합: 숏드라마 훅, 인물 테스트, 정체성 앵커 클립.
레시피 B: 제품 쇼케이스 (이미지 + 텍스트, 비디오 선택)
- 이미지: 제품 × 2–3 + 장면 × 1 (선택)
- 텍스트: 등장 → 셀링 포인트 클로즈업 → CTA 여백
- 비디오: 브랜드 기존 광고 운镜 1개 (선택)
적합: 이커머스 메인 비디오, 피드 제품 필름.
레시피 C: 감독급 광고 (이미지 + 비디오 + 텍스트, 오디오 선택)
- 이미지: 제품/캐릭터 잠금
- 비디오: 운镜 분위기
- 오디오: BGM 리듬
- 텍스트: 스토리보드 + 금지항 + 「외형은 이미지 기준」
적합: 브랜드 숏 TVC, 제안 컨셉 샘플.
레시피 D: 토크/퍼포먼스 (이미지 + 텍스트 + 오디오)
- 이미지: 출연자 설정
- 오디오: 톤 또는 박자
- 텍스트: 짧은 대사 + 샷 크기; 긴 독백 피하기
적합: 다국어 토크 전 단일 언어 마스터 (이후 언어 확장).
권장 Prompt 골격 (이미지-투-비디오 전용)
【작업】세로/가로 숏, 영화적 그레이딩, 길이 약 16–20초.
【외형 잠금】주체 외형은 참조 이미지 엄격 준수: 얼굴 교체, 헤어 변경, 포장 비율·메인 컬러 변경 금지.
【운镜】[비디오 참조 있으면] 렌즈 움직임은 참조 비디오 푸시/서클 리듬; [없으면] 푸시/팔로우/고정 기재.
【샷 1 | 0–5s】구축: [장면], [주체 입화].
【샷 2 | 5–13s】전개: [동작/이익점], 중경 또는 클로즈업.
【샷 3 | 13–20s】마무리: [표정/제품 정지], 깨끗한 여백; 읽을 수 있는 작은 글자 생성 금지.
【오디오】[분위기 또는 「오디오 리듬 참조」]; 대사 1–2짧은 문장 이내.
【금지】배경 깨진 글자, 엑스트라 난입, 중간 의상/제품 교체.
핵심 문장을 거의 매번 유지: 「외형은 참조 이미지를 엄격히 따름」. Seedance 멀티모달 참조에서 가장 저렴하고 효과적인 일관성 스위치입니다.
세 가지 완전 사례
사례 1: 캐릭터 IP 앵커 (12초 → 18초)
목표: 「같은 사람」 확인 후 서사 추가.
- 캐릭터 이미지 × 2 + 텍스트만: 「중근경, 느린 푸시, 중립 표정, 깨끗한 배경」
- 통과 후 3샷 스토리 추가, 동일 이미지 세트 유지
- 실패 시 이벤트 밀도 줄이기, 잡이미지 추가 금지
사례 2: 이어폰 제품 이미지-투-비디오 (16초 · 9:16)
서사: 화이트 테이블 등장 → 이어패드 재질 클로즈업 → 착용 정지 여백.
참조: 화이트 제품 × 2, 디테일 × 1. Prompt 요점: 외형 잠금 문장 + 3샷 타임라인 + 「포장 작은 글자 생성 금지」. 선택: 5초 서클 운镜 참조 추가, 「운镜만 배움」 명시.
사례 3: 비 내리는 밤 감정 필름 (이미지 + 비디오 + 오디오)
이미지: 비 내리는 거리 mood × 1, 캐릭터 × 1 비디오: 느린 팔로우 참조 오디오: 습한 환경 노이즈 또는 저주파 pad 텍스트: 3샷 훅; 문자/화면 선명 작은 글 피하기
전형적인 Seedance 멀티모달 참조 풀세트이지만 「정체성=이미지, 렌즈=비디오, 이야기=텍스트」를 유지합니다.
반복 4단계 (멀티모달 전용)
- 텍스트-only로 구조 (10–12초): 훅 가독성
- 이미지만 추가해 외형 잠금 (여전히 12초): 같은 사람/제품인지
- 비디오 또는 오디오 하나만 추가: 한 번에 다 넣지 않기
- 16–20초로 연장: 후반 외형·운镜 붕괴 확인
4단계 실패: 두 구간 생성 후 편집, 또는 2단계로 돌아가 참조 수 줄이기.
흔한 오해 (「Prompt 못 쓴다」보다 치명적)
- 참조가 많을수록 좋다: 필요 이상이면 서로 충돌
- 비디오 참조로 얼굴 잠금: 이미지로 정체성, 비디오는 운镜만
- 한 콜라주에 여러 캐릭터: 모델 파싱 어려움
- 화면에 선명 slogan/파라미터 요구: 깨진 글자, 후반 자막으로
- 첫 시도에 20초 + 전 모달: 짧게 → 길게, 이미지 → 오디오비디오
- 중간에 참조 세트 교체: 배우/제품을 바꾼 것과 같음
흔한 실패와 수정
| 현상 | 가능 원인 | 수정 |
|---|---|---|
| 얼굴 교체 / 제품 형태 흔들림 | 이미지 충돌 또는 잠금 문장 누락 | 핵심 1–3장 고정 + 잠금 문장 반복 |
| 이미지 있는데도 다름 | 해상도 낮음/메이크업·헤어 불일치 | 동일 메이크업 정면으로 교체, 측면 잡이미지 제거 |
| 운镜이 참조와 무관 | 「운镜 참조 비디오」 미선언 | Prompt에 역할 분담 명시 |
| 2인 얼굴 섞임 | 참조 과다 | 각 1–2장, 텍스트로 캐릭터명 구분 |
| 오디오가 입모양 흔들림 | 대사 과다 | 1문장으로; 음화 의도 정렬 |
| 비디오 추가 후 정체성 drift | 비디오 속 다른 얼굴 학습 | 「외형은 이미지 기준」 강조 또는 비디오 제거 |
순수 텍스트 워크플로와 어떻게 선택?
| 목표 | 권장 경로 |
|---|---|
| 빠른 아이디어 / 추상 분위기 | 순수 텍스트 → mood 이미지 여부 결정 |
| 연재 캐릭터 / 투입 제품 | 이미지-투-비디오 중심 (레시피 A/B) |
| 「어떤 필름 같은」 렌즈감 | 이미지 잠금 + 비디오 운镜 (레시피 C) |
| 리듬/토크 주도 | 이미지 + 텍스트 + 오디오 (레시피 D) |
SEO와 실제 생산 관점에서 「Seedance 이미지-투-비디오」와 「Seedance 멀티모달 참조」는 같은 생산 라인의 두 검색 표현—본질은 참조로 랜덤성을 줄이는 것입니다.
SEO 및 소재 관리 권장
- 제목·썸네일에 「이미지-투-비디오 / 멀티모달 참조」로 고의도 검색 매칭
- 본문에 Seedance 2.5, 이미지-투-비디오, 참조 이미지, 비디오 참조, 오디오 참조 자연 포함
- 캐릭터/SKU별 「참조 패키지」 폴더 (이미지 세트 버전), 임의 교체 금지
- QC 통과 레시피를 내부 템플릿으로, Prompt 템플릿 라이브러리와 교차 재사용
자주 묻는 질문
Q: Seedance 2.5 이미지-투-비디오는 반드시 이미지를 올려야 하나요? A: 필수는 아닙니다. 캐릭터 연재, 제품 복원, 브랜드 톤에는 강력 권장; 없으면 일관성 비용이 크게 증가합니다.
Q: 이미지는 최대 몇 장? A: 「역할 명확」 기준, 보통 캐릭터 1–2, 제품 2–3, 장면 1–2면 충분. 적고 깔끔하게.
Q: 비디오 참조가 참조 영상 인물까지 학습하나요? A: 가능합니다. Prompt에 외형은 내 이미지 기준을 명시하거나, 주인공 없는 순수 운镜 클립 사용.
Q: Seedance 2.0 멀티모달과 차이? A: 프로세스 호환; 2.5는 더 긴 길이와 더 강한 샷 간 일관성, 「참조 잠금 후 16–20초 훅을 한 번에」에 적합.
Q: 생성 후 운镜만 바꿀 수 있나요? A: 동일 이미지 세트 유지, 텍스트 운镜 또는 비디오 참조만 교체해 재생성; 외형 설명과 참조를 동시에 대폭 변경하지 마세요.
맺음말: 참조를 Seedance의 「스크립트 보드」로
멀티모달은 소재 쌓기 경쟁이 아니라 Seedance 2.5에 명확한 스크립트 보드를 주는 것:
- 이미지로 정체성·제품 고정
- 비디오로 렌즈 언어 차용
- 오디오로 리듬·호흡 안정
- 텍스트로 타임라인·금지항 작성
오늘 대조 실험: 같은 3샷 스토리를 순수 텍스트 1개, 참조 2장 1개—「후자만 연재 가능한 자산」이라 느껴지면 Seedance 이미지-투-비디오 생산 라인이 본격 가동된 것입니다.