Seedance 2.5의 reference 시스템 심층 해부: 이미지·비디오·오디오 레퍼런스는 실제로 어떻게 작동하는가
Seedance 2.5의 reference 시스템은 가장 강력하면서도 가장 이해받지 못하는 기능 중 하나입니다. 대부분의 사람들은 레퍼런스를 완전히 무시하거나, 파일을 한꺼번에 던져 넣고 운에 맡깁니다. EvoLink의 오픈 가이드에 실린 커뮤니티 사례들은 세 번째 길을 보여줍니다. 레퍼런스를 각 파일마다 역할이 있는, 의도적으로 꾸린 팀으로 다루는 것입니다. 핵심은 슬롯을 다 채우는 것이 아니라, 모델에게 꼭 필요한 앵커를 정확히 필요한 만큼만 제공하는 데 있습니다.
Seedance 2.5는 EvoLink에 출시되었습니다. 아래 R2V 한도는 이미지 30개, 영상 10개, 오디오 10개입니다. workflow별 model ID를 선택하고 짧은 테스트부터 시작하세요. 이 글은 독립적인 가이드이며 ByteDance와 제휴 관계가 없습니다.
진짜 레퍼런스 예산
다음은 EvoLink R2V(seedance-2.5-reference-to-video)에 문서화된 field와 한도입니다:
| 타입 | 요청 필드 | 요청당 최대치 |
|---|---|---|
| 이미지 | image_urls | 30 |
| 비디오 | video_urls | 10 |
| 오디오 | audio_urls | 10 |
한도를 채우는 것이 목표가 아닙니다. 실제 운영은 소수의 role-based asset으로 시작하고, 현재 한도는 live provider documentation과 대조하십시오.
레퍼런스는 어떻게 prompt에 들어가는가
레퍼런스는 별도의 사이드 채널이 아니라 인라인으로 인용됩니다. prompt는 해당 파일의 내용이 작용해야 할 바로 그 위치에 «image_1_1» 같은 마커를 써 넣습니다:
”……카메라가 검은 코트를 입은 남자(«image_1_1» 참조)를 안정적으로 따라간다……”
이것이 결정적인 사고의 전환입니다. 코트도, 얼굴도, 장소도 묘사하지 않습니다. 그것들을 가리키는 것입니다. 말은 방향을 싣고, 파일은 명사를 싣습니다. prompt는 짧아지고 출력의 일관성은 동시에 높아집니다. 비디오와 오디오 레퍼런스도 같은 방식으로 작동하며, 대응하는 «video_x_y»와 «audio_x_y» 마커를 사용합니다.
각 예산을 어떻게 쓸 것인가
여러 다중 레퍼런스 사례를 보면 배분에는 뚜렷한 경제학이 있습니다. 타입별로 생각해 봅시다:
| 역할 | 타입 | 일반적인 개수 | 무엇을 고정하는가 |
|---|---|---|---|
| 캐릭터 아이덴티티 | 이미지 | 캐릭터당 2–3 | 테이크 전체에 걸친 얼굴, 의상, 신체 비율 |
| 장소와 세트 | 이미지 | 2–4 | 환경, 건축, 세트 장식 |
| 팔레트와 그레이딩 | 이미지 | 1–2 | 색채 세계, 조명 분위기 |
| 카메라 문법 | 비디오 | 1–2개 클립 | 움직임 그 자체 — 짧은 클립 하나가 긴 문단을 이깁니다 |
| 리듬 | 오디오 | 1개 파일 | 페이스, 비트 구조, 컷 타이밍 |
두 캐릭터 장면은 빠르게 복잡해집니다. 각 asset에 role, subject ID, version, 사용 이유를 기록하십시오. image, video, audio는 각각 독립된 한도(30/10/10)를 가지지만, 한도까지 채우기보다 asset마다 역할이 설명되는 구성을 유지하십시오.
디버깅 가능하게 유지하는 워크플로
시간을 태우는 실수는 모든 레퍼런스를 한꺼번에 로드하는 것입니다. 여러 파일을 쓴 생성이 잘못되면 모든 파일이 용의자가 됩니다. 층을 쌓아 가는 순서를 지키면 실패는 진단 가능한 상태로 남으며, 이는 저희가 이 사이트를 위해 콘텐츠를 생성하며 얻은 경험과도 일치합니다:
- 먼저 prompt만으로 드래프트를 active route documentation이 허용하는 lowest-risk setting으로 돌려 구도와 움직임을 다듬습니다
- 이미지 아이덴티티 레퍼런스를 추가하고 캐릭터가 유지되는지 확인합니다
- 카메라 무브 비디오 클립을 추가하고 움직임이 전이되는지 확인합니다
- 오디오는 마지막에 추가합니다 — 리듬은 마무리 층이지 기초가 아닙니다
한 번에 한 layer만 추가하면 failure 원인을 좁힐 수 있습니다. low-risk setting — 짧은 길이(출시 범위 4~30초)와 480p tier — 부터 시작하고, audio billing 영향은 콘솔 가격으로 확인하십시오.
레퍼런스 품질 규칙
입력과 출력을 비교하며 얻은 결론입니다:
- 여러 각도가 유효할 수 있습니다. 권리가 확인된 소수의 asset으로 시작하고 live route가 허용하며 acceptance가 개선될 때만 추가하십시오.
- 깨끗한 레퍼런스가 깨끗하게 전이됩니다. 피사체가 어수선한 카메라 무브 클립은 움직임만이 아니라 내용까지 흘려보냅니다. 최고의 레퍼런스 클립은 눈에 띄게 담백합니다.
- 참조한 것을 다시 묘사하지 마십시오. 파일과 그 파일에 대한 서술 사이의 모순은 예측 불가능한 방식으로 해소됩니다. 마커를 인용했으면 거기서 멈추십시오.
이 경제학을 직접 시험해 보기
먼저 프롬프트 라이브러리에서 마커를 확인하고 두 캐릭터 버전을 구성하세요. 예를 들어 identity 이미지 6개, 장소 3개, palette 1개, camera video 1개, audio 1개를 사용합니다. 플레이그라운드에서 준비하고 코드에서는 image_urls, video_urls, audio_urls와 seedance-2.5-reference-to-video를 사용하세요. 자세한 내용은 API 가이드를 참고하십시오.