深入解析 Seedance 2.5 的参考系统:图像、视频与音频参考究竟如何运作
Seedance 2.5 的参考系统是它最强大、也最少被理解的功能之一。大多数人要么完全忽略参考,要么把文件一股脑丢进去碰运气。EvoLink 的开放指南中的社区案例展示了第三种做法:把参考当作一支精心组建的团队,每个文件都有自己的职责。重点不在于用满所有槽位——而在于给模型它真正需要的锚点,不多不少。
先说明一点:Seedance 2.5 官方 API 已上线。下文 R2V 上限为 30 张图、10 个视频和 10 个音频;请选择对应 workflow ID,并从短时测试开始。这是一份独立指南,我们与字节跳动没有隶属关系。
真正的参考额度
参考按类型划分,每种类型都有各自的单次请求上限:
| 类型 | 请求字段 | 单次请求上限 |
|---|---|---|
| 图像 | image_urls | 最多 30 张 |
| 视频 | video_urls | 最多 10 个 |
| 音频 | audio_urls | 最多 10 个 |
这是彼此独立的额度,而不是共用一个总池——消耗图像槽位并不会减少你能附加的视频或音频参考数量。实际上,大多数镜头用到的数量远低于上限;这些余量的存在,是为了让多角色、多约束的创作不再是一种妥协。
参考如何进入提示词
参考并不是一条旁路——它们在行内被引用。提示词会在某个文件的内容应当发挥作用的位置,精确地写下类似 «image_1_1» 的标记:
”……镜头平稳地跟随一位身穿黑色大衣的男子(参考 «image_1_1»)……”
这是关键的思维转变:你不去描述大衣、面孔、场景——你指向它们。文字承载方向,文件承载名词。提示词变得更短,输出同时变得更一致。视频和音频参考的运作方式相同,使用相对应的 «video_x_y» 和 «audio_x_y» 标记。
如何分配每种额度
在各类多参考案例中,分配遵循一套清晰的经济学。按类型来思考:
| 职责 | 类型 | 典型数量 | 锁定什么 |
|---|---|---|---|
| 角色身份 | 图像 | 每个角色 2–3 | 整段镜头中的面孔、服装、身形比例 |
| 场景与布景 | 图像 | 2–4 | 环境、建筑、陈设 |
| 色调与调色 | 图像 | 1–2 | 色彩世界、光影氛围 |
| 镜头语法 | 视频 | 1–2 段片段 | 运镜本身——一段短片胜过一整段文字 |
| 节奏 | 音频 | 1 个文件 | 节奏感、节拍结构、剪辑时机 |
双角色场景中的身份素材很快就会变得复杂,因此每个素材都需要角色、subject ID、版本和使用理由。三种类型的额度彼此独立,这一点已由 R2V workflow 的正式文档确认。
让它保持可调试的工作流
最浪费时间的错误,就是一次性加载所有参考。当一次多文件生成出问题时,每个文件都是嫌疑对象。分层的顺序能让失败保持可诊断,这也和我们为本站生成内容时的经验相符:
- 先做纯提示词草稿,采用 active route 文档允许的最低风险设置,直到构图和运动达到预期
- 加入图像身份参考,确认角色保持一致
- 加入运镜视频片段,确认运镜得以转移
- 最后加入音频——节奏是收尾层,而不是地基
每次运行只加一层,意味着每个失败都只有一个嫌疑对象。先用 4–30 秒、480p/720p 中的低风险设置跑通镜头,再加入参考;音频与选项价格以服务商控制台为准。
参考质量准则
从输入与输出的对比中总结:
- 多个角度可能胜过单张主图。 从少量已授权的身份素材开始;只有 live route 允许且新增素材确实改善验收结果时再扩展。
- 干净的参考带来干净的转移。 一段自身画面繁杂的运镜片段会泄漏内容,而不只是运动;最好的参考片段往往格外朴素。
- 不要重新描述你所引用的东西。 文件与关于该文件的文字之间的矛盾会以不可预测的方式被解决——引用标记,然后闭嘴。
亲自体验这套经济学
先阅读提示词库中每个标记是如何放置的,然后重建一个属于你自己的双角色版本镜头:比如 6 个图像槽位用于身份、3 个用于场景、1 个用于色调,再加 1 段运镜视频片段和 1 条音频音轨。这远在每种额度之内,三种类型都留有充足余量。在试玩场中搭建好,在正式生成前先预览;如果你是通过代码来驱动,参考字段(image_urls、video_urls、audio_urls)接受纯 URL——请查看 API 指南了解请求结构和三个正式 workflow ID。