监看屏前堆着人物大头照、全身照、场景图、运镜视频、音乐和品牌KV,生成师一句“都参考一下”就提交。结果人物穿着场景图里的衣服,摄影机继承了参考视频的人物,声音节奏又把动作拉乱。素材多没有解决问题,反而增加了争抢控制权的入口。
深圳TikTok视频拍摄要做的不是建立一个无边界素材池,而是建立参考绑定协议:每个素材有唯一ID、明确角色、优先级、允许继承项和禁止继承项。小编建议,一个素材尽量只负责一件事;职责越清楚,返工才越能归因。
一、先把参考分成六种角色

- Identity:人物面部、产品结构、身体比例。
- Wardrobe:服装、妆发、配饰与材质。
- Scene:空间布局、置景、时间与光线。
- Motion:摄影机轨迹或动作节奏。
- Style:色彩、颗粒、材质语言与美术方向。
- Audio:音色、台词、环境声与音乐拍点。
同一张全身照可以负责身体比例和服装,但不要同时让它决定场景。若必须复用,manifest要明确主角色和次角色。
二、用角色标签取代“图片1、图片2”
文件先命名为 CHAR_A_FACE、CHAR_A_WARDROBE、LOC_LOBBY_NIGHT、CAM_ORBIT_SLOW、SFX_DOOR_CLOSE。提示词再声明“人物A的面部只参考CHAR_A_FACE;服装只参考CHAR_A_WARDROBE;CAM_ORBIT_SLOW只提供运镜,不继承其中人物与场景”。标签稳定后,镜头顺序变化也不会改乱引用。
Google DeepMind Veo公开展示了场景、角色、物体参考与首尾帧等控制。生产层应该进一步把这些输入变成资产角色,而不是靠操作员临时记忆。
三、优先级只解决冲突,不替代QC
建议优先级为:产品或人物身份 > 功能动作 > 空间连续性 > 摄影机 > 光线材质 > 风格装饰。身份参考和风格参考冲突时,先保身份;运镜视频和场景图冲突时,运镜只继承运动。优先级写在镜头包里,避免不同生成师各自判断。
但高优先级不保证结果正确。人物脸稳了,手部动作仍可能穿模;产品结构正确,镜头轴线仍可能跳。每个角色仍需独立QC。
四、多人和多产品要拆组
四个角色、三件产品和复杂场景同时进入一个镜头,很容易出现身份交换和同款分身。先分别生成角色组与产品组,再用建立镜头交代空间,最后才做互动。对话场景可用单人过肩、反打和双人中景分开完成,不必强求一条长镜头。
每个人都用独立大头照和全身照,不使用多人九宫格作为身份参考。指代始终用稳定名称,不写“他”“另一个人”。
五、时间绑定决定声音能否真正控制画面
声音参考需要标记事件:第一个重拍进入产品近景,门锁声对应手部动作完成,音乐抽空对应品牌句出现。只给一首音乐而不写同步点,模型或剪辑只能猜节奏。动作参考同样要写起点、峰值和结束状态。
阿里云百炼提供多模态与生成式AI相关文档入口。无论具体模型接口怎样变化,资产角色、时间点和输出验收应留在项目自己的manifest里,避免工作流被单一工具绑死。
六、参考绑定manifest模板
| 字段 | 例子 |
|---|---|
| asset_id | CHAR_A_FACE_V03 |
| role | identity |
| priority | 1 |
| inherit | 面部、发型、年龄 |
| exclude | 服装、背景、光线 |
| shots | S02,S03,S05 |
| sha256 | 文件校验值 |
完成manifest后先用一支建立镜头和一支动作镜头做压力测试,再扩展整场。需要采集身份、场景、运镜和声音参考,可查看 短视频制作解决方案。