监看屏前堆着人物大头照、全身照、场景图、运镜视频、音乐和品牌KV,生成师一句“都参考一下”就提交。结果人物穿着场景图里的衣服,摄影机继承了参考视频的人物,声音节奏又把动作拉乱。素材多没有解决问题,反而增加了争抢控制权的入口。

深圳TikTok视频拍摄要做的不是建立一个无边界素材池,而是建立参考绑定协议:每个素材有唯一ID、明确角色、优先级、允许继承项和禁止继承项。小编建议,一个素材尽量只负责一件事;职责越清楚,返工才越能归因。

一、先把参考分成六种角色

深圳TikTok视频拍摄如何绑定多模态参考:AIGC角色与镜头教程原创教程封面
深圳TikTok视频拍摄如何绑定多模态参考:AIGC角色与镜头教程:用可见的制作证据控制AIGC生成与验收。
  • Identity:人物面部、产品结构、身体比例。
  • Wardrobe:服装、妆发、配饰与材质。
  • Scene:空间布局、置景、时间与光线。
  • Motion:摄影机轨迹或动作节奏。
  • Style:色彩、颗粒、材质语言与美术方向。
  • Audio:音色、台词、环境声与音乐拍点。

同一张全身照可以负责身体比例和服装,但不要同时让它决定场景。若必须复用,manifest要明确主角色和次角色。

二、用角色标签取代“图片1、图片2”

文件先命名为 CHAR_A_FACE、CHAR_A_WARDROBE、LOC_LOBBY_NIGHT、CAM_ORBIT_SLOW、SFX_DOOR_CLOSE。提示词再声明“人物A的面部只参考CHAR_A_FACE;服装只参考CHAR_A_WARDROBE;CAM_ORBIT_SLOW只提供运镜,不继承其中人物与场景”。标签稳定后,镜头顺序变化也不会改乱引用。

Google DeepMind Veo公开展示了场景、角色、物体参考与首尾帧等控制。生产层应该进一步把这些输入变成资产角色,而不是靠操作员临时记忆。

三、优先级只解决冲突,不替代QC

建议优先级为:产品或人物身份 > 功能动作 > 空间连续性 > 摄影机 > 光线材质 > 风格装饰。身份参考和风格参考冲突时,先保身份;运镜视频和场景图冲突时,运镜只继承运动。优先级写在镜头包里,避免不同生成师各自判断。

但高优先级不保证结果正确。人物脸稳了,手部动作仍可能穿模;产品结构正确,镜头轴线仍可能跳。每个角色仍需独立QC。

四、多人和多产品要拆组

四个角色、三件产品和复杂场景同时进入一个镜头,很容易出现身份交换和同款分身。先分别生成角色组与产品组,再用建立镜头交代空间,最后才做互动。对话场景可用单人过肩、反打和双人中景分开完成,不必强求一条长镜头。

每个人都用独立大头照和全身照,不使用多人九宫格作为身份参考。指代始终用稳定名称,不写“他”“另一个人”。

五、时间绑定决定声音能否真正控制画面

声音参考需要标记事件:第一个重拍进入产品近景,门锁声对应手部动作完成,音乐抽空对应品牌句出现。只给一首音乐而不写同步点,模型或剪辑只能猜节奏。动作参考同样要写起点、峰值和结束状态。

阿里云百炼提供多模态与生成式AI相关文档入口。无论具体模型接口怎样变化,资产角色、时间点和输出验收应留在项目自己的manifest里,避免工作流被单一工具绑死。

六、参考绑定manifest模板

字段例子
asset_idCHAR_A_FACE_V03
roleidentity
priority1
inherit面部、发型、年龄
exclude服装、背景、光线
shotsS02,S03,S05
sha256文件校验值

完成manifest后先用一支建立镜头和一支动作镜头做压力测试,再扩展整场。需要采集身份、场景、运镜和声音参考,可查看 短视频制作解决方案

获取多模态参考绑定模板