截至 2026 年 8 月,我们重新核对了 YouTube 关于生成式内容披露与人物形象申诉的两份帮助文档、TikTok 的 AI 生成内容说明,以及 Meta 关于逼真合成影像与拟真音频披露的公开页面。三家平台的具体工具和呈现方式并不相同,但都把注意力放到了同一件事:当声音或画面足够像真实人物,发布者需要清楚判断内容怎样制作、人物是否被允许使用,以及观众会不会误解。
这组公开资料观察也改变了深圳AIGC广告片多语言数字人制作公司的审片顺序。多语言数字人不能只在最后检查嘴唇有没有跟上配音;译文、声音、口型、眼神、人物授权和平台版本需要从一条代表句开始共同确认。本文只讨论品牌广告与商业视频的制作判断,不把平台披露等同于法律意见,也不承诺一种流程适用于所有人物、语言和投放账户。
样本与范围:三份公开说明分别在谈什么
YouTube 的生成式内容披露说明要求创作者对看起来真实、且经 AI 明显生成或修改的内容作出披露,并区分了明显虚构、轻微编辑与可能使观众误解的现实感内容。其人物形象申诉说明进一步指出,即使视频已经标注为合成内容,也不等于获得使用他人脸部或声音的许可。
TikTok 的AI 生成内容说明介绍创作者标签和自动标签;Meta 的虚假信息政策页面说明,发布逼真的合成视频或拟真音频时可能需要使用 AI 披露工具。平台做法会继续更新,品牌发布前仍要按当时的内容、地区、账户与后台提示复核。
这些页面没有替品牌决定台词怎么翻译,也不会替后期判断一处口型是否自然。它们提供的是发布语境:越接近真实人物的画面和声音,制作资料、使用许可与版本记录越不能在交付时临时补。我们据此把研究范围收窄到一个高频采购问题——一支广告要做中英日三版,能不能直接用同一段脸部表演替换三份声音。
主要发现:真实感由嘴形、重音、眼神和动作共同完成
先看嘴形。中文与英文里的双唇音会让嘴唇在明确时刻闭合,f、v 一类发音会让下唇与上齿发生关系,th 等发音还可能出现更细的舌位变化。生成结果如果把这些辨识度高的发音点抹成同一种开合,即使总时长对齐,观众仍会感到声音与脸分开。
再看下颌和面颊。长元音、快速连读、句首吸气与重读词的开口幅度不同;只让嘴唇移动,下颌却像冻结,人物容易产生面具感。胡须、手遮嘴、侧脸、运动模糊和快速转头会降低可控性,因此正面半身适合承担完整口播,困难角度更适合短句、反应、产品近景或画外音。
第三处是眼神。一段中文版表演里,演员可能在产品名出现前看向镜头,在结果句末轻轻点头。英文把重音移到效果词,日文把核心信息放在句尾,原来的眨眼、抬眉与视线节点就未必成立。最后还要把手部动作放回来:人物说到“打开”时是否已经碰到产品,说到结果时画面是否真的给出变化。四处共同响应,人物才像重新说了一遍,而不是脸上贴了一条新声轨。
ONCE VISUAL 的深圳 AIGC 广告片制作把实拍、生成与合成按镜头任务分工。多语言数字人沿用这一思路:原始表演保留人物气质,配音确定新语言节奏,生成处理可见发音,合成和精修负责让口型、眼神与产品动作重新相遇。
原因分析:一条台词会在四个制作层面移动
第一层是说法。品牌名怎么读、产品型号是否逐字母读、数字单位是否换算、行动提示采用命令还是建议,都应由品牌和对应语言人员确认。字幕可以更紧凑,口播文本则必须真的适合被说出来。母语审校关注的不是逐字相等,而是信息、身份与语气在目标语言里是否成立。
第二层是时间。最终配音需要标记句首吸气、短停、重读词与句尾收音,并记录最终长度。若英文版多出半秒,不宜直接把整段画面匀速拉长;可以调整译文、重录语气,或把一部分台词移到产品近景。临时配音只用于判断时长,最终配音才进入口型生成。
第三层是表演。两个词即使替换后总时长相同,辅音闭合与重音仍可能改变,眨眼、眉毛、头部微动和视线也要跟着复核。第四层是版本:横版主片、9:16 短版和无字净版对人物近景、字幕面积与切点有不同要求,同一个修改不能只在母版里完成后就默认所有导出文件同步正确。
这也是单句样片有价值的原因。它选取一句同时包含品牌名、产品名、数字、一次情绪转折和一个明显停顿的台词,让品牌团队、母语审校、导演与后期在小范围内先回答问题。若一条代表句已经出现节奏不稳,整片批量生成只是把返工扩大。
对品牌的影响:修改发生在哪个节点,决定要重做多少版本
口播稿确认前修改一个词,通常只影响译文和临时配音;最终声音确认后再改,可能需要重录、重做嘴形和重新安排眼神;横竖版全部输出后再改,还要逐个核对字幕、切点、产品动作与文件名。采购报价不应只写“增加两种语言”,还要说明何时视为译文锁定、何时视为声音锁定、口型修整包含哪些镜头、每轮反馈怎样合并。
人物和声音的使用许可也单独记录。肖像、原始表演、声音素材、语言版本、使用地区、使用期限和媒体范围由谁提供,是否允许声音模型、替身表演或第三方素材进入项目,都应在制作前确认。平台标签告诉观众内容怎样制作,不能替代人物与声音本身的许可。
审片意见则要指向具体语言、时间点与问题类型。例如“英文版 00:12 产品名重音后,眼神晚两帧回到镜头”,比“这里不像真人”更容易行动。需要保持品牌口吻时,可参考 ONCE VISUAL 的深圳品牌视频制作方法,先确认人物身份与说话语气,避免中文版像创始人、英文版像主播、日文版又变成客服播报。
下一步建议:用一条代表句决定全片,而不是先生成整支广告
代表句测试分四遍看。第一遍静音,只看嘴唇、牙齿、舌位、下颌与面颊;第二遍闭眼,只听译文自然度、呼吸、停顿和重音;第三遍正常速度回看眼神、微表情与产品动作;第四遍缩到手机大小并套入目标平台界面,检查字幕、披露标签和产品信息会不会互相遮挡。
通过以后再扩展到全片,并为每种语言记录最终口播稿、审校人、音频版本、画面母版、生成批次、人工修整区间、字幕文件和发布用途。如果内容还承担海外电商转化,可结合 ONCE VISUAL 的深圳跨境电商产品视频制作,为发现、比较与下单重新编排信息长度,而不是把同一段口播塞进所有入口。
这套方法适合使用真实感人物、需要多语言口播、且会输出多个画幅的品牌广告。明显卡通化的虚构角色、纯画外音内容或只做字幕本地化的项目,制作重点会不同。最终交付前,仍需由品牌按实际人物、素材来源、投放市场和平台后台完成审核。
如果你正在采购多语言数字人或 AIGC 广告片,可以把现有人物素材、目标语言、口播稿、授权范围和发布平台发给 ONCE VISUAL,我们会先做一条代表句测试,再据此确认全片的制作与交付范围。
