把三个文件名改成A、B、C,再让它们配同一段十五秒画面:A版由配音演员完成,B版使用普通合成音,C版来自经本人确认的声音克隆。三条都能把词念对,但只有一条在产品出现、人物停顿和片尾行动句之间保持了同一种性格。AIGC广告片配音真正要选的不是“像不像真人”,而是哪种声音能在这条广告里承担品牌身份、表演和版本更新。
这篇文章适合已经有脚本、分镜或粗剪,正在比较真人配音、AI配音与声音克隆的品牌和采购团队。读完后,你可以用同一段测试画面完成三次判断:先听身份,再看动作,最后换到真实发布环境,并把授权、标注和声音分轨写进交付范围。
把画面关掉:品牌需要一个“人”,还是只要清楚信息
第一遍不看画面,也不告诉审听者声音来自哪里。只播放品牌名、一个核心卖点和一句行动提示。采购方此时不要先问成本,而要记录三个反应:听众能否复述关键信息;这条声音像一个有态度的说话者,还是一台读稿器;语气变化是否来自句意,而不是随机的重音和气口。
如果广告靠人物立场、情绪转折或一句具有记忆点的品牌表达推动,真人配音通常更容易在导演指导下做出连续表演。录音时可把同一句拆成“克制、解释、邀请”三种意图,不追求一次把整段读完。若内容主要是功能步骤、菜单说明或高频更新的信息,普通合成音可能更合适,但仍要逐句处理产品名、数字、单位、外语缩写和停顿。
一线测试不要从完整脚本开始。先截取十五秒,里面必须同时有品牌名、产品动作和片尾句;再给三种声音使用同一版文案、同一背景音乐和同一响度。这样听到的差异来自表演与适配,而不是混音在替某个方案加分。
审听表也不要只留“喜欢、不喜欢”。可以让品牌、导演和后期分别写下三个词:这条声音像谁、正在对谁说、听完想让观众做什么。若三个人给出的角色完全不同,说明声音还没有形成清楚身份。此时继续细调音色意义不大,应先改说话关系和表演方向;若角色一致、只是某几个词不清,再进入发音与节奏调整。
把画面打开:嘴型、手部动作和声音停顿必须落在一起
第二遍打开画面,重点不再是音色,而是时间。人物嘴型已经清楚可见时,换一句更长的译文可能让声音落到闭嘴以后;产品按钮刚被按下,旁白若提前说出结果,画面会像慢半拍;镜头切到微距材质时,句子仍在解释上一项功能,信息也会互相打架。
现场可把测试段做成带时间码的三行表:画面动作、允许说话的时段、不可挪动的产品事实。配音演员可以通过语速、气口和重录调整表演;普通合成音通常要先改写句长,再调节速度,不能简单拉伸音频;声音克隆还要检查情绪变化是否稳定,避免一句像本人、下一句突然变成另一种年龄和距离感。
这里有三个只属于声音制作的验收细节。第一,品牌名至少单独录一条干声,避免后续短版只能从混音里硬切。第二,爆破音、齿音和换气要在旁白单轨里检查,不能等音乐盖上后才签收。第三,人物口播镜头必须保存一版只有同期声与环境底的文件,方便判断配音替换到底是在修正语言,还是已经改变演员表演。
录音文件要保留场次信息,而不是每次覆盖“最终版”。同一句可按语气编号为 calm、direct、warm,并在审听批注里写清选中哪一条、为什么选。合成声音也按同样方式保存原文、生成版本和选用片段;只保存成片里的那一小段,后期就无法判断问题来自文本、发音设置还是剪辑点。
切换语言:版本越多,越要先决定哪些表演不能复制
多语言不是把中文声音替换成英语、德语或西班牙语就结束。词长、句序和重音都会改变画面节奏。一个更稳的做法是先锁“不能移动的点”:产品点亮、人物回头、功能结果出现和片尾落版;再允许译文在这些点之间调整。脚本应保留时间码、发音备注、品牌词读法和不可改写的产品事实。
真人配音适合需要文化语感、喜剧节奏或强情绪的主版本,也便于导演在录音棚里即时追问。普通合成音适合大量说明短版、内部预演或需要持续更新的版本,但每种语言仍需母语审听。声音克隆更适合品牌确实要延续某位本人声音、且使用方式已经确认的场景;它不应被当作“以后都不用再约演员”的默认方案。
翻译审听最好保留一条回退线:母语审听人只改读起来生硬的句子,品牌产品负责人只确认事实,剪辑师只判断时长。三种修改不要同时压在一条批注里。若译文必须增加解释,就先给画面补呼吸;若画面节点完全不能动,就换更短的自然表达,而不是把语速推到听不清。
技术工具本身也可能要求单独的声音确认。例如,OpenAI 的自定义声音说明把确认录音与声音样本分成两份,且两者要来自同一声音;ElevenLabs 对专业声音克隆的说明则要求声音本人完成创建与验证,再由本人分享。采购方案不能把某一工具的能力,直接写成对所有人物和所有用途都长期有效。
进入发布页:声音来源与平台标注在成片外再验一次
第三遍把测试文件放进真实发布流程。YouTube要求创作者披露看起来真实、且被明显修改或合成的内容,判断时应查看YouTube关于生成或合成内容披露的官方说明;TikTok也要求对包含真实感图像、音频或视频的AI生成内容进行标注,具体入口和适用范围以TikTok的AI生成内容说明为准。
这一步不只问“要不要打标签”。还要确认发布账号、广告投放方式、市场、人物身份和声音用途有没有变化。自然发布的品牌片改成付费广告,或者企业员工声音改用到长期促销短片,都应重新核对。涉及参考素材、人物与工具使用范围时,可同时查看AIGC广告片素材与人物审核方法,把声音作为独立项目记录。
上线复演至少做两次:一次关闭字幕,只听声音能否独立讲清产品;一次静音打开字幕,确认信息不会因声音缺席而消失。随后在手机扬声器和耳机各听一遍,检查低频音乐是否压住辅音、片尾句是否被平台按钮打断。广告成片中的声音是否可信,常常在这个最普通的播放环境里暴露。
如果同一条片要进入官网、展会和社媒,不能拿一个混音文件到处复制。展会现场可能没有稳定听音条件,官网首播也可能静音,社媒广告还要与平台字幕和按钮共同工作。声音方案应明确哪些信息必须靠画面重复,哪些声音只在有声观看时增强情绪,避免旁白成为唯一的产品说明。
收回工程:最终交付要让声音能复查、替换和继续使用
无论选择真人还是合成方案,交付物都不应只有一条已经混好的成片。至少要分开保存旁白干声、音乐、音效、环境底和完整混音;多语言项目再增加静音母版、每种语言的时间码脚本、字幕文件和发音确认记录。文件名要包含语言、版本、日期和是否带音乐,例如 VO_EN_US_v03_dry,而不是“英文最终版2”。
声音克隆项目还应保存本人确认材料、生成账户归属、可使用项目与期限、停用方式,以及哪些样本不得继续外发。普通合成音要记录所用声音、工具版本和最终选用文件;真人配音则要写清录音条数、补录触发条件、媒体用途与使用期限。这样半年后换一条行动句时,制作团队知道可以直接更新哪一轨,也知道哪些内容必须重新确认。
可报价的声音范围最终应回答五件事:谁在说、为什么选这种声音、哪几处必须贴合画面、会生成多少语言和短版、交付后如何替换。若项目同时含实拍人物与生成镜头,可在AIGC广告片与AI视频制作方案下统一安排声音测试、画面版本与上线复演;相关成片类型也可在ONCE商业影像案例中核对。
需要把声音选择落到实际制作范围时,带上十五秒粗剪、带时间码脚本、人物方案、目标语言、发布平台和预计更新频率,和 ONCE 做一次匿名审听;三类声音会在同一段画面里完成盲听、对画面和上线复演,结果再整理成可录制、可审听、可替换的声音交付范围。
