AI 视觉分镜真正有价值的地方,不是提前做出一批“像广告”的漂亮图,而是在开机之前,把剧本、人物、空间、产品、摄影、表演和剪辑节奏放进同一个可讨论、可修改、可执行的视觉系统。下面将用一支匿名化的 90 秒设备类 TVC,完整拆解一套 AI视觉化分镜制作流程:成片脚本最终拆成 67 个镜头,平均每镜约 1.34 秒;建立 7 组角色参考、12 组纯场景参考,再以 7 类景别、8 类机位和 6 个焦段完成整片视觉预演。所有客户、品牌、型号与可识别商业信息均已移除,图片只用于解释方法。

创意导演工作台上铺陈角色卡、场景图与连续分镜的高端编辑式画面
从角色、场景到逐镜画面:AI视觉预演首先是一套制作系统。

一、先区分三种东西:故事梗概、镜头脚本和视觉预演

很多团队第一次做 AI 分镜,会把一段十几秒的文案直接交给模型,让模型生成一张“代表画面”。这张图可以用于气氛沟通,却不能回答片场最基本的问题:这十几秒到底拍几个镜头?先看谁?谁在动作?产品何时出现?情绪落点在哪里?镜头之间靠什么剪?如果把这些问题留到开机当天,所谓“分镜”就只是一组情绪海报。

可执行的分镜头脚本,最小单位不是段落,而是一个明确的视觉动作。一个镜头至少要回答五件事:画面里是谁或什么、观众这一刻必须看见什么、摄影机站在哪里、动作从哪里开始到哪里结束、这个镜头如何进入下一镜。AI 视觉化只是把答案变得可见,不能替代答案本身。

因此,项目开始时要先定义三层交付:

层级回答的问题最终文件
创意层影片为什么成立,观众先感受到什么创意阐述、故事节拍、情绪曲线
导演层每一秒如何被镜头组织镜号、时长、景别、焦段、机位、运镜、调度
视觉预演层人物、空间、光线和构图是否能统一角色卡、场景图、产品参考、逐镜画面、客户提案

如果只是为创意会准备情绪参考,做到第一层即可;如果要用于报价、置景、选角、勘景、摄影和客户确认,就必须进入第二、第三层。关于传统分镜脚本的基础结构,可以先阅读站内的《广告分镜脚本怎么写》;本文重点解决它之后的难题:如何把一份已经成形的脚本,推进成整片一致的 AI 视觉预演。

二、第一步不是出图,而是把 90 秒重新拆成“可见动作”

拆镜时,不要按文案换行,也不要按场景名称机械分段。更有效的方法是为每个叙事节拍寻找镜头功能。常见功能包括:建立空间、交代人物、展示动作、证明结果、捕捉反应、连接转场、提供剪辑遮挡、留下品牌停顿。一个节拍通常需要两到五个镜头共同完成,而不是由一张大而全的画面承担。

例如,脚本里写“梦幻开场,6 秒内展示创意已经变成真实作品”。如果把它处理成一个 6 秒大全景,摄影机、人物和产品只能在同一构图里缓慢表演,信息密度和剪辑弹性都会不足。更合理的拆法可以是:

  1. 1.2 秒结果特写:先看作品材质,让观众立即获得结果。
  2. 1.6 秒人物与设备关系镜头:交代作品由谁完成、发生在哪里。
  3. 1.6 秒多人物或多场景呼应:把个人创作扩展为家庭或副业价值。
  4. 1.6 秒反应或动作收口:用轻微停顿把观众带入下一段。

这样依然是 6 秒,却拥有四个剪辑点、四种信息功能和多个节奏版本。导演可以在后期把第一镜压到 0.8 秒,也可以把反应镜延长到 2 秒;制片也能清楚知道哪些镜头共用场景、演员和道具。

匿名化项目中,儿童角色面对桌面草图停笔思考的中近景,用于说明创意节拍如何被拆成可见动作
先写“观众这一镜必须看见什么”,再写画面。停住的笔尖、散开的草图和人物视线,比“一个孩子正在创作”更接近镜头任务。

三、先做镜头数据表,别让模型替你决定摄影

当 67 个镜头被列出后,下一步不是逐条写提示词,而是做全片摄影矩阵。矩阵的作用,是在生成之前看见结构性问题:是不是中景过多?是不是所有人物都正面看镜头?是不是每个房间都用同样的机位?是不是所谓“高级感”只剩大光圈和暖色?

这次匿名项目的镜头分布为:17 个中景、16 个全景、11 个大特写、9 个大全景、8 个特写、5 个中近景和 1 个图形端卡;机位则覆盖三分之四侧角、低机位、过肩、高机位、俯拍、侧面、主观视角和中心轴。焦段使用 16、25、32、50、75、100mm,其中 16mm 占 37 镜,但并没有把 16mm 当成唯一答案。

设计维度作用常见错误
景别分配信息密度与情绪距离所有镜头都停在“看得清人和产品”的中景
焦段决定空间压缩、透视关系和人物存在感只在提示词里写“电影感”,没有真实镜头语言
机位决定观众与人物、产品之间的权力和亲密关系正面平视、中心构图连续出现
帧率意图预判动作质感与剪辑节奏把所有动作都写成慢动作
构图任务组织前景、中景、背景和视觉落点只描述主体,不描述空间层次

使用 16mm 的理由,也不能只是“显得高级”。广角适合建立空间、形成前中后景视差、让动作进入画面,并为家庭或工作室场景保留环境信息;50mm 以上则更适合材料、眼神和操作细节。镜头设计要围绕叙事功能,而不是围绕某个流行参数。我们在视觉提示中使用 ARRI ALEXA 35 的高光滚降、肤色和阴影细节作为质感参照,但必须明确:生成图是摄影方向预演,不是声称画面由该摄影机真实拍摄。ARRI 官方资料对 ALEXA 35 的 Super 35 传感器、17 档动态范围与 REVEAL Color Science 有清晰说明,适合摄影与后期团队统一参照语言。

四、建立“一致性圣经”:角色、场景、产品、色彩必须分开管理

整片一致性差,通常不是模型不够强,而是输入资产没有被分层。把人物照片、场景参考、产品白底图、色板和镜头要求全部塞进同一段提示词,模型会在每一镜重新权衡它们,最终出现脸型变化、衣服换色、家具移动、产品比例漂移和光向冲突。

建议至少建立四套独立资产:

  • 角色圣经:年龄、体型、脸部特征、发型、肤色、固定服装、饰品和情绪边界。
  • 场景圣经:房间结构、门窗位置、主要家具、材质、主色、实景光源和可移动道具。
  • 产品圣经:正面、左右侧、三分之四角度、关键结构、不能改变的比例与品牌限制。
  • 风格圣经:摄影机观感、镜头家族、对比度、色温、颗粒、黑位、高光和禁止项。

生成工具已经普遍支持参考图输入。OpenAI 的官方图像生成文档明确区分从文字生成、对现有图像编辑,以及使用一张或多张图片作为新图参考;Adobe Firefly 也把“构图参考”和“风格参考”拆开:前者主要约束轮廓、深度与画面安排,后者主要影响色彩、纹理、光线和整体气质。对商业分镜而言,这种拆分非常重要:人物身份参考不应该同时承担场景构图参考,场景结构图也不应该被当成色彩风格的唯一来源。

五、角色卡不是选角海报,而是身份锁定文件

角色卡至少需要正面全身、正面或三分之四近景、侧面三个角度。全身用于锁定身高比例和服装轮廓,近景用于锁定面部,侧面用于避免后续生成只会复制一张正脸。必要时增加手部、鞋履、饰品和表情小样,但不要一开始就加入大量戏剧动作,因为动作会干扰身份判断。

匿名角色设计卡,包含同一女性角色的全身、近景和侧面三种视角
一张合格的角色卡要同时解决体态、面部与侧面识别。正文示例中的人名已取消,角色只作为一致性方法演示。

角色描述要写可观察事实,不写空泛气质。“温暖、有创造力、很高级”很难被视觉模型稳定执行;“30 岁上下、自然卷短发、奶油色针织上衣、深青围裙、深棕宽腿裤、动作克制、面对成品时只短暂停顿”则可以被摄影、造型和生成系统共同理解。

表演边界同样需要锁定。广告人物最容易被生成成过度惊喜、夸张大笑或对镜头展示商品。导演应该提前写清:笑容出现在哪一镜、眼神看向哪里、手的动作是否完成、是否允许对镜头、是否需要停顿。人物一致性不是只保住一张脸,而是保住这个人在整条故事里的行为逻辑。

六、先生成不带人物的纯场景,再让角色进入空间

场景图最好先完全不带人物。原因很简单:当角色提前占据画面,模型容易围绕人物重新设计房间;下一镜换机位时,桌子、门窗和背景墙就会漂移。纯场景板的任务是确定建筑关系、主家具、材质、色彩和光线方向,并预留摄影机能够站立的位置。

匿名创作者工作室的纯场景参考图,包含胡桃木工作台、深青柜体、侧窗和暖色自然光
纯场景板先锁定空间骨架:窗在左侧、主桌在中心、深青柜体在后方,暖光由左向右推进。人物和摄影机之后只能在这个空间里调度。

场景圣经里至少记录:空间用途、入口与窗的位置、主桌或主沙发坐标、背景层次、色温、日夜状态、灯具是否入画、主光方向、可移动道具和禁用元素。需要拍摄多个时间段时,应为同一空间分别制作日景和夜景版本,而不是要求模型在每一镜临时“把它变成夜晚”。

色彩也要从“形容词”变成可执行关系。例如这套示例使用深青、胡桃木、陶土橙、奶油白和少量芥末黄:深青负责空间深度,胡桃木提供生活质感,陶土橙承担情绪温度,奶油白保证人物和成品可读。后续每一镜可以调整明暗,却不重新发明一套配色。

七、把提示词写成“制作规格”,而不是文学描述

高质量提示词不在于长,而在于层级稳定。推荐把每镜提示拆成四层:

  1. 全片层:摄影机观感、镜头家族、色彩、对比度、材质、皮肤和禁止项,所有镜头共用。
  2. 镜头层:镜号、时长、景别、焦段、机位、构图、动作、可见故事信息和光线。
  3. 参考锁定层:哪张图锁人物、哪张图锁空间、哪张图锁产品,各自允许改变什么。
  4. 验收层:身份、建筑、产品结构、手部、文字、反射、阴影和叙事是否通过。
镜头编号:S025
时长:1.2 秒
镜头功能:建立生日空间,并为后续人物反应留出剪辑入口
景别 / 焦段 / 机位:中景,16mm,侧面机位
构图:彩旗形成近景遮挡,母亲在左侧中层,父亲在右侧深处
动作:两位家长同时布置,但动作方向相反,孩子从背景短暂穿过
光线:窗侧暖光为主,实景串灯只做层次
参考锁定:场景图锁建筑;角色卡锁身份与服装
禁止:正面摆拍、夸张笑容、家具位移、额外人物、可读品牌文字

请注意,这里没有写“电影感、梦幻、高级、震撼”之类无法验收的词。镜头有没有高级感,最终来自透视、材质、光线、动作和取舍,而不是来自形容词数量。

八、批量生成要分波次,不要 67 镜一次性提交

整片生成最稳妥的方式,是先做小样,再按依赖关系分波次。建议顺序如下:

  1. 角色卡与纯场景板通过后,先生成每个主场景的一张代表镜头。
  2. 检查人物、空间、产品和光向是否稳定,必要时修改圣经,而不是只修单张图。
  3. 生成每条故事线的建立镜头、关键动作镜头和结果镜头。
  4. 再补过肩、反应、特写、主观视角和转场镜头。
  5. 最后生成产品 Hero、图形端卡和可能需要后期合成的镜头。
匿名角色站在工作室大桌前查看空白帆布袋的广角画面,用于说明人物进入既定场景后的空间连续性
场景先锁定,人物再进入。桌面、衣架、后柜、窗光和人物服装都应延续角色卡与纯场景板,而不是每镜重新设计。

分波次还有一个重要价值:能尽早暴露系统性错误。如果前三张图里的工作室都不一样,问题不在第 4 张提示词,而在场景圣经;如果同一角色每次年龄都变化,问题在角色卡;如果产品角度总是被模型重新设计,就要增加多角度产品参考和结构禁区。先修系统,再扩量,比逐张返工有效得多。

九、构图丰富性要靠镜头组设计,而不是随机换角度

“不要都是中景”只是最低要求。真正的构图丰富性,要让不同角度承担不同叙事功能。以下三张图属于同一段家庭故事,却分别负责空间、关系和主观体验:

家庭生日场景的16毫米广角建立镜头,前景彩旗遮挡,父母分处画面两侧
建立镜头:16mm 广角利用彩旗做近景遮挡,让人物、空间和动作同时成立。
父亲为孩子戴上生日头饰的高机位关系镜头
关系镜头:高机位让父亲的手、孩子的表情与地面礼盒形成三角关系,亲密感来自动作,而不是对镜头微笑。
从礼物盒内部向外看的主观镜头,孩子位于中心,父母分处两侧
主观镜头:礼盒内部 POV 为剪辑提供一次视角翻转,也把“打开礼物”变成观众亲历的动作。

随机换角度会带来视觉噪音;功能明确的换角度才形成节奏。每次改变机位前都问一句:新角度增加了什么信息?如果答案只是“看起来不一样”,这张图很可能不值得拍。广角负责空间和动作,近景负责关系,特写负责证据,主观镜头负责参与感,转场镜头负责时间或空间跳跃。景别与角度的变化必须跟着叙事压力变化。

十、连续性审片:每张图都好看,整片仍然可能失败

AI 分镜的审片方式,不能只逐张放大看。建议同时做两种检查:

  • 单镜检查:手部是否合理,产品结构是否准确,动作是否能执行,文字与 Logo 是否出现伪造,反射与阴影是否可信。
  • 序列检查:人物身份、服装、场景结构、时间、光向、道具位置、视线方向和动作连续性是否成立。

最有效的做法是把所有镜头缩成接触表,先不看细节,只看节奏和重复。如果连续六张都是人物坐在桌边的中景,即使每张都很精致,影片依然平;如果一个角色的发型在接触表里忽长忽短,也比逐张查看更容易被发现。

审片时还要区分“视觉预演允许的近似”和“拍摄执行不能接受的错误”。背景书架上不可读的虚化文字通常不影响调度;产品操作步骤、认证名称、屏幕 UI 和品牌 Logo 则必须由真实素材或后期完成,不能让生成模型替客户发明。对于生成资产的来源、编辑与授权记录,也应保留文件哈希、版本和来源说明。C2PA 的 Content Credentials 规范提供了一种记录媒体来源与历史的开放思路,但无论是否使用该技术,团队内部都应先建立最基本的资产台账。

织物上图案完成揭膜的材料大特写,用于说明分镜中的工艺与材质证据
大特写不是装饰镜头,而是证据镜头。膜、织物纹理、图案边缘和手指动作必须符合真实工艺逻辑。

十一、把通过的图片回填分镜表,形成真正的导演文件

图片通过后,要回到分镜表,而不是把文件散落在文件夹里。一个适合导演、制片、摄影和客户共同阅读的表格,建议保留以下字段:

字段写法
镜号S001—S067,保持唯一且可回填素材文件名
时长直接写 1.2s、1.6s、2.0s,不再重复 TC IN / TC OUT
场景 / 人物 / 道具只写本镜真正出现的元素
景别 / 焦段 / 机位 / 帧率合并为摄影说明,避免列数过多
运镜写起点、运动方式、停止点,不写“高级推进”
表演调度单独一列,写人物走位、视线、手部和停顿
画面与导演意图解释这一镜交代什么,为什么必须存在
分镜图嵌入对应图片,保证打印和屏幕浏览都可读

镜头时长要回算到整片。这个匿名项目 67 镜合计 90 秒,平均 1.34 秒,但平均值只用于发现异常:如果某个纯信息镜占 8 秒,就要确认它是否真是长镜头;如果情绪峰值只有 0.6 秒,也要确认观众是否有读取时间。导演最终调节的是呼吸,不是追求每镜相同长度。

十二、客户提案要像一本杂志,不要像生产数据库

分镜表负责执行,客户提案负责理解。两者可以共享图片,却不应共享同一版式。客户提案建议按“项目描述—创意方向—角色设计—场景设计—分镜序列—收尾画面”组织。分镜页每页放三张图,是一个相对稳定的阅读密度:足以形成前后关系,又不会把画面缩得过小。

极简不等于空。高端杂志感主要来自大图比例、标题层级、留白、统一字体和图文节奏,而不是大量线框、渐变面板和装饰图标。图片下方只保留镜号、时长、场景、摄影说明和一段导演意图。客户需要知道镜头为什么这样拍,不需要看到模型参数、生成次数或内部提示词。

如果一页三张图仍然无法讲清动作,说明问题通常不在排版,而在前面的拆镜。提案不是用来遮盖镜头逻辑的,它只是把已经成立的镜头逻辑更清楚地展示出来。

十三、AI 应该负责什么,导演必须保留什么

AI 很适合承担高成本的视觉试错:快速比较不同场景方向、测试服装和配色、提前发现镜头重复、制作客户可理解的空间与动作预演、在正式制作前验证一条故事线是否连贯。它也能把抽象创意迅速变成一套可排序的画面,让创意、制片、摄影和客户更早进入同一语境。

但以下决定不应交给模型自动完成:

  • 一个段落到底需要几个镜头;
  • 卖点、情绪和人物关系谁先谁后;
  • 什么必须真实拍摄,什么可以生成或后期合成;
  • 产品功能、工艺、认证和法律表述是否准确;
  • 人物是否在“表演广告”,还是在真实完成动作;
  • 哪些漂亮画面应该删掉,因为它们没有叙事功能。

换句话说,AI 可以把导演判断放大,却不能替团队建立判断。最差的工作流是“先出 100 张,再挑好看的”;更成熟的工作流是“先定义 67 个镜头任务,再为每个任务生成最有执行价值的画面”。

十四、一套可直接复制的制作清单

脚本拆镜检查

  • 每个镜头是否只有一个主要动作和一个视觉落点?
  • 每段十几秒的内容是否真的需要长镜头,还是应拆为建立、动作、证据和反应?
  • 所有镜头时长相加是否等于成片时长?
  • 每个镜头是否明确进入和退出方式?

一致性资产检查

  • 主角是否有全身、近景和侧面角色卡?
  • 每个主场景是否有不带人物的纯场景板?
  • 产品是否有多角度真实参考及不可改结构清单?
  • 色彩、光向、材质、服装和主要道具是否形成书面圣经?

逐镜生成检查

  • 提示词是否写了景别、焦段、机位、构图、动作和光线?
  • 参考图是否明确各自角色,而不是全部混用?
  • 是否按故事线和场景分波次生成?
  • 每完成一波,是否先做接触表连续性检查?

交付检查

  • 图片文件名、镜号和表格是否一一对应?
  • 分镜表是否区分摄影、运镜和表演调度?
  • 客户提案是否删除内部提示词、工具名称和生成备注?
  • 所有示例图、品牌、人物与产品是否具备使用授权或已经匿名化?

十五、常见问题

AI 分镜需要做到和最终成片一模一样吗?

不需要,也通常做不到。它应该准确锁定叙事功能、人物关系、空间、光向、构图和产品结构,让客户与制作团队理解“要拍成什么”;真实表演、镜头运动细节、材质微差和现场偶然性仍由正式制作完成。

为什么不能直接逐镜输入文字生成?

因为模型不会自动记住上一镜的房间、人物和产品。没有角色卡、场景板与结构参考,逐镜生成等于逐镜重新设计。图像工具支持多图参考和迭代编辑,但参考资产如何分工,仍需要团队先定义。

16mm 广角是不是高端广告的固定答案?

不是。16mm 能强化空间纵深和动作进入感,但过度使用会造成面部透视、产品比例和节奏单一。广角、标准焦段和长焦应该按镜头功能组合。所谓“ARRI 质感”也不是一个滤镜,而是高光、肤色、黑位、动态范围和镜头选择共同形成的结果。

生成图应该如何进入后续视频制作?

先把通过的画面作为镜头级视觉依据,再决定实拍、CG、平面动画或图生视频路线。涉及产品操作、认证、UI、Logo 和法律信息的镜头,应回到真实素材与人工后期。站内《实拍证据和生成镜头如何排进创意过会》进一步讨论了混合制作边界。

结语:真正高效的,不是生成更快,而是更早做对决定

当一支 90 秒影片被拆成 67 镜时,工作量看似增加,实际上大量问题被提前解决了:客户知道每一秒在看什么,制片知道需要哪些演员、场景和道具,摄影知道镜头与光线方向,后期知道节奏和转场,AI 团队也知道每张图的验收标准。相反,只有几张漂亮概念图的方案,往往把所有决定推迟到最昂贵的阶段。

判断一套 AI视觉化分镜制作流程是否成熟,看的不是模型名字,而是导演、摄影、美术和制片能否共同维护一套视觉生产秩序:先拆镜,再锁一致性;先设计镜头矩阵,再批量生成;先做连续性审片,再进入表格与提案。只要这套秩序成立,工具可以替换,项目依然能够推进。

如果你的项目已经有脚本或创意方向,但还没有形成可报价、可拍摄、可验收的视觉方案,可以先了解AI 广告片与视觉预演制作,再整理脚本时长、产品资料、目标市场和交付画幅,通过项目需求表提交 Brief。我们会先判断镜头数量、实拍与生成边界,再决定角色、场景、分镜和后续视频路线。

官方资料与延伸阅读

图片说明:本文封面为本教程专门生成的匿名原创视觉;正文图片来自匿名化商业分镜流程示例,仅用于方法教学,不呈现任何具体客户、品牌、产品型号或商业机密。