部落格

2026年9月5日

在为视频付费之前用 AI 做分镜:把账单除以十的方法

一张图 1 到 5 积分,一个视频镜头 26 到 96 积分。如何用静帧确定取景、人物和光线,再只动画已经通过的部分,附一条三十秒短片的完整成本核算。

Frank Houbre

Frank HoubreImaginode 創辦人

本该决定你工作方式的价格比

一张图 1 到 5 积分,而一个五秒的视频镜头要 26 到 96 积分:在图上改,比在视频上改便宜十到二十倍。

把这两个数字并排放好,整套方法就顺理成章了。Flux Schnell 上一张图 1 积分,Flux 2 Klein 上 3 积分。一个五秒的视频镜头在 Kling 2.5 Turbo 上从 26 积分起,在 Seedance 2.0 Fast 上涨到 48,十秒则是 96。

换句话说,一个到了视频阶段才发现的取景错误,会让你付出图像阶段三十倍的代价。而且相信我,取景错误从来不会在你看到图之前被发现。

这就是分镜的全部意义,一件电影一直在用的工具,理由非常实在:画一个镜头比拍一个镜头便宜。AI 什么都没发明,它只是让不会画画的人也用得上这件事。

一份分镜真正该包含什么

有用的分镜为每个镜头确定取景、主体、动作和时长:正是这四条信息,让你之后能毫不犹豫地生成视频。

分镜不是一版漂亮的画。它是一份决策文件。对每个镜头它回答四个问题:看到什么,怎么取景,镜头期间发生什么,持续多久。

这四个答案,正是你之后要交给视频模型的东西。一份做好的分镜,就是你已经写好的视频提示词,外加模型将要动画的那张起始图。两个阶段之间什么都没丢。

而且它让任何文字都显示不出的东西变得可见:节奏。六格并排放好,立刻告诉你你的片子是有呼吸的,还是把同一个镜头连着来了三遍。这是在文字表格里永远看不到的东西。

从分场开始,在一个文本节点里

先按顺序一个镜头写一句话,带上时长:写下来的分场只花十分钟,能省掉那些根本没用的镜头。

在生成任何一张图之前,打开一个文本节点,用句子把你的片子写出来。一个镜头一句话,按顺序,带上目标时长。镜头一,三秒,把杯子放到吧台上的手。镜头二,四秒,抬起眼睛的顾客的脸。你懂这个意思。

文本节点也可以替你写:给它一条指令,比如写一条关于某产品的三十秒短片的分场,三句话,一个镜头一句,不要标题不要编号。一个语言模型每次生成 1 到 3 积分,在这个阶段微不足道。

但要重读,并且自己拍板。模型很乐意在六个镜头够用的地方给你八个,因为没有任何东西促使它做减法。分场是你唯一能免费删掉一个镜头的时刻:从画格开始,每一次删除都是已经花掉的预算。

生成画格:合适的模型和合适的预算

在 Flux Schnell 上用 1 积分探索构图,再把选中的画格用 Flux 2 Klein 的 3 积分定下来:六个通过的镜头不到五十积分。

探索阶段:Flux Schnell,1 积分,别数着花。你找的是构图,不是美感。每个镜头三四次通常就够看出什么行得通。六个镜头二十四次,就是 24 积分,两毛钱左右。

锁定阶段:选中的画格在 Flux 2 Klein 上用 3 积分干净地重做一遍,或者用 Seedream 5 Lite 的 5 积分,如果你需要它接受参考图。六张最终画格,18 到 30 积分。

一套完整的六镜头分镜总计:五十积分上下,大约五毛钱。对比一下:在 Seedance 2.0 Fast 上盲生成六个视频镜头要 288 积分,而且其中一半你会扔掉。

让人物在六张画格里保持一致

在每条提示词里用 @提及 调用的参考节点,能在所有画格上保住同一张脸,而在每条提示词里重复描述则会失败。

只要有人出现在不止一个镜头里,分镜就会暴露它本该预防的那个问题:一格到下一格,那不是同一个人。在这里、按图像的价钱解决掉,好过留到视频阶段。

建一个参考节点,给它名字、描述和你人物的三张照片,然后在六条提示词里用 @提及 调用它。图片会随提示词一起发出,模型会照抄真实的比例,而不是每次都编一套新的。

确认你选的模型接受参考:不接受时节点上不会出现这个接口,这是唯一的提示。完整方法,包括起始照片怎么选,在AI 里保持人物一致创建一个 AI 人物里。

保住光线和美术方向

一个风格节点接到六个节点上,在所有地方强制同一套配色和同一种处理,而且只在一个地方修改。

分镜早早暴露的第二件事:光线不统一的六个镜头,不构成一部片子。一个是傍晚的暖光,另一个是冷冷的霓虹,剪出来会像一块补丁。

风格节点担的就是这个角色。你把美术方向描述一次,加上参考图,接到六个图像节点上。你所有的画格都继承它,而你哪天改了配色的主意,只需在一个地方改。

这也是让分镜拿得出手的原因。六张统一的画格看起来像一部片子;六张各行其是的看起来像试验。当这份文件送到客户手上时,差别是巨大的。

相机节点:把调度放进分镜里

在相机节点里设定取景、镜头、光圈和角度,能在画格阶段就把调度定下来,同样的设置随后原样送进视频。

分镜是用来决定取景的,而相机节点正是为此而生。你选景别、镜头、光圈、角度,它把这些设置翻译成模型听得懂的语言。

好处有两重。首先你得到的画格,真的像最终镜头的样子,带着 85 mm 该有的压缩感或者 f/1.4 该有的背景虚化。其次,这个节点可以原样接到视频节点上:在图像阶段定下的调度,不用重打一遍就进了视频。

一个相机节点可以喂给多个镜头以保持镜头语言的统一,或者你的分场如果在全景和特写之间交替,也可以一个镜头放一个。各项设置以及它们分别改变什么,在在 AI 里调度镜头里。

分镜变成视频的那一刻

每一张通过的画格成为一个视频节点的起始图:模型动画的是一个已经获批的构图,而不是自己编一个。

这就是让其余一切都说得通的那一步。一张通过的画格接进视频节点,成为它的第一帧。模型不再构图,只负责动起来。你把最不确定的那个变量从算式里拿掉了。

具体说,这意味着视频提示词变得非常短,而这是好事。画面什么样,图已经说了。剩下的只是描述运动:镜头缓慢推进,手合拢,目光抬起。每个镜头三个词。

可用镜头的比例一下子上去了,因为视频失败的大部分来自取景或人物,而不是运动。而当某个镜头还是失败了,你就只重跑那一个镜头,保持同一张起始图,26 到 48 积分。

一条三十秒短片的完整成本

五十积分的分镜,再加六个 26 积分的视频镜头:一条三十秒的片子大约 200 积分,含剪辑,因为剪辑是免费的。

拿一个具体的例子算总账,六个五秒的镜头。图像探索,1 积分跑二十来次:24 积分。最终画格,六张 3 积分:18 积分。整套分镜是 42 积分。

视频生成,六个五秒 720p 镜头在 Kling 2.5 Turbo 上按 26 积分:156 积分。剪辑节点把这些拼起来,导出在你的设备上计算,不消耗一个积分。合计约 198 积分,就算两欧元吧。

对比一下没有分镜的做法。你直接生成视频,因为取景不对扔掉一半,再重做六个。十二个镜头按 26 积分是 312 积分,而且你花了两倍的时间。要超过十秒的完整方法,写在超过 10 秒的 AI 视频里。

把分镜当作交付给客户的东西

在制作视频之前让六张画格获批,把修改移到最便宜的一侧,也让这单更稳。

这一切还有一个商业上的理由,分量至少和省下的积分一样重。看到成片的客户会有意见。这很正常,这是他的项目。只是到了那个阶段,每一条意见都要一次视频重生成。

在制作之前把六张画格发给他。他会告诉你第三个镜头不行,光太冷,第二个他更想要个大一点的景别。这些修改每条 3 积分,十分钟。

而在分镜上取得的同意,之后会保护你:通过了的就是通过了。关于怎么把这些阶段写进报价,我在向客户为 AI 创作开价里写了我的价目表。

分镜解决不了的事

一张完美的画格既不保证运动,也不保证人物在动画过程中不走样,更不保证两个镜头之间接得上。

让你相信分镜能解决一切,那我就不诚实了。它定下的是每个镜头的起点,而不是接下来那五秒里发生的事。

视频模型完全可能从一张无可挑剔的图出发,到第三秒让脸漂走,或者自作主张加一个你没要的运镜。这是剩下的那部分随机性,它依然存在。

它解决的是其余全部:取景、构图、光线、风格、人物身份、分场的节奏。也就是一个镜头被扔掉的绝大多数原因。这已经很了不起了,而且只要 42 积分。

该走的流程,五步

写下分场、1 积分探索、锁定画格、从画格出发做动画、免费剪辑:五步,就按这个顺序,绝不换别的。

第一,在文本节点里写下分场,一个镜头一句话,带时长。第二,用 1 积分做图像探索,别舍不得。第三,在一个好模型上锁定画格,人物用参考节点,美术方向用风格节点,取景用相机节点。

第四,动画:每张画格成为一个视频节点的起始图,配一条只描述运动的短提示词。第五,剪辑,负责拼接、裁切、加转场和声音,免费。

如果你从没生成过视频,先从你的第一条 AI 视频开始,把单个视频节点摸熟,再回到这里看完整方法。如果是产品广告,一步步的路径在产品视频广告里。

想在真正的畫布上試試嗎?

本文提到的一切,都能在瀏覽器裡用 Imaginode 完成。

開始使用