2026年9月5日
在生成式AI里烧掉点数的10个错误
用19点数的模型做探索、还没在图片上确认就直接出视频、不编辑而是重生成、买提示词:最费钱的十个习惯,以及该怎么做。

Frank HoubreImaginode 創辦人
几乎人人都犯的同样十个错误
生成式AI里的浪费,绝大部分来自十个具体习惯,而它们都不需要学任何技术就能改掉。
我给团队做这些工具的培训有一阵子了,最让我印象深刻的是重复。从来不是每个人有十个不同的错误,而是所有人都犯同样的十个错误,无论起点如何。
没有一个是天赋或技术理解的问题。它们要么是从别的工具带来的反射,要么只是没人说过。改掉之后,同一个人的月度预算会降到原来的二分之一或三分之一,效果反而更好。
下面按真实代价排序,从最贵到最阴险。如果只改一个,请改第二个,它带来的损失遥遥领先。
错误1:用贵的模型做探索
用19点数的模型找想法,花的是1点数一次尝试的十九倍,而这个判断根本不取决于成图质量。
这个反射很合逻辑:我想要最好的结果,就用最好的模型。可是在探索阶段,你判断的不是成图,而是在找一个构图、一个取景、一个想法。就这些点而言,1点数的图和19点数的图告诉你的完全一样。
1点数的Flux Schnell就是为此而生。二十次尝试花20点数,两毛钱左右。同样二十次放在Nano Banana Pro上要380点数,接近四欧元,得到的判断一模一样。
规则是:构图定下来之后再动用贵模型。在最低价探索,在高价收尾。这是所有纪律里回报最高的一条,也是最容易执行的一条。
错误2:还没在图片上确认就直接出视频
一个视频镜头要26到96点数,而一张图片只要1到5点数:先用图片确认取景,能把一部片子的账单砍掉一半到三分之二。
这是最贵的错误,而且遥遥领先。你有个镜头想法,直接生成视频。取景不对。重生成。人物换了张脸。再重生成。三次48点数下去,手里还是什么都没有。
同样三次迭代放在图片上,用Flux 2 Klein只要9点数。取景一旦对了,这张图就成为视频节点的起始图,模型只需要让一个已经通过的构图动起来。
这就是分镜的全部逻辑,我在在为视频付钱之前先用AI做分镜里写了完整数字。记住这个比例:在图片上改,比在视频上改便宜三十倍。
错误3:用文字描述一张脸,而不是把它给模型看
没有任何提示词,哪怕四百个词,能稳住一张脸:稳住脸的是参考图,文字永远做不到。
你的角色每次生成都换脸,于是你加细节。鼻子的形状、双眼的间距、落在左边的那绺头发。写到四百个词,脸还是在变。
语言对一张脸来说太贫乏。把你最好的朋友用文字描述出来,交给一个从没见过他的画师:画像会合理,但绝不会像。而每多写一个关于脸的词,代价是场景和光线上失去的注意力。
行得通的是:一个参考节点、三张照片、提示词里一个@提及。模型收到的是图像,复制的是真实比例。完整内容在让角色保持一致。
错误4:重生成而不是编辑
当一张图已经对了95%,重生成会让一切回到零:编辑模型只改那个细节并保留其余,花2到10点数。
图片很完美,只是外套该是蓝色的。你改掉提示词里的那个词,重生成。拿回来的是一张完全不同的图:另一张脸、另一个场景、另一种光。而那张好的已经没了。
每次生成都从不同的随机噪声出发。重生成从来不是修改,而是重来。6点数的Flux Kontext、2点数的GPT Image Mini或10点数的Nano Banana 2会把你的图作为输入,只改你描述的部分。
还要记得指令的后半段,也是所有人都会忘的那半:不许动的清单。脸、姿势、取景、背景、光线。没有它,模型会顺手把碰到的一切都修一遍。完整用法在重做同一张AI图。
错误5:在做不到的模型上死磕
同一个缺陷连续三次失败,说明这个模型做不到:第四次不会有任何改变。
教科书式的例子是图里的文字。你要招牌上出现一个品牌名,模型写出几乎正确的词,你重生成。十二次。十二点数打水漂,因为这个模型不会写字。
同一个缺陷,同一个模型不要重生成超过三次。三次失败是一条信息:换模型。Nano Banana Pro、GPT Image 2或Recraft V4.1能干净地写短文字,一次就搞定。
同样的道理适用于不被采纳的参考、不出现的端口、这个模型没有的画幅。那不是藏起来的设置,而是缺失的能力。按缺陷分类的细节在畸形的手和读不出的字。
错误6:先按一种画幅生成,再去裁剪
模型是按给它的画框来构图的:把方图裁成竖图会毁掉构图并丢掉一半像素,而直接按正确画幅生成一分钱不多花。
你按默认设置生成了方图,然后这张视觉要发限时动态。你一裁,人物被切掉,喜欢的背景也不见了。
画幅是节点上的一个下拉菜单,不多花一个点数。9:16时模型会纵向堆叠,16:9时它会在两侧留白。这是两种不同的构图,而不是同一张图多了边。
如果同一内容要出两种画幅,别裁剪:复制节点、改画幅、保持同样的样式节点和参考节点连着。每种画幅的确切尺寸在该用什么画幅和分辨率生成。
错误7:在试验阶段就把分辨率拉高
Seedance 2.0的十秒在720p要120点数,在2160p要660点数:在高分辨率下探索,会让最终进垃圾桶的镜头贵上五倍。
在视频里,分辨率是整个目录中最粗暴的价格杠杆,而它恰好就是人们会随手去动的那个,因为设置就在旁边。
数字是这样:Seedance 2.0十秒在720p是120点数,在2160p是660点数。Wan 3.0三十秒在480p是180点数,在1080p是720点数。没有任何批量折扣。
而运动、取景和角色的稳定性,在480p下完全判断得出来。低分辨率确认,只在选定版本上拉高。图片有时相反:Flux 2 Klein和Seedream 5 Lite的高一档价格完全一样,那就没有理由不用。
错误8:给要剪辑的镜头留着音频
那样每个镜头都会生成自己的环境声,六个在剪辑里互相打架,而且每个镜头还要多花二十点数左右。
很多视频模型都有音频开关,往往默认打开,因为一段无声视频一眼就能被注意到。单独一个镜头,很好。六个要剪在一起的镜头,就是双重损失。
先说多花的钱:Veo 3.1 Lite的八秒720p,无声29点数,有声48点数。六个镜头就是114点数的差额。再说结果:六种不同的环境声,每到接点就生硬地断掉。
先生成无声,再给完成的剪辑铺一条音轨。一段配音、一段音乐、几处放在该放位置的音效。片子会获得分别配音的镜头永远得不到的整体感。
错误9:买提示词
被卖出去的提示词是为另一个模型、另一个版本、另一个题材写的:它换不过来,也教不会你任何东西。
永远别买提示词。二十欧元一千条魔法提示词这种包,是这个行业里最没用的产品,理由三行就能写完。
一,它们是为某个特定模型写的,往往还是上一代,换个地方结果完全不同。二,它们描述的是作者的题材,不是你的,而适配它们恰恰需要你会写提示词。三,也是最糟的:它们什么都不教你,所以下个月你还会再买。
能学会的是提示词的结构,而这写一篇文章就够了:写出管用的提示词。如果你想让模型来写你的提示词,文本节点花1到3点数就能做到,而且用的是你的题材和你的艺术方向。
错误10:什么都不保留
如果不保留项目,那张好图的提示词、模型和设置都无从查起:你会为已经做过的工作再付一次钱。
最阴险的一个,因为当下不花一分钱。你找到了对的组合,下载了图片,关掉。三周后需要一个衍生版本,而你已经想不起模型、提示词和设置。
你重来一遍,得到差不多的东西,永远不是同一个。以一个月的常规工作计,这意味着好几个小时,以及一整份点数预算被花了两次。
在画布上,每个节点把它的生成结果保留为缩略图,缩略图背后的参数面板会显示引擎、逐字的提示词、设置、相机、输入、成本和日期。保留项目而不是文件,它免费,而且会不止一次救你。
每次点击前该问的那个问题
问问自己这次生成要告诉你什么:如果答案是一个构图上的决定,1点数的模型就够了。
所有这些错误都归结为一个缺失的习惯,而它只要两秒钟:点击之前,问问自己这次生成要告诉你什么。
如果是构图或取景上的决定,就用最便宜的模型、低分辨率、用图片而不是视频。如果是最终成品,就搬出好模型并拉高分辨率。这两种情形既不需要同一个模型,也不需要同样的预算,把它们混为一谈正是问题的根源。
确切价格在每次点击前就写在生成按钮上,取舍立刻可做。如果你想在开始前把整个项目估个价,公开计算器会算出总数,画布里的助手也能按你的预算搭出完整流程。
餘額