2026年9月5日
手畸形、文字读不通:AI 为什么偏偏栽在这两件事上,以及怎么绕过去
六根手指和生造词背后真正的技术原因,今天能把字写对的模型,以及不用再生成十次就能解决大多数情况的构图与修图方法。

Frank HoubreImaginode 創辦人
一秒钟暴露 AI 图的两个破绽
手和文字失败的原因正好相反:手的变化太多,学不干净;文字要求的是模型从来没练过的符号级精确。
你把图给别人看。挺好看,光也对,人物站得稳。然后对方盯着手,数手指,接着念背景里店铺的招牌,上面写着类似「面包坊」的东西,只是中间那个字缺了一笔。
这两个破绽是图像生成最容易辨认的签名,如今已经成了所有人都会用的检验。让人恼火的是,它们和其余部分极出色的图共存:一张颗粒完美的肖像,被一只六指手毁掉。
好消息是,这两个问题成因不同,因此解法也不同。而且到了 2026 年,只要选对模型,其中一个基本已经解决。我们先看它为什么会错,再看具体该怎么做。
手为什么会错:模型真正学到的是什么
一只手有二十多个关节,在大多数训练照片里又小又被部分遮挡,角度一变形状完全不同:模型学到的是一个模糊的平均值。
一张脸就是两只眼睛、一个鼻子、一张嘴,顺序永远一样,几乎总是正面或四分之三侧面,而且常常是照片里最大的元素。模型在可比的条件下看过它上亿次。它学得非常好。
手在每一点上都相反。二十多个关节,可能的姿势数量因此爆炸。它在画面里很小,因为在动所以常常糊,还经常被物体、衣服或另一只手挡住。而且换个角度,同一只手给出的轮廓彼此毫无关系。
结果就是模型输出手的平均值,就像你要一条龙时它输出龙的平均值一样。区别在于龙的平均值仍然可信,没人见过真龙,而手的平均值任何人一眼就看出来。而且它的运作方式里没有任何东西告诉它多一根手指是错的:它没有规则,它只有概率。
文字为什么会错:模型在画,不在拼写
图像模型逐像素生成看起来合理的形状,并不把字母当作符号来表示:所以它做出来的是像文字的东西,而不是文字。
文字是另一种性质的问题。图像模型不认识字母表。它不知道 B 是 B,也不知道 B 排在 C 前面。它看过数十亿张含有「看起来像文字」区域的图片,于是学会了生成「看起来像文字」的区域。
所以失败的结果才有那种特征性的样子:从来不是彻底的乱码,而是差一点就对。比例对、字距对、字体对,中间夹着两个生造的字。模型完美完成了它真正在做的事,也就是画出一种排版质感。
再加上在一张图里,文字相对于其余部分往往很小。模型把注意力分配给填满画面的东西。一块高二十像素的招牌得不到它需要的照料,「面包坊」就是在这一步掉了一笔。
文字上真正改变了的东西
带有强语言理解训练的近期模型能稳定地把短文字写对:文字问题今天是一个选模型的问题。
这就是很多人没有更新的地方,因为他们在 2023 年形成了看法,之后再没打开过。图里的文字现在可以了,前提是你拿出对的模型。
先是语言模型、然后才画画的那些模型有结构性优势:它们在画之前就知道什么是一个词。Nano Banana Pro 建立在 Gemini 3 Pro 之上,能处理图内文字和精确排版。GPT Image 2 完全是同一种性格:它的长处不是质感,而是听话,短文字写得干净。
旁边,Recraft V4.1 出身设计圈,能把短文字干净地嵌进一个图形构图里,海报或标志的第一反应就是它。而 Flux 2 Max 在需要照片级真实感又要求招牌可读时,文字水平比 Flux 2 Pro 高一档。
有文字时不要用的模型
又快又便宜的模型能出很好的图,但不会写字:1 积分的 Flux Schnell 用来探索仍然无敌,用来做承载一个词的视觉则完全不行。
上一段的推论,也是最费积分的一条。1 积分的 Flux Schnell 用来探索构图、试构图取景、确定氛围非常合适。它不会把你的口号写对,再跑十五次也不会变。
代价高昂的反应,是抱着一开始那个模型不放。你已经生成到第十二次,白花了十二积分,而换一个会写字的模型本来能一次就用 8 或 19 积分解决问题。
碰到文字缺陷,同一个模型永远不要跑超过三次。三次不行,说明模型做不到,不是你要求得不好。换模型,就这样。
怎么写指令,文字才出得对
把准确的文字放进引号,明确要求它按这个拼写出现且不出现任何其他词,并且只用几个字。
措辞和模型一样重要。在提示词里用引号写下准确的文字,然后加一句锁死的话:必须出现,完全按此拼写,清晰可读,不出现任何其他文字。没有这句话,模型很乐意在你的标题下面加一句它自己编的宣传语。
第二条规则:保持简短。一个品牌名、一句五个字的口号、一个日期。整整一段文字放进图里,今天没有哪个模型能做干净,从平面设计角度看也不是好主意。长文字放在剪辑里或排版软件里,不在生成里。
第三条规则:给它地方。明确要求文字占据一块大而对比清楚的区域。让模型在街道尽头的招牌上写六个字,它会在满画面标题能成功的地方失败。这和任何指令都是同一个逻辑,这个话题在写出管用的提示词里有更完整的讨论。
手:三个构图选择解决大部分问题
取景切在手以上、让手拿住一件东西、把手移出清晰平面:这三个决定不花一个积分就能消除大多数失败。
关于手,没人有神奇解法,我也不会给你编一个。近期模型比两年前明显好了,但没有哪个能保证每次都是五根手指。管用的做法是不要给它们出最难的题。
第一个选择:取景。胸部以上的中景或脸部特写从结构上消除了问题。看看专业广告摄影,它切在手以上的频率比人们以为的高得多。相机节点让你干净地锁定这个取景,而不是指望它。
第二个选择:把手占住。一只手拿着杯子、手机、笔、方向盘,什么都行,就是一只姿势被物体约束的手,模型处理这类构型比处理凭空张开的手好得多。第三个选择:把它移出清晰区。相机节点里 f/1.4 的光圈会把手放进背景虚化里,糊掉的手指不会被数。
描述动作,而不是解剖
在提示词里数手指没有用:模型不数数,要描述的是动作,是手拿着什么、怎么拿。
所有人的第一反应都是在提示词里写五根手指。没用,以后也不会有用,因为模型根本没有计数机制。你可以写「恰好五根手指、解剖学上正确的手」,它没有任何规则可以执行。
管用的是把场景描述成姿势自然确定的样子。两只手平放在桌上。一只手握住杯子的把手。双臂交叉。手插在口袋里。你描述的是模型在稳定姿势下见过上百万次的构型,它就能还原出来。
其实和其他一切是同一个原理:描述一个具体情境比给模型抽象要求能得到多得多。描述一个动作,它会。遵守一个数字约束,它不会。
修,而不是重跑:定点编辑
编辑模型接手你的图,只改你描述的部分:修一只手花几个积分,而重新完整生成还要重新验证一次构图。
这就是能改变一切的习惯,也是新手没有的习惯。当一张图已经好到 95 分,不要重跑。要修。
6 积分的 Flux Kontext 从不从零开始:它要求一张输入图,按指令改造它,保住纯生成模型会随机重组的部分。你把图给它,只描述该变的地方:修好左手,让它握住杯子的把手,其他什么都不要改。
10 积分的 Nano Banana 2 以理解复合指令的方式做同样的活,2 积分的 GPT Image Mini 是目录里做简单修图最便宜的选项。无论哪种情况,指令的后半段都必须列出不动的东西:脸、姿势、取景、光线、场景。没有这份清单,模型还给你的是另一张图,很好,但是另一张。
交付前放大,所有人都跳过的那一遍检查
缺陷在百分之百下才看得见,缩略图上看不见:交付前把图放大要花 12 积分,能避免印出来才发现的事故。
生成的图在画布缩略图上看一眼,通过,发出去。三周后它被印成 A2,手上有六根手指。这事我碰到过,一次就足以养成习惯。
这一遍检查花两分钟。你把图放大打开,按顺序扫三块区域:手,所有带文字的地方包括背景,然后是眼睛和牙齿。这三遍能抓住几乎全部缺陷。
对要送印的视觉,用 12 积分的 Topaz Precision 的增强节点能干净地放大,顺带把低分辨率藏起来的东西暴露出来。这和让照片变清晰里说的是同一个工具,它既是放大器,也是检查用的放大镜。
其他会暴露 AI 图的细节
过于整齐的牙齿、重影的首饰、前后矛盾的布料花纹、对不上任何东西的反光:同样的成因产生另一些缺陷,没那么出名,但一样明显。
手和文字最出名,但同样的机制也产生别的失败。牙齿,常常太多也太整齐,因为它们小而重复。首饰和眼镜,会在镜腿处出现重影。布料花纹,条纹或格子,在衣服中间朝一个方向走完又换一个方向。
反光是单独一类,而且非常说明问题:在镜子或橱窗里,模型画出看起来像反光的东西,却不核对它和场景是否对应。看看人物身后的玻璃,你会经常在里面找到图中任何地方都不存在的东西。
还有人群,一放大背景里的脸就变得令人不安。这里的反应同样是:用取景避开问题,或者用定点编辑把它改掉。这些正是我在生成式 AI 的新手错误里逐条检查的点。
总结起来的做法
有文字就选会写字的模型,取景避开张开的手,用编辑去修而不是重跑,交付前放大检查一遍。
文字方面问题已经解决,是选模型的事:图形类用 Nano Banana Pro、GPT Image 2 或 Recraft,需要带文字的照片级真实感用 Flux 2 Max。准确文字放引号里,加一句锁死的话,最多几个字。
手方面没有完美的模型,答案在调度上:切在手以上,用物体占住手,或者把它移出清晰平面。描述动作,永远不要写手指数量。而当一张图已经好到 95 分,用编辑模型去修,别从零重来。
要在不烧掉预算的情况下试完这些,就在 Flux Schnell 上用 1 积分探索,只在选定的构图上换到 8 或 19 积分的模型。准确价格在每次点击前显示在按钮上,完整价目表在这里。