2026年9月5日
提示词要用英文写吗?答案取决于模型
你用母语输入时真正送到模型的是什么,为什么英文长期是必选项,今天哪些模型能无损理解其他语言,以及一个 6 积分的测试如何为你的情况下结论。

Frank HoubreImaginode 創辦人
所有人都有、却不好意思问出口的问题
你的提示词会原封不动地送到模型,中间没有任何翻译:所以你用什么语言,对结果是有真实影响的。
这是最早被问到的问题之一,常常压低声音问,好像它是个蠢问题。它一点也不蠢。它有真正的技术答案,而这个答案最近变了。
先说最重要、也没人说的一点:你的键盘和模型之间没有自动翻译。你打什么就送什么。你用中文写,送到模型的就是中文,随之而来的后果也都在。
那么,母语还是英文?诚实的回答是,这取决于你选的模型,而且有一个三分钟的测试能为你的具体情况下结论。两件事我们都做:先弄明白为什么,再动手测。
为什么英文长期是唯一正确答案
图像模型学习的图片,配文绝大多数是英文:其他语言的词在其中出现得太少,因此和它所描述的东西联系得更弱。
图像模型通过看几亿组图片和配文来学习。这些配文来自网页,而为这类任务索引的网页是压倒性的英文世界。
机械的结果是:golden hour 这个短语被看到几百万次,贴在傍晚拍的照片上。中文的「黄金时刻」少得多。所以模型对其中一个的联系牢固得多,而中文提示词往往给出更含糊、更泛化、更松散的结果。
这就是那条从 2022 年起被到处重复的万能建议「提示词写英文」的来处。它当时是对的。今天对得少多了,而不加区分地继续重复它,会让人错过重要的东西。
变化在哪:先理解、再作画的模型
近期依托大语言模型的图像模型会先解读指令再生成,而这种理解是真正多语言的。
新一代图像模型不再只是把词语对应到质感。有些会经过一个语言模型,由它读懂你的要求,再去驾驶生成。
Nano Banana Pro 建立在 Gemini 3 Pro 之上,是目录里理解长指令能力最强的。Nano Banana 2 跑的是 Gemini 3.1 Flash 的图像生成。GPT Image 2 出自同一个世界,它的长处被明确定位为听从指令而不是质感。
这些模型理解中文的方式和理解英文一样,因为负责理解的那部分是一个用几十种语言训练过的语言模型。在它们上面,用母语写几乎不付代价,反而因为用母语而更精确。
英文仍然更可取的模型
又快又便宜的纯图像模型,用英文仍然更忠实:在专业词汇上尤其明显。
在目录的另一端,经典扩散模型没有语言理解层。它们把你的文字编码,当成一份统计指引来用。在那里,语言仍然算数。
1 积分的 Flux Schnell、整个 Flux 家族,以及所有在本地跑 Stable Diffusion 的东西,都属于这一类。用英文你会得到更忠实的结果,尤其是提示词里出现精确词汇的时候。
顺带一说,这不是模型质量的问题:Flux 2 Pro 做的图非常漂亮。这是它怎么读你文字的问题。一个出色的模型,可以是一个糟糕的中文读者。
为你的情况下结论的 6 积分测试
在你用的模型上,把同一条提示词用母语生成三次,再用它的英文译文生成三次:差距要么立刻看得见,要么根本不存在。
别听我的,自己测。在 Flux Schnell 上花 6 积分,三分钟就够,而且结论对你的模型、你的题材、你的风格有效。
写一条带点专业词汇的提示词:仰拍站在悬崖边的女人,傍晚的逆光,浅景深。生成三次。然后把同一条提示词译成英文,在同一个模型、同一个比例下生成三次。
把六张图放在一起看。如果英文那三张把仰拍角度和逆光守得更好,说明你的模型偏好英文,你从此一劳永逸地知道了。如果差距看不出来,那就毫无顾虑地用母语写:你在自己的语言里更精确,而精确比语言更重要。
英文确实保有优势的那部分词汇
电影和摄影的专业术语在英文里是密度极高的关键词,而在其他语言里的对应说法往往更含糊或更长。
哪怕在一个完全理解中文的模型上,某些英文词依然更优,而这是密度的问题,不是语言的问题。
看看 bokeh、golden hour、backlit、rim light、low angle、shallow depth of field、dolly in。每一个词都只指一件确切的事,而模型看过它们上百万次,正好贴着那个效果。中文的对应说法常常要绕一句话,一绕就稀释了。
所以有了混合写法,也是我实际的做法:场景、动作和意图用母语,专业术语用英文。一个奔跑的女人身上的 golden hour 逆光,shallow depth of field。读起来很丑,效果很好,因为提示词不是一段文章,是一张指令清单。
相机节点已经替你写好了英文
相机节点的设置以英文提示词片段的形式送到模型:凡是调度的部分,语言问题已经解决了。
我几乎不再在提示词里写专业词汇,是有原因的,而且原因是结构性的。相机节点里有取景、镜头、光圈、角度和运动的菜单。
你看不见的是,这些菜单的每一个选项都以英文提示词片段的形式存着,送到模型的正是这个片段。你在母语界面里选「特写」,模型收到的是它烂熟于心的英文术语。
好处不止于翻译。你不用再背词汇,不会再用错术语,而且这个设置会接到多个节点上保持一致。每一项设置具体改变什么,写在在 AI 里调度镜头里。
图里的文字:完全是另一个问题
提示词的语言和要显示的文字的语言是独立的:把母语词放进引号里就能得到,指令用什么语言都不影响。
注意别把两件事混在一起。你下指令用的语言,和要出现在图里的文字用什么语言,毫无关系。
如果你的海报上要写「面包坊」,就把这个准确的词放进引号写在提示词里,并加上必须按此原样出现、不得出现任何其他文字。指令的其余部分用英文也行,不影响。
对中文还有两点提醒。汉字在有些模型上比拉丁字母更容易出错,所以务必放大检查。并且选一个会写字的模型:Nano Banana Pro、GPT Image 2 或 Recraft V4.1。这个话题的完整版在手畸形、文字读不通里。
毁掉一次生成的假朋友
把专业术语逐字翻译,经常得到与预期相反的效果:一些常用词是已知的陷阱。
如果你转用英文,别拿词典硬翻。几个总会出现、而且很费生成次数的例子。
电影里的「镜头」是 shot,不是 lens,也不是 plan。「画面」是 frame,不是 screen 也不是 box。「氛围」是 mood 或 atmosphere,不要单用 ambiance,这个词存在,但在日常英文里指别的东西。而「清晰」是 sharp 或 in focus,绝不是 net。
稳妥的做法是让语言模型来写这条英文提示词,而不是自己翻。文本节点用 1 到 3 积分就能做:把你的想法用母语给它,要求输出一条英文图像提示词,详细、用电影词汇、不要标题也不要评论。
视频也一样吗
视频模型遵循同样的逻辑,但从一张起始图出发时,视频提示词短到这个问题几乎失去意义。
规则相同:依托强语言理解的视频模型能很好地接住中文,其他的偏好英文。这方面没有新东西。
只是实际操作中这个问题少得多。工作方式规范的话,视频节点收到的是一张已经确认过的起始图,提示词只描述运动。镜头缓慢推进。手合拢。三个词,语言在这里已经改变不了什么。
这是分镜方法一个令人愉快的副作用,见在为视频付费之前用 AI 做分镜:把负担从文字移到图像上,语言问题就几乎无从谈起了。
我具体是怎么做的
场景和意图用母语,专业术语用英文,调度交给相机节点,遇到新模型就做六张图的测试。
我的做法三行就能写完。场景、动作和意图用母语写,因为我在自己的语言里更精确,而精确是提示词里最要紧的东西。专业术语保留英文,因为它们更密。
所有调度都走相机节点,所以根本不在我的文字里。而当目录里进了新模型,我会先做六张图的测试再形成看法。花 6 积分,省下几个月的错误信念。
我不再给的建议是:不动脑子直接用英文写。三年前这是对的,今天在半个目录上都会损失精确度。而一条精确的母语提示词,永远胜过一条含糊的英文提示词。
总结
在依托语言模型的模型上,用母语写;在纯扩散模型上,改用英文或两者混合。
Nano Banana 2 和 Pro、GPT Image 2:中文通过时没有明显损失,用你的语言写。Flux Schnell、Flux 家族以及所有本地跑的东西:英文仍然更忠实,尤其在专业词汇上。
无论哪种情况,电影词汇用英文都仍是个好反应,而相机节点已经替你省掉了其中的大部分。要显示在图里的文字放进引号,与指令的语言无关。
如果你想深挖的是提示词的结构而不是它的语言,那才是结果差异真正被决定的地方:写出管用的提示词拆解了完整的解剖,主体、动作、取景、光线、风格。