ブログ

2026年9月5日

崩れた手と読めない文字:AIがこの二つを外す理由と、その切り抜け方

六本指と架空の単語の背後にある本当の技術的理由、いま正しく文字を書けるモデル、そして十回生成し直さずに大半のケースを片づける構図と修整の手順。

Frank Houbre

Frank HoubreImaginode創業者

AI画像を一秒で見破らせる二つの欠点

手と文字は正反対の理由で失敗する。手は変化が大きすぎてきれいに学習できず、文字はモデルが練習していない記号的な正確さを要求する。

誰かに画像を見せます。きれいだし、光もいいし、人物もちゃんと立っている。ところが相手は手を見て、指を数え、それから背景の店の看板を読む。そこには「ブーランジェニー」のような何かが書かれている。

この二つの欠点は画像生成のもっとも見分けやすい署名で、いまや誰もが当てはめるテストになりました。厄介なのは、それ以外は素晴らしい画像と同居することです。粒状感が完璧なポートレートが、六本指の手一つで台無しになる。

いい知らせは、二つの問題は原因が違い、したがって解決策も違うということ。そして2026年、そのうち一方は正しいモデルを選べばほぼ解決しているということです。なぜ外すのかを見てから、具体的に何をすべきかを見ていきます。

手が外れる理由:モデルが実際に学んだもの

手には二十以上の関節があり、学習用の写真の大半では小さく、部分的に隠れて写り、角度によってまるで違う形になる。モデルはそのぼやけた平均を学んだ。

顔は目が二つ、鼻が一つ、口が一つ、常に同じ順番で、ほぼ必ず正面か斜め四十五度、しかも写真の中で最大の要素であることが多い。モデルはそれを似た条件で数億回見ます。とてもよく学習します。

手はすべての点でその逆です。関節が二十以上あるので、取りうる姿勢の数が爆発する。画面の中では小さく、動くのでぶれていることが多く、物や衣服やもう一方の手にしょっちゅう隠れる。そして角度が変われば、同じ手がまるで別物のシルエットになる。

結果としてモデルは手の平均を出します。ドラゴンを頼んだときにドラゴンの平均を出すのと同じです。ただしドラゴンの平均は誰も本物を見ていないので信じられるのに対し、手の平均は誰の目にも飛び込んでくる。しかもその仕組みのどこにも、指が一本多いのは間違いだと教えるものはありません。規則ではなく確率で動いているからです。

文字が外れる理由:モデルは描いているのであって、綴っていない

画像モデルは一画素ずつもっともらしい形を作るだけで、文字を記号として表現していない。だから文字ではなく、文字らしきものを作る。

文字はまったく性質の違う問題です。画像モデルはアルファベットを知りません。BがBであること、Cの前に来ることを知らない。文字らしく見える領域を含む画像を何十億枚も見て、文字らしく見える領域を作ることを学んだのです。

だから失敗にはあの独特の見た目があります。完全な意味不明にはならず、ほぼ正しい。比率も、字間も、書体も合っていて、真ん中に二文字だけ架空の字が混じる。モデルは本当にやっていたこと、つまり活字のようなテクスチャを描くことには完璧に成功しているのです。

さらに画像の中で文字はたいてい他の要素に比べて小さい。モデルは画面を占める部分に注意を配分します。高さ二十画素の看板は必要なだけの手当てを受けられず、そこで「ブーランジェリー」は道中で一文字を落とすわけです。

文字について本当に変わったこと

強い言語理解とともに学習された最近のモデルは、短い文字を確実に正しく書く。文字の問題は今日、モデル選びの問題である。

ここが多くの人が更新していない点です。2023年に意見を固め、その後開き直していないからです。画像の中の文字は、正しいモデルを持ち出しさえすれば、もう機能します。

まず言語モデルであって、そのうえで描くモデルには構造的な利点があります。描く前に単語とは何かを知っているのです。Nano Banana Pro は Gemini 3 Pro を土台にしていて、画像内の文字と正確なレイアウトを扱います。GPT Image 2 もまったく同じ性格です。強みは質感ではなく従順さで、短い文字をきれいに書きます。

その隣で Recraft V4.1 はデザインの世界の出身で、短い文字をグラフィックの構成にきれいに組み込みます。ポスターやロゴなら第一の反射としてこれです。そして Flux 2 Max は、読める看板が入った写実的な画が必要なとき、Flux 2 Pro より一段上で文字を保ちます。

文字があるときに使ってはいけないモデル

速くて安いモデルは書けないまま非常によい画像を出す。1クレジットのFlux Schnellは探索には無敵のままだが、言葉を載せるビジュアルには使えない。

前の段落の裏返しで、いちばんクレジットを無駄にさせるのがこれです。1クレジットの Flux Schnell は構図を探る、フレーミングを試す、雰囲気を確かめるのに最適です。あなたのキャッチコピーを正しく書くことはありませんし、十五回回し直しても変わりません。

高くつく反射は、最初のモデルで粘ることです。十二回目の生成に来て、何も得ずに十二クレジットを使った。書けるモデルに移っていれば、8か19クレジットで一発で片づいていたのに。

文字の欠点に対して、同じモデルを三回を超えて回さないこと。三回で届かないなら、それはモデルにできないということであって、頼み方が悪かったのではありません。モデルを変える、それだけです。

文字が正しく出るための指示の書き方

正確な文字を引用符に入れ、その綴りのまま現れること、他の語を一切出さないことを明示的に要求し、数語にとどめる。

書き方はモデルと同じくらい重要です。プロンプトの中に正確な文字を引用符で書き、そのうえで固定する一文を足します。必ず表示すること、この綴りのまま、完全に読めるように、他の語は一切なし。この一文がないと、モデルはあなたの見出しの下に自作のあおり文句を平気で足します。

第二の規則、短く保つこと。ブランド名、五語のスローガン、日付。段落まるごとを画像の中に、というのは今日どのモデルもきれいにはできませんし、グラフィックとしても良い考えではありません。長い文字は編集かレイアウトソフトで載せるもので、生成でやるものではありません。

第三の規則、場所を与えること。文字が広くコントラストの効いた面積を占めるよう明示的に頼みます。通りの奥の看板に六文字書けと言われたモデルは、画面いっぱいの見出しなら成功する場面で失敗します。どんな指示でも同じ理屈で、この話題は効くプロンプトの書き方でより広く扱っています。

手:本質を片づける三つのフレーミングの選択

手より上で切る、手に物を持たせる、ピント面から外す。この三つの決断が、1クレジットもかけずに失敗の大半を消す。

手について奇跡の解決策を持っている人はいませんし、私も作り話をするつもりはありません。最近のモデルは二年前よりはっきり上手くなりましたが、毎回五本指を保証するものはありません。効くのは、いちばん難しい課題を出さないことです。

第一の選択、フレーミング。バストショットか顔のクローズアップなら、構造的に問題が消えます。プロの広告写真を見てください。思っているよりずっと頻繁に手より上で切っています。カメラノードを使えば、そのフレーミングを期待するのではなくきちんと固定できます。

第二の選択、手をふさぐ。カップ、スマホ、ペン、ハンドル、何でもいいので何かを持つ手は、物によって姿勢が拘束された手であり、モデルは宙に開いた手よりそうした構成のほうがはるかに上手い。第三の選択、ピント面から外す。カメラノードでf/1.4の絞りにすれば手は背景ボケに入り、ぼけた指は数えられません。

解剖ではなく動作を書く

プロンプトで指を数えても効かない。モデルは数えない。書くべきは仕草であり、手が何をどう持っているかである。

誰もがやる反射が、プロンプトに指五本と書くことです。効きませんし、これからも効きません。モデルには数える仕組みが一切ないからです。ちょうど五本の指、解剖学的に正しい手、と書いても、適用すべき規則がないのです。

効くのは、姿勢が自ずと決まるように場面を書くことです。両手をテーブルに平らに置いて。片手でカップの取っ手を握って。腕を組んで。手をポケットに入れて。モデルが安定した姿勢で何百万回も見てきた構成を書けば、それを返してきます。

実のところ他のすべてと同じ原理です。モデルに抽象的な指示を出すより、具体的な状況を書くほうがはるかに多くを得られる。動作を書くことは、モデルにはできる。数の制約に従うことは、できないのです。

回し直さずに直す:狙った編集

編集モデルはあなたの画像を受け取り、書いたところだけを変える。手を直すのは数クレジット、対して完全な再生成は新しい構図の検証まで付いてくる。

これがすべてを変える習慣で、初心者が持っていないものです。画像が95パーセント良いなら、回し直さない。直すのです。

6クレジットの Flux Kontext はゼロから始めることが決してありません。入力画像を必須とし、指示に沿って変形し、純粋な生成モデルなら勝手に組み直してしまう部分を保ちます。自分の画像を渡し、変えるべきところだけを書く。左手を直して、カップを取っ手で持たせて、他は何も変えないで。

10クレジットの Nano Banana 2 は複合的な指示を理解して同じ仕事をこなし、2クレジットの GPT Image Mini は簡単な修整ならカタログで最も安い選択肢です。いずれの場合も、指示の後半では動かさないものを列挙してください。顔、ポーズ、フレーミング、光、背景。この列挙がないと、モデルは別の画像を返してきます。とても良い、けれど別の画像を。

納品前の拡大、誰もが飛ばす見直し

欠点は等倍で見える、サムネイルでは見えない。納品前に画像を拡大するのは12クレジットで、印刷して初めて見つかる事故を防ぐ。

生成した画像をキャンバスのサムネイルで見て、承認して、送る。三週間後、A2で印刷されていて、手の指が六本ある。私も経験しましたし、一度あれば習慣になります。

見直しは二分です。画像を大きく開いて、三つの領域を順に走査します。手、背景も含めて文字が入っているところすべて、それから目と歯。この三巡でほぼすべての欠点が捕まります。

印刷に回すビジュアルなら、12クレジットの Topaz Precision を使う改善ノードがきれいに拡大し、ついでに低解像度が隠していたものを暴きます。写真をくっきりさせるで説明したのと同じ道具で、拡大機であると同時に検査用の虫眼鏡でもあります。

AI画像を見破らせる、その他の細部

整いすぎた歯、二重になる装身具、辻褄の合わない布の柄、何にも対応しない映り込み。同じ原因が、あまり知られていないが同じくらい目立つ別の欠点を生む。

手と文字が主役ですが、同じ仕組みが別の失敗も生みます。歯は、小さくて反復的なせいで多すぎたり整いすぎたりする。宝飾品や眼鏡は、つるのあたりで二重になる。布の柄、ストライプやチェックは、衣服の途中で向きが変わる。

映り込みは別格で、とても分かりやすい例です。鏡やショーウィンドウの中に、モデルは場面と対応しているか確かめずに、映り込みらしきものを描きます。人物の後ろのガラスを見てください。画像のどこにも存在しないものが、しょっちゅう見つかります。

そして群衆。奥の顔は拡大した途端に不気味になります。ここでも反射は同じです。問題を避けるフレーミングか、それを直す狙った編集か。まさに生成AIの初心者がやる間違いで点検している項目です。

手順のまとめ

文字があるなら書けるモデルを選び、開いた手を避けるように切り、回し直さず編集で直し、納品前に大きくして見直す。

文字については問題は解決済みで、モデルの問題です。グラフィックならNano Banana Pro、GPT Image 2、Recraft、文字入りの写実が必要ならFlux 2 Max。正確な文字を引用符に、固定の一文、多くても数語。

手については完璧なモデルはなく、答えは演出にあります。上で切る、物で手をふさぐ、ピント面から外す。仕草を書き、指の本数は決して書かない。そして画像が95パーセント良いなら、ゼロからやり直さず編集モデルで直すこと。

予算を溶かさずにこれを全部試すには、Flux Schnellの1クレジットで探索し、採用した構図でだけ8か19クレジットのモデルに移ること。正確な価格はクリックの前にボタン上に表示され、一覧はこちらにあります。

実際のキャンバスで試してみませんか?

この記事で紹介した内容は、すべてブラウザ上のImaginodeで実践できます。

始める