Блог

5 сентября 2026 г.

Искажённые руки и нечитаемый текст: почему ИИ проваливает именно эти две вещи и как выкрутиться

Настоящая техническая причина шести пальцев и выдуманных слов, модели, которые сегодня пишут правильно, и метод кадрирования и ретуши, решающий большинство случаев без десяти новых генераций.

Frank Houbre

Frank HoubreОснователь Imaginode

Два дефекта, выдающие изображение ИИ за секунду

Руки и текст проваливаются по противоположным причинам: руки слишком изменчивы, чтобы выучиться чисто, а текст требует символьной точности, которую модель никогда не отрабатывает.

Вы показываете кому то своё изображение. Красиво, свет хороший, персонаж стоит ровно. И человек смотрит на руку, считает пальцы, а потом читает вывеску магазина на заднем плане, где написано что то вроде ПЕКАРНЛ.

Эти два дефекта, самые узнаваемые подписи генерации изображений, стали тестом, который применяет каждый. Раздражает то, что они соседствуют с во всём остальном превосходными картинками: портрет с идеальным зерном, испорченный рукой с шестью пальцами.

Хорошая новость в том, что у двух проблем разные причины и, значит, разные решения. И что в 2026 году одна из двух в основном решена, если взять правильную модель. Разберём, почему это не выходит, а потом что именно делать.

Почему проваливаются руки: что модель на самом деле выучила

У руки больше двадцати суставов, на большинстве обучающих фотографий она крошечная и частично закрыта, а от угла зависит форма, не похожая на себя же: модель выучила её размытое среднее.

Лицо, это два глаза, нос, рот, всегда в одном порядке, почти всегда анфас или в три четверти, и часто самый крупный элемент кадра. Модель видит это сотни миллионов раз в сопоставимых условиях. Она учится очень хорошо.

Рука во всём противоположна. Больше двадцати суставов, значит число возможных положений взрывается. Она мала в кадре, часто смазана, потому что движется, регулярно спрятана за предметом, одеждой или другой рукой. И в зависимости от угла одна и та же рука даёт силуэты, не имеющие между собой ничего общего.

В итоге модель выдаёт среднее по рукам, ровно так же, как выдаёт среднее по драконам, когда вы просите дракона. Только среднее по драконам остаётся правдоподобным, живого никто не видел, а среднее по рукам бросается в глаза кому угодно. И ничто в её устройстве не говорит ей, что лишний палец, это ошибка: у неё нет правил, у неё вероятности.

Почему проваливается текст: модель рисует, она не пишет по буквам

Модель изображения выдаёт правдоподобные формы пиксель за пикселем, без представления букв как символов: поэтому она делает нечто похожее на письмо, а не письмо.

Текст, это проблема иной природы. Модель изображения не знает алфавита. Она не знает, что Б, это Б и что она идёт перед В. Она видела миллиарды картинок с зонами, похожими на текст, и научилась выдавать зоны, похожие на текст.

Поэтому у неудач такой характерный вид: это никогда не полная бессмыслица, это почти правильно. Верные пропорции, верные межбуквенные просветы, верная гарнитура, и две выдуманные буквы посередине. Модель прекрасно справилась с тем, что делала на самом деле, то есть нарисовала типографскую фактуру.

Добавьте, что в изображении текст обычно крошечный по сравнению с остальным. Модель распределяет внимание на то, что заполняет кадр. Вывеска высотой в двадцать пикселей не получает нужной заботы, и именно там ПЕКАРНЯ теряет по дороге букву.

Что действительно изменилось с текстом

Недавние модели, обученные с сильным языковым пониманием, надёжно пишут короткий текст правильно: проблема текста сегодня, это проблема выбора модели.

Вот пункт, который многие не обновили, потому что составили мнение в 2023 году и больше к нему не возвращались. Текст в изображении теперь работает, при условии что вы достанете правильную модель.

У моделей, которые сначала языковые, а рисуют потом, есть структурное преимущество: они знают, что такое слово, до того как его нарисовать. Nano Banana Pro опирается на Gemini 3 Pro и справляется с текстом в изображении и точной вёрсткой. У GPT Image 2 ровно такой же профиль: его сила не фактура, а послушание, и короткий текст он пишет чисто.

Рядом Recraft V4.1 вышел из мира дизайна и аккуратно встраивает короткий текст в графическую композицию, что делает его первым рефлексом для афиши или логотипа. А Flux 2 Max держит текст на ступень выше Flux 2 Pro, когда нужен фотореализм с читаемой вывеской внутри.

Модели, которых не стоит брать, когда есть текст

Быстрые и дешёвые модели выдают очень хорошие картинки, не умея писать: Flux Schnell за 1 кредит остаётся непобедимым для поиска и непригодным для визуала, несущего слово.

Следствие предыдущего абзаца, и то, что съедает больше всего кредитов. Flux Schnell за 1 кредит идеален, чтобы исследовать композицию, проверить кадрирование, утвердить настроение. Ваш слоган он не напишет правильно, и пятнадцать перезапусков ничего не изменят.

Дорого обходится рефлекс держаться за модель, с которой начали. Вы на двенадцатой генерации, потратили двенадцать кредитов впустую, тогда как переход на модель, умеющую писать, решил бы задачу с первого раза за 8 или 19 кредитов.

Никогда не перезапускайте одну и ту же модель больше трёх раз из за дефекта текста. Если трёх попыток не хватило, значит модель этого не умеет, а не вы плохо попросили. Смените модель, вот и всё.

Как написать инструкцию, чтобы текст вышел правильным

Возьмите точный текст в кавычки, явно потребуйте, чтобы он появился именно в таком написании и чтобы не появилось никаких других слов, и ограничьтесь несколькими словами.

Формулировка значит не меньше модели. Напишите точный текст в кавычках внутри промпта, а затем добавьте фразу, которая закрывает лазейку: должен появиться, написанным ровно так, полностью читаемым, никаких других слов. Без этой фразы модель охотно добавит под ваш заголовок собственный придуманный слоган.

Второе правило: держитесь коротко. Название бренда, слоган из пяти слов, дата. Целый абзац внутри картинки сегодня не сделает чисто ни одна модель, да и графически это плохая идея. Длинный текст кладут на монтаже или в программе вёрстки, а не в генерации.

Третье правило: дайте ему место. Явно попросите, чтобы текст занимал широкую, контрастную область. Модель, которой нужно написать шесть букв на вывеске в конце улицы, провалится там, где справится с заголовком во весь кадр. Логика та же, что и для любой инструкции, а тема шире разобрана в как написать работающий промпт.

Руки: три решения по кадру, снимающие основное

Кадрируйте выше рук, займите их предметом или выведите из плоскости резкости: эти три решения убирают большинство неудач, не стоя ни одного кредита.

С руками ни у кого нет чудесного решения, и я не стану его выдумывать. Свежие модели справляются заметно лучше, чем два года назад, но ни одна не гарантирует пять пальцев каждый раз. Работает другое: не давать им самое трудное задание.

Первое решение: кадр. Поясной план или крупный план лица снимают проблему конструктивно. Посмотрите на профессиональную рекламную фотографию, она кадрирует выше рук куда чаще, чем принято думать. Узел Камера позволяет задать этот кадр чисто, а не надеяться на него.

Второе решение: займите руку. Рука, держащая чашку, телефон, ручку, руль, неважно что, это рука, чьё положение задано предметом, и такие конфигурации моделям удаются намного лучше открытой ладони в пустоте. Третье решение: выведите её из зоны резкости. Диафрагма f/1.4 в узле Камера кладёт руки в фоновое размытие, а размытый палец не считают.

Описывайте действие, а не анатомию

Считать пальцы в промпте бесполезно: модель не считает, описывать нужно жест, то что рука держит и как она это держит.

Универсальный рефлекс, это написать в промпте пять пальцев. Не работает и работать не будет, потому что у модели нет никакого механизма счёта. Можете написать ровно пять пальцев, анатомически верная рука, ей нечего применять.

Работает описание сцены так, чтобы положение было задано неявно. Обе руки плашмя на столе. Рука сомкнута вокруг ручки чашки. Руки скрещены на груди. Руки в карманах. Вы описываете конфигурацию, которую модель видела миллионы раз в устойчивом положении, и она её воспроизводит.

На деле это тот же принцип, что и во всём остальном: описав конкретную ситуацию, получишь намного больше, чем дав модели абстрактное требование. Описать действие она умеет. Выполнить числовое ограничение не умеет.

Чинить, а не перезапускать: адресное редактирование

Модель редактирования берёт вашу картинку и меняет только то, что вы описали: исправить руку стоит несколько кредитов против полной новой генерации и нового кадра, который снова придётся проверять.

Вот привычка, которая меняет всё, и которой нет у новичков. Когда изображение хорошо на 95 процентов, его не перезапускают. Его чинят.

Flux Kontext за 6 кредитов никогда не начинает с нуля: он требует входное изображение и преобразует его по инструкции, сохраняя то, что чисто генеративные модели пересобрали бы наугад. Вы даёте ему свою картинку и описываете только то, что должно измениться: исправь левую руку, она должна держать чашку за ручку, больше ничего не меняй.

Nano Banana 2 за 10 кредитов делает ту же работу с пониманием составных инструкций, а GPT Image Mini за 2 кредита, это самый дешёвый вариант каталога для простой ретуши. В любом случае вторая половина вашей инструкции должна перечислить то, что не двигается: лицо, поза, кадр, свет, декорация. Без этого перечня модель вернёт вам другое изображение, очень хорошее, но другое.

Увеличение перед сдачей, проверка, которую все пропускают

Дефекты видны при ста процентах, а не на миниатюре: увеличить изображение перед сдачей стоит 12 кредитов и избавляет от ошибки, которая обнаруживается на печати.

Сгенерированное изображение смотрят на миниатюре холста, утверждают и отправляют. Через три недели оно напечатано в A2, а на руке шесть пальцев. Со мной такое было, и одного раза хватает, чтобы завести привычку.

Проверка занимает две минуты. Вы открываете изображение крупно и по порядку проходите три зоны: руки, всё, что содержит текст, включая фоны, затем глаза и зубы. Эти три прохода ловят почти все дефекты.

Для визуала, который пойдёт в печать, узел Улучшить с Topaz Precision за 12 кредитов увеличивает чисто и попутно вскрывает то, что прятало низкое разрешение. Это тот же инструмент, что описан в сделать фотографию чёткой, и он служит контрольной лупой не меньше, чем увеличителем.

Другие детали, выдающие изображение ИИ

Слишком ровные зубы, двоящиеся украшения, несогласованные узоры ткани, отражения, которым ничто не соответствует: те же причины дают другие дефекты, менее известные, но столь же заметные.

Руки и текст в центре внимания, но та же механика даёт и другие промахи. Зубы, часто слишком многочисленные и слишком ровные, потому что они мелкие и повторяющиеся. Украшения и очки, двоящиеся на дужках. Узоры ткани, полоска или клетка, идущие в одну сторону, а посреди одежды в другую.

Отражения, это отдельный и очень показательный случай: в зеркале или витрине модель рисует нечто похожее на отражение, не проверяя, соответствует ли оно сцене. Посмотрите на стёкла за вашими персонажами, вы регулярно найдёте там вещи, которых нет нигде в изображении.

И толпа, где лица на заднем плане становятся тревожными, стоит приблизить. Здесь рефлекс тот же: кадр, обходящий проблему, или адресное редактирование, которое её исправляет. Это ровно те пункты, которые я разбираю в ошибки новичка в генеративном ИИ.

Порядок действий, коротко

Берите модель, которая пишет, когда есть текст, кадрируйте так, чтобы избежать раскрытых ладоней, чините редактированием вместо перезапуска и проверяйте крупно перед сдачей.

С текстом проблема решена, и это вопрос модели: Nano Banana Pro, GPT Image 2 или Recraft для графики, Flux 2 Max, когда нужен фотореализм с текстом внутри. Точный текст в кавычках, запирающая фраза, максимум несколько слов.

С руками идеальных моделей нет, и ответ в постановке: кадрировать выше, занять руку предметом или вывести её из плоскости резкости. Описывайте жест, никогда число пальцев. А когда изображение хорошо на 95 процентов, чините его моделью редактирования, а не начинайте заново.

Чтобы проверить всё это, не спалив бюджет, ищите за 1 кредит на Flux Schnell и переходите на модель за 8 или 19 кредитов только на выбранной композиции. Точная цена показывается на кнопке перед каждым кликом, а полная таблица здесь.

Хотите попробовать на настоящем холсте?

Всё, что описано в этой статье, делается в Imaginode, прямо в браузере.

Начать