2026년 9월 5일
일그러진 손과 읽을 수 없는 글자: AI가 이 둘을 놓치는 이유와 빠져나오는 법
여섯 손가락과 지어낸 단어 뒤에 있는 진짜 기술적 이유, 오늘날 글자를 제대로 쓰는 모델들, 그리고 열 번 다시 생성하지 않고 대부분의 경우를 해결하는 구도와 보정 방법.

Frank HoubreImaginode 창업자
AI 이미지를 1초 만에 들통나게 하는 두 가지 결함
손과 글자는 정반대의 이유로 실패한다. 손은 변화가 너무 커서 깨끗하게 학습되지 않고, 글자는 모델이 연습하지 않는 기호적 정확성을 요구한다.
누군가에게 이미지를 보여줍니다. 예쁘고, 빛도 좋고, 인물도 똑바로 서 있습니다. 그런데 상대는 손을 보고 손가락을 세더니, 배경의 가게 간판을 읽습니다. 거기엔 「베이커니」 같은 무언가가 쓰여 있습니다.
이 두 결함은 이미지 생성의 가장 알아보기 쉬운 서명이고, 이제 모두가 적용하는 시험이 되었습니다. 답답한 건 나머지가 훌륭한 이미지와 함께 존재한다는 점입니다. 입자감이 완벽한 초상이 손가락 여섯 개짜리 손 하나로 망가집니다.
좋은 소식은 두 문제의 원인이 다르고 따라서 해법도 다르다는 것입니다. 그리고 2026년에는 둘 중 하나는 올바른 모델만 고르면 사실상 해결되었다는 것입니다. 왜 실패하는지 보고, 그다음 정확히 무엇을 해야 하는지 보겠습니다.
손이 실패하는 이유: 모델이 실제로 배운 것
손에는 스무 개가 넘는 관절이 있고, 대부분의 학습용 사진에서 작고 부분적으로 가려진 채 나타나며, 각도에 따라 완전히 다른 형태가 된다. 모델은 그 흐릿한 평균을 배웠다.
얼굴은 눈 둘, 코 하나, 입 하나이고 항상 같은 순서이며, 거의 언제나 정면이나 사분의 삼 각도이고, 사진에서 가장 큰 요소인 경우가 많습니다. 모델은 그것을 비슷한 조건에서 수억 번 봅니다. 아주 잘 배웁니다.
손은 모든 점에서 그 반대입니다. 관절이 스무 개가 넘으니 가능한 자세의 수가 폭발합니다. 화면 안에서 작고, 움직이니 흔들려 있는 경우가 많고, 물건이나 옷이나 다른 손에 자주 가려집니다. 그리고 각도에 따라 같은 손이 서로 아무 상관 없는 실루엣을 만듭니다.
결과적으로 모델은 손의 평균을 내놓습니다. 용을 요청하면 용의 평균을 내놓는 것과 같습니다. 다만 용의 평균은 아무도 실물을 본 적이 없으니 그럴듯하게 남지만, 손의 평균은 누구의 눈에나 곧바로 들어옵니다. 게다가 그 작동 방식 어디에도 손가락 하나가 더 있는 것이 잘못이라고 알려주는 것이 없습니다. 규칙이 아니라 확률로 움직이니까요.
글자가 실패하는 이유: 모델은 그리는 것이지 철자를 쓰는 것이 아니다
이미지 모델은 픽셀 단위로 그럴듯한 형태를 만들 뿐, 글자를 기호로 표현하지 않는다. 그래서 글씨가 아니라 글씨처럼 보이는 것을 만든다.
글자는 성질이 다른 문제입니다. 이미지 모델은 알파벳을 모릅니다. B가 B라는 것도, C보다 앞에 온다는 것도 모릅니다. 글자처럼 보이는 영역이 들어간 이미지를 수십억 장 보았고, 글자처럼 보이는 영역을 만드는 법을 배웠을 뿐입니다.
그래서 실패한 결과물은 그 특유의 모양을 합니다. 완전한 횡설수설은 절대 아니고, 거의 맞습니다. 비율도 맞고, 자간도 맞고, 서체도 맞는데, 가운데에 지어낸 글자가 두 개 섞여 있습니다. 모델은 자기가 실제로 하던 일, 즉 활자 같은 질감을 그리는 일에는 완벽하게 성공한 것입니다.
여기에 이미지 안에서 글자는 나머지에 비해 작은 경우가 많다는 점을 더하세요. 모델은 화면을 채우는 것에 주의를 배분합니다. 높이 스무 픽셀짜리 간판은 필요한 만큼의 정성을 받지 못하고, 바로 거기서 「베이커리」가 가는 길에 글자 하나를 흘립니다.
글자에서 실제로 달라진 것
강한 언어 이해와 함께 학습된 최근 모델들은 짧은 글자를 안정적으로 정확히 쓴다. 글자 문제는 오늘날 모델 선택의 문제다.
많은 사람이 갱신하지 않은 지점이 여기입니다. 2023년에 의견을 굳히고 다시 열어본 적이 없기 때문입니다. 이미지 속 글자는 이제 됩니다. 올바른 모델을 꺼내 온다는 조건에서요.
먼저 언어 모델이고 그다음에 그리는 모델들은 구조적 이점이 있습니다. 그리기 전에 단어가 무엇인지 압니다. Nano Banana Pro는 Gemini 3 Pro에 기반해 이미지 속 글자와 정밀한 레이아웃을 다룹니다. GPT Image 2도 성격이 정확히 같습니다. 강점은 질감이 아니라 순종이고, 짧은 글자를 깔끔하게 씁니다.
그 옆에서 Recraft V4.1은 디자인 쪽 출신이라 짧은 글자를 그래픽 구성 안에 깔끔하게 넣습니다. 포스터나 로고라면 첫 번째 반사로 이것입니다. 그리고 Flux 2 Max는 읽히는 간판이 들어간 사실적인 결과가 필요할 때 Flux 2 Pro보다 한 단계 위로 글자를 지탱합니다.
글자가 있을 때 쓰지 말아야 할 모델
빠르고 싼 모델은 쓸 줄 모른 채 아주 좋은 이미지를 만든다. 1크레딧짜리 Flux Schnell은 탐색에는 여전히 무적이지만, 단어를 실은 비주얼에는 쓸 수 없다.
앞 문단의 따름정리이고, 크레딧을 가장 많이 잃게 하는 것입니다. 1크레딧의 Flux Schnell은 구도를 탐색하고, 프레이밍을 시험하고, 분위기를 확정하는 데 완벽합니다. 당신의 슬로건을 제대로 쓰지는 못하고, 열다섯 번 더 돌려도 달라지지 않습니다.
비싸게 먹히는 반사는 처음 쓰던 모델로 버티는 것입니다. 열두 번째 생성에 와서 아무것도 없이 열두 크레딧을 썼습니다. 쓸 줄 아는 모델로 넘어갔다면 8이나 19크레딧으로 한 번에 끝났을 문제인데요.
글자 결함에 같은 모델을 세 번을 넘겨 돌리지 마세요. 세 번으로 안 되면 모델이 못 하는 것이지, 당신이 잘못 요청한 게 아닙니다. 모델을 바꾸세요, 그게 전부입니다.
글자가 제대로 나오게 지시를 쓰는 법
정확한 문구를 따옴표에 넣고, 그 철자 그대로 나타날 것과 다른 어떤 단어도 나오지 않을 것을 명시적으로 요구하고, 몇 단어로 제한한다.
표현은 모델만큼 중요합니다. 프롬프트에 정확한 문구를 따옴표로 쓰고, 그다음 잠그는 한 문장을 더하세요. 반드시 나타날 것, 정확히 이 철자로, 완벽히 읽히게, 다른 어떤 단어도 없이. 이 문장이 없으면 모델은 당신 제목 아래에 제가 지어낸 홍보 문구를 기꺼이 덧붙입니다.
두 번째 규칙, 짧게 유지하기. 브랜드명, 다섯 단어짜리 슬로건, 날짜. 문단 하나를 통째로 이미지 안에 넣는 것은 오늘날 어떤 모델도 깔끔하게 하지 못하고, 그래픽적으로도 좋은 생각이 아닙니다. 긴 글자는 편집이나 편집 디자인 프로그램에서 얹는 것이지 생성에서 하는 게 아닙니다.
세 번째 규칙, 자리를 주기. 글자가 넓고 대비가 좋은 면적을 차지하도록 명시적으로 요청하세요. 거리 안쪽 간판에 여섯 글자를 쓰라는 모델은, 화면 가득한 제목이라면 성공할 자리에서 실패합니다. 어떤 지시든 같은 논리이고, 이 주제는 먹히는 프롬프트 쓰기에서 더 넓게 다룹니다.
손: 핵심을 해결하는 세 가지 프레이밍 선택
손 위에서 자르기, 물건으로 손을 채우기, 초점면 밖으로 빼기. 이 세 가지 결정이 1크레딧도 쓰지 않고 실패의 대부분을 없앤다.
손에 관해서는 아무도 기적의 해법이 없고, 저도 지어내지 않겠습니다. 최근 모델들은 2년 전보다 확실히 나아졌지만, 매번 손가락 다섯 개를 보장하는 모델은 없습니다. 통하는 건 가장 어려운 과제를 요구하지 않는 것입니다.
첫 번째 선택, 프레이밍. 가슴 위 샷이나 얼굴 클로즈업이면 구조적으로 문제가 사라집니다. 전문 광고 사진을 보세요. 생각보다 훨씬 자주 손 위에서 자릅니다. 카메라 노드를 쓰면 그 프레이밍을 기대하는 대신 깔끔하게 고정할 수 있습니다.
두 번째 선택, 손을 채우기. 컵, 휴대폰, 펜, 핸들, 무엇이든 쥐고 있는 손은 물건에 의해 자세가 구속된 손이고, 모델은 허공에 펼친 손보다 그런 구성을 훨씬 잘 해냅니다. 세 번째 선택, 선명한 영역에서 빼내기. 카메라 노드에서 f/1.4 조리개를 쓰면 손이 배경 흐림 속에 들어가고, 흐려진 손가락은 세어지지 않습니다.
해부학이 아니라 행동을 묘사하기
프롬프트에서 손가락을 세는 것은 통하지 않는다. 모델은 세지 않는다. 묘사해야 할 것은 동작이고, 손이 무엇을 어떻게 쥐고 있는가다.
누구나 하는 반사가 프롬프트에 손가락 다섯 개라고 쓰는 것입니다. 통하지 않고, 앞으로도 통하지 않을 겁니다. 모델에는 세는 장치가 전혀 없기 때문입니다. 정확히 손가락 다섯 개, 해부학적으로 올바른 손이라고 써도, 적용할 규칙이 없습니다.
통하는 것은 자세가 저절로 정해지도록 장면을 묘사하는 것입니다. 두 손을 탁자에 평평하게 올리고. 한 손으로 컵 손잡이를 감싸 쥐고. 팔짱을 끼고. 손을 주머니에 넣고. 모델이 안정된 자세로 수백만 번 본 구성을 묘사하면, 그것을 되돌려줍니다.
사실 다른 모든 것과 같은 원리입니다. 모델에게 추상적인 지시를 주는 것보다 구체적인 상황을 묘사할 때 훨씬 많은 것을 얻습니다. 행동을 묘사하는 건 모델이 할 줄 압니다. 숫자 제약을 따르는 건 못 합니다.
다시 돌리는 대신 고치기: 겨냥한 편집
편집 모델은 당신의 이미지를 받아 묘사한 부분만 바꾼다. 손 하나를 고치는 데는 몇 크레딧, 반면 새 생성은 새 구도까지 다시 검증해야 한다.
모든 것을 바꾸는 습관이 이것이고, 초보자에게 없는 습관입니다. 이미지가 95퍼센트 좋으면 다시 돌리지 않습니다. 고칩니다.
6크레딧의 Flux Kontext는 결코 0에서 시작하지 않습니다. 입력 이미지를 요구하고 지시에 따라 변형하며, 순수 생성 모델이라면 무작위로 다시 조합했을 부분을 보존합니다. 자기 이미지를 주고 바뀌어야 할 것만 묘사하세요. 왼손을 고쳐, 컵을 손잡이로 쥐게 해, 나머지는 아무것도 바꾸지 마.
10크레딧의 Nano Banana 2는 복합 지시를 이해하며 같은 일을 하고, 2크레딧의 GPT Image Mini는 간단한 보정이라면 카탈로그에서 가장 싼 선택지입니다. 어느 경우든 지시의 후반부에는 움직이지 않을 것을 나열해야 합니다. 얼굴, 포즈, 프레이밍, 빛, 배경. 그 목록이 없으면 모델은 다른 이미지를 돌려줍니다. 아주 좋은, 그러나 다른 이미지를요.
납품 전 확대, 모두가 건너뛰는 검수
결함은 100퍼센트에서 보이지 썸네일에서는 보이지 않는다. 납품 전에 이미지를 확대하는 데 12크레딧이 들고, 인쇄해서야 발견하는 사고를 막는다.
생성한 이미지를 캔버스 썸네일로 보고, 승인하고, 보냅니다. 3주 뒤 A2로 인쇄되어 있고 손에는 손가락이 여섯 개입니다. 저도 겪었고, 한 번이면 습관이 생기기에 충분합니다.
검수는 2분입니다. 이미지를 크게 열고 세 구역을 순서대로 훑습니다. 손, 배경을 포함해 글자가 들어간 모든 곳, 그다음 눈과 이. 이 세 번의 통과가 거의 모든 결함을 잡습니다.
인쇄로 갈 비주얼이라면 12크레딧의 Topaz Precision을 쓰는 개선 노드가 깔끔하게 확대하면서 낮은 해상도가 숨기고 있던 것을 드러냅니다. 사진을 선명하게 만들기에서 설명한 것과 같은 도구이고, 확대기인 동시에 검사용 돋보기 역할도 합니다.
AI 이미지를 들통나게 하는 다른 디테일들
지나치게 고른 이, 겹쳐 나오는 장신구, 앞뒤가 맞지 않는 옷감 무늬, 아무것에도 대응하지 않는 반사. 같은 원인이 덜 알려졌지만 똑같이 눈에 띄는 다른 결함을 만든다.
손과 글자가 주인공이지만, 같은 메커니즘이 다른 실패도 만듭니다. 이는 작고 반복적이어서 너무 많고 너무 고르게 나오는 경우가 많습니다. 장신구와 안경은 다리 부분에서 겹쳐 나옵니다. 옷감 무늬, 줄무늬나 체크는 옷 한가운데서 방향이 바뀝니다.
반사는 별개의 경우이고 아주 잘 드러납니다. 거울이나 쇼윈도 안에, 모델은 장면과 대응하는지 확인하지 않고 반사처럼 보이는 무언가를 그립니다. 인물 뒤의 유리를 보세요. 이미지 어디에도 없는 것들이 심심찮게 발견됩니다.
그리고 군중, 확대하는 순간 뒤쪽 얼굴들이 불안해집니다. 여기서도 반사는 같습니다. 문제를 피하는 프레이밍이거나, 그것을 고치는 겨냥한 편집이거나. 바로 생성형 AI 초보자의 실수에서 짚는 항목들입니다.
따라야 할 절차, 요약
글자가 있으면 쓸 줄 아는 모델을 고르고, 펼친 손을 피하도록 자르고, 다시 돌리는 대신 편집으로 고치고, 납품 전에 크게 검수한다.
글자는 문제가 해결되었고 모델의 문제입니다. 그래픽이면 Nano Banana Pro, GPT Image 2, Recraft, 글자가 들어간 사실적 결과가 필요하면 Flux 2 Max. 정확한 문구는 따옴표에, 잠그는 문장, 최대 몇 단어.
손은 완벽한 모델이 없고, 답은 연출에 있습니다. 위에서 자르기, 물건으로 손을 채우기, 초점면 밖으로 빼기. 동작을 묘사하고, 손가락 개수는 절대 쓰지 마세요. 그리고 이미지가 95퍼센트 좋으면 처음부터 다시 하지 말고 편집 모델로 고치세요.
예산을 태우지 않고 이 모두를 시험하려면 Flux Schnell에서 1크레딧으로 탐색하고, 채택한 구도에서만 8이나 19크레딧 모델로 넘어가세요. 정확한 가격은 클릭 전에 버튼에 표시되고, 전체 표는 여기에 있습니다.