실험형

사진 글자 추출은 왜 틀릴까? 크기·흐림을 바꿔 읽어본 결과

같은 영문·한글 샘플을 축소하고 흐리게 만든 뒤 OCR 결과를 비교했습니다. 글자 추출이 틀리는 상황과 다시 촬영할지, 결과만 고칠지 판단하는 기준을 제시합니다.

사진 속 글자를 읽는 기능이 틀리면 ‘모델이 나쁜가?’부터 생각하기 쉽습니다. 하지만 글자의 획이 충분히 남아 있는지, 사진이 흐려졌는지에 따라 같은 인식 엔진에서도 결과가 달라질 수 있습니다.

툴릿에서 쓰는 한국어·영어 OCR 엔진과 작은 인쇄 글자 샘플 두 장으로 크기와 흐림을 바꾸어 보았습니다. 이 실험은 일부러 조건을 통제한 사례로, 모든 스마트폰 사진의 정확도를 예측하지는 않습니다.

실험에서 확인한 점

작아져도 늘 틀리지는 않았습니다

영문 샘플을 절반·4분의 1 크기로 줄여도 이 사례에서는 같은 문장을 읽었습니다.

더 작은 글자는 바뀌었습니다

90×23픽셀 영문에서는 TOOLIT이 TOOUIT으로, 95×24픽셀 한글에서는 툴릿이 플릿으로 읽혔습니다.

심한 흐림은 읽지 못했습니다

이 영문 샘플에 강한 흐림을 주자 추출 결과가 비었습니다. 선명한 원본이 우선입니다.

같은 글자를 축소하거나 흐리게 했습니다

  1. 1

    저장소의 테스트용 PNG 두 장을 사용했습니다. 영문 원본은 720×180픽셀에 ‘HELLO TOOLIT 123’, 한글 원본은 760×190픽셀에 ‘안녕하세요 툴릿 123’이 인쇄되어 있습니다. 실제 사용자 사진이나 개인정보는 사용하지 않았습니다.

  2. 2

    원본·축소본·흐림본을 만들고 도구와 같은 Tesseract 한국어+영어 모델로 각각 인식했습니다. 축소는 영문 360×90, 180×45, 90×23픽셀 및 한글 95×24픽셀로 했고, 흐림은 영문 원본에 두 강도로 적용했습니다.

  3. 3

    반환된 텍스트만 비교했습니다. 스크립트는 scripts/measure-ocr-and-alpha.mjs에 있습니다. 이미지 한 장씩·한 번씩의 통제 시험이며 글자별 정확도 평균이나 실제 촬영 환경의 성공률은 아닙니다.

실제로 읽힌 문장

이 샘플에서는 적당한 축소와 약한 흐림이 결과를 바꾸지 않았습니다. 반면 더 작은 축소에서 영문과 한글 각각 한 부분 이상이 달라졌고, 강한 흐림에서는 영문 결과가 아예 비었습니다. ‘축소하면 반드시 실패한다’가 아니라, 사진마다 읽을 수 있는 최소 정보가 다르다는 관찰입니다.

입력OCR 결과원문과 비교
영문 원본 720×180HELLO TOOLIT 123같음
영문 360×90 / 180×45HELLO TOOLIT 123같음
영문 90×23HELLO TOOUIT 123TOOLIT 오인식
영문 강한 흐림빈 결과읽지 못함
한글 원본 760×190안녕하세요 툴릿 123같음
한글 95×24안녕하세요 플릿 123"툴릿 오인식·끝에 기호 추가

사진이 작거나 흐릴 때 왜 복원이 어려울까요?

글자가 작아지면 구별에 필요한 짧은 획과 빈 공간이 몇 픽셀 안에 몰립니다. 흐림은 이 경계를 주변 배경과 섞습니다. OCR은 남은 모양과 언어 단서로 가장 그럴듯한 글자를 고르므로 비슷한 글자나 뜻밖의 기호가 나올 수 있습니다.

이미 작은 사진을 확대 저장하는 것은 줄어든 획을 되돌리지 못합니다. Tesseract 공식 품질 안내도 해상도, 기울기, 노이즈와 입력 이미지 전처리를 중요한 변수로 다룹니다. 다만 사진의 문제를 고쳐도 모든 고유명사·숫자가 정확해지는 것은 아닙니다.

다시 촬영할지, 추출 결과를 고칠지

몇 글자만 잘못되고 대부분 읽힌다면 결과 칸에서 원본과 대조하며 수정하는 편이 빠릅니다. 한 줄 전체가 비거나 반복해서 엉뚱한 글자가 나오면 촬영·캡처 원본부터 바꾸세요. 빛 반사 없이 평평하게 찍고, 글자가 잘리지 않게 하며, 필요한 언어를 선택합니다.

금액·날짜·계좌 번호처럼 한 글자의 영향이 큰 곳은 인식률이 높아 보이더라도 전부 직접 확인해야 합니다. 표의 칸 관계는 일반 TXT로 옮길 때 별도로 검토하세요.

이번 결과가 보장하지 않는 것

샘플은 짧고 뚜렷한 인쇄 문장 두 개뿐입니다. 손글씨, 명함, 회전된 영수증, 표, 그림 위 글씨, 휴대전화별 압축 방식은 시험하지 않았습니다. 축소·흐림 수치가 모든 이미지의 실패 경계라고 해석하면 안 됩니다.

실제 문서에서는 원본 이미지와 추출 결과를 나란히 두고 오류를 고치는 절차 자체가 정확도를 지키는 마지막 단계입니다.

판단에 참고한 공식 문서

원본의 가독성을 먼저 확보하고, 결과는 반드시 검수하세요

이 작은 실험에서 크기를 많이 줄이거나 심하게 흐리게 하면 일부 글자가 바뀌거나 결과가 비었습니다. 반대로 절반 정도의 축소는 같은 샘플에서 문제를 만들지 않았습니다. 단일 ‘최소 픽셀’ 규칙보다 실제 글자 모양과 추출 결과를 확인하는 것이 낫습니다.

재촬영할 수 있다면 선명한 원본을 준비하고, 추출 후에는 중요한 숫자와 이름부터 원본과 대조하세요. OCR은 다시 타이핑하는 시간을 줄이는 도구이지 검수 절차의 대체물이 아닙니다.