🧭 개요

이 문서는 OCR(광학 문자 인식)과 NLP 관련 핵심 모델인 CRAFT, TRBA를 정리한다.
주로 이미지 기반 문자인식 파이프라인에서 사용하는 구조를 설명한다.

🧱 CRAFT (Character Region Awareness for Text detection)

정의

CRAFT는 문자 영역의 위치 정보를 탐지하는 OCR 모델이다.

  • 이미지에서 문자 영역(region map)연결 정보(link map)를 추출한다.
  • Fully Convolutional Network 기반이다.
  • 단어를 구성하는 개별 문자 위치를 박스로 찾는 데 강하다.
  • 복잡한 배경에서도 텍스트 영역을 비교적 잘 찾는다.
입력: 텍스트 이미지
출력: 글자 중심점 + 연결 정보 => 문자 영역 박스

example

Scene Text Detection, 문서 스캔 이미지 처리 등에 사용된다.

🧱 TRBA (TPS-ResNet-BiLSTM-Attention)

정의

TRBA는 OCR의 문자 인식(Recognition)을 위한 모델 조합이다.
기존 CRNN 계열을 개선한 구조로 많이 사용된다.

구성 단계

단계 모델 설명
1 TPS (Thin Plate Spline) 입력 이미지의 왜곡 보정
2 ResNet Feature Extractor 이미지에서 특징 추출
3 BiLSTM 양방향 문맥 정보 추출
4 Attention Decoder 문자 시퀀스 생성
입력: 단어 이미지
출력: 문자열 예측 (예: "OpenAI")

🔄 사용 흐름

  • CRAFT텍스트 영역 탐지를 담당한다.
  • TRBA는 해당 영역에서 문자를 인식한다.
  • 두 모델을 결합하면 End-to-End OCR Pipeline을 구성할 수 있다.
  • 문서 자동화, 이미지 텍스트 추출, 검색 인덱싱 등에 활용된다.

📚 참고

연결문서

태그: ,

카테고리:

업데이트:

댓글남기기