AI OCR NPL
🧭 개요
이 문서는 OCR(광학 문자 인식)과 NLP 관련 핵심 모델인 CRAFT, TRBA를 정리한다.
주로 이미지 기반 문자인식 파이프라인에서 사용하는 구조를 설명한다.
🧱 CRAFT (Character Region Awareness for Text detection)
정의
CRAFT는 문자 영역의 위치 정보를 탐지하는 OCR 모델이다.
- 이미지에서 문자 영역(region map)과 연결 정보(link map)를 추출한다.
- Fully Convolutional Network 기반이다.
- 단어를 구성하는 개별 문자 위치를 박스로 찾는 데 강하다.
- 복잡한 배경에서도 텍스트 영역을 비교적 잘 찾는다.
입력: 텍스트 이미지
출력: 글자 중심점 + 연결 정보 => 문자 영역 박스
example
Scene Text Detection, 문서 스캔 이미지 처리 등에 사용된다.
🧱 TRBA (TPS-ResNet-BiLSTM-Attention)
정의
TRBA는 OCR의 문자 인식(Recognition)을 위한 모델 조합이다.
기존 CRNN 계열을 개선한 구조로 많이 사용된다.
구성 단계
| 단계 | 모델 | 설명 |
|---|---|---|
| 1 | TPS (Thin Plate Spline) | 입력 이미지의 왜곡 보정 |
| 2 | ResNet Feature Extractor | 이미지에서 특징 추출 |
| 3 | BiLSTM | 양방향 문맥 정보 추출 |
| 4 | Attention Decoder | 문자 시퀀스 생성 |
입력: 단어 이미지
출력: 문자열 예측 (예: "OpenAI")
🔄 사용 흐름
CRAFT는 텍스트 영역 탐지를 담당한다.TRBA는 해당 영역에서 문자를 인식한다.- 두 모델을 결합하면 End-to-End OCR Pipeline을 구성할 수 있다.
- 문서 자동화, 이미지 텍스트 추출, 검색 인덱싱 등에 활용된다.
📚 참고
- CRAFT: https://arxiv.org/abs/1904.01941
- TRBA: https://arxiv.org/abs/1904.01906
- 구현체: https://github.com/clovaai/deep-text-recognition-benchmark
댓글남기기