본문 바로가기
🧰 유틸리티무료오픈소스

테서랙트 언어 데이터

Tesseract Languages (tessdata_fast)

테서랙트 OCR용 언어 학습 데이터

한줄평

테서랙트로 다국어 문서를 인식하려면 사실상 필수인 데이터입니다. 다만 fast 버전은 속도 위주라 최고 정확도가 필요하면 별도의 정밀(best) 모델을 쓰는 편이 낫습니다.

이런 분께 테서랙트로 다양한 언어의 문서를 인식하려는 분께

좋은 점

  • 한국어 포함 100여 개 언어 지원
  • 속도 최적화 모델로 인식이 빠름

아쉬운 점

  • 정확도 최우선 작업에는 정밀 모델보다 인식률이 낮을 수 있습니다

테서랙트 언어 데이터 소개

테서랙트 OCR 엔진이 이미지 속 글자를 인식하려면 언어별 학습 모델이 필요한데, 이 패키지가 바로 그 데이터 모음입니다. tessdata_fast는 속도에 최적화된 정수 버전 모델로, 한국어를 포함한 100개 이상의 언어를 지원합니다. 그 자체로 실행되는 프로그램이 아니라 테서랙트에 얹어 쓰는 데이터 파일이며, 설치 후 원하는 언어를 지정해 문자 인식에 활용합니다.

제작사

영삼넷 · 공식 홈페이지

테서랙트 언어 데이터 (Tesseract Languages (tessdata_fast)) 무료 다운로드 | 자료실 | 영삼넷