본문 바로가기
728x90

OCR5

[논문 리뷰] What If We Only Use Real Datasets for Scene Text Recognition? Toward Scene Text Recognition With Fewer Labels 본 논문은 CVPR 2021에서 발표된 Text Recognition 논문으로, TRBA 모델 ('What is wrong with scene text recognition model comparisons? dataset and model analysis')을 제안한 백정훈 님의 논문이기도 하다. 본문 내용 Scene Text Recognition (STR) 연구에서는 리얼 데이터가 부족하기 때문에 일반적으로 대규모 합성 데이터셋을 사용하여 학습을 진행한다. 때문에 암묵적으로 리얼 데이터만으로는 STR 모델 학습이 거의 불가능하다는 암묵적인 상식(?)이 있었다고 한다. 하지만 본 논문에서는 이 상식이 STR 연구를 방해했다고 말한다. 본 논문에서는 최근에 축적된 리얼 데이터셋을 통합하고 지정된 실제 데이.. 2023. 3. 12.
[논문 리뷰] What Is Wrong With Scene Text Recognition Model Comparisons? Dataset and Model Analysis 본 논문은 ICCV 2019에서 Naver Clova가 발표한 Text Recognition 논문이다. (공식 레퍼지토리) 제안하는 내용 기존의 정리되어 있지 않던 STR(Scene Text Recognition) dataset을 정리하고 STR 을 4단계로 나누어 정립했다. 논문에서 제안한 STR 4단계는 아래와 같고, 각 단계의 모듈별 기여도를 실험을 통해 제공하고 있다. Transformation Stage : TPS(Thin-Plate Spline)이라는 STN(Spatial Transformation Network)와 유사한 방법으로 이미지 노멀라이즈 (왜곡되어 있는 텍스트를 인식 모델이 가장 인식하기 쉬운 형태로 변환) Feature Extraction Stage : 일반적인 CNN 아키텍처... 2023. 3. 12.
[논문 리뷰] Data Augmentation for Scene Text Recognition 텍스트 인식에 포커스가 맞춰진 augmentation이 있을까 싶어 논문을 찾던중 ICCV 2021 학회에서 발표된 STR에서의 Data augmentation 논문이 있어서 정리하려 한다. Abstract 일부 Scene Text Recognition(STR) 모델은 실제 데이터를 사용해서 평가하기 때문에 학습 데이터와 테스트 데이터 분포 간의 불일치는 주로 nosie, artifacts, geometry, structure 등의 영향을 받아서 성능 저하로 이어진다. 본 논문에서는 이를 개선하기 위해 36개의 image augmenation function으로 구성된 STRAug를 소개한다. 각 함수는 자연 장면에서 찾을 수 있거나 카메라 센서에 의해 발생하거나 신호 처리 작업 중 발생하는 이미지 속성.. 2023. 3. 11.
[웹 데모] 네이버 클로바 OCR 데모 OCR은 이미지 속에서 텍스트를 찾고 읽어내는 기술로 최근에는 원하는 텍스트 정보만을 추출하는 수준까지 도달했고, 이 분야에서는 네이버가 업계 최고 수준의 기술력을 가지고 있다. 네이버는 CVPR 2019에서 발표한 Text detection 모델인 CRAFT, 21년에 발표한 end-to-end document understanding 모델인 Donut 그리고 가장 최근인 22년에 발표한 DEER 모델까지 OCR 부분에서 많은 논문을 내고 있다. 논문에서의 수치적은 성능이 우수한 것은 알겠는데, 실제로 얼마나 잘 동작하는 모델일까? 네이버 클로바는 OCR 웹 데모를 제공하고 있어 누구나 사용해 볼 수 있다. (링크) 네이버 클로바 OCR 웹 데모 페이지에서 General OCR, 영수증, 신용카드 등 .. 2023. 3. 1.
[오픈 소스] EasyOCR 텍스트 검출/인식 AI 모델을 무료로 쉽게 사용해보자 https://github.com/JaidedAI/EasyOCR GitHub - JaidedAI/EasyOCR: Ready-to-use OCR with 80+ supported languages and all popular writing scripts including Latin, Chines Ready-to-use OCR with 80+ supported languages and all popular writing scripts including Latin, Chinese, Arabic, Devanagari, Cyrillic and etc. - GitHub - JaidedAI/EasyOCR: Ready-to-use OCR with 80+ ... github.com OCR(Optical Character.. 2022. 12. 16.
728x90