• 제목/요약/키워드: 한글 문자 인식

검색결과 326건 처리시간 0.023초

저해상도 인쇄체 한글 영상 인식을 위한 자소 분할 방법 (Grapheme Segmentation Method for Low Quality Printed Hangul Text Recognition)

  • 이성훈;조규태;김진식;김진형;정철곤;김상균;문영수;김지연
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2006년도 한국컴퓨터종합학술대회 논문집 Vol.33 No.1 (B)
    • /
    • pp.382-384
    • /
    • 2006
  • 본 논문에서는 저해상도 한글 영상을 자소 단위로 분리하는 방법을 제안한다. 비디오 자막이나 저해상도 스캔 영상의 경우 자소간 획이 접촉되거나 잡영이 많이 포함되어 기존의 자소 분할 방법으로는 한계가 있다. 한자 문자열을 문자 단위로 분할하는데 사용된 비선형 분할 경로 알고리즘을 한글 낱자 영상에 적용하여 자소 단위로 분할한다. 기존의 분할 경로 알고리즘을 한글 자소 분할에 효과적으로 적용하기 위해서 우세점 탐지 알고리즘을 이용하여 자소간 접촉점을 찾고 이를 바탕으로 생성된 분할 경로에 따라 여러 개의 자소 후보 영상이 생성된다. 자소 영상을 자소 인식기로 인식한 결과 높은 인식률을 보이는 것을 실험을 통하여 확인하였다.

  • PDF

Online to Offline 상점을 위한 한글 메뉴판 인식 : 어텐션 메커니즘을 적용한 VGG-ResNet 융합 모델 (Recognition of Korean Menu for Online to Offline Stores : VGG-ResNet Fusion Model with Attention Mechanism)

  • 시종욱;이상진;김성영
    • 한국정보전자통신기술학회논문지
    • /
    • 제17권4호
    • /
    • pp.190-197
    • /
    • 2024
  • O2O 상점 모델은 온/오프라인의 경계를 허물어 고객에게 큰 편의성을 제공하는 플랫폼이다. 이러한 플랫폼을 효과적으로 운영하기 위해서는 소상공인들이 필요한 정보를 디지털 형태로 제공해야 한다. 특히, 한글 메뉴판을 디지털화하는 과정이 수동으로 진행될 경우 여러 문제점을 일으킬 수 있으며, OCR 기술 사용 시 한글의 인식 정확도가 낮아 오류 인식의 가능성이 높다. 이에 본 논문에서는 한글 메뉴판의 자동 인식을 위해 대표적인 OCR 모델인 EasyOCR을 기반으로 하되, 한글 문자 인식의 낮은 정확도를 개선하고자 한다. 제안하는 모델은 VGG와 ResNet의 구조적 장점을 통합하고, 어텐션 메커니즘을 도입하여 한글 문자의 인식 성능을 크게 향상시키도록 설계한다. 실험 결과, 제안하는 모델은 EasyOCR에 비해 Accuracy 기준 약 3.5%, Confidence Score와 Normalized Edit Distance 기준 약 1%의 인식 정확도 향상을 보였다. 따라서, 제안한 방법이 기존 문제를 효과적으로 해결할 수 있음을 입증한다.

한글문자의 컴퓨터 처리: II. 터미날 설계와 역사 (Korean Character processing: Part II. Terminal Design and History)

  • 정원량
    • 대한전자공학회논문지
    • /
    • 제16권4호
    • /
    • pp.1-12
    • /
    • 1979
  • 이 논문은 "한글문자의 컴퓨터 처리 : 1. 이론 "의 후편으로서 동일 subject의 실질적, 역사적 측면을 취급한다. 논문의 전반부에서는 다음 문제들을 논한다. : 한글 입출력 터미날의 기능적 설계, 모아쓰기 algorithm과 dot matrix fonts 에 의존한 한글 character generator, 입력 keyboard, 구성(keyset 와 key-stroke수 사이의 관계), binary code 의 설계를 위해 고려되어야 할 조건 등이다. 후반부는 개인적 관점에서 본 한글문자의 컴퓨터 처리의 역사론에 할당되었다. 기록화된 업적들을 주요 내용에 따라 네그룹으로 분류하였고, 시대순으로 나열될 참고문헌들의 비판적 개론을 위해 문제점들을 하나씩 거론하였다. 입력 (문자의 컴퓨터인식)과 출력 (모아쓰기의 처리)의 문제들을 분별하여 토론하였다.

  • PDF

한글 인쇄체 문자인식 전용 신경망 Coprocessor의 구현에 관한 연구 (Study on Implementation of a neural Coprocessor for Printed Hangul-Character Recognition)

  • 김영철;이태원
    • 한국정보처리학회논문지
    • /
    • 제5권1호
    • /
    • pp.119-127
    • /
    • 1998
  • 본 논문에서는 한글 인쇄체 인식 시스템의 실시간 처리를 위하여 인식 프로세스중 시간이 많이 걸리는 한글 문자 유형 분류 및 자소 인식 단계를 고속 처리할 수 있는 다층구조 신경망을 VLSI 설계 하였으며, 신경망과 호스트 컴퓨터간의 인터페이스와 신경망 제어를 담당하는 코프로세서 구조를 제안하였다. 이를 VHDL 모델링 및 논리합성을 통하여 설계하여 시뮬레이션을 통하여 구조와 동작 및 성능을 검증하였다. 실험결과 제안한 신경망 coprocessor는 기존의 소프트웨어 구현 인식 시스템의 유형 분류 및 자소 인식률과 대등한 성능을 보인 반면 고속의 인식속도를 보였다.

  • PDF

계층적 신경망을 이용한 주민등록증 성명인식 (Printed Name on ID Card recognition using a Hierachical Organized Neural Network)

  • 서원택;조범준
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2003년도 봄 학술발표논문집 Vol.30 No.1 (B)
    • /
    • pp.325-327
    • /
    • 2003
  • 본 논문에서는 인쇄체 한글을 실용적으로 인식할 수 있는 계층적으로 구성한 신경망을 제안하고, 이를 이용해서 주민등록증의 성명을 인식하는데 적용하였다. 문자영상을 신경망을 이용하여 한글의 6가지 유형으로 먼저 분류한 후, 분류된 문자영상을 각 형식에 따라 자소단위로 분할해서 각 형식에 따른 신경망으로 인식하는 구조로 만들었다. 훈련용 데이터는 각 형식 별로 자소를 분리해서 얻은 영상들을 자소별 평균이미지로 만들어서 이를 조합하여 만든 글자로 사용하였다. 그래서 같은 형식의 같은 자음이라도 글자의 모양과 위치가 조금 다른것에 대해서 강인한 훈련을 할 수 있었다. 또한 입력단에서의 잡음을 줄이기 위해 히스토그램의 국부 평균을 적용하였다. 100명의 주민등록증을 컴퓨터 카메라를 이용하여 입력받아서 테스트한 결과 98.1%의 높은 인식률을 얻을 수 있었다.

  • PDF

저해상도 팩스 표지 영상의 구조 분석 (Structure Analysis of Low Contrast Fax Cover Pages)

  • 임영규;이성환
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1998년도 가을 학술발표논문집 Vol.25 No.2 (2)
    • /
    • pp.387-389
    • /
    • 1998
  • 팩스가 보편적인 정보 전달 매체로 자리잡게 됨에 따라 기업체나 관공서 뿐만 아니라 가정에서도 많은 작업이 팩스를 통해 이루어지게 되었다. 이에 따라 팩스 문서의 분석 및 인식의 필요성이 증가하게 되었다. 팩스 문서는 표지와 내용이 두 부분으로 이루어지는데 팩스 문서의 처리를 위해서는 성명, 주소등을 포함하는 팩스 표지의 분석이 중요하다. 따라서 본 논문에서는 팩스 표지 영상의 구조 분석 방법을 제안한다. 제안한 팩스 표지 구조 분석 방법은 팩스 표지가 헤드, 송/수신 정보, 메시지로 구성된다는 점에 착안하여 위치 정보를 이용한 영역 분리에 중점을 두었으며, 팩스 표지의 종류를 몇 가지로 분류하여 도표 형태의 팩스 표지도 분석이 가능하도록 하였다. 분자 인식에서는 팩스 문자 인식에 우수한 성능을 보이고 있는 자소 기반 한글 문자 인식기를 사용하였다. 또한 한글의 자소 모델에 기반한 후처리 방법을 개발하여 인식 오류를 교정하였다.

  • PDF

프랙탈 차원과 어트랙트를 이용한 한글 혼동 문자 인식에 관한 연구 (A Study on the Hangeul confusion Character Recognition Using Fractal Dimensions and Attactors)

  • 손영우;남궁재찬
    • 한국정보처리학회논문지
    • /
    • 제6권7호
    • /
    • pp.1825-1831
    • /
    • 1999
  • 카오스 이론의 프랙탈 차원과 어트랙터를 이용하여 특징을 추출하여 문자인식에 적용하는 새로운 방법을 제안함으로써 기존의 혼동문자에 의한 오인식 비율을 줄이고자 하였다. 먼저 인식기에 부담을 줄이기 위해서 각 문자에 대해 특징을 조사하여 분류를 행한다. 분류된 문자에 대해 각 문자에 해당하는 Box-counting dimension, Natural Measure, Information dimension을 구하여 특징을 추출하여 인식하였다. 또한 문자의 히스토그램의 값을 이용하여 어트랙터를 구성하고 어트랙터에서 차원 값을 구한 다음 문자 자체의 차원 값과 함께 특징으로 사용하여 인식하였다. 실험 결과 전체적인 인식율의 평균은 학습 데이터에 대해서는 평균 96.03%, 미학습 데이터에 대해서는 91.74%를 나타내어 제안된 방법의 유효성을 보였다.

  • PDF

문자 인식 기술을 이용한 데이터베이스 구축 (Building Database using Character Recognition Technology)

  • 한선화;이충식;이준호;김진형
    • 한국정보처리학회논문지
    • /
    • 제6권7호
    • /
    • pp.1713-1723
    • /
    • 1999
  • 문자 인식 기술은 인쇄도니 형태로 존재하는 수많은 정보를 데이터베이스화 할 수 있는 가장 유용한 대안이다. 본 논문에서는 문자 인식 기술을 사용한 데이터베이스 구축의 타당성을 조사하기 위하여, 문자인식기를 사용한 데이터베이스를 시범적으로 구축하였다. 우선 데이터베이스를 구축할 때 문자 인식기의 선택 시 고려하여야 할 사항들을 살펴보고, 이를 기준으로 4가지의 상용 문자 인식기에 대한 인식 실험을 거친 후 그 중 인식 성능이 가장 좋은 것을 선택하였다. 대상 문서로는 다양한 인쇄 품질 및 특성을 갖는 실제 논문집의 초록을 대상으로 삼았으며, 대량 데이터에 대한 인식률 계산을 위해 수작업된 데이터베이스가 있는 KT 테스트 컬렉션[1]을 선택하였다. 실험은 실제 대용량 데이터베이스 구축과 유사한 환경을 만들기 위해, 문서별 학습이나 기울기 보정 등의 사전 작업을 생략하였다. 실험 결과 970편의 논문 요약문에 대해 평균 문자 인식률 90.5%를 보여, 한글 문자 인식 기술이 아직 데이터베이스 구축에 활용되기에는 이르다는 것을 보였다. 문자 인식에 의한 인식 오류에서는 수작업 한 문서에서 발견되는 오류와는 상이한 유형이 많이 발견된다. 본 논문에서는 추후의 연구를 위하여 문자 인식 텍스트에서 나타나는 오류의 유형을 분류하였다.

  • PDF

한글 문자의 인식을 위한 대수적 구조 (Algebraic Structure for the Recognition of Korean Characters)

  • 이주근;주훈
    • 대한전자공학회논문지
    • /
    • 제12권2호
    • /
    • pp.11-17
    • /
    • 1975
  • 이 논문은 한글문자의 자동인식을 위한 기초적인 연구로서 기본문자의 구조에 대해서 검토하였다. 기본문자를 구조, 선분구조 및 물자 graph의 node와의 연결곤계 들 구조를 세가지 측면에서 집합 및 군론에 의한 대수적인 분석을 하고 또 그들의 각 구조의 복잡성에 대한 계릉을 고찰하였다. 나아가서 10개의 모음은 한 요소의 Affine 변환에 의한 연속회전으로 이루어지는 회전변환군 속에서 다수의 동치관계가 존재한다는 것을 기술하므로써, 한글문자의 인식에 있어서는 topological 골격외에 기하적 성질이 특히 중요하다는 것을 아울러 지적 하였다. The paper examined the character structure as a basic study for the recognition of Korean characters. In view of concave structure, line structure and node relationship of character graph, the algebraic structure of the basic Korean characters is are analized. Also, the degree of complexities in their character structure is discussed and classififed. Futhermore, by describing the fact that some equivalence relations are existed between the 10 vowels of rotational transformation group by Affine transformation of one element into another, it could be pointed out that the geometrical properting in addition to the topological properties are very important for the recognition of Korean characters.

  • PDF

문자 별 특징 모델을 이용한 한글 문서 영상에서 키워드 검색 (Keyword Spotting on Hangul Document Images Using Character Feature Models)

  • 박상철;김수형;최덕재
    • 정보처리학회논문지B
    • /
    • 제12B권5호
    • /
    • pp.521-526
    • /
    • 2005
  • 본 논문에서는 저 품질의 한글 문서 영상에서 OCR 기반 검색 시스템의 대안으로 키워드 검출 시스템(Keyword Spotting)을 제안하고 OCR 기반 문서 검색 시스템과 비교한다. 제안 시스템은 문자 분할, 키워드 특징 추출 그리고 단어 매칭으로 구성된다. 문자 분할 단계에서는 인접한 두 문자간의 연결을 효과적으로 분리하면서 문자 넓이 값의 분산이 최소가 되도록 하는 문자 분할 방법을 제안한다. 키워드 특징은 서체별 문자 모델의 결합으로 구성한다. 단어 매칭 단계에서는 문자 매칭에 기반한 단어 대 단어 매칭 방법을 적용한다. 본 논문에서 제안한 키워드 검출 시스템의 성능을 평가하기 위해 한글 문서 영상을 대상으로 OCR 기반 문서 검색 시스템과 비교하였다. 그 결과 한글 글자 크기가 작고 문서의 상태가 좋지 않은 경우 제안한 키워드 검출 시스템에 의한 검색 성능이 OCR 기반 검색 시스템 보다 우수함을 입증하였다.