• Title/Summary/Keyword: 숫자열

검색결과 110건 처리시간 0.02초

두자 접촉 숫자열의 분할-자유 인식 (Segmentation-free Approach to the Recognition of Two Touching Numerals)

  • 최순만;오일석
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1998년도 가을 학술발표논문집 Vol.25 No.2 (2)
    • /
    • pp.381-383
    • /
    • 1998
  • 숫자열 인식은 문서 자동화 분야에서 매우 중요하다. 기존의 방법들은 숫자열을 낱자 단위로 분할하는 단계와 분할된 숫자들을 인식하는 두 단계로 이루어져 있다. 이들 방법으로는 접촉 유형의 많은 변형 때문에 만족할 만한 결과를 얻을 수 없다. 본 논문은 두자 접촉 숫자열을 분할-자유 방법으로 인식하는 방법을 제안한다. 이 방법은 두자 접촉 숫자열을 하나의 패턴으로 간주하여 인식한다. 즉, 인식 대상이 되는 부류가 100개(00, 01, 02, ... , 98, 99)이다. 훈련 데이터는 NIST 데이터베이스에의 낱자 단위 숫자들을 조합하여 합성하였고, 테스트 데이터는 NIST의 숫자열 필드에서 두자 접촉한 숫자열 만을 추출하여 사용하였다.

  • PDF

CPgraph를 이용한 숫자열 영상에서 숫자 분할 (Digit Segmentation in Digit String Image Using CPgraph)

  • 오정수
    • 한국정보통신학회논문지
    • /
    • 제23권9호
    • /
    • pp.1070-1075
    • /
    • 2019
  • 본 논문은 영상에서 숫자열을 검출하고 숫자열을 구성하고 있는 숫자들을 분할하여 숫자 인식 시스템을 위한 입력 숫자 영상을 생성하는 알고리즘을 제안하고 있다. 제안된 알고리즘은 블랍 검출을 통해 블랍화된 숫자열을 검출하고, 검출된 블랍 정보를 이용해 숫자열 영역을 지정하고, 숫자열 기울어짐을 보정한다. 그리고 제안된 알고리즘은 본 논문에서 새롭게 정의된 세 종류의 CPgraph을 이용해 숫자 기울어짐을 보정하고, 보정된 숫자열에서 숫자 분할을 위한 경계 지점을 결정한다. 일정 영역의 폰트 크기로 인쇄된 숫자열을 포함하는 영상 그룹과 필기체 숫자열을 포함하는 영상 그룹을 이용한 숫자 분할 실험에서 제안된 알고리즘 각 영상 그룹에서 100%와 90% 이상의 숫자들을 성공적으로 분할하고 있다.

접촉 숫자쌍 인식기를 이용한 필기 숫자열 인식 (Recognition of Handwritten Numeral Strings Using Touching Numeral Pair Recognizer)

  • 최순만;오일석
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2000년도 가을 학술발표논문집 Vol.27 No.2 (2)
    • /
    • pp.344-346
    • /
    • 2000
  • 임의 길이 숫자열을 인식하기 위해서는 우선 숫자열 영상을 인식기가 다룰 수 있는 형태로 변환해야 한다. 만일, 사용하는 인식기가 낱자 단위 인식기라면 낱자 단위로 분할하여야 하는데, 두자 이상의 숫자들이 접촉한 경우 정확한 분할이 어렵다. 이 논문은 이러한 문제를 해결하기 위하여 접촉 숫자쌍을 분할하지 않고 통째로 인식하는 방법을 사용한다. 필기 숫자열을 인식하기 위해 제안한 방법은 두 개의 인식기를 이용한다. 숫자열에서 분할된 패턴이 낱자인 경우 낱자 인시기가, 접촉 숫자쌍일 경우 접촉 숫자쌍 인식기가 인식한다. NIST 데이터베이스에 대한 실험 결과 2~10개의 숫자를 포함한 숫자열에 대하여 83.76%의 숫자열 인식률을 보여 접촉 숫자열 패턴을 낱자 단위로 분할하지 않고도 효과적으로 인식할 수 있음을 확인할 수 있었다.

  • PDF

한국어 연결숫자 인식에서의 발화검증과 대체오류수정 (Utterance Verification and Substitution Error Correction In Korean Connected Digit Recognition)

  • 정두경;김형순
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2002년도 하계학술발표대회 논문집 제21권 1호
    • /
    • pp.111-114
    • /
    • 2002
  • 음성인식에서 발화검증은 비인식대상어휘(OOV)를 기각시키고, 인식대상어휘라도 오인식 가능성이 높은 결과를 기각시키는 기술을 말한다. 본 논문에서는 혼동가능성 높은 숫자쌍들이 존재하는 한국어 연결 숫자 인식에서 발화검증 결과로 숫자열 기각시 오인식 가능성이 높은 숫자열을 그냥 기각시키는 대신에 대체오류를 수정하여 인식성능을 향상시키고자 하였다. N-best decoding 결과에 따르면 $2^{nd}\;best$$3^{rd}\;best$안에 대부분의 제대로 된 인식결과들이 포함된다. 따라서, N-best decoding을 이용해, 숫자열 기각시 $2^{nd}\;best$ 숫자열로 대체된 것이라고 가정한 후, 개별숫자 log likelihood ratio(LLR)과 N-best 기반의 숫자열 LLR[3] 등을 함께 고려한 신뢰도 측정방식에 의해 그 가정이 맞다고 판단이 되면 $2^{nd}\;best$ 의 숫자열과 대체함으로써 부분적으로 오류를 수정하였다.

  • PDF

두자 접촉 숫자열의 분할 자유 인식 (Segmentation-free Recognition of Touching Numeral Pairs)

  • 최순만;오일석
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제27권5호
    • /
    • pp.563-574
    • /
    • 2000
  • 숫자열 인식은 문서 처리 자동화에서 매우 중요하다. 기존 방법들은 숫자열을 낱자 단위로 분할하는 단계와 분할된 숫자들을 인식하는 두 단계로 이루어져 있다. 그러나 이들 방법으로는 접촉 유형의 수많은 변형 때문에 만족할 만한 결과를 얻을 수 없다. 본 논문은 두자 접촉 숫자열의 분할-자유 인식 방법을 제안한다. 이 접근 방법에서는 두자 접촉 숫자열을 하나의 패턴으로 간주하여, 총 100개(‘00’, ‘01’, ‘02’, ..., ‘98’, ‘99’) 부류를 대상으로 인식한다. NIST 데이타베이스의 숫자열 필드에서 두자 접촉한 숫자열을 추출하여 실험하였다. 부류수가 방대한 경우 나타나는 기존 신경망 인식기의 한계 때문에, 모듈러 신경망을 사용하였으며 인식 실험을 통하여 우수성을 입증하였다.

  • PDF

접촉된 숫자열의 분할 및 인식 기법 (Segmentation and Recognition Methods for Touching Handwritten Digit String)

  • 송성일;김황수
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2002년도 가을 학술발표논문집 Vol.29 No.2 (2)
    • /
    • pp.481-483
    • /
    • 2002
  • 본 논문은 숫자간 접촉이 포함된 무제약 오프라인 필기 숫자열 인식을 위한 분할 및 인식기법을 소개하고자 한다. 시스템은 숫자열에서 접촉된 성분을 추출하는 모듈, 접촉된 숫자를 분할하는 모듈과 최종적으로 분할된 결과를 조합하는 모듈로 이루어진다. 그리고, 위의 기법을 NIST 데이터에 적용하여 제안한 분할 및 인식기법의 효율성을 보여준다.

  • PDF

필기 숫자열 인식률 향상을 위한 초기 처리에 관한 연구 (Early Processings for an Improvement in Handwritten Digit String Recognition)

  • 윤성수;변영철;김경환;최영우;이일병
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1999년도 가을 학술발표논문집 Vol.26 No.2 (2)
    • /
    • pp.455-457
    • /
    • 1999
  • 필기 숫자열의 인식성능을 향상시키기 위해서는 물론 인식기 자체의 성능 개선도 필요하지만 인식기에서 필요로 하는 정보를 제공해주는 초기단계의 개선 역시 매우 중요하다. 낱자와는 달리 숫자열 인식에서는 인식기에서 필요한 단위로 입력 데이터를 분할해야만 하는데 잡영, 기울어짐, 접촉 등의 원인에 의해서 쉽게 분할해내기 어렵기 때문이다. 본 논문에서는 이런 문제점들을 극복하기 위한 방법들은 제시하였으며 NIST 숫자열 데이터에 적용해 본 결과 16%의 성능 향상을 보였다.

  • PDF

서식 문서의 선과 접촉된 숫자열 복원에 관한 연구 (Restoration of Numeral Strings Touched with Lines in Various Form Documents)

  • 이창현;최영우;김경환;이일병
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제28권6호
    • /
    • pp.439-449
    • /
    • 2001
  • 본 논문에서는 서식 문서의 선과 숫자의 획이 접촉된 경우 숫자의 획을 접촉되기 전 상태의 원 이미지로 복원하는 방법을 제안한다. 제안하는 방법에는 서기 문서에서 추출한 숫자열을 대상으로 열 단위로 복원한다. 과정은 우선 숫자열과 접촉된 선의 위치를 찾아내고, 선을 추적하면서 접촉으로 판정되는 영역을 유형별로 분류하여, 각 유형에 적합한 획 복원 방법을 제안한다. 또한 선에 숫자의 획이 완전히 포함된 경우의 복원 방법도 제안하여 현장에서의 서식 처리 과정에서 발생하는 문제점을 해결하고자 하였다. 제안하는 방법을 평가하기 위해서 은행 입출금전표, 신용카드 매출전표 및 NIST 필기 숫자열 데이터베이스 이미지를 사용하였다.

  • PDF

결정값 발생기를 이용한 무제약 필기체 숫자 열의 인식 (Unconstrained Handwritten Numeral Sti-ing Recognition by Using Decision Value Generator)

  • 김계경;김진호;박희주
    • 한국산업정보학회논문지
    • /
    • 제6권1호
    • /
    • pp.82-89
    • /
    • 2001
  • 본 논문에서는 독립문자 식별기 및 인식기를 바탕으로 한 결정값 발생기를 도입하여 무제 약 필기체 숫자 열을 효과적으로 인식하는 방안을 제안하였다. 필기체 숫자 열의 인식을 위해 사전 분할 모듈, 최종 분할 모듈 그리고 인식 모듈 등의 세 개의 모듈을 설계 구현하였다. 사전 분할 모듈에서는 결정값 발생기를 이용하여 독립 숫자, 접촉 숫자 그리고 끊어진 숫자 등을 구분하였다. 최종 분할 모듈에서도 결정값 발생기의 결과를 이용하여 접촉 숫자들을 분할하는 과정을 수행하고 인식 모듈에서 각각 분할된 숫자들을 인식하였다. 분할 기반 방식과 무 분할 방식을 혼용하여 필기체 숫자열을 인식함으로서 기존의 오 인식률을 최소화시키도록 하였다. 제안된 방식을 이용하여 NIST SD19 필기체 숫자 열 데이터베이스의 인식을 한 결과 기존의 연구결과에 비해 높은 96.7%의 인식률을 얻을 수 있었다.

  • PDF

BERT를 이용한 숫자-한국어 음역 모호성 해소 (Arabic-Numerals to Korean Transliteration Disambiguation using BERT)

  • 박정연;육대범;이재성
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2020년도 제32회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.42-44
    • /
    • 2020
  • TTS(Text-to-Speech) 시스템을 위해서는 한글 이외의 문자열을 한글로 변환해줄 필요가 있다. 이러한 문자열에는 숫자, 특수문자 등의 문자열이 포함되어 있다. 특히 숫자의 경우, 숫자가 사용되는 문맥에 따라 그 발음방법이 달라지는 문제점이 있다. 본 논문에서는 기존의 규칙기반과 한정된 문맥 정보만을 활용할 수 있는 방법이 아닌, 딥러닝을 이용한 방법으로 문맥에 따라 발음방법이 달라지는 숫자 음역의 모호성을 해소하는 방법을 소개한다.

  • PDF