• Title/Summary/Keyword: 문자 분류

Search Result 351, Processing Time 0.028 seconds

An ECG Document Imaging System based on Neural Network and Graphic Techniques (신경망과 그래픽 기법을 이용한 심전도 결과지 이미징 시스템)

  • Kim Jin-Sang;Choi Sang-Yeol;Bae In-Ho;Kim Yun-Nyeon
    • Proceedings of the Korean Institute of Intelligent Systems Conference
    • /
    • 2006.05a
    • /
    • pp.269-272
    • /
    • 2006
  • 병원의 각종 측정 장비에서 출력되는 결과지나 의사들이 작성한 기록지를 스캔하여 이미지형태로 저장하는 이미징 시스템 개발이 크게 요구되고 있다. 본 논문에서는 신경망과 그래픽 기법을 사용하여 대학병원 심전도실에서 사용되는 여섯 종류의 심전도 출력지를 이미지 형태로 저장하고 검색하는 이미징 시스템의 설계와 구현에 대해 논하였다. 구현된 시스템은 여섯 종류의 심전도 출력지를 분류하고, 분류된 각 출력지에 인쇄된 중요한 측정 데이터를 인식하여 데이터베이스에 저장한다. 심전도 출력지의 분류는 각 샘플 서식들의 평균 히스토그램을 구한 다음 새로운 출력지가 들어올 때 평균 히스토그램과의 거리가 가장 가까운 출력지로 분류하는 nearest-neighbor 방법을 사용하였다. 출력지에 인쇄된 데이터의 인식을 위해 먼저 XML로 작성한 출력지별 추출 정보를 기반으로 스캔한 이미지의 영역 분할 작업을 수행한다. 분할된 영역들은 신경망을 이용해 문자 인식을 하고, 인식된 문자들이 데이터베이스의 해당 속성값으로 저장된다. 스캔한 출력지는 의사들이 주석을 붙이거나 조건 검색을 위해 이미지 형태로 저장된다.

  • PDF

Optical Character Recognition System Using The Document Form Identification (문서 양식 식별을 이용한 광학 문자 인식 시스템)

  • Jung, Won-Gyo;Park, Sang-Sung;Shin, Young-Geun;Ahn, Dong-Kyu;Jang, Dong-Sik
    • Proceedings of the Korean Society of Computer Information Conference
    • /
    • 2008.06a
    • /
    • pp.155-161
    • /
    • 2008
  • 최근 들어 문서나 서류 등의 보관에 대한 중요성이 커짐에 따라 기존에 종이 형태로 관리하던 문서나 서류들을 편리하게 관리하기 위해 문서 전자화 시스템을 도입하고 있는 기업 및 기관들이 많아지고 있다. 과거에는 종이로 되어 있는 서류들을 전자화시키기 위해서 사람들이 해당 서류를 보고 컴퓨터에 데이터를 수작업으로 일일이 입력해야 하는 번거로움이 있었다. 현재는 이러한 번거로움을 줄이기 위해 문서나 서류를 스캔하고, 스캔한 이미지에서 광학문자 인식(OCR: Optical Character Recognition) 기술을 이용한 방법으로 종이 형태의 문서들을 전자화하고 있다. 그러나 OCR을 통해 문자 인식을 한 이후에도 인식된 전체 문서에서 필요한 부분과 필요하지 않은 부분을 일일이 수작업으로 분류해야 하는 번거로움이 있다는 것이 문제점으로 부각되고 있다. 본 논문에서는 이와 같은 문제점을 해결하기 위해 문서 양식과 인식이 필요한 부분을 미리 지정해 놓고 문자 인식을 하는 방법 및 시스템을 제안한다. 제안된 시스템은 문자 인식 속도를 향상시키고 보다 정확한 문자 인식이 가능하게 하여, 전체적으로 문자 인식의 효율을 향상시킬 수 있을 것이다. 또한 대량의 정형화된 문서의 문자 인식에도 효과적일 것으로 기대한다.

  • PDF

A Study on Character Segmentation in Car Plates (번호판에서의 문자 세그멘테이션에 관한 연구)

  • Lee, Sang-Hoon;Kim, Kyung-Hyun;Kim, Chun-Lin;Cha, Eui-Young
    • Annual Conference of KIPS
    • /
    • 2003.05a
    • /
    • pp.623-626
    • /
    • 2003
  • 본 논문에서는 현재 자동차 번호판의 형식이 구 번호판과 신 번호판 두 가지 유형으로 구성되어 있다는 점을 고려하여 번호판의 세부적 세그멘테이션의 성능을 개선하는 방법에 대하여 제시한다. 컴퓨터 비젼을 바탕으로 한 자동차 번호판의 인식방법과 문자인식방법은 비용면이나 간편성에서 맡은 장점을 가지고 있으며 여러 응용분야에서 사용될 수 있기 때문에 다방면에서 시도되고 있다. 본 시스템은 모폴로지 연산과 클러스트링을 이용하여 자동차 번호판 전체 영역을 추출하는 방법을 사용한다. 다음으로 구번호판에서 신번호판으로 넘어가는 과도기적 단계에 있는 번호판들의 특징인 용도기능의 표시문자의 위치 차이를 이용하여 구 번호판과 신번호판을 먼저 분류한다. 분류된 번호판에서 두 번호판의 차이점인 차종기초 표시영역의 숫자를 나누어서 세그멘테이션함으로서 기존의 연구방법보다 개선된 세그멘테이션 능력과 이로 인하여 향상된 번호판 인식결과를 얻을 수 있다.

  • PDF

Feature Extraction of Hangul Character Based on Chaos Theory (카오스 이론을 이용한 한글 문자 특징 추출에 관한 연구)

  • 손영우;남궁재찬;홍경순
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 1999.10b
    • /
    • pp.315-317
    • /
    • 1999
  • 미세한 차이를 고감도 식별하는 카오스 이론의 프랙탈 차원과 스트레인즈 어트랙터를 생성하는 수정된 에농 함수를 이용하여, 한글 2,350자에 대한 시계열 데이터의 혼도도를 분석하기 위해, 각각의 문자 0트랙터를 구성한 후, 프랙탈 차원을 나타내는 Box-counting Dimension 및 Natural Measure, Information Bit, Information Dimension 등을 구하여 문자 특징을 추출하는 새로운 알고리즘을 제시하였다. 실험결과 한글 2,350자에 대하여 99.23%의 분류율을 나타내어 제안된 방법의 유효성을 보였다.

  • PDF

A Hangul Element Separation for the Hand-written Character Recognition (필기체 인식을 위한 한글 자소분리)

  • Baek, Nam-U
    • 한국ITS학회:학술대회논문집
    • /
    • 2004.11a
    • /
    • pp.208-211
    • /
    • 2004
  • 본 연구는 필기체 한글 문자를 인식하기 위하여 한글 문자구조를 6개 기본구조로 분류한다. 각각의 한글 자음과 모음을 7-세크먼트, '/'(Left-Incline), '$\backslash$'(Right-Incline), '-'(Left-Right), '$\mid$'(UP-Down), 'c'(Circle), 'ㄱ'(Right-down), 'ㄴ'(Down-Right) 분리한다. 분리된 7-세크먼트에 대해 한글이 쓰여지는 위치에 따라 8개의 기본구조로 정의하여 세크먼트를 분리하여 레벨화한다. 따라서 본 연구는 문자를 자소(자음과모음)로 하여 7-세크먼트로 분리하는 필기체 자소분리 구조를 제시한다.

  • PDF

An recognition of printed chinese character using neural network (신경망을 이용한 인쇄체 한자의 인식)

  • 이성범;오종욱;남궁재찬
    • The Journal of Korean Institute of Communications and Information Sciences
    • /
    • v.18 no.9
    • /
    • pp.1269-1282
    • /
    • 1993
  • In this paper, we propose to method of recognizing printed chinese characters which combine the coventional deterministic methods and the neural networks. Firstly, we extract four directional vector of strokes from chinese characters. Secondly, we make the mesh of the center of gravity in the vector and then constitute the H x8 feature matrix using black pixel lenth from each meshs. This normalized feature matrix value offer as the input of neural network for classifying into the 14 character types. And this calssified character classify again into Busu group by the Busu recognizing neural network. Finally, we recognize each characters using the distance of similarity between input characters and reference characters. The usefulness of the proposed algorithm is evaluated by experimenting with recognizing the chinese characters.

  • PDF

A Spam Filtering Method using Frequency Distribution of Special Letter and Frequency Ratio of Keyword (특수 문자 및 단어 빈도 비율을 이용한 스팸 필터링 방법)

  • Lee, Seong-Jin;Baik, Jong-Bum;Han, Chung-Seok;Lee, Soo-Won
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2011.06c
    • /
    • pp.280-283
    • /
    • 2011
  • 인터넷 환경에서 무차별적으로 유통되는 스팸 문서로 인한 사회적 문제가 커져 가고 있는 가운데 스팸문서를 차단하기 위한 활발한 연구들이 이루어지고 있다. 이 가운데 대표적인 연구는 자질어를 이용한 기계학습 기반의 스팸 차단 기술이다. 그러나 이 방법은 미리 선택된 자질어로만 구성된 분류 모델을 사용하기 때문에 Term Spamming(단어 조작에 의한 스팸 차단 행위)에 취약하며, 스팸 차단의 성능과 학습 소요 시간이 선택된 자질어의 품질과 수에 민감하게 영향을 받는다는 문제점이 있다. 본 논문에서는 이러한 문제를 해결하기 위해 스팸 문서에서 등장하는 특수 문자의 빈도와 반복되는 단어의 특징을 이용한 스팸 탐지 방법을 제안한다. 제안 방법은 각 문서에서 등장하는 특수 문자의 비율과 최다 출현 단어의 반복 패턴을 정의하고 기계학습 알고리즘을 적용하여 스팸 분류 모델을 생성한다. 제안 방법의 성능 평가를 위해 E-mail 데이터와 블로그의 Post 데이터를 사용하여 자질어 기반의 스팸 차단 방법과 비교 실험을 진행하였다. 실험 결과 본 논문에서 제안하는 방법이 분류 정확도와 학습 소요 시간에 있어 우수한 성능을 보이는 것을 확인하였다.

Edit Distance Problem for the Korean Alphabet with Phoneme Classification System (음소의 분류 체계를 이용한 한글 편집 거리 알고리즘)

  • Roh, Kang-Ho;Park, Kun-Soo;Cho, Hwan-Gue;Chang, So-Won
    • Journal of KIISE:Computer Systems and Theory
    • /
    • v.37 no.6
    • /
    • pp.323-329
    • /
    • 2010
  • The edit distance problem is finding the minimum number of edit operations to transform a string into another one. It is one of the important problems in algorithm research and there are some algorithms that compute an optimal edit distance for the one-dimensional languages such as the English alphabet. However, there are a few researches to find the edit distance for the more complicated language such as the Korean or Chinese alphabet. In this paper, we define the measure of the edit distance for the Korean alphabet with the phoneme classification system to improve the previous edit distance algorithm and present an algorithm for the edit distance problem for the Korean alphabet.

A Sentiment Analysis of Internet Movie Reviews Using String Kernels (문자열 커널을 이용한 인터넷 영화평의 감정 분석)

  • Kim, Sang-Do;Yoon, Hee-Geun;Park, Seong-Bae;Park, Se-Young;Lee, Sang-Jo
    • Annual Conference on Human and Language Technology
    • /
    • 2009.10a
    • /
    • pp.56-60
    • /
    • 2009
  • 오늘날 인터넷은 개인의 감정, 의견을 서로 공유할 수 있는 공간이 되고 있다. 하지만 인터넷에는 너무나 방대한 문서가 존재하기 때문에 다른 사용자들의 감정, 의견 정보를 개인의 의사 결정에 활용하기가 쉽지 않다. 최근 들어 감정이나 의견을 자동으로 추출하기 위한 연구가 활발하게 진행되고 있으며, 감정 분석에 관한 기존 연구들은 대부분 어구의 극성(polarity) 정보가 있는 감정 사전을 사용하고 있다. 하지만 인터넷에는 나날이 신조어가 새로 생기고 언어 파괴 현상이 자주 일어나기 때문에 사전에 기반한 방법은 한계가 있다. 본 논문은 감정 분석 문제를 긍정과 부정으로 구분하는 이진 분류 문제로 본다. 이진 분류 문제에서 탁월한 성능을 보이는 Support Vector Machines(SVM)을 사용하며, 문서들 간의 유사도 계산을 위해 문장의 부분 문자열을 비교하는 문자열 커널을 사용한다. 실험 결과, 실제 영화평에서 제안된 모델이 비교 대상으로 삼은 Bag of Words(BOW) 모델보다 안정적인 성능을 보였다.

  • PDF

A Rough Classification Method for Character Recognition Based on Patial Feature Vectors (문자인식을 위한 특징벡터의 부분 정보를 이용한 대분류 방법)

  • 강선미;오근창;황승욱;양윤모;김덕진
    • The Journal of Korean Institute of Communications and Information Sciences
    • /
    • v.18 no.1
    • /
    • pp.32-38
    • /
    • 1993
  • In this paper a effective classification method for character recognition is proposed. The existing classification methods select candidates by comparing an unknown input character, with all the standard patterns based on the similarity measur. The proposed method, however, groups similiar characters together and uses their average distance as representative value of the group. We divided the character region into several sub-region and applied ISODATA algorithm to partial vectors of each sub-region to anstruct appropriate number of groups. After computing the distance between partial feature vector and its mapping group, we could collect all the information of input character ultimately. The proposed method showed improvement in the processing speed and certainty in classification than the existing methods.

  • PDF