통합 검색 | Korea Science

연역적이고 국부적인 영문자의 폰트 분류법 (A Priori and the Local Font Classification)

정민철
- 한국산학기술학회:학술대회논문집
- /
- 한국산학기술학회 2002년도 추계학술발표논문집
- /
- pp.205-208
- /
- 2002
본 연구에서는 영문 단어로부터 폰트를 분류하기 위해 연역적이고 국부적인 폰트 분류 방법을 제안한다. 이는 문자 인식 전에 한 단어에서 폰트를 분류하는 것을 말한다. 폰트 분류를 위해 활자 특성인 Ascender, Descender와 Serif가 사용된다. 입력 단어로부터 Ascender, Descender와 Serif가 추출되어 특징 벡터가 추출되고, 그 특징 벡터는 인공 신경망에 의해 입력 단어에 대한 폰트 그룹, 폰트 이름이 분류된다. 제안된 연역적이고 국부적인 폰트 분류 방법은 폰트 정보가 문자 분할기와 문자 인식기에 사용될 수 있게 한다 나아가, 특정 폰트에 따른 Mono-font 문자 분할기와 Mono-Font 문자 인식기로 구성되는 OCR 시스템을 구성할 수 있는 것을 가능하게 한다.

혼용문서에서의 유사문자 분류 (The Similar Character Classification in the Mixed Document)

문경애;지수영;오원근
- 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
- /
- 한국정보과학회언어공학연구회 1993년도 제5회 한글 및 한국어정보처리 학술대회
- /
- pp.485-492
- /
- 1993
본 논문에서는 혼용문서에서 문자들의 유사성으로 인해 발생하는 오인식문자를 줄이기위해 대분류 단계에서 유사문자군을 찾고 이들 사이의 유사도를 계산, 분류하는 유사문자분류 방법을 제안하였다. 이 방법은 유사문자군내의 각 문자마다 그 문자만이 갖는 고유한 요인과 그 문자를 제외한 나머지 문자일 가능성이 있는 요인을 찾아 입력문자와 비교하여 유사도가 가장 큰 문자를 인식문자로 선택하는 알고리즘이다. 또한, 인식 후 오인식된 문자들에 대해 특징사전의 갱신을 통하여 인식률을 향상시켰다.
PDF

신문자동인식 시스템을 위한 문자의 분류에 관한 연구 (A Study on the Classify of Character for Newspaper Automatic Recognition System)

이승형;전종익;조용주;남궁재찬
- 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
- /
- 한국정보과학회언어공학연구회 1989년도 한글날기념 학술대회 발표논문집
- /
- pp.209-215
- /
- 1989
본 논문에서는 신문자동인식을 위한 신문문자의 분류에 관한 연구를 하였다. 먼저, 문서의 문자를 추출하기 위하여 블럭화를 행한다. 블럭화는 문자열을 찾아 절과절, 단어와 단어 사이를 찾아 분리구간을 정한다음 블럭을 합성 및 분리를 하였다. 다음으로 블럭화된 문자의 종류를 알기 위한 각 문자에 대하여 6 형식 분류를 하여 특성을 조사함으로써 문자분류를 행하였다. 본 연구에서는 실험을 용하여 블럭화는 충실하게 추출이 되어졌고 한글의 모아쓰기 특성과 한문과의 유사한 형식특성 때문에 분류에 어려움이 있었으나 비교적 충실하게 추출하였다.
PDF

기계학습과 언어처리에 기반한 문자메시지 분류 (Text Message Classification based on Machine Learning)

선주오;지명근;최범휘;이현아
- 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
- /
- 한국정보과학회언어공학연구회 2019년도 제31회 한글 및 한국어 정보처리 학술대회
- /
- pp.492-495
- /
- 2019
휴대전화 메시지로는 결제, 인증번호, 택배, 광고 등의 다양한 문자들이 수신된다. 이 문자들은 서로 섞여 있어 이용자가 찾고자 하는 문자를 찾는 데 어려움이 있다. 본 논문에서는 기계학습과 단어 임베딩을 통해 메시지들을 카테고리로 분류하는 방법을 제안하고, 이를 구현한 안드로이드 앱을 소개한다. 앱에서는 택배, 카드, 인증, 공공기관, 통신사, 대화, 기타의 7개의 분류로 메시지를 분류하며, 자동 분류에서는 수동 태깅한 5802건의 문자메시지를 사용한다. 앱에서는 저장된 문자메시지간 유사도에 기반한 오프라인에 서의 자동 분류를 지원하여 개인정보 노출에 대한 거부감이 있는 사용자의 요구를 반영한다.
PDF

유형의 상대적 크기를 고려한 한글문자의 유형 분류 (Tyue Classification of Korean Characters Considering Relative Type Size)

김병기
- 한국컴퓨터정보학회논문지
- /
- 제11권6호
- /
- pp.99-106
- /
- 2006
한글과 같이 문자집합이 큰 조합 문자의 인식을 위해서는 문제공간을 줄여주는 유형분류가 큰 도움이 된다. 기존 연구들이 한글 구성원리에 치중하여 한글 유형을 정한 결과 복모음 문자에 대한 정확한 분류가 어려웠고 문자집합이 상대적으로 큰 종성 있는 문자들에 대한 세분류가 부족하여 문제공간의 분배에 어려움이 많았다. 본 논문에서는 이러한 문제들을 해결하고자 수평 투영 프로파일을 이용하여 안정적 추출이 가능한 횡모음을 우선 추출하고. 수평 투영 프로파일과 연결요소를 이용하여 종성 있는 문자들에 대하여 종성을 5가지 그룹 중 하나로 세분류 하는 유형분류 방법을 제안하였다. 기존의 유형분류 방법들이 유형간 크기 불균형을 갖는 6개 혹은 15개의 유형을 가진 반면에 제안한 방법은 균형 있고 안정적 분류가 가능한 19개의 유형을 갖는다. 한글 잦기순 1.000자에 대한 7개의 상용 글꼴자료를 사용하여 분류 시스템을 만들고 월간지에서 스캔(Scan)한 30.614자에 대한 유형 분류 실험을 통하여 제안한 방법이 다양한 글꼴과 큰 문자집합을 갖는 한글 문자의 유형분류에 효율적임을 확인하였다.
PDF

Substroke HMM 기반 온라인 필기체 문자인식 (On-line Handwriting Recognition Based on Substroke HMM)

김춘영;석수영;정호열;정현열
- 융합신호처리학회 학술대회논문집
- /
- 한국신호처리시스템학회 2003년도 하계학술대회 논문집
- /
- pp.74-77
- /
- 2003
본 논문에서는 자연스러운 온라인 필기체 문자 인식을 위하여 획 기반 HMM(Substroke HMM)을 기반으로 한 인식 방법을 채택하고, 획 분류의 정확도 향상을 위한 전처리 과정에 대해 재샘플링 간격 조정을 통한 획 분류실험을 통해 인식률 제고에 관한 실험을 수행하였다 필기체 문자인식을 위한 방법으로 한 문자 전체를 HMM으로 구성하는 Whole-character HMM과 자소단위를 HMM으로 구성하는 character HMM을 주로 이용하였으나, 이러한 방법은 문자의 수에 비례하여 비교적 큰 메모리 용량과 계산량이 요구되는 단점이 있다. 이러한 단점을 개선하기 위한 획 기반 HMM은 문자를 획 단위로 분류한 후 이를 HMM 모델로 구성하므로 소수의 획 기반 HMM 모델만으로 문자를 모두 표현할 수 있는 장점을 가지고 있어, 인식률의 큰 저하 없이 계산량 및 메모리 용량을 크게 줄일 수 있다. PDA상에서 수집한 완성형 한글 데이터베이스를 사용하여 획 분류 실험을 수행한 결과 평활화와 7/100 길이의 재샘플링을 수행한 경우 평활화 과정을 추가하지 않은 기존의 재샘플링 5/100 길이의 경우에 비해 정확도가 평균 3.7% 향상을 나타내었으며, 특히 첨가 에러율이 감소함을 확인할 수 있다.
PDF

한글 인쇄체 문자의 형식 분류 및 비선형적 자소 분리에 관한 연구 (A Study on Korean Printed Character Type Classification And Nonlinear Grapheme Segmentation)

박용민;김도현;차의영
- 한국정보통신학회:학술대회논문집
- /
- 한국해양정보통신학회 2006년도 춘계종합학술대회
- /
- pp.784-787
- /
- 2006
본 논문에서는 한글 인쇄체 문자의 자소를 비선형적으로 분리하는 방법을 제안한다. 자소 분리 대상 문자는 자소의 조합 방식에 따라 6개의 형식으로 분류한다. 인쇄체 한글의 6형식 분류를 위해 그레이 레벨의 문자 이미지로부터 망 특성과 수직 수평 투영 기법을 이용해 특징을 추출하고, 오류 역전파 기법을 이용하여 분류를 시도한다. 분류된 문자 형식을 기반으로 분리 후보 영역을 지정하고, 이 영역을 기반으로 다단식 그래프 탐색 알고리즘을 이용하여 최적의 비선형적 자소 분리 경로를 찾아낸다. 실험 결과, 제안한 방법은 한글의 6형식 분류에 적합하였으며, 자소가 서로 붙어 선형적으로 분리가 어려운 문자의 자소 분리에 좋은 성능을 나타내었다.
PDF

A Deep Learning Model for Disaster Alerts Classification

Park, Soonwook;Jun, Hyeyoon;Kim, Yoonsoo;Lee, Soowon
- 한국컴퓨터정보학회논문지
- /
- 제26권12호
- /
- pp.1-9
- /
- 2021
재난문자는 재난 발생 시 국가에서 해당 지역에 있는 시민들에게 보내는 문자 메시지다. 재난문자의 발송 건수는 점점 증가하여, 불필요한 재난문자가 많이 수신됨에 따라 재난문자를 차단하는 사람들이 증가하고 있다. 이와 같은 문제를 해결하기 위하여, 본 연구에서는 재난문자를 재난 유형별로 자동으로 분류하고 수신자에 따라 필요한 재난의 재난문자만 수신하게 하는 딥러닝 모델을 제안한다. 제안 모델은 재난문자를 KoBERT를 통해 임베딩하고, LSTM을 통해 재난 유형별로 분류한다. [명사], [명사 + 형용사 + 동사], [모든 품사]의 3가지 품사 조합과 제안 모델, 키워드 분류, Word2Vec + 1D-CNN 및 KoBERT + FFNN의 4종류 분류 모델을 활용하여 재난문자를 분류한 결과, 제안 모델이 0.988954의 정확도로 가장 높은 성능을 달성하였다.
https://doi.org/10.9708/jksci.2021.26.12.001 인용 PDF KSCI HTML

문자형식 분류 기반의 인쇄체 문자인식에 관한 연구 (A Study on Machine Printed Character Recognition Based on Character Type Classification)

임길택;김호연
- 전자공학회논문지CI
- /
- 제40권5호
- /
- pp.266-279
- /
- 2003
본 논문에서는 문자의 형식정보를 이용하여 인식대상 문자군을 분할하여 인쇄체 문자를 인식하는 방법을 제안한다. 인식대상 문자를 전체 7개의 형식으로 나누는데, 한글 문자의 경우 자소 조합 방식에 따라 6개의 형식으로 분류하며, 영·숫자 및 기호 문자의 경우 1개의 형식으로 분류한다. 각 문자형식에 따라 입력 문자 영상을 몇 개의 인식단위로 나누고, 이에 대한 방향각도 특징을 추출하여 신경망 인식기에 입력하여 인식한 후 인식된 각 인식단위를 조합하여 문자인식을 한다. 각각 구현된 7가지 형식별 문자인식기를 단순 스위칭 및 통합 방법과 두 방법의 변형 방법 등 7가지의 방법으로 결합하여 최종 문자인식을 하였다. 실험 결과, 단순 스위칭 방법은 98.62%, 단순 통합 방법은 90.54%, 나머지 5가지의 변형 방법들이 97.35%에서 98.65%의 인식 성능을 보였다.
PDF KSCI

DCT와 정보 화소 밀도를 이용한 PDA로 획득한 명함 영상에서의 영역 해석 (Region Analysis of Business Card Images Acquired in PDA Using DCT and Information Pixel Density)

김종흔;장익훈;김남철
- 한국통신학회논문지
- /
- 제29권8C호
- /
- pp.1159-1174
- /
- 2004
본 논문에서는 PDA에 장착된 카메라를 사용하여 획득한 명함 영상에 대한 효율적인 영역 해석 알고리듬을 제안한다. 제안된 방법은 크게 영역 분할, 정보 영역 분류, 문자 영역 분류의 3개 과정으로 구성된다. 영역 분할에서는 입력 명함 영상을 8${\times}$8 크기의 블록으로 나누고 각 블록을 저주파 대역에서의 정규화 된 DCT 계수의 에너지를 이용하여 정보 블록과 배경 블록으로 분류한 다음, 블록에 대한 영역 라벨링을 통하여 정보 영역과 배경 영역으로 분할한다. 정보 영역 분류에서는 각 정보 영역을 블록 신호의 수평, 수직 방향 에지 성분과 저주파 대역에서의 DCT 계수의 에너지 비와 이진화 된 정보 영역 내에서의 흑화소인 정보 화소의 밀도를 이용하여 문자 영역과 배경 영역으로 분류한다. 문자 영역 분류에서는 분류된 문자 영역을 정보 화소의 밀도와 평균 런 길이를 이용하여 다시 큰 문자와 작은 문자 영역으로 분류한다. 실험결과 제안된 영역 해석 방법은 여러 종류의 명함을 다양한 주변 여건에서 PDA로 획득한 시험 영상에 대하여 정보 영역과 배경 영역을 잘 분할하고, 정보 영역을 문자 영역과 그림 영역으로 잘 분류하며, 다시 문자 영역을 큰 문자와 작은 문자 영역으로 잘 분류함을 보였다 그리고 제안된 영역 분할 방법과 정보 영역 분류 방법은 기존의 방법들보다 각각 약 2.2-10.1%와 7.7%의 에러율 향상을 보였다.
PDF KSCI

검색결과 348건 처리시간 0.025초

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

자세히 찾기

이미지 검색 (β)