• 제목/요약/키워드: 문자집합

검색결과 87건 처리시간 0.027초

순위다중패턴매칭을 위한 해싱기반 알고리즘의 이동테이블 병렬계산 (Parellel Computation of the Shift Table of a Hashing-Based Algorithm for the Order-Preserving Multiple Pattern Matching)

  • 박정훈;김영호;권상훈;심정섭
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2017년도 춘계학술발표대회
    • /
    • pp.36-39
    • /
    • 2017
  • 길이가 같은 두 문자열의 같은 위치에 있는 문자의 순위가 모두 일치할 때, 두 문자열은 순위동형이라 한다. 순위다중패턴매칭문제는 텍스트 T와 k개의 패턴들의 집합 $P^{\prime}=\{P_1,P_2{\ldots},P_k\}$이 주어졌을 때, P'의 패턴들과 순위동형인 T의 모든 부분문자열의 위치를 찾는 문제이다. 최근 전처리단계에서 P'에 대한 이동테이블을 O(kmqlogq) 시간에 계산하여 순위다중패턴매칭문제를 해결하는 해싱기반 알고리즘이 제시되었다. 이때 P'에서 가장 짧은 패턴의 길이를 m, q-그램의 길이를 q라고 한다. 본 논문에서는 P'이 주어졌을 때, 이동테이블을 O(mqlogq) 시간에 계산하는 병렬알고리즘을 제시한다. 실험결과, 본 논문에서 제시하는 병렬알고리즘은 k개의 스레드를 이용하여 m=100, q=5에 대해 k=100일때와 k=1,000일 때 순차알고리즘보다 각각 약 12.9배, 약 215배 빠른 수행시간을 보였다.

트리 구조를 이용한 수식 인식 연구 (A Study on Equation Recognition Using Tree Structure)

  • 박병준;김현식;김완태
    • 한국정보전자통신기술학회논문지
    • /
    • 제11권4호
    • /
    • pp.340-345
    • /
    • 2018
  • 수식은 일반 문장에 비해 복잡한 구조와 다양한 문자와 기호가 사용되어 단순한 키보드 입력만으로는 모든 문자 집합을 입력할 수 없어 한글이나 워드 같은 문서편집기 내에서도 자체적으로 구현된 수식 편집기를 사용하고 있다. 수식을 올바르게 표현하기 위해 구문을 해석할 수 있는 의미가 될 수 있는 사전 학습 정보가 필요하다. 문자가 입력되더라도 크기와 위치 서로간의 관계에 따라 다른 수식으로 표현될 수 있기 때문이다. 즉 표현될 위치와 크기 등 문자와 기호들 간의 상호관계를 고려하여 수식의 형태를 트리 모델로 표현한다. 문자인식 응용의 한 분야로 문자나 기호(부호)를 인식하는 기술을 이미 널리 알려졌지만, 수식을 입력과 해석하는 방법은 일반적인 텍스트에 비해 복잡한 분석 과정이 필요하다. 본 논문에서는 수식의 문자를 인식하고 표현되는 위치와 크기의 결정을 빠르게 해석하는 수식 인식기를 구현하였다.

TV 제어 메뉴의 다국적 언어 인식을 위한 특징 선정 기법 (A Feature Selection Technique for Multi-lingual Character Recognition)

  • 강근석;박현정;김호준
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송공학회 2005년도 학술대회
    • /
    • pp.199-202
    • /
    • 2005
  • TV OSD(On Screen Display) 메뉴 자동검증 시스템에서 다국적 언어의 문자 인식은 표준패턴의 구조적 분석이 쉽지 않을 뿐만 아니라 학습패턴 집합의 규모와 특징의 수가 증가함으로 인하여 특징추출 및 인식 과정에서 방대한 계산량이 요구된다. 이에 본 연구에서는 학습 데이터에 포함되는 다량의 특징 집합으로부터 인식에 필요한 효과적인 특징을 선별함으로써 패턴 분류기의 효율성을 개선하기 위한 방법론을 고찰한다. 이를 위하여 수정된 형태의 Adaboost 기법을 제안하고 이를 적용한 실험 결과로부터 그 유용성을 고찰한다. 제안된 알고리즘은 초기의 특징 집합을 취약한 성능을 갖는 다수의 분류기(classifier)로서 고려하며, 이로부터 반복학습을 통하여 개선된 분류기를 점진적으로 선별해 나가게 된다. 학습의 원리는 주어진 학습패턴 집합에 기초하여 일종의 교사학습(supervised learning) 방식으로 이루어진다. 각 패턴에 할당된 가중치 값은 각 단계에서 산출되는 분류결과에 따라 적응적으로 수정되어 반복학습이 진행됨에 따라 점차 보완적 성능을 갖는 분류기를 선택할 수 있게 한다. 즉, 주어진 각 학습패턴에 대하여 초기에 균등한 가중치가 부여되며, 반복학습의 각 단계에서 적용되는 분류기의 출력을 분석하여 오분류된 패턴의 가중치 분포를 증가시켜 나간다. 본 연구에서는 실제 응용으로서 OSD 메뉴검증 시스템을 대상으로 제안된 이론을 적용하고 그 타당성을 평가한다.

  • PDF

한글 문장의 자동 띄어쓰기 (Automatic Word-Segmentation for Hangul Sentences)

  • 강승식
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1998년도 제10회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.137-142
    • /
    • 1998
  • 자동 띄어쓰기는 띄어쓰기가 무시된 한글 문서의 자동색인이나 문자인식에서 줄바꿈 문자에 대한 공백 삽입 문제 등을 해결하는데 필요하다. 이러한 문서에서 공백이 삽입될 위치를 찾아 주는 띄어쓰기 알고리즘으로 어절 블록에 대한 문장 분할 기법과 양방향 최장일치법을 이용한 어절 인식 방법을 제안한다. 문장 분할은 한글의 음절 특성을 이용하여 어절 경계가 비교적 명확한 어절 블록을 추출하는 것이며, 어절 블록에 나타난 각 어절들을 인식하는 방법으로는 형태소 분석기를 이용한다. 4,500여 어절로 구성된 두 가지 유형의 문장 집합에 대하여 제안한 방법의 띄어쓰기 정확도를 평가한 결과 '공백 재현율'이 97.3%, '어절 재현율'이 93.2%로 나타났다.

  • PDF

모양 분해를 이용한 필기 한글 문자의 골격선 추출 (Extraction of Skeletons from Handwritten Hangul Characters using Shape Decomposition)

  • 홍기천;오일석
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제27권6호
    • /
    • pp.583-594
    • /
    • 2000
  • 필기 한글 문자 인식을 위한 획 추출 방법으로 많이 사용되는 세선화는 패턴을 왜곡시키는 문제점을 안고 있다. 본 논문은 모양 분해 알고리즘을 사용한 한글 문자의 골격선 추출 방법을 제안한다. 먼저 모양 분해 알고리즘을 사용하여 입력 패턴을 유사 볼록한 부품 집합으로 분해한다. 모양 분해된 패턴에서 결합 부품을 탐지하고, 이 부품과 인접한 부품들로부터 골격선을 구한다. 그 다음 결합 부품과 인접하지 않은 부품들에 대한 골격선을 추출하고 골격선의 연결성을 보장하기 위해서 선분 연장을 수행한다. 본 논문에서 추출한 골격선과 세선화로 추출한 골격선을 비교하기 위하여 다섯 가지 비교 기준을 설정하고, 이를 기반으로 비교 분석하였다. 본 논문에서 제안한 방법이 여러 기준에서 세선화-기반 방법보다 우수함을 보였다.

  • PDF

순위다중패턴매칭을 위한 해싱기반 알고리즘 (A Hashing-Based Algorithm for Order-Preserving Multiple Pattern Matching)

  • 강문성;조석현;심정섭
    • 정보과학회 논문지
    • /
    • 제43권5호
    • /
    • pp.509-515
    • /
    • 2016
  • 순위패턴매칭문제는 텍스트 T와 패턴 P가 주어질 때, P와 각 문자들의 순위가 동일한 순서로 나타나는 T의 모든 부분문자열을 찾는 문제이다. 순위패턴매칭문제는 주가지수분석과 음악의 유사성분석과 같이 문자 자체를 비교하는 것보다 값의 변화순서가 중요한 분야에서 연구가 진행되었다. 순위다중패턴매칭문제는 텍스트 T와 여러 개의 패턴들로 이루어진 패턴집합 $\mathbb{P}$가 주어질 때, $\mathbb{P}$에 속한 패턴과 각 문자들의 순위가 동일한 순서로 나타나는 T의 모든 부분문자열을 찾는 문제이다. 본 논문에서는 순위다중패턴매칭문제를 해결하는 해싱기반 알고리즘을 제시한다.

위상회전에 의한 필기체 한글의 자동인식 (Automatic Recognition of Hand-written Hangout by the Phase Rotation)

  • 이주근;김홍기
    • 대한전자공학회논문지
    • /
    • 제13권1호
    • /
    • pp.23-30
    • /
    • 1976
  • 이 논문에서는 위상회전에 의한 오목구조의 짐출로서 필기체 한글을 인식하는 한 방법을 검토한다. 문자 Pattern를 오목구조적인 기본 Segment로 분해하여 집합으로 분류하고, 그들 집함에 대한 각 Segment의 폐상태와 위상특징을 logic으로 표현한다. 다음 그들 logic pattern의 위상회전으로서 오목구조의 topological성질과 위상특징을 검출하여 문자를 결정한다. 이 방법은 필기체의 변화와 문자의 대소, 경사 띤 위치 변위에 대한 식별의 유연성을 가지며, 인식율이 높다. In this paper, a method is proposed for the recognition of hand-written Hangeul. This is peiformed by extraction of the concave structural segments by phase rotation. Character patterns can be decomposed into the fundamental concave structural segments which are also categorized into segment sects, and the closure and phase features of each segment in set is represented by logics. By rotating the logic pattern, the topological and phase features of segment are extracted for the reliable recognition of the character. It is also evaluated that this method applies to a wide variety of shape, position and declination of the character.

  • PDF

한글 문자의 인식을 위한 대수적 구조 (Algebraic Structure for the Recognition of Korean Characters)

  • 이주근;주훈
    • 대한전자공학회논문지
    • /
    • 제12권2호
    • /
    • pp.11-17
    • /
    • 1975
  • 이 논문은 한글문자의 자동인식을 위한 기초적인 연구로서 기본문자의 구조에 대해서 검토하였다. 기본문자를 구조, 선분구조 및 물자 graph의 node와의 연결곤계 들 구조를 세가지 측면에서 집합 및 군론에 의한 대수적인 분석을 하고 또 그들의 각 구조의 복잡성에 대한 계릉을 고찰하였다. 나아가서 10개의 모음은 한 요소의 Affine 변환에 의한 연속회전으로 이루어지는 회전변환군 속에서 다수의 동치관계가 존재한다는 것을 기술하므로써, 한글문자의 인식에 있어서는 topological 골격외에 기하적 성질이 특히 중요하다는 것을 아울러 지적 하였다. The paper examined the character structure as a basic study for the recognition of Korean characters. In view of concave structure, line structure and node relationship of character graph, the algebraic structure of the basic Korean characters is are analized. Also, the degree of complexities in their character structure is discussed and classififed. Futhermore, by describing the fact that some equivalence relations are existed between the 10 vowels of rotational transformation group by Affine transformation of one element into another, it could be pointed out that the geometrical properting in addition to the topological properties are very important for the recognition of Korean characters.

  • PDF

연산자 LIKE의 새로운 한글 탐색 패턴 (A New Korean Search Pattern of the Operator LIKE)

  • 박성철;노은향;박영철;박종철
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제34권3호
    • /
    • pp.244-260
    • /
    • 2007
  • 데이타베이스 언어인 SQL의 연산자 LIKE는 문자열을 탐색하기 위한 연산자로서 문자열 양식을 설정함으로써 그에 부합하는 칼럼값들을 식별할 수 있게 한다. 표음문자인 한글의 각 음절은 초성과 중성으로 구성되거나 초성, 중성, 그리고 종성으로 구성된다. 본 논문은 연산자 LIKE의 한글 음절의 탐색 양식으로서 한글 음절로 표현되는 기존 양식에 추가하여 한글의 초성과 중성에 기반한 새로운 양식을 제안한다. 제안하는 한글 탐색 양식은 특정 초성을 가지는 한글 음절들, 특정 중성을 가지는 한글 음절들, 또는 특정 초성과 중성을 가지는 한글 음절들을 탐색할 수 있게 한다. 제안하는 한글 탐색 양식을 SQL의 기존 연산자들로 표현하는 것은 실질적으로 많은 불편을 수반하며 DBMS의 문자 집합에 따라 응용 프로그램의 호환성 문제를 초래할 수 있다. 본 논문은 제안하는 한글 탐색 양식을 고려한 연산자 LIKE의 수행 알고리즘을 한글과 한자에 대한 정보 교환용 부호계의 국가 표준인 KS X 1001로 표현된 문자들을 기반으로 제시한다.

시장측면에서 본 초고속 정보통신망

  • 최수혁
    • 한국데이타베이스학회:학술대회논문집
    • /
    • 한국데이타베이스학회 1994년도 DB산업기술 활성화를 위한 학술대회 및 기술 심포지움
    • /
    • pp.183-198
    • /
    • 1994
  • $\circledcirc$ 초고속정보통신망이란\ulcorner $\square$ 음성, 기호 및 영상 등의 멀티미디어 서비스를 실어보내는 정보고속도로 $\square$ 기존 통신망으로는 한계에 직면하고 있는 정보전달속도와 영상전송서비스를 강화시키는 새로운 고속화, 대용랑화된 통신망 $\square$ 초고속, 대용량, 쌍방항의 음성, 문자ㆍ도형, 영상을 포함한 복합서비스를 전송하는 모든 유무선망의 집합체 $\square$ 전화, 컴퓨터, TV가 통합된 "완전한 멀티미디어서비스" 개발 및 공급을 촉진하는 새로운 기반구조(중략)

  • PDF