• Title/Summary/Keyword: 문자집합

Search Result 87, Processing Time 0.026 seconds

A New DNS Protocol for Multilingual Domain Names (다국어 도메인을 위한 DNS 프로토콜 : mlDNS)

  • 신혜원;이승익;이동만
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2000.10c
    • /
    • pp.328-330
    • /
    • 2000
  • DNS(Domain Name Service)는 인터넷 호스트의 주소를 제공하는 서비스로써 기존의 시스템은 영어 알파벳 이외의 다른 언어들로 구성된 도메인 네임(Domain Name)은 처리하지 못한다. 최근, 인터넷의 국제화에 따른 다국어 도메인의 필요성이 점차 증대됨에 따라 이러한 문제점을 해결하고 다국어 도메인 이름을 처리할 수 있는 새로운 DNS 프로토콜인 mlDNS(Multilingual Domain Name Service)를 제안한다. 기존의 DNS와의 호환성 및 상호 운용성을 보장하고 특정 언어에 종속되지 않는 시스템을 디자인하기 위해 mlDNS에서는 Unicode 문자 집합을 기반으로 모든 DNS 질의를 UTF-8 인코딩 방식으로 처리하고 이러한 새로운 mlDNS 질의와 기존의 DNS 질의를 구분하기 위해 DNS 질의 헤더에 'IN'이라는 새로운 비트 영역을 지정하여 사용한다.

  • PDF

A Study on the Image Recognition Using Mathematical Morphology (수학적 모폴로지를 이용한 화상인식에 관한 연구)

  • 남태희
    • Journal of the Korea Society of Computer and Information
    • /
    • v.3 no.2
    • /
    • pp.113-117
    • /
    • 1998
  • The image recognition, with various technics, recently presented an effective recognition scheme both for image and character. The analyzing process, however, is highly complicated so that this does not utilized fully. This paper examines the validity of the image recognition through morphology, which is simple and a theory of sets. The morphology applies erosion and dilation, opening and closing, and structuring element.

  • PDF

필기 한글 문자의 골격선 추출

  • 박정선;홍기천;오일석
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2000.04b
    • /
    • pp.565-567
    • /
    • 2000
  • 필기 한글 인식에서 원래 패턴의 모양을 유지하는 골격선 추출은 중요하다. 세선화에 의존하는 기존 방법은 작은 잡음에 민감하다는 단점을 안고 있다. 본 논문은 필기 한글 패턴에 적합한 새로운 골격선 추출 방법을 제안한다. 먼저 한글 패턴은 T-접점과 B-접점이라는 두가지 모양 특징을 중심으로 분할할 수 있다는 관찰에 근거하여 유사블록으로 이루어진 부품 집합으로 분할한다. 또한 세 개 이상의 획이 복잡한 형태로 만나는 지점을 결합 부품으로 분할한다. 그런 다음, 각 부품에서 접점의 형태에 따라 결합 부품을 추가 탐지한다. 결합 부품과 인접한 부품들의 연관 관계에 따라 골격선을 구하고, 골격선의 연결성을 보장하기 위해서 선분 연장을 수행한다. 본 논문에서 기존의 방법과의 비교를 위해 다섯 가지 비교 기준을 설정하고, 이를 기반으로 비교 분석하였다. 본 논문에서 제안한 방법이 여러 기준에서 세선화-기반 방법보다 우수함을 보였다.

  • PDF

A new segmentation method for non-manhattan layout document images using connected component (연결요소 특징을 이용한 복잡한 문서영상의 구조 분석)

  • 이상협;이경무
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 1997.11a
    • /
    • pp.71-74
    • /
    • 1997
  • 본 논문은 일반적으로 제약 없는 형식 문서 즉, 논-맨하탄(non-manhattan) 형식의 이진문서영상을 분석하는 기법으로서, 연결요소기법에 기반한 특징추출과 이를 이용한 영역분리 및 분류에 관한 새로운 방법을 제안한다. 제안한 방식은 바텀-업(bottom-up)방식으로서 먼저 처리속도의 고속화와 축소시 특징 영역보존을 위해 임계치 축소기법을 사용하고, 축소된 이진 문서영상내의 각 연결된 검은 화소의 집합을 개체화하고 개체의 특성에 따라 텍스트, 신성분, 해프톤, 도형 그리고 표 등으로 분류한다. 영역분류는 두단계로 이루어지는데, 1차분류에서는 우선, B/W 비, 면적, 외각 테두리의 높이와 너비 비, 테두리선유무 등의 특징을 이용하여 해프톤, 수평 수직선, 테두리(표 및 도형)영역을 분리한다. 이후 2차 분류에서는 문자성분의 수평결합을 통한 텍스트행 성분을 추출한다. 마지막 후처리 과정으로 표분석 알고리듬을 통하여 테두리 영역중 표와 도형을 정확히 구분하고, 또한 도형에 관련한 문서성분을 해당 도형 개체에 연결하는 작업을 수행함으로써 완벽한 영역분류를 한다. 다양한 문서영상을 이용한 시뮬레이션을 통해 제안한 알고리듬의 성능을 입증한다.

  • PDF

On-line Recognition in Korean Character Using Fuzzy Membership Function (퍼지소속함수를 이용한 온라인 한글 인식)

  • Shim, Young-Chul;Oh, Kyung-Whan
    • Annual Conference on Human and Language Technology
    • /
    • 1991.10a
    • /
    • pp.300-306
    • /
    • 1991
  • 본 논문에서는 온라인 한글 인식을 위하여 퍼지소속함수를 사용하였다. 획의 오인식으로 인한 문자의 오인식 문제를 해결하기 위하여 인식 시스템 내에서 획을 퍼지집합으로 표현하며, 자모를 인식하는데 사용되는 획의 중심점들 간의 방향은 퍼지소속 함수로 정의하여 추론한다. 본 논문에서 제시하는 퍼지추론 방법은 같은 획으로 시작되는 모든 자소에 대하여 적용되며, 애매모호한 상황하에서도 인식을 수행한다. 따라서 퍼지소속함수를 사용한 시스템은 종래에 오인식 되었던 애매한 글자들을 정확하게 인식할 수 있었다.

  • PDF

Edge Detection of Characters on the Rubber Tire Image Using Fuzzy $\alpha-Cut$ Set (퍼지 $\alpha$ 컷 집합에 의한 고무 타이어 영상의 문자 윤관선 추출)

  • 김경민;박중조;박귀태
    • Journal of the Korean Institute of Telematics and Electronics B
    • /
    • v.31B no.6
    • /
    • pp.71-80
    • /
    • 1994
  • The purpose of this paper is to explore the use of fuzzy set theory for image processing and analysis. As an application example, the fuzzy method of edge detection is proposed to extract the edges of raised characters on tires.In general, Sobel, Prewitt, Robert and LoG filters are used to detect the edge, but it is difficult to detect the edge because of ambiguity of representations, noise and general problems in the interpretation of tire image. Therefore, in his paper, the fuzzy property plane has been extracted from the spatial domain using the ramp-mapping function. And then the ideas of fuzzy MIN and MAX are applied in removing noise and enhancement of the image simultaneously. From the result of MIN and MAX procedure a new fuzzy singleton is generated by extracting the difference between adjacent membership function values. And the edges are extracted by applying fuzzy $\alpha$-cut set to the fuzzy singletion, Finally, these ideas are applied to the tire images.

  • PDF

Proximate Word Filtering by Hierarchical Clustering (계층적 군집화를 이용한 근사 단어 필터링 기법)

  • Kim, Sung-Hwan;Cho, Hwan-Gue
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2012.04a
    • /
    • pp.1101-1104
    • /
    • 2012
  • 단어 필터링은 유해정보를 차단위한 기본적인 기능이다. 그러나 악의적인 사용자는 필터링 시스템을 우회하기 위하여 금지 단어에 의도적인 변형을 가한다. 이에 대응하기 위해 일정 오류를 허용하여 필터링을 수행하는 근사 단어 필터링이 있다. 근사 단어를 검색하기 위한 문자열 색인 방법으로는 주로 기준 단어(Pivot)을 이용한 유클리드 공간에의 사상을 이용하는데, 이는 단어 필터링에 응용하기에는 근본적인 구조상의 한계점이 있다. 본 논문에서는 필터링 대상이 되는 단어 집합 내에서 군집화를 수행하여 계층적인 자료구조를 구성하고, 단어 필터링을 위한 필터링 질의(Filtering query)를 정의한 뒤 그에 적합한 탐색 상의 적용에 관하여 설명한다. 실험 결과 기존의 기준 단어(Pivot)을 이용한 색인 기법에 비하여 16.9%~26.6%의 탐색 속도 향상을 확인할 수 있었다.

A Study on Automatic Data Tagging for Text-based Training Data Construction (텍스트 기반의 훈련 데이터 구축을 위한 자동 데이터 태깅 작업에 대한 연구)

  • Kim, NaYun;So, Hyeryung;Park, Joonho
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2020.11a
    • /
    • pp.1008-1009
    • /
    • 2020
  • 텍스트 기반의 훈련 데이터는 데이터를 수집한 이후에 각 문자별로 태깅 작업이 필요하다. 말뭉치(Corpus)는 언어학에서 주로 이루고 있는 텍스트 집합이다. 말뭉치는 각 단어의 품사 표기에 대한 정보가 태그 형태로 되어 있다. 본 연구에서는 한국어 기반의 태깅 작업을 연구했으며, 기본 한국어 말뭉치가 아닌 기업이나 연구 기관에서 데이터를 수집하여 말뭉치나 별도 학습 데이터를 구축하기 위한 자동 태깅 방법에 대해 알아본다.

Establishment of the Korean Standard Vocal Sound into Character Conversion Rule (한국어 음가를 한글 표기로 변환하는 표준규칙 제정)

  • 이계영;임재걸
    • Journal of the Institute of Electronics Engineers of Korea CI
    • /
    • v.41 no.2
    • /
    • pp.51-64
    • /
    • 2004
  • The purpose of this paper is to establish the Standard Korean Vocal Sound into Character Conversion Rule (Standard VSCC Rule) by reversely applying the Korean Standard Pronunciation Rule that regulates the way of reading written Hangeul sentences. The Standard VSCC Rule performs a crucially important role in Korean speech recognition. The general method of speech recognition is to find the most similar pattern among the standard voice patterns to the input voice pattern. Each of the standard voice patterns is an average of several sample voice patterns. If the unit of the standard voice pattern is a word, then the number of entries of the standard voice pattern will be greater than a few millions (taking inflection and postpositional particles into account). This many entries require a huge database and an impractically too many comparisons in the process of finding the most similar pattern. Therefore, the unit of the standard voice pattern should be a syllable. In this case, we have to resolve the problem of the difference between the Korean vocal sounds and the writing characters. The process of converting a sequence of Korean vocal sounds into a sequence of characters requires our Standard VSCC Rule. Making use of our Standard VSCC Rule, we have implemented a Korean vocal sounds into Hangeul character conversion system. The Korean Standard Pronunciation Rule consists of 30 items. In order to show soundness and completeness of our Standard VSCC Rule, we have tested the conversion system with various data sets reflecting all the 30 items. The test results will be presented in this paper.

A Two-Phase On-Device Analysis for Gender Prediction of Mobile Users Using Discriminative and Popular Wordsets (모바일 사용자의 성별 예측을 위한 식별 및 인기 단어 집합 기반 2단계 기기 내 분석)

  • Choi, Yerim;Park, Kyuyon;Kim, Solee;Park, Jonghun
    • The Journal of Society for e-Business Studies
    • /
    • v.21 no.1
    • /
    • pp.65-77
    • /
    • 2016
  • As respecting one's privacy becomes an important issue in mobile device data analysis, on-device analysis is getting attention, in which the data analysis is conducted inside a mobile device without sending data from the device to outside. One possible application of the on-device analysis is gender prediction using text data in mobile devices, such as text messages, search keyword, website bookmarks, and contact, which are highly private, and the limited computing power of mobile devices can be addressed by utilizing the word comparison method, where words are selected beforehand and delivered to a mobile device of a user to determine the user's gender by matching mobile text data and the selected words. Moreover, it is known that performing prediction after filtering instances using definite evidences increases accuracy and reduces computational complexity. In this regard, we propose a two-phase approach to on-device gender prediction, where both discriminability and popularity of a word are sequentially considered. The proposed method performs predictions using a few highly discriminative words for all instances and popular words for unclassified instances from the previous prediction. From the experiments conducted on real-world dataset, the proposed method outperformed the compared methods.