Search | Korea Science

Terminology Tagging System using elements of Korean Encyclopedia (백과사전 기반 전문용어 태깅 시스템)

Bae, Young-Jun;Choe, Ho-Seop;Ock, Cheul-Young
- Annual Conference on Human and Language Technology
- /
- 2005.10a
- /
- pp.167-172
- /
- 2005
지금까지 자연언어처리에서의 품사태깅(parts-of-speech tagging) 기술에 대한 연구는 활발히 진행된 반면, 전문용어에 대한 처리 기술은 미비한 점이 많았다. 전문용어에 관련된 연구는 대부분 구축, 표준화, 추출 등에 대한 연구가 많았으나 전문용어 태그 설정과 태깅 기술 연구는 부족한 상황이다. 본 논문에서는 전문용어 태그를 (분야정보: 아이디) 순으로 설정하고 백과사전의 분류 체계를 이용하여 어떤 특정 분야 문서의 전문용어를 자동으로 태깅하는 시스템을 구축하였다. 전문용어 태깅 시스템은 형태소분석기를 사용하지 알고 문맥의 규칙과 조사 어미사전을 이용해 자동으로 태깅을 하게 된다. 이 시스템의 정확률 측정을 위한 정답말뭉치는 웹 상에 공개되어 있는 백과사전 html문서를 이용하였다. 우선 백과사전에 나와있는 용어는 전문용어라고 가정한다. 하나의 문서에는 '용어', '요약', '본문', '이미지', '분류', '참조항목' 등의 정보들이 있다. 이 중 '본문'에는 그 용어에 대한 자세한 설명이 있는데 특정 단어에는 태그로 백과사전 내에 있는 단어를 찾아 볼 수 있게 링크 되어있다. 이 정보를 이용해 태그로 되어있는 것을 설정한 태그로 바꾸고 단계별로 확장 태깅을 해서 정답말뭉치를 만든다. 태깅 시스템과 정답말뭉치를 비교해 정확률을 계산해서 시스템의 성능을 측정하였다.

The Korean Part-of-speech Tagging Workbench for Tagged Corpus Construction (품사태그부착 코퍼스 구축을 위한 한국어 품사태깅 워크벤치)

Park, Young-C.;Kim, Nam-Il;Huh, Wook;Nam, Ki-Chun;Choi, Key-Sun
- Annual Conference on Human and Language Technology
- /
- 1997.10a
- /
- pp.94-101
- /
- 1997
한국어의 언어분석을 위한 가공코퍼스의 하나인 품사부착 코퍼스는 형태소 언어분석의 기초가 되는 자료로서 각종 언어분석 모델의 학습자료와 관측자료 또는 검증자료로서 중요한 역할을 한다. 품사부착 코퍼스의 구축은 많은 노력과 시간이 요구되는 어려운 작업이다. 기존의 구축방법은 자동 태거의 결과를 일일이 사람이 확인해 가면 오류를 발견하고 수정하는 단순 작업이었다. 이러한 단순 작업은 한번 수정된 자동태거의 반복적 오류, 미등록어에 의한 오류 들을 계속적으로 수정해야하는 비효율성을 내포하고 있었다. 본 논문에서는 HMM기반의 자동 태거를 사용하여 1차적으로 한국어 문서를 자동 태깅한다. 자동 태깅 결과로부터 규칙기반의 오류 수정을 추가적으로 행한다. 이렇게 구축된 결과를 사용자에게 제시하여 최종 오류를 수정하고 이를 앞으로의 태깅작업에 반영하는 품사부착 워크벤치에 대해 기술한다.
PDF

The Method for the Construction of POS Tagged Corpus based on Morpheme Ready Made Dictionary and RDBMS (형태소 기분석 사전과 DBMS를 이장한 형태소 분석 말뭉치 구축의 한 방법)

Cho, Jin-Hyun;Kang, Beom-Mo
- Annual Conference on Human and Language Technology
- /
- 2001.10d
- /
- pp.33-40
- /
- 2001
본 논문은 1999년도에 구축된 '150만 세종 형태소 분석 말뭉치'를 바탕으로 형태소 기분석 사전을 구축하고, 이를 토대로 후처리의 수작업을 고려한 반자동 태거를 구축하는 방법론에 대해 연구한 것이다. 분석말뭉치 구축에 있어 기존 자동 태거에 의한 자동 태깅의 문제점을 분석하고, 이미 구축된 형태분석 말뭉치를 이용해 후처리 작업이 보다 용이한 1차 가공말뭉치를 구축하는 반자동 태거의 개발과 그 방법론을 제시하는데 목적을 두고 있다. 이와 같은 논의에 따라 분석 말뭉치의 구축을 위한 태거는 일반적인 언어 처리를 위한 태거와는 다르다는 점을 주장하였고, 태거에 전적으로 의존하는 태깅 방식보다는 수작업의 편의를 제공할 수 있는 태깅 방식이 필요함을 강조하였다. 본 연구에서 제안된 반자동 태거는 전체적인 태깅 성공률과 정확도가 기존의 태거에 비해 떨어지지만 정확한 단일 분석 결과를 텍스트의 장르에 따른 편차 없이 50% 이상으로 산출하고, 해결이 어려운 어절 유형에 대해서 완전히 작업자의 판단에 맡김으로써 오류의 가능성을 줄인다. 또한 분석 어절에 대해 여러 표지를 부착함으로써 체계적이고 단계적인 후처리 작업이 가능하도록 하였다.
PDF

Semi-Automatic Object-Action Extractor to Build the Utterance Corpus for the Dialogue System (대화 시스템의 말뭉치 구축을 위한 Object-Action 반자동 추출기)

Yoon, JungMin;Hwang, Jaewon;Ko, Youngjoong
- Annual Conference on Human and Language Technology
- /
- 2015.10a
- /
- pp.220-223
- /
- 2015
본 논문은 대화 시스템에서 사용되는 말뭉치의 구축을 위해 Object와 Action을 반자동으로 추출하는 도구에 대해 기술한다. 제안하는 추출 도구는 형태소 분석과 의존 구문 분석의 결과를 기반으로 적절한 Object와 Action을 추출하는 것에 목표를 두고 있다. 그러나 형태소 분석과 의존 구문 분석의 결과는 여러 가지 오류가 포함될 수 있다. 이러한 오류는 잘못된 Object와 Action의 추출로 이어질 수 있다. 그리고 Object의 추출에 있어 해당 명사의 격이 중요한 정보를 가진다. 하지만 한국어의 특성한 조사의 생략 등으로 인해 격 태깅의 모호성이 발생하게 된다. 따라서 본 논문에서 제안하는 반자동 추출기는 형태소 분석과 의존 구문 분석의 잘못된 결과를 사용자가 손쉽게 수정할 수 있도록 하고 모호성이 발생할 수 있는 Object를 사용자에게 알려주어 올바른 Object와 Action의 추출을 가능하게 한다. 추출기를 이용한 말뭉치의 구축은 1) 형태소 분석 2) 의존 구문 분석 3) Object-Action 추출의 단계로 진행된다. 실험에서 사용된 발화는 관광 회화용 대화 시스템의 숙박, 공항 영역의 500개의 발화이며, 이 중 259개의 발화가 태깅 시 모호성이 발생하는 발화이다. 반자동 추출기를 통해 모호성이 발생한 발화를 태깅한 결과 전체 발화 중 51.8%의 발화를 빠르고 정확하게 태깅할 수 있었다.
PDF

Word Sense Disambiguation using Meaning Groups (의미그룹을 이용한 단어 중의성 해소)

Kim, Eun-Jin;Lee, Soo-Won
- Journal of KIISE:Computing Practices and Letters
- /
- v.16 no.6
- /
- pp.747-751
- /
- 2010
This paper proposes the method that increases the accuracy for tagging word meaning by creating sense tagged data automatically using machine readable dictionaries. The concept of meaning group is applied here, where the meaning group for each meaning of a target word consists of neighbor words of the target word. To enhance the tagging accuracy, the notion of concentration is used for the weight of each word in a meaning group. The tagging result in SENSEVAL-2 data shows that accuracy of the proposed method is better than that of existing ones.
PDF KSCI

Enhanced RDFa Tagging Method using XML Editing Tool (XML 편집도구를 이용한 향상된 RDFa 태깅 기법)

Choi, Young-Ho;Cha, Seung-Jun;Lee, Kyu-Chul
- Proceedings of the Korea Information Processing Society Conference
- /
- 2010.11a
- /
- pp.155-158
- /
- 2010
시맨틱 웹 기술을 활용한 OpenAPI 의미 기반 검색 시스템에서 설명정보페이지에 의미정보를 가진 메타데이터를 첨가하기 위해 RDFa 기술을 이용한 태깅을 하였다. 하지만 태깅 시 사람이 수작업을 통해 입력하기 때문에 시간소모가 크고 오류 위험이 높다는 제약사항이 있다. 이러한 제약사항을 해결하기 위해 본 논문에서는 XML/XHTML 편집도구를 이용한 향상된 RDFa 태깅을 제안한다. 이는 속도향상과 오류 감소의 방법으로 XML/XHTML 편집도구에서 제공하는 자동완성 기능을 제안하고 있다. 그리고 자동완성 기능을 사용하기 위해 DTD를 수정하여 적용하였고 수정된 방법을 테스트한 결과 기존의 수동 태깅 기법보다 걸리는 시간이 단축됐고, 오류를 줄일 수 있음이 확인되었다. 결과를 얻을 수 있었다.
https://doi.org/10.3745/PKIPS.y2010m11a.155 인용 PDF

Learning Tagging Ontology from Large Tagging Data (대규모 태깅 데이터를 이용한 태깅 온톨로지 학습)

Kang, Sin-Jae
- Journal of the Korean Institute of Intelligent Systems
- /
- v.18 no.2
- /
- pp.157-162
- /
- 2008
This paper presents a learning method of tagging ontology using large tagging data such as a folksonomy, which stands for classification structure informally created by the people. There is no common agreement about the semantics of a tagging, and most social web sites internally use different methods to represent tagging information, obstructing interoperability between sites and the automated processing by software agents. To solve this problem, we need a tagging ontology, defined by analyzing intrinsic attributes of a tagging. Through several machine learning for tagging data, tag groups and similar user groups are extracted, and then used to learn the tagging ontology. A recommender system adopting the tagging ontology is also suggested as an applying field.
https://doi.org/10.5391/JKIIS.2008.18.2.157 인용 PDF KSCI

A Study on Automatic Data Tagging for Text-based Training Data Construction (텍스트 기반의 훈련 데이터 구축을 위한 자동 데이터 태깅 작업에 대한 연구)

Kim, NaYun;So, Hyeryung;Park, Joonho
- Proceedings of the Korea Information Processing Society Conference
- /
- 2020.11a
- /
- pp.1008-1009
- /
- 2020
텍스트 기반의 훈련 데이터는 데이터를 수집한 이후에 각 문자별로 태깅 작업이 필요하다. 말뭉치(Corpus)는 언어학에서 주로 이루고 있는 텍스트 집합이다. 말뭉치는 각 단어의 품사 표기에 대한 정보가 태그 형태로 되어 있다. 본 연구에서는 한국어 기반의 태깅 작업을 연구했으며, 기본 한국어 말뭉치가 아닌 기업이나 연구 기관에서 데이터를 수집하여 말뭉치나 별도 학습 데이터를 구축하기 위한 자동 태깅 방법에 대해 알아본다.
https://doi.org/10.3745/PKIPS.y2020m11a.1008 인용 PDF

Automatic Acquisition of Lexical Rules for Part-of-Speech Tagging (품사태깅을 위한 어휘규칙의 자동획득)

Lee, Sang-Zoo;Ryu, Won-Ho;Kim, Jin-Dong;Rim, Hae-Chang
- Annual Conference on Human and Language Technology
- /
- 1998.10c
- /
- pp.20-27
- /
- 1998
기존의 어휘규칙기반 품사태거는 품사문맥이나 어휘확률만을 사용하는 통계적 품사태거에 의해 해결되지 않는 형태론적 중의성을 어휘문맥을 참조하는 어휘규칙을 사용함으로써 효과적으로 해결할 수 있었다. 그러나 어휘규칙을 수작업으로 획득하기 때문에 규칙 획득에 많은 시간이 소요되어 소량의 규칙만이 사용되었다. 본 논문에서는 품사부착말뭉치로부터 어휘규칙을 자동으로 획득하는 방법을 제안한다. 제안된 방법으로 자동획득된 어휘규칙을 사용하여 실험말뭉치의 66.1%를 98.8%의 정확률로 태깅하였다. 이로써 통계적 품사태거만을 사용할 때(95.43% 정확률) 보다 어휘규칙과 결합할 때(96.12% 정확률) 통계적 품사태거의 성능이 약 15.1%(0.69% 정확률)만큼 향상되었다. 또한 제안된 방법은 영어 품사태깅에 대해서도 효과적임이 실험을 통해 증명되었다.
PDF

Automatic Lifelog Tagging through Context Detection in the Smart Phone (스마트폰 환경에서 사용자의 컨텍스트 추출을 통한 라이프로그 자동 태깅 기법)

Kim, Byeong-Jun;Kim, Tak-Eun;Lee, Ki-Yong;Kim, Myoung-Ho
- Proceedings of the Korean Information Science Society Conference
- /
- 2010.06c
- /
- pp.84-89
- /
- 2010
최근 스마트폰의 성능이 향상되고 다양한 기능이 추가됨에 따라 기록되는 라이프로그 정보가 급격히 증가하고 있다. 이에 따라 라이프로그를 체계적으로 저장하고 검색하는 일이 중요해지고 있다. 사용자 컨텍스트는 라이프로그 검색의 정확도를 높이기 위한 중요한 요소 중 하나로 논의되어 왔다. 따라서 이를 자동으로 추출하고, 라이프로그의 태깅에 활용하려는 많은 연구가 시도되었다. 그러나 많은 기존 연구들은 컨텍스트를 추출하기 위해 사용자 주변에 센서가 설치되어 있는 환경을 가정하였는데, 이러한 환경은 비용 등의 문제로 일부 제한된 영역에서만 적용 가능하기 때문에, 광범위한 지역에서 사용자의 컨텍스트를 추출할 수 없다는 문제점이 있었다. 본 연구에서는 외부 센서들이 설치된 환경을 가정하지 않고, 스마트폰에 장착된 센서만을 활용하여 사용자의 컨텍스트를 찾아내고, 이를 라이프로그 자동 태깅에 적극 활용하는 방법에 대해 제안한다. 특히 본 연구에서는 기존의 포괄적인 컨텍스트의 정의를 일정 시간 간격동안 지속되는 사용자의 상황으로 한정지어 재정의하고, 이를 라이프로그 태깅에 활용하는 방법에 대해서 논의한다.
PDF

Search Result 108, Processing Time 0.032 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)