통합 검색 | Korea Science

자동 음차표기를 이용한 영-한 음차표기 대역쌍의 자동 추출 (An Algorithm for extracting English-Korean Transliteration pairs using Automatic I-K Transliteration)

오종훈;배선미;최기선
- 한국정보과학회:학술대회논문집
- /
- 한국정보과학회 2004년도 봄 학술발표논문집 Vol.31 No.1 (B)
- /
- pp.928-930
- /
- 2004
지금까지 기계번역과 교차언어 정보검색 등과 같은 자연언어응용에서 사용되는 번역지식을 자동으로 구축하는 연구가 활발히 진행되어 왔다. 번역지식을 자동으로 구축하는 연구는 대역사전에 등재되어 있지 않은 미등록어에 대한 대역정보를 문서에서 자동으로 획득하는 것을 목표로 한다. 최근에는 이러한 미등록어 중 음차표기 번역지식에 대한 연구가 활발히 진행되고 있다. 음차표기는 주로 영어 단어를 발음에 기반하여 비영어권의 언어로 표기하는 것을 의미한다. 음차표기된 단어들은 새로운 개념을 나타내는 신조어가 많기 때문에 사전에 등재되어 있지 않온 경우가 많다. 따라서 효과적인 번역지식 구축을 위해서는 이러한 음차표기 번역지식을 자동으로 획득하는 것은 매우 중요하다. 본 논문에서는 영-한 음차표기 대역쌍을 문서에서 자동으로 추출하는 알고리즘을 제안한다. 본 논문의 기법은 한국어 음차표기의 인식, 영-한 자동음차표기, 한국어 음차표기와 자동음차표기된 영어단어간의 음성적 유사도 비교를 통하여 음차표기 대역쌍을 추출한다. 본 논문의 기법은 약 93%의 정확률과 68%의 재현율을 나타내었다.
PDF

한영 기계번역을 위한 고정표현 지식베이스 구축 (Establishment of Fixed Expression KnowledgeBase for Korean-to-English Machine Translation)

이현호;안동언;정성종;김재훈;서영애;김영길
- 한국정보과학회:학술대회논문집
- /
- 한국정보과학회 2000년도 봄 학술발표논문집 Vol.27 No.1 (B)
- /
- pp.369-371
- /
- 2000
예제 기반 기계번역 시스템에서 해석의 정확도를 높이기 위해서는 대량의 고품질 대역 코퍼스가 필요하다. 이 대역 코퍼스는 예문을 단순히 나열해 놓은 것이 아니라 일정한 표현 형식에 따라서 기술한 대역 패턴들이다. 본 논문에서는 용언과 필수항인 명사구들로 이루어지는 고정표현을 정의하고 한국어와 영어의 대역 패턴을 기술하여 지식베이스를 구축한다. 빈도수가 높은 용언 5,000개를 중심으로 한영사전에 있는 용례 58,000여 개의 고정표현 지식을 구축하였다. 본 논문에서는 고정표현 지식베이스를 구축하는 과정을 기술하고, 고정표현 지식을 기술하면서 발생하였던 여러 가지 문제점을 예와 같이 기술한다.
PDF

한영 기계번역을 위하 고정표현 지식의 기술 방법 (The Representation Method of Fixed Expression Knowledge for Korean-to-English Machine Translation)

서진원;안동언;정성종;김재훈;서영애;김영길
- 한국정보과학회:학술대회논문집
- /
- 한국정보과학회 2000년도 봄 학술발표논문집 Vol.27 No.1 (B)
- /
- pp.366-368
- /
- 2000
규칙기반 기계번역 시스템의 문제점을 보완하고자 제시된 예제기반 기계번역 시스템은 대량의 고품질 대역 코퍼스가 필요하다. 그리고, 빠른 N-best 예제 검색, 유사 예제 계산, 번역결과의 평가 등이 중요한 문제들이다. 또한, 무엇보다도 기본적인 것은 대역 예문들을 표현하고 기술하는 방법이다. 본 논문에서는 자연어 대역 예문들을 수집하여 기계번역 시스템에서 사용하는 고정 표현 지식을 기술하는 방법에 대해서 논의한다. 대역 패턴의 기술 방법을 CFG 형태로 정의하고 실제 용례를 통하여 기술 방법을 설명한다.
PDF

기록평가의 지식구조와 용어 분석 : 『Encyclopedia of Archival Science』 표제어를 중심으로 (Knowledge Structure and Terminology of Archival Appraisal: Focusing on the Entries of "Encyclopedia of Archival Science")

설문원
- 한국기록관리학회지
- /
- 제23권1호
- /
- pp.81-99
- /
- 2023
'평가(appraisal)'는 기록관리의 핵심 영역이다. 이 연구는 기록학 분야의 대표적인 백과사전인 『Encyclopedia of Archival Science』을 중심으로 기록평가의 지식구조를 파악하고, 관련 대역어들의 적절성을 분석하기 위한 것이다. 이를 위하여 먼저 이 사전에 146개 표제어 중 평가 관련 표제어 34개를 추출하고, 내용분석에 기초하여 용어를 범주화하였다. 둘째, 각 범주별 표제어들을 중심으로 주요 개념과 논의의 흐름을 살펴보았다. 셋째. 각 표제어들에 대한 대역어를 제시하였으며 대역어 선정 시 고려할 점을 제안하였다. 특히 '기록평가'(records appraisal)와 '보존기록평가(archival appraisal)'를 구분하여 사용하고, 등가의 원칙에 따라 대역어를 선정할 것을 제안하였다.
https://doi.org/10.14404/JKSARM.2023.23.1.081 인용 PDF

병렬 말뭉치를 이용한 도메인 특화 사전 자동 추출 연구 (A Study of Automatic Extraction of Domain Specified Dictionary)

박은진;황금하;김영길
- 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
- /
- 한국정보과학회언어공학연구회 2009년도 제21회 한글 및 한국어 정보처리 학술대회
- /
- pp.237-241
- /
- 2009
본 논문에서는 도메인별 병렬 말뭉치를 이용하여 해당 도메인에 특화된 한영 대역쌍을 Moses Toolkit을 이용하여 자동 추출하였다. 이렇게 추출된 대역쌍은 도메인 특화 자동 번역 시스템의 번역 사전으로 사용하기에는 많은 오류가 포함되어 있기 때문에, 본 논문에서는 이를 효율적으로 제거할 수 있는 식을 제안하였다. 본 논문에서 제안한 식으로 오류를 제거한 결과, 임계값 0.5를 기준으로 추출된 한영 대역쌍이 1,098개였고, 이는 실험에 사용한 기업 분야 병렬 말뭉치 42,200문장 중에서 29,292문장(69.4%)에 영향을 주었다. 자동으로 추출한 도메인 특화 번역 지식을 기존 자동 번역 시스템의 번역 지식에 적용한 결과 BLEU가 0.0054 향상되었다.
PDF

어휘의미분석 기반 다국어 어휘대역 서비스 (Multilingual Word Translation Service based on Word Semantic Analysis)

류법모
- 디지털콘텐츠학회 논문지
- /
- 제19권1호
- /
- pp.75-83
- /
- 2018
다문화 가정 구성원은 언어 차이 때문에 자녀 교육에서 어려움을 겪고 있다. 이와 같은 어려움을 해결하기 위해서는 실생활에 필요한 한국어 용어들을 간편하고 신속하게 접근할 수 있는 스마트 번역 서비스를 이들에게 제공할 필요가 있다. 그러나 현재의 자동 번역 기술은 영어, 중국어, 일본어 등의 주요 국가 언어 중심으로 개발 되고 있으며, 자녀의 교육, 공공기관과의 소통 등 특수 목적의 용어들은 번역하기에는 한계가 있다. 본 연구에서는 초급 수준의 한국어를 이해하고 있는 다문화가정 구성원을 위한 실시간 자동 어휘대역어 서비스를 제안한다. 어휘대역어 서비스는 한국어 문장에 표현된 각 단어들의 의미를 자동으로 분석하여 다국어 대역어를 제공한다. 이를 위하여 한국어 의미분석 연구, 다국어 번역지식 구축 연구, 언어교육 연구의 융합연구를 수행하였다. 어휘대역서비스를 베트남, 일본 출신의 결혼이주여성을 대상으로 평가하여 의미있는 평가결과를 얻었다.
https://doi.org/10.9728/dcs.2018.19.1.75 인용 PDF KSCI

통계적 기계 번역 기술의 연구 동향

김선호;윤준태;임해창
- 정보처리학회지
- /
- 제11권2호
- /
- pp.76-87
- /
- 2004
기계번역은 자연어 처리 및 인공지능 분야에서 가장 어려 운 태스크 중의 하나로 인식되어 왔다. 이는 정확한 번역이란 텍스트에 대한 이해 없이는 불가능하기 때문이다. 그러한 이유로 연구자들은 한때 기계번역에 대한 부정적인 결론에 도달하기도 하였다. 지금까지 기계번역을 위해 다양한 방법이 연구되어 왔으며 이들 연구에서는 주로 두 언어에 대한어휘나 구의 대역사전, 숙어사전, 개별 언어의 문법, 혹은 변환규칙 및 변환사전, 문장생성에 관련된 지식, 의미나 실세계 지식, 도메인에 적합한 지식 등 번역의 방식과 목적에 따라 다양한 형태의 지식과 알고리즘이 적용되었으며 그 대부분은 방대한 양의 수작업에 의존적이었다.(중략)
PDF

다양한 지식을 사용한 영한 기계번역에서의 대역어 선택 (Target Word Selection for English-Korean Machine Translation System using Multiple Knowledge)

이기영;김한우
- 한국컴퓨터정보학회논문지
- /
- 제11권5호
- /
- pp.75-86
- /
- 2006
일반적으로 영어를 한국어로 번역할 때, 대부분의 영어 명사 어휘들은 해당 어휘가 사용되는 문맥에 따라 다양한 한국어 명사로 번역될 수 있다. 따라서 영어 원문이 갖는 의미를 손실 없이 번역문으로 전달하기 위해서는 문맥에 맞는 올바른 한국어 대역어를 선택할 수 있어야 한다. 본 논문에서는 동사구패턴, 공기 정보에 기반한 의미벡터, 공기 품사 정보 및 한국어 문맥 통계 정보 등의 다양한 지식을 사용하여 영어 명사 어휘의 대역어를 올바로 선택하는 방안을 제공한다. 동사구 패턴은 사전과 코퍼스를 사용하여 구축되었으며, 의미 벡터는 영어 어휘가 특정 한국어 어휘로 번역될 때 공기하는 정보들의 조건부 확률을 나타낸다. 한국어 문맥 통계 정보는 한국어 코퍼스로부터 추출된 N-그램 정보를 나타내며, 품사 공기 정보는 대역어 선택 모호성을 지니는 영어 어휘와 통계적으로 깊은 관련성을 지니는 품사를 나타낸다. 마지막으로 본 논문에서 제안한 대역어 선택 모호성 해소 방안을 평가하기 위한 실험을 수행하였으며, 실험 결과, 제안하는 방법이 기존의 방법보다 성능이 좋다는 것을 확인할 수 있었다.
PDF

한국어 어휘 지식 베이스 구축 시스템 (Korean Lexical Knowledge Base Construction System)

이해중;조정미;문준혁;서정연
- 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
- /
- 한국정보과학회언어공학연구회 1999년도 제11회 한글 및 한국어 정보처리 학술대회
- /
- pp.397-403
- /
- 1999
어휘 지식은 자연어 처리에서 매우 중요한 요소이다. 그러나 대규모의 어휘 지식 베이스를 구축하는 것은 많은 시간과 비용을 필요로하는 일이다. 본 논문에서는 온라인 국어 사전을 이용하여 범용의 대규모 한국어 어휘 지식 베이스를 자동으로 구축하는 방법을 제안하고 실제로 시스템을 구현한다. 제안하는 방법론은 비교적 적은 비용으로 단시일내에 대규모의 어휘 지식 베이스를 구축하는 것을 가능하게 한다. 또한 지식 구축 과정이 자동화되어 만들어진 지식 베이스의 유지, 보수 및 확장이 용이하다. 구현된 시스템으로 구축한 어휘 지식 베이스는 기계번역에서의 대역어 선정이나 한국어 조사의 의미 분별 등 자연어 처리 과정에서 발생하는 각종 어휘 의미 모호성 해소에 응용될 수 있다.
PDF

용언구에 기반한 한영 기계번역 시스템 : 'CaptionEye/KE' (Korean-to-English Machine Translation System based on Verb-Phrase : 'CaptionEye/KE')

서영애;김영길;서광준;최승권
- 한국정보처리학회:학술대회논문집
- /
- 한국정보처리학회 2000년도 추계학술발표논문집 (상)
- /
- pp.269-272
- /
- 2000
본 논문에서는 ETRI에서 개발 중인 용언구에 기반한 한영 기계번역 시스템 CaptionEye/KE에 대하여 논술한다. CaptionEye/KE는 대량의 고품질 한-영 양방향 코퍼스로부터 추출된 격틀사전 및 대역패턴, 대역문 연결패턴 등의 언어 지식들을 바탕으로 하여, 한국어의 용언구 단위의 번역을 조합하여 전체 번역을 수행한다. CaptionEye/KE는 변환방식의 기계번역 시스템으로서, 크게 한국어 형태소 분석기, 한국어 구문 분석기, 부분 대역문 연결기, 부분 대역문 생성기, 대역문 선택/정련기, 영어형태소 생성기로 구성된다. 입력된 한국어 문장에 대해 형태소 분석 및 태깅을 수행한 후, 격틀사전을 이용하여 구문구조를 분석하고 의존 트리를 생성해 낸다. 이렇게 생성된 의존 트리로부터 대역문 연결패턴을 이용하여 용언구들간의 연결에 대한 번역을 수행한 후 대역패턴을 이용하여 각 용언구들을 번역하고 문장 정련과정을 거쳐 영어 문장을 최종 생성한다.
PDF

검색결과 38건 처리시간 0.026초

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

자세히 찾기

이미지 검색 (β)