• 제목/요약/키워드: 코퍼스 분석

검색결과 206건 처리시간 0.024초

운율경계강도 예측을 위한 품사셋 비교 연구 (Comparison of Three POS Sets in Prosody Break Index Estimation)

  • 엄기완
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1998년도 학술발표대회 논문집 제17권 2호
    • /
    • pp.81-84
    • /
    • 1998
  • 본 논문에서는 문장의 문법 구조로부터 운율 경계 강도를 효율적으로 예측하기 위해서, 문법 정보의 세밀함에 따라 품사셋을 3단계로 설정하였다. 그리고 운율 경계 강도를 예측하는데 있어서 어떠한 품사셋이 최적인가를 알아보기 위해 150문장의 코퍼스를 구축하였으며, 세 종류의 품사셋에 대해 코퍼스를 수작업으로 품사분석을 하였다. 청취실험으로 결정한 운율 경계 강도를 바탕으로 확률론적인 모델링 방법을 사용하여 예측하는 실험을 하였다. 이러한 예측결과를 평가 비교하여 최적의 품사셋을 정하였다.

  • PDF

음운지속시간의 정규화와 모델링 (A Normalization and Modeling of Segmental Duration)

  • 김인영
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1998년도 제15회 음성통신 및 신호처리 워크샵(KSCSP 98 15권1호)
    • /
    • pp.99-104
    • /
    • 1998
  • 한국어의 자연스러운 음성합성을 위해 280문장에 대하여 남성화자 1명이 발성한 문음성 데이터를 음운 세그먼트, 음운 라벨링, 음운별 품사 태깅하여 음성 코퍼스를 구축하였다. 이 문 음성 코퍼스를 사용하여 음운환경, 품사 뿐만 아니라 구문 구조에 이하여 음운으 lwlthrtlrks이 어떻게 변화하는가에 대하여 xhdrPwjrdfmh 분석하였다. 음운 지속시간을 보다 정교하게 예측하기 위하여, 각 음운의 고유 지속시간의 영향이 배제된 정규화 음운지속시간을 회귀트리를 이용하여 모델화하였다. 평가결과, 기존의 회귀트리를 이용한 음운지속시간 모델에 의한 예측오차는 87%정도가 20ms 이내 이었지만, 정규화 음운 지속시간 모델에 의한 예측 오차는 89% 정도가 20ms 이내로 더욱 정교하게 예측되었다.

  • PDF

코퍼스를 이용한 한국어 지각동사의 논항구조 분석 (A Corpus based Analysis of the Argument Structure of Korean Perception Verbs)

  • 정유진;강범모
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1999년도 제11회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.316-323
    • /
    • 1999
  • 동사의 다의성은 결합되는 어휘에 따른 의미확장으로 설명된다. 본고에서는 한국어 지각동사의 기본의미가 갖는 논항관계를 바탕으로 코퍼스를 이용하여 다른 어휘와의 연여관계를 관찰함으로써 공기하는 어휘를 체계화시키고 기본의미와 의미확장의 실제 사용빈도를 조사하는데 그 의의가 있다.

  • PDF

확률적 CFG 파싱을 활용한 한국어 복합명사 구조 분석의 중의성 해소 (Disambiguation on the Analysis of Korean Complex Nominals, Using Probabilistic CFG Parsing)

  • 김동성
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2011년도 제23회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.61-66
    • /
    • 2011
  • 본 논문은 한국어 복합명사 구조의 분석을 목적으로 한다. 연구는 이론 언어학뿐만이 아니라 정보처리, 정보검색과 같은 언어의 전산적 처리에서도 중요한다. 복합명사 구조는 크게 외심구조와 내심구조로 나뉘며 내심구조의 경우에 좌분지나 우분지 구조로 분석이 되어야 하는 중의성이 있다. 기존의 Lauer 모델은 사전적 정보에서 발견되는 확률 정보를 구조 정보에 연결하기 위한 모델로 의존모델과 인접모델을 제시하였다. 본 연구에서는 구조에 기반을 둔 확률정보를 결합하기 위한 확률적 CFG 파싱 방법을 활용하고자 하였다. 이를 위해서 실제 코퍼스상에서 발견되는 복합명사 패턴을 대상으로 구조적 분석을 화자 직관을 통해서 진행하고, 이를 다시 Lauer 모델과 확률적 CFG 파싱 방법 응용과 비교해 보았다. 결과적으로 화자 직관에 가장 일치한 예측을 하였으며, 구조에 대한 정보 해석이 가능하였다.

  • PDF

BERT기반 LSTM-CRF 모델을 이용한 한국어 형태소 분석 및 품사 태깅 (Korean Morphological Analysis and Part-Of-Speech Tagging with LSTM-CRF based on BERT)

  • 박천음;이창기;김현기
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2019년도 제31회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.34-36
    • /
    • 2019
  • 기존 딥 러닝을 이용한 형태소 분석 및 품사 태깅(Part-Of-Speech tagging)은 feed-forward neural network에 CRF를 결합하는 방법이나 sequence-to-sequence 모델을 이용한 방법 등의 다양한 모델들이 연구되었다. 본 논문에서는 한국어 형태소 분석 및 품사 태깅을 수행하기 위하여 최근 자연어처리 태스크에서 많은 성능 향상을 보이고 있는 BERT를 기반으로 한 음절 단위 LSTM-CRF 모델을 제안한다. BERT는 양방향성을 가진 트랜스포머(transformer) 인코더를 기반으로 언어 모델을 사전 학습한 것이며, 본 논문에서는 한국어 대용량 코퍼스를 어절 단위로 사전 학습한 KorBERT를 사용한다. 실험 결과, 본 논문에서 제안한 모델이 기존 한국어 형태소 분석 및 품사 태깅 연구들 보다 좋은 (세종 코퍼스) F1 98.74%의 성능을 보였다.

  • PDF

남북한 영어교과서 어휘의 차이 (Vocabulary Difference of South and North Korean English Textbook)

  • 김정렬
    • 한국콘텐츠학회논문지
    • /
    • 제20권1호
    • /
    • pp.107-116
    • /
    • 2020
  • 본 연구는 남북한 영어교과서에 나타난 어휘를 비교하여 영어어휘의 양적 질적인 차이를 알아보고 궁극적으로 남북한 통일 영어교과서에 담을 영어어휘 목록을 만드는데 필요한 기초적인 작업을 진행하는데 있다. 이를 위해 2000년대에 출간된 남북한 영어교과서로 코퍼스를 구축하여 어휘목록을 추출하고 이들 남북한 영어교과서 코퍼스를 비교하였다. 어휘목록의 추출은 남한 영어교과서의 경우는 7차교육과정 이후 출간된 교과서에서 추출하고 북한 영어교과서의 경우는 김정일정권시대인 2000년대 이후 영어교과서로 코퍼스를 구축하고 그 코퍼스에서 어휘목록을 만들어서 비교하였다. 이를 위해서 AntConc 3.5.7을 사용하여 어휘목록을 추출하고 콘코던스를 통해서 어휘목록에 나온 어휘의 사용맥락을 살펴보면서 점검하였다. 이를 통해서 남북한 영어 어휘의 양적 질적 비교를 통해서 그 차이점들을 도출하였다. 양적으로 남북한이 영어교과서를 통해서 학습해야 할 어휘는 양적으로 비슷하게 3000 단어 내외였으나 북한 영어교과서의 경우 전문학술 어휘가 좀 더 많이 나타났다. 자본주의 시장경제를 따르는 남한과 사회주의 계획경제를 따르는 북한 영어교과서에는 이와 관련된 어휘의 사용과 의미적 차이가 발견되었다. 아울러, 종교와 문법 용어의 사용에 있어서 차이가 나타났다.

변환 규칙 학습기를 이용한 한국어 의존 구조 분석기 (Dependency Structure Analysis System for Korean Using Automatically Acquired Transformation Rules)

  • 이성욱;서정연
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1997년도 제9회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.360-363
    • /
    • 1997
  • 코퍼스 속의 언어적 규칙을 직접적으로 사용하여 한국어 의존 구조를 분석하기 위해, 본 한국어 의존 구조 분석기는 의존 구조가 나타나 있는 코퍼스로부터 변환 규칙 학습기로 규칙을 자동적으로 학습하고 그 규칙을 적용함으로써 한국어 의존 구조를 분석한다. 이를 위해 기존의 연구된 구구조 문법의 규칙 틀과는 다른 한국어 의존 구조에 맞는 규칙 틀을 연구하였고 또 의존 구조에서 발생할 수 있는 교차구조(Crossing structure)를 방지하는 연산을 고안하였다.

  • PDF

남북한 고등학교 영어교과서 4-gram 연어 비교 분석 (Comparative Analysis of 4-gram Word Clusters in South vs. North Korean High School English Textbooks)

  • 김정렬
    • 한국콘텐츠학회논문지
    • /
    • 제20권7호
    • /
    • pp.274-281
    • /
    • 2020
  • 본 연구는 4-gram 연어분석으로 남북한 고등학교 영어교과서를 비교분석하고자 하는 것이 목적이다. N-gram 분석은 그동안 우리가 알고 있는 관습적인 관용어와는 달리 코퍼스를 구성하여 기계적인 방법으로 물리적으로 함께 공기하는 빈도가 높은 낱말군을 객관적인 방법으로 추출하여 분석하는 것이다. 본 연구의 목적은 AntConc의 N-gram 분석 도구로 4-gram 연어를 남북한 영어교과서 코퍼스에서 찾아서 비교 분석해 보는 것이다. 분석의 대상은 북한의 2013 교육개혁에 따른 북한 고등중학교 영어교과서와 남한의 2015교육과정에 따른 고등학교 영어교과서로 구성된 코퍼스에서 구어와 문어의 token과 type을 구분하여 분석 비교한다. 이를 분석대상으로 하여 코퍼스의 4-gram 연어를 문법범주와 기능범주로 나눈 준거를 통해서 분석하였다. 문법범주는 크게 명사구, 동사구, 전치사구, 부분절 그리고 기타로 나누어 범주화하고 기능범주는 지칭, 텍스트의 조직, 입장과 기타로 나누었다. 분석한 결과 4-gram 연어에 나타난 구어와 문어 모두 남한의 영어교과서가 북한의 영어교과서 보다 token과 type의 수가 상대적으로 많았다. 그리고 문법범주에는 남북한 모두 영어교과서에 동사구와 부분절 형태의 4-gram 연어가 가장 많았으며 기능범주에는 남북한 모두 영어교과서에 입장 기능과 관련된 4-gram 연어가 가장 많았다.

담화표지 '아', '어', '음'의 성별과 연령별 사용 양상 (The pattern of use by gender and age of the discourse markers 'a', 'eo', and 'eum')

  • 송영숙;심지수;오재혁
    • 말소리와 음성과학
    • /
    • 제12권4호
    • /
    • pp.37-45
    • /
    • 2020
  • 이 연구는 담화 표지 '아, 어, 음'의 출현 빈도와 발화 시간, 발화 위치 등을 계량적으로 관찰하여 성별과 연령별 차이를 보이고자 하였다. 이를 위해 대용량 음성 코퍼스인 서울코퍼스를 이용하였고, Praat(ver.6.1.31)으로 음길이와 실제 발화를 확인하고, Emeditor(ver.17.6.1)로 코퍼스를 분석하고, R(ver.3.4.4)로 통계 분석하여 결과를 제시하였다. 성별에 따라 보면 여성의 경우 남성보다 단독 발화에서 '음'이 고빈도로 사용되었고, 발화 종결 위치에서의 평균 음길이 또한 길었다. 연령에 따라 보면 발화 시작 위치에서 10대에서는 '아'가, 40대는 '어'가 고빈도로 출현하는 것이 특징적이었다.

키워드 네트워크를 이용한 항공관련 글로벌 연구동향 분석: 스코퍼스(Scopus)게재 논문을 중심으로 (Study on Research Trends in Airline Industry using Keyword Network Analysis: Focused on the Journal Articles in Scopus)

  • 이주양;장필식
    • 한국융합학회논문지
    • /
    • 제8권5호
    • /
    • pp.169-178
    • /
    • 2017
  • 다양한 연구 분야에서, 광범위한 텍스트 분석을 이용한 연구 동향파악과 관련 패턴의 도출은 중요한 의미를 가진다. 본 연구에서는 키워드 네트워크 분석을 통해, 1997년부터 2016년까지의 항공관련 글로벌 연구 동향을 조사하였다. 이를 위해 스코퍼스 등재 학술지 논문 25,959편을 대상으로 키워드 네트워크 모델을 설정하고 중심성(연결, 매개) 분석을 수행하였다. 연구 결과는 항공관련 연구동향이 키워드 네트워크 분석을 통해 계량적으로 설명될 수 있음을 보여준다. 최근 20년간 항공관련 연구가 가장 활발히 이루어진 분야는 공학 분야와 사회과학 분야인 것으로 확인되었으며, 연결중심성이 높은 키워드들이 매개중심성 또한 높은 것으로 나타났다. 본 연구의 결과는 항공과 관련된 정책 수립 및 새로운 연구개발 주제를 탐색하는 자료로 활용될 수 있을 것으로 기대된다.