• 제목/요약/키워드: Korean linguistics

검색결과 603건 처리시간 0.023초

MUSE 감성주석코퍼스를 활용한 문장 극성과 키워드 극성간의 불일치 현상에 대한 분석 (Evaluation of the Discordance between Sentence Polarities and Keyword Polarities by Using MUSE Sentiment-Annotated Corpora)

  • 조동희;신동혁;주희진;채병열;자오 원카이;남지순
    • 한국어정보학회:학술대회논문집
    • /
    • 한국어정보학회 2016년도 제28회 한글및한국어정보처리학술대회
    • /
    • pp.195-200
    • /
    • 2016
  • 본 연구는 MUSE 감성 코퍼스를 활용하여 문장의 극성과 키워드의 극성이 얼마만큼 일치하고 일치하지 않은지를 분석함으로써 특히 문장의 극성과 키워드의 극성이 불일치하는 유형에 대한 연구의 필요성을 역설하고자 한다. 본 연구를 위하여 DICORA에서 구축한 MUSE 감성주석코퍼스 가운데 IT 리뷰글 도메인으로부터 긍정 1,257문장, 부정 1,935문장을, 맛집 리뷰글 도메인으로부터는 긍정 2,418문장, 부정 432문장을 추출하였다. UNITEX를 이용하여 LGG를 구축한 후 이를 위의 코퍼스에 적용하여 나타난 양상을 살펴본 결과, 긍 부정 문장에서 반대 극성의 키워드가 실현된 경우는 두 도메인에서 약 4~16%의 비율로 나타났으며, 단일 키워드가 아닌 구나 문장 차원으로 극성이 표현된 경우는 두 도메인에서 약 25~40%의 비교적 높은 비율로 나타났음을 확인하였다. 이를 통해 키워드의 극성에 의존하기 보다는 문장과 키워드의 극성이 일치하지 않는 경우들, 가령 문장 전체의 극성을 전환시키는 극성전환장치(PSD)가 실현된 유형이나 문장 내 극성 어휘가 존재하지 않지만 구 또는 문장 차원의 극성이 표현되는 유형들에 대한 유의미한 연구가 수행되어야 비로소 신뢰할만한 오피니언 자동 분류 시스템의 구현이 가능하다는 것을 알 수 있다.

  • PDF

21세기 세종계획 관용표현 전자사전 구축에 대하여 (On the development of a computational lexical database of idiomatic expressions in the frmework of 21st Sejong Project)

  • 박만규;이선웅;나윤희;이광호
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2001년도 제13회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.334-340
    • /
    • 2001
  • 본고는 올해 처음 시도하는 세종계획 관용표현 전자사전 구축에 관한 글이다. 본 전자사전이 완성되면 관용표현의 총체적 정보(형태, 통사, 의미, 화용 정보)를 수록하는 최초의 업적이 될 뿐만 아니라 실제 언어 자료에서 흔히 볼 수 있는 관습적 표현까지 모두 포괄하는 4만 표제어의 대규모 사전이 될 것이다. 본 사전에서는 관용표현의 형태 통사적 구성과 그 분포적 속성뿐 아니라, 관용표현이 가지는 논항의 존재 유무, 구조, 조사 통합 양상, 그리고 고정명사에 대한 수식어 제약, 어휘적 통사적 변형 양상, 선어말어미 제약, 어말어미 제약, 문장 유형 제약 등이 수록된다. 또한 각 논항의 의미역과 선택제약에 관한 정보, 그 외 다양한 의미 화용 정보 어원 표기 정보 등도 담기게 된다. 본고에서는 그러한 정보의 표기 양식을 하나하나 명시적으로 설명할 것이다.

  • PDF

Penn Korean Treebank: Development and Evaluation

  • Han, Chung-hye;Han, Na-Rae;Ko, Eon-Suk;Martha Palmer;Heejong Yi
    • 한국언어정보학회:학술대회논문집
    • /
    • 한국언어정보학회 2002년도 Language, Information, and Computation Proceedings of The 16th Pacific Asia Conference
    • /
    • pp.69-78
    • /
    • 2002
  • This paper discusses issues in building a 54-thousand-word Korean Treebank using a phrase structure annotation, along with developing annotation guidelines based on the morpho-syntactic phenomena represented in the corpus. Various methods that were employed for quality control and the evaluation on the Treebank are also presented.

  • PDF

현대 한국어 파찰음의 조음점 전진 현상에 대한 연구 (The Study of Advanced Articulation of the Korean Affricates)

  • 국경아;강은지;김주원
    • 대한음성학회:학술대회논문집
    • /
    • 대한음성학회 2007년도 한국음성과학회 공동학술대회 발표논문집
    • /
    • pp.247-250
    • /
    • 2007
  • The affricates of the Korean were alveolar sounds in the 15th century. Alveolar sounds have changed to post-alveolar or alveo-palatal sounds since the 18th century, at least in Southern Korean. These days, the advanced articulation of the affricates are observed, especially in the speech of young generations. The aim of this paper is to show the differences of the affricates when they are pronounced in alveo-palatal and in a more advanced position than in alveo-palatal by their cut-off frequencies. We have recorded speeches of freshmen(in their early twenties) at Seoul National University. The result was that the cut-off frequency of the advanced articulation in auditory observations was higher than that of the others. We have found in particular, that women have tendency to advance their place of articulation of the affricates.

  • PDF

Development and Evaluation of a Korean Treebank and its Application to NLP

  • Han, Chung-Hye;Han, Na-Rae;Ko, Eon-Suk;Martha Palmer
    • 한국언어정보학회지:언어와정보
    • /
    • 제6권1호
    • /
    • pp.123-138
    • /
    • 2002
  • This paper discusses issues in building a 54-thousand-word Korean Treebank using a phrase structure annotation, along with developing annotation guidelines based on the morpho-syntactic phenomena represented in the corpus. Various methods that were employed for quality control are presented. The evaluation on the quality of the Treebank and some of the NLP applications under development using the Treebank are also pre-sented.

  • PDF

워드 임베딩을 활용한 관용표현 인식 연구 (Korean Idiom Classification Using Word Embedding)

  • 박서윤;강예지;강혜린;장연지;김한샘
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2020년도 제32회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.548-553
    • /
    • 2020
  • 우리가 쓰는 일상 언어 중에는 언어적 직관이 없는 사람은 의미 파악이 힘든 관용표현이 존재한다. 관용표현을 이해하기 위해서는 표현에 대한 형태적, 의미적 이해가 수반되어야 하기 때문이다. 기계도 마찬가지로 언어적 직관이 없기 때문에 관용표현에 대한 자연어 처리에는 어려움이 따른다. 특히 일반표현과 중의성 관계에 있는 관용표현의 특성이 고려되지 않은 채 문자적으로만 분석될 위험성이 높다. 본 연구에서는 '관용표현은 주변 문맥과의 관련성이 떨어진다'라는 가정을 중심으로 워드 임베딩을 활용한 관용표현과 일반표현에 대한 구분을 시도하였다. 실험은 4개 표현에 대해 이루어 졌으며 Skip-gram, Fasttext를 활용한 방법을 통해 관용표현은 주변 단어들과의 유사성이 떨어짐을 확인하였다.

  • PDF

Application of Statistical Methods in Quantitative Linguistics Study

  • Choi, Kyung-Ho;Hwang, Yong-Joo
    • Journal of the Korean Data and Information Science Society
    • /
    • 제18권2호
    • /
    • pp.269-278
    • /
    • 2007
  • Nowadays, from the study of quantitative linguistics, the application of quantitative method is located in a variety of fields as a necessary method. According to this phenomenon, the knowledge of statistical method is requisite for linguists. However, unfortunately, there still remain difficulties for them to acquire the statistical knowledge. So, it is needed for linguists to be helped by statisticians and their active roles. Accordingly, this study is going to emphasizing that statisticians should have more interests in the field of quantitative linguistics. Moreover, it will prove that by using statistical methods, analysis on the linguistic research becomes more objective and scientific.

  • PDF

형태소 깎는 노인: 국어사 자료를 위한 형태분석 보조기 (The POS Elderly: Semi-automatic annotation tool for Historical Korean)

  • 김미경;박수지;이상아
    • 한국어정보학회:학술대회논문집
    • /
    • 한국어정보학회 2016년도 제28회 한글및한국어정보처리학술대회
    • /
    • pp.39-43
    • /
    • 2016
  • '형태소 깎는 노인'은 국어사 자료를 처리하는 고성능 자동 형태분석기의 개발이 난항을 겪고 있는 상황에서 수동으로 형태분석 작업을 하는 연구자들을 지원하기 위하여 개발된 형태분석 보조기이다. 인간과 기계의 분업을 통해 인간의 피로를 최대한 줄이고, 단순 반복 형태에 대해서는 정답을 확실하게 제안할 수 있다는 것이 특징이다. 국어사 자료에는 한국어 정보처리를 위해 필요한 어휘 사전이 없으므로, 문법형태소 사전을 만들어 이를 단서로 조사/어미부와 어간부를 구분하도록 하였다. 이를 통해 구축된 소규모 형태분석 말뭉치들이 장기적으로는 자동 형태분석기의 성능 개선에 일조할 수 있을 것으로 기대한다.

  • PDF

형식인가 기능인가\ulcorner (Form or Function\ulcorner)

  • 이종민
    • 한국영어학회지:영어학
    • /
    • 제2권4호
    • /
    • pp.575-587
    • /
    • 2002
  • In this paper we discuss the contrastive nature of formalism and functionalism in linguistics. Though the mainstreams of linguistic analysis have been focused on the form and function, they have been challenged from each other's strong points. On the one hand, the formal description has been studied in the tradition of generative grammar. On the other hand, the functional nature has played a crucial role in the framework of language use. It seems undesirable to argue that there is one-sided bias toward any type of linguistic approach. I try to present a balanced view of these two contrastive approaches. We also argue that there should be a cooperative work in developing the mutual growth of linguistic theory.

  • PDF

The Polysemy of Da3: An ontology-based lexical semantic study

  • Hong, Jia-Fei;Huang, Chu-Ren;Ahrens, Kathleen
    • 한국언어정보학회:학술대회논문집
    • /
    • 한국언어정보학회 2007년도 정기학술대회
    • /
    • pp.155-162
    • /
    • 2007
  • In this study, we explore the polysemy of da3 through the ontological conceptual structure found in SUMO. First, we divide several different senses for da3, clustering physical event senses and metaphorical event senses. In here, we only focus on physical event senses of da3. From the physical event senses of da3, we divide them into two main categories: 1) hit and 2) pump. We then use SUMO ontological concepts to identify these physical senses. Finally, we can observe the common patterns of the "hit" sense group and the "pump" sense group for da3.

  • PDF