• 제목/요약/키워드: 신조어 분리

검색결과 10건 처리시간 0.019초

정치 도메인에서 신조어휘의 효과적인 추출 및 의미 분석에 대한 연구 (Study on Effective Extraction of New Coined Vocabulary from Political Domain Article and News Comment)

  • 이지현;김재홍;조예성;이민구;최혜봉
    • 문화기술의 융합
    • /
    • 제7권2호
    • /
    • pp.149-156
    • /
    • 2021
  • 정치적 사안에 대한 대중의 의견과 인식을 객관적으로 이해하기 위한 방법으로 텍스트 마이닝을 통한 빅데이터 분석을 수행할 수 있다. 기존 어휘 사전에 기반한 텍스트 마이닝 알고리즘은 신조어와 같이 사전에 수록되지 않은 어휘를 분석하는데 한계가 나타난다. SNS를 통해 나타나는 사용자들의 의견은 많은 경우 신조어와 비속어를 포함하는데, 이러한 어휘들을 효과적으로 분석하지 못한다면 정확한 대중의 인식과 의견을 파악하기 어렵게 된다. 본 논문은 정치 섹션의 뉴스 댓글로부터 정치적 의미성을 지니는 신조어와 비속어를 효과적으로 추출하는 방법을 제안하고, 추출한 신조어휘들의 의미와 맥락을 이해하기 위한 다양한 방법을 제시하였음.

대화형 에이전트 인식오류 및 신조어 탐지를 위한 알고리즘 개발: 한글 음절 분리 기반의 단어 유사도 활용 (Developing a New Algorithm for Conversational Agent to Detect Recognition Error and Neologism Meaning: Utilizing Korean Syllable-based Word Similarity)

  • 이정원;임일
    • 지능정보연구
    • /
    • 제29권3호
    • /
    • pp.267-286
    • /
    • 2023
  • 인공지능 스피커로 대표되는 대화형 에이전트는 사람-컴퓨터 간 대화형이기 때문에 대화 상황에서 오류가 발생하는 경우가 잦다. 에이전트 사용자의 발화 기록에서 인식오류는 사용자의 발화를 제대로 인식하지 못하는 미인식오류 유형과 발화를 인식하여 서비스를 제공하였으나 사용자가 의도한 바와 다르게 인식된 오인식오류 유형으로 나뉜다. 이 중 오인식오류의 경우, 서비스가 제공된 것으로 기록되기 때문에 이에 대한 오류 탐지가 별도로 필요하다. 본 연구에서는 텍스트 마이닝 기법 중에서도 단어와 문서를 벡터로 바꿔주는 단어 임베딩과 문서 임베딩을 이용하여 단순 사용된 단어 기반의 유사도 산출이 아닌 단어의 분리 방식을 다양하게 적용함으로써 연속 발화 쌍의 유사도를 기반으로 새로운 오인식오류 및 신조어 탐지 방법을 탐구하였다. 연구 방법으로는 실제 사용자 발화 기록을 활용하여 오인식오류의 패턴을 모델 학습 및 생성 시 적용하여 탐지 모델을 구현하였다. 그 결과, 오인식오류의 가장 큰 원인인 등록되지 않은 신조어 사용을 탐지할 수 있는 패턴 방식으로 다양한 단어 분리 방식 중 초성 추출 방식이 가장 좋은 결과를 보임을 확인하였다. 본 연구는 크게 두 개의 함의를 가진다. 첫째, 인식오류로 기록되지 않아 탐지가 어려운 오인식오류에 대하여 다양한 방식 별 비교를 통해 최적의 방식을 찾았다. 둘째, 이를 실제 신조어 탐지 적용이 필요한 대화형 에이전트나 음성 인식 서비스에 적용한다면 음성 인식 단계에서부터 발생하는 오류의 패턴도 구체화할 수 있으며, 오류로 분류되지 않더라도 사용자가 원하는 결과에 맞는 서비스가 제공될 수 있음을 보였다.

한국어 차용 중국어 신조어의 언어융합 현상 고찰 (A Contemplation on Language Fusion Phenomenon of Chinese Neologism Derived from Korean)

  • 정은
    • 문화기술의 융합
    • /
    • 제8권6호
    • /
    • pp.261-268
    • /
    • 2022
  • 어떤 언어도 다른 언어와 분리되어 독립적으로 존재할 수 없다. 언어는 외래문화와 접촉하게 되면 서로 끊임없는 영향을 미치고 변화를 불러일으킨다. 90년대 이후 세계 과학기술 및 정보화의 급속적인 발전으로 한국의 드라마, K-POP으로 파생된 한류 붐은 중국 언어에도 영향을 미쳐 중국 온오프라인에서 한국어 차용 신조어가 교류 상용어이자 사회 유행어가 되고 있다. 한국어 차용 신조어는 중국어와 한국어의 언어접촉의 영향과 결과를 반영한 것으로 우리는 한국어 차용 중국어 신조어의 발생 배경과 원인을 사회문화요인과 심리적 필요성을 근거로 살펴보고, 신조어를 음역, 의역, 한국한자어 차용, 기타 4가지 유형으로 나누어 설명하였다. 신조어는 조어 과정에서 발생하는 비규범적인 문제에도 불구하고 중국어 표현을 더욱 풍부하게 하며, 언어적인 면에서도 새로움과 변화, 혁신적이고 창조적인 것을 추구하는 중국 세대의 견해와 이해를 반영하는 사회문화의 거울이 된다. 우리는 한·중 양국 젊은이들이 상대언어와 문화를 이해하고 소통하여 서로 우호적인 감정을 가질 수 있는 인식 변화의 계기가 될 수 있기를 기대하며, 향후 중국어 교육 현장에서도 한·중 언어융합의 응용을 통한 교수 및 학습에 도움이 되길 기대한다.

확률 기반 미등록 단어 분리 및 태깅 (Probabilistic Segmentation and Tagging of Unknown Words)

  • 김보겸;이재성
    • 정보과학회 논문지
    • /
    • 제43권4호
    • /
    • pp.430-436
    • /
    • 2016
  • 형태소 분석시 나타나는 고유명사나 신조어 등의 미등록어에 대한 처리는 다양한 도메인의 문서 처리에 필수적이다. 이 논문에서는 3단계 확률 기반 형태소 분석에서 미등록어를 분리하고 태깅하기 위한 방법을 제시한다. 이 방법은 고유명사나 일반명사와 같은 개방어 뒤에 붙는 다양한 접미사를 분석하여 미등록 개방어를 추정할 수 있도록 했다. 이를 위해 형태소 품사 부착 말뭉치에서 자동으로 접미사 패턴을 학습하고, 확률 기반 형태소 분석에 맞도록 미등록 개방어의 분리 및 태깅 확률을 계산하는 방법을 제시하였다. 실험 결과, 제안한 방법은 새로운 미등록 용어가 많이 나오는 문서에서 미등록어 처리 성능을 크게 향상시켰다.

기체 분리막 공정과 환경

  • 박현채;강용수
    • 한국막학회:학술대회논문집
    • /
    • 한국막학회 1995년도 제3회 하계분리막 Workshop (환경과 막분리 공정의 역할)
    • /
    • pp.73-92
    • /
    • 1995
  • 환경오염은 인간이 지구상에서 산업활동을 시작한 이래 계속되어 오고 있는 문제인데, 최근에 들어서 전세계적으로 산업화가 가속되고 또한 인구의 급격한 증가로 인하여 매우 심각한 국면을 맞이하고 있다. 환경오염은 원재료를 가공하여 인간의 일상생활에 필요한 물픔을 생산하는 전 산업 영역에서 발생하고 있는데 이러한 환경오염은 토양오염, 수질오염, 대기오염의 세 가지로 분류할 수 있다. 오늘날의 심각한 환경오염은 환경기술이라는 신조어를 만들게 되었는데, 이는 환경오염을 적게 유발시키는 생산공정을 의미하는 저오염 생산기술(clean technology)과 생성된 오염 물질을 분리 회수하는 오염물질 처리기술(cleaning technology)로 대별할 수 있다. 저오염 생산기술은 자동차의 전착공정 등에서 보듯이 오염물질을 최소한도로 배출하게 설계한 'zero discharge' 개념의 생산공정 등에서 실용화되고 있는데, 최근에는 에너지 효율을 향상시켜 궁극적으로 CO$_{2}$의 발생을 억제하려는 시도도 많은 관심을 끌고 있다. 하지만 환경기술이라고 부르는 경우 거의 대부분은 생성된 오염 물질을 처리하는 오염물질 처리기술을 의미한다.

  • PDF

이중언어 코퍼스로부터 외래어 표기 사전의 자동구축 (Automatic Construction of a Transliteration Dictionary from Bilingual Corpus)

  • 이재성
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1999년도 제11회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.142-149
    • /
    • 1999
  • 외국문명의 영향으로 많은 외래어가 한국어 문서 내에서 사용되고 있으며, 이러한 단어는 주로 전문용어, 고유명사, 신조어 등으로 사전에 등록되지 않는 것이 많다. 본 논문에서는 이중언어 코퍼스로부터 자동으로 외래어 사전을 추출해 내는 확률적 정렬 방법과 실험결과를 소개한다. 확률적 정렬 방법은 통계적 음차 표기 모델에서 사용된 방법을 변형하여 적용한 것이며, 문서단위로 정렬된 두 종류의 영-한 이중언어 코퍼스에 대해 실험하여 재현률과 정확률을 측정하였다 성능은 전처리단계인 한국어 미등록어 추정에 영향을 많이 받았는데, 미등록어 추정을 대략하였을 경우, 재현률은 평균 58%였고, 정확률은 평균74%이었으며, 수동으로 미등록어 명사를 분리했을 경우, 재현률 평균86%, 정확률 평균91%로 외래어와 대응되는 원어를 추출해 냈다.

  • PDF

휴대폰 문자 메시지로부터 자동 일정 등록 (Automatically Registering Schedules from Text Messages on Handheld Devices)

  • 김형철;김재훈
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2010년도 제22회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.86-93
    • /
    • 2010
  • 개인 휴대용 단말기의 보급률이 높아짐에 따라, SMS 메시지가 또 하나의 새로운 의사소통 수단으로 발전하였다. 특히 통화보다 가격이 저렴하고, 통화 후 따로 적어두지 않아도 자동으로 저장되는 특징으로 인해 약속 등을 정할 때 많은 도움이 된다. 본 논문은 일반적인 정보추출 방법을 적용하여 이러한 SMS 메시지에서 자동으로 약속 시간과 장소를 추출한다. 기계학습 기법으로는 CRF를 이용하였으며, 비속어나 신조어가 많고 줄임말이 많은 SMS 메시지의 특징상 토큰분리나 품사 부착 등의 전처리 언어엔진을 사용하지 않았으며, 대신 Bi-Gram 언어모델을 사용하였으며, 학습 시 사전이나 어휘 등의 다양한 자질들을 적용하여 시스템의 정확도를 높였다.

  • PDF

정보산업 분야 시소러스의 공학적 구축 방안 (Toward IT Domain Thesaurus: An Engineering Approach)

  • 류법모;김재호;최기선;성원경
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2005년도 제17회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.13-20
    • /
    • 2005
  • 이 논문은 공학적인 접근 방법에 기반한 단계적인 전문분야 시소러스 구축 방법을 제안한다. 시소러스 구축 과정은 용어 추출 단계, 용어 분류 단계, 계층 구조 구축 의 3단계로 구성되고, 모든 단계에서 자동 처리와 전문가 검증 작업을 거친다. 추출된 용어를 미리 정해진 분류 체계에 따라 분리한 후 여러 개의 작은 시소러스를 구축하고, 마지막으로 전체 시소러스로 결합한다. 이 방법은 1) 시소러스를 구축하는 복잡도가 줄어들고, 2) 클래스 단위의 작은 시소러스가 다른 전문분야 시소러스에 쉽게 재사용 될 수 있으며, 3) 각 클래스에 포함된 용어들의 분포를 쉽게 판단할 수 있는 장점이 있다. 제안한 방법을 이용하여 한국어 정보기술 분야 시소러스를 구축하였다. 시소러스 구축에 사용된 용어들은 정보기술 분야의 최근의 한국어 신문과 특허 문서에서 추출하였기 때문에 한국에서 만들어진 신조어를 포함한다. 구축된 시소러스는 81 개의 상위 레벨클래스와 1,000개 이상의 용어로 구성된다.

  • PDF

음절 단위 임베딩과 딥러닝 기법을 이용한 복합명사 분해 (Compound Noun Decomposition by using Syllable-based Embedding and Deep Learning)

  • 이현영;강승식
    • 스마트미디어저널
    • /
    • 제8권2호
    • /
    • pp.74-79
    • /
    • 2019
  • 기존의 복합명사 분해 알고리즘은 미등록어 단위명사들이 포함된 복합명사를 분해할 때 미등록어를 분리하기 어려운 문제가 발생한다. 이는 현실적으로 모든 고유명사, 신조어, 외래어 등의 모든 단위 명사를 사전에 등록하는 것은 불가능하다는 한계가 존재하기 때문이다. 이 문제를 해결하기 위하여 복합명사 분해 문제를 태그 열 부착(sequence labeling) 문제로 정의하고 음절 단위 임베딩과 딥러닝 기법을 이용하는 복합명사 분해 방법을 제안한다. 단위명사 사전을 구축하지 않고 미등록 단위명사를 인식하기 위하여 복합명사를 구성하는 각 음절들을 연속적인 벡터 공간에 표현하여 LSTM과 선형체인(linear-chain) CRF를 이용하는 방식으로 복합명사를 단위명사들로 분해한다.

tvN 드라마 <백일의 낭군님>의 내러티브 특징과 현대적 요소의 활용 방식 연구 (A Study on the Characteristics of the Narrative and Application Methods of the Modern Elements of , a Drama of tvN)

  • 염원희
    • 대중서사연구
    • /
    • 제25권1호
    • /
    • pp.249-280
    • /
    • 2019
  • 본 연구는 텔레비전 드라마 <백일의 낭군님>을 통해 퓨전사극의 관습이 무엇이며, 이를 바탕으로 장르 내부에서 개성적인 변주가 이루어지면서 대중성을 확보해가는 과정을 확인하고자 한다. <백일의 낭군님>은 퓨전사극의 관습을 심화하는 방식으로 오히려 관습성을 탈피하고자 하였다. 기존 드라마에서 반복된 갈등의 역사를 종합적으로 제시함으로써 시청자들이 쉽게 몰입할 수 있도록 하였고, 궁중 암투를 그리면서도 이와 분리된 공간을 설정하여 남녀의 로맨스를 충실하게 그려내었다. 두 개의 개별적인 수수께끼를 제시하여 내러티브를 풍부하게 만들었다. 또한 '비혼'과 기득권의 횡포라는 사회문제를 이야기하고, 시대상을 반영한 인물과 신조어와 줄임말을 활용한 대사 등 현대 문화의 조선적 해석을 시도하여 과거로 오늘을 보는 것이 아니라, 오늘의 시각으로 과거를 보는 시점을 취하여 새로움을 선사했다. 드라마 콘텐츠의 성공은 관습에서 벗어나는 것이 아니라, 이를 바탕으로 무엇을 변화시킬 수 있는가를 고민해야 하는 데 있다. <백일의 낭군님>은 퓨전사극의 현재와 가능성을 확인할 수 있는 드라마이다.