• 제목/요약/키워드: 한글맞춤법

검색결과 46건 처리시간 0.017초

한국어 문법 오류 교정 모델을 위한 문장 단위 디노이징 학습법 (Sentence Unit De-noising Training Method for Korean Grammar Error Correction Model)

  • 김훈래;김윤수;이근배
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2022년도 제34회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.507-511
    • /
    • 2022
  • 문법 교정 모델은 입력된 텍스트에 존재하는 문법 오류를 탐지하여 이를 문법적으로 옳게 고치는 작업을 수행하며, 학습자에게 더 나은 학습 경험을 제공하기 위해 높은 정확도와 재현율을 필요로 한다. 이를 위해 최근 연구에서는 문단 단위 사전 학습을 완료한 모델을 맞춤법 교정 데이터셋으로 미세 조정하여 사용한다. 하지만 본 연구에서는 기존 사전 학습 방법이 문법 교정에 적합하지 않다고 판단하여 문단 단위 데이터셋을 문장 단위로 나눈 뒤 각 문장에 G2P 노이즈와 편집거리 기반 노이즈를 추가한 데이터셋을 제작하였다. 그리고 문단 단위 사전 학습한 모델에 해당 데이터셋으로 문장 단위 디노이징 사전 학습을 추가했고, 그 결과 성능이 향상되었다. 노이즈 없이 문장 단위로 분할된 데이터셋을 사용하여 디노이징 사전 학습한 모델을 통해 문장 단위 분할의 효과를 검증하고자 했고, 디노이징 사전 학습하지 않은 기존 모델보다 성능이 향상되는 것을 확인하였다. 또한 둘 중 하나의 노이즈만을 사용하여 디노이징 사전 학습한 두 모델의 성능이 큰 차이를 보이지 않는 것을 통해 인공적인 무작위 편집거리 노이즈만을 사용한 모델이 언어학적 지식이 필요한 G2P 노이즈만을 사용한 모델에 필적하는 성능을 보일 수 있다는 것을 확인할 수 있었다.

  • PDF

SNS 채팅 데이터에 적응적인 Self-Attention 기반 문맥의존 철자오류 교정 시스템 (Adaptive Context-Sensitive Spelling Error Correction System Based on Self-Attention for Social Network Service Chatting Data)

  • 최혜원;장대식;손동철;이승욱;고영중
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2019년도 제31회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.362-367
    • /
    • 2019
  • 본 논문에서는 Self-Attention을 활용한 딥러닝 기반 문맥의존 철자오류 교정 모델을 제안한다. 문맥의존 철자오류 교정은 최근 철자오류 교정 분야에서 활발히 연구되고 있는 문제 중 하나이다. 기존에는 규칙 기반, 확률 기반, 임베딩을 활용한 철자오류 교정이 연구되었으나, 아직 양질의 교정을 수행해내기에는 많은 문제점이 있다. 따라서 본 논문에서는 기존 교정 모델들의 단점을 보완하기 위해 Self-Attention을 활용한 문맥의존 철자오류 교정 모델을 제안한다. 제안 모델은 Self-Attention을 활용하여 기존의 임베딩 정보에 문맥 의존적 정보가 반영된 더 나은 임베딩을 생성하는 역할을 한다. 전체 문장의 정보가 반영된 새로운 임베딩을 활용하여 동적으로 타겟 단어와의 관련 단어들을 찾아 문맥의존 철자 오류교정을 시행한다. 본 논문에서는 성능평가를 위해 세종 말뭉치를 평가 데이터로 이용하여 제안 모델을 실험하였고, 비정형화된 구어체(Kakao Talk) 말뭉치로도 평가 데이터를 구축해 실험한 결과 비교 모델보다 높은 정확율과 재현율의 성능향상을 보였다.

  • PDF

임베디드 시스템에 적합한 한국어 복합명사 분해 (Korean Compound Nouns Decomposition Suitable for Embedded Systems)

  • 최민석;김창현;천민아;박호민;남궁영;윤호;김재훈
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2018년도 제30회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.316-320
    • /
    • 2018
  • 복합명사는 둘 이상의 말이 결합된 명사를 말하며 문장에서 하나의 단어로 간주된다, 그러나 맞춤법 및 띄어쓰기 검사나 정보검색의 색인어 추출, 기계번역의 미등록어 추정 등의 분야에서는 복합명사를 구성하는 개별 단어를 확인할 필요가 있다. 이 과정을 복합명사 분해라고 한다. 복합명사를 분해하는 방법으로 크게 규칙 기반 방법, 통계 기반 방법 등이 있으며 본 논문에서는 규칙을 기반으로 최소한의 통계 정보를 이용하는 방법을 제안한다. 본 논문은 4개의 분해 규칙을 적용하여 분해 후보를 생성하고 분해 후보들 중에 우선순위를 정하여 최적 후보를 선택하는 방법을 제안한다. 기본 단어(명사)로 트라이(trie)를 구축하고 구축된 트라이를 이용하여 양방향 최장일치를 적용하고 음절 쌍의 통계정보를 이용해서 모호성을 제거한다. 성능을 평가하기 위해 70,000여 개의 명사 사전과 음절 쌍 통계정보를 구축하였고, 이를 바탕으로 복합명사를 분해하였으며, 분해 정확도는 단어 구성비를 반영하면 96.63%이다. 제안된 복합명사 분해 방법은 최소한의 데이터를 이용하여 복합명사 분해를 수행하였으며 트라이 자료구조를 사용해서 사전의 크기를 줄이고 사전의 검색 속도를 개선하였다. 그 결과로 임베디드 시스템과 같은 소형 기기의 환경에 적합한 복합명사 분해 시스템을 구현할 수 있었다.

  • PDF

한국어 음운 변동 처리 규칙의 설계 및 구현 (Design and Implementation of Vocal Sound Variation Rules for Korean Language)

  • 이계영
    • 한국정보처리학회논문지
    • /
    • 제5권3호
    • /
    • pp.851-861
    • /
    • 1998
  • 한국어는 음운 변동 현상이 매우 발달되어 있다는 특징을 갖고 있다. 따라서, 음성 인식율의 제고와 음성 합성음의 자연스러움을 향상시키기 위해서는 음운 변동 현상을 비롯한 한국어의 모든 특징에 대한 체계적인 연구가 있어야 한다. 본 논문은 한국어의 제 특징 중에서 음운 변동 현상을 효율적으로 처리할 수 있는 규칙을 설계하고 구현함으로써, 한국어 음성 인식과 합성에 효율적으로 이용될 수 있음을 보인다. 음운 변동 규칙의 설계를 위하여 사용된 규정은 한글 맞춤법 통일안의 표준 발음법(7장 30항)이며, 일차적으로 각 규정별로 설계된 규칙을 최종적으로 27개 그룹으로 정리된 종성별 규칙을 제시하였다. 본 연구에서 제안된 음운 변동 처리 시스템은 한번의 규칙 적용으로 음운 변도 dgus상이 신속히 처리되는 잇점이 있으며, 단어 및 용언의 어간에 접속되는 정보에 대한 처리 내용까지도 제안된 규칙내에 수용하였기 때문에 문장 단위의 음성 인식과 합성 시스템의 연구에 도움을 줄 수 있다.

  • PDF

영어기반 컴퓨터자동채점모델과 기계번역을 활용한 서술형 한국어 응답 채점 -자연선택개념평가 사례- (Scoring Korean Written Responses Using English-Based Automated Computer Scoring Models and Machine Translation: A Case of Natural Selection Concept Test)

  • 하민수
    • 한국과학교육학회지
    • /
    • 제36권3호
    • /
    • pp.389-397
    • /
    • 2016
  • 이 연구는 기계 번역을 활용하여 영어기반서술형 평가의 자동채점모델을 한국어 응답에 적용하는 방법의 효용감을 조사하기 위하여 이루어졌다. 이 연구를 위하여 예비생물교사 128명이 4문항으로 구성된 자연선택개념평가도구에 응답한 512개의 서술형응답을 활용하였다. 서술형응답은 한글맞춤법을 교정한 것과 교정하지 않은 학생들이 작성한 그대로의 응답 두 가지를 구글번역으로 번역하였다. 8가지 과학적 개념과 비과학적 개념을 채점하는 자동채점모델을 통해 생성한 4096개의 예측자료의 정확도를 독립적으로 수행한 전문가 채점자료와 비교하는 방법으로 확인하였다. 그 결과 컴퓨터로 채점한 점수와 전문가 채점점수의 평균값의 문항별 분포는 유의미한 차이가 없었다. 평균값을 활용하여 생성한 통계치들은 전문가 채점자료를 통하여 생성한 자료들과 유의미한 차이가 없었다. 학생별 점수의 Pearson 상관관계 계수를 확인한 결과 과학적 개념 점수는 0.848, 비과학적 개념 점수는 0.776이었다. 언어적으로 단순한 개념의 경우 채점자간 일치도 (kappa)가 0.8이상이었다. 이 결과는 기계 번역과 영어기반 서술형 평가의 자동채점모델이 우리나라 학생들의 자연선택개념문항을 채점하는데 유용한 방법이 될 수 있음을 보여준다.

초등학교 예비교사들의 수학적 '문제 만들기'에 나타나는 문장의 오류 유형 분석 (Analysis on Sentence Error Types of Mathematical Problem Posing of Pre-Service Elementary Teachers)

  • 허난;신호철
    • 한국학교수학회논문집
    • /
    • 제16권4호
    • /
    • pp.797-820
    • /
    • 2013
  • 본 논문은 초등학교 예비교사 100명을 대상으로 수학적 '문제 만들기'의 문장에 나타나는 오류를 분석하고 그에 대한 간단한 예방책을 기술한 논의이다. '문제 만들기' 문장에는 '음운 오류, 단어 오류, 문장 오류, 의미 오류, 표기 오류' 등 5가지 오류 유형이 나타났다. 이를 다시 14개의 세부 유형으로 구분하여 세부적으로 논의하였다. 곧 음운 오류의 유형은 'ㄹ'첨가 오류와 조사끼리의 준말 사용 오류가 있다. 단어 오류는 크게 '부적절한 사용 오류'와 '부당한 생략 오류'로 구분하고 이를 다시 조사, 어미, 어휘의 사용 오류와 조사와 어휘의 부당한 생략 오류로 유형화하였다. 문장 오류는 '지시 대상의 오류, 문장 성분의 생략 오류, 어순 오류, 자체 비문'의 네 가지로 유형화하였다. 의미 오류는 논리적 모순 관계 오류와 중의성을 띄는 의미 오류에 대해서만 논의하였고, 표기 오류는 띄어쓰기와 문장 부호, 철자에 관한 한글 맞춤법 오류와 외래어 표기법 오류 등에 대하여 논의하였다. 또한 14개의 문법적 세부 오류 유형을 방지하기 위한 예방책을 제시하였다. 먼저 구어와 문어의 차이를 인식하고, 둘째 글을 쓰는 문어 상황에 맞도록 구어적 표현을 지양하도록 하는 것, 셋째 국어 기본 문형 학습에 대한 강조, 넷째 단어 의미의 명확한 이해를 바탕으로 한 의미의 논리적 전개 인식을 제안하였으며, 끝으로 국어 어문 규정에 대한 학습을 제안하였다. 그리고 대학생 글쓰기 교육에 대한 필요성에 대한 재인식을 결론으로 갈음하였다.

  • PDF