• 제목/요약/키워드: 한글표현

검색결과 514건 처리시간 0.03초

한국어 오픈 도메인 대화 모델의 CTRL을 활용한 혐오 표현 생성 완화 (Mitigating Hate Speech in Korean Open-domain Chatbot using CTRL)

  • 좌승연;차영록;한문수;신동훈
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2021년도 제33회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.365-370
    • /
    • 2021
  • 대형 코퍼스로 학습한 언어 모델은 코퍼스 안의 사회적 편견이나 혐오 표현까지 학습한다. 본 연구에서는 한국어 오픈 도메인 대화 모델에서 혐오 표현 생성을 완화하는 방법을 제시한다. Seq2seq 구조인 BART [1]를 기반으로 하여 컨트롤 코드을 추가해 혐오 표현 생성 조절을 수행하였다. 컨트롤 코드를 사용하지 않은 기준 모델(Baseline)과 비교한 결과, 컨트롤 코드를 추가해 학습한 모델에서 혐오 표현 생성이 완화되었고 대화 품질에도 변화가 없음을 확인하였다.

  • PDF

문장 유사도를 이용한 다양한 표현의 패러프레이즈 생성 (Various Paraphrase Generation Using Sentence Similarity)

  • 박다솔;장두성;차정원
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2021년도 제33회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.576-581
    • /
    • 2021
  • 패러프레이즈란 어떤 문장을 같은 의미를 가지는 다른 단어들을 사용하여 표현한 것들을 의미한다. 이는 정보 검색, 다중 문서 요약, 질의응답 등 여러 자연어 처리 분야에서 중요한 역할을 한다. 특히, 양질의 패러프레이즈 코퍼스를 얻는 것은 많은 시간 및 비용이 소요된다. 이러한 문제점을 해소하기 위해 본 논문에서는 문장 유사도를 이용한 패러프레이즈 쌍을 구축하고, 또 구축한 패러프레이즈 쌍을 이용하여 기계 학습을 통해 새로운 패러프레이즈을 생성한다. 제안 방식으로 생성된 패러프레이즈 쌍은 기존의 구축되어 있는 코퍼스 내 나타나는 표현들로만 구성된 페러프레이즈 쌍이라는 단점이 존재한다. 이러한 단점을 해소하기 위해 기계 학습을 이용한 실험을 진행하여 새로운 표현에 대한 후보군을 추출하는 방법을 적용하여 새로운 표현이라고 볼 수 있는 후보군들을 추출하여 기존의 코퍼스 내 새로운 표현들이 생성된 것을 확인할 수 있었다.

  • PDF

워드 임베딩을 활용한 관용표현 인식 연구 (Korean Idiom Classification Using Word Embedding)

  • 박서윤;강예지;강혜린;장연지;김한샘
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2020년도 제32회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.548-553
    • /
    • 2020
  • 우리가 쓰는 일상 언어 중에는 언어적 직관이 없는 사람은 의미 파악이 힘든 관용표현이 존재한다. 관용표현을 이해하기 위해서는 표현에 대한 형태적, 의미적 이해가 수반되어야 하기 때문이다. 기계도 마찬가지로 언어적 직관이 없기 때문에 관용표현에 대한 자연어 처리에는 어려움이 따른다. 특히 일반표현과 중의성 관계에 있는 관용표현의 특성이 고려되지 않은 채 문자적으로만 분석될 위험성이 높다. 본 연구에서는 '관용표현은 주변 문맥과의 관련성이 떨어진다'라는 가정을 중심으로 워드 임베딩을 활용한 관용표현과 일반표현에 대한 구분을 시도하였다. 실험은 4개 표현에 대해 이루어 졌으며 Skip-gram, Fasttext를 활용한 방법을 통해 관용표현은 주변 단어들과의 유사성이 떨어짐을 확인하였다.

  • PDF

한글도메인이름을 지원하기 위한 Proxy HDNS 구현 (P-HDNS : A New Scheme to Support Multilingual Domain Names)

  • 김원;진용옥
    • 전자공학회논문지C
    • /
    • 제36C권12호
    • /
    • pp.1-10
    • /
    • 1999
  • 주어진 도메인 이름에 대하여 클라이언트 프로그램은 DNS(Domain Name System)을 통하여 해당 IP주소를 얻는데 현제의 인터넷상에서는 ASCII 코드로 표현되는 도메인이름의 사용만 가능하다. 이로 인하여 ASCII 코드와는 다른 코드체계를 갖는 국가들도 ASCII 코드로 표현된 도메인 이름을 사용할 수밖에 없다. 그러므로 보다 편리한 인터넷 사용자 환경을 위해서는 기존의 ASCII 코드로만 제한되어 있는 도메인 이름 보다는 해당 국가의 코드로 표현할 수 있도록 해야 한다. 본 고에서는 기존의 DNS 상에서 도메인 이름을 다국어로 표현할 수 있는 기법을 제안한다. 제안하는 기법은 기존의 운 도메인이름 표현규약 하에서의 UTF5를 기반으로 하는 다국어 코드와 ASCII 코드간의 상호 변환 방법, 변환된 코드값을 도메인 데이터 패킷에 적용하는 기법, 그리고 변환된 도메인 이름 데이터를 저장하는 네임서버의 설정 방법으로 구성된다. 제안하는 기법을 기초로 하여 클라이언트 프로그램과 DNS 사이에서 게이트웨이로서 동작하는 Proxy HDNS(P-HDNS)를 구현하여 실제로 한글도메인이름이 국내 인터넷 환경에서 사용할 수 있었다. 본 고에서는 제안하는 기법과 P-HDNS의 구현 내용에 대하여 기술한다.

  • PDF

웹 검색을 이용한 한글대역어에 대한 영어약어의 중의성 해소 (Web-based disambiguation of English Abbreviation for Korean Term)

  • 구희관;정한민;강인수;성원경
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2006년도 춘계학술발표대회
    • /
    • pp.611-614
    • /
    • 2006
  • 특정 신문은 해당 도메인의 언어자원을 구축하는데 필요한 자원이며, 한글과 영어의 괄호를 통해 표현되는 대역어구는 다국어 정보로 언어자원 구축에 이용된다. 그러나, 실제로 신문에서 사용되는 한영대역어의 구성은 한글대역어와 영어약어로 구성된 비율이 80%이상을 보인다. 신문을 대상으로 대역어사전 등을 구축하기 위해서는, 영어양어의 완전한 형태인 영어비약어 정보가 필요하다. 본 논문은 영어비약어 정보를 획득하기 웹검색을 통해 영어비약어를 획득하고, 영어약어를 이용해 영어약어와 영어비약어의 관계를 이용하는 방법을 제안한다.

  • PDF

자연어 활용(1) : 간편한 컴퓨터 조작을 위한 한글 문장 이해에 관한 연구 (Application of Natural Language Processing(1) : Understanding of the Hangul Sentences for Simple Computer Manipulation)

  • 장덕성;이동애
    • 인지과학
    • /
    • 제3권1호
    • /
    • pp.41-60
    • /
    • 1991
  • 대부분의 PC 사용자들은 늘 사용하는 몇 가지 명령만으로 컴퓨터를 조작하고 있다. 그러나 DOS명령 대신 한글 문장으로 컴퓨터를 조작한다면, 최적의 명령어를 생성해낼수 있을뿐 아니라 사용자에게 융통성을 제공할 수 있다. 이를 위하여 본 논문에서는 자연어로 입력되는 한글 문장을 형태소 분석, 구문분석, 의미분석, 개념분석을 통해 일련의 DOS명령으로 변환하는 방법을 연구하였다. 형태소 분석에서는 Tabular Parsing 이 이용되고, 구문 분석과 의미분석에서는 격문법이 이용된다. 문자의 의미는 개념망으로 표현되고 이로부터 DOS 명령어가 생성된다.

자연어 처리 수화 3D 학습 시스템 개발 (Development of 3D sign language learning system for processing natural language)

  • 김재현
    • 한국콘텐츠학회:학술대회논문집
    • /
    • 한국콘텐츠학회 2011년도 춘계 종합학술대회 논문집
    • /
    • pp.229-230
    • /
    • 2011
  • 이 연구는 청각장애자 및 건청인들을 위한 수화교육 시스템으로 주어진 환경 내에서 청각 장애자 및 건청인들에게 3D 시각적인 정보를 활용해 교육하는 시스템에 대한 연구이다. 실생활에서 사용하는 수화 동작은 3D DB화하여, 입력되는 한글 텍스트에 대응해 3D 캐릭터가 수화 동작을 리얼하게 구현하는 것을 목적으로, 수화 교육이 필요한 장소나 사람들에게 유용하게 활용할 수 있도록 한다. 생활단어를 추가하여 대부분의 생활용어를 적절히 표현할 수 있도록 하고, 자연스러운 수화단어 구현을 위한 모션 편집 및 블랜딩 기법을 적용하며, 자연어처리 알고리즘을 활용하여 한글문장에도 대응할 수 있도록 개발하기 위하여 수화 애니메이션 기술, 한글 입력 문장에 따른 3D 수화 구문 변화 자연어 처리 알고리즘, 실시간 3D 랜더링 기술 등을 근간으로 한 시스템을 개발하고자 한다.

  • PDF

한.영 혼용 문에서 조사오류 검출 및 교정 (A Josa-Errors Detection and Correction from Korea-English Mixed Sentences)

  • 정규철;정민수;조원홍
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1998년도 제10회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.36-40
    • /
    • 1998
  • 전문 분야의 세분화로 인한 신조어 발생이 늘어나고 있다. 또한, 이러한 단어를 우리말로 표현이 불가능한 경우 우리 발음으로 풀어 기록하지 않고 그대로 적는 경우도 늘어나고 있는 추세이다. 특히 전문 서적일수록 두드러진다. 그러나 한글과 영어를 혼용하여 기록할 경우 부적절한 조사의 쓰임으로 인하여 매끄럽지 못함을 가끔 볼 수 있다. 본 논문에서는 영단어의 발음특성정보를 이용하여 한글 조사의 오류를 정확하게 검출하고 교정을 할 수 있다.

  • PDF

음절 단위 Multi-hot 벡터 표현을 활용한 Sequence-to-sequence Autoencoder 기반 한글 오류 보정기 (Sequence-to-sequence Autoencoder based Korean Text Error Correction using Syllable-level Multi-hot Vector Representation)

  • 송치성;한명수;조훈영;이경님
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2018년도 제30회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.661-664
    • /
    • 2018
  • 온라인 게시판 글과 채팅창에서 주고받는 대화는 실제 사용되고 있는 구어체 특성이 잘 반영된 텍스트 코퍼스로 음성인식의 언어 모델 재료로 활용하기 좋은 학습 데이터이다. 하지만 온라인 특성상 노이즈가 많이 포함되어 있기 때문에 학습에 직접 활용하기가 어렵다. 본 논문에서는 사용자 입력오류가 다수 포함된 문장에서의 한글 오류 보정을 위한 sequence-to-sequence Denoising Autoencoder 모델을 제안한다.

  • PDF

주소 인식 시스템을 위한 필기 한글 단어 인식 (Handwritten Korean Word Recognition for Address Recognition)

  • 권진욱;이관용;변혜란;이일병
    • 한국지능시스템학회:학술대회논문집
    • /
    • 한국퍼지및지능시스템학회 1997년도 춘계학술대회 학술발표 논문집
    • /
    • pp.201-204
    • /
    • 1997
  • 최근 주소를 자동으로 인식하여 우편물 분류와 같은 업무를 효과적으로 수행하기 위한 연구가 진행되고 있다. 기존 연구들은 낱자 단위의 인식을 수행한 후 사전 형태의 간단한 DB를 통해 최종의 결과를 생성한다. 그러나 한글과 같은 복잡한 구조의 필기 문자에 대한 인식기의 성능은 아직도 미흡한 상태이다. 따라서 낱자 인식기의 성능에 의존하는 현재와 같은 방법으로는 만족할 만한 결과를 얻기가 힘들 것으로 생각된다. 본 논문에서는 낱자 인식 결과에 크게 의존하지 않고 주소에 나타나는 단어의 낱자들 사이간 연결 정보를 이용하여 단어를 인식할 수 있는 시스템을 제안한다. 본 시스템은 통계적 인식기를 사용하여 낱자를 인식하는 부분과 낱자 인식 결과를 조합하여 단어 수준의 인식과정을 통해 최종의 결과를 생성하는 부분으로 구성된다. 통계적 인식기는 Nearest neighborhood 방법을 사용하여 간단한 형태로 구현하였다. 단어인식 모듈은 단어에서 모든 문자간의 관계를 표현할 수 있도록 HMM 모형을 사용하여 어휘정보 네트워크를 구성하고 이를 이용하여 주소에 나타나는 단어를 인식하도록 하였다. PE92 한글 문자 데이터를 이용하여 실험을 수 璿\ulcorner 결과, 통계적 인식기의 성능이 저조함에도 불구하고 HMM을 이용한 어휘정보 네트워크가 이를 보완함으로써 좋은 결과를 얻었다. 이러한 단어 인식 방법을 주소 이외의 다른 단어 집합에 대해서도 쉽게 적용될 수 있을 것으로 예상된다.

  • PDF