• 제목/요약/키워드: sentence processing

검색결과 324건 처리시간 0.023초

CNN 기반 감성 변화 패턴을 이용한 가짜뉴스 탐지 (Fake News Detection Using CNN-based Sentiment Change Patterns)

  • 이태원;박지수;손진곤
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제12권4호
    • /
    • pp.179-188
    • /
    • 2023
  • 최근 가짜뉴스는 뉴스 콘텐츠 형식을 가장하고 중요한 사건이 발생할 때마다 등장하여 사회적 혼란을 초래한다. 이에 가짜뉴스를 탐지하기 위한 연구로 인공지능 기술이 사용된다. 자연어 처리를 통해 가짜뉴스를 자동으로 인지 및 차단하거나, 네트워크 인과 추론과 결합함으로써 허위 정보를 확산시키는 소셜미디어 인플루언스 계정을 감지하는 등의 가짜뉴스 탐지 접근법이 딥러닝을 통해 구현될 수 있었다. 그러나 가짜뉴스 탐지는 여러 자연어 처리 분야 중에서도 해결이 어려운 문제로 분류된다. 가짜뉴스가 가지는 형식 및 표현의 다양성으로 특성 추출의 난도가 높고, 뉴스가 속한 범주에 따라 하나의 특성이 서로 다른 의미를 가질 수도 있는 등 다양한 한계점이 존재한다. 본 논문에서는 가짜뉴스를 탐지하기 위한 추가적인 식별 기준으로 감성 변화 패턴을 제시한다. 합성곱 신경망을 가짜뉴스 데이터 세트에 적용하여 콘텐츠 특성에 기반한 분석을 수행하고, 감성 변화 패턴을 추가로 분석함으로써 성능이 개선된 모델을 제안한다. 뉴스를 구성하는 문장에 대하여 감성 극성을 산출하고 장단기 메모리를 적용함으로써 문장 순서에 의존적인 결괏값을 얻을 수 있다. 이를 감성 변화의 패턴으로 정의하고 뉴스의 콘텐츠 특성과 결합하여 가짜뉴스 탐지를 위한 제안 모델의 독립변수로 활용한다. 제안 모델과 비교 모델을 딥러닝으로 학습시키고 가짜뉴스 데이터 세트를 이용한 실험을 진행하여 감성 변화 패턴이 가짜뉴스 탐지 성능을 개선할 수 있음을 확인한다.

Natural Language Processing(NLP)를 활용한 법원의 판결과 온라인상 대중 인식간 괴리에 관한 실증 연구 (Examining the Disparity between Court's Assessment of Cognitive Impairment and Online Public Perception through Natural Language Processing (NLP): An Empirical Investigation)

  • 노승국
    • 한국빅데이터학회지
    • /
    • 제8권1호
    • /
    • pp.11-22
    • /
    • 2023
  • 본 연구는 대중들이 '심신장애를 사유로 하는 형량 감경 비율'에 대해 어떻게 생각하고 있는지 분석하고, 여론의 방향과 실제 법원의 판단이 합치되는지 확인하기 위해 수행되었다. 이를 위해, 대법원 코트넷 판결문 검색시스템과 기관별 정신감정 의뢰 건수, 네이버 뉴스에서 '심신장애'를 키워드로 하는 기사의 개수와 댓글 개수, 댓글 내용을 크롤링한 결과를 활용하였다. 데이터 분석 결과, 여론은 심신장애에 따른 형량 감경에 대해 부정적이었으며 그 기준의 모호성에 대해 불만을 나타냈다. 그러나 실제 판결문 분석과 기관별 정신감정 의뢰 건수 분석 결과 법원은 「형법」제10조(심신장애)에 규정된 정신장애인의 책임 조각 및 책임 감경에 대해 엄격하게 판단하고 있음을 확인할 수 있었다. 즉, 가해자의 정신장애에 대한 인정 사례는 줄어들고 있지만 여론은 이를 인지하지 못하고 있다. 공권력이 국민 수호의 의무를 충분히 수행하고 있지 못하다는 여론의 형성은 국가기관에 대한 국민의 신뢰를 떨어뜨리는 부정적 효과를 갖고 있다. 따라서 국민의 안전을 보장하는 경찰과 검찰은 국민의 신뢰를 얻기 위해 명확한 기준에 따라 법집행을 할 필요가 있으며 사법부도 심신장애에 대한 감형 기준에 대해 엄중한 판단은 물론 그 적용 결과를 국민들에게 인식시켜줄 필요가 있다.

SMS 변형된 문자열의 자동 오류 교정 시스템 (Automatic Error Correction System for Erroneous SMS Strings)

  • 강승식;장두성
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제35권6호
    • /
    • pp.386-391
    • /
    • 2008
  • 휴대폰과 메신저 등 통신 환경에서 문자 메시지를 전송할 때 표준어가 아닌 왜곡된 어휘들을 사용하고 있으며, 이러한 변형된 어휘들은 음성 인식, 음성 합성, 문서 정보 추출 등 언어처리 및 관련 분야의 응용 시스템에서 많은 문제점을 유발시킨다. 본 논문에서는SMS 문장들의 변형 및 띄어쓰기 오류를 자동으로 교정하여 형태소 분석 및 품사 태깅의 성능 저하 문제를 방지하는 문자열 오류의 교정 방법을 제안하고 시스템을 구현하였다. 시스템의 성능에 가장 큰 영향을 미치는 변형된 문자열 사전을 구축하는 방법으로 (1) 통신 어휘집을 기반으로 수동으로 구축하는 방법, (2) 수작업으로 구축된 말뭉치로부터 자동으로 변형된 문자열을 추출하는 방법, (3) 자동으로 변형된 문자열을 추출할 때 좌우 문맥을 고려하는 방법에 대하여 시스템을 구현하고 실험을 통하여 비교-분석 및 성능 평가 결과를 제시하였다.

의미네트워크를 이용한 단어의미의 모호성 해결방법 (A Word Sense Disambiguation Method with a Semantic Network)

  • 나동렬
    • 인지과학
    • /
    • 제3권2호
    • /
    • pp.225-248
    • /
    • 1992
  • 본 논문에서는 의미 네트워크에 기반을 둔 지식베이스를 이용하여 단어 의미의 모호성을 해소하는 방법들을 소개 한다. 기본이 되는 방법은 입력문자의 의미해석이 진행됨에 따라 수집되는 지식베이스내의 경로(path)들을 추적하여 이용하는 것이다. 이러한 경로들을 의미경로(semantic path)라고 부른다. 파싱과정에서 한 단어가 입력되면 이단어가 가질수 있는 의미 중에서 어느 의미 경로에도 이용되지 않은 것들이 제거된다. 각 제거는 의미 경로들을 통하여 전파되어 이미 입력된 다른 단어들의 의미의 제거를 유발한다. 이 박업은 더이상 제거되는 의미가 없을때 까지 반복 진행된느데 이를 recursive word sense removal 작업이라 부른다. 추상적인 개념의 구체화(conctetion) 작업도 단어 의미 모호성해소의 중요한 방법인데, 본 논문에서는 이를 경로조절작업(path adjustment operation)이라고 불리는 방법을 이용하여 확장시키는 방법을 소개한다. 의미사이의 연과성(semantic association)이나 구문분석으로부터의 정보를 위의 방법들과 관련지어 이용하는 방법도 살펴본다.

부분 구문 분석 결과에 기반한 두 단계 부분 의미 분석 시스템 (Two-Phase Shallow Semantic Parsing based on Partial Syntactic Parsing)

  • 박경미;문영성
    • 정보처리학회논문지B
    • /
    • 제17B권1호
    • /
    • pp.85-92
    • /
    • 2010
  • 부분 의미 분석 시스템은 문장의 구성 요소들이 술어와 갖는 관계를 분석하는 것으로 문장에서 술어의 주체, 객체, 도구 등을 나타내는 의미 논항을 확인하게 된다. 본 논문에서 개발한 부분 의미 분석 시스템은 두 단계로 구성되어 있는데, 먼저 부분 구문 분석 결과로부터 의미 논항의 경계를 찾는 의미 논항 확인 단계를 수행하고 다음으로 확인된 의미 논항에 적절한 의미역을 부착하는 의미역 할당 단계를 수행한다. 순차적인 두 단계 방법을 적용하는 것에 의해서, 학습 성능 저하의 주요한 원인인 클래스 분포의 불균형 문제를 완화할 수 있고, 각 단계에 적합한 자질을 선별하여 사용할 수 있다. 본 논문에서는 PropBank 말뭉치에 기반한 CoNLL-2004 shared task의 데이터 집합 및 평가 프로그램을 사용하여 각 단계가 시스템의 전체 성능에 기여하는 정도를 보인다.

상품평의 언어적 분석을 통한 상품 평가 요약 시스템 (Product Evaluation Summarization Through Linguistic Analysis of Product Reviews)

  • 이우철;이현아;이공주
    • 정보처리학회논문지B
    • /
    • 제17B권1호
    • /
    • pp.93-98
    • /
    • 2010
  • 본 논문에서는 폭발적으로 증가하고 있는 상품평을 효과적으로 활용하기 위해 언어적 분석을 통하여 상품 평가를 요약하는 시스템을 제안한다. 시스템에서는 스커트 상품 분류의 경우 '디자인'과 '재질'과 같이, 상품을 평가하는 기준이 되는 항목에 대한 상품평의 부정과 긍정의 극성 여부를 판별하여 그래프 형태로 요약하여 제시한다. 본 논문에서는 작은 시드 어휘와 문맥에 기반한 자동 확장 방법을 사용하여 평가 항목 별 평가 어휘 극성 사전을 구축하여 평가 항목에 대한 상품평의 극성을 판정한다. 제안한 방식은 여러 온라인 쇼핑몰의 실제 상품평에 대한 실험에서 극성 사전 추출에서 평균 69.8%의 정확율과 문장별 극성 식별에서 평균 81.8%의 정확율을 보였다.

신문 기사의 언어 사용 양상: 코퍼스언어학적 접근 (Aspects of Language Use in Newspaper Articles: A Corpus Linguistic Perspective)

  • 송경화;강범모
    • 인지과학
    • /
    • 제17권4호
    • /
    • pp.255-269
    • /
    • 2006
  • 본 연구는 신문 기사에 대한 실증적 언어 분석을 목적으로 한다. <21세기 세종계획>에 의해 구축된 대용량의 신문 기사 말뭉치를 형태, 어절, 절, 문장 등의 단위로 계량화하여 분석하였다. 신문 기사를 표제, 전문, 본문의 세 구성 성분으로 나누고 표제의 표시성과 압축성의 실현 양상, 전문과 표제의 연관성, 본문의 문장 구조와 일반명사 구성 비율 등을 살펴보았다. 이 연구를 통하여 기존의 비계량적 연구 방법들과 차별화 된 실증적 연구로서 신문 이론을 검증하고, 신문 기사의 새로운 언어 현상을 발견할 수 있었다. 신문 기사와 같은 텍스트는 인간의 인지적 언어 처리의 결과이며 동시에 인지적 언어 형성에 영향을 미칠 것이다.

  • PDF

문서 분류의 개선을 위한 단어-문자 혼합 신경망 모델 (Hybrid Word-Character Neural Network Model for the Improvement of Document Classification)

  • 홍대영;심규석
    • 정보과학회 논문지
    • /
    • 제44권12호
    • /
    • pp.1290-1295
    • /
    • 2017
  • 문서의 텍스트를 바탕으로 각 문서가 속한 분류를 찾아내는 문서 분류는 자연어 처리의 기본 분야 중 하나로 주제 분류, 감정 분류 등 다양한 분야에 이용될 수 있다. 문서를 분류하기 위한 신경망 모델은 크게 단어를 기본 단위로 다루는 단어 수준 모델과 문자를 기본 단위로 다루는 문자 수준 모델로 나누어진다. 본 논문에서는 문서를 분류하는 신경망 모델의 성능을 향상시키기 위하여 문자 수준과 단어 수준의 모델을 혼합한 신경망 모델을 제안한다. 제안하는 모델은 각 단어에 대하여 문자 수준의 신경망 모델로 인코딩한 정보와 단어들의 정보를 저장하고 있는 단어 임베딩 행렬의 정보를 결합하여 각 단어에 대한 특징 벡터를 만든다. 추출된 단어들에 대한 특징 벡터를 바탕으로, 주의(attention) 메커니즘을 이용한 순환 신경망을 단어 수준과 문장 수준에 각각 적용하는 계층적 신경망 구조를 통해 문서를 분류한다. 제안한 모델에 대하여 실생활 데이터를 바탕으로 한 실험으로 효용성을 검증한다.

PubMine: An Ontology-Based Text Mining System for Deducing Relationships among Biological Entities

  • Kim, Tae-Kyung;Oh, Jeong-Su;Ko, Gun-Hwan;Cho, Wan-Sup;Hou, Bo-Kyeng;Lee, Sang-Hyuk
    • Interdisciplinary Bio Central
    • /
    • 제3권2호
    • /
    • pp.7.1-7.6
    • /
    • 2011
  • Background: Published manuscripts are the main source of biological knowledge. Since the manual examination is almost impossible due to the huge volume of literature data (approximately 19 million abstracts in PubMed), intelligent text mining systems are of great utility for knowledge discovery. However, most of current text mining tools have limited applicability because of i) providing abstract-based search rather than sentence-based search, ii) improper use or lack of ontology terms, iii) the design to be used for specific subjects, or iv) slow response time that hampers web services and real time applications. Results: We introduce an advanced text mining system called PubMine that supports intelligent knowledge discovery based on diverse bio-ontologies. PubMine improves query accuracy and flexibility with advanced search capabilities of fuzzy search, wildcard search, proximity search, range search, and the Boolean combinations. Furthermore, PubMine allows users to extract multi-dimensional relationships between genes, diseases, and chemical compounds by using OLAP (On-Line Analytical Processing) techniques. The HUGO gene symbols and the MeSH ontology for diseases, chemical compounds, and anatomy have been included in the current version of PubMine, which is freely available at http://pubmine.kobic.re.kr. Conclusions: PubMine is a unique bio-text mining system that provides flexible searches and analysis of biological entity relationships. We believe that PubMine would serve as a key bioinformatics utility due to its rapid response to enable web services for community and to the flexibility to accommodate general ontology.

스킵 포인팅 모델 기반 포인터 네트워크 (Pointer Networks based on Skip Pointing Model)

  • 박천음;이창기
    • 정보과학회 컴퓨팅의 실제 논문지
    • /
    • 제22권12호
    • /
    • pp.625-631
    • /
    • 2016
  • 포인터 네트워크는 어텐션 메커니즘(Attention mechanism)을 기반으로 입력열에 대응되는 위치를 결과 리스트로 출력하는 모델이다. 포인터 네트워크를 수행할 때 입력열의 크기를 N이라고 하면, 각 입력에 대한 어텐션(attention)을 계산하기 때문에 시간복잡도는 $O(N^2)$이 되어 디코딩 시간이 길어진다. 이에 따라, 본 논문에서는 포인터 네트워크의 디코딩 시간을 줄이기 위하여 디코딩 시에 필요한 입력 정보만을 확인하는 스킵 포인팅 모델 기반 포인터 네트워크를 제안한다. 본 논문에서 제안한 방법을 이용하여 대명사 상호참조해결에 대한 실험을 수행한 결과, 일반 포인터 네트워크에 비하여 문장당 처리 시간이 약 1.15배 빠른 속도와, MUC F1 값이 약 2.17% 향상된 83.60%의 성능을 보였다.