• Title/Summary/Keyword: 문단

Search Result 130, Processing Time 0.026 seconds

SERADE: Section Representation Aggregation Retrieval for Long Document Ranking (SERADE : 섹션 표현 기반 문서 임베딩 모델을 활용한 긴 문서 검색 성능 개선)

  • Hye-In Jung;Hyun-Kyu Jeon;Ji-Yoon Kim;Chan-Hyeong Lee;Bong-Su Kim
    • Annual Conference on Human and Language Technology
    • /
    • 2022.10a
    • /
    • pp.135-140
    • /
    • 2022
  • 최근 Document Retrieval을 비롯한 대부분의 자연어처리 분야에서는 BERT와 같이 self-attention을 기반으로 한 사전훈련 모델을 활용하여 SOTA(state-of-the-art)를 이루고 있다. 그러나 self-attention 메커니즘은 입력 텍스트 길이의 제곱에 비례하여 계산 복잡도가 증가하기 때문에, 해당 모델들은 선천적으로 입력 텍스트의 길이가 제한되는 한계점을 지닌다. Document Retrieval 분야에서는, 문서를 특정 토큰 길이 단위의 문단으로 나누어 각 문단의 유사 점수 또는 표현 벡터를 추출한 후 집계함으로서 길이 제한 문제를 해결하는 방법론이 하나의 주류를 이루고 있다. 그러나 논문, 특허와 같이 섹션 형식(초록, 결론 등)을 갖는 문서의 경우, 섹션 유형에 따라 고유한 정보 특성을 지닌다. 따라서 문서를 단순히 특정 길이의 문단으로 나누어 학습하는 PARADE와 같은 기존 방법론은 각 섹션이 지닌 특성을 반영하지 못한다는 한계점을 지닌다. 본 논문에서는 섹션 유형에 대한 정보를 포함하는 문단 표현을 학습한 후, 트랜스포머 인코더를 사용하여 집계함으로서, 결과적으로 섹션의 특징과 상호 정보를 학습할 수 있도록 하는 SERADE 모델을 제안하고자 한다. 실험 결과, PARADE-Transformer 모델과 비교하여 평균 3.8%의 성능 향상을 기록하였다.

  • PDF

XML Document Keyword Weight Analysis based Paragraph Extraction Model (XML 문서 키워드 가중치 분석 기반 문단 추출 모델)

  • Lee, Jongwon;Kang, Inshik;Jung, Hoekyung
    • Journal of the Korea Institute of Information and Communication Engineering
    • /
    • v.21 no.11
    • /
    • pp.2133-2138
    • /
    • 2017
  • The analysis of existing XML documents and other documents was centered on words. It can be implemented using a morpheme analyzer, but it can classify many words in the document and cannot grasp the core contents of the document. In order for a user to efficiently understand a document, a paragraph containing a main word must be extracted and presented to the user. The proposed system retrieves keyword in the normalized XML document. Then, the user extracts the paragraphs containing the keyword inputted for searching and displays them to the user. In addition, the frequency and weight of the keyword used in the search are informed to the user, and the order of the extracted paragraphs and the redundancy elimination function are minimized so that the user can understand the document. The proposed system can minimize the time and effort required to understand the document by allowing the user to understand the document without reading the whole document.

Reading Speed Comparison: Paragraphs in Digital and Print Media (디지털 매체와 인쇄 매체에서의 문단 읽기 속도 비교)

  • Ko Eun Lee
    • Korean Journal of Cognitive Science
    • /
    • v.34 no.4
    • /
    • pp.299-314
    • /
    • 2023
  • This study aimed to examine whether there are differences in reading performance between digital and print media by measuring reading speed of paragraphs on print materials and tablet PC. To investigate whether the physical characteristics of the media influence reading performance, the format of text was kept as similar as possible between print and digital media. We also compared conditions in which paragraphs consisted of either long or short sentences to explore if there were differential effects on reading performance based on sentence length across different media. Additionally, reading speed was analyzed based on reading span to investigate whether there were differences in reading performance according to participants' working memory capacity. As a result, reading speed was faster when reading print media compared to digital media. However, there was no difference in reading speed based on the length of sentences composing the paragraphs. Participants with a higher reading span exhibited faster reading speed compared to participants with a lower reading span. Moreover, participants with a higher reading span read paragraphs composed of long sentences faster on print media than on digital media. The findings of this study suggest that visual fatigue induced by tablet PCs and participants' working memory capacity may impact reading speed.

A Study on Classifying and Analyzing the News Form in the Web for Automatic Summarization (자동 요약을 위한 웹 기사들의 유형 구분과 주연문맥 추출에 관한 연구)

  • Lee Tae-Young
    • Proceedings of the Korean Society for Information Management Conference
    • /
    • 2006.08a
    • /
    • pp.169-174
    • /
    • 2006
  • 웹 상의 기사들의 종류를 보도, 기획/해설, 인터뷰/대담, 논설, 신변잡기로 나누어 자동요약을 위한 프레임을 작성하였다. 각 기사 프레임들은 글 구조적으로 분석되어 '사건, 상황, 연관, 과정, 원인, 결과, 결론, 전망, 방안, 평가 등'과 같은 문단 슬롯이 부여되었고 문단 슬롯은 다시 문장 슬롯으로 세분되었다. 'if-needed' 패싯으로 육하원칙인 '주체, 객체, 시간, 장소, 원인, 방법'을 택하였다. 슬롯이나 패싯의 실제값들을 추출 표현하는 과정에서 문구의 수사적 역할과 단어 최상위 범주 및 줄거리 단위를 참조하였다. 기사의 유형과 문단 및 문장 슬롯을 판별하기 위해서 유형 판별 규칙과 슬롯 판별 규칙을 구비하였다.

  • PDF

A Construction of Indexing System for Sentence Retrieval (문장 검색을 위한 색인시스템 구축 : 초 .중등 학생의 한국어 및 영어 문장을 중심으로)

  • 이태영
    • Journal of the Korean Society for information Management
    • /
    • v.20 no.1
    • /
    • pp.145-163
    • /
    • 2003
  • An indexing language were studied to construct the sentences and paragraphs providing system aided to write a Korean or English composition. The indexing language includes the index terms like noun, predicate, and adverb. and also various index symbols. The subject name and the keyword Included the symbols, which Indicate the connectives between clauses in a sentence, is used as the access point. The search results show this system will be effective with large database and developed retrieval methods.

Adversarial Examples for Robust Reading Comprehension (강건한 질의응답 모델을 위한 데이터셋 증강 기법)

  • Jang, Hansol;Jun, Changwook;Choi, Jooyoung;Sim, Myoseop;Kim, Hyun;Min, Kyungkoo
    • Annual Conference on Human and Language Technology
    • /
    • 2021.10a
    • /
    • pp.41-46
    • /
    • 2021
  • 기계 독해는 문단과 질문이 주어질 때에 정답을 맞추는 자연어처리의 연구분야다. 최근 기계 독해 모델이 사람보다 높은 성능을 보여주고 있지만, 문단과 질의가 크게 변하지 않더라도 예상과 다른 결과를 만들어 성능에 영향을 주기도 한다. 본 논문에서는 문단과 질문 두 가지 관점에서 적대적 예시 데이터를 사용하여 보다 강건한 질의응답 모델을 훈련하는 방식을 제안한다. 트랜스포머 인코더 모델을 활용하였으며, 데이터를 생성하기 위해서 KorQuAD 1.0 데이터셋에 적대적 예시를 추가하여 실험을 진행하였다. 적대적 예시를 이용한 데이터로 실험한 결과, 기존 모델보다 1% 가량 높은 성능을 보였다. 또한 질의의 적대적 예시 데이터를 활용하였을 때, 기존 KorQuAD 1.0 데이터에 대한 성능 향상을 확인하였다.

  • PDF

Wrapping Cloth with Cloud and Treasures Pattern Donated by the Head House of the Descendants of Lee Hangbok at the National Museum of Korea: Dating and Analysis of the Cloud and Treasures Pattern (국립중앙박물관 소장 이항복 종가 기증 운보문단 보자기 무늬의 특징과 연대추정)

  • Hwang, Jinyoung
    • Conservation Science in Museum
    • /
    • v.23
    • /
    • pp.49-60
    • /
    • 2020
  • The wrapping cloth with Cloud and Treasures Pattern donated by the head house of the descendants of Lee Hangbok (1556-1618) at the National Museum of Korea underwent conservation treatment for its protection and display. It was then compared with other ancient fabric objects for dating and analysis of the design. The subjects of Cloud and Treasures Patterns of clothing excavated from tombs dated to some point between the birth and death of Lee Hangbok and with Cloud and Treasures Patterns on the covers of Uigwe copies from the same period from the late 16th and 18th centuries were compared. The results of comparison with relics with clear dating are as follows: First, The Cloud and Treasures Patterns on the late 16th and 17th centuries the differences in the proportion between the head and the tail of the cloud among. Second, the Cloud and Treasures Patterns on the covers of Uigwe copies and fabrics excavated from tombs dated no later than the early 1700s share similarities with the Cloud and Treasures Pattern on the donated wrapping cloth in terms of the arrangement and size of designs and the proportion between each portion of the design. Though the study failed to identify the exact use of the wrapping cloth, it was estimated to be produced in early 18th century when the portraits of Lee Hangbok were copied.