• 제목/요약/키워드: content-based summary

검색결과 77건 처리시간 0.026초

다중레벨 벡터양자화 기반의 유사도를 이용한 자동 음악요약 (Automatic Music Summarization Using Similarity Measure Based on Multi-Level Vector Quantization)

  • 김성탁;김상호;김회린
    • The Journal of the Acoustical Society of Korea
    • /
    • 제26권2E호
    • /
    • pp.39-43
    • /
    • 2007
  • Music summarization refers to a technique which automatically extracts the most important and representative segments in music content. In this paper, we propose and evaluate a technique which provides the repeated part in music content as music summary. For extracting a repeated segment in music content, the proposed algorithm uses the weighted sum of similarity measures based on multi-level vector quantization for fixed-length summary or optimal-length summary. For similarity measures, count-based similarity measure and distance-based similarity measure are proposed. The number of the same codeword and the Mahalanobis distance of features which have same codeword at the same position in segments are used for count-based and distance-based similarity measure, respectively. Fixed-length music summary is evaluated by measuring the overlapping ratio between hand-made repeated parts and automatically generated ones. Optimal-length music summary is evaluated by calculating how much automatically generated music summary includes repeated parts of the music content. From experiments we observed that optimal-length summary could capture the repeated parts in music content more effectively in terms of summary length than fixed-length summary.

다중 비주얼 특징을 이용한 어학 교육 비디오의 자동 요약 방법 (Automatic Summary Method of Linguistic Educational Video Using Multiple Visual Features)

  • 한희준;김천석;추진호;노용만
    • 한국멀티미디어학회논문지
    • /
    • 제7권10호
    • /
    • pp.1452-1463
    • /
    • 2004
  • 양방향 방송 서비스로의 전환을 맞아 다양한 사용자 요구 및 기호에 적합한 컨텐츠를 제공하고, 증가하는 방송 컨텐츠를 효율적으로 관리, 이용하기 위해 비디오의 자동 에 대한 요구가 증가하고 있다. 본 논문에서는 내용 구성이 잘 갖추어진 어학 교육 비디오의 자동 에 대한 방법을 제안한다. 내용 기반을 자동으로 생성하기 위해 먼저 디지털 비디오로부터 샷 경계를 검출한 후, 각 샷을 대표하는 키프레임으로부터 비주얼 특징들을 추출한다. 그리고 추출된 다중 비주얼 특징을 이용해 어학 교육 비디오의 세분화된 내용 정보를 결정한다. 마지막으로, 결정된 내용 정보를 기술하는 요약문을 MPEG-7 MDS(Multimedia Description cheme)에 정의된 계층적 (Hierarchical Summary) 구조에 맞추어 XML 문서로 생성한다. 외국어 회화 비디오에 대해 실험하여 제안한 자동 방법의 효율성을 검증하였으며, 제안한 방법이 교육 방송용 컨텐츠의 다양한 서비스 제공 및 관리를 위한 비디오 요약 시스템에 효율적으로 적용 가능함을 확인하였다.

  • PDF

An Efficient Machine Learning-based Text Summarization in the Malayalam Language

  • P Haroon, Rosna;Gafur M, Abdul;Nisha U, Barakkath
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제16권6호
    • /
    • pp.1778-1799
    • /
    • 2022
  • Automatic text summarization is a procedure that packs enormous content into a more limited book that incorporates significant data. Malayalam is one of the toughest languages utilized in certain areas of India, most normally in Kerala and in Lakshadweep. Natural language processing in the Malayalam language is relatively low due to the complexity of the language as well as the scarcity of available resources. In this paper, a way is proposed to deal with the text summarization process in Malayalam documents by training a model based on the Support Vector Machine classification algorithm. Different features of the text are taken into account for training the machine so that the system can output the most important data from the input text. The classifier can classify the most important, important, average, and least significant sentences into separate classes and based on this, the machine will be able to create a summary of the input document. The user can select a compression ratio so that the system will output that much fraction of the summary. The model performance is measured by using different genres of Malayalam documents as well as documents from the same domain. The model is evaluated by considering content evaluation measures precision, recall, F score, and relative utility. Obtained precision and recall value shows that the model is trustable and found to be more relevant compared to the other summarizers.

국가R&D과제정보 요약을 위한 한국어 정보요약 시스템 (Korean Information Summary System for National R&D Projcet Information Summary)

  • 이종원;김태현;신동구;조우승
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2022년도 추계학술대회
    • /
    • pp.72-74
    • /
    • 2022
  • 국가과학기술지식정보서비스(이하 NTIS)에서는 국가R&D과제정보를 제공하고 있다. 과제정보는 '과제명', '과제수행기관', '연구책임자명' 등의 메타정보와 '연구목표', '연구내용', '기대효과'와 같은 과제를 설명하는 텍스트들로 구성되어있다. 과제정보 100만건을 대상으로 검색한 결과목록에서 '연구목표' 나 '연구내용' 등을 모두 확인하여 원하는 과제정보를 찾기 위해서는 많은 시간이 필요하다는 문제가 있다. 이러한 문제점을 해소하기 위해, 본 논문에서는 국가R&D 과제정보 내에서 장문의 텍스트로 구성된 부분을 요약하는 과제정보 요약 시스템을 제안하고자 한다. 한국어의 언어학적 특징을 분석하여 전처리기를 구축하고 전처리된 텍스트 정보를 처리하기 위한 자연어 처리 기술 기반 과제정보 요약 모델을 개발하였다. 이를 통해 장문으로 구성된 과제정보를 압축 및 요약된 형태로 제공하여, 이용자들이 요약정보만으로도 전반적인 내용을 쉽고 빠르게 유추하는 데 도움이 될 것이다.

  • PDF

효율적인 비디오 브라우징을 위한 동적 요약 및 요약 기술구조 (Dynamic Summarization and Summary Description Scheme for Efficient Video Browsing)

  • 김재곤;장현성;김문철;김진웅;김형명
    • 방송공학회논문지
    • /
    • 제5권1호
    • /
    • pp.82-93
    • /
    • 2000
  • 최근 디지털 비디오 데이터가 급격히 증가하고 대중화됨에 따라 이를 활용하기 위한 효율적인 접근 기법이 절실히 요구되고 있다. 비디오 요약(video summarization) 기법은 의미적으로 중요한 요점만으로 전체 비디오를 표현하는 것으로 비디오 내용에 대한 전반적인 개관(overview)을 제공할 뿐만 아니라 브라우징(browsing) 등의 유용한 접근 기능을 제공한다. 본 논문에서는 의미적으로 중요한 내용을 포함하는 비디오 주요구간(highlight segment) 검출을 통한 새로운 동적 요약(dynamic summarization) 기법과 생성된 요약 정보 표현을 위하여 MPEG-7에 제안한 요약 기술구조(DS : Description Scheme)에 대하여 기술한다. 본 논문의 기술구조는 다중 계층의 하이라이트(highlight), 계층적 브라우징, 사용자 주문형 요약 등의 기능을 통하여 비디오의 개관 및 효율적인 브라우징, 네비게이션(navigation)을 가능하게 한다. 또한, 제안하는 비디오 요약 기법 및 요약 기술구조의 실현 가능성 및 기능 구현을 확인하기 위하여 축구 비디오에 대한 적용 실례를 제시한다.

  • PDF

Implementation of TV-Anytime Compliant STB for Personalized TV Services

  • Lee Hee Kyung;Yang Seung Jun;Kim Jae Gon;Hong Jin Woo
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2004년도 학술대회지
    • /
    • pp.576-580
    • /
    • 2004
  • In this paper, we present a design and implementation of a TV-Anytime compliant STB to provide personalized content consumption according to user preferences and various terminal/network conditions. This paper mainly details with a metadata engine which consists of meta data de-multiplexing, metadata decoding, and metadata-based content browsing. For personalized content consumption, the proposed metadata engine provides the following key functionalities: advanced EPG, non-linear segment navigation wirh Tables-of-Content and/or event-based summary, automatic recommendation of user-preferred programs, and etc. The implemented STB employing the metadata engine is successfully tested with a set of service scenarios in an end-to-end broadcasting test-bed.

  • PDF

음악요약 생성에 관한 연구 (A Study on Music Summarization)

  • 김성탁;김상호;김회린;최지훈;이한규;홍진우
    • 방송공학회논문지
    • /
    • 제11권1호
    • /
    • pp.3-14
    • /
    • 2006
  • 음악요약이란 주어진 음악 컨텐츠에서 가장 중요하고 특징적인 한 부분이나 여러 부분들을 제공하는 것을 말한다. 음악요약 기술에는 크게 두 가지 종류의 음악요약을 위한 기술들이 연구되고 있다. 음악 컨텐츠 내에서 반복되는 구간을 음악요약으로 제공하는 기술과 특정이 다른 부분들의 일정구간을 모두 제공하는 기술이 있다. 본 논문에서는 두 가지 종류의 음악요약을 제공하는 알고리즘들을 제안하고 평가하였다. 반복되는 구간을 음악요약으로 제공하는 다중 레벨 벡터양자화를 이용한 알고리즘은 고정된 길이와 최적의 길이를 가지는 음악요약을 제공하는 알고리즘들을 객관적인 방법으로 성능을 평가하였고, 음악 내에서 특정이 다른 부분들을 일정부분씩 취합하여 제공하는 2-D 유사도 행렬과 k-mean 알고리즘을 이용하는 집단화 방법을 이용한 방법의 평가는 주관적인 평가인 MOS 테스트로 평가하였다. 다중 레벨 벡터양자화를 이용한 음악요약을 제공하는 알고리즘에서 고정된 길이의 음악요약을 제공하는 알고리즘은 사람이 직접 요약한 결과와 제안한 방법으로 구한 요약과의 중첩도 (Overlapping Ratio)를 이용한 결과 기존의 방법들이 42.2% 와 47.3% 임에 비해 제안된 방법은 67.1%로 높은 성능을 보여주었고, 최적의 길이를 가지는 음악요약을 제공하는 알고리즘은 음악에 따라 다른 길이를 가지는 반복되는 부분의 포함 정도를 나타내는 최적 중첩비율 (Optimal Overlapping Ratio) 을 측정한 결과 고정된 길이를 가지는 음악요약 보다 최적의 길이로 음악마다 다른 길이 의 반복되는 부분을 효과적으로 표현함을 알 수 있었다. 집단화 방법을 이용한 알고리즘은 두 가지 질문들 (제공된 세그먼트들 중 특정이 비슷한 것의 개수, 제공된 세그먼트들 중 같은 구조에 속하는 것의 개수)을 이용한 MOS 테스트에서 우수한 결과를 보여주었다. 환자에서 완전관해를 보였고, 원격전이와 국소재발이 각각 2명과 1명에서 관찰되었다. 결론: SMART를 사용한 IMRT를 도입하여 임상적으로나 선량측정상 이하선의 기능 보존이 가능하였으며, 또한 생물학적으로 더욱 효과적일 것으로 생각되었다 향후 정확한 종양억제 효과와 만기 독성을 알기 위해서는 추가적인 연구대상과 추적관찰이 필요하다고 생각한다.ty modulated radiation therapy, IMRT)를 이용한 최근의 결과와 비교하여 CK를 이용한 정위 방사선 치료는 생존율 측면에서 비슷하거나 나은 결과를 보였다. 또한 심각한 부작용은 관찰되지 않았으며 짧은 기간의 치료로 환자에게 편의를 제공할 수 있어 결과적으로 삶의 질을 향상시킬 수 있을 것이다. 따라서, 이 새로운 치료 방법은 국소 진행된, 절제 불가능한 췌장암 환자에서 심각한 부작용 없는 효과적인 치료가 될 것으로 생각된다. 또한 계획용 표적 체적은 CK 치료의 유용한 예후 인자로 사용될 것이다.인위적 활동에 의한 부분이 높은 것으로 추정되었다.가>에는 이 시교의 외면적인 따스함과 내면적인 정(情)과 성(性)의 부드러움이 적고. 그 반대로 풍간하여 지절사정(指切事情)함이 강하였던 모양이다. 풍간하여 사정(事情)을 매몰차게 지적하여 논평하였음을 퇴계는 '완세불공(玩迷不恭)'이라고 판단했을 것이다. 장육당은 청(淸)과 탁(濁)이 있음을 알지 못하고. 그것의 분별도 하지 못하는 세상 사람들을 완농(玩弄)하였다. 그러므로 그는 진환(塵 )에서 초연(超然)했던 것이다. 천석고황(泉石膏 )으로 태평성대(太平聖代)에 사시가흥(四時佳興)을 한가지로 하는 퇴계와는 그래서 다르다. 퇴계는 순풍(淳風)과 어진 인성(人性)을 긍정하였기에 만족하고. '고인(古人)의 녀던 길'을 끊임없이 행(行)하고자 하였다. 여기에서 '완세불공(玩世不恭)'과 '온유돈후(溫柔敦厚)'가 판별되어진다.

오류 유형에 따른 생성요약 모델의 본문-요약문 간 요약 성능평가 비교 (Empirical Study for Automatic Evaluation of Abstractive Summarization by Error-Types)

  • 이승수;강상우
    • 인지과학
    • /
    • 제34권3호
    • /
    • pp.197-226
    • /
    • 2023
  • 텍스트 생성요약은 자연어처리의 과업 중 하나로 긴 텍스트의 내용을 보존하면서 짧게 축약된 요약문을 생성한다. 생성요약 과업의 특성 상 본문의 핵심내용을 요약문에서 보존하는 것은 매우 중요하다. 기존의 생성요약 방법론은 정답요약과의 어휘 중첩도(Lexical-Overlap)를 기반으로 본문의 내용과 유창성을 측정했다. ROUGE는 생성요약 요약모델의 평가지표로 많이 사용하는 어휘 중첩도 기반의 평가지표이다. 생성요약 벤치마크에서 ROUGE가 49점대로 매우 높은 성능을 보임에도 불구하고, 생성한 요약문과 본문의 내용이 불일치하는 경우가 30% 가량 존재한다. 본 연구에서는 정답요약의 도움 없이 본문만을 활용해 생성요약 모델의 성능을 평가하는 방법론을 제안한다. 본 연구에서 제안한 평가점수를 AggreFACT의 라벨과 상관도 분석결과, 다음의 두 가지 경우 가장 높은 상관관계를 보였다. 첫 번째는 Transformer 구조의 인코더-디코더 구조에 대규모 사전학습을 진행한 BART와 PEGASUS 등을 생성요약 모델의 베이스라인으로 사용한 경우이고, 두 번째는 요약문 전체에 걸쳐 오류가 발생한 경우이다.

Application of Topic Modeling Techniques in Arabic Content: A Systematic Review

  • Maram Alhmiyani;Huda Alhazmi
    • International Journal of Computer Science & Network Security
    • /
    • 제23권6호
    • /
    • pp.1-12
    • /
    • 2023
  • With the rapid increase of user generated data on digital platforms, the task of categorizing and classifying theses huge data has become difficult. Topic modeling is an unsupervised machine learning technique that can be used to get a summary from a large collection of documents. Topic modeling has been widely used in English content, yet the application of topic modeling in Arabic language is limited. Therefore, the aim of this paper is to provide a systematic review of the application of topic modeling algorithms in Arabic content. Using a well-known and trusted databases including ScienceDirect, IEEE Xplore, Springer Link, and Google Scholar. Considering the publication date from 2012 to 2022, we got 60 papers. After refining the papers based on predefined criteria, we resulted in 32 papers. Our result show that unfortunately the application of topic modeling techniques in Arabic content is limited.

완전성과 간결성을 고려한 텍스트 요약 품질의 자동 평가 기법 (Automatic Quality Evaluation with Completeness and Succinctness for Text Summarization)

  • 고은정;김남규
    • 지능정보연구
    • /
    • 제24권2호
    • /
    • pp.125-148
    • /
    • 2018
  • 다양한 스마트 기기 및 관련 서비스의 증가에 따라 텍스트 데이터가 폭발적으로 증가하고 있으며, 이로 인해 방대한 문서로부터 필요한 정보만을 추려내는 작업은 더욱 어려워졌다. 따라서 텍스트 데이터로부터 핵심 내용을 자동으로 요약하여 제공할 수 있는 텍스트 자동 요약 기술이 최근 더욱 주목을 받고 있다. 텍스트 요약 기술은 뉴스 요약 서비스, 개인정보 약관 요약 서비스 등을 통해 현업에서도 이미 활발하게 적용되고 있으며, 학계에서도 문서의 주요 요소를 선별하여 제공하는 추출(Extraction) 접근법과 문서의 요소를 발췌한 뒤 이를 조합하여 새로운 문장을 구성하는 생성(Abstraction) 접근법에 따라 많은 연구가 이루어지고 있다. 하지만 문서의 자동 요약 기술에 비해, 자동으로 요약된 문서의 품질을 평가하는 기술은 상대적으로 많은 진전을 이루지 못하였다. 요약문의 품질 평가를 다룬 기존의 대부분의 연구들은 사람이 수작업으로 요약문을 작성하여 이를 기준 문서(Reference Document)로 삼고, 자동 요약문과 기준 문서와의 유사도를 측정하는 방식으로 수행되었다. 하지만 이러한 방식은 기준 문서의 작성 과정에 막대한 시간과 비용이 소요될 뿐 아니라 요약자의 주관에 의해 평가 결과가 다르게 나타날 수 있다는 한계를 갖는다. 한편 이러한 한계를 극복하기 위한 연구도 일부 수행되었는데, 대표적으로 전문에 대해 차원 축소를 수행하고 이렇게 축소된 전문과 자동 요약문의 유사도를 측정하는 기법이 최근 고안된 바 있다. 이 방식은 원문에서 출현 빈도가 높은 어휘가 요약문에 많이 나타날수록 해당 요약문의 품질이 우수한 것으로 평가하게 된다. 하지만 요약이란 본질적으로 많은 내용을 줄여서 표현하면서도 내용의 누락을 최소화하는 것을 의미하므로, 단순히 빈도수에 기반한 "좋은 요약"이 항상 본질적 의미에서의 "좋은 요약"을 의미한다고 보는 것은 무리가 있다. 요약문 품질 평가의 이러한 기존 연구의 한계를 극복하기 위해, 본 연구에서는 요약의 본질에 기반한 자동 품질 평가 방안을 제안한다. 구체적으로 요약문의 문장 중 서로 중복되는 내용이 얼마나 적은지를 나타내는 요소로 간결성(Succinctness) 개념을 정의하고, 원문의 내용 중 요약문에 포함되지 않은 내용이 얼마나 적은지를 나타내는 요소로 완전성(Completeness)을 정의한다. 본 연구에서는 간결성과 완전성의 개념을 적용한 요약문 품질 자동 평가 방법론을 제안하고, 이를 TripAdvisor 사이트 호텔 리뷰의 요약 및 평가에 적용한 실험 결과를 소개한다.