• Title/Summary/Keyword: 언어 분석

Search Result 4,670, Processing Time 0.026 seconds

A Study of Pre-trained Language Models for Korean Language Generation (한국어 자연어생성에 적합한 사전훈련 언어모델 특성 연구)

  • Song, Minchae;Shin, Kyung-shik
    • Journal of Intelligence and Information Systems
    • /
    • v.28 no.4
    • /
    • pp.309-328
    • /
    • 2022
  • This study empirically analyzed a Korean pre-trained language models (PLMs) designed for natural language generation. The performance of two PLMs - BART and GPT - at the task of abstractive text summarization was compared. To investigate how performance depends on the characteristics of the inference data, ten different document types, containing six types of informational content and creation content, were considered. It was found that BART (which can both generate and understand natural language) performed better than GPT (which can only generate). Upon more detailed examination of the effect of inference data characteristics, the performance of GPT was found to be proportional to the length of the input text. However, even for the longest documents (with optimal GPT performance), BART still out-performed GPT, suggesting that the greatest influence on downstream performance is not the size of the training data or PLMs parameters but the structural suitability of the PLMs for the applied downstream task. The performance of different PLMs was also compared through analyzing parts of speech (POS) shares. BART's performance was inversely related to the proportion of prefixes, adjectives, adverbs and verbs but positively related to that of nouns. This result emphasizes the importance of taking the inference data's characteristics into account when fine-tuning a PLMs for its intended downstream task.

An Analysis of Cultural Policy-related Studies' Trend in Korea using Semantic Network Analysis(2008-2017) (언어네트워크분석을 통한 국내 문화정책 연구동향 분석(2008-2017))

  • Park, Yang Woo
    • The Journal of the Korea Contents Association
    • /
    • v.17 no.11
    • /
    • pp.371-382
    • /
    • 2017
  • This study aims to analyze the research trend of cultural policy-related papers based on 832 key words among 186 whole articles in the Journal of Cultural Policy by the Korea Culture & Tourism Institute from October 2008 to January 2017. The analysis was performed using a big data analysis technique called the Semantic Network Analysis. The Semantic Network Analysis consists of frequency analysis, density analysis, centrality analysis including degree centrality, betweenness centrality, and eigenvector centrality. Lastly, the study shows a figure visualizing the results of the centrality analysis through Netdraw program. The most frequently exposed key words were 'culture', 'cultural policy/administration', 'cultural industry/cultural content', 'policy', 'creative industry', in the order. The key word 'culture' was ranked as the first in all the analysis of degree centrality, betweenness centrality and eigenvector centrality, followed by 'policy' and 'cultural policy/administraion'. The key word 'cultural industry/cultural content' with very high frequency recorded high points in degree centrality and eigenvector centrality, but showed relatively low points in betweenness centrality.

Applying Universal Dependency Relation Tagsets to Korean (Universal Dependency 관계 태그셋의 한국어 적용)

  • Lee, Chanyoung;Kim, Jinung;Kim, Han Saem
    • Annual Conference on Human and Language Technology
    • /
    • 2018.10a
    • /
    • pp.334-339
    • /
    • 2018
  • 본 논문에서는 기존에 구축되어 있는 구 구조 기반 구문 분석 태그셋을 Universal Dependency 관계 태그 셋으로 변환하는 방안에 대해 논의하였다. 범언어적으로 활용하기 위해 개발된 Universal Dependency의 관계 태그셋을 한국어에 적용할 때에는 범용 POS 태그셋인 UPOS뿐만 아니라 개별 언어의 특성을 반영하고 있는 XPOS를 반드시 참고해야만 한다. 본 연구에서는 Universal Dependency 관계 태그셋을 한국어 구문 분석 태그셋에 대응시키는 과정에서 생기는 문제점들을 '원시 말뭉치 처리 문제'와 '기구축 구문 태그 말뭉치 오류의 문제'로 나누어 지적하고, 이에 대한 해결책을 제시하였다.

  • PDF

요구사항 분류 언어를 통한 반 자동 품질 요구사항 분류

  • Park, Su-Yong;Min, Seong-Gi;Choe, Sun-Hwang
    • 시스템엔지니어링워크숍
    • /
    • s.1
    • /
    • pp.127-133
    • /
    • 2003
  • 시나리오 형태의 요구사항 분류는 ATAM, SAAM, Software Quality Metric 과 같은 품질 요구사항 분석 및 평가 방법 등 많은 분야에 응용된다. 이들 기법들은 소프트웨어 시스템의 품질 요구사항을 분석, 평가하기에 앞서 초기 수집된 요구사항들을 분류하게 된다. 그러나 요구사항을 분류하는 일은 수작업을 통해 이루어지게 되고, 따라서 미 분류, 중복분류, 등의 결함을 가질 수 있다. 결함의 가능성을 요구사항의 수가 많은 대형 프로젝트 일수록 높아지게 된다. 따라서 본 논문에서는 요구사항 분류언어를 통한 품질 요구사항 자동 분류 기법을 제안한다. 제안된 기법은 분류언어와 유사도를 이용한 2 단계 분류기법을 이용하였다. 분류언어는 각 도메인별로 개발되어 비슷한 도메인일 경우 재사용될 수 있다. 이를 검증하기 위해, 본 논문에서는 15 여개의 프로젝트로부터 수집된 요구사항을 이용해 실험을 수행하고 그 결과를 분석, 평가 하였다.

  • PDF

The Development of the Checklists for Students' Interaction with Others in Learning Mathematics (수학 학습에서 학생의 상호작용 분석을 위한 도구 개발)

  • Koh Sang Sook;Koh Ho Kyung
    • Journal of Educational Research in Mathematics
    • /
    • v.12 no.4
    • /
    • pp.443-455
    • /
    • 2002
  • 정보화시대를 맞아 어느 때보다도 활발히 전교과에 걸쳐 학생의 의사소통의 능력을 향상하기 위한 다양한 방법이 모색되고 있다. 학교현장의 수학교육자는 수학교수-학습에서 어떤 상호작용이 일어났는지, 특히 다루기 쉬운 도구로써 계산기가 주어졌을 때 어떻게 학생의 지식 발달이 언어적 상호작용에서 이루어지는지를 알아야 한다. 본 연구는 이러한 학생의 상호작용을 분석할 때 필요한 분석도구를 개발하는 것이다. 예비연구와 본 연구를 통해 언어적 상호작용의 구성요소가 세 영역, 즉, 지식구성 진술, 사회적 상호작용 진술, 그리고 교사의 교육어 진술에서 개발되었다. 본 연구에서 개발한 자료를 이용하여 특히 학생의 지식 구성 발달에 따른 상호작용의 구성요소의 특징을 파악하고 이에 필요한 언어적 상호작용의 역할과 활성화 방안을 모색하는 연구가 가능하다.

  • PDF

Manual Revision of Penn Korean Universal Dependency Treebank (Penn Korean Universal Dependency Treebank 데이터셋 구축)

  • Oh, Taehwan;Han, Jiyoon;Kim, Hansaem
    • Annual Conference on Human and Language Technology
    • /
    • 2021.10a
    • /
    • pp.61-65
    • /
    • 2021
  • 본 연구에서는 2018년에 공개된 Penn Korean Universal Dependency Treebank(이하 PKT-UD v2018) 데이터의 오류를 분석하고 이를 개정하여 새롭게 데이터셋(이하 PKT-UD v2020)을 구축하였다. PKT-UD v2018은 구구조 분석 방식으로 구축된 Penn Korean Treebank를 UD(Universal Dependencies)의 체계에 맞추어 자동적으로 변환한 후 보정하여 구축한 데이터이다. 본 연구에서는 이와 같은 자동 변환의 과정에서 발생한 오류를 바로 잡고, UD 체계를 최대한 활용하면서 한국어의 특성을 잘 살린 데이터셋을 구축할 수 있는 방법을 제안하였다.

  • PDF

Con-Talky: Information Extraction and Visualization Platform for Communication of Construction Industry (Con-Talky: 건설 분야 전문가의 의사소통을 위한 정보 추출 및 시각화 플랫폼)

  • Shim, Midan;Park, Chanjun;Hur, Yuna;Lim, Heuiseok
    • Annual Conference on Human and Language Technology
    • /
    • 2021.10a
    • /
    • pp.476-481
    • /
    • 2021
  • 본 논문은 용어의 비통일성과 문서의 다양성으로 인해 발생하는 건설분야 전문가들의 의사소통 문제를 해결하기 위한 Con-Talky를 제안한다. Con-Talky는 자연언어처리의 대표적인 기술인 형태소분석, 의존구문분석, 의미역 결정 기술을 융합하여 건설분야의 "설계기준문서"를 시각화하고 핵심 정보추출을 자동으로 해주는 플랫폼이다. 해당 플랫폼을 이용하여 토목분야 전문가들의 의사소통 문제를 완화시킬 수 있으며 용어의 비통일성 및 표준화에도 기여할 수 있다. 또한 본 논문은 국내 건설 및 토목분야에 최초로 자연언어처리 기술을 적용한 논문이다. 해당 분야의 연구를 활성화 하기 위해 건설분야에 특화된 단일 말뭉치와 트리플 데이터를 자체 제작함과 동시에 전면 공개하였다.

  • PDF

Malicious Script Detection By Static Analysis (정적 분석 기법을 이용한 악성 스크립트 탐지)

  • 배병우;이성욱;조은선;홍만표
    • Proceedings of the Korea Institutes of Information Security and Cryptology Conference
    • /
    • 2001.11a
    • /
    • pp.91-95
    • /
    • 2001
  • 본 논문은 현재 컴퓨터 사용자들에게 많은 피해를 입히고 있는 악성 스크립트 코드에 대한 탐지기법을 제시하고자 한다. 스크립트 언어는 타 언어에 비해서 단순하며, 상위 수준의 언어로 작성된 소스를 직접 분석가능하기 때문에 기존의 이진 파일 형태의 바이러스 비해 정적 분석 기법 적용이 용이하다. 제안하는 탐지 기법은 기존의 스코어링 방식을 기반으로 한 패턴 매칭과는 달리 스크립트가 수행하는 악성 행위의 분석을 통해 행위 패턴을 생성하고, 이 패턴들을 정적 분석 기법을 통해 패턴간의 관계 분석을 통해 보다 확실한 악성 행위를 탐지하여 스크립트에 포함된 악성행위들을 보고한다. 기존 대부분의 바이러스 탐지 도구들은 이미 알려진 바이러스들만을 탐지 할 수 있다. 정적 분석 기법을 이용한 악성 스크립트 탐지 방법은 악성 행위 별 패턴 존재 여부를 판단하므로 이미 알려진 바이러스는 물론 알려지지 않은 바이러스를 탐지 할 수 있는 방안을 제시한다.

  • PDF

Principles, methods, and some problems in compiling a Korean treebank (구문 분석 말뭉치 구축을 위한 분석의 원칙, 방법, 문제)

  • Kim, Ui-Su;Kang, Beom-Mo
    • Annual Conference on Human and Language Technology
    • /
    • 2002.10e
    • /
    • pp.155-162
    • /
    • 2002
  • 본고는 21세기 세종계획의 일환으로 현재 구축 중인 구문 분석 말뭉치의 분석 방안에 대한 연구이다 논의하고자 하는 내용은 첫째, 구문 분석에서의 기본 원칙과 표지의 종류 및 세부 원칙에 대한 것이다. 둘째, 이러한 구문 분석 방안을 마련하는 데 있어 심각하게 고려된 몇 가지 유형의 문제들에 관한 논의이다. 특히 이 문제들은 자연언어처리에서뿐만 아니라 이론적인 국어학의 연구에서도 매우 중요하다. 화자의 직관에 의해서라기보다는 실제 말뭉치 구축 작업을 통해서 그 실체가 확연하게 드러나는 문제들이라는 점에서 이들은 우리의 관심을 끌기에 충분하다. 본고에서는 이러한 문제들이 실제 구문 분석에서 어떻게 발생하고 어떻게 해결될 수 있는지를 보일 것이다.

  • PDF

Enhancement Method of the Procedural Thinking Ability through Universal Programming Language Utilizing Entry (엔트리를 이용한 보편적 프로그래밍 언어 개발로 절차적 사고력 향상 방안)

  • Kim, Dong-Man;Lee, Tae-Wuk
    • Proceedings of The KACE
    • /
    • 2017.08a
    • /
    • pp.131-134
    • /
    • 2017
  • 이 연구에서 엔트리 명령 블록을 이용하여 보편적 프로그래밍 언어를 개발하고 검증하였다. 그래서 이 연구를 통해 블록형 프로그래밍 언어의 접근 수월성을 이용하여 절차적 사고력 향상을 위한 아이디어를 제공하고자 하였다. 새로운 프로그래밍 언어를 만들어 알고리즘을 적용하여 함수화된 사칙연산 프로그램을 만들면서, 다양한 알고리즘을 적용하면 엔트리에서 제시하는 모든 명령 블록을 만들 수 있음을 증명하였다. 이 연구를 통해 1)프로그래밍 언어에 포함된 다양한 기능의 명령어들도 함수화되어 있음을 증명하고 재생산 가능함을 경험할 수 있는 아이디어를 제공하고, 2)초보 프로그래머들이 프로그래밍 언어 개발에 대한 흥미와 관심을 갖게 되는 방안을 제시하며, 3)알고리즘을 경험하면서 절차적 사고력을 향상시킬 수 있는 다른 방향의 SW 교수 학습 방법과, 4)프로그래밍 언어를 미시적으로 탐구하면서 SW 교육 관점을 다양화하는 방법을 제시하였다. 이 연구에서 제시한 방안으로 학생들이 절차적 사고력 향상과 프로그래밍 언어의 다양성 인식, 프로그램을 심층적으로 분석하는 태도 등의 SW 교육에 대한 긍정적 변화를 기대한다.

  • PDF