• Title/Summary/Keyword: 자동 데이터 구축

Search Result 716, Processing Time 0.027 seconds

Building Sentiment-Annotated Datasets for Training a FbSA model based on the SSP methodology (반자동 언어데이터 증강 방식에 기반한 FbSA 모델 학습을 위한 감성주석 데이터셋 FeSAD 구축)

  • Yoon, Jeong-Woo;Hwang, Chang-Hoe;Choi, Su-Won;Nam, Jee-Sun
    • Annual Conference on Human and Language Technology
    • /
    • 2021.10a
    • /
    • pp.66-71
    • /
    • 2021
  • 본 연구는 한국어 자질 기반 감성분석(Feature-based Sentiment Analysis: FbSA)을 위한 대규모의 학습데이터 구축에 있어 반자동 언어데이터 증강 기법(SSP: Semi-automatic Symbolic Propagation)에 입각한 자질-감성 주석 데이터셋 FeSAD(Feature-Sentiment-Annotated Dataset)의 개발 과정과 성능 평가를 소개하는 것을 목표로 한다. FeSAD는 언어자원을 활용한 SSP 1단계 주석 이후, 작업자의 주석이 2단계에서 이루어지는 2-STEP 주석 과정을 통해 구축된다. SSP 주석을 위한 언어자원에는 부분 문법 그래프(Local Grammar Graph: LGG) 스키마와 한국어 기계가독형 전자사전 DECO(Dictionnaire Electronique du COréen)가 활용되며, 본 연구에서는 7개의 도메인(코스메틱, IT제품, 패션/의류, 푸드/배달음식, 가구/인테리어, 핀테크앱, KPOP)에 대해, 오피니언 트리플이 주석된 FeSAD 데이터셋을 구축하는 프로세싱을 소개하였다. 코스메틱(COS)과 푸드/배달음식(FOO) 두 도메인에 대해, 언어자원을 활용한 1단계 SSP 주석 성능을 평가한 결과, 각각 F1-score 0.93과 0.90의 성능을 보였으며, 이를 통해 FbSA용 학습데이터 주석을 위한 작업자의 작업이 기존 작업의 10% 이하의 비중으로 감소함으로써, 학습데이터 구축을 위한 프로세싱의 소요시간과 품질이 획기적으로 개선될 수 있음을 확인하였다.

  • PDF

Evaluation Category Selection For Automated Essay Evaluation of Korean Learner (한국어 학습자 작문 자동 평가를 위한 평가 항목 선정)

  • Kwak, Yong-Jin
    • Annual Conference on Human and Language Technology
    • /
    • 2017.10a
    • /
    • pp.270-271
    • /
    • 2017
  • 본 연구는 한국어 학습자 작문의 자동 평가 시스템 개발의 일환으로, 자동 평가 결과에 대한 설명과 근거가 될 수 있는 평기 기준 범주를 선정하기 위한 데이터 구축과 선정 방법을 제시한다. 작문의 평가 기준의 영역과 항목은 평가체계에 대한 이론적 연구에 따라 다양하다. 이러한 평가 기준은 자동 평가에서는 식별되기 어려운 경우도 있고, 각각의 평가 기준이 적용되는 작문 오류의 범위도 다양하다. 그러므로 본 연구에서는 자동 평가 기준 선정의 문제는 다양한 평가 기준에 중 하나를 선정하는 분류의 문제로 보고, 학습데이터를 구축, 기계학습을 통해 자동 작문 평가에 효과적인 평가 기준을 선정 가능성을 제시한다.

  • PDF

Semi-automatic Construction of Training Data using Active Learning (능동 학습을 이용한 학습 데이터 반자동 구축)

  • Lee, Chang-Ki;Hur, Jeong;Wang, Ji-Hyun;Lee, Chung-Hee;Oh, Hyo-Jung;Jang, Myung-Gil;Lee, Young-Jik
    • 한국HCI학회:학술대회논문집
    • /
    • 2006.02a
    • /
    • pp.1252-1255
    • /
    • 2006
  • 본 논문은 정보검색, 정보추출, 번역, 자연어처리 등의 작업을 위한 통계적 방법론에서 필요한 학습 데이터 구축을 효율적으로 하기 위한 학습 데이터 반자동 구축 장치 및 그 방법에 대하여 기술한다. 본 논문에서는 학습 데이터 구축양을 줄이기 위해서 능동 학습을 이용한다. 또한 최근 각광 받고 있는 Conditional Random Fields(CRF)를 능동학습에 이용하기 위해서 CRF를 이용한 Confidence measure를 정의한다.

  • PDF

HyperCLOVA for Data Generation of Korean Fact Verification (HyperCLOVA를 이용한 한국어 Fact 검증을 위한 자동 데이터 생성)

  • Lee, Jong-Hyeon;Na, Seung-Hoon;Shin, Dongwook;Kim, Seon-Hoon;Kang, Inho
    • Annual Conference on Human and Language Technology
    • /
    • 2021.10a
    • /
    • pp.118-123
    • /
    • 2021
  • 현대 사회에서 소셜 네트워킹 서비스의 증가와 확산은 많은 정보를 쉽고 빠르게 얻을 수 있도록 하였지만 허위·과장 정보의 확산이 큰 문제로 자리잡고 있다. 최근 해외에서는 이들을 자동으로 분류 및 판별하고자하는 Fact 검증 모델에 관한 연구 및 모델 학습을 위한 데이터의 제작 및 배포가 활발히 이루어지고 있다. 그러나 아직 국내에서는 한국어 Fact 검증을 위한 데이터가 많이 부족한 상황이기 때문에 본 논문에서는 최근 좋은 성능을 보이는 openai 의 GPT-3를 한국어 태스크에 적용시킨 HyperCLOVA 를 이용하여 한국어 Fact 검증 데이터 셋을 자동으로 구축하고 이를 최신 Fact 검증 모델들에 적용하였을 때의 성능을 측정 및 분석 하고자 하였다.

  • PDF

베이지안 망을 이용한 온톨로지의 구축에 관한 연구

  • Jang, Seong-Won;Lee, Geon-Chang
    • 한국경영정보학회:학술대회논문집
    • /
    • 2008.06a
    • /
    • pp.288-293
    • /
    • 2008
  • 의미적 지식기반인 온톨로지(ontology)에 대한 관심이 높아지고 있다. 온톨로지란 어휘나 개념의 정의 또는 명세로서, 인간과 컴퓨터의 의사소통 또는 지식의 표현과 저장, 활용 및 재사용을 위해 이용된다. 그러나 온톨로지를 구축하는 대부분의 방법은 체계적이거나 자동적이지 못하다. 도메인 전문가에 의존하는 전통적인 온톨로지 구축 방법은 시간과 비용이 많이 소요된다. 온톨로지 구축 툴은 많이 있지만 아직 인간의 노력을 필요로 한다. 또한 변화하는 도메인 지식을 온톨로지에 신속하게 반영하는 것은 어려운 일이다. 본 연구는 이러한 한계를 해결하기 위해, 도메인 전문가의 지식이나 경험을 최소화하면서 자동적으로 도메인 지식을 얻을 수 있는 방법을 제시하였다. 이 방법은, 데이터 기반의 도메인 지식을 대상으로, 베이지안 망(Bayesian network)이 갖고 있는 데이터 분석에서의 장점과 온톨로지와의 관련성을 이용하여 온톨로지를 자동적으로 구축하는 것이다. 평판(flat panel) TV 경기예측 사례를 통하여 온톨로지를 구축하는 과정을 알아보았다. 구축과정의 타당성을 확보하기 위하여 디스플레이 산업 전문가들과의 인터뷰를 통하여 온톨로지를 완성하고, 해당 온톨로지의 타당성 검증을 위하여 멤버체크를 한 결과 매우 높은 타당성을 얻을 수 있었다. 본 연구에서 제안하는 온톨로지는, 실제로 산업경기 예측을 계획하고 구축하며 미래 의사결정지원시스템을 설계하기 위한 주요 구성요인으로 제공될 수 있을 것이다.

  • PDF

An Exploratory Study on the Construction of Retrospective Authority Data with National Authorities (국가전거를 활용한 단위 도서관의 전거데이터 소급 구축 연구)

  • Jee-Hyun Rho
    • Journal of the Korean Society for Library and Information Science
    • /
    • v.57 no.1
    • /
    • pp.161-182
    • /
    • 2023
  • In the recent cataloging environment, the function of authority data is becoming more important. In Korea, a pilot project for sharing and joint use of the national authority data has been promoted since 2019, and a plan to automatically construct retrospective authority data using national authorities is in progress. This study aims to (1) analyze the results of the pilot project for retrospective authority data jointly promoted by the National Library of Korea and KERIS in 2019, (2) explore methodological limitations and problems in the process, and (3) derive policy proposals for constructing authority data more efficiently. To this end, a university library participating in the pilot project was investigated as a case study. Based on it, the automatic generation rate and accuracy of authority data, and errors and omissions cases and causes were analyzed in detail. As a results of the study, it was found that the quality of union catalogs and bibliographic records had a great influence on automatically constructing authority data, and supplementary methods were needed to minimize these limitations.

Methodology for Constructing Data for Automatic Generation of Emotional Copywrite (감성적 광고 카피 자동 생성을 위한 데이터 구축 방법론)

  • Jimin Seong;Haeun Shin;Jiyoon Kang
    • Annual Conference on Human and Language Technology
    • /
    • 2023.10a
    • /
    • pp.336-341
    • /
    • 2023
  • 초대규모 언어모델의 뛰어난 생성 기술이 실질적인 부분에서 많은 도움을 주고 있음에도 불구하고 사람들의 마음을 움직일 수 있는 매력적인 광고 카피를 생성하기에는 아쉬운 점이 많다. 이 연구는 효과적인 광고 카피 자동생성을 위한 데이터 구축 방법론 연구로, 데이터에 일관적으로 학습시킬 수 있는 감성적 카피의 문체적 특징을 프레임워크로 정의하고 이를 모델에 적용한 결과를 보여 데이터 설계 방법론의 유효성을 검증하고자 하였다. 실험 결과 문체 적합성 측면에서 성공적인 결과를 확인한 것에 비해, 한국어 보조사와 같이 미세한 어감 차이를 발생시키는 요소나 의미적 중의성 해석 등의 고차원적인 한국어 구사능력을 필요로 하는 부분에서 생성모델의 개선 여지를 발견할 수 있었다. 본 연구에서 보인 감성형 카피 생성을 위한 프레임워크는 마케팅 실무에서도 유용하게 사용될 수 있을 뿐만 아니라, 고객 세그멘테이션 분석이 이루어진다면 타깃 고객의 취향을 고려한 효과적이고 맞춤화된 광고 카피를 생성에 기여할 수 있을 것으로 기대된다.

  • PDF

Automatic Construction of Deep Learning Training Data for High-Definition Road Maps Using Mobile Mapping System (정밀도로지도 제작을 위한 모바일매핑시스템 기반 딥러닝 학습데이터의 자동 구축)

  • Choi, In Ha;Kim, Eui Myoung
    • Journal of the Korean Society of Surveying, Geodesy, Photogrammetry and Cartography
    • /
    • v.39 no.3
    • /
    • pp.133-139
    • /
    • 2021
  • Currently, the process of constructing a high-definition road map has a high proportion of manual labor, so there are limitations in construction time and cost. Research to automate map production with high-definition road maps using artificial intelligence is being actively conducted, but since the construction of training data for the map construction is also done manually, there is a need to automatically build training data. Therefore, in this study, after converting to images using point clouds acquired by a mobile mapping system, the road marking areas were extracted through image reclassification and overlap analysis using thresholds. Then, a methodology was proposed to automatically construct training data for deep learning data for the high-definition road map through the classification of the polygon types in the extracted regions. As a result of training 2,764 lane data constructed through the proposed methodology on a deep learning-based PointNet model, the training accuracy was 99.977%, and as a result of predicting the lanes of three color types using the trained model, the accuracy was 99.566%. Therefore, it was found that the methodology proposed in this study can efficiently produce training data for high-definition road maps, and it is believed that the map production process of road markings can also be automated.

Implementation of Automatic measurement system for a Change of channel etching thickness with a HTS Transistor (고온 초전도 트랜지스터의 채널 식각 두께에 따른 임계 특성 자동 측정장치 구축)

  • Hyun, Ong-Ok;Kang, Hyeong-Gon;Ko, Seok-Cheol;Han, Byoung-Sung
    • Proceedings of the Korean Institute of Electrical and Electronic Material Engineers Conference
    • /
    • 2003.07a
    • /
    • pp.561-564
    • /
    • 2003
  • 본 연구는 고온 초전도 자속 흐름 트랜지스터의 채널 식각 두께에 따른 임계 특성의 자동 측정을 위해 나노옴/마이크로 볼트 미터 와 전원공급기 등 측정에 필요한 장비들을 GPIB 인터페이스 보드를 통해 PC와 연결하여 측정 장치를 구축후 직접 제작한 측정 프로그램을 통해 자동으로 시편에 전류, 전압을 가한후 임계 특성값을 효율적인 방법으로 측정하고 측정 결과값들을 시간순서 및 측정 대상에 따라 데이터 베이스화 하는 방법에 대하여 소개한다. 부수적으로 임계 특성의 정확한 측정을 위해 실험에 변수가 되는 요소들을 찾아내고 실험 데이터값들로부터 오차를 발견, 오차의 원인이 되는 식각 방법 및 실험 환경등의 부가적인 요소들을 고려하여 개선된 측정 장치를 구축하는데 경제적, 시간적인 효율성 측면에 대해 언급했다.

  • PDF

High-Quality Multimodal Dataset Construction Methodology for ChatGPT-Based Korean Vision-Language Pre-training (ChatGPT 기반 한국어 Vision-Language Pre-training을 위한 고품질 멀티모달 데이터셋 구축 방법론)

  • Jin Seong;Seung-heon Han;Jong-hun Shin;Soo-jong Lim;Oh-woog Kwon
    • Annual Conference on Human and Language Technology
    • /
    • 2023.10a
    • /
    • pp.603-608
    • /
    • 2023
  • 본 연구는 한국어 Vision-Language Pre-training 모델 학습을 위한 대규모 시각-언어 멀티모달 데이터셋 구축에 대한 필요성을 연구한다. 현재, 한국어 시각-언어 멀티모달 데이터셋은 부족하며, 양질의 데이터 획득이 어려운 상황이다. 따라서, 본 연구에서는 기계 번역을 활용하여 외국어(영문) 시각-언어 데이터를 한국어로 번역하고 이를 기반으로 생성형 AI를 활용한 데이터셋 구축 방법론을 제안한다. 우리는 다양한 캡션 생성 방법 중, ChatGPT를 활용하여 자연스럽고 고품질의 한국어 캡션을 자동으로 생성하기 위한 새로운 방법을 제안한다. 이를 통해 기존의 기계 번역 방법보다 더 나은 캡션 품질을 보장할 수 있으며, 여러가지 번역 결과를 앙상블하여 멀티모달 데이터셋을 효과적으로 구축하는데 활용한다. 뿐만 아니라, 본 연구에서는 의미론적 유사도 기반 평가 방식인 캡션 투영 일치도(Caption Projection Consistency) 소개하고, 다양한 번역 시스템 간의 영-한 캡션 투영 성능을 비교하며 이를 평가하는 기준을 제시한다. 최종적으로, 본 연구는 ChatGPT를 이용한 한국어 멀티모달 이미지-텍스트 멀티모달 데이터셋 구축을 위한 새로운 방법론을 제시하며, 대표적인 기계 번역기들보다 우수한 영한 캡션 투영 성능을 증명한다. 이를 통해, 우리의 연구는 부족한 High-Quality 한국어 데이터 셋을 자동으로 대량 구축할 수 있는 방향을 보여주며, 이 방법을 통해 딥러닝 기반 한국어 Vision-Language Pre-training 모델의 성능 향상에 기여할 것으로 기대한다.

  • PDF