Search | Korea Science

BERT-based Data Augmentation Techniques for Korean Coreference Resolution (한국어 상호참조해결을 위한 BERT 기반 데이터 증강 기법)

Kim, Kihun;Lee, Changki;Ryu, Jihee;Lim, Joonho
- Annual Conference on Human and Language Technology
- /
- 2020.10a
- /
- pp.249-253
- /
- 2020
상호참조해결은 문서 내에 등장하는 모든 멘션 중에서 같은 의미를 갖는 대상(개체)들을 하나의 집합으로 묶어주는 자연어처리 태스크이다. 한국어 상호참조해결의 학습 데이터는 영어권에 비해 적은 양이다. 데이터 증강 기법은 부족한 학습 데이터를 증강하여 기계학습 기반 모델의 성능을 향상시킬 수 있는 방법 중 하나이며, 주로 규칙 기반 데이터 증강 기법이 연구되고 있다. 그러나 규칙 기반으로 데이터를 증강하게 될 경우 규칙 조건을 만족하지 못했을 때 데이터 증강이 힘들다는 문제점과 임의로 단어를 변경 혹은 삭제하는 과정에서 문맥에 영향을 주는 문제점이 발생할 수 있다. 따라서 본 논문에서는 BERT의 MLM(Masked Language Model)을 이용하여 기존 규칙기반 데이터 증강 기법의 문제점을 해결하고 한국어 상호참조해결 데이터를 증강하는 방법을 소개한다. 실험 결과, ETRI 질의응답 도메인 상호참조해결 데이터에서 CoNLL F1 1.39% (TEST) 성능 향상을 보였다.
PDF

Controllable data augmentation framework based on multiple large-scale language models (복수 대규모 언어 모델에 기반한 제어 가능형 데이터 증강 프레임워크)

Hyeonseok Kang;Hyuk Namgoong;Jeesu Jung;Sangkeun Jung
- Annual Conference on Human and Language Technology
- /
- 2023.10a
- /
- pp.3-8
- /
- 2023
데이터 증강은 인공지능 모델의 학습에서 필요한 데이터의 양이 적거나 편향되어 있는 경우, 이를 보완하여 모델의 성능을 높이는 데 도움이 된다. 이미지와는 달리 자연어의 데이터 증강은 문맥이나 문법적 구조와 같은 특징을 고려해야 하기 때문에, 데이터 증강에 많은 인적자원이 소비된다. 본 연구에서는 복수의 대규모 언어 모델을 사용하여 입력 문장과 제어 조건으로 프롬프트를 구성하는 데 최소한의 인적 자원을 활용한 의미적으로 유사한 문장을 생성하는 방법을 제안한다. 또한, 대규모 언어 모델을 단독으로 사용하는 것만이 아닌 병렬 및 순차적 구조로 구성하여 데이터 증강의 효과를 높이는 방법을 제안한다. 대규모 언어 모델로 생성된 데이터의 유효성을 검증하기 위해 동일한 개수의 원본 훈련 데이터와 증강된 데이터를 한국어 모델인 KcBERT로 다중 클래스 분류를 수행하였을 때의 성능을 비교하였다. 다중 대규모 언어 모델을 사용하여 데이터 증강을 수행하였을 때, 모델의 구조와 관계없이 증강된 데이터는 원본 데이터만을 사용하였을 때보다 높거나 그에 준하는 정확도를 보였다. 병렬 구조의 다중 대규모 언어 모델을 사용하여 400개의 원본 데이터를 증강하였을 때에는, 원본 데이터의 최고 성능인 0.997과 0.017의 성능 차이를 보이며 거의 유사한 학습 효과를 낼 수 있음을 보였다.
PDF

Use Cases and Metadata Design for Integration of Broadcasting Service with Augmented Reality (방송과 증강현실의 접목을 위한 서비스 시나리오와 증강방송 메타데이터 설계)

Choi, Bumsuk;Kim, Soonchoul;Jeong, Youngho;Lee, Wondon
- Proceedings of the Korean Society of Broadcast Engineers Conference
- /
- 2012.07a
- /
- pp.435-438
- /
- 2012
본 논문에서는 최근 모바일 디바이스에서 제공되고 있는 증강현실 서비스를 방송환경에 접목할 수 있는 서비스 시나리오에 대한 소개와 이를 실현하기 위한 증강방송 메타데이터에 대하여 소개한다. 방송환경이 모바일 환경과 다르기 때문에 완벽한 증강 서비스를 제공하는데 있어서 한계가 있다. 한편 TV 의 대 화면과 양질의 TV 프로그램, 스마트 TV 로의 발전에 따른 웹 환경 지원과 모션/음성 인식 인터페이스, 그리고 스마트 TV 애플리케이션의 등장은 증강방송의 가능성을 한층 높이고 있다. 이를 가능하게 하기 위하여 증강방송 메타데이터를 설계하였으며, 증강방송 메타데이터는 증강영역 및 시간, 증강 콘텐츠, 정합 정보 등을 포함한다. 증강방송 메타데이터를 방송환경에 적합하게 전송하기 위하여 스트리밍 서비스에 적합하도록 메타데이터 구조를 정의하였다.
PDF

A Study on the Optimization of Data Augmentation Ratio using CTGAN (CTGAN기반 데이터 증강 비율 최적화 연구)

Da-Hun Seong;Yujin Lim
- Proceedings of the Korea Information Processing Society Conference
- /
- 2023.11a
- /
- pp.327-330
- /
- 2023
머신러닝과 딥러닝 모델의 사용이 급증함에 따라 충분한 데이터 확보의 중요성이 부각되고 있다. 이에 따라 생성 모델을 통한 데이터 증강 기술이 주목받고 있으나, 증강 데이터를 활용했을 때 학습의 성능 분석은 아직 부족하다. 따라서 본 연구에서는 데이터 증강 시나리오에 따라 증강 비율별 합성 데이터의 유용성을 조사하고자 한다. 본 연구에서는 테이블 데이터를 증강하는 것에 초점을 맞추었으며, 이를 위해 테이블 데이터를 합성할 때 유용한 성능을 보이는 딥러닝 모델 CTGAN을 활용하였다. 실험에서 데이터를 증강하는 두 가지 다른 시나리오를 고려한 결과, 두 시나리오에서 모두 실험에서 설정한 증강 비율까지의 합성 데이터가 유용한 결과를 보임을 확인할 수 있었다.
https://doi.org/10.3745/PKIPS.y2023m11a.327 인용 PDF

A Study on Synthesizing Training Data for One-stage Object Detector (단일 단계 검출 방법을 위한 이미지 합성기반 학습 데이터 증강에 관한 연구)

Lee, Seon-Gyeong;Jeong, Chi Yoon;Moon, KyeongDeok;Kim, Chae-Kyu
- Proceedings of the Korea Information Processing Society Conference
- /
- 2020.05a
- /
- pp.446-450
- /
- 2020
딥러닝 기반의 영상 분석 방법들은 많은 양의 학습 데이터가 필요하며, 학습 데이터 구축에는 많은 시간과 노력이 소요된다. 특히 객체 검출 분야의 경우 영상 내 객체의 위치, 크기, 범주 등의 정보가 모두 필요하여 학습 데이터 구축에 더 많은 어려움이 있으며, 이를 해결하기 위해 최근 이미지 합성기반 데이터 증강에 관한 연구가 활발히 진행되고 있다. 이미지 합성기반 데이터 증강 방법은 배경 영상에 객체를 합성할 때 객체와 배경 영상이 접한 영역에서 아티팩트(Artifact)가 발생하며, 이는 객체 검출 모델이 아티팩트를 객체의 특징으로 모델링하여 검출 성능이 저하되는 원인이 된다. 이러한 문제를 해결하기 위하여 본 논문에서는 양방향 필터 기반의 이미지 합성 방법을 제안하고, 단일 단계 검출의 대표적인 방법인 RetinaNet을 이용하여 이미지 합성기반 데이터 증강 방법의 성능을 분석하였다. 공개 데이터셋에 대한 실험 결과 본 논문에서 사용한 단일 검출 방법 및 데이터 증강 기법을 사용하면 더 적은 양의 증강 데이터로 기존 방법과 동일한 성능을 보여주는 것을 확인하였다.
https://doi.org/10.3745/PKIPS.y2020m05a.446 인용 PDF

Pet-Species Classification with Data augmentation based on GAN (GAN 기반 데이터 증강을 통한 반려동물 종 분류)

Park, Chan;Moon, Nammee
- Proceedings of the Korea Information Processing Society Conference
- /
- 2021.11a
- /
- pp.930-932
- /
- 2021
영상처리에서 데이터 증강(Data augmentation)은 단순히 사진을 편집하여 사진의 개수를 증강하는 것이다. 단순 데이터 증강은 동물의 반점이나 다양한 색깔을 반영하지 못하는 한계가 있다. 본 논문에서는 GAN을 통한 데이터 증강 기법을 제안한다. 제안하는 방법은 CycleGAN을 사용하여 GAN 이미지를 생성한 뒤, 데이터 증강을 거쳐 동물의 종 분류 정확도를 측정한다. 정확도 비교를 위해 일반 사진으로만 구성한 집단과 GAN 사진을 추가한 두 집단으로 나누었다. ResNet50을 사용하여 종 분류 정확도를 측정한다.
https://doi.org/10.3745/PKIPS.y2021m11a.930 인용 PDF

A Study of GAN-based data augmentation technique on Acceleration Data Gereration (GAN 기반 데이터 증강기법을 통한 가속도 데이터 생성에 대한 연구)

Kang, Sung-Hwan;Chow, We-Duke
- Proceedings of the Korean Society of Computer Information Conference
- /
- 2022.07a
- /
- pp.495-497
- /
- 2022
본 데이터 GAN 기법 데이터 증강기법을 적용하여 가속도 데이터를 증강하는 방법에 대해 연구한다. 가속도 데이터는 사람의 활동패턴을 인지하는데 있어 가장 기본적인 데이터로 활용된다. 가속도 데이터를 증강한 뒤, 활동패턴을 인지하는 머신러닝 모델 훈련에 사용한 결과 생성한 데이터가 육안으로 확인하였을 때 실제 데이터와 유사한 패턴을 형성하였고, 실제 활동패턴인지 모델 훈련에 사용한 결과 정확도(Accuracy)는 기존 데이터로만 훈련한 경우 74%인데 비해 증강된 데이터를 혼합하여 훈련하였을 때 약 88%로 개선된 것을 확인하였다.
PDF

A Vector and Thickness-Based Data Augmentation that Efficiently Generates Accurate Crack Data (정확한 균열 데이터를 효율적으로 생성하는 벡터와 두께 기반의 데이터 증강)

Ju-Young Yun;Jong-Hyun Kim
- Proceedings of the Korean Society of Computer Information Conference
- /
- 2023.01a
- /
- pp.377-380
- /
- 2023
본 논문에서는 합성곱 신경망(Convolutional Neural Networks, CNN)과 탄성왜곡(Elastic Distortion) 기법을 통한 데이터 증강 기법을 활용하여 학습 데이터를 구축하는 프레임워크를 제안한다. 실제 균열 이미지는 정형화된 형태가 없고 복잡한 패턴을 지니고 있어 구하기 어려울 뿐만 아니라, 데이터를 확보할 때 위험한 상황에 노출될 우려가 있다. 이러한 데이터베이스 구축 문제점을 본 논문에서 제안하는 데이터 증강 기법을 통해 비용적, 시간적 측면에서 효율적으로 해결한다. 세부적으로는 DeepCrack의 데이터를 10배 이상 증가하여 실제 균열의 특징을 반영한 메타 데이터를 생성하여 U-net을 학습하였다. 성능을 검증하기 위해 균열 탐지 연구를 진행한 결과, IoU 정확도가 향상되었음을 확인하였다. 데이터를 증강하지 않았을 경우 잘못 예측(FP)된 경우의 비율이 약 25%였으나, 데이터 증강을 통해 3%까지 감소하였음을 확인하였다.
PDF

Masked language modeling-based Korean Data Augmentation Techniques Using Label Correction (정답 레이블을 고려한 마스킹 언어모델 기반 한국어 데이터 증강 방법론)

Myunghoon Kang;Jungseob Lee;Seungjun Lee;Hyeonseok Moon;Chanjun Park;Yuna Hur;Heuiseok Lim
- Annual Conference on Human and Language Technology
- /
- 2022.10a
- /
- pp.485-490
- /
- 2022
데이터 증강기법은 추가적인 데이터 구축 혹은 수집 행위 없이 원본 데이터셋의 양과 다양성을 증가시키는 방법이다. 데이터 증강기법은 규칙 기반부터 모델 기반 방법으로 발전하였으며, 최근에는 Masked Language Modeling (MLM)을 응용한 모델 기반 데이터 증강 연구가 활발히 진행되고 있다. 그러나 기존의 MLM 기반 데이터 증강 방법은 임의 대체 방식을 사용하여 문장 내 의미 변화 가능성이 큰 주요 토큰을 고려하지 않았으며 증강에 따른 레이블 교정방법이 제시되지 않았다는 한계점이 존재한다. 이러한 문제를 완화하기 위하여, 본 논문은 레이블을 고려할 수 있는 Re-labeling module이 추가된 MLM 기반 한국어 데이터 증강 방법론을 제안한다. 제안하는 방법론을 KLUE-STS 및 KLUE-NLI 평가셋을 활용하여 검증한 결과, 기존 MLM 방법론 대비 약 89% 적은 데이터 양으로도 baseline 성능을 1.22% 향상시킬 수 있었다. 또한 Gate Function 적용 여부 실험으로 제안 방법 Re-labeling module의 구조적 타당성을 검증하였다.
PDF

Numerical Reasoning Dataset Augmentation Using Large Language Model and In-Context Learning (대규모 언어 모델 및 인컨텍스트 러닝을 활용한 수치 추론 데이터셋 증강)

Yechan Hwang;Jinsu Lim;Young-Jun Lee;Ho-Jin Choi
- Annual Conference on Human and Language Technology
- /
- 2023.10a
- /
- pp.203-208
- /
- 2023
본 논문에서는 대규모 언어 모델의 인컨텍스트 러닝과 프롬프팅을 활용하여 수치 추론 태스크 데이터셋을 효과적으로 증강시킬 수 있는 방법론을 제안한다. 또한 모델로 하여금 수치 추론 데이터의 이해를 도울 수 있는 전처리와 요구사항을 만족하지 못하는 결과물을 필터링 하는 검증 단계를 추가하여 생성되는 데이터의 퀄리티를 보장하고자 하였다. 이렇게 얻어진 증강 절차를 거쳐 증강을 진행한 뒤 추론용 모델 학습을 통해 다른 증강 방법론보다 우리의 방법론으로 증강된 데이터셋으로 학습된 모델이 더 높은 성능을 낼 수 있음을 보였다. 실험 결과 우리의 증강 데이터로 학습된 모델은 원본 데이터로 학습된 모델보다 모든 지표에서 2%p 이상의 성능 향상을 보였으며 다양한 케이스를 통해 우리의 모델이 수치 추론 학습 데이터의 다양성을 크게 향상시킬 수 있음을 확인하였다.
PDF

Search Result 472, Processing Time 0.04 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)