Search | Korea Science

Data Preprocessing block for Education Programming Language based Deep aI Yourself Hands-on Platform (교육용 프로그래밍 언어 기반 Deep aI Yourself 실습 플랫폼을 위한 데이터 전처리 블록)

Lee, Se-Hoon;Kim, Ki-Tae;Baek, Min-Ju;Yoo, Chae-Won
- Proceedings of the Korean Society of Computer Information Conference
- /
- 2020.07a
- /
- pp.297-298
- /
- 2020
본 논문에서는 머신러닝 학습에 있어 데이터 전처리의 중요성과 기존 데이터 전처리 기능을 가진 교육용 실습 플랫폼 서비스의 단점은 개선할 수 있는 데이터 전처리 학습을 위한 교육용 블록코딩 기반 실습 플랫폼을 제안한다. 머신러닝 모델의 학습데이터는 데이터 전처리에 따라 모델의 정확도에 큰 영향을 미치므로 데이터를 다양하게 활용하기 위해서는 전처리의 필요성을 깨닫고 과정을 정확하게 이해해야 한다. 따라서 데이터를 처리하는 과정을 이해하고 전처리를 직접 실행해 볼 수 있는 교육용 프로그래밍 언어 기반 D.I.Y 실습 플랫폼을 구현한다.
PDF

Data preprocessing for efficient machine learning (효율적인 기계학습을 위한 데이터 전처리)

Kim, Dong-Hyun;Yoo, Seung-Eon;Lee, Byung-Jun;Kim, Kyung-Tae;Youn, Hee-Yong
- Proceedings of the Korean Society of Computer Information Conference
- /
- 2019.01a
- /
- pp.49-50
- /
- 2019
데이터를 기반으로 한 기계학습은 데이터의 양, 학습 모델, 그리고 데이터의 특징 등 다양한 환경에 민감한 특징을 지니고 있어, 보다 효율적인 기계학습을 위해 데이터의 전처리 과정을 필요로 한다. 데이터의 전처리 과정이란 특징 선택(Feature selection), 노이즈 데이터의 제거, 차원 감소(Demension reduction), 클러스터링(Clustering) 등 보다 효율적인 기계학습을 위한 방법이다. 따라서 본 논문에서는 다양한 환경에서 보다 효율적인 기계학습을 위한 데이터 전처리 기술의 종류 및 간단한 특징에 대해 서술한다.
PDF

A Study on data pre-processing for rainfall estimation from CCTV videos (CCTV 영상 기반 강수량 산정을 위한 데이터 전처리 방안 연구)

Byun, Jongyun;Jun, Changhyun;Lee, Jinwook;Kim, Hyeonjun;Cha, Hoyoung
- Proceedings of the Korea Water Resources Association Conference
- /
- 2022.05a
- /
- pp.167-167
- /
- 2022
최근 빅데이터에 관련된 연구에 있어 데이터의 품질관리에 대한 논의가 꾸준히 이뤄져 오고 있다. 특히 이미지 처리 및 분석에 활용되어온 딥러닝 기술의 경우, 분류 작업 및 패턴인식 등으로부터 데이터의 특징을 추출함으로써 비지도학습(Unsupervised Learning)을 가능하게 한다는 장점이 있음에도 불구하고 빅데이터를 다루는 과정에 있어 용량, 다양성, 속도 및 신뢰성 측면에서의 한계가 있었다. 본 연구에서는 CCTV 영상을 활용한 강수량 산정 모델 개발에 있어 예측 정확도 향상 및 성능 개선을 도모할 수 있는 데이터 전처리 방법을 제안하였다. 서울 근린 AWS 4개소 지역(김포장기, 하남덕풍, 강동, 성남) 및 중앙대학교 지점 내 CCTV를 설치한 후, 최대 9개월의 영상을 확보하여 강수량 산정을 위한 딥러닝 모델을 개발하였다. 배경분리, 조도조정, 영역설정, 데이터증진, 이상데이터 분류 등이 가능한 알고리즘을 개발함으로써 데이터셋 자체에 대한 전처리 작업을 수행한 후, 이에 대한 결과를 기존 관측자료와 비교·분석하였다. 본 연구에서 제안한 전처리 방법들을 적용한 결과, 강수량 산정 모델의 예측 정확도를 평가하는 지표로 선정한 평균 제곱근 편차(Root Mean Square Error; RMSE)가 약 30% 감소함을 확인하였다. 본 연구의 결과로부터 CCTV 영상 데이터를 활용한 강수량 산정의 가능성을 확인할 수 있었으며 특히, 딥러닝 모델 개발시 필요한 적정 전처리 방법들에 대한 기준을 제시할 수 있을 것으로 판단된다.
PDF

A Study of Data Preprocessing Algorithm Using TCS/HI-PASS Data (TCS/HI-PASS 데이터를 이용한 전처리 알고리즘 구현에 관한 연구)

Jeong, Hyeon-Seok;Oh, Sang-Seok;Min, Sung-Gi
- Proceedings of the Korea Information Processing Society Conference
- /
- 2011.11a
- /
- pp.1005-1008
- /
- 2011
본 논문에서는 교통 이력자료의 시공간 데이터를 활용하여 교통 분석 및 예측에 필요한 신뢰성 높은 데이터를 제공하기 위한 TCS/HI-PASS 전처리 알고리즘을 제안한다. 시공간 데이터의 전처리 알고리즘은 각종 교통정보에 이용되고 있으며, 그 중 대표적으로 활용되고 있는 것이 차량 검지기(VDS)를 통해 수집된 교통량, 속도, 점유율 정보이다. 이러한 정보에 가공처리 알고리즘을 적용하여 공간평균속도 기반의 통행시간을 산정하고 있으며, 고속도로 통행료 수납시스템(TCS)으로 부터는 출발영업소와 도착영업소의 진 출입시간을 기반으로 평균통행시간을 산정하고 있다. 본 연구에서는 차량 검지기(VDS) 데이터와 기존 TCS 데이터의 전처리 알고리즘을 분석하여 TCS와 HI-PASS 데이터 기반의 개선된 전처리 알고리즘을 설계, 구현하였다.
https://doi.org/10.3745/PKIPS.y2011m11a.1005 인용 PDF

Dataset Property - based Algebraic Operators for Data Mining Preprocessing (데이터집합 특성에 기반한 데이터 마이닝 전처리 대수 연산자)

Kim, Hyo-Sook;Lee, Won-Suk
- Proceedings of the Korea Information Processing Society Conference
- /
- 2002.11c
- /
- pp.1709-1712
- /
- 2002
지식 탐사 연구의 핵심이 되어온 데이터 마이닝은 축적 데이터로부터 쉽게 추출되지 않는 데이터 상호관계나 일정 패턴과 같은 유용한 내재 정보 추출을 주된 목적으로 수행된다. 그러나, 데이터 마이닝은 대용량의 데이터 처리로 인해 빈번한 메모리 공간 제약과 처리 속도 저하 등의 한계성을 드러낸다. 이를 극복하기 위해 많은 마이닝 알고리즘 개발과 기존 알고리즘 개선 방법이 제시되어 왔으나 여전히 궁극적인 해결방안은 대두되지 않고 있다. 따라서, 만약 데이터 전처리 과정을 통해 마이닝 목적에 적합한 부분 데이터집합 추출 및 가공이 선행된다면 보다 효율적인 데이터 마이닝 작업을 유도할 수 있을 것이다. 본 논문은 효과적 데이터 전처리를 위한 필수 기본 연산 기능들을 주어진 데이터집합의 트랜잭션 및 데이터 특성에 기초하여 관계형 대수 형태로 의미를 정립하고, 적용 사례에 의한 상세 설명 및 실제 구현된 온라인 데이터 전처리 시스템을 제안한다.
PDF

Effectiveness of Normalization Pre-Processing of Big Data to the Machine Learning Performance (빅데이터의 정규화 전처리과정이 기계학습의 성능에 미치는 영향)

Jo, Jun-Mo
- The Journal of the Korea institute of electronic communication sciences
- /
- v.14 no.3
- /
- pp.547-552
- /
- 2019
Recently, the massive growth in the scale of data has been observed as a major issue in the Big Data. Furthermore, the Big Data should be preprocessed for normalization to get a high performance of the Machine learning since the Big Data is also an input of Machine Learning. The performance varies by many factors such as the scope of the columns in a Big Data or the methods of normalization preprocessing. In this paper, the various types of normalization preprocessing methods and the scopes of the Big Data columns will be applied to the SVM(: Support Vector Machine) as a Machine Learning method to get the efficient environment for the normalization preprocessing. The Machine Learning experiment has been programmed in Python and the Jupyter Notebook.
https://doi.org/10.13067/JKIECS.2019.14.3.547 인용 PDF KSCI HTML

A study on the increase of user gesture recognition rate using data preprocessing (데이터 전처리를 통한 사용자 제스처 인식률 증가 방안)

Kim, Jun Heon;Song, Byung Hoo;Shin, Dong Ryoul
- Proceedings of the Korean Society of Computer Information Conference
- /
- 2017.07a
- /
- pp.13-16
- /
- 2017
제스처 인식은 HCI(Human-Computer Interaction) 및 HRI(Human-Robot Interaction) 분야에서 활발히 연구되고 있는 기술이며, 제스처 데이터의 특징을 추출해내고 그에 따른 분류를 통하여 사용자의 제스처를 정확히 판별하는 것이 중요한 과제로 자리 잡았다. 본 논문에서는 EMG(Electromyography) 센서로 측정한 사용자의 손 제스처 데이터를 분석하는 방안에 대하여 서술한다. 수집된 데이터의 노이즈를 제거하고 데이터의 특징을 극대화시키기 위하여 연속적인 데이터로 변환하는 전처리 과정을 거쳐 이를 머신 러닝 알고리즘을 사용하여 분류하였다. 이 때, 기존의 raw 데이터와 전처리 과정을 거친 데이터의 성능을 decision-tree 알고리즘을 통하여 비교하였다.
PDF

스마트 항로표지 서비스를 위한 데이터 전처리 기술 연구

박종빈;김경원
- Proceedings of the Korean Institute of Navigation and Port Research Conference
- /
- 2022.06a
- /
- pp.85-87
- /
- 2022
스마트 항로표지 장치에서는 위도와 경도에 대응하는 각종 센싱정보가 시계열 형식으로 생산되므로 다양한 서비스 개발이 용이하다. 그러나 데이터의 수집 및 관리 주체가 상이하고, 시스템이 분산된 상태이며, 같은 항로표지에 대해서도 저장 포맷이 다를 수 있는 등 데이터의 효과적인 활용측면에서 제약이 많았다. 이를 해결하기 위해 본 논문에서는 파편적으로 수집된 스마트 항로표지 원시 데이터를 효과적으로 결합하고 다양한 위치기반 서비스 제공에 적합하게 가공하는 데이터 전처리 기술을 제안한다.
PDF

Performance Improvement on Similar Texts Searching System for Massive Document Repository (대용량 문서 집합에서 유사문서 탐색 시스템의 성능 개선)

Park, Sun-Young;Cho, Hwan-Gue
- Proceedings of the Korea Information Processing Society Conference
- /
- 2010.04a
- /
- pp.413-416
- /
- 2010
최근 발생한 수많은 표절 논란으로 인해 많은 유사 문서 탐색 시스템이 개발되어 사용되고 있다. 많은 시스템 중 내용기반 유사문서 탐색 시스템인 DeVAC은 대용량 문서 1:1간의 비교에서 빠른 성능을 보여주지만 수천~수만 개의 문서 집합에 대해서는 적절한 성능을 보여주지 못한다. 이를 해결하기 위해 전역 사전(Global Dictionary)을 이용한 전처리 방법이 고안되어 적용되었다. 이 전처리 방법을 통해 비교해야 할 문서쌍이 줄어들고 전체 시스템의 성능을 향상시킬 수 있다는 것은 밝혀졌으나, 전처리를 위해 발생하는 추가 비용에 대한 계측이 이루어지지 않았을 뿐 아니라 문서 쌍이 얼마나 감소하는지 측정한 실험에서도 언어 처리용 실험적 데이터(말뭉치)에 대한 실험이 대부분을 차지하였기 때문에 실제 데이터에 대해 어떤 성능을 보일지 정확히 예측할 수 없었다. 본 논문에서는 전체 시스템에서 전처리를 위해 필요한 모든 추가 비용을 측정하고, 데이터를 1.5Gb, 6263개의 문서로 이루어진 실존하는 문서 집합으로 구성하여 성능 향상 정도를 측정함으로써 실제 데이터에 대한 전처리 신뢰도를 예측하였다. 실험 결과 전처리 후 찾아낸 유사한 문서 쌍을 전처리를 하지 않을 경우의 80~89.3% 정도로 유지하면서 검사 시간을 기존의 10.8%~15.4% 수준으로 대폭 감소시킬 수 있었다.
https://doi.org/10.3745/PKIPS.y2010m04a.413 인용 PDF

Data Augmentation and Preprocessing to Improve Automated Essay Scoring Model (에세이 자동 평가 모델 성능 향상을 위한 데이터 증강과 전처리)

Kanghee Go;Doguk Kim
- Annual Conference on Human and Language Technology
- /
- 2023.10a
- /
- pp.327-332
- /
- 2023
데이터의 품질과 다양성은 모델 성능에 지대한 영향을 끼친다. 본 연구에서는 Topic을 활용한 데이터 전처리와 BERT 기반 MLM, T5, Random Masking을 이용한 증강으로 데이터의 품질과 다양성을 높이고자 했으며, 이를 KoBERT 기반 에세이 자동 평가 모델에 적용했다. 데이터 전처리만 진행했을 때, Quadratic Weighted Kappa Score(QWK)를 기준으로 모델이 에세이의 모든 평가 항목에 대해 베이스라인보다 더욱 높은 일치도를 보였으며 평가항목별 일치도의 평균을 기준으로 0.5368029에서 0.5483064(+0.0115035)로 상승했다. 여기에 제안하는 증강 방식을 추가 할 경우 MLM, T5, Random Masking 모두 성능 향상 효과를 보였다. 특히, MLM 데이터 증강 방식을 추가로 적용하였을 때 최종적으로 0.5483064에서 0.55151645(+0.00321005)으로 상승해 가장 높은 일치도를 보였으며, 에세이 총점으로 QWK를 기준으로 성능을 평가하면 베이스라인 대비 0.4110809에서 0.4380132(+0.0269323)로의 성능 개선이 있었다.
PDF

Search Result 1,170, Processing Time 0.036 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)