• 제목/요약/키워드: Machine learning labeling

검색결과 55건 처리시간 0.028초

Manchu Script Letters Dataset Creation and Labeling

  • Aaron Daniel Snowberger;Choong Ho Lee
    • Journal of information and communication convergence engineering
    • /
    • 제22권1호
    • /
    • pp.80-87
    • /
    • 2024
  • The Manchu language holds historical significance, but a complete dataset of Manchu script letters for training optical character recognition machine-learning models is currently unavailable. Therefore, this paper describes the process of creating a robust dataset of extracted Manchu script letters. Rather than performing automatic letter segmentation based on whitespace or the thickness of the central word stem, an image of the Manchu script was manually inspected, and one copy of the desired letter was selected as a region of interest. This selected region of interest was used as a template to match all other occurrences of the same letter within the Manchu script image. Although the dataset in this study contained only 4,000 images of five Manchu script letters, these letters were collected from twenty-eight writing styles. A full dataset of Manchu letters is expected to be obtained through this process. The collected dataset was normalized and trained using a simple convolutional neural network to verify its effectiveness.

딥러닝 기반의 딥 클러스터링 방법에 대한 분석 (Analysis of deep learning-based deep clustering method)

  • 권현;이준
    • 융합보안논문지
    • /
    • 제23권4호
    • /
    • pp.61-70
    • /
    • 2023
  • 클러스터링은 데이터의 정답값(실제값)이 없는 데이터를 기반으로 데이터의 특징벡터의 거리 기반 등으로 군집화를 하는 비지도학습 방법이다. 이 방법은 이미지, 텍스트, 음성 등 다양한 데이터에 대해서 라벨링이 없이 적용할 수 있다는 장점이 있다. 기존 클러스터링을 하기 위해 차원축소 기법을 적용하거나 특정 특징만을 추출하여 군집화하는 방법이 적용되었다. 하지만 딥러닝 기반 모델이 발전하면서 입력 데이터를 잠재 벡터로 표현하는 오토인코더, 생성 적대적 네트워크 등을 통해서 딥 클러스터링의 기술이 연구가 되고 있다. 본 연구에서, 딥러닝 기반의 딥 클러스터링 기법을 제안하였다. 이 방법에서 오토인코더를 이용하여 입력 데이터를 잠재 벡터로 변환하고 이 잠재 벡터를 클러스터 구조에 맞게 벡터 공간을 구성 및 k-평균 클러스터링을 하였다. 실험 환경으로 pytorch 머신러닝 라이브러리를 이용하여 데이터셋으로 MNIST와 Fashion-MNIST을 적용하였다. 모델로는 컨볼루션 신경망 기반인 오토인코더 모델을 사용하였다. 실험결과로 k가 10일 때, MNIST에 대해서 89.42% 정확도를 가졌으며 Fashion-MNIST에 대해서 56.64% 정확도를 가진다.

산업제어시스템의 이상 탐지 성능 개선을 위한 데이터 보정 방안 연구 (Research on Data Tuning Methods to Improve the Anomaly Detection Performance of Industrial Control Systems)

  • 전상수;이경호
    • 정보보호학회논문지
    • /
    • 제32권4호
    • /
    • pp.691-708
    • /
    • 2022
  • 머신러닝과 딥러닝의 기술이 보편화되면서 산업제어시스템의 이상(비정상) 탐지 연구에도 적용이 되기 시작하였다. 국내에서는 산업제어시스템의 이상 탐지를 위한 인공지능 연구를 활성화시키기 위하여 HAI 데이터셋을 개발하여 공개하였고, 산업제어시스템 보안위협 탐지 AI 경진대회를 시행하고 있다. 이상 탐지 연구들은 대개 기존의 딥러닝 학습 알고리즘을 변형하거나 다른 알고리즘과 함께 적용하는 앙상블 학습 모델의 방법을 통해 향상된 성능의 학습 모델을 만드는 연구가 대부분 이었다. 본 연구에서는 학습 모델과 데이터 전처리(pre-processing)의 개선을 통한 방법이 아니라, 비정상 데이터를 탐지하여 라벨링 한 결과를 보정하는 후처리(post-processing) 방법으로 이상 탐지의 성능을 개선시키는 연구를 진행하였고, 그 결과 기존 모델의 이상 탐지 성능 대비 약 10%이상의 향상된 결과를 확인하였다.

지능형 IoT 미러 시스템을 활용한 인터랙티브 콘텐츠 서비스 구현 (Development of Interactive Content Services through an Intelligent IoT Mirror System)

  • 정원석;서정욱
    • 한국항행학회논문지
    • /
    • 제22권5호
    • /
    • pp.472-477
    • /
    • 2018
  • 본 논문에서는 지능형 IoT (internet of things) 미러 시스템을 통해 사용자의 우울증 예방을 위한 인터랙티브 콘텐츠 서비스를 구현한다. 인터랙티브 콘텐츠 서비스를 위해 IoT 미러 장치는 뇌파 헤드셋 디바이스로부터 집중도 및 명상도 데이터를 측정하고, 웹캠을 통해 다층 퍼셉트론 알고리즘으로 분류된 "슬픔", "분노", "혐오감", "중립", "행복" 및 "놀람"과 같은 표정 데이터를 측정한 후, oneM2M 표준을 준용한 IoT 서버로 전송한다. IoT 서버에 수집된 데이터는 제안한 병합 레이블링 과정을 거쳐 세 가지의 우울 단계(RED, YELLOW, GREEN)를 분류하는 기계학습 모델을 생성한다. 실험을 통해 k-최근접 이웃 모델로 우울 단계를 분류한 결과 약 93%의 정확도를 얻을 수 있었고, 분류된 우울 단계에 따라 가족, 친구 및 사회복지사에게 소셜 네트워크 서비스 에이전트를 통해 알림 메시지를 전송하여 사용자와 보호자 간의 인터랙티브 콘텐츠 서비스를 구현하였다.

WiseQA를 위한 정답유형 인식 (Recognition of Answer Type for WiseQA)

  • 허정;류법모;김현기;옥철영
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제4권7호
    • /
    • pp.283-290
    • /
    • 2015
  • 본 논문에서는 WiseQA 시스템에서 정답유형을 인식하기 위한 하이브리드 방법을 제안한다. 정답유형은 어휘정답유형과 의미정답유형으로 구분된다. 본 논문은 어휘정답유형 인식을 위해서 질문초점에 기반한 규칙모델과 순차적 레이블링에 기반한 기계학습모델을 제안한다. 의미정답유형 인식을 위해 다중클래스 분류에 기반한 기계학습모델과 어휘정답유형을 이용한 필터링 규칙을 소개한다. 어휘정답유형 인식성능은 F1-score 82.47%이고, 의미정답유형 인식성능은 정확률 77.13%이다. 어휘정답유형 인식성능은 IBM 왓슨과 비교하여, 정확률은 1.0% 저조하고, 재현율은 7.4% 높다.

랜덤포레스트 머신러닝 기법을 활용한 전통적 비행이론기반 청소년 온·오프라인 비행 예측요인 연구 (A Study on the Classic Theory-Driven Predictors of Adolescent Online and Offline Delinquency using the Random Forest Machine Learning Algorithm)

  • 이택호;김선영;한윤선
    • 한국심리학회지 : 문화 및 사회문제
    • /
    • 제28권4호
    • /
    • pp.661-690
    • /
    • 2022
  • 본 연구에서는 청소년 비행이 지속적인 사회문제로 대두됨에 따라 청소년의 온·오프라인 비행을 예측하는 주요 요인들을 탐색하고 전통적 비행이론(사회학습이론, 일반긴장이론, 사회통제이론, 일상활동이론, 낙인이론)의 적용 가능성을 살펴보았다. 분석에 활용된 데이터는 한국아동·청소년패널조사 2010(KCYPS 2010)의 초1, 초4, 중1 패널 6차년도 데이터이다(N=4,137). 예측 모형을 구축함에 있어 전통적 통계기반의 회귀모형 대신 랜덤포레스트 머신러닝 기법을 활용함으로써 예측 성능 향상과 더불어 보다 많은 예측요인의 고려 가능성에 초점을 두었다. 랜덤포레스트 분석 결과, 청소년의 온·오프라인 비행을 설명하는 데에 전통적인 비행이론은 여전히 유효하였으며, 온라인 비행은 주로 개인적 요인(일상활동이론, 낙인이론)과, 오프라인 비행은 사회적 요인(사회학습이론, 사회통제이론)과 관련이 있는 것으로 나타났다. 또한 일반긴장 이론은 온라인 비행과 오프라인 비행 모두를 예측하는 중요한 이론적 기반임을 확인할 수 있었다. 본 연구는 머신러닝 기법을 통해 청소년 비행에 영향을 주는 주요 요인을 도출하고, 기존 비행이론의 활용 가능성도 함께 고려했다는 점에서 의의가 있으며, 청소년 온·오프라인 비행에 대한 예방 및 개입 방향성을 재고하는 기반을 제공할 것이라 기대된다.

이미지 생성을 위해 노이즈를 이용한 GAN 시스템 (GAN System Using Noise for Image Generation)

  • 배상중;김민규;정회경
    • 한국정보통신학회논문지
    • /
    • 제24권6호
    • /
    • pp.700-705
    • /
    • 2020
  • 생성적 적대 신경망(GAN, Generative Adversarial Network)은 두 개의 신경망을 대립하여 이미지를 생성하는 방법이다. 이미지를 생성할 때 랜덤으로 생성한 노이즈를 재배열하여 이미지를 생성하는데 이러한 방법으로 생성된 이미지는 노이즈에 따라 생성이 잘 이루어지지 않고, 이미지의 픽셀이 적은 경우 제대로 된 이미지를 생성하기 어렵다는 문제점이 발생할 수 있다. 또한 데이터 분류에서 데이터가 쌓이는 속도와 크기가 증가되는데 이들을 라벨링하는 데는 많은 어려움이 있다. 본 논문에서는 이를 해결하기 위해 랜덤으로 생성하던 노이즈에 실제 데이터를 사용하여 노이즈를 생성하고 이를 기반으로 이미지를 생성하는 기법을 제안한다. 제안하는 시스템은 기존에 있는 이미지를 기반으로 하는 이미지를 생성하는 것이므로 좀 더 자연스러운 이미지의 생성이 가능하다는 것을 확인하였고 이를 학습에 이용할 경우 기존의 생성적 적대 신경망을 사용한 방법보다 더 높은 적중률을 보임을 확인하였다.

Advanced neuroimaging techniques for evaluating pediatric epilepsy

  • Lee, Yun Jeong
    • Clinical and Experimental Pediatrics
    • /
    • 제63권3호
    • /
    • pp.88-95
    • /
    • 2020
  • Accurate localization of the seizure onset zone is important for better seizure outcomes and preventing deficits following epilepsy surgery. Recent advances in neuroimaging techniques have increased our understanding of the underlying etiology and improved our ability to noninvasively identify the seizure onset zone. Using epilepsy-specific magnetic resonance imaging (MRI) protocols, structural MRI allows better detection of the seizure onset zone, particularly when it is interpreted by experienced neuroradiologists. Ultra-high-field imaging and postprocessing analysis with automated machine learning algorithms can detect subtle structural abnormalities in MRI-negative patients. Tractography derived from diffusion tensor imaging can delineate white matter connections associated with epilepsy or eloquent function, thus, preventing deficits after epilepsy surgery. Arterial spin-labeling perfusion MRI, simultaneous electroencephalography (EEG)-functional MRI (fMRI), and magnetoencephalography (MEG) are noinvasive imaging modalities that can be used to localize the epileptogenic foci and assist in planning epilepsy surgery with positron emission tomography, ictal single-photon emission computed tomography, and intracranial EEG monitoring. MEG and fMRI can localize and lateralize the area of the cortex that is essential for language, motor, and memory function and identify its relationship with planned surgical resection sites to reduce the risk of neurological impairments. These advanced structural and functional imaging modalities can be combined with postprocessing methods to better understand the epileptic network and obtain valuable clinical information for predicting long-term outcomes in pediatric epilepsy.

기계학습을 위한 의료영상 라벨링 웹 애플리케이션 구현 (Implementation of medical image labeling web application for machine learning)

  • 이충섭;임동욱;김지언;노시형;유영주;김태훈;정창원
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2021년도 추계학술발표대회
    • /
    • pp.602-605
    • /
    • 2021
  • 최근 인공지능 연구가 활발히 진행되고 있는 가운데 국내외에서 오픈 데이터셋을 제공하고 있어 기술개발이 가속화되고 있다. 데이터셋은 지도학습을 위한 학습데이터로 라벨링 데이터를 포함하고 있어 다양한 라벨링 기능이 적용된 도구 개발이 필요하다. 본 논문에서는 의료영상의 라벨링 데이터를 정교하고 빠르게 생성하기 위한 라벨링 웹 애플리케이션에 대해서 기술한다. 이를 구현하기 위해서 Back Projection, Grabcut 기법을 이용한 반자동 방식과 기계학습 모델을 통해서 예측한 자동 방식의 라벨링 기능을 구현하였다. 이와 관련하여 라벨링 기능별 수행 결과를 근감소증 진단을 위한 영상 라벨링 수행결과와 정량분석 결과를 보였다.

준지도 학습을 활용한 사용자 기반 소형 어선 충돌 경보 분류모델에대한 연구 (A Study on the User-Based Small Fishing Boat Collision Alarm Classification Model Using Semi-supervised Learning)

  • 석호준;심승;우정훈;조준래;정재룡;조득재;백종화
    • 한국항해항만학회지
    • /
    • 제47권6호
    • /
    • pp.358-366
    • /
    • 2023
  • 본 연구는 해양수산부의 '지능형 해상교통정보시스템' 서비스 중 '사고취약선박 모니터링 서비스'의 선박 충돌 경보를 개선하기 위한 것으로, 현재의 선박 충돌 경보는 대형 선박 위주의 데이터와 그 운항자에 기반한 설문조사 레이블을 가지고 지도 학습(SL)한 모델을 사용하고 있다. 이로 인해, 소형선박 데이터 및 운항자의 의견이 현재 충돌 지도학습 모델에 반영되지 않아, 소형선박 운항자가 느끼는 체감보다 먼 거리에서 경보가 제공되기 때문에 그 효과가 미비하다. 또한, 지도학습(SL) 방법은 레이블링 된 다수의 데이터가 필요하지만, 레이블링 과정에서 많은 자원과 시간이 필요하다. 본 논문은 이러한 한계를 극복하기 위해 준지도학습(SSL)의 알고리즘인 Label Propagation과 TabNet을 사용하여 레이블이 결정되지 않은 데이터를 활용하여 소형선박을 위한 충돌 경보의 분류 모델을 연구하였다. 충돌 경보의 분류 모델을 활용하여 소형선박 운항자를 대상으로 실해역 시험을 수행한 결과 운항자의 만족도가 증가하는 결과를 확인하였다.