• 제목/요약/키워드: 레이블

검색결과 538건 처리시간 0.03초

한국어 문장 표현을 위한 비지도 대조 학습 방법론의 비교 및 분석 (Comparison and Analysis of Unsupervised Contrastive Learning Approaches for Korean Sentence Representations)

  • 유영현;이규민;전민진;차지이;김강산;김태욱
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2022년도 제34회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.360-365
    • /
    • 2022
  • 문장 표현(sentence representation)은 자연어처리 분야 내의 다양한 문제 해결 및 응용 개발에 있어 유용하게 활용될 수 있는 주요한 도구 중 하나이다. 하지만 최근 널리 도입되고 있는 사전 학습 언어 모델(pre-trained language model)로부터 도출한 문장 표현은 이방성(anisotropy)이 뚜렷한 등 그 고유의 특성으로 인해 문장 유사도(Semantic Textual Similarity; STS) 측정과 같은 태스크에서 기대 이하의 성능을 보이는 것으로 알려져 있다. 이러한 문제를 해결하기 위해 대조 학습(contrastive learning)을 사전 학습 언어 모델에 적용하는 연구가 문헌에서 활발히 진행되어 왔으며, 그중에서도 레이블이 없는 데이터를 활용하는 비지도 대조 학습 방법이 주목을 받고 있다. 하지만 대다수의 기존 연구들은 주로 영어 문장 표현 개선에 집중하였으며, 이에 대응되는 한국어 문장 표현에 관한 연구는 상대적으로 부족한 실정이다. 이에 본 논문에서는 대표적인 비지도 대조 학습 방법(ConSERT, SimCSE)을 다양한 한국어 사전 학습 언어 모델(KoBERT, KR-BERT, KLUE-BERT)에 적용하여 문장 유사도 태스크(KorSTS, KLUE-STS)에 대해 평가하였다. 그 결과, 한국어의 경우에도 일반적으로 영어의 경우와 유사한 경향성을 보이는 것을 확인하였으며, 이에 더하여 다음과 같은 새로운 사실을 관측하였다. 첫째, 사용한 비지도 대조 학습 방법 모두에서 KLUE-BERT가 KoBERT, KR-BERT보다 더 안정적이고 나은 성능을 보였다. 둘째, ConSERT에서 소개하는 여러 데이터 증강 방법 중 token shuffling 방법이 전반적으로 높은 성능을 보였다. 셋째, 두 가지 비지도 대조 학습 방법 모두 검증 데이터로 활용한 KLUE-STS 학습 데이터에 대해 성능이 과적합되는 현상을 발견하였다. 결론적으로, 본 연구에서는 한국어 문장 표현 또한 영어의 경우와 마찬가지로 비지도 대조 학습의 적용을 통해 그 성능을 개선할 수 있음을 검증하였으며, 이와 같은 결과가 향후 한국어 문장 표현 연구 발전에 초석이 되기를 기대한다.

  • PDF

불규칙 조명 환경에 강인한 번호판 문자 분리 기법 (Robust Scheme of Segmenting Characters of License Plate on Irregular Illumination Condition)

  • 김병현;한영준;한헌수
    • 한국컴퓨터정보학회논문지
    • /
    • 제14권11호
    • /
    • pp.61-71
    • /
    • 2009
  • 자동차의 번호판은 차량의 등록 정보를 확인할 수 있는 유일한 방법이다. 불법 주정차 단속 및 주차 관리 시스템에 차량의 등록 정보를 확인하기 위해 카메라를 이용한 무인 인식시스템의 개발이 활발히 연구되고 있다. 하지만, 일반 도로상에서 날씨나 주변 장애물들은 자동차 번호판 상에 조명 변화를 일으켜 번호판 문자의 추출을 어렵게 한다. 본 논문은 번호판 영상을 개선하여 조명변화에 강인한 문자 추출 알고리즘을 제안한다. 제안하는 기법은 번호판 영상의 명암 대비도를 높이기 위해 Chi-Square 확률 밀도 함수를 이용한다. 또한, 정확한 문자영역을 추출하기 위해, 적응적인 문턱값을 적용함으로써 고품질의 이진화 영상을 얻는다. 번호판의 문자들을 추출하는 일련의 과정에서 방해가 되는 잡음들을 전처리와 레이블링을 통해 제거한다. 마지막으로 번호판의 문자들은 번호판의 기하학적 특징을 이용한 이진화 영상의 프로파일링으로부터 추출된다.

머신러닝을 활용한 선발 투수 교체시기에 관한 연구 (A Study on the Timing of Starting Pitcher Replacement Using Machine Learning)

  • 노성진;노미진;한무명초;엄선현;김양석
    • 스마트미디어저널
    • /
    • 제11권2호
    • /
    • pp.9-17
    • /
    • 2022
  • 본 연구는 야구 경기에서 선발 투수를 위기 상황 이전에 교체하기 위한 의사결정을 지원하는 예측 모델 구현을 목적으로 한다. 이를 위해 베이스볼 서번트(Baseball Savant)에서 제공하는 메이저리그 스탯캐스트 데이터를 활용하여, 선발 투수를 위기 상황 이전에 선제적으로 교체하는 예측 모델을 구현한다. 이를 위해 첫째, 데이터 탐색을 통해 선발 투수가 경기에서 직면하는 위기 상황을 도출하였다. 둘째, 선발 투수가 이닝 종료 전에 교체된 경우, 이전 이닝에서 교체하는 것으로 레이블을 구성하여 학습을 진행하였다. 학습된 모델을 비교한 결과 앙상블 기법을 기반으로 한 모델이 F1-Score가 65%로 가장 높은 예측 성능을 보였다. 본 연구의 실무적 의의는 제안하는 모델을 통해 선발 투수를 위기 상황 이전에 교체하여 팀의 승리 확률을 높이는 데 기여할 수 있으며, 경기 중 감독은 데이터 기반의 전략적 의사결정 지원을 받을 수 있을 것이다.

밀키트 제품 리뷰 데이터를 이용한 텍스트 분석 사례 연구 (A Case Study on Text Analysis Using Meal Kit Product Review Data)

  • 최혜선;연규필
    • 한국콘텐츠학회논문지
    • /
    • 제22권5호
    • /
    • pp.1-15
    • /
    • 2022
  • 본 연구에서는 밀키트 제품 평가에 영향을 미치는 요인을 파악하기 위하여 밀키트 제품 리뷰 데이터에 대한 텍스트 분석을 수행하였다. 분석에 사용된 자료는 네이버 쇼핑 사이트에서 판매되고 있는 밀키트 제품에 대한 리뷰 334,498건을 스크래핑하여 수집하였다. 텍스트 자료에 대한 전처리 과정을 거쳐 제품 리뷰에 빈번히 등장하는 단어를 추출한 후 워드클라우드 및 감성분석을 수행하였다. 감성분석시 제품 리뷰에 대한 긍정 또는 부정의 레이블은 평점을 기준으로 설정하여 반응변수로 활용하였고, 입력변수로는 단어들의 정규화 단어빈도-역문서빈도 (TF-IDF) 값을 구하여 사용하였다. 리뷰의 극성을 판별하는 모형으로는 로지스틱 회귀모형, 서포트 벡터 머신, 랜덤 포레스트 알고리즘을 적용하였으며, 분류 정확도 및 해석가능성을 고려하여 로지스틱 회귀모형을 최종 모형으로 선택한 후 제품 범주별 감성분석 모형으로 사용하였다. 각 제품 범주별로 도출된 로지스틱 회귀모형으로부터 밀키트 제품 구매 후 긍·부정의 감성을 발생시킨 주요 요인들을 밝혀내었다. 결과적으로 텍스트 분석을 통해 밀키트 제품 개발 시 특정 카테고리, 메뉴, 재료에 대한 긍정 요소를 극대화하고 부정적 위험 요소를 제거할 수 있는 기반을 제공할 수 있음을 확인하였다.

이미지 기반 축산물 불량 탐지에서의 희소 클래스 처리 전략 (Sparse Class Processing Strategy in Image-based Livestock Defect Detection)

  • 이범호;조예성;이문용
    • 한국정보통신학회논문지
    • /
    • 제26권11호
    • /
    • pp.1720-1728
    • /
    • 2022
  • 인공지능 기술의 발전으로 산업 4.0시대가 열렸고 축산업에서도 ICT 기술이 접목된 스마트 농장의 구현이 큰 관심을 받고 있다. 그중에서도 컴퓨터 비전 기반 인공지능 기술을 접목한 축산물 및 축산 가공품의 품질 관리 기술은 스마트 축산의 핵심 기술에 해당한다. 그러나 인공지능 모형 훈련을 위한 축산물 이미지 데이터 수의 부족과 특정 범주(class)에 대한 데이터 불균형은 관련 연구 및 기술 개발에 큰 장해물이 되고 있다. 이러한 문제들을 해결하기 위해, 본 연구에서는 오버샘플링과 적대적 사례 생성기법의 활용을 제안한다. 제안되는 방법은 성공적인 불량 탐지 (Defect detection) 관점을 기반으로 하며, 이는 부족한 데이터 레이블을 효과적으로 활용하는데 필요한 방법이다. 최종적으로 실험을 통해 제안된 방법의 타당성을 확인하고 활용 전략을 검토한다.

사용자 입력 문장에서 우울 관련 감정 탐지 (Detects depression-related emotions in user input sentences)

  • 오재동;오하영
    • 한국정보통신학회논문지
    • /
    • 제26권12호
    • /
    • pp.1759-1768
    • /
    • 2022
  • 본 논문은 AI Hub에서 제공하는 웰니스 대화 스크립트, 주제별 일상 대화 데이터세트와 Github에 공개된 챗봇 데이터세트를 활용하여 사용자의 발화에서 우울 관련 감정을 탐지하는 모델을 제안한다. 우울 관련 감정에는 우울감, 무기력을 비롯한 18가지 감정이 존재하며, 언어 모델에서 높은 성능을 보이는 KoBERT와 KoELECTRA 모델을 사용하여 감정 분류 작업을 수행한다. 모델별 성능 비교를 위해 우리는 데이터세트를 다양하게 구축하고, 좋은 성능을 보이는 모델에 대해 배치 크기와 학습률을 조정하면서 분류 결과를 비교한다. 더 나아가, 사람은 동시에 여러 감정을 느끼는 것을 반영하기 위해, 모델의 출력값이 특정 임계치보다 높은 레이블들을 모두 정답으로 선정함으로써, 다중 분류 작업을 수행한다. 이러한 과정을 통해 도출한 성능이 가장 좋은 모델을 Depression model이라 부르며, 이후 사용자 발화에 대해 우울 관련 감정을 분류할 때 해당 모델을 사용한다.

BPE를 활용한 한국어 감정사전 제작 (Developing a Korean sentiment lexicon through BPE)

  • 박호민;천민아;남궁영;최민석;윤호;김재균;김재훈
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2019년도 제31회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.510-513
    • /
    • 2019
  • 감정분석은 텍스트에서 나타난 저자 혹은 발화자의 태도, 의견 등과 같은 주관적인 정보를 추출하는 기술이며, 여론 분석, 시장 동향 분석 등 다양한 분야에 두루 사용된다. 감정분석 방법은 사전 기반 방법, 기계학습 기반 방법 등이 있다. 본 논문은 사전 기반 감정분석에 필요한 한국어 감정사전 자동 구축 방법을 제안한다. 본 논문은 영어 감정사전으로부터 한국어 감정사전을 자동으로 구축하는 방법이며, 크게 세 단계로 구성된다. 첫 번째는 한영 병렬 말뭉치를 이용한 한영 이중언어 사전을 구축하는 단계이고, 두 번째는 한영 이중언어 사전을 통한 한영 이중언어 그래프를 생성하는 단계이며, 세 번째는 영어 단어의 감정값을 한국어 BPE의 감정값으로 전파하는 단계이다. 본 논문에서는 제안된 방법의 유효성을 보이기 위해 사전 기반 한국어 감정분석 시스템을 구축하여 평가하였으며, 그 결과 제안된 방법이 합리적인 방법임을 확인할 수 있었으며 향후 연구를 통해 개선한다면 질 좋은 한국어 감정사전을 효과적인 방법으로 구축할 수 있을 것이다.

  • PDF

사용자 평가를 통한 모바일 애플리케이션 접근성 지침의 개정 방향 (A Study on the Amendment of the Mobile Application Accessibility Guideline based on User Evaluation)

  • 문현주;김석일
    • 재활복지
    • /
    • 제18권2호
    • /
    • pp.181-205
    • /
    • 2014
  • 미래창조과학부는 2011년에 모바일 앱이 장애인 접근성을 제공하기 위한 요구사항을 규정하는 모바일 애플리케이션 접근성 지침을 만들고, 이를 고시하여 국가기관과 공공기관이 활용하도록 하고 있다. 본 논문에서는 5개의 모바일 앱에 대한 사용자 평가를 실시하고, 사용자가 제기한 문제점과 현행 모바일 애플리케이션 접근성 지침의 검사항목 간의 관계를 분석하였다. 분석 결과, 일부 모바일 앱은 모바일 애플리케이션 접근성 지침을 준수하고 있음에도 불구하고 사용자가 접근할 수 문제점이 발견되어 현행 지침이 접근성 제공을 위한 요구 사항을 충분히 반영하지 못하고 있음을 보였다. 모바일 앱이 장애인 접근성을 충실히 제공하기 위해서는 키보드 접근성, 컨트롤 크기, 레이블 제공, 시간제한 등의 검사항목이 지침에 추가되어야 한다. 또한 일부 검사항목은 수정하거나 삭제함으로써 모바일 애플리케이션 접근성 지침을 개정할 필요가 있다.

Mask R-CNN과 Dense-Net을 이용한 제조 현장에서의 작업자 행동 추출 (Extraction of Worker Behavior at Manufacturing Site using Mask R-CNN and Dense-Net)

  • 리타 리자얀티;황민태;진교홍
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2022년도 춘계학술대회
    • /
    • pp.150-153
    • /
    • 2022
  • 본 논문은 작업자와 객체들이 서로 혼재되어 있는 제조 현장에서 Mask R-CNN을 이용해 객체들을 탐지한 후 이를 Dense-Net을 통해 객체 형상을 자동으로 추출하는 기술을 담고 있다. 이는 맞춤형 공장 데이터 세트를 기반으로 하며, 대상이 되는 객체는 작업자, 기계, 도구, 컨트롤 박스 및 제품들이다. Mask R-CNN은 이미 잘 알려진 객체 인식 방식으로서 다중 객체 인식을 지원하며, Dense-Net은 중첩된 객체들로 부터 개별 객체를 추출하는 데 탁월한 효과를 보여준다. 이러한 두 가지 기술을 이용한 기초구현 결과 제조 현장 모습에서 객체들을 정상적으로 추출해 이미지를 설명할 수 있으며, 향후 객체에 대한 레이블링과 객체 간의 상호 관계를 추가해 작업자의 이상 행동을 감지하는 용도로 활용할 계획이다.

  • PDF

에지 및 형태학적 재구성에 의한 연결요소를 이용한 자연영상의 문자영역 검출 (Character Region Detection in Natural Image Using Edge and Connected Component by Morphological Reconstruction)

  • 권교현;박종천;전병민
    • 한국엔터테인먼트산업학회논문지
    • /
    • 제5권1호
    • /
    • pp.127-133
    • /
    • 2011
  • 자연영상에 내포되어 있는 문자는 다양한 내용을 표현하는 중요한 정보이다. 기존의 문자 검출 알고리즘은 영상의 복잡도와 주변의 조명, 문자와 유사한 배경색 등의 환경에서 문자영역을 검출하지 못하는 문제점이 있으므로 본 논문에서는 에지 및 형태학적 재구성에 의한 연결요소를 이용한 자연영상에 포함된 문자영역을 검출하는 방법을 제안한다. 첫 번째 단계로, 명암도 영상에서 캐니에지(Canny-Edge) 검출기를 이용한 에지 성분과 형태학적 연산에 의한 지역적 최소/최대값을 갖는 연결요소를 검출하고, 각각 검출된 연결성분을 레이블링하고, 레이블링 된 각 성분에 대해 문자가 갖는 특징을 이용한 후보 문자영역을 검출한다. 마지막으로 검출된 후보 문자 영역을 서로 합병하여 하나의 후보 문자 영역을 생성하고, 후보 문자 영역의 인접성과 유사성으로 후보 문자 영역을 검증하여 최종 문자 영역을 검출한다. 실험결과 제안한 에지 및 연결요소 성분을 이용한 방법은 문자영역 검출의 정확성이 개선되었다.