• 제목/요약/키워드: Noise Classification

검색결과 669건 처리시간 0.027초

생성-선정을 통한 텍스트 증강 프레임워크 (TAGS: Text Augmentation with Generation and Selection)

  • 김경민;김동환;조성웅;오흥선;황명하
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제12권10호
    • /
    • pp.455-460
    • /
    • 2023
  • 텍스트 증강은 자연어처리 모델의 성능 향상을 목적으로 원본 텍스트의 변환, 생성을 통하여 새로운 증강 텍스트를 생성하는 방법론이다. 기존 연구된 기법들은 표현적 다양성 부족, 의미 왜곡 , 한정적인 양의 증강 텍스트와 같은 한계점이 존재한다. 거대언어모델과 few-shot learning을 활용한 텍스트 증강은 이러한 한계점의 극복이 가능하지만, 잘못된 생성으로 인한 노이즈 발생의 위험성이 존재한다. 본 논문에서는 여러 후보 텍스트를 생성하고 적합한 텍스트를 증강 텍스트로 선정하는 TAGS를 제안한다. TAGS는 기존 텍스트 few shot learning을 통해 다양한 표현을 생성하면서 대조 학습과 유사도 비교를 통해 원본 텍스트가 적더라도 적합한 데이터를 효과적으로 선정한다. 이를 텍스트 증강이 필수적인 업무용 챗봇 데이터에 적용하여 60배 이상의 양적 향상을 달성하였다. 또한 증강 텍스트의 질적 향상을 확인하기 위해 실제 생성된 텍스트를 분석하여 원본 텍스트에 비해 의미론적, 표현적으로 다양한 텍스트를 생성함을 확인하였으며, 증강 텍스트로 실제 분류 모델을 학습하고 실험하여 실질적으로 자연어처리 모델 성능 향상에 도움이 되는 것을 확인하였다.

중증 장애우용 음성구동 휠체어를 위한 강인한 음성인식 알고리즘 (Robust Speech Recognition Algorithm of Voice Activated Powered Wheelchair for Severely Disabled Person)

  • 석수영;정현열
    • 한국음향학회지
    • /
    • 제26권6호
    • /
    • pp.250-258
    • /
    • 2007
  • 현재의 음성인식 기술은 하드웨어 기술의 발전과 더불어 여러 분야에 응용되고 있지만 음성구동 휠체어와 같은 고신뢰성이 요구되는 응용분야에서는 아직도 그 성능이 불충분하다. 실 환경에서 음성을 통해 안전하게 휠체어를 제어하기 위해서는 도로의 소음 등과 같은 주변잡음의 영향에 의한 음성인식 성능의 저하, 사용자의 기침소리나 숨소리 등과 같은 비음성 입력시의 오동작, 명령어의 불명확한 발성과 일반인과는 다른 발성 속도 및 발성 주파수 등을 고려한 인식시스템이 필요하다. 이를 위하여 본 논문에서는 비음성 입력시의 오동작을 방지하기 위해 인식기의 전처리 단에서 YIN 기본주파수 추출방법을 적용한 후 프레임 별 신뢰도에 기반한 고정도로 음성/비음성을 판별할 수 있는 방법을 제안하고, 불명확한발성에 대한 인식 성능 향상을 위해 화자 적응화 방법 및 개인적인 발성 변이를 표현할 수 있는 다중 후보 단어사전을 구성하여 인식성능 제고를 도모하였다. 잡음이 포함된 실 환경하에서 수집한 데이터를 대상으로 인식실험을 수행한 결과 기존의 켑스트럼 방법에서는 오류 없이 비음성을 찾아내는 재현율은 62%로 나타났으나 본 논문에서 제안한 YIN방법에 기반을 둔 신뢰도 측정방법에서는 95.1%를 나타나 우수한 성능을 나타내었다. 실 환경에서 수집된 2211개의 불명확한 발성을 대상으로 인식실험을 수행한 결과 2000상태 16 혼합수 HMnet 모델을 이용한 경우 인식률이 78.6%로 나타났으나 MAP적응화 방법 및 다중 후보 인식사전을 적용한 결과 99.5%의 인식 성능을 나타내어 제안한 방법의 유효성을 확인할 수 있었다.

Fully Automatic Coronary Calcium Score Software Empowered by Artificial Intelligence Technology: Validation Study Using Three CT Cohorts

  • June-Goo Lee;HeeSoo Kim;Heejun Kang;Hyun Jung Koo;Joon-Won Kang;Young-Hak Kim;Dong Hyun Yang
    • Korean Journal of Radiology
    • /
    • 제22권11호
    • /
    • pp.1764-1776
    • /
    • 2021
  • Objective: This study aimed to validate a deep learning-based fully automatic calcium scoring (coronary artery calcium [CAC]_auto) system using previously published cardiac computed tomography (CT) cohort data with the manually segmented coronary calcium scoring (CAC_hand) system as the reference standard. Materials and Methods: We developed the CAC_auto system using 100 co-registered, non-enhanced and contrast-enhanced CT scans. For the validation of the CAC_auto system, three previously published CT cohorts (n = 2985) were chosen to represent different clinical scenarios (i.e., 2647 asymptomatic, 220 symptomatic, 118 valve disease) and four CT models. The performance of the CAC_auto system in detecting coronary calcium was determined. The reliability of the system in measuring the Agatston score as compared with CAC_hand was also evaluated per vessel and per patient using intraclass correlation coefficients (ICCs) and Bland-Altman analysis. The agreement between CAC_auto and CAC_hand based on the cardiovascular risk stratification categories (Agatston score: 0, 1-10, 11-100, 101-400, > 400) was evaluated. Results: In 2985 patients, 6218 coronary calcium lesions were identified using CAC_hand. The per-lesion sensitivity and false-positive rate of the CAC_auto system in detecting coronary calcium were 93.3% (5800 of 6218) and 0.11 false-positive lesions per patient, respectively. The CAC_auto system, in measuring the Agatston score, yielded ICCs of 0.99 for all the vessels (left main 0.91, left anterior descending 0.99, left circumflex 0.96, right coronary 0.99). The limits of agreement between CAC_auto and CAC_hand were 1.6 ± 52.2. The linearly weighted kappa value for the Agatston score categorization was 0.94. The main causes of false-positive results were image noise (29.1%, 97/333 lesions), aortic wall calcification (25.5%, 85/333 lesions), and pericardial calcification (24.3%, 81/333 lesions). Conclusion: The atlas-based CAC_auto empowered by deep learning provided accurate calcium score measurement as compared with manual method and risk category classification, which could potentially streamline CAC imaging workflows.

위성영상의 방사적 특성을 고려한 구름 탐지 방법 개발 (Development of Cloud Detection Method Considering Radiometric Characteristics of Satellite Imagery)

  • 서원우;강홍기;윤완상;임평채;이수암;김태정
    • 대한원격탐사학회지
    • /
    • 제39권6_1호
    • /
    • pp.1211-1224
    • /
    • 2023
  • 구름은 광학위성을 이용한 국토 관측 및 재난 대응, 변화 탐지 등 지표의 현상을 관측하는데 있어 많은 어려운 문제를 야기한다. 구름의 존재는 영상 처리 단계 뿐만 아니라 최종적으로는 데이터의 품질에 영향을 미치므로 이를 반드시 식별하고 제거하는 과정이 필요하다. 따라서 본 연구에서는 위성영상 내 구름의 분광패턴에 가장 근접한 화소를 탐색 및 추출해 최적의 임계값을 선정하고 임계값을 바탕으로 구름 산출물을 제작하는 일련의 과정을 자동으로 수행하는 새로운 구름 탐지 기법을 개발하고자 하였다. 구름 탐지 기법은 크게 세 단계로 구성된다. 첫 번째 단계에서는 Digital Number (DN) 단위 영상을 대기상층 반사율 단위로 변환하는 과정을 수행한다. 두 번째 단계에서는 대기상층 반사율 영상을 이용하여 Hue-Value-Saturation (HSV) 변환 및 삼각형 임계 처리, 최대우도 분류 등의 전처리를 적용하고 각 영상별로 초기 구름 마스크 생성을 위한 임계값을 결정한다. 세번째 후처리 단계에서는 생성된 초기 구름 마스크에 포함된 노이즈를 제거하고 구름 경계 및 내부를 개선한다. 구름 탐지를 위한 실험 자료로 구름의 공간적, 계절적 분포의 다양성을 보여주는 4~11월 시기에 한반도 지역에서 촬영된 국토위성 L2G 영상을 사용하였다. 제안 방법의 성능을 검증하기 위해 단일 임계화 방법으로 생성된 결과를 비교하였다. 실험 결과, 제안 방법은 기존 방법과 비교하여 전처리 과정을 통해 각 영상의 방사학적 특성을 고려할 수 있어 보다 정확하게 구름을 검출할 수 있었다. 또한, 구름 개체를 제외한 나머지 밝은 물체(판넬식 지붕, 콘크리트 도로, 모래 등)의 영향을 최소화하는 결과를 보여주었다. 제안 방법은 기존 방법 대비 F1-score 기준으로 30% 이상의 개선된 결과를 보여주었으나 눈이 포함된 특정 영상에서 한계점이 있었다.

Sentinel-1 위성 영상을 활용한 침수 탐지 기법 방법론 비교 연구 (Comparative study of flood detection methodologies using Sentinel-1 satellite imagery)

  • 이성우;김완엽;이슬찬;정하규;박종수;최민하
    • 한국수자원학회논문집
    • /
    • 제57권3호
    • /
    • pp.181-193
    • /
    • 2024
  • 기후변화에 의해 발생하는 대기 불균형은 강우량의 증가로 이어지고, 침수 발생 빈도가 증가함에 따라 이를 탐지할 수 있는 기술의 필요성이 증가하고 있다. 침수 피해를 최소화하기 위해 지속적인 모니터링이 필요하며, 날씨의 영향을 받지 않는 합성개구레이더(Synthetic Aperture Radar, SAR) 영상을 활용하여 침수지역을 탐지하였다. 관측된 데이터는 median 필터를 통해 노이즈를 감소시키는 전처리 과정을 진행하였으며, 객체 탐지 기법을 통해 수체와 비수체를 분류하여 각 기법의 침수탐지 활용성을 평가하고자 하였다. 본 연구에서는 Otsu 기법과 SVM 기법을 통해 수체 및 침수 탐지를 수행하였으며, Confusion Matrix를 통해 전체적인 모델의 성능을 평가하였다. Otsu 기법은 수체와 비수체의 경계를 구분하는데 적합함을 보였으나, 혼합물의 영향을 받아 오탐지의 비율이 높게 나타났다. 반면, SVM 기법을 사용한 경우, 오탐지 비율이 낮고 혼합물에 의한 영향에 민감하지 않은 것으로 관측되었다. 이에 따라 침수 상태를 제외한 다른 조건에서 SVM 기법의 정확도가 높게 나타났다. Otsu 기법이 침수 조건에서 SVM 기법보다 다소 높은 정확도를 보였지만, 정확도의 차이가 5% 미만임을 확인할 수 있었다(Otsu: 0.93, SVM: 0.90). SVM 기법이 Otsu 기법보다 침수 전, 침수 후의 조건에서 정확도 차이가 최대 15% 이상 발생하여 수체 및 침수탐지에 더 적합하게 나타났다(Otsu: 0.77, SVM: 0.92). 이러한 결과는 SVM 기법이 수체 및 침수탐지에서 효과적으로 활용될 수 있음을 시사하며, 미래의 수재해 탐지 시스템에 적용될 때 유용한 정보를 제공할 수 있을 것으로 기대된다.

캠페인 효과 제고를 위한 자기 최적화 변수 선택 알고리즘 (Self-optimizing feature selection algorithm for enhancing campaign effectiveness)

  • 서정수;안현철
    • 지능정보연구
    • /
    • 제26권4호
    • /
    • pp.173-198
    • /
    • 2020
  • 최근 온라인의 비약적인 활성화로 캠페인 채널들이 다양하게 확대되면서 과거와는 비교할 수 없을 수준의 다양한 유형들의 캠페인들이 기업에서 수행되고 있다. 하지만, 고객의 입장에서는 중복 노출로 인한 캠페인에 대한 피로감이 커지면서 스팸으로 인식하는 경향이 있고, 기업입장에서도 캠페인에 투자하는 비용은 점점 더 늘어났지만 실제 캠페인 성공률은 오히려 더 낮아지고 있는 등 캠페인 자체의 효용성이 낮아지고 있다는 문제점이 있어 실무적으로 캠페인의 효과를 높이고자 하는 다양한 연구들이 지속되고 있다. 특히 최근에는 기계학습을 이용하여 캠페인의 반응과 관련된 다양한 예측을 해보려는 시도들이 진행되고 있는데, 이 때 캠페인 데이터의 다양한 특징들로 인해 적절한 특징을 선별하는 것은 매우 중요하다. 전통적인 특징 선택 기법으로 탐욕 알고리즘(Greedy Algorithm) 중 SFS(Sequential Forward Selection), SBS(Sequential Backward Selection), SFFS(Sequential Floating Forward Selection) 등이 많이 사용되었지만 최적 특징만을 학습하는 모델을 생성하기 때문에 과적합의 위험이 크고, 특징이 많은 경우 분류 예측 성능 하락 및 학습시간이 많이 소요된다는 한계점이 있다. 이에 본 연구에서는 기존의 캠페인에서의 효과성 제고를 위해 개선된 방식의 특징 선택 알고리즘을 제안한다. 본 연구의 목적은 캠페인 시스템에서 처리해야 하는 데이터의 통계학적 특성을 이용하여 기계 학습 모델 성능 향상의 기반이 되는 특징 부분 집합을 탐색하는 과정에서 기존의 SFFS의 순차방식을 개선하는 것이다. 구체적으로 특징들의 데이터 변형을 통해 성능에 영향을 많이 끼치는 특징들을 먼저 도출하고 부정적인 영향을 미치는 특징들은 제거를 한 후 순차방식을 적용하여 탐색 성능에 대한 효율을 높이고 일반화된 예측이 가능하도록 개선된 알고리즘을 적용하였다. 실제 캠페인 데이터를 이용해 성능을 검증한 결과, 전통적인 탐욕알고리즘은 물론 유전자알고리즘(GA, Genetic Algorithm), RFE(Recursive Feature Elimination) 같은 기존 모형들 보다 제안된 모형이 보다 우수한 탐색 성능과 예측 성능을 보임을 확인할 수 있었다. 또한 제안 특징 선택 알고리즘은 도출된 특징들의 중요도를 제공하여 예측 결과의 분석 및 해석에도 도움을 줄 수 있다. 이를 통해 캠페인 유형별로 중요 특징에 대한 분석과 이해가 가능할 것으로 기대된다.

주성분분석을 이용한 토끼 망막 신경절세포의 활동전위 파형 분류 (PCA­based Waveform Classification of Rabbit Retinal Ganglion Cell Activity)

  • 진계환;조현숙;이태수;구용숙
    • 한국의학물리학회지:의학물리
    • /
    • 제14권4호
    • /
    • pp.211-217
    • /
    • 2003
  • 주성분분석은 잘 알려진 데이터 분석 방법으로써 높은 차원의 데이터를 낮은 차원의 데이터로 표현하는데 효과적이어서 얼굴인식, 데이터 압축 등에 이용되고 있다. 주성분분석을 하게 되면 원 데이터의 공분산 행렬로부터 정규직교한 고유벡터와 해당하는 고유치를 얻게 되고 그 중 큰 값을 가지는 고유벡터 들을 선택하여 선형 변환함으로써 데이터의 차원을 줄일 수 있게 된다. 망막에 빛 자극이 인가되면 시세포 층에서 전기신호로 변환된 후 복잡한 신경회로를 거쳐 최종적으로 신경절세포 층에서 활동전위의 형태로 출력되게 된다. 본 연구에서는 다채널전극을 사용하여 여러 개 망막 신경절세포로부터 유래되는 활동전위를 기록한 후 개개의 신호를 구분하는 과정을 거치고, 이어서 그 신호를 만들어 내는 각 뉴론들끼리의 시간적, 공간적 흥분발사 패턴을 이해함으로써 궁극적으로 시각정보 인코딩 기전을 밝히려는 연구 목표하에 그 첫 단계로서 망막 신경절세포의 활동전위를 기록한 후 분류하는 과정을 성공적으로 수행하였기에 그 내용을 서술하고자 한다. 망막에서 기록되는 신경절세포 활동전위는 불규칙하고 확률적이기 때문에 주성분분석을 통하여 그 유형을 분류할 수 있었다. 토끼 눈으로부터 망막을 박리하여 망막조각을 얻은 후 신경절세포 층이 전극표면을 향하도록 전극에 부착하였다. 8${\times}$8의 microelectrode array (MEA)를 전극으로 사용하였고, 증폭기는 MEA 60 system을 사용하여 신경절세포 활동전위를 기록하였다. 활동전위 기록 후 파형 분류를 하였다. 잡음이 섞여있는 기록으로부터 신호를 검출하기 위하여, 잡음역치($\pm$3$\sigma$)를 설정하였다. 역치를 넘는 파형 만을 획득한 후 주성분분석을 통해 각 파형의 첫 번째 주성분, 두 번째 주성분을 계산하여 2차원 평면에 투사함으로써 몇 개의 의미있는 클러스터를 얻었다. 이 클러스터는 곧 각 신경절세포에서 유래되는 파형을 반영하므로 주성분분석을 통하여 망막 신경절세포의 활동전위를 각 세포별로 분류할 수 있음을 확인하였다.

  • PDF

유전자 알고리즘을 이용한 분류자 앙상블의 최적 선택 (Optimal Selection of Classifier Ensemble Using Genetic Algorithms)

  • 김명종
    • 지능정보연구
    • /
    • 제16권4호
    • /
    • pp.99-112
    • /
    • 2010
  • 앙상블 학습은 분류 및 예측 알고리즘의 성과개선을 위하여 제안된 기계학습 기법이다. 그러나 앙상블 학습은 기저 분류자의 다양성이 부족한 경우 다중공선성 문제로 인하여 성과개선 효과가 미약하고 심지어는 성과가 악화될 수 있다는 문제점이 제기되었다. 본 연구에서는 기저 분류자의 다양성을 확보하고 앙상블 학습의 성과개선 효과를 제고하기 위하여 유전자 알고리즘 기반의 범위 최적화 기법을 제안하고자 한다. 본 연구에서 제안된 최적화 기법을 기업 부실예측 인공신경망 앙상블에 적용한 결과 기저 분류자의 다양성이 확보되고 인공신경망 앙상블의 성과가 유의적으로 개선되었음을 보여주었다.

Conditional Generative Adversarial Network(CGAN) 기반 협업 필터링 추천 시스템 (Conditional Generative Adversarial Network based Collaborative Filtering Recommendation System)

  • 강소이;신경식
    • 지능정보연구
    • /
    • 제27권3호
    • /
    • pp.157-173
    • /
    • 2021
  • 소비자의 욕구와 관심에 맞추어 개인화된 제품을 추천하는 추천 시스템은 비즈니스에 필수적인 기술로서의 그 중요성이 증가하고 있다. 추천 시스템의 대표적인 모형 중 협업 필터링은 우수한 성능으로 다양한 분야에서 활용되고 있다. 그러나 협업필터링은 사용자-아이템의 선호도 정보가 충분하지 않을 경우 성능이 저하되는 희소성의 문제가 있다. 또한 실제 평점 데이터의 경우 대부분 높은 점수에 데이터가 편향되어 있어 심한 불균형을 갖는다. 불균형 데이터에 협업 필터링을 적용할 경우 편향된 클래스에 과도하게 학습되어 추천 성능이 저하된다. 이러한 문제를 해결하기 위해 많은 선행연구들이 진행되어 왔지만 추가적인 외부 데이터 또는 기존의 전통적인 오버샘플링 기법에 의존한 추천을 시도하였기에 유용성이 떨어지고 추천 성능 측면에서 한계점이 있었다. 본 연구에서는 CGAN을 기반으로 협업 필터링 구현 시 발생하는 희소성 문제를 해결함과 동시에 실제 데이터에서 발생하는 데이터 불균형을 완화하여 추천의 성능을 높이는 것을 목표로 한다. CGAN을 이용하여 비어있는 사용자-아이템 매트릭스에 실제와 흡사한 가상의 데이터를 생성하여, 희소성을 가지고 있는 기존의 매트릭스로만 학습한 것과 비교했을 때 높은 정확도가 예상된다. 이 과정에서 Condition vector y를 이용하여 소수 클래스에 대한 분포를 파악하고 그 특징을 반영하여 데이터를 생성하였다. 이후 협업 필터링을 적용하고, 하이퍼파라미터 튜닝을 통해 추천 시스템의 성능을 최대화하는데 기여하였다. 비교 대상으로는 전통적인 오버샘플링 기법인 SMOTE, BorderlineSMOTE, SVM-SMOTE, ADASYN와 GAN을 사용하였다. 결과적으로 데이터 희소성을 가지고 있는 기존의 실제 데이터뿐만 아니라 기존 오버샘플링 기법들보다 제안 모형의 추천 성능이 우수함을 확인하였으며, RMSE, MAE 평가 척도에서 가장 높은 예측 정확도를 나타낸다는 사실을 증명하였다.