• 제목/요약/키워드: supervised clustering

검색결과 112건 처리시간 0.029초

비음수 행렬 분해와 동적 분류 체계를 사용한 자동 이메일 다원 분류 (Automatic Email Multi-category Classification Using Dynamic Category Hierarchy and Non-negative Matrix Factorization)

  • 박선;안동언
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제37권5호
    • /
    • pp.378-385
    • /
    • 2010
  • 이메일 사용의 증가로 수신 메일을 효율적이면서 정확하게 분류할 필요성이 점차 늘고 있다. 현재의 이메일 분류는 SVM, 베이지안 분류자, 규칙 기반 분류자 등을 이용하여 스팸 메일을 필터링하기 위한 이원 분류가 주를 이루고 있다. 그러나 이러한 지도 학습 방법들은 적합한 이메일을 인식하기 위하여서 사용자가 규칙이나 색인어 목록을 작성해야 한다. 비지도 학습 방법으로 군집을 이용한 다원 분류 방법은 메일의 분류 주제를 설정해주어야 한다. 본 논문에서는 비음수 행렬 분해(NMF, Non-negative Matrix Factorization)를 기반으로 한 자동 분류 주제 생성 방법과, 동적 분류 체계(DCH, Dynamic Category Hierarchy) 방법을 이용한 분류 주제 내에 이메일을 재구성하는 방법을 결합한 새로운 이메일 다원 분류 방법을 제안한다. 이 방법은 수신되는 이메일을 자동으로 다원 분류하여 대량의 메일을 효율적으로 관리할 수 있으며, 사용자가 분류 결과를 만족하지 못하면 분류 주제 내의 이메일을 동적으로 재구성하여 분류의 정확률을 높인다.

Medical Image Analysis Using Artificial Intelligence

  • Yoon, Hyun Jin;Jeong, Young Jin;Kang, Hyun;Jeong, Ji Eun;Kang, Do-Young
    • 한국의학물리학회지:의학물리
    • /
    • 제30권2호
    • /
    • pp.49-58
    • /
    • 2019
  • Purpose: Automated analytical systems have begun to emerge as a database system that enables the scanning of medical images to be performed on computers and the construction of big data. Deep-learning artificial intelligence (AI) architectures have been developed and applied to medical images, making high-precision diagnosis possible. Materials and Methods: For diagnosis, the medical images need to be labeled and standardized. After pre-processing the data and entering them into the deep-learning architecture, the final diagnosis results can be obtained quickly and accurately. To solve the problem of overfitting because of an insufficient amount of labeled data, data augmentation is performed through rotation, using left and right flips to artificially increase the amount of data. Because various deep-learning architectures have been developed and publicized over the past few years, the results of the diagnosis can be obtained by entering a medical image. Results: Classification and regression are performed by a supervised machine-learning method and clustering and generation are performed by an unsupervised machine-learning method. When the convolutional neural network (CNN) method is applied to the deep-learning layer, feature extraction can be used to classify diseases very efficiently and thus to diagnose various diseases. Conclusions: AI, using a deep-learning architecture, has expertise in medical image analysis of the nerves, retina, lungs, digital pathology, breast, heart, abdomen, and musculo-skeletal system.

Arabic Stock News Sentiments Using the Bidirectional Encoder Representations from Transformers Model

  • Eman Alasmari;Mohamed Hamdy;Khaled H. Alyoubi;Fahd Saleh Alotaibi
    • International Journal of Computer Science & Network Security
    • /
    • 제24권2호
    • /
    • pp.113-123
    • /
    • 2024
  • Stock market news sentiment analysis (SA) aims to identify the attitudes of the news of the stock on the official platforms toward companies' stocks. It supports making the right decision in investing or analysts' evaluation. However, the research on Arabic SA is limited compared to that on English SA due to the complexity and limited corpora of the Arabic language. This paper develops a model of sentiment classification to predict the polarity of Arabic stock news in microblogs. Also, it aims to extract the reasons which lead to polarity categorization as the main economic causes or aspects based on semantic unity. Therefore, this paper presents an Arabic SA approach based on the logistic regression model and the Bidirectional Encoder Representations from Transformers (BERT) model. The proposed model is used to classify articles as positive, negative, or neutral. It was trained on the basis of data collected from an official Saudi stock market article platform that was later preprocessed and labeled. Moreover, the economic reasons for the articles based on semantic unit, divided into seven economic aspects to highlight the polarity of the articles, were investigated. The supervised BERT model obtained 88% article classification accuracy based on SA, and the unsupervised mean Word2Vec encoder obtained 80% economic-aspect clustering accuracy. Predicting polarity classification on the Arabic stock market news and their economic reasons would provide valuable benefits to the stock SA field.

악성코드 패킹유형 자동분류 기술 연구 (A Study on Automatic Classification Technique of Malware Packing Type)

  • 김수정;하지희;이태진
    • 정보보호학회논문지
    • /
    • 제28권5호
    • /
    • pp.1119-1127
    • /
    • 2018
  • 대부분의 침해공격은 악성코드를 통해 발생하고 있으며, 침해공격으로 인한 피해는 사물인터넷/사이버 물리 시스템과 연결되면서 사이버공간에만 국한되지 않고 실생활에 큰 위협이 되고 있다. 이에 따라, 다양한 악성코드 동적분석, 정적분석기술들이 연구되었는데, 악성코드 동적분석들은 결과적인 악성행위를 쉽게 확인할 수 있어 널리 사용되었으나 VM 환경탐지 시 동작하지 않는 anti-VM 악성코드가 증가하면서 어려움을 겪고 있고, 악성코드 정적분석기술들은 코드자체를 해석할 수 있어 많은 정보를 얻을 수 있으나 난독화, 패킹 기술들이 적용되어 분석가를 어렵게 하고 있다. 본 논문에서는 정적분석기술의 주요 장애물인 난독화 유형을 자동식별, 분류하는 기술을 제안한다. 특히, 제안하는 모델을 통해 알려진 패커나 알려지지 않은 패커와 상관없이 일정한 기준에 의해 모든 악성코드를 분류할 수 있는 것이 가능하다. 악성코드 분류는 다양한 활용이 가능하지만, 예를 들면 악성코드 정적 feature에 기반하여 머신러닝 기반 분석을 할 때, 전체 파일에 대해 학습 및 분석하는 방식보다 악성코드 유형별 학습 및 분석이 더욱 효과적일 것이다. 이를 위해, PE구조에서 활용 가능한 feature에 대해 지도 학습 및 비지도 학습 방식의 모델을 설계했고, 98,000여개 샘플을 통해 결과 검증을 진행하였다.

부분공간과 LVQ 분류기에 기반한 실시간 얼굴 인식 (Real-Time Face Recognition Based on Subspace and LVQ Classifier)

  • 권오륜;민경필;전준철
    • 인터넷정보학회논문지
    • /
    • 제8권3호
    • /
    • pp.19-32
    • /
    • 2007
  • 본 논문에서는 실시간 얼굴인증 시스템의 구축을 위한 LVQ 신경망 기반의 새로운 얼굴 인식 방법을 제안한다. 기존의 연구에서 PCA, LDA 변환이 많이 적용되며 신경망을 결합한 형태가 제안되고 있지만 신경망 학습 시간이 오래 걸리는 단점을 가지고 있다. LVQ 신경망은 학습 시간이 짧고 클래스간의 분리도를 최대화할 수 있는 교사학습방법이다. 따라서, 본 논문에서 제안된 방법은 동영상으로부터 실시간으로 입력되는 얼굴영상을 PCA와 LDA변환을 순차적으로 적용하여 부분공간상의 변환된 특징벡터로부터 LVQ 신경망의 학습을 통하여 얼굴을 인식한다. 외부조명의 영향에 강건한 인식시스템을 구축하기 위하여 얼굴검출 단계에서 검출된 얼굴영역은 밝기값의 최대-최소 정규화 방법에 의해 보정된 정규화 영상을 생성한다. 정규화된 얼굴영상은 PCA와 LDA 변환을 통해 부분공간상의 특징벡터로 변환된다. 변환된 훈련 데이터로부터 LVQ 신경망의 초기 중심 벡터를 결정하고 신경망의 학습률 향상을 위해 K-Means 클러스터링 알고리즘을 적용하며, 초기 중심 벡터를 이용하여 LVQ2 학습 방법에 의해 학습된 중심벡터는 클래스의 대표 벡터가 된다. 결국 각 클래스의 대표 벡터로부터 입력 영상의 특징벡터간의 유클리디언 거리 비교법을 적용하여 얼굴 인식을 수행한다. ORL 데이터베이스를 이용한 정지 영상에 대한 인식과 실시간으로 입력되는 영상에 대한 인식 등 두 가지 형태의 영상을 기반으로 실험한 결과 두 경우에 모두 제안된 방법이 기존의 인식 방법보다 인식률에서 우수함을 입증할 수 있었다.

  • PDF

Molecular Classification and Characterization of Human Gastric Adenocarcinoma through DNA Microarray

  • Xie, Hongjian;Eun, Jung-Woo;Noh, Ji-Heon;Jeong, Kwang-Wha;Kim, Jung-Kyu;Kim, Su-Young;Lee, Sug-Hyung;Park, Won-Sang;Yoo, Nam-Jin;Lee, Jung-Young;Nam, Suk-Woo
    • Molecular & Cellular Toxicology
    • /
    • 제3권3호
    • /
    • pp.190-194
    • /
    • 2007
  • Gastric adenocarcinoma (GA) is a major tumor type of gastric cancers and subdivides into several different tumors such as papillary, tubular mucinous, signet-ring cell and adenosquamous carcinoma according to histopatholigical determination. In other hand, GA is also subdivided into intestinal and diffuse type of adenocarcinoma by the Lauren?fs classification. In this study, we have examined differential gene expression pattern analysis of three histologically different GAs of 24 samples by using DNA microarray containing approximately 19000 genetic elements. The hierarchical clustering analysis of 24 gastric adenocarcinomas (12 of intestinal type, 7 of diffuse type and 5 of mixed type) resulted in two major subgroup on dendrogram, and two subgroups included most of intestinal and diffused type of GAs respectively. Supervised analysis of 19 intestinal and diffuse type GAs by using Wilcoxon rank T-test (P<0.01) resulted in 100 outlier genes which exactly separated intestinal and diffuse type of GA by differential gene expression. In conclusion, genome-wide analysis of gene expression of GAs suggested that GAs may subclassify as intestinal and diffused type of GA by their characteristic molecular expression. Our results also provide large-scale genetic elements which reflect molecular differences of intestinal and diffuse type of GAs, and this may facilitate to understand different molecular carcinogenesis of gastric cancer.

SELDI-TOF MS를 활용한 혈당강하 수수 종자의 펩타이드 프로파일링 및 특이 발현 펩타이드 선발 (Peptide Profiling and Selection of Specific-Expressed Peptides in Hypoglycemic Sorghum Seed using SELDI-TOF MS)

  • 박세준;황수민;박준영;고지연;김태완
    • 한국작물학회지
    • /
    • 제59권3호
    • /
    • pp.252-262
    • /
    • 2014
  • 혈당 강하를 목적으로 선발된 수수계통의 종자 유래 펩타이드의 양적, 질적 형질을 특성화하고 혈당 강하 수수에서 특이적으로 발현 펩타이드를 선발하기 위하여, 혈당 강하수수 7계통과 비 혈당 강하 수수 5계통에 대한 종자 펩타이드 프로파일링을 SELDI-TOF MS 기법을 활용하여 분석하였다. 1. 분자량의 범위가 2~20 kDa에서 검출된 수수 12계통 종자의 펩타이드는 CM10 (weak cation exchanger)에서 104개와 Q10 (strong anion exchanger)에서 95개였으며, 펩타이드 양적발현에서 12계통 간 유의성(p < 0.01)을 보인 펩타이드는 CM10에서 99개와 Q10에서 93개였다. 2. 12계통 간 양적 발현에 유의적(p < 0.01) 펩타이드를 이용한 heat map 분석에서 수수 각 계통 종자의 고유한 펩타이드 프로파일과 특이적으로 발현하는 펩타이드를 제시하고 있다. 3. 수수 12계통간의 근연거리를 이용한 군집분석에서 혈당 강하 수수 7계통과 비 혈당 강하 수수 5계통이 서로 다른 2개의 군집을 형성하였다. 4. 혈당 강하 계통에서 유의성(p < 0.00001)이 있게 발현되는 펩타이드를 29개 선정하였으며, 이중에서 혈당강하 계통에서만 공통적으로 높게 발현된 10개의 펩타이드(분자량이 2231.6, 2845.4, 2907.9, 3063.5, 3132.6, 3520.8, 4078.8, 5066.2, 5296.5, 5375.5 Da)를 선발하였다.

중소하천유역에서 Hybrid Neural Networks에 의한 수문학적 예측 (Hydrological Forecasting Based on Hybrid Neural Networks in a Small Watershed)

  • 김성원;이순탁;조정식
    • 한국수자원학회논문집
    • /
    • 제34권4호
    • /
    • pp.303-316
    • /
    • 2001
  • 본 연구에서는 중소하천수계에서 수문학적 예측을 위하여 Hybrid Neural Networks의 일종인 반경기초함수(RBF) 신경망모형이 적용되었다. RBF 신경망모형은 4종류의 매개변수로 구성되어 있으며, 지율 및 지도훈련과정으로 이루어져있다. 반경기초함수로서 가우스핵함수(GKF)가 이용되었으며, GKF의 매개변수인 중심과 폭은 K-Means 군집알고리즘에 의해 최적화 된다. 그리고 RBF 신경망모형의 매개변수인 중심, 폭, 연결강도와 편차벡터는 훈련을 통하여 최적 매개변수의 값이 결정되며, 이 매개변수들을 이용하여 모형의 검증과정이 이루어진다. RBF 신경망모형은 한국의 IHP 대표유역중 하나인 위천유역에 적용하였으며, 모형의 훈련과 검증을 위하여 10개의 강우사상을 선택하였다. 또한 RBF 신경망모형과 비교검토하기 위하여 엘만 신경망(ENN)모형을 이용하였으며, ENN 모형은 일단게 할선역전파(OSSBP) 및 탄성역전파(RBP)알고리즘으로 이루어져 있다. 모형의 훈련과 검증과정을 통하여 RBF 신경망모형이 ENN 모형보다 양호한 결과를 나타내는 것으로 분석되었다. RBF 신경망모형은 훈련시키는데 시간이 적게 들고, 이론적 배경이 부족한 수문학자들도 쉽게 사용할 수 있는 신경망모형이다.

  • PDF

기술과학 분야 학술문헌에 대한 학습집합 반자동 구축 및 자동 분류 통합 연구 (Semi-automatic Construction of Learning Set and Integration of Automatic Classification for Academic Literature in Technical Sciences)

  • 김선우;고건우;최원준;정희석;윤화묵;최성필
    • 정보관리학회지
    • /
    • 제35권4호
    • /
    • pp.141-164
    • /
    • 2018
  • 최근 학술문헌의 양이 급증하고, 융복합적인 연구가 활발히 이뤄지면서 연구자들은 선행 연구에 대한 동향 분석에 어려움을 겪고 있다. 이를 해결하기 위해 우선적으로 학술논문 단위의 분류 정보가 필요하지만 국내에는 이러한 정보가 제공되는 학술 데이터베이스가 존재하지 않는다. 이에 본 연구에서는 국내 학술문헌에 대해 다중 분류가 가능한 자동 분류 시스템을 제안한다. 먼저 한국어로 기술된 기술과학 분야의 학술문헌을 수집하고 K-Means 클러스터링 기법을 활용하여 DDC 600번 대의 중분류에 맞게 매핑하여 다중 분류가 가능한 학습집합을 구축하였다. 학습집합 구축 결과, 메타데이터가 존재하지 않는 값을 제외한 총 63,915건의 한국어 기술과학 분야의 자동 분류 학습집합이 구축되었다. 이를 활용하여 심층학습 기반의 학술문헌 자동 분류 엔진을 구현하고 학습하였다. 객관적인 검증을 위해 수작업 구축한 실험집합을 통한 실험 결과, 다중 분류에 대해 78.32%의 정확도와 72.45%의 F1 성능을 얻었다.

하이브리드 인공신경망 모형을 이용한 부도 유형 예측 (Bankruptcy Type Prediction Using A Hybrid Artificial Neural Networks Model)

  • 조남옥;김현정;신경식
    • 지능정보연구
    • /
    • 제21권3호
    • /
    • pp.79-99
    • /
    • 2015
  • 부도 예측은 회계와 재무 분야에서 꾸준히 연구되고 있는 분야이다. 초기에는 주로 다중판별분석(multiple discriminant analysis)와 로짓 분석(logit analysis)과 같은 통계적 방법을 이용하였으나, 1990년대 이후에는 경영 분야의 분류 문제를 위해 많은 연구자들이 인공신경망(back-propagation neural network), 사계기반추론(case-based reasoning), 서포트 벡터 머신(support vector machine) 등과 같은 인공지능을 통한 접근법을 이용하여 통계적 방법보다 분류 성과 측면에서 우수함을 입증해왔다. 기존의 기업의 부도에 관한 연구에서 많은 연구자들이 재무비율을 이용하여 부도 예측 모형을 구축하는 것에 초점을 맞추어왔다. 부도예측에 관한 연구가 꾸준히 진행되고 있는 반면, 부도의 세부적인 유형을 예측하여 제시하는 것에 대한 연구는 미흡한 실정이었다. 따라서 본 연구에서는 수익성, 안정성, 활동성 지표를 중심으로 국내 비외감 건설업 기업들의 부도 여부뿐만 아니라 부도의 세부적인 유형까지 예측 가능한 모형을 개발하고자 한다. 본 연구에서는 부도 유형을 예측하기 위해 두 개의 인공신경망 모형을 결합한 하이브리드 접근법을 제안하였다. 첫 번째 인공신경망 모형은 부도예측을 위한 역전파 인공신경망을 이용한 모형이며, 두 번째 인공신경망 모형은 부도 데이터를 몇 개의 유형으로 분류하는 자기조직화지도(self-organizing map)을 이용한 모형이다. 실험 결과를 통해 정의된 5개의 부도 유형인 심각한 부도(severe bankruptcy), 안정성 부족(lack of stability), 활동성 부족(lack of activity), 수익성 부족(lack of profitability), 회생 가능한 부도(recoverable bankruptcy)는 재무 비율에 따라 유형별로 상이한 특성을 갖는 것을 확인할 수 있었다. 본 연구 결과를 통해 신용 평가 분야의 연구자와 실무자들이 기업의 부도의 유형에 대한 유용한 정보를 얻을 것으로 기대한다.