• 제목/요약/키워드: Big Data Clustering

검색결과 146건 처리시간 0.035초

주변 확률을 고려하지 않는 확률적 흥미도 측도 계열 유사성 측도의 서열화 (A study on the ordering of PIM family similarity measures without marginal probability)

  • 박희창
    • Journal of the Korean Data and Information Science Society
    • /
    • 제26권2호
    • /
    • pp.367-376
    • /
    • 2015
  • 데이터마이닝 기법 중의 하나인 군집분석은 다양한 특성을 지닌 관찰대상에 대해 유사성을 바탕으로 동질적인 군집으로 묶은 후, 동일 군집에 속해 있는 공통된 특성을 조사하는데 이용되는 기법이다. 본 논문에서는 주변 확률을 고려하지 않는 확률적 흥미도 측도 기반 유사성 측도인 Yule I과 II, Michael, Digby, Baulieu, 그리고 Dispersion 측도에 대해 상한 및 하한을 설정함으로써 이들의 대소관계를 규명하였다. 그 결과, 세 가지 유형의 대소 관계가 성립한다는 사실을 수식의 증명뿐만 아니라 실제 데이터 및 모의실험 데이터에 의해서도 확인할 수 있었다. 이들 측도들은 각 경계에 있는 측도와는 더욱 더 유사한 값을 가지므로 각 측도의 상한 및 하한은 여러 가지 측도들을 분류하는 도구가 되며, 실제 값의 관점에서 각 측도들의 관계를 알게 되면 주어진 알고리즘의 안정화에 도움이 될 수 있을 것이다.

K-평균 군집을 이용한 마이크로타겟팅을 위한 SNS 빅데이터 활용 모델링에 관한 연구 (A Study on the Application Modeling of SNS Big-data for a Micro-Targeting using K-Means Clustering)

  • 송재오;이상문
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2015년도 제51차 동계학술대회논문집 23권1호
    • /
    • pp.321-324
    • /
    • 2015
  • 본 논문에서는 SNS에 존재하는 특정 제품과 브랜드 또는 기업에 대한 평가, 의견, 느낌, 사용 후기 등의 소비자 생각을 수집하여 기업에서 향후 신제품 개발이나 시장 진출 및 확대 등의 경영활동에 활용할 수 있도록 SNS 빅데이터를 문석하고, 이를 활용하여 보다 소집단화 되고 개인화 되어가는 Micro-Trend 중심의 마케팅 활동을 할 수 있는 Micro-Targeting 관련 분석 정보를 제공 모델링하는 것을 제안한다. 본 연구에서는 SNS 데이터의 수집, 저장, 분석에 대한 내용을 다루고 있으며, 특히 마이크로타겟팅을 위한 정보를 머하웃(Mahout)의 유클리드 거리 기반의 유사도와 K-평균 군집 알고리즘을 활용하여 구현하고자 하였다.

  • PDF

금융 빅 데이터를 이용한 주식수익률 행태 분석 (An Analysis of Stock Return Behavior using Financial Big Data)

  • 정헌용;김상식
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2014년도 추계학술대회
    • /
    • pp.708-710
    • /
    • 2014
  • 최근 금융 분야에서는 빅 데이터를 이용하여 주가예측 모형을 만들어내고 있으며, 특히 금융 시계열 자료의 변동성 집중 현상을 금융 빅 데이터를 이용하여 분석함으로써 세계 주식시장의 동조화 현상을 분석하고 있다. 본 논문에서는 한국과 중국의 일별 주가지수수익률과 일중 주가지수수익률을 이용하여 이들 2개 국가의 대표적인 주가지수 시계열 데이터에 변동성 집중 현상이 존재하는지를 보다 세밀하게 추적하여 양국 주식시장의 동조화 현상을 분석한다. 분석 결과, 한국의 KOSPI와 중국의 Shanghai 종합주가지수의 지수수익률 시계열 자료는 단위근이 존재하지 않으며, 변동성 집중 현상을 보이는 것으로 나타났다. 또한 한국보다는 중국 주식시장의 변동성 집중현상이 보다 강하게 나타나며, 이러한 현상은 일중 주가지수수익률 시계열 자료에서 보다 두드러지게 나타났다.

  • PDF

A Implementation of Optimal Multiple Classification System using Data Mining for Genome Analysis

  • Jeong, Yu-Jeong;Choi, Gwang-Mi
    • 한국컴퓨터정보학회논문지
    • /
    • 제23권12호
    • /
    • pp.43-48
    • /
    • 2018
  • In this paper, more efficient classification result could be obtained by applying the combination of the Hidden Markov Model and SVM Model to HMSV algorithm gene expression data which simulated the stochastic flow of gene data and clustering it. In this paper, we verified the HMSV algorithm that combines independently learned algorithms. To prove that this paper is superior to other papers, we tested the sensitivity and specificity of the most commonly used classification criteria. As a result, the K-means is 71% and the SOM is 68%. The proposed HMSV algorithm is 85%. These results are stable and high. It can be seen that this is better classified than using a general classification algorithm. The algorithm proposed in this paper is a stochastic modeling of the generation process of the characteristics included in the signal, and a good recognition rate can be obtained with a small amount of calculation, so it will be useful to study the relationship with diseases by showing fast and effective performance improvement with an algorithm that clusters nodes by simulating the stochastic flow of Gene Data through data mining of BigData.

DBSCAN 기반의 제조 공정 데이터 불량 위치의 검출 (Detection of the Defected Regions in Manufacturing Process Data using DBSCAN)

  • 최은석;김정훈;아지즈 나스리디노프;이상현;강정태;류관희
    • 한국콘텐츠학회논문지
    • /
    • 제17권7호
    • /
    • pp.182-192
    • /
    • 2017
  • 제조 산업은 국가 경제 성장의 원동력으로 그 중요성이 부각되고 있다. 이에 따라 제조 공정상에서 생성되는 제조 데이터 분석의 중요성 또한 조명 받고 있다. 본 논문에서는 PCB(Printed Circuit Board) 제조 공정에서 발생한 로그 데이터를 분석하여 PCB 상에서 빈번하게 발생하는 고장 영역에 대해서 작업자가 고장 영역을 직접 눈으로 볼 수 있도록 시각화하는 방법을 제안한다. 우선 고장 영역을 파악하기 위해서 PCB 공정 데이터 집합에 K-means, DB-SCAN 클러스터링 알고리즘을 적용하여 군집화 하였고, 두 알고리즘 중 더 정확한 고장 영역을 도출하는지 비교하였다. 또한 MVC(Model-View-Controller) 구조 시스템을 개발하여 실제 PCB 이미지 상에 클러스터링 결과를 출력하는 것으로 실제 고장영역을 눈으로 확인할 수 있도록 시각화하였다.

대학생의 그릿 군집 유형에 따른 성격 5요인, 학업적응 및 심리적 안녕감의 차이 (The Differences of Big-Five Personality Factors, Academic Adaptation, and Psychological Well-Being According to Grit Cluster Types in College Students)

  • 김은혜;김민정;김지혜
    • 한국학교ㆍ지역보건교육학회지
    • /
    • 제21권1호
    • /
    • pp.75-89
    • /
    • 2020
  • Objects: The purpose of this study was to examine the differences of college students' big-five personality factors, academic adaptation, and psychological well-being according to cluster types based on the grit. Methods: The participants of this study were 190 college students. All variables were evaluated by self-report of college students. The data were analyzed by one-way ANOVA and two-step clustering statistics using SPSS 21.0. Results: First, a cluster analysis on a sample of 190 college students revealed four clusters: the more highly grit group, higher tenacity group, higher consistency of interests, and the less grit group. Second, there were significant differences of 190 college students' big five personality factors, academic adaptation, and psychological well-being according to cluster types based on the grit. Conclusions: These findings can be used as an important contribution to further research and educational practices for promoting the grit in college students. Also it suggests the need for health education to increase the psychological well-being of college students.

Comparative analysis of model performance for predicting the customer of cafeteria using unstructured data

  • Seungsik Kim;Nami Gu;Jeongin Moon;Keunwook Kim;Yeongeun Hwang;Kyeongjun Lee
    • Communications for Statistical Applications and Methods
    • /
    • 제30권5호
    • /
    • pp.485-499
    • /
    • 2023
  • This study aimed to predict the number of meals served in a group cafeteria using machine learning methodology. Features of the menu were created through the Word2Vec methodology and clustering, and a stacking ensemble model was constructed using Random Forest, Gradient Boosting, and CatBoost as sub-models. Results showed that CatBoost had the best performance with the ensemble model showing an 8% improvement in performance. The study also found that the date variable had the greatest influence on the number of diners in a cafeteria, followed by menu characteristics and other variables. The implications of the study include the potential for machine learning methodology to improve predictive performance and reduce food waste, as well as the removal of subjective elements in menu classification. Limitations of the research include limited data cases and a weak model structure when new menus or foreign words are not included in the learning data. Future studies should aim to address these limitations.

Modeling Large S-System using Clustering and Genetic Algorithm

  • Jung, Sung-Won;Lee, Kwang-H.;Lee, Co-Heon
    • 한국생물정보학회:학술대회논문집
    • /
    • 한국생물정보시스템생물학회 2005년도 BIOINFO 2005
    • /
    • pp.197-201
    • /
    • 2005
  • When we want to find out the regulatory relationships between genes from gene expression data, dimensionality is one of the big problem. In general, the size of search space in modeling the regulatory relationships grows in O(n$^2$) while the number of genes is increasing. However, hopefully it can be reduced to O(kn) with selected k by applying divide and conquer heuristics which depend on some assumptions about genetic network. In this paper, we approach the modeling problem in divide-and-conquer manner. We applied clustering to make the problem into small sub-problems, then hierarchical model process is applied to those small sub-problems.

  • PDF

온라인 음악 콘텐츠 추천 시스템 구현을 위한 협업 필터링 기법들의 비교 평가 (Evaluation of Collaborative Filtering Methods for Developing Online Music Contents Recommendation System)

  • 유영석;김지연;손방용;정종진
    • 전기학회논문지
    • /
    • 제66권7호
    • /
    • pp.1083-1091
    • /
    • 2017
  • As big data technologies have been developed and massive data have exploded from users through various channels, CEO of global IT enterprise mentioned core importance of data in next generation business. Therefore various machine learning technologies have been necessary to apply data driven services but especially recommendation has been core technique in viewpoint of directly providing summarized information or exact choice of items to users in information flooding environment. Recently evolved recommendation techniques have been proposed by many researchers and most of service companies with big data tried to apply refined recommendation method on their online business. For example, Amazon used item to item collaborative filtering method on its sales distribution platform. In this paper, we develop a commercial web service for suggesting music contents and implement three representative collaborative filtering methods on the service. We also produce recommendation lists with three methods based on real world sample data and evaluate the usefulness of them by comparison among the produced result. This study is meaningful in terms of suggesting the right direction and practicality when companies and developers want to develop web services by applying big data based recommendation techniques in practical environment.

저자동시인용분석에 의한 Business Analytics 분야의 지적 구조 분석: 2002 ~ 2020 (The Intellectual Structure of Business Analytics by Author Co-citation Analysis : 2002 ~ 2020)

  • 임혜정;서창교
    • 한국정보시스템학회지:정보시스템연구
    • /
    • 제30권1호
    • /
    • pp.21-44
    • /
    • 2021
  • Purpose The opportunities and approaches to big data have grown in various ways in the digital era. Business analytics is nowadays an inevitable strategy for organizations to earn a competitive advantage in order to survive in the challenged environments. The purpose of this study is to analyze the intellectual structure of business analytics literature to have a better insight for the organizations to the field. Design/methodology/approach This research analyzed with the data extracted from the database Web of Science. Total of 427 documents and 23,760 references are inserted into the analysis program CiteSpace. Author co-citation analysis is used to analyze the intellectual structure of the business analytics. We performed clustering analysis, burst detection and timeline analysis with the data. Findings We identified seven sub- areas of business analytics field. The top four sub-areas are "Big Data Analytics Infrastructure", "Performance Management System", "Interactive Exploration", and "Supply Chain Management". We also identified the top 5 references with the strongest citation bursts including Trkman et al.(2010) and Davenport(2006). Through timeline analysis we interpret the clusters that are expected to be the trend subjects in the future. Lastly, limitation and further research suggestion are discussed as concluding remarks.