• 제목/요약/키워드: big data mining

검색결과 679건 처리시간 0.024초

빅데이터 시대의 경쟁력 확보를 위한 선택과 집중

  • 임용재;백선경;연승준
    • 정보와 통신
    • /
    • 제29권11호
    • /
    • pp.3-10
    • /
    • 2012
  • 정보통신기술의 급속한 발전으로 인해 인터넷은 사회 전분야를 변화시키고 있으며 다양하고 폭넓은 이용 행태에 따라 지금 이 순간에도 엄청난 데이터를 생산해 내고 있다. 대부분의 인터넷 데이터는 제한적인 활용 이외 단순 생성과 소멸을 반복해 왔으나 최근 들어 빅데이터(Big Data)라는 핵심 키워드의 부상으로 인터넷 데이터에 대한 관심이 고조되고 있다. 과거에도 데이터 마이닝(Data Mining), 비즈니스 인텔리전스(Business Intelligence), 라이프 로그(Life Log) 등을 통해 데이터 기반의 부가가치를 창출하려는 노력은 시도되어 왔다. 그렇다면 왜 다시 빅데이터라는 이름으로 재부상 하고 있는 것일까? 이는 정보통신기술의 진화와 맞물려 새롭게 부상하고 있는 인터넷 글로벌 기업들이 지속적으로 생성되는 다양한 데이터들을 확보하고 그 속에서 숨겨진 가치를 찾고 인사이트(Insight)를 도출하려는 시도를 통해 데이터 보유와 활용이 새로운 경쟁력이 될 수 있음을 입증하고 있기 때문이다. 이러한 시도들은 빅데이터를 다양한 분야에서 중요한 이슈로 자리매김하게 하고 있다. 이러한 상황에서 과연 우리는 빅데이터 시대를 어떻게 리드하고 무엇에 집중하여야 할 것인가? 본 연구는 현재 뜨거운 감자로 부상한 빅데이터를 정의하고 빅데이터 시장분석, 사례분석, 정책분석을 통해 시사점을 도출하여 향후 다가올 빅데이터 시대의 국가경쟁력 확보를 위한 빅데이터 이니셔티브(Initiative)의 필요성과 중점 방향 등을 제언하고자 한다.

포스트 팬데믹 시대의 중고 패션 소비 인식 변화 (Changes in the Perception of Second-hand Fashion Consumption in the Post-pandemic Era)

  • 김하빈;이하경
    • 한국의류산업학회지
    • /
    • 제24권1호
    • /
    • pp.66-80
    • /
    • 2022
  • Even before the Covid-19 outbreak, the second-hand fashion market has been growing as the fashion industry strives towards sustainability. It has also accelerated due to the economic contraction caused by the pandemic. In previous studies, the second-hand market has been steadily studied; however, the research is insufficient compared to the diversified market. Therefore, this study investigates changes in consumers' perception of the second-hand fashion market affected by Covid-19. This study collected text data with the keyword 'second-hand fashion' from various blogs. We analyzed 24,000 posts before and after the Covid-19 outbreak by applying the LDA algorithm for topic modeling and content analysis. Seven and nine different topics for the period before and after the pandemic respectively were derived. The results revealed that during the pandemic the consumers realized the practical value of sustainability in their daily lives than they did before the pandemic. Furthermore, they tried to minimize transaction anxiety by using diverse platforms with advanced technology. They also realized economic value by buying and selling sneakers in the popular sneakers resale market. The results could help understand the rapidly growing second-hand fashion market during Covid-19.

Quantitative Study of Soft Masculine Trends in Contemporary Menswear Using Semantic Network Analysis

  • Tin Chun Cheung;Sun Young Choi
    • 한국의류학회지
    • /
    • 제46권6호
    • /
    • pp.1058-1073
    • /
    • 2022
  • Big data analytics and social media have shifted the way fashion trends are dictated. Fashion as a medium for expressing gender has created new concepts of masculinity in popular culture, where men are increasingly depicted in a softer style. In this study, we analyzed 2,879 menswear collections over a 10-year period from Vogue US to uncover key menswear trends. Using Semantic Network Analysis (SNA) on Orange3, we were able to quantitatively analyze how contemporary menswear designers interpreted diversified trends of masculinity on the runway. Frequency and degree centrality were measured to weigh the significance of trend keywords. "Jacket (f = 3056; DC = 0.80), shirt (f = 1912; DC = 0.60) and pant (f = 1618; DC = 0.53)" were among the most prominent keywords. Our results showed that soft masculine keywords, e.g., "lace, floral, and pink" also appeared, but with the majority scoring DC = < 0.10. The findings provide an insight into key menswear trends through frequency, degree centrality measurements, time-series analysis, egocentric, and visual semantic networks. This also demonstrates the feasibility of using text analytics to visualize design trends, concepts, and patterns for application as an ideation tool for academic researchers, designers, and fashion retailers.

Empowering Agriculture: Exploring User Sentiments and Suggestions for Plantix, a Smart Farming Application

  • Mee Qi Siow;Mu Moung Cho Han;Yu Na Lee;Seon Yeong Yu;Mi Jin Noh;Yang Sok Kim
    • 스마트미디어저널
    • /
    • 제12권10호
    • /
    • pp.38-46
    • /
    • 2023
  • Farming activities are transforming from traditional skill-based agriculture into knowledge-based and technology-driven digital agriculture. The use of intelligent information and communication technology introduces the idea of smart farming that enables farmers to collect weather data, monitor crop growth remotely and detect crop diseases easily. The introduction of Plantix, a pest and disease management tool in the form of a mobile application has allowed farmers to identify pests and diseases of the crop using their mobile devices. Hence, this study collected the reviews of Plantix to explore the response of the users on the Google Play Store towards the application through Latent Dirichlet Allocation (LDA) topic modeling. Results indicate four latent topics in the reviews: two positive evaluations (compliments, appreciation) and two suggestions (plant options, recommendations). We found the users suggested the application to additional plant options and additional features that might help the farmers with their difficulties. In addition, the application is expected to benefit the farmer more by having an early alert of diseases to farmers and providing various substitutes and a list of components for the remedial measures.

텍스트마이닝 기반의 효율적인 장소 브랜드 이미지 강도 측정 방법 (An Efficient Estimation of Place Brand Image Power Based on Text Mining Technology)

  • 최석재;전종식;비스워스 수브르더;권오병
    • 지능정보연구
    • /
    • 제21권2호
    • /
    • pp.113-129
    • /
    • 2015
  • 장소 브랜딩은 특정 장소에 대한 의미 부여를 통해 장소성의 정체성 및 공동가치를 생성하며 가치 창출을 하는데 중요한 활동이며, 장소 브랜드에 대한 이미지 파악을 통해 이루어진다. 이에 마케팅, 건축학, 도시건설학 등 여러 분야에서는 인상적인 장소 브랜드의 이미지를 구축하기 위하여 많은 노력을 기울이고 있다. 하지만 설문조사를 포함한 대면조사 방법은 대부분 주관적인 작업이며 측정에 많은 인력 또는 고도의 전문 인력이 소요되어 고비용을 발생시키므로 보다 객관적이면서도 비용효과적인 브랜드 이미지 조사 방법이 필요하다. 이에 본 논문은 텍스트마이닝을 통하여 장소 브랜드의 이미지 강도를 객관적이고 저비용으로 얻는 방법을 찾는 것을 목적으로 한다. 제안하는 방법은 장소 브랜드 이미지를 구성하고 있는 요인과 그 키워드들을 관련 웹문서에서 추출하며, 추출된 정보를 통해 특정 장소의 브랜드 이미지 강도를 측정하는 방법이다. 성능은 안홀트 방법에서 평가에 사용하는 전세계 50개 도시 이미지 인덱스 순위와의 일치도로 검증하였다. 성능 비교를 위해 임의로 순위를 매기는 방법, 안홀트의 설문방식대로 일반인이 평가하는 방법, 본 논문의 방법을 사용하되 안홀트의 방법으로 학습한 것으로 유의한 것으로 추정되는 평가 항목만을 반영하는 방법과 비교하였다. 그 결과 제안된 방법론은 정확성, 비용효율성, 적시성, 확장성, 그리고 신뢰성 측면에서 우수함을 보일 수 있었다. 따라서 본 연구에서 제안한 방법론은 안홀트 방식에 상호 보완적으로 사용될 수 있을 것이다. 향후에는 장소 브랜드 이미지를 형성하는 속성 별로 등장횟수를 계산 한 후에 장소 브랜드에 대한 태도, 연상, 그리고 브랜드 자산과의 인과관계를 자동으로 파악할 수 있는 부분까지 구현하고 실증적 실험을 할 예정이다.

확장된 사용자 유사도를 이용한 CF-기반 건강기능식품 추천 시스템 (A CF-based Health Functional Recommender System using Extended User Similarity Measure)

  • 홍세인;정의주;김재경
    • 지능정보연구
    • /
    • 제29권3호
    • /
    • pp.1-17
    • /
    • 2023
  • 정보통신기술의 발전과 디지털 기기의 대중화로 인해, 온라인 시장의 규모가 커지고 있다. 그 결과 고객들은 상품을 선택하는데 많은 시간과 비용이 소요되는 정보 과부하(Information Overload) 문제에 직면하고 있다. 따라서 고객이 선호할만한 상품을 추천해 주는 추천 시스템은 필수적인 도구가 되었으며 협업 필터링(Collaborative Filtering) 기법은 가장 널리 쓰이는 추천 방법이다. 전통적인 추천 시스템은 평점과 같은 정량적인 데이터만을 사용하기 때문에 추천의 정확도는 높지 않다. 이와 같은 문제를 해결하기 위해 요즘에는 사용자 리뷰와 같은 정성적 데이터를 반영하는 연구가 활발히 진행되고 있다. 협업 필터링의 일반적인 절차는 사용자-상품 행렬 생성, 이웃 집단 탐색, 추천 목록 생성 3단계로 구성되며 코사인 같은 사용자 유사도를 사용하여 목표 고객의 이웃을 탐색하며, 추천 상품 목록을 생성한다. 본 연구에서는 이웃 집단 탐색 및 추천 목록 생성 단계에서 사용하는 사용자 간의 유사도를 기존의 사용자 평점을 이용한 유사도에 고객의 리뷰 데이터를 사용하는 확장된 사용자 유사도를 제시한다. 리뷰를 정량화 하기 위해 본 연구에서는 텍스트 마이닝을 활용한다. 즉, 리뷰 데이터에 TF-IDF, Word2Vec, 그리고 Doc2Vec 기법을 사용하여 두 사용자 간의 리뷰 유사도를 구한 후 사용자 평점을 사용한 유사도와 리뷰 유사도를 결합한 확장된 유사도를 생성하는 것이다. 이를 검증하기 위해 전자상거래 사이트인 Amazon의 'Health and Personal Care'의 사용자 평점과 리뷰 데이터를 사용하였다. 실험 결과, 사용자 간 유사도를 산출할 때 기존의 평점에 기반한 유사도만을 사용하는 것보다, 사용자 리뷰의 유사도를 추가로 반영한 확장된 유사도를 사용하면 추천의 정확도가 높아진다는 것을 확인했다. 또한, 여러 텍스트 마이닝 기법 중에서 TF-IDF 기법을 사용한 확장된 유사도를 이웃 집단 탐색 및 추천 목록 생성단계에서 사용할 때의 성능이 가장 좋게 나타났다.

기업의 SNS 노출과 주식 수익률간의 관계 분석 (The Analysis on the Relationship between Firms' Exposures to SNS and Stock Prices in Korea)

  • 김태환;정우진;이상용
    • Asia pacific journal of information systems
    • /
    • 제24권2호
    • /
    • pp.233-253
    • /
    • 2014
  • Can the stock market really be predicted? Stock market prediction has attracted much attention from many fields including business, economics, statistics, and mathematics. Early research on stock market prediction was based on random walk theory (RWT) and the efficient market hypothesis (EMH). According to the EMH, stock market are largely driven by new information rather than present and past prices. Since it is unpredictable, stock market will follow a random walk. Even though these theories, Schumaker [2010] asserted that people keep trying to predict the stock market by using artificial intelligence, statistical estimates, and mathematical models. Mathematical approaches include Percolation Methods, Log-Periodic Oscillations and Wavelet Transforms to model future prices. Examples of artificial intelligence approaches that deals with optimization and machine learning are Genetic Algorithms, Support Vector Machines (SVM) and Neural Networks. Statistical approaches typically predicts the future by using past stock market data. Recently, financial engineers have started to predict the stock prices movement pattern by using the SNS data. SNS is the place where peoples opinions and ideas are freely flow and affect others' beliefs on certain things. Through word-of-mouth in SNS, people share product usage experiences, subjective feelings, and commonly accompanying sentiment or mood with others. An increasing number of empirical analyses of sentiment and mood are based on textual collections of public user generated data on the web. The Opinion mining is one domain of the data mining fields extracting public opinions exposed in SNS by utilizing data mining. There have been many studies on the issues of opinion mining from Web sources such as product reviews, forum posts and blogs. In relation to this literatures, we are trying to understand the effects of SNS exposures of firms on stock prices in Korea. Similarly to Bollen et al. [2011], we empirically analyze the impact of SNS exposures on stock return rates. We use Social Metrics by Daum Soft, an SNS big data analysis company in Korea. Social Metrics provides trends and public opinions in Twitter and blogs by using natural language process and analysis tools. It collects the sentences circulated in the Twitter in real time, and breaks down these sentences into the word units and then extracts keywords. In this study, we classify firms' exposures in SNS into two groups: positive and negative. To test the correlation and causation relationship between SNS exposures and stock price returns, we first collect 252 firms' stock prices and KRX100 index in the Korea Stock Exchange (KRX) from May 25, 2012 to September 1, 2012. We also gather the public attitudes (positive, negative) about these firms from Social Metrics over the same period of time. We conduct regression analysis between stock prices and the number of SNS exposures. Having checked the correlation between the two variables, we perform Granger causality test to see the causation direction between the two variables. The research result is that the number of total SNS exposures is positively related with stock market returns. The number of positive mentions of has also positive relationship with stock market returns. Contrarily, the number of negative mentions has negative relationship with stock market returns, but this relationship is statistically not significant. This means that the impact of positive mentions is statistically bigger than the impact of negative mentions. We also investigate whether the impacts are moderated by industry type and firm's size. We find that the SNS exposures impacts are bigger for IT firms than for non-IT firms, and bigger for small sized firms than for large sized firms. The results of Granger causality test shows change of stock price return is caused by SNS exposures, while the causation of the other way round is not significant. Therefore the correlation relationship between SNS exposures and stock prices has uni-direction causality. The more a firm is exposed in SNS, the more is the stock price likely to increase, while stock price changes may not cause more SNS mentions.

빅데이터를 활용한 공원 이용행태의 시계열분석 - 올림픽공원을 대상으로 - (Time Series Analysis of Park Use Behavior Utilizing Big Data - Targeting Olympic Park -)

  • 우경숙;서주환
    • 한국조경학회지
    • /
    • 제46권2호
    • /
    • pp.27-36
    • /
    • 2018
  • 본 연구는 공원 이용자의 욕구를 파악하여 이용자에 적합한 공원 환경으로 변화되어야 할 필요성에 주목하고, 이용자의 욕구를 파악하기 위하여 행태분석의 필요성을 제기하였다. 이에 온라인 데이터(블로그)를 연구의 기초자료로 선정하고, 5년 단위로 구분하여 데이터를 수집한 후 텍스트 마이닝을 활용해 시계열적 행태의 특성을 도출하고, 사회연결망 분석을 통해 온라인 데이터의 유의성을 검증하였다. 텍스트 마이닝 분석 결과, 첫째, '길을 걷다'(산책), '사진을 찍다', '자전거(인라인, 킥보드 등)를 타다', '먹다', '공연을 관람하다'는 올림픽공원에서 행해지는 공통적인 행태로 나타났다. 둘째, 수집된 데이터의 초기에는 운동 등 적극적인 신체활동을 행태가 주를 이루었지만, 최근에는 핸드폰, 게임, 음식을 먹고 커피를 마시는 등의 소극적인 비활동적 행태도 공원에서 나타나는 새로운 행태적 특징으로 나타났다. 셋째, 공원 이용자의 행태에 영향을 미치는 요인은 인터넷 발달, 자신의 개성과 스타일을 표현하는 문화 등 사회의 여러 가지 여건의 변화로 나타났다. 넷째, 올림픽공원에서 나타나는 특별한 행태는 공연 관람 등 문화적인 활동과 역사수업 등 교육적인 활동으로 도출되었다. 결론적으로 공원 계획 설계 시 의도하였던 목적보다는 여러 가지 시대적 변화로 사람들의 라이프 스타일이 변화하고, 공원의 행태에까지 영향을 미치는 것으로 나타났다. 이에 올림픽공원의 주요 행태와 영향을 미치는 요인을 고려하여 이용자에게 적합한 환경으로 변화되어야 할 필요성이 있다. 분석방법으로 활용한 텍스트 마이닝은 과거의 데이터도 수집이 가능하다는 장점이 있어 행태 분석 시 장기적인 관점에서 분석이 가능하고, 도출된 키워드로 새로운 행태 및 가치 측정이 가능하여 이후 행태분석 연구의 영역의 확대가 가능한 것으로 판단된다. 또한, 사회연결망 분석을 통해 온라인 데이터의 타당성을 검증하여 연구결과의 신뢰를 높일 수 있었다. 추후 수집하는 데이터의 종류를 다양하게 하여 더 포괄적인 행태분석에 대한 연구가 수행되어야 하며, 대용량 데이터의 정확성, 신뢰성을 검증할 수 있는 다양한 방법에 대한 연구가 필요할 것이다.

Research of Semantic Considered Tree Mining Method for an Intelligent Knowledge-Services Platform

  • Paik, Juryon
    • 한국컴퓨터정보학회논문지
    • /
    • 제25권5호
    • /
    • pp.27-36
    • /
    • 2020
  • 본 논문은 지식기반의 서비스 융합을 추구하는 4차산업혁명의 핵심 기반인 데이터로부터 유용하지만 드러나지 않는 정보들을 추출하는 방식을 제안한다. IoT로 대표되는 초연결사회에서 빅데이터의 생성은 필연적이며 그로부터 최적의 서비스를 도출하기 위해서는 가치있는 데이터를 찾아내는 것은 최우선으로 수행되어야 한다. 다양한 디바이스로부터 엄청난 양의 데이터를 수집·저장·관리하고 통합하는 데이터중심 IoT 플랫폼은 일종의 미들웨어 솔루션으로, 플랫폼의 궁극적인 목적은 빅데이터를 적시적소에 맞게 가공 및 분석수행 후 가치 있는 결과를 도출하여 최적의 답안을 제시하는 것이다. 이는 데이터를 분석하는 효율적이고 정확한 알고리즘을 필요로 한다. 이를 위해 본 논문은 분산되어 생성되는 IoT 데이터로부터 유용 정보 추출을 위해 시맨틱을 고려하여 원데이터를 저장하는 특화된 구조체를 설계하고 제안한 구조체에 기반하여 가치있는 정보를 찾아내기 위한 알고리즘을 다양한 정의와 증명을 사용하여 제시한다.

스파크 프레임워크를 위한 병렬적 k-Modes 알고리즘 (Parallel k-Modes Algorithm for Spark Framework)

  • 정재화
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제6권10호
    • /
    • pp.487-492
    • /
    • 2017
  • 클러스터링은 빅데이터 분석 및 데이터 마이닝 분야에서 데이터 간 유사성을 파악하기 위해 사용하는 기법으로 다양한 클러스터링 기법 중 범주적 데이터를 위해 k-Modes 알고리즘이 대표적으로 사용된다. k-Modes와 같이 반복적 연산이 집중된 작업의 속도를 향상시키기 위해 많은 관심을 받고 있는 분산 병행 프레임워크 스파크는 하둡과 달리 RDD라는 추상화 객체 개념을 사용하여 대용량의 데이터를 메모리 상에서 처리 가능한 환경을 제공한다. 스파크는 다양한 기계학습을 위한 라이브러리인 Mllib을 제공하고 있으나 연속적 데이터만 처리 가능한 k-means만 포함되어 있어 범주적 데이터 처리가 불가능한 한계가 있다. 따라서 본 논문에서는 스파크 환경에서 범주적 데이터 클러스터링을 위한 k-Modes 알고리즘을 위한 RDD 설계하고 효과적으로 동작할 수 있는 알고리즘을 구현하였다. 실험을 통해 제안한 알고리즘이 스파크 환경에서 선형적으로 증가한다는 것을 보였다.