• 제목/요약/키워드: Unstructured data analysis

검색결과 426건 처리시간 0.03초

텍스트 마이닝 통합 애플리케이션 개발: KoALA (Application Development for Text Mining: KoALA)

  • 전병진;최윤진;김희웅
    • 경영정보학연구
    • /
    • 제21권2호
    • /
    • pp.117-137
    • /
    • 2019
  • 빅데이터 시대를 맞아 다양한 도메인에서 수없이 많은 데이터들이 생산되면서 데이터 사이언스가 대중화 되었고, 데이터의 힘이 곧 경쟁력인 시대가 되었다. 특히 전 세계 데이터의 80% 이상을 차지하는 비정형 데이터에 대한 관심이 부각되고 있다. 소셜 미디어의 발전과 더불어 비정형 데이터의 대부분은 텍스트 데이터의 형태로 발생하고 있으며, 마케팅, 금융, 유통 등 다양한 분야에서 중요한 역할을 하고 있다. 하지만 이러한 소셜 미디어를 활용한 텍스트 마이닝은 수치형 데이터를 활용한 데이터 마이닝 분야에 비해 접근이 어렵고 복잡해 기대에 비해 그 활용도가 높지 못한 실정이다. 이에 본 연구는 프로그래밍 언어나 고사양 하드웨어나 솔루션에 의존하지 않고, 쉽고 간편한 소셜 미디어 텍스트 마이닝을 위한 통합 애플리케이션으로 Korean Natural Language Application(KoALA)을 개발하고자 한다. KoALA는 소셜 미디어 텍스트 마이닝에 특화된 애플리케이션으로, 한글, 영문을 가리지 않고 분석 가능한 통합 애플리케이션이다. 데이터 수집에서 전처리, 분석, 그리고 시각화에 이르는 전 과정을 처리해준다. 본 논문에서는 디자인 사이언스(design science) 방법론을 활용해 KoALA 애플리케이션을 디자인, 구현, 적용하는 과정에 대해서 다룬다. 마지막으로 블록체인 비즈니스 관련 사례를 들어 KoALA의 실제 활용방안에 대해서 다룬다. 본 논문을 통해 소셜 미디어 텍스트 마이닝의 대중화와 다양한 도메인에서 텍스트 마이닝의 실무적, 학술적 활용을 기대해 본다.

R&D Perspective Social Issue Packaging using Text Analysis

  • Wong, William Xiu Shun;Kim, Namgyu
    • 한국IT서비스학회지
    • /
    • 제15권3호
    • /
    • pp.71-95
    • /
    • 2016
  • In recent years, text mining has been used to extract meaningful insights from the large volume of unstructured text data sets of various domains. As one of the most representative text mining applications, topic modeling has been widely used to extract main topics in the form of a set of keywords extracted from a large collection of documents. In general, topic modeling is performed according to the weighted frequency of words in a document corpus. However, general topic modeling cannot discover the relation between documents if the documents share only a few terms, although the documents are in fact strongly related from a particular perspective. For instance, a document about "sexual offense" and another document about "silver industry for aged persons" might not be classified into the same topic because they may not share many key terms. However, these two documents can be strongly related from the R&D perspective because some technologies, such as "RF Tag," "CCTV," and "Heart Rate Sensor," are core components of both "sexual offense" and "silver industry." Thus, in this study, we attempted to discover the differences between the results of general topic modeling and R&D perspective topic modeling. Furthermore, we package social issues from the R&D perspective and present a prototype system, which provides a package of news articles for each R&D issue. Finally, we analyze the quality of R&D perspective topic modeling and provide the results of inter- and intra-topic analysis.

상품 리뷰 분석을 통한 사용자 맞춤형 추천 시스템 (Customized recommendation system through product review analysis)

  • 황도연;배상중;김창수;정회경
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2018년도 춘계학술대회
    • /
    • pp.460-461
    • /
    • 2018
  • 전통적인 방식의 추천 시스템은 사용자가 독립적으로 행동한다는 가정하에 개발된 방식이며, 단순하게 상품을 나열하거나 상품의 속성과 사용자의 기호를 연관하는 기능이 부족하여 가독성과 효율성이 떨어지는 문제점이 있다. 이를 해결하기 위해 본 논문에서는 상품 리뷰 데이터를 크롤링을 한 뒤 R을 이용한 텍스트 마이닝 기법을 사용하여 비정형의 리뷰 데이터를 사용자의 구매이력과의 연관 분석을 통해 의미 있는 정보로 가공하여 사용자 맞춤형 정보를 제공하는 시스템을 제안한다. 이를 통해 사용자는 방대한 양의 상품 리뷰 데이터를 분석할 필요 없이 자신에게 필요한 데이터만을 제공받을 수 있게 되어 사용자의 의사결정에 도움 될 것으로 사료된다.

  • PDF

소방공무원의 외상 후 스트레스 경험 (Post-traumatic Stress Experienced by Firefighters and Paramedics)

  • 이나윤;하양숙
    • Perspectives in Nursing Science
    • /
    • 제9권2호
    • /
    • pp.83-93
    • /
    • 2012
  • Purpose: The purpose of this study was to describe the post-traumatic stress experiences of firefighters and paramedics. Methods: The participants were 20 fire fighters and paramedics who belong to the Busan Fire Department. Data were collected through in-depth, unstructured audio-taped interviews by the investigator over a six-month period. The participants were asked to describe their post-traumatic stress. The data were analyzed according to Giorgi's method for phenomenological analysis. Results: The interview data were organized by theme into 7 categories that emerged from the analysis. Participants faced various post-traumatic stresses working as fire fighters or paramedics. The categories were suffering from disastrous situations, feeling of fear and helplessness in the face of death, re-experiencing vividly the past traumatic situation, avoiding painful reminders of the trauma, emotional numbing as time passes, suffering from emotional arousal and increased anxiety, and struggling to cope with the post-traumatic stress. Conclusion: This study provides a better understanding of post-traumatic stress experiences from fire fighters and paramedics and the knowledge gained from this study will help in developing appropriate post-traumatic stress management programs.

  • PDF

소셜 빅데이터 기반 인공지능 개발윤리 인식 분석 (A Study on the Awareness of Artificial Intelligence Development Ethics based on Social Big Data)

  • 김마리;박서하;노승국
    • 공학교육연구
    • /
    • 제25권3호
    • /
    • pp.35-44
    • /
    • 2022
  • Artificial intelligence is a core technology in the era of digital transformation, and as the technology level is advanced and used in various industries, its influence is growing in various fields, including social, ethical and legal issues. Therefore, it is time to raise social awareness on ethics of artificial intelligence as a prevention measure as well as improvement of laws and institutional systems related to artificial intelligence development. In this study, we analyzed unstructured data, typically text, such as online news articles and comments to confirm the degree of social awareness on ethics of artificial intelligence development. The analysis showed that the public intended to concentrate on specific issues such as "Human," "Robot," and "President" in 2018 to 2019, while the public has been interested in the use of personal information and gender conflics in 2020 to 2021.

형상 최적화를 통한 축류송풍기의 설계 (Design of An Axial Flow Fan with Shape Optimization)

  • 서성진;최승만;김광용
    • 대한기계학회논문집B
    • /
    • 제30권7호
    • /
    • pp.603-611
    • /
    • 2006
  • This paper presents the response surface optimization method using three-dimensional Wavier-Stokes analysis to optimize the blade shape of an axial flow fan. Reynolds-averaged Wavier-Stokes equations with $k-{\epsilon}$ turbulence model are discretized with finite volume approximations using the unstructured grid. Regression analysis is used for generating response surface, and it is validated by ANOVA and t-statistics. Four geometric variables, i.e., sweep and lean angles at mean and tip respectively were employed to improve the efficiency. The computational results are compared with experimental data and the comparisons show generally good agreements. As a main result of the optimization, the total efficiency was successfully improved. Also, detailed effects of sweep and lean on the axial flow fan are discussed.

OOP 개념에 기초한 유동해석용 전처리 프로그램 개발 (Development of a Pre-Processing Program for Flow Analysis Based on the Object-Oriented Programming Concept)

  • 명현국;안종기
    • 대한기계학회논문집B
    • /
    • 제32권1호
    • /
    • pp.70-77
    • /
    • 2008
  • A pre-processing program based on the OOP(object-oriented programming) concept has been developed. The program consists of the input of a 2D or 3D flow problem to a CFD program by means of an user-friendly interface and the subsequent transformation of this input into a form suitable for the solver(PowerCFD) using unstructured cell-centered method. User-friendly GUI(graphic user interface) has been built on the base of MFC(Microsoft Foundation Class). The program is organized as modules by classes based on VTK(Visualization ToolKit)-library, and these classes are made to function through inheritance and cooperation which is an important and valuable concept of object-oriented programming. The major functions of this program are introduced and demonstrated, which include mesh generation, boundary settings, solver settings, generation of grid connectivity and geometric data etc.

Academic Registration Text Classification Using Machine Learning

  • Alhawas, Mohammed S;Almurayziq, Tariq S
    • International Journal of Computer Science & Network Security
    • /
    • 제22권1호
    • /
    • pp.93-96
    • /
    • 2022
  • Natural language processing (NLP) is utilized to understand a natural text. Text analysis systems use natural language algorithms to find the meaning of large amounts of text. Text classification represents a basic task of NLP with a wide range of applications such as topic labeling, sentiment analysis, spam detection, and intent detection. The algorithm can transform user's unstructured thoughts into more structured data. In this work, a text classifier has been developed that uses academic admission and registration texts as input, analyzes its content, and then automatically assigns relevant tags such as admission, graduate school, and registration. In this work, the well-known algorithms support vector machine SVM and K-nearest neighbor (kNN) algorithms are used to develop the above-mentioned classifier. The obtained results showed that the SVM classifier outperformed the kNN classifier with an overall accuracy of 98.9%. in addition, the mean absolute error of SVM was 0.0064 while it was 0.0098 for kNN classifier. Based on the obtained results, the SVM is used to implement the academic text classification in this work.

용어 사전의 특성이 문서 분류 정확도에 미치는 영향 연구 (Analyzing the Effect of Characteristics of Dictionary on the Accuracy of Document Classifiers)

  • 정해강;김남규
    • 경영과정보연구
    • /
    • 제37권4호
    • /
    • pp.41-62
    • /
    • 2018
  • 다양한 소셜 미디어 활동과 인터넷 뉴스 기사, 블로그 등을 통해 유통되는 비정형 데이터의 양이 급증함에 따라 비정형 데이터를 분석하고 활용하기 위한 연구가 활발히 진행되고 있다. 텍스트 분석은 주로 특정 도메인 또는 특정 주제에 대해 수행되므로, 도메인별 용어 사전의 구축과 적용에 대한 중요성이 더욱 강조되고 있다. 용어 사전의 품질은 비정형 데이터 분석 결과의 품질에 직접적인 영향을 미치게 되며, 분석 과정에서 정제의 역할을 수행함으로써 분석의 관점을 정의한다는 측면에서 그 중요성이 더욱 강조된다. 이렇듯 용어 사전의 중요성은 기존의 많은 연구에서도 강조되어 왔으나, 용어 사전이 분석 결과의 품질에 어떤 방식으로 어떤 영향을 미치는지에 대한 엄밀한 분석은 충분히 이루어지지 않았다. 따라서 본 연구에서는 전체 문서에서의 용어 빈도수에 기반을 두어 사전을 구축하는 일괄 구축 방식, 카테고리별 주요 용어를 추출하여 통합하는 용어 통합 방식, 그리고 카테고리별 주요 특질(Feature)을 추출하여 통합하는 특질 통합 방식의 세 가지 방식으로 사전을 구축하고 각 사전의 품질을 비교한다. 품질을 간접적으로 평가하기 위해 각 사전을 적용한 문서 분류의 정확도를 비교하고, 각 사전에 고유율의 개념을 도입하여 정확도의 차이가 나타나는 원인을 심층 분석한다. 본 연구의 실험에서는 5개 카테고리의 뉴스 기사 총 39,800건을 분석하였다. 실험 결과를 심층 분석한 결과 문서 분류의 정확도가 높게 나타나는 사전의 고유율이 높게 나타남을 확인하였으며, 이를 통해 사전의 고유율을 높임으로써 분류의 정확도를 더욱 향상시킬 수 있는 가능성을 발견하였다.

AJAX+XML 기반의 모니터링 시스템 (Realtime Monitoring System using AJAX + XML)

  • 최윤정;박승수
    • 디지털산업정보학회논문지
    • /
    • 제5권4호
    • /
    • pp.39-49
    • /
    • 2009
  • Nowadays, according to rapid development of computing environments, information processing and analysis system are very interesting research area. As a viewpoint of data preparation-processing-analysis in knowledge technology, the goal of automated information system is to satisfy high reliability and confidence and to minimize of human-administrator intervention. In addition, we expect the system which can deal with problem and abnormal error effectively as a fault detection and fault tolerance. In this paper, we design a monitoring system as follows. A productive monitoring information from various systems has unstructured forms and characteristics and crawls informative data by conditions and gathering rules. For representing of monitering information which requested by administrator, running-status can be able to check dynamically and systematic like connection/closed status in real-time. Our proposed system can easily correct and processing for monitoring information from various type of server and support to make objective judgement and analysis of administrator under operative target of information system. We implement semi-realtime monitering system using AJAX technology for dynamic browsing of web information and information processing using XML and XPATH. We apply our system to SMS server for checking running status and the system shows that has high utility and reliability.