• 제목/요약/키워드: Big Data Pattern Analysis

검색결과 170건 처리시간 0.023초

클러스터링 기법을 이용한 수용가별 전력 데이터 패턴 분석 (Customer Load Pattern Analysis using Clustering Techniques)

  • 유승형;김홍석;오도은;노재구
    • KEPCO Journal on Electric Power and Energy
    • /
    • 제2권1호
    • /
    • pp.61-69
    • /
    • 2016
  • Understanding load patterns and customer classification is a basic step in analyzing the behavior of electricity consumers. To achieve that, there have been many researches about clustering customers' daily load data. Nowadays, the deployment of advanced metering infrastructure (AMI) and big-data technologies make it easier to study customers' load data. In this paper, we study load clustering from the view point of yearly and daily load pattern. We compare four clustering methods; K-means clustering, hierarchical clustering (average & Ward's method) and DBSCAN (Density-Based Spatial Clustering of Applications with Noise). We also discuss the relationship between clustering results and Korean Standard Industrial Classification that is one of possible labels for customers' load data. We find that hierarchical clustering with Ward's method is suitable for clustering load data and KSIC can be well characterized by daily load pattern, but not quite well by yearly load pattern.

부분방전 해석 방법으로 PSA(Pulse Sequence Analysis)의 문제점에 대한 고찰 (Some Considerations on the Problems of PSA(Pulse Sequence Analysis) as a Partial Discharge Analysis Method)

  • 김정태;이호근
    • 한국전기전자재료학회:학술대회논문집
    • /
    • 한국전기전자재료학회 2004년도 추계학술대회 논문집 Vol.17
    • /
    • pp.327-330
    • /
    • 2004
  • Because of its effectiveness for the PD(partial discharge) pattern recognition, PSA(Pulse Sequence Analysis) has been considered as a new analytic method instead of conventional PRPDA(Phase Resolved Partial Discharge Analysis). However, PSA has a big problem that can misanalyze patterns in case of data missing resulting from poor sensitivity because it analyses the correlation between sequential pulses, which leads to hesitate to apply it to on-site. Therefore, in this paper, the problems of PSA such as data missing and noise adding cases were investigated. For the purpose, PD data obtained from various defects including noise adding data were used and analysed, The result showed that both cases can cause fatal errors in recognizing PD patterns. In case of the data missing, the error depends on the kinds of defect and the degree of degradation. Also, it could be noticed that the error due to adding noises was larger than that due to some data missing.

  • PDF

부산지역 교통관련 기사를 이용한 비정형 빅데이터의 정형화와 시각적 해석 (Structuring of unstructured big data and visual interpretation)

  • 이경준;노윤환;윤상경;조영석
    • Journal of the Korean Data and Information Science Society
    • /
    • 제25권6호
    • /
    • pp.1431-1438
    • /
    • 2014
  • 2013년 1월 1일부터 2013년 12월 31일까지의 부산지역지인 국제신문과 부산일보의 기사들 중 제목에 '부산'과 '교통'을 동시에 포함한 2889건의 기사 내용의 관계 또는 관련 있는 데이터에 내재되어 있는 의미 있는 패턴을 찾아내고자한다. 데이터마이닝 (datamining)의 일부인 텍스트마이닝(textmining)의 기법을 이용하여 사회네트워크분석 (SNA; social network analysis)을 실시하였다. 비정형 데이터의 정형화를 위해 빅데이터의 저장, 처리 및 분석을 위해 자바 기반의 오픈소스 프레임워크인 하둡 생태계 (Hadoop ecosystem)의 HDFS와 맵리듀스 (MapReduce)를 Linux (Ubuntu-12.04LTS) 환경에서 이용하였고, 기존의 R패키지에서 제공되는 사회 네트워크 분석보다 효율적인 시각화를 위해 각 노드 및 선에 비율에 따른 가중치를 주어 색상과 굵기로 해석할 수 있도록 새로운 알고리즘을 구현하였다.

블록체인 네트워크를 이용한 빅데이터 분석 기반 생산·소비량 인증 전력 거래 시스템에 관한 연구 (A Study on the Production and Consumption Authentication Power Trading System based on Big Data Analysis using Blockchain Network)

  • 김영곤;허걸;최중인
    • 에너지공학
    • /
    • 제28권4호
    • /
    • pp.76-81
    • /
    • 2019
  • 이 논문은 에너지 클라우드 참여 프로슈머의 신뢰성 있는 생산 및 소비량 인증에 기반 한 개인 간 거래, 클라우드 간 거래, 그리고 소규모 분산전력 중개시장 참여 등의 다양한 에너지 프로슈머 비즈니스 모델에 필요한 생산·소비량 인증 기반 전력 거래 시스템에 관한 고찰이다. 이 시스템은 에너지 거래에 있어 가장 중요한 파라미터로 간주할 수 있는 거래 정산의 신뢰성을 확보하기 위한 것으로써 에너지 프로슈머로부터 수집되는 발전·소비 빅데이터 분석에 의한 인증 기반 블록체인 스마트 컨트랙트 체결을 위한 것이다. 이를 위하여 IoT AMI로부터 수집 된 빅데이터 분석 시스템과 AMI 와 연계 구성된 프라이빗 블록체인 네트워크를 적용한 생산량 인증 시스템 구성을 소개하고 블록체인 스마트 컨트랙트를 활용한 전력 거래 매칭 방식을 제안한다. 마지막으로 에너지 클러스터 거래 시스템 및 비즈니스모델을 알아본다.

영상 스토리 분석과 시청 패턴 분석 기반의 추천 시스템 구현 (Implementation of User Recommendation System based on Video Contents Story Analysis and Viewing Pattern Analysis)

  • 이현섭;김민영;이지훈;김진덕
    • 한국정보통신학회논문지
    • /
    • 제24권12호
    • /
    • pp.1567-1573
    • /
    • 2020
  • 인터넷 기술의 발전으로 1인 미디어 시대로 도래했다. 한 개인이 스스로 콘텐츠를 제작하여 관련 온라인 서비스로 업로드 하고, 많은 사용자가 온라인 서비스의 콘텐츠를 인터넷을 이용할 수 있는 장치(PC, 스마트폰, 스마트TV 등)를 이용해 시청하고 있다. 현재 대부분 사용자가 기존 온라인 서비스에서 제공하는 검색기능을 통해 원하는 콘텐츠를 찾아서 시청하고 있다. 이러한 기능은 콘텐츠를 업로드 한 사용자가 입력한 정보를 바탕으로 제공된다. 이러한 제한된 단어 데이터를 바탕으로 콘텐츠를 검색해야 하는 환경에서 잘못된 정보가 있는 경우 검색 결과의 유사도 효율 저하와 잘못된 결과를 사용자에게 제시한다. 이를 해결하기 위해 본 논문에서는 온라인 서비스에서 콘텐츠 정보를 시스템이 능동적으로 영상을 분석하고, 영상이 보유한 특성을 추출해 반영하는 방법을 제시한다. 한 동영상의 음성데이터를 근거한 스토리 내용을 근거로 형태소를 추출해 빅데이터 기술로 분석하기 위한 연구 내용을 다룬다.

보건의료 빅데이터를 이용한 얼굴마비환자의 의료비용에 관한 연구 (Medical costs for patients with Facial paralysis : Based on Health Big Data)

  • 홍민정;엄태웅;김신아;김남권
    • 대한한의학회지
    • /
    • 제36권3호
    • /
    • pp.98-110
    • /
    • 2015
  • Objectives: The purpose of this study was to analyze the medical cost of facial paralysis in payer perspective and to estimate the practice pattern of patient using 2011 Health Insurance Review & Assessment Service-National Patients Sample(HIRA-NPS). Methods: Basic statistical system was used for descriptive analysis of NPS dataset. A table for general information (table20) was extracted by disease code, and social demographic characteristics, distribution of the use among inpatients and outpatients, utilization of each kind of medical care institutions, medical cost were analyzed. Subgroup analysis was conducted for assuming the practice pattern of korean medicine and western medicine. Results: A total of 8,219 people and 64,345 claims data were identified as having facial paralysis. Proportion of outpatient was 95.23%, inpatient 0.84% and patient using both services 3.93%. Mean patient charges was 44,229 won per outpatient, 178,886 won per inpatient and 523,542 won per patient using both services. Utilization of korean medical care institutions was 68.81%(claims), 40.46%(patients), utilization of western medical care institutions was 31.19%(claims), 59.54%(patients). The amount charged by korean medical care institutions was 52.61% and western medical care institutions was 47.39%. Cost per claim was higher than those of the korean treatment and cost per patient of western treatment was lower than those of the korean treatment. Conclusions: The research assessed the medical cost and practice pattern associated with facial paralysis. These findings could be used in health care policy and subsequent studies.

K-means 알고리즘과 GBR 알고리즘을 이용한 정수장 응집제 투입률 결정 기법 (Determination of coagulant input rate in water purification plant using K-means algorithm and GBR algorithm)

  • 김진영;강복선;정회경
    • 한국정보통신학회논문지
    • /
    • 제25권6호
    • /
    • pp.792-798
    • /
    • 2021
  • 본 논문에서는 인공지능 기반의 빅데이터 분석과 예측을 통하여 정수장의 공정 중 약품투입곤정에서 응집제 투입률을 결정하는 알고리즘을 도출하였다. 또한, 빅데이터 기술 및 인공지능 알고리즘 적용 방법에 대한 분석 및 기존의 학문적, 기술적 자료를 검토하여 유사 분야 적용 사례를 분석 검토하였다. 이를 통한 최적 응집제 투입률 제시를 목표로 운영 근무자의 의사결정 패턴을 입력 변수와 출력변수의 관계 패턴으로 학습한 후 학습된 패턴을 실제 응집제 주입 공정에 적용하여 침전수 탁도가 목표치에 근사한 일정 수준을 유지할 수 있도록 운영이 가능하였다. 데이터 범위 산정과 전처리를 거친 변수를 선정하여 알고리즘 수행을 준비한 후 군집화와 분류 알고리즘을 적용하여 알고리즘 수행과 결과에 대한 피드백을 반복하여 학습을 진행하였다.

점진적 가중화 맥시멀 대표 패턴 마이닝의 최신 기법 분석, 유아들의 물품 패턴 분석 시나리오 및 성능 분석 (Recent Technique Analysis, Infant Commodity Pattern Analysis Scenario and Performance Analysis of Incremental Weighted Maximal Representative Pattern Mining)

  • 윤은일;윤은미
    • 인터넷정보학회논문지
    • /
    • 제21권2호
    • /
    • pp.39-48
    • /
    • 2020
  • 데이터마이닝 기법들은 의미 있고 유용한 정보를 효율적으로 찾기 위해서 제안되어 왔다. 특별히, 빅 데이터 환경에서 데이터가 여러 응용들에서 축적되어짐에 따라, 관련된 패턴 마이닝 방법들이 제안되고 있다. 최근에는 파일이나 데이터베이스에 이미 저장되어 있는 정적 데이터를 분석하는 대신에 점진적으로 생성되는 동적 데이터를 마이닝 하는 것이 더 흥미 있는 연구영역으로 고려되고 있는데 동적데이터는 단지 한번만 스캔하여 읽을 수 있기 때문이다. 이와 같은 이유로, 어떻게 동적 데이터를 효율적으로 마이닝 하는지에 대한 연구들이 진행되고 있다. 더불어서, 마이닝 결과로 거대한 수의 패턴들이 생성되기 때문에, 맥시멀 패턴 마이닝과 같은 대표 패턴들을 마이닝하는 접근방법들도 제안되고 있다. 또 다른 이슈로, 실세계에서 더 의미있는 패턴들을 발견하기 위해, 가중화 패턴 마이닝에서 아이템들의 가중치가 사용되고 있다. 실제 상황에서 아이템의 이익이나 가격 등이 가중치로 사용 될 수 있다. 본 논문에서는 점진적으로 생성되는 데이터에 대한 가중화 맥시멀 패턴 마이닝, 맥시멀 대표 패턴 마이닝 그리고 점진적 패턴 마이닝 기법들에 대해 분석한다. 그리고 가중화 대표 패턴 마이닝을 적용하여서 유아들에게서 필요로 하는 물품 패턴들을 분석하기 위한 응용 시나리오를 제시한다. 추가로, 분석한 마이닝 알고리즘들에 대한 성능 평가를 수행한다. 결과적으로, 점진적 가중화 맥시멀 패턴 마이닝 기법이 점진적 가중화 패턴 마이닝과 가중화 패턴 마이닝 기법보다 좋은 성능을 가짐을 보인다.

빅데이터를 활용한 전자무역시스템에 대한 연구 (A Study for Electronic Trading Business System Using Big Data)

  • 이철웅;조성우;조세홍;황대훈
    • 디지털콘텐츠학회 논문지
    • /
    • 제14권4호
    • /
    • pp.573-580
    • /
    • 2013
  • 정보기술과 기기의 발달은 정보화 사회를 가속화 시켰으며 이에 따라 정보의 생산과 확산, 그리고 소비가 훨씬 빠르고 편리해졌다. 사람들이 이제 언제 어디서든 무선통신과 스마트기기를 활용하여 정보를 창조, 공유, 소비할 수 있게 되었다. 또한, 기술의 발달은 기존의 텍스트가 주를 이루던 사용자의 데이터 소비패턴을 이미지, 음성, 영상의 대용량 데이터를 확산과 공유를 가능하게 되었으며 이를 통하여 개인이 소비하는 데이터의 양도 기하급수적으로 늘어나게 되었다. 과거와는 다르게 빠르게 생성되고 소비되는 방대한 데이터 정보 속에서 유용한 데이터를 찾아서 찾고 원하는 방향으로 알맞게 분석하는지가 더욱 중요한 부분이 되었다. 본 연구에서는 빅데이터에 대하여 살펴보고 전자무역 분야에서의 활용 방법을 보여준다.

LDA 기법을 이용한 버스 승객의 잠재적 이동패턴 분석 (Latent mobility pattern analysis of bus passengers with LDA)

  • 조아;이경희;조완섭
    • Journal of the Korean Data and Information Science Society
    • /
    • 제26권5호
    • /
    • pp.1061-1069
    • /
    • 2015
  • 최근 교통 분야에서 발생하는 교통 빅데이터 (교통카드 데이터, ATMS 데이터 등)의 분석결과를 교통 정책에 활용하는 사례가 늘어나고 있는 추세이다. 또한 교통 데이터 분석 기법을 기존의 단순 빈도 분석 기법에서 다양한 데이터 마이닝 기법으로 확장하여 교통 데이터 속에 숨어있는 의미를 파악하려는 연구도 진행되고 있다. 본 연구에서는 교통카드 데이터에 대하여 토픽모델링 기법 중의 하나인 LDA (Latent Dirichlet Allocation) 기법을 적용하여 청주시 버스 승객들의 이동패턴을 분석한다. 이를 위해 교통카드 데이터의 하차 결측치를 추정하고, LDA 기법을 적용하여 이동패턴을 추출하였다. 또한 LDA 분석으로 도출된 값을 측정값으로 하여 다차원적 분석을 함으로써 청주시 버스 승객들의 이동패턴 특징을 파악할 수 있다. 분석 결과, 청주시의 경우 크게 1) 시외지역에서 터미널을 이용해 청주시에서 유입되는 패턴, 2) 주거지역에서 상업지역으로 이동하는 패턴, 3) 청주 인근 학교에서 상업 지역 (청주 중심가)로 이동하는 패턴을 발견할 수 있었다. 이동패턴은 도시 계획, 대중교통서비스 향상, 버스 노선 신설 등 다양한 교통정책의 수립에 활용될 수 있을 것으로 기대된다.