• 제목/요약/키워드: 데이터 기반 분석

검색결과 10,023건 처리시간 0.054초

스톰을 기반으로 한 실시간 SNS 데이터 분석 시스템

  • 이현경;고기철;손영성;김종배
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2015년도 춘계학술대회
    • /
    • pp.435-436
    • /
    • 2015
  • 광고 효과 분석과 극대화를 위해 기업들이 SNS를 활용하는 비중이 갈수록 높아지고 있다. 특히 광고 효과의 실질적인 효과 분석을 위해 SNS 이용자를 대상으로 한 하둡 기반의 키워드 추출 분석이 곽광을 받고 있다. 기존 하둡 기반 키워드 추출 분석은 저장된 데이터를 Map Reduce 방식으로 처리하는 것이 대부분이다. 이 때문에 정보가 실시간(Real Time)으로 전파되는 SNS의 특성을 온전히 반영하지 못 하는 한계를 가지고 있다. 본 연구에서는 이러한 기존의 하둡 기반 키워드 자동 추출 모델의 한계점을 지적하고, 이를 개선하기 위해 실시간 데이터 분석이 가능한 스톰을 활용하는 모델을 제시하고자 한다.

  • PDF

텍스트 마이닝 기반의 데이터 분석 웹 애플리케이션 (Data Analysis Web Application Based on Text Mining)

  • 길완제;김재웅;박구락;이윤열
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2021년도 제64차 하계학술대회논문집 29권2호
    • /
    • pp.103-104
    • /
    • 2021
  • 본 논문에서는 텍스트 마이닝 기반의 토픽 모델링 웹 애플리케이션 모델을 제안한다. 웹크롤링 기법을 활용하여 키워드를 입력하면 요약된 논문 정보를 파일로 저장할 수 있고 또한 키워드 빈도 분석과 토픽 모델링 등을 통해 연구 동향을 손쉽게 확인해볼 수 있는 웹 애플리케이션을 설계하고 구현하는 것을 목표로 한다. 제안 모델인 웹 애플리케이션을 통해 프로그래밍 언어와 데이터 분석 기법에 대한 지식이 부족하더라도 논문 수집과 저장, 텍스트 분석을 경험해볼 수 있다. 또한, 이러한 웹 시스템 개발은 기존의 html, css, java script와 같은 언어에 의존하지 않고 파이썬 라이브러리를 활용하였기 때문에 파이썬을 기반으로 데이터 분석과 머신러닝 교육을 수행할 경우 프로젝트 기반 수업 교육 과정으로 채택이 가능할 것으로 기대된다.

  • PDF

과금 데이터를 이용한 이동통신 네트워크의 특성 연구 (Measurement Analysis of Billing Record in the Cellular Networks)

  • 김예호;권종욱;최형기
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2008년도 한국컴퓨터종합학술대회논문집 Vol.35 No.1 (D)
    • /
    • pp.255-258
    • /
    • 2008
  • 현재 이동통신 네트워크는 통신 기술의 발전에 힘입어 음성 서비스를 넘어선 다양한 패킷 데이터 기반 서비스를 제공하고 있다. 하지만 현재 IEEE 802.11과 같은 이기종 네트워크에 대한 연구가 다양하게 진행되고 있는 것과 달리 이동통신 네트워크의 패킷 데이터 기반 서비스에 대한 연구는 이루어지지 않았다. 이러한 추세의 원인은 이동통신 네트워크가 사업자에 의해서 폐쇄적으로 운영되고 있기 때문이다. 우리는 지금까지 이기종 네트워크에 대한 연구를 바탕으로 예측만 하던 문제를 해결하기 위해 이 논문은 통해서 이동통신 네트워크의 패킷 기반 데이터 서비스의 특징을 분석한다. 실제 트래픽을 모두 분석하는 것은 규모의 문제로 불가능했기 때문에 우리는 서비스에 대한 과금 데이터를 사용했다. 과금 데이터에는 네트워크의 특징이 대부분 반영되어 있기 때문에 실제 트래픽을 수집해서 분석하는 것과 같다. 분석결 과로 이동통신 환경에서 사용자 행동 패턴과 서비스 유형별 트래픽 특성 및 네트워크의 특징을 보여준다. 이러한 결과는 향후 네트워크 진화에 의해서 예상되는 트래픽 예측 및 관리에 활용 가능하고, 네트 워크 모델링에 있어서의 기반 지식을 제공한다.

  • PDF

대용량 데이터 기반 트리플 저장소 아키텍처 분석 (Analysis of Scalable Triple Repository Architecture for Big Data)

  • 김태홍;엄정호;조민희;최성필;정한민
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2012년도 한국컴퓨터종합학술대회논문집 Vol.39 No.1(B)
    • /
    • pp.423-425
    • /
    • 2012
  • 비정형데이터의 분석을 위한 다양한 연구가 진행되면서 폭발적인 트리플 데이터 증가가 이루어졌다. 이는 결국 서비스 인프라의 병목현상을 초래하고 있으며, 그 해결책으로서 분산 병렬 아키텍처가 주목받고 있다. 본 논문은 대용량 시맨틱웹 자원을 저장, 적재, 질의 및 추론할 수 있는 트리플 저장소 특성에 가장 적합한 시스템 구조를 선정하기 위해 대용량 처리 능력, 데이터 처리 속도 및 안정성의 측면에서 연합 DBMS와 맵리듀스를 분석하는데 초점을 맞추고 있다. 분석 결과는 대용량 데이터 기반 트리플 저장소의 특성과 아키텍처의 유연성 및 향후 성능 개선 가능성을 판단하는 요소로 활용하여 맵리듀스 방식을 대용량 트리플 저장소에 적합한 방식으로 선정하였다. 본 연구는 대용량 데이터 기반 트리플 저장소 개발의 방향 수립을 위한 기반 연구로서 중요한 가치를 가진다.

워크플로우 프로세스 기반 데이터 큐브 및 분석 (Workflow Process-Aware Data Cubes and Analysis)

  • 진민혁;김광훈
    • 인터넷정보학회논문지
    • /
    • 제19권6호
    • /
    • pp.83-89
    • /
    • 2018
  • 워크플로우 프로세스 인텔리전스와 시스템에서 워크플로우 프로세스 마이닝 및 분석 문제가 중요해지고 있다. 워크플로우 프로세스 인텔리전스의 품질을 향상시키기 위해서는 워크플로우 프로세스 마이닝 및 분석을 수행할 때, 워크플로우 실행 이벤트 로그를 저장하는 효율적이고 효과적인 데이터 센터가 필수적이다. 본 논문에서는 워크플로우 이벤트 로그 데이터 센터를 효율적으로 구성하고 XES 형식으로 워크플로우 프로세스 실행 이벤트 로그를 효과적으로 저장하기 위한 3차원 프로세스 기반 데이터 큐브를 제안한다. 이의 검증 단계로서, 프로세스 기반 데이터 큐브가 워크플로우 프로세스 패턴과 해당 워크플로우 프로세스 실행 이벤트 내역에서 실행 비율 및 업무전달관계와 같은 분석적 지식을 발견하는데 얼마나 적합한지를 보여주기 위해 프로세스 마이닝 실행 예제를 제시한다. 결과적으로, 프로세스 기반 데이터 큐브와 이를 활용한 프로세스 마이닝 시스템의 구현을 통해, 워크플로우 프로세스의 기본적 제어흐름 패턴을 성공적으로 발견할 수 있음을 확인했다.

모바일 통신 빅데이터 기반 항공교통이용자 O/D 추출 알고리즘 연구 (Algorithm Development for Extract O/D of Air Passenger via Mobile Telecommunication Bigdata)

  • 조범철;권기훈
    • 한국빅데이터학회지
    • /
    • 제8권2호
    • /
    • pp.1-13
    • /
    • 2023
  • 현행 항공교통이용자 분석은 주로 통계적인 분석이 주류를 이루고 있으나, 이동경로, 지역별 이용자 수, 공항접근 소요시간 등 세부적인 사항에 대한 분석이 어렵다는 한계가 있다. 한편 빅데이터 기술 발전과 데이터3법 개정에 따라 빅데이터 기반 교통분석이 활성화되고 있으며, 모바일 통신 데이터는 휴대전화 단말기의 위치를 상세하게 파악할 수 있어 교통분석을 위한 좋은 분석자료가 될 수 있다. 이에 본 연구에서는 기존 항공교통이용자 분석방법의 한계를 극복하기 위해 이동경로 전체를 분석할 수 있는 모바일 통신 데이터를 기반의 교통이용자 O/D(Origin/Destination) 추출 알고리즘을 제시한다. 본 연구에서 제시하는 알고리즘은 각 공항에 공항신호탐지 구역을 설정하고, 해당 구역의 기지국 접속이력을 토대로 항공교통이용자를 추출하고 해당 이용자의 출발지-도착지 경로상의 기지국 접속 데이터를 토대로 이동경로를 추정하는 것이다. 본 연구에서는 2019년 1~12월의 기간을 대상으로 모든 국내 공항에 대하여 국내/국제선 이용자에 대해 O/D를 추출하였다. 또한 추출된 데이터의 검증을 위해 모바일 통신데이터 기반 항공교통 이용자 O/D 데이터와 항공통계데이터에 대해 상관성 분석을 수행하였다. 이를 통해 총량에는 차이가 있으나(국내선 4.1, 국제선 4.6) 상관성 0.99로 상관성이 높아 활용 가능할 것으로 판단되었다. 본 연구에서 제시한 알고리즘은 기존과 다르게 항공교통이용자의 이동행태, 지역별/연령별 비율 등 폭넓고 상세한 분석을 가능하게 하며, 향후 공항관련 정책 마련이나 지역별 시장분석 등 다양한 분야에서 활용할 수 있다.

사용자 데이터와 메타데이터에 대한 유닉스 버퍼 캐쉬의 성능 분석 (Performance analysis of UNIX buffer cache on user data and metadata)

  • 최진모;김준형;성영락;오하령
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1998년도 가을 학술발표논문집 Vol.25 No.2 (3)
    • /
    • pp.74-76
    • /
    • 1998
  • 본 논문에서는 유닉스 파일 시스템에서의 버퍼캐쉬 크기에 따라 사용자 데이터와 메타데이터의 버퍼 캐쉬 히트율을 분석하였다. 그리고 메타 데이터가 유닉스 운영체제 파일 시스템의 성능에 미치는 영향을 분석하고 이를 기반으로 버퍼 캐쉬의 동적 특성과 성능의 장애 요인들을 분석하였다. 유닉스 운영체제에서 사용되는 사용자 데이터와 메타데이터에 대한 버퍼 캐쉬의 동적인 동작을 분석하기 위하여 trace-driven방법을 이용하였으며 이를 위하여 시뮬레이터를 작성.사용하였다. 파일 시스템은 특정 유닉스 버전에 영향을 받지 않기 위해 USF[1]에 기초하였고, 작업부하(workload)로는 Sprite- trace 데이터 중 allspice 서버에서 추출한 데이터를 사용하였다.

  • PDF

대규모 과학 데이터 분석을 위한 데이터 집약형 클라우드 서비스 (Data Intensive Cloud Service for Large Scientific Data Analysis)

  • 함재균;우준;김석문;장지훈;박찬열
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2012년도 한국컴퓨터종합학술대회논문집 Vol.39 No.1(A)
    • /
    • pp.21-23
    • /
    • 2012
  • 과학 연구에 있어서 데이터 집약형 컴퓨팅은 데이터의 대형화와 함께 그 중요성이 날로 더하여지고 있다. 데이터 집약형 컴퓨팅은 대용량 데이터의 분석을 통해 과학적 지식을 발견하는 것을 목적으로 하고 있으며, 그 처리 방법에 있어서 데이터 병렬화 기법을 주로 사용하게 되는데, 이는 클라우드 컴퓨팅을 통해 도움을 받을 수 있는 계산 처리 방식이다. 또 데이터 집약형 컴퓨팅 서비스에서는 데이터의 검색 및 추출, 전송 등에 있어서 대용량의 데이터를 다룰 수 있는 고도화된 기술을 필요로 하게 된다. 본 연구에서는 대규모 과학 데이터 분석을 위해서 필요한 연구 환경을 유연하고 확장성 있게 제공하는 데이터 집약형 클라우드 서비스를 제안하였다. 본 연구의 목표 시스템은 대량의 데이터 분석을 위해 필요한 다양한 형태의 플랫폼, 응용 프로그램, 시스템 프로그램 등을 제공하는 클라우드 기반의 분석 서비스와 데이터 속성에 기반하여 빠른 검색 및 추출, 효율적인 전송을 제공하는 데이터 서비스로 이루어진다.

독립된 데이터셋을 활용한 효율적인 딥러닝 기반 비프로파일링 부채널 분석 방안 (Efficient Non-Profiled Deep Learning-based Side-Channel Analysis with Independent Dataset)

  • 김주환;문혜원;김연재;박아인;한동국
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2020년도 춘계학술발표대회
    • /
    • pp.169-172
    • /
    • 2020
  • 비프로파일링 부채널 분석은 프로파일링 장비가 없는 환경에서 부채널 정보를 이용해 비밀정보를 분석하는 방법이다. 기존에 알려진 Timon의 비프로파일링 분석은 학습 데이터 집합만을 이용해 공격하므로 전력 파형의 수가 제한된다면 과적합이 발생하여 키 분석 성능이 떨어질 수 있다. 본 논문에서는 비프로파일링 환경에서의 딥러닝 기반 부채널 분석 성능을 향상시키기 위해 학습 데이터 집합과 독립적인 검증 데이터 집합을 활용해야 하는 실증적 근거를 제시한다. 이에 대한 실험으로 기존 기법과 제시한 기법의 성능을 비교해 봤을 때, 검증 데이터를 활용하면 더 적은 데이터로 비밀키 추출이 가능함을 보인다.

빅데이터 기반 대용량 시계열 에너지 데이터 처리 시스템 (Time-series big data analytics software on IoT streaming data)

  • 강정훈;유준재
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2018년도 춘계학술발표대회
    • /
    • pp.52-53
    • /
    • 2018
  • 본 논문은 에너지 빅데이터를 분석하기 위해 대용량의 시계열 데이터를 처리하는 시스템의 설계, 구축 방법을 제시한다. 이미 사용 중인 건물이나 공장의 에너지 효율화를 위해서 정부는 효율자원 시장 지원 사업을 수행하고 있다, 에너지 소비 설비에 따라 고효율 자원으로 변경 설치하는 데 필요한 자금의 일부를 지원하고 있다. 정부지원으로 고효율 설비로 변경함에 따라 실증 사이트에서는 측정 데이터를 수집하여, 효율화 정도를 파악하기 위한 에너지 데이터 분석 시스템을 구축하여 운영하였다. 해당 측정 정보는 IoT 전력량계를 통해 수집되며, 수집된 데이터는 클라우드 시스템에서 다양한 머신러닝 알고리즘에 적용되어, 에너지 소비 효율 평가에 필요한 성능 지표를 연산한다. 구현된 진단 시스템은 기축 건물의 에너지 효율향상 상황을 분석하는데 기여할 수 있다. 빅데이터 기반의 에너지 분석 기능을 사용하여 에너지 고효율 장비의 운영시간, 부하율 등의 효율성과 성능통계를 연산할 수 있다.