• Title/Summary/Keyword: Hive

검색결과 81건 처리시간 0.024초

Matlab을 활용한 빅데이터 기반 분석 시스템 연구 (Research on the Analysis System based on the Big Data for Matlab)

  • 주문일;김희철
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2016년도 추계학술대회
    • /
    • pp.96-98
    • /
    • 2016
  • 최근 급속한 데이터의 생성으로 인하여 빅데이터 기술이 발전하고 있으며, 빅데이터를 분석하기 위한 다양한 빅데이터 분석 툴이 개발되어지고 있다. 대표적인 빅데이터 기반의 분석 툴은 R 프로그램, Hive, Tajo 등 다양한 분석 툴이 있다. 그러나, Matlab을 활용한 데이터 분석과 이를 위한 알고리즘 개발이 여전히 보편적이며, 빅데이터 분석에서도 Matlab이 광범위하게 사용되고 있다. 본 논문은 생체신호를 분석하는 Matlab을 활용한 빅데이터 기반 분석 시스템을 연구하고자 한다.

  • PDF

An Empirical Performance Analysis on Hadoop via Optimizing the Network Heartbeat Period

  • Lee, Jaehwan;Choi, June;Roh, Hongchan;Shin, Ji Sun
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제12권11호
    • /
    • pp.5252-5268
    • /
    • 2018
  • To support a large-scale Hadoop cluster, Hadoop heartbeat messages are designed to deliver the significant messages, including task scheduling and completion messages, via piggybacking to reduce the number of messages received by the NameNode. Although Hadoop is designed and optimized for high-throughput computing via batch processing, the real-time processing of large amounts of data in Hadoop is increasingly important. This paper evaluates Hadoop's performance and costs when the heartbeat period is controlled to support latency sensitive applications. Through an empirical study based on Hadoop 2.0 (YARN) architecture, we improve Hadoop's I/O performance as well as application performance by up to 13 percent compared to the default configuration. We offer a guideline that predicts the performance, costs and limitations of the total system by controlling the heartbeat period using simple equations. We show that Hive performance can be improved by tuning Hadoop's heartbeat periods through extensive experiments.

하둡 에코시스템을 활용한 로그 데이터의 이상 탐지 기법 (Anomaly Detection Technique of Log Data Using Hadoop Ecosystem)

  • 손시운;길명선;문양세
    • 정보과학회 컴퓨팅의 실제 논문지
    • /
    • 제23권2호
    • /
    • pp.128-133
    • /
    • 2017
  • 최근 대용량 데이터 분석을 위해 다수의 서버를 사용하는 시스템이 증가하고 있다. 대표적인 빅데이터 기술인 하둡은 대용량 데이터를 다수의 서버로 구성된 분산 환경에 저장하여 처리한다. 이러한 분산 시스템에서는 각 서버의 시스템 자원 관리가 매우 중요하다. 본 논문은 다수의 서버에서 수집된 로그 데이터를 토대로 간단하면서 효율적인 이상 탐지 기법을 사용하여 로그 데이터의 변화가 급증하는 이상치를 탐지하고자 한다. 이를 위해, 각 서버로부터 로그 데이터를 수집하여 하둡 에코시스템에 저장할 수 있도록 Apache Hive의 저장 구조를 설계하고, 이동 평균 및 3-시그마를 사용한 세 가지 이상 탐지 기법을 설계한다. 마지막으로 실험을 통해 세 가지 기법이 모두 올바로 이상 구간을 탐지하며, 또한 가중치가 적용된 이상 탐지 기법이 중복을 제거한 더 정확한 탐지 기법임을 확인한다. 본 논문은 하둡 에코시스템을 사용하여 간단한 방법으로 로그 데이터의 이상을 탐지하는 우수한 결과라 사료된다.

오프라인 마켓에 적용 가능한 빅데이터 분석 시스템 구축 방안에 관한 연구 (A Study on Possible Construction of Big Data Analysis System Applied to the Offline Market)

  • 이후영;박구락;김동현
    • 디지털융복합연구
    • /
    • 제14권9호
    • /
    • pp.317-323
    • /
    • 2016
  • 빅데이터는 현재 기업 경쟁력의 주요 자산으로 여겨지고 있고 향후에 그 영향력은 더욱 확대될 것으로 전망된다. 그 중요성을 인식한 기업들은 이미 빅데이터를 제품 개발과 마케팅에 적극적으로 활용하고 있으며 정치, 스포츠 등 사회 전반에 걸쳐 적용분야는 점점 늘어나고 있다. 그러나 시스템 구축에 따른 노하우 부족과 고비용은 빅데이터 시스템 도입에 여전히 큰 장애가 되고 있다. 본 논문에서는 중소규모 오프라인 마켓의 POS 판매 데이터를 빅데이터 시스템 중 오픈소스인 하둡(Hadoop) 및 하이브(Hive)를 기반으로 하는 빅데이터 시스템 구현을 목표로 한다. 이러한 융복합을 통해 단순히 손익분석과 재고관리 등에 집중되었던 기존 판매 시스템을 보완하여 고객의 소비패턴과 선호도 조사, 수요에 대한 사전 예측이 가능하도록 하는 경영자의 합리적인 의사결정에 기초자료로 활용할 수 있을 것으로 기대된다.

이동 평균과 3-시그마를 이용한 하둡 로그 데이터의 이상 탐지 (Anomaly Detection of Hadoop Log Data Using Moving Average and 3-Sigma)

  • 손시운;길명선;문양세;원희선
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제5권6호
    • /
    • pp.283-288
    • /
    • 2016
  • 최근 빅데이터 처리를 위한 연구들이 활발히 진행 중이며, 관련된 다양한 제품들이 개발되고 있다. 이에 따라, 기존 환경에서는 처리가 어려웠던 대용량 로그 데이터의 저장 및 분석이 가능해졌다. 본 논문은 다수의 서버에서 빠르게 생성되는 대량의 로그 데이터를 Apache Hive에서 분석할 수 있는 데이터 저장 구조를 제안한다. 그리고 저장된 로그 데이터로부터 특정 서버의 이상 유무를 판단하기 위해, 이동 평균 및 3-시그마 기반의 이상 탐지 기술을 설계 및 구현한다. 또한, 실험을 통해 로그 데이터의 급격한 증가폭을 나타내는 구간을 이상으로 판단하여, 제안한 이상 탐지 기술의 유효성을 보인다. 이 같은 결과를 볼 때, 본 연구는 하둡 기반으로 로그 데이터를 분석하여 이상치를 바르게 탐지할 수 있는 우수한 결과라 사료된다.

Calibration of Apis Mellifera Hives for Pollination of Brassica Crop at Rawalpindi

  • ABBASI, Khalida Hamid;RAZZAQ, Asif;JAMAL, Muhammad;KHANUM, Saeeda;JAWAD, Khawer;ULLAH, Muhammad Arshad
    • 식품보건융합연구
    • /
    • 제6권2호
    • /
    • pp.17-21
    • /
    • 2020
  • The response of honeybee (Apis mellifera L.) pollination on canola yield with reference to most suitable number of bee hive need per unit area of crops in order to meet optimum pollination needs and better economic yields by comparing number of hives and yield components an experiment was conducted at Beekeeping and Hill Fruit Pests Research, Station Rawalpindi during 2017-18 in complete randomized block design with two sets of four treatments for comparison: 1 hive acre-1, 2 hives acre-1, 3 hives acre-1 and 0 hive acre-1. The hives were kept inside the experimental area. Parameters were assessed: pollination density, pollinator's diversity, agronomic and economic yield. In case of pollination density, the cumulative mean abundance bee species revealed that at 1200 hours, Apis mellifera was the most abundant and frequent visitor with a mean population of 8.69 bees/plant followed by A. dorsata (0.72), Syrphid fly (0.2) and other pollinators. Minimum bee population was observed during 1400 hours, mainly due to the closure of flowers and partially due to high temperature (>35℃). Pollinator diversity revealed that A. mellifera was the most dominant pollinator of Brassica crop with highest abundance (71%). A. dosata ranked 2nd (16%) followed by A. florea (6%) respectively.

빅데이터 기반 의료 임상 결과 분석 (Big Data-based Medical Clinical Results Analysis)

  • 황승연;박지훈;윤하영;곽광진;박정민;김정준
    • 한국인터넷방송통신학회논문지
    • /
    • 제19권1호
    • /
    • pp.187-195
    • /
    • 2019
  • 최근 빅데이터 관련 기술들이 발전함에 따라 다양한 분야에서 생성되는 데이터들을 수집하여 저장하고 처리 및 분석할 수 있게 되었다. 이러한 빅데이터 기술들을 임상 결과 분석에 활용하고, 임상시험 설계 최적화를 통해 보건의료분야에 투입되는 막대한 비용을 절감할 수 있을 것으로 전망된다. 따라서 본 논문에서는 임상 결과를 분석하여 임상시험 기간과 비용 등을 줄일 수 있는 가이드 정보를 제시하고자 한다. 먼저 Sqoop을 사용하여 임상 결과 데이터가 저장된 관계형 데이터 베이스로부터 HDFS에 수집하여 저장하고, 하둡을 기반으로 동작하는 처리 도구인 Hive를 이용하여 데이터를 처리한다. 공공분야, 기업 등 각 분야에서 많이 활용되고 있는 빅데이터 분석 도구인 R을 이용하여 연관성 분석을 한다.

초고속 유전자 증폭법을 이용한 벌집꼬마밑빠진벌레 (Aethina tumida)의 신속한 검출 기법 개발 (Development of Rapid Detection System for Small Hive Beetle (Aethina tumida) by using Ultra-Rapid PCR)

  • 김정민;임수진;;홍기정;윤병수
    • 한국양봉학회지
    • /
    • 제32권2호
    • /
    • pp.119-131
    • /
    • 2017
  • 벌집꼬마밑빠진벌레 (Small hive beetle; SHB; Aethina tumida)의 신속검출과 대량 조사를 위하여 SHB 특이 초고속 유전자 증폭법을 개발하였다. 3쌍의 Aethina tumida-특이 유전자 증폭용 프라이머들은 벌집꼬마밑빠진벌레의 미토콘드리아 유전체 중 cytochrome oxidase subunit I (COI) 유전자에 근거하여 선발하였다. 최적화된 초고속 PCR은 $2.1{\times}10^1$ 분자의 작은벌집딱정벌레 COI 유전자를 18분 40초만에 특이적으로 그리고 정량적으로 검출할 수 있었다. 양봉현장의 적용을 위하여, 봉변으로부터 쉽게 DNA를 추출하는 방법을 고안하였으며, 봉변 1g 중 $10^5$ 분자의 벌집꼬마밑빠진벌레 COI 유전자가 존재할 경우(1/1000의 SHB 유충 사체), 10분 이내에 벌집꼬마밑빠진벌레의 존재와 분자적 정량을 마칠 수 있었다. 제안하는 이 실험법이 양봉현장에 널리 적용되어, 벌통 내 벌집꼬마밑빠진벌레의 침입여부 판단, 증식의 수준, 그리고 침입지역의 파악 및 제어에 활용되기를 기대한다.

위젯과 보안기능을 탑재한 IoT기반 스마트액자(BeeHiveFrame) (IoT-based Smart Photo Frame Containing Widget and Security Functions(BeeHiveFrame))

  • 권용진;김판겸;김우철;박예운;김봉재;황영섭
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2016년도 추계학술발표대회
    • /
    • pp.880-881
    • /
    • 2016
  • 디지털액자가 고전적 액자의 향취를 주며 또한 사진을 바꿀 수 있는 기능도 제공하지만 아직 새 흐름이 되는 못했다. 그 이유는 비싼 가격과 사진을 전송하기가 불편하기 때문이다. 우리는 디지털 액자로 사진 전송을 쉽게 하고, 거기에 더하여 위젯과 보안 기능을 추가하는 연구를 하였다. 사진 전송을 위하여 AWS(Amazon Web Service) 서버를 사용하는데 AWS 서버는 언제 어디서나 원할 때면 사진을 WiFi로 전송할 수 있게 한다. 이는 현재 사용하는 USB나 SD 카드를 이용하여 디지털 사진을 전송하는 것보다 훨씬 편리하다. 우리의 디지털 액자를 사용하면 다른 사람과 사진 교환이 쉽고 따라서 가족, 친구, 동료 사이의 친밀감도 쉽게 높일 수 있다.