• 제목/요약/키워드: 공간데이터 마이닝

검색결과 177건 처리시간 0.025초

센서 네트워크의 데이터 스트림 마이닝을 위한 온톨로지 기반의 전처리 기법 (Ontology based Preprocessing Scheme for Mining Data Streams from Sensor Networks)

  • 정재은
    • 지능정보연구
    • /
    • 제15권3호
    • /
    • pp.67-80
    • /
    • 2009
  • 다양한 센서의 개발과 센서 네트워크 구축으로 인해 특정 공간의 환경 데이터를 수집할 수 있다. 보다 유용한 정보 및 지식의 발견을 위하여 데이터 마이닝(Data mining) 기법이 활용되는 연구들이 소개되었다. 본 연구에서는 이와 같은 데이터 마이닝 기법의 효율성 증대를 위하여 센서 네트워크로부터의 데이터 스트림의 전처리 과정(Preprocessing)을 수행하고자 한다. 제안하는 센서 스트림 데이터의 전처리 과정은 i) 세션확인(Session identification)과 ii) 오류검증(Error detection) 문제를 해결하고자 한다. 특히, 이를 위해 각센서 장비로부터 수집되는 데이터의 의미(Semantics)를 표현하고 있는 온톨로지(Ontology)를 적용한다. 본 연구 결과의 성능 평가를 위하여 센서 네트워크 테스팅 환경을 교내에 설치하였으며 30여일 동안 수집된 데이터를 이용하여 시뮬레이션을 실행하였다.

  • PDF

밀도 기반 클러스트링을 적용한 공간 특성화 시스템 (Spatial Characterization System using Density-Based Clustering)

  • 유재현;이주홍;전석주;박상호
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2005년도 추계학술발표대회 및 정기총회
    • /
    • pp.101-104
    • /
    • 2005
  • 최근 GIS 시스템, 위성사진, 원격 탐사 시스템과 같은 다양한 응용 시스템으로부터 수집된 방대한 양의 공간 데이터에서 지식을 발견하는 공간 데이터 마이닝에 대한 관심이 더욱 높아지고 있다. 기존의 공간 데이터마이닝에 대한 연구들은 방대한 비공간 데이터들의 지식을 효율적으로 탐사하고자 하였다. 그러나 기존의 시스템은 발견된 지식의 효과성을 보장하지 못하는 문제점을 가진다. 따라서 본 논문은 공간 데이터 타입을 포함하는 대용량의 데이터들로부터 효과성을 보장하는 특성화 지식 탐사시스템을 제안한다. 본 논문에서 제안하는 공간 특성화 지식 탐사시스템은 밀도 기반의 클러스터링 기법을 적용하여 탐사된 특성화 지식의 효과성을 높였다.

  • PDF

위치기반 소셜 미디어 데이터의 텍스트 마이닝 기반 공간적 클러스터링 분석 연구 (Spatial Clustering Analysis based on Text Mining of Location-Based Social Media Data)

  • 박우진;유기윤
    • 대한공간정보학회지
    • /
    • 제23권2호
    • /
    • pp.89-96
    • /
    • 2015
  • 위치기반 소셜 미디어 데이터는 빅데이터, 위치기반서비스 등 다양한 분야에서 활용가능성이 매우 큰 데이터이다. 본 연구에서는 위치기반 소셜 미디어 데이터의 텍스트 정보를 분석하여 주요한 키워드들이 공간적으로 어떻게 분포하고 있는지를 파악할 수 있는 일련의 분석방법론을 적용해보았다. 이를 위해, 위치태그를 지닌 트윗 데이터를 서울시 강남지역과 그 주변지역에 대하여 2013년 8월 한달 간 수집하였으며, 이 데이터를 대상으로 하여 텍스트 마이닝을 통해 주요 키워드들을 도출하였다. 이러한 키워드들 중 음식, 엔터테인먼트, 업무 및 공부의 세 카테고리에 해당하는 키워드들만 추출, 분류하였으며 각 카테고리에 해당하는 트윗 데이터들에 대해서 공간적 클러스터링을 실시하였다. 도출된 각 카테고리별 클러스터들을 실제 그 지역의 건물 또는 벤치마크 POI들과 비교한 결과, 음식 카테고리 클러스터는 대규모 상업지역들과 일치도가 높았고 엔터테인먼트 카테고리의 클러스터는 공연장, 극장, 잠실운동장 등과 일치하였다. 업무 및 공부 카테고리 클러스터들은 학원 밀집지역 및 사무용 빌딩 밀집지역과 높은 일치도를 나타내었다.

소셜미디어 데이터를 활용한 중앙정부와 지방정부 간 지하공간의 주요 이슈 고찰 (Analysis of Issues on Underground Space between Central and Local Governments Utilizing Social Media Data)

  • 최해옥;백성준
    • 지적과 국토정보
    • /
    • 제46권1호
    • /
    • pp.75-86
    • /
    • 2016
  • 본 연구는 중앙정부와 지방정부 간 지하공간에 관한 주요 이슈를 파악하기 위해 소셜미디어 데이터를 활용하였다. 또한 이를 빅데이터 분석방법론을 통해 분석하였다. 연구방법론으로 사회네트워크분석의 키워드 네트워크 방법을 사용하였고 트위터를 통해 얻어진 텍스트 데이터를 텍스트마이닝 기법을 사용하여 분석하였다. 특히 지하공간은 2014년 잠실 싱크홀 사건 이후 사회적으로 관심을 가지고 있는 이슈로서 키워드 네트워크 분석을 통해 계량적으로 분석을 시도하였다. 네트워크의 속성을 파악하기 위해 중심성 지수, 그룹밀도 분석을 통해 지하공간과 관련된 이슈를 파악하였다. 이러한 분석 결과 중앙정부의 정책 관련 항목은 지자체 정책과 관련이 있음을 확인하였다. 중앙정부는 예방차원에서 특별법을 바탕으로 예방체계를 구축하여 지자체가 지하공간에 관련된 문제에 대해 대응 관리하도록 법에 근거한 예방체계를 구축하고 있다. 이와 같은 결과는 앞으로 중앙 정부가 연구관련 분야를 강화함으로써 지하공간 관련 안전대책을 구축하는 데 법과 기술이 서로 협력하여 발전해야 함을 시사해 준다.

다각형 객체를 지원하는 공간 클러스터링 기법의 설계 (Design of Spatial Clustering Method for Spatial Objects with Polygonometry)

  • 황지완;문상호
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2004년도 춘계종합학술대회
    • /
    • pp.374-377
    • /
    • 2004
  • 공간 데이터 마이닝을 위한 기존의 클러스터링 기법들은 점 객체만을 대상으로 한다. 즉, 선이나면 같은 다양한 공간 객체들을 지원하지 못한다. 이것은 클러스터링 과정에서 객체들 간의 거리 계산에 있어서, 점 객체는 용이하지만, 선과 면인 경우에는 어렵기 때문이다. 본 논문에서는 이러한 문제점을 해결하기 위하여 균등 격자를 이용한 클러스터링 기법을 설계한다. 세부적으로 이 기법에서는 다각형 객체들 간의 거리 계산을 균등 격자를 이용하여 단순화시킴으로서 거리 계산에 따른 시간과 비용을 줄일 수 있다.

  • PDF

밀도 클러스터링을 이용한 공간 특성화 시스템 설계 및 구현 (Design and Implementation of Spatial Characterization System using Density-Based Clustering)

  • 유재현;박태수;안찬민;박상호;홍준식;이주홍
    • 한국컴퓨터정보학회논문지
    • /
    • 제11권2호
    • /
    • pp.43-52
    • /
    • 2006
  • 최근 유비쿼터스 컴퓨팅의 관심이 증대되면서, 방대하고 다양한 형태의 데이터에 대한 효율성과 효과성을 고려한 지식 탐사연구의 필요성이 요구된다. 공간 특성화 방법은 공간과 비공간 속성들을 고려하여 특성화 지식을 발견하는 방법으로, 기존의 특성화 방법을 확장하여 공간 영역에 대한 다양한 형태의 지식을 발견할 수 있다. 기존 공간 특성화기법에 대한 연구들은 다음과 같은 문제점을 가진다. 첫째, 기존의 연구는 탐사된 지식의 결과가 다각적인 공간 분석을 수행하지 못하는 문제점을 가진다 둘째, 공간 탐색 시 사용자에 의해 미리 정해진 위치 영역만을 고려하여 탐색함으로 유용한 지식탐사를 보장하지 못하는 문제점을 가진다. 따라서 본 연구에서는 밀도 기반의 클러스터링이 적용된 새로운 공간 특성화기법을 제안한다.

  • PDF

한정된 메모리 공간에서 데이터 스트림의 빈발항목 최적화 방법 (Finding Frequent Itemsets Over Data Streams in Confined Memory Space)

  • 김민정;신세정;이원석
    • 정보처리학회논문지D
    • /
    • 제15D권6호
    • /
    • pp.741-754
    • /
    • 2008
  • 지속적으로 확장되는 데이터 스트림에 대한 데이터 마이닝 수행과정에서는 메모리 사용량을 가용한 범위 내로 제한하는 것이 중요한 요소이다. 본 논문에서는 데이터 스트림 환경에서 한정된 메모리 공간을 이용하여 빈발 항목집합을 탐색하는데 효과적인 프라임 패턴 트리(Prime pattern tree: PPT)구조를 제안한다. 프라임 패턴 트리는 기존의 전위 트리 구조와 비교하여 항목집합들을 하나의 노드로 관리함으로써 트리의 크기를 크게 줄일 수 있는 장점이 있다. 또한, 전지 임계값 $S_{\delta}$에 따라 노드를 병합하거나 분리하여 동적으로 트리의 크기와 결과 집합의 정확도를 마이닝 수행 중에 조절 할 수 있다. $S_{\delta}$값이 크면 한 노드에서 관리되는 항목집합의 수가 증가하게 되고, 출현 빈도수를 추정해야 하기 때문에, $S_{\delta}$값이 작을수록 결과집합의 정확도가 높다. 이처럼 PPT에는 트리의 크기와 정확도의 trade-off 가 존재한다. PPT의 이러한 특성에 기반하여, 데이터 스트림에서 갑자기 데이터 집합에 변화가 생겨 빈발항목이 될 가능성이 높은 항목들이 많이 출현하는 경우에도 마이닝을 지속적으로 수행할 수 있도록 지원한다. 본 논문에서는 프라임 패턴 트리를 이전 연구에서 제안한 데이터 스트림에서 최근 빈발 항목 탐색 방법인 estDec 방법에 적용하여 한정된 작은 양의 메모리 공간을 이용하여 온라인 데이터 스트림에서 빈발항목을 탐색하는 방법을 제시한다. 또한, 가용 메모리 범위에서 최적의 메모리를 사용하여 최적의 마이닝 결과를 얻을 수 있도록 하는 메모리 사용량에 대한 적응적 방법을 제시한다. 끝으로, 여러 실험을 통한 효율성 검증을 통해 제안된 방법의 여러 특성을 확인한다.

PPFP(Push and Pop Frequent Pattern Mining): 빅데이터 패턴 분석을 위한 새로운 빈발 패턴 마이닝 방법 (PPFP(Push and Pop Frequent Pattern Mining): A Novel Frequent Pattern Mining Method for Bigdata Frequent Pattern Mining)

  • 이정훈;민연아
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제5권12호
    • /
    • pp.623-634
    • /
    • 2016
  • 현존하는 빈발 패턴 마이닝 방법은 대부분 시간 효율성을 목표로 하고, 물리적 메모리 사용에 매우 의존적이다. 하지만 빅데이터 시대가 도래함에 따라 실제 세상의 데이터베이스는 급속도로 증가하고 있으며, 그에 따라 기존의 방법으로 현실적인 거대한 양의 데이터를 마이닝하기에 물리적 메모리 공간이 부족한 실정이다. 이러한 문제를 해결하기 위해, 빈발 패턴 마이닝의 메모리 의존성을 줄이기 위한 보조저장장치 기반의 연구들이 진행되었으나, 메모리 기반의 방법들에 비해 처리 시간이 너무 많이 소비된다는 한계가 있었다. 따라서 확장성을 가지며, 기존의 디스크 기반의 방법들에 비해 시간효율성을 높인 새로운 빈발 패턴 마이닝이 필요하게 되었다. 본 논문에서는 빅데이터로부터 빈도 아이템 집합들을 마이닝하기 위해 메모리와 디스크를 함께 사용하는 스택 기반의 새로운 접근법인 PPFP 알고리즘을 제안하였다. PPFP는 빈발 패턴 마이닝 접근법 중 가장 인기 있고 효율적인 접근법 중 하나인 FP-growth를 기반으로 하고 있다. PPFP 마이닝 방법은 다음과 같이 두 단계로 진행된다. (1) IFP-tree 구축: FP-tree를 생성한 후, 새로운 인덱스 번호 부여 방법으로 FP-tree의 각 노드에 인덱스 번호를 부여하고, 이 인덱스 번호가 부여된 FP-tree(IFP-tree)를 테이블로 변환하여(IFP-table) 디스크에 저장한다. (2) PPFP 알고리즘을 이용한 빈발 패턴 마이닝: 스택 기반의 PUSH-POP 방식으로 패턴을 확장시켜 나가며 빈발 패턴을 마이닝한다. 이러한 방식을 통해 메모리 기반의 방법에 비해 반복적으로 많은 시간이 소모되는 연산에 매우 적은 양의 메모리를 활용하여 확장성과 함께 시간효율성 또한 향상시킬 수 있었다. 그리고 기존의 연구 방법들과 비교 실험을 통해 새로운 알고리즘의 성능을 증명하였다.

위키피디어 기반 개념 공간을 가지는 시멘틱 텍스트 모델 (A Semantic Text Model with Wikipedia-based Concept Space)

  • 김한준;장재영
    • 한국전자거래학회지
    • /
    • 제19권3호
    • /
    • pp.107-123
    • /
    • 2014
  • 텍스트마이닝 연구의 기본적인 난제는 기존 텍스트 표현모델이 자연어 문장으로 기술된 텍스트 데이터로부터 의미 또는 개념 정보를 표현하지 않는데 기인한다. 기존 텍스트 표현모델인 벡터공간 모델(vector space model), 불리언 모델(Boolean model), 통계 모델(statistical model), 텐서공간 모델(tensor space model) 등은 'Bag-of-Words' 방식에 바탕을 두고 있다. 이러한 텍스트 모델들은 텍스트에 포함된 단어와 그것의 출현 횟수만으로 텍스트를 표현하므로, 단어의 함축 의미, 단어의 순서 및 텍스트의 구조를 전혀 표현하지 못한다. 대부분의 텍스트 마이닝 기술은 대상 문서를 'Bag-of-Words' 방식의 텍스트 모델로 표현함을 전제로 하여 발전하여 왔다. 하지만 오늘날 빅데이터 시대를 맞이하여 방대한 규모의 텍스트 데이터를 보다 정밀하게 분석할 수 있는 새로운 패러다임의 표현모델을 요구하고 있다. 본 논문에서 제안하는 텍스트 표현모델은 개념공간을 문서 및 단어와 동등한 매핑 공간으로 상정하여, 그 세 가지 공간에 대한 연관 관계를 모두 표현한다. 개념공간의 구성을 위해서 위키피디어 데이터를 활용하며, 하나의 개념은 하나의 위키피디어 페이지로부터 정의된다. 결과적으로 주어진 텍스트 문서집합을 의미적으로 해석이 가능한 3차 텐서(3-order tensor)로 표현하게 되며, 따라서 제안 모델을 텍스트 큐보이드 모델이라 명명한다. 20Newsgroup 문서집합을 사용하여 문서 및 개념 수준의 클러스터링 정확도를 평가함으로써, 제안 모델이 'Bag-of-Word' 방식의 대표적 모델인 벡터공간 모델에 비해 우수함을 보인다.

u-SilverCare에서의 USN 미들웨어 기반 센서 데이터 마이닝 (USN middleware based Sensor Datamining in u-SilverCare Service)

  • 허병문;이준욱;채덕진;정재두;류근호
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2006년도 추계학술발표대회
    • /
    • pp.429-432
    • /
    • 2006
  • 기존의 u-HealthCare 서비스는 환자에 대해서 일정한 공간에서의 센서의 on/off 타입에 대한 모니터링/환자관리의 서비스를 제공하였다. 이러한 환경하에서의 주된 서비스는 현재 환자의 상태에 대한 수동적인 형태이다. 이러한 문제점들을 해결하기 위해 센서 데이터에 대한 연속센서 데이터마이닝 기법을 이용한다. USN의 응용서비스인 u-HealthCare 서비스는 센서데이터로부터 생체정보 및 위치정보를 이용하여 환자/보호자/관련 의료진에게 필요한 정보를 제공한다. 이것은 환자에 대한 관리/모니터링뿐만 아니라 환자의 상태에 따른 센싱(sensing)된 데이터를 이용한 패턴(pattern), 예측-(prediction), 이상치(outlier)를 분석함으로써 보다 나은 서비스를 제공할 수 있다. 본 논문에서는 센서 데이터에 대해 새로운 연속 센서데이터 마이닝 기법을 적용하여 질의를 통해 지식을 추출하고 보다 지능화된 서비스를 제공할 수 있는 응용서비스 기법을 제안한다.

  • PDF