• 제목/요약/키워드: 지식기반 데이터마이닝

검색결과 47건 처리시간 0.041초

u-SilverCare에서의 USN 미들웨어 기반 센서 데이터 마이닝 (USN middleware based Sensor Datamining in u-SilverCare Service)

  • 허병문;이준욱;채덕진;정재두;류근호
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2006년도 추계학술발표대회
    • /
    • pp.429-432
    • /
    • 2006
  • 기존의 u-HealthCare 서비스는 환자에 대해서 일정한 공간에서의 센서의 on/off 타입에 대한 모니터링/환자관리의 서비스를 제공하였다. 이러한 환경하에서의 주된 서비스는 현재 환자의 상태에 대한 수동적인 형태이다. 이러한 문제점들을 해결하기 위해 센서 데이터에 대한 연속센서 데이터마이닝 기법을 이용한다. USN의 응용서비스인 u-HealthCare 서비스는 센서데이터로부터 생체정보 및 위치정보를 이용하여 환자/보호자/관련 의료진에게 필요한 정보를 제공한다. 이것은 환자에 대한 관리/모니터링뿐만 아니라 환자의 상태에 따른 센싱(sensing)된 데이터를 이용한 패턴(pattern), 예측-(prediction), 이상치(outlier)를 분석함으로써 보다 나은 서비스를 제공할 수 있다. 본 논문에서는 센서 데이터에 대해 새로운 연속 센서데이터 마이닝 기법을 적용하여 질의를 통해 지식을 추출하고 보다 지능화된 서비스를 제공할 수 있는 응용서비스 기법을 제안한다.

  • PDF

퍼지 데이터로부터 연관 규칙을 추출하기 위한 도구의 개발 (On Developing of a tool for association rule extracting from fuzzy data)

  • 강유경;황석형;김응희
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2010년도 추계학술발표대회
    • /
    • pp.413-416
    • /
    • 2010
  • 오늘날, 대량의 데이터를 수집, 저장 및 관리하는 데이터베이스 기술의 진보를 기반으로, 의료, 과학, 교육, 비즈니스 등 다양한 분야에서 발생되는 대규모 데이터를 축적하게 되었다. 다양한 분야에서 축적된 대량의 데이터에 내재된 유용한 정보를 수월하게 추출하여 분석하기 위해 널리 사용되고 있는 형식개념분석기법은, 주어진 데이터로부터 정보의 최소단위로써 개념들을 추출하고, 개념들 사이의 관계를 토대로 개념계층구조를 구축하기 위한 정형화된 데이터마이닝 기법을 제공하고 있다. 본 논문에서는, 주어진 퍼지 데이터에 잠재된 유용한 정보를 추출하기 위해, 퍼지 집합 이론을 형식개념분석기법에 접목한 퍼지개념분석기법과 이를 지원하기 위해 본 연구에서 개발된 FFCA-Wizard를 소개한다. 또한, FFCA-Wizard를 사용하여 실세계 데이터를 대상으로 퍼지개념분석을 실시한 실험 결과를 보고한다.

데이터마이닝기법을 이용한 인터넷교육 맞춤 시스템 (Internet Learning customized System for using Data Mining Techniques)

  • 이진호;류준석;김응모
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2009년도 추계학술발표대회
    • /
    • pp.763-764
    • /
    • 2009
  • 정보통신 기술의 발전은 우리의 생활 전반에 걸쳐 빠르게 흡수되며 급속히 진행되고 있다. 특히 교육의 패러다임이 변화됨에 따라 오늘날 인터넷을 기반으로 한 가상교육의 형태는 학생들로 하여금 더 많은 지식 습득 기회를 제공한다. 본 논문에서는 인터넷상의 교육 시스템에서 개인의 정보를 수집하고, 개인별 교육성향을 분석하여 개인별로 적절한 서비스를 제공하기 위한 연구를 하였다. 데이터 마이닝 기법 중 연관규칙과 클러스터링 협업 필터링을 이용하여 학습자의 교육성향을 파악할 수 있다. 이를 마케팅에 적용한다면 학습자의 선호도를 상승시키고 해당 회사에 신뢰도가 높아져 이익을 증가시킬 수 있는 시스템으로 활용될 수 있다.

다계층 밀도기반 군집화 기법 (Multi-hierarchical Density-based Clustering Method)

  • 신동문;정석호;이경민;이동규;손교용;류근호
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2009년도 추계학술발표대회
    • /
    • pp.797-798
    • /
    • 2009
  • 군집화는 대용량의 데이터로부터 유용한 정보를 추출하는 데에 적합한 데이터마이닝 기법들 중 하나이다. 군집화 기법은 주어진 데이터그룹 내에서 사전정보 없이 의미있는 지식을 발견할 수 있으므로 큰 어려움이 없이 실제 응용분야에 적용할 수 있다. 또한, 대용량 데이터를 다룰 때에 개별적인 데이터에 대한 접근 횟수를 줄이고, 알고리즘이 다루어야 할 데이터 구조의 크기를 줄일 수 있다. 본 논문에서는 밀도-기반 군집화 기법을 기반으로 하는 새로운 군집화 기법을 제안한다. 우리가 제안하는 군집화 기법은 반복적인 군집화 과정을 통하여 군집 내 주변 잡음을 제거하고 더 세밀하게 집단을 세분화하는 것이 가능하다. 또한, 군집을 표현하는 데에 계층구조로 나타내어 각 군집의 상관관계를 파악하는 데에 유리하다. 본 논문에서 제안하는 군집화 기법을 통하여 다양한 밀도를 가진 군집들을 효과적으로 분류할 수 있을 거라고 기대된다.

Nonstandard Machine Learning Algorithms for Microarray Data Mining

  • Zhang, Byoung-Tak
    • 한국생물정보학회:학술대회논문집
    • /
    • 한국생물정보시스템생물학회 2001년도 제2회 생물정보 워크샵 (DNA Chip Bioinformatics)
    • /
    • pp.165-196
    • /
    • 2001
  • DNA chip 또는 microarray는 다수의 유전자 또는 유전자 조각을 (보통 수천내지 수만 개)칩상에 고정시켜 놓고 DNA hybridization 반응을 이용하여 유전자들의 발현 양상을 분석할 수 있는 기술이다. 이러한 high-throughput기술은 예전에는 생각하지 못했던 여러가지 분자생물학의 문제에 대한 해답을 제시해 줄 수 있을 뿐 만 아니라, 분자수준에서의 질병 진단, 신약 개발, 환경 오염 문제의 해결 등 그 응용 가능성이 무한하다. 이 기술의 실용적인 적용을 위해서는 DNA chip을 제작하기 위한 하드웨어/웻웨어 기술 외에도 이러한 데이터로부터 최대한 유용하고 새로운 지식을 창출하기 위한 bioinformatics 기술이 핵심이라고 할 수 있다. 유전자 발현 패턴을 데이터마이닝하는 문제는 크게 clustering, classification, dependency analysis로 구분할 수 있으며 이러한 기술은 통계학과인공지능 기계학습에 기반을 두고 있다. 주로 사용된 기법으로는 principal component analysis, hierarchical clustering, k-means, self-organizing maps, decision trees, multilayer perceptron neural networks, association rules 등이다. 본 세미나에서는 이러한 기본적인 기계학습 기술 외에 최근에 연구되고 있는 새로운 학습 기술로서 probabilistic graphical model (PGM)을 소개하고 이를 DNA chip 데이터 분석에 응용하는 연구를 살펴본다. PGM은 인공신경망, 그래프 이론, 확률 이론이 결합되어 형성된 기계학습 모델로서 인간 두뇌의 기억과 학습 기작에 기반을 두고 있으며 다른 기계학습 모델과의 큰 차이점 중의 하나는 generative model이라는 것이다. 즉 일단 모델이 만들어지면 이것으로부터 새로운 데이터를 생성할 수 있는 능력이 있어서, 만들어진 모델을 검증하고 이로부터 새로운 사실을 추론해 낼 수 있어 biological data mining 문제에서와 같이 새로운 지식을 발견하는 exploratory analysis에 적합하다. 또한probabilistic graphical model은 기존의 신경망 모델과는 달리 deterministic한의사결정이 아니라 확률에 기반한 soft inference를 하고 학습된 모델로부터 관련된 요인들간의 인과관계(causal relationship) 또는 상호의존관계(dependency)를 분석하기에 적합한 장점이 있다. 군체적인 PGM 모델의 예로서, Bayesian network, nonnegative matrix factorization (NMF), generative topographic mapping (GTM)의 구조와 학습 및 추론알고리즘을소개하고 이를 DNA칩 데이터 분석 평가 대회인 CAMDA-2000과 CAMDA-2001에서 사용된cancer diagnosis 문제와 gene-drug dependency analysis 문제에 적용한 결과를 살펴본다.

  • PDF

장소 추천을 위한 방문 간격 보정 (Temporal Interval Refinement for Point-of-Interest Recommendation)

  • 김민석;이재길
    • 데이타베이스연구회지:데이타베이스연구
    • /
    • 제34권3호
    • /
    • pp.86-98
    • /
    • 2018
  • 장소추천시스템은 시간과 장소가 주어졌을 때, 사용자에게 가장 흥미로운 장소를 추천해주는 시스템을 말한다. 스마트폰과 사물인터넷(IoT), 장소기반 소셜네트워크(LBSN)의 발달에 힘입어 사용자들의 방대한 양의 장소 방문 데이터를 축적하게 되었고, 이를 통해 특정한 시점에 사용자들이 원하는 장소를 적절히 추천해줄 수 있는 장소추천시스템의 중요성이 부각되었다. 장소추천시스템은 사용자의 방문(Check-in) 횟수라는 암시적 피드백(Implicit feedback) 데이터에서 사용자의 시퀀스 선호(Sequential preference)를 이끌어내어 높은 성능을 내기 위한 연구들이 제안되었다. 하지만 시퀀스 선호 정보를 활용하여 모델을 구성하는 경우, 데이터의 밀도가 더욱 희박해지고 이에 따라 적은 수의 데이터에 기반하여 구축되는 모델의 성능이 왜곡될 가능성이 존재한다. 본 연구에서는 신뢰도(Confidence)에 기반하여 방문 주기를 보정하는 방법론을 제안한다. 사용자의 시퀀스 선호 정보로부터 도출된 장소 간 방문 시간전이간격(temporal transition interval)을 활용하여 추천시스템을 구성할 때, 해당 방법론을 통하여 데이터의 왜곡을 보정함으로써 추천시스템의 성능을 향상하였다. 제안하는 방법의 효과를 검증하기 위하여, Foursquare와 Gowalla의 데이터셋을 이용한 비교실험을 통해 제안하는 방법론의 우수성을 보였다.

조건(암, 정상)에 따라 특이적 관계를 나타내는 유전자 쌍으로 구성된 유전자 모듈을 이용한 독립샘플의 클래스예측 (Class prediction of an independent sample using a set of gene modules consisting of gene-pairs which were condition(Tumor, Normal) specific)

  • 정현이;윤영미
    • 한국컴퓨터정보학회논문지
    • /
    • 제15권12호
    • /
    • pp.197-207
    • /
    • 2010
  • 대용량(High-throughput) 형태로 얻어진 cDNA 마이크로어레이 데이터에 다양한 데이터 마이닝 기법을 적용하면 서로 다른 조직에서 추출한 유전자의 발현정도를 비교할 수 있고 정상세포와 암세포에서 발현량의 차이를 보이는 DEG(Differently Expression Gene) 유전자를 추출할 수 있다. 이들을 이용하여 병을 진단할 수 있을 뿐만 아니라, 암의 진행 단계(Cancer Stage)에 따른 치료 방법을 결정할 수 있다. 마이크로어레이를 기반으로 한 대부분의 암 분류자는 기계학습 기법을 이용하여 암 관련 유전자를 추출하여, 이들 유전자를 총체적으로 이용하여 독립 샘플의 클래스(암, 정상)를 판정한다. 하지만 유전자의 발현량의 차이뿐만 아니라 유전자와 유전자의 상관관계의 변화가 질병 진단에 활용될 수 있다. 대부분의 질병은 단독 유전자의 변이에 의한 것이 아니라 유전자의 모듈로 이루어진 유전자조절네트워크의 변이에 의한 것이기 때문이다. 본 논문에서는 조건에 따라 특이적 관계를 나타내는 유전자 쌍을 식별하여, 이들 유전자 쌍을 이용한 유전자 분류 모듈을 생성한다. 분류 모듈을 이용한 암 분류 방법이 기존의 암 분류 방법보다 높은 정확도로 암과정상 샘플을 분류함을 보여주고 있다. 분류 모듈을 구성하는 유전자의 수가 상대적으로 적으므로 임상키트로의 개발도 고려할 수 있다. 향후 분류 모듈에 속하는 유전자의 기능적 검증을, GO(Gene Ontology)를 활용함으로서, 밝혀지지 않은 새로운 암 관련 유전자를 식별하고, 분류 모듈을 확대하여 암 특이적 유전자조절네트워크 구성에 활용할 계획이다.

개인 맞춤형 의료진단 서비스 제공을 위한 효율적인 데이터마이닝 기법 (Efficient Mining for Personalized Medical treatment Diagnosis Service)

  • 권은희;이승철;이주창;김응모
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2007년도 가을 학술발표논문집 Vol.34 No.2 (C)
    • /
    • pp.200-204
    • /
    • 2007
  • 최근 유비쿼터스 환경의 발달로 인해 사용자 중심의 유비쿼터스 기술이 활발히 연구되고 있다. 이에 따른 각종 응용 분야가 활발히 연구 중이며, 그 중에서 특히 U-Health 기술이 주목받고 있다. U-Health 기술은 질병의 치료라는 전통적인 관점의 의료 서비스에서 벗어나 건강한 상태의 지속적인 관리와 질병의 예방이라는 적극적이고 확장된 개념으로 발전해가고 있다. 건강상태를 관리하고 진단하기 위해서는 기존의 진단데이터를 효율적으로 관리하고, 그것을 토대로 하여 유용한 정보를 얻어 낼 수 있는 방법이 필요하다. 지금까지는 데이터를 처리하기 위하여 통계적인 수치나 전문가에 의한 전문지식을 토대로 하는 방법을 사용하고 있다. 그러나, 건강상태를 관리하고 진단을 목적으로 하는 시스템에서는 높은 정확성이 보장되어야 한다. 또한 유비쿼터스 환경의 특성상 적은 메모리의 사용과 빠른 마이닝 속도가 수반되어야 한다. 본 논문에서는 튜플기반의 진단데이터들을 마이닝하여 진단패턴을 뽑아내는 의료 진단 마이닝 알고리즘을 제안한다. 본 알고리즘은 진단패턴정보의 정확성을 높일 수 있는 장점을 가지며, 튜플기반의 데이터들을 트리 구조로 구성함으로써 마이닝 속도를 향상시킨다. 더 나아가 트리 구조의 컴팩트한 데이터 구조로 메모리 적재가 용이하다. 이는 센서가 부착된 개별 사용자로부터 실시간으로 들어오는 건강상태와 진단패턴과의 비교, 분석을 가능하게 함으로써 보다 정확하고 빠른 진단결과를 내려줄 수 있는 의사결정시스템의 사용에 적합하다.

  • PDF

하이브리드 데이터마이닝 메커니즘에 기반한 전문가 지식 추출 (Extraction of Expert Knowledge Based on Hybrid Data Mining Mechanism)

  • 김진성
    • 한국지능시스템학회논문지
    • /
    • 제14권6호
    • /
    • pp.764-770
    • /
    • 2004
  • This paper presents a hybrid data mining mechanism to extract expert knowledge from historical data and extend expert systems' reasoning capabilities by using fuzzy neural network (FNN)-based learning & rule extraction algorithm. Our hybrid data mining mechanism is based on association rule extraction mechanism, FNN learning and fuzzy rule extraction algorithm. Most of traditional data mining mechanisms are depended ()n association rule extraction algorithm. However, the basic association rule-based data mining systems has not the learning ability. Therefore, there is a problem to extend the knowledge base adaptively. In addition, sequential patterns of association rules can`t represent the complicate fuzzy logic in real-world. To resolve these problems, we suggest the hybrid data mining mechanism based on association rule-based data mining, FNN learning and fuzzy rule extraction algorithm. Our hybrid data mining mechanism is consisted of four phases. First, we use general association rule mining mechanism to develop an initial rule base. Then, in the second phase, we adopt the FNN learning algorithm to extract the hidden relationships or patterns embedded in the historical data. Third, after the learning of FNN, the fuzzy rule extraction algorithm will be used to extract the implicit knowledge from the FNN. Fourth, we will combine the association rules (initial rule base) and fuzzy rules. Implementation results show that the hybrid data mining mechanism can reflect both association rule-based knowledge extraction and FNN-based knowledge extension.

유전자 알고리즘을 이용한 데이터 마이닝의 분류 시스템에 관한 연구 (Using Genetic Rule-Based Classifier System for Data Mining)

  • 한명묵
    • 인터넷정보학회논문지
    • /
    • 제1권1호
    • /
    • pp.63-72
    • /
    • 2000
  • 데이터마이닝은 방대한 데이터 자료로부터 숨어있는 지식이나 유용한 정보를 추출하는 과정이다. 이러한 데이터 마이닝 알고리즘은 통계학, 전자계산학, 그리고 기계학습 분야에서의 오랜 기간동안 이루어진 연구 결과의 산물이다. 어느 특정한 상황에 적용하는 특정한 기술들의 선택은 구현되어야 하는 데이터 마이닝 임무의 성격과 가용한 데이터의 성격에 의존한다. 데이터 마이닝에는 여러 임무가 있으며, 그 중에서 가장 대표적인 임무가 분류라고 (classification) 볼 수 있다. 분류는 인간 사고의 기본적인 요소이기 때문에 여러 응용 분야에서 많은 연구가 진행되어 왔으며, 문제 분석의 첫 단계라고 볼 수 있다. 본 논문에서는 학습문제에서 강건성(robust)을 갖는 유전자 알고리즘 기반의 분류시스템을 제안하고, 데이터 마이닝에서 중요한 분류기능에 관련된 문제인 nDmC에 응용해서 그 유효성을 검증한다.

  • PDF