• 제목/요약/키워드: 데이타 마이닝

검색결과 106건 처리시간 0.026초

데이타마이닝 기법을 이용한 경보데이타 분석기 구현 (Implementation of Analyzer of the Alert Data using Data Mining)

  • 신문선;김은희;문호성;류근호;김기영
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제31권1호
    • /
    • pp.1-12
    • /
    • 2004
  • 최근 네트워크 구성이 복잡해짐에 따라 정책기반의 네트워크 관리기술에 대한 필요성이 증가하고 있으며, 특히 네트워크 보안관리를 위한 새로운 패러다임으로 정책기반의 네트워크 관리 기술이 도입되고 있다. 보안정책 서버는 새로운 정책을 입력하거나 기존의 정책을 수정, 삭제하는 기능과 보안정책 결정 요구 발생시 정책결정을 수행하여야 하는데 이를 위해서는 보안정책 실행시스템에서 보내온 경보 메시지에 대한 분석 및 관리가 필요하다. 따라서 이 논문에서는 정책기반 네트워크 보안관리 프레임워크의 구조 중에서 보안정책 서버의 효율적인 보안정책 수립 및 수행을 지원하기 위한 경보데이타 분석기를 설계하고 구현한다. 경보 데이타 저장과 분석을 위해서 데이타베이스 스키마를 설계하고 저장된 경보데이타를 분석하는 모듈을 구현하며 경보데이타 마이닝 엔진을 구현하여 경보데이타를 효율적으로 분석하고 이를 통해 경보들의 새로운 유사패턴그룹이나 공격시퀀스를 유추하여 능동적인 보안정책관리를 지원할 수 있도록 한다.

데이타마이닝 기법을 이용한 효율적인 전문 용어 클러스터링 (An Efficient Terminology Clustering Method Using Datamining Technique)

  • 이정화;남상엽;문현정;우용태
    • 한국데이타베이스학회:학술대회논문집
    • /
    • 한국데이타베이스학회 2000년도 추계학술대회 E-Business와 정보보안
    • /
    • pp.210-215
    • /
    • 2000
  • 최근 대량의 텍스트 문서로부터 의미 있는 패턴이나 연관 규칙을 발견하기 위한 텍스트마이닝 기법에 대한 연구가 활발히 전개되고 있다. 하지만 비정형 텍스트 문서로부터 추출된 용어의 수는 불규칙적이고 일반적인 용어가 많이 추출되는 관계로 일반적인 연관 규칙 탐사 방법을 사용하게 되면 무의미한 연관 규칙이 대량으로 생성되어 지식 정보를 효과적으로 검색하기 어렵다. 본 논문에서는 연관 규칙 탐사 기법을 이용하여 대량의 문서로부터 유용한 지식 정보를 찾기 위하여 의미적으로 연관된 전문 용어들끼리 클러스터링 하기 위한 방법을 제안하였다. 학술 논문을 대상으로 전문 용어를 추출하여 관련된 용어들끼리 클러스터를 구성하는 실험을 통하여 제안된 방법의 효율성을 보였다.

  • PDF

균등 격자를 이용한 공간 클러스터링 기법의 설계 및 구현 (Design and Implementation of Spatial Clustering Method using Regular Grid)

  • 문상호
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2003년도 춘계종합학술대회
    • /
    • pp.485-489
    • /
    • 2003
  • 기존 연구에서 공간데이타 마이닝을 지원하기 위하여 여러 가지 공간 클러스터링 기법들이 제시되었다. 그러나 대부분의 기법들이 객체들 간의 거리를 기반으로 수행하므로, 공간데이타의 양이 많아질수록 계산 비용이 증가하는 문제점이 발생한다. 본 논문에서는 이러한 문제점을 해결하기 위하여, 균등 격자를 기반으로 하는 공간 클러스터링 기법을 제시한다. 그리고 이 기법을 실현화시키기 위하여 파일구조, 자료구조, 알고리즘을 설계 및 구현하고, 실제 실험데이타를 대상으로 적용하여 클러스터 생성 결과를 보인다.

  • PDF

데이타마이닝 기법을 이용한 문서 자동 분류 모델 (An Automatic Text Classification Model using Association Rules)

  • 김영인;이진용;문현정;우용태
    • 한국데이타베이스학회:학술대회논문집
    • /
    • 한국데이타베이스학회 2000년도 추계학술대회 E-Business와 정보보안
    • /
    • pp.101-108
    • /
    • 2000
  • 기업에서 보유한 전문 지식 정보가 급속도로 증가함에 따라 대량의 문서에 저장된 지식 정보를 효과적으로 탐색하여 기업 경영에 활용하기 위한 지식경영시스템 도입이 확산되고 있다. 이러한 지식경영시스템에서 핵심적인 구성 요소는 전문 분야의 지식 정보를 체계적으로 분류하고 효율적으로 검색하기 위한 지식 탐사 기법이다. 본 논문에서는 데이타마이닝 기법을 이용하여 문서를 자동적으로 분류하기 위한 새로운 모델을 제안하였다. 연관 규칙 탐사 알고리즘을 이용하여 학습용 문서 집합으로부터 세부 분야를 대표하는 색인어 집합을 구성하였다. 세부 분야별 색인어 집합에 대하여 전체 문서에 대한 비중에 따라 가중치 배열을 구성하여 문서를 자동으로 분류하기 위한 기준으로 삼았다. 임의의 문서를 자동적으로 분류하는 실험을 통하여 제안된 방법의 효율성을 검정하였다.

  • PDF

데이타 마이닝을 사용한 방학 중 학습방법과 학업성취도의 관계 분석 (Effective Studying Methods during a School Vacation: A Data Mining Approach)

  • 김혜숙;문양세;김진호;노웅기
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제34권1호
    • /
    • pp.40-51
    • /
    • 2007
  • 학업성취도 향상을 위해 정규 수업 이외에도 과외, 학원수강, 교육방송 시청 등 다양한 교육이 이루어지고 있다. 본 논문에서는 방학 중 학습방법과 생활습관이 학업성취도 변화에 미치는 영향을 분석하기 위한 데이타 마이닝 접근법을 제안한다. 우선, 학업성취도에 영향을 미치는 방학중의 학습방법과 생활습관에 대한 다양한 요소를 도출한다. 다음으로, 마이닝 기법 중 의사결정트리와 연관 규칙을 사용하기 위한 데이타 변환 및 분석 방법을 제안한다. 마지막으로, 설문조사를 통해 수집한 현실의 구체적 데이터에서 의사결정트리를 생성하고 연관 규칙을 추출하는 방법을 제안한다. 중학생들에 대한 설문조사를 분석한 결과, 의사결정트리의 경우 네 가지 의미있는 결과를 도출하였다. 첫째, 상위권 학생들의 경우 학원수강이 성적을 향상시키는 것으로 나타났다. 둘째, 대부분 학생들의 경우 인터넷 학습사이트 이용은 성적을 하락시키는 것으로 나타났다. 셋째, 성적 변화에 큰 영향을 미칠 것으로 예상했던 과외는 실제로 큰 영향을 미치지 못하는 것으로 나타났다. 넷째, 다양한 학습방법의 병행은 오히려 성적 하락의 요인이 되는 것으로 파악되었다. 다음으로, 연관 규칙 추출 결과, 방학 중 활동 사이에는 특이한 규칙이 없는 것으로 나타났다. 본 논문에서 제시한 데이타 마이닝 접근법 및 결과는 학생들의 방학 중 생활 지도나 학습 계획 수립에 많은 도움이 될 수 있다고 사료된다.

퍼지 결정트리를 이용한 패턴분류를 위한 데이터 마이닝 알고리즘 (Data Mining Algorithm Based on Fuzzy Decision Tree for Pattern Classification)

  • 이중근;김명원
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제26권11호
    • /
    • pp.1314-1323
    • /
    • 1999
  • 컴퓨터의 사용이 일반화됨에 따라 데이타를 생성하고 수집하는 것이 용이해졌다. 이에 따라 데이타로부터 자동적으로 유용한 지식을 얻는 기술이 필요하게 되었다. 데이타 마이닝에서 얻어진 지식은 정확성과 이해성을 충족해야 한다. 본 논문에서는 데이타 마이닝을 위하여 퍼지 결정트리에 기반한 효율적인 퍼지 규칙을 생성하는 알고리즘을 제안한다. 퍼지 결정트리는 ID3와 C4.5의 이해성과 퍼지이론의 추론과 표현력을 결합한 방법이다. 특히, 퍼지 규칙은 속성 축에 평행하게 판단 경계선을 결정하는 방법으로는 어려운 속성 축에 평행하지 않는 경계선을 갖는 패턴을 효율적으로 분류한다. 제안된 알고리즘은 첫째, 각 속성 데이타의 히스토그램 분석을 통해 적절한 소속함수를 생성한다. 둘째, 주어진 소속함수를 바탕으로 ID3와 C4.5와 유사한 방법으로 퍼지 결정트리를 생성한다. 또한, 유전자 알고리즘을 이용하여 소속함수를 조율한다. IRIS 데이타, Wisconsin breast cancer 데이타, credit screening 데이타 등 벤치마크 데이타들에 대한 실험 결과 제안된 방법이 C4.5 방법을 포함한 다른 방법보다 성능과 규칙의 이해성에서 보다 효율적임을 보인다.Abstract With an extended use of computers, we can easily generate and collect data. There is a need to acquire useful knowledge from data automatically. In data mining the acquired knowledge needs to be both accurate and comprehensible. In this paper, we propose an efficient fuzzy rule generation algorithm based on fuzzy decision tree for data mining. We combine the comprehensibility of rules generated based on decision tree such as ID3 and C4.5 and the expressive power of fuzzy sets. Particularly, fuzzy rules allow us to effectively classify patterns of non-axis-parallel decision boundaries, which are difficult to do using attribute-based classification methods.In our algorithm we first determine an appropriate set of membership functions for each attribute of data using histogram analysis. Given a set of membership functions then we construct a fuzzy decision tree in a similar way to that of ID3 and C4.5. We also apply genetic algorithm to tune the initial set of membership functions. We have experimented our algorithm with several benchmark data sets including the IRIS data, the Wisconsin breast cancer data, and the credit screening data. The experiment results show that our method is more efficient in performance and comprehensibility of rules compared with other methods including C4.5.

정량 정보를 포함한 순차 패턴 마이닝 알고리즘 (Sequential Pattern Mining Algorithms with Quantities)

  • 김철연;임종화;;심규석
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제33권5호
    • /
    • pp.453-462
    • /
    • 2006
  • 순차 패턴을 찾는 것은 데이타마이닝 응용분야에서 중요한 문제이다. 기존의 순차 패턴 마이닝 알고리즘들은 아이템으로만 이루어진 순차 패턴만을 취급하였으나 경제나 과학분야와 같은 많은 분야에서는 정량 정보가 아이템과 같이 기록되어 있으며, 기존의 알고리즘이 처리하지 못하는 이러한 정량 정보는 사용자에게 보다 유용한 정보를 전달하여 줄 수 있다. 본 논문에서는 정량 정보를 포함한 순차패턴 마이닝 문제를 제안하였다. 기존의 순차패턴 알고리즘에 대한 단순한 확장으로는 모든 정량에 대한 후보 패턴들을 모두 생성하기 때문에 확대된 탐색 공간을 효율적으로 탐색할 수 없음을 보이고, 이러한 단순한 확장 알고리즘의 성능을 대폭 향상시키기 위하여 정량 정보에 대해 해쉬 필터링과 정량 샘플링 기법을 제안하였다. 다양한 실험 결과들은 제안된 기법들이 단순히 확장된 알고리즘과 비교하여 수행시간을 매우 단축시켜 줄 뿐만 아니라, 데이타베이스 크기에 대한 확장성 또한 향상시켜줌을 보여 준다.

위치 기반 서비스를 위한 이동 객체의 시간 패턴 탐사 기법 (Temporal Pattern Mining of Moving Objects for Location based Services)

  • 이준욱;백옥현;류근호
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제29권5호
    • /
    • pp.335-346
    • /
    • 2002
  • 위치 기반 서비스는 이동중인 사용자에게 위치와 관련된 정보를 제공한다. 최소한의 자원으로 사용자에게 유용한 정보를 개인화하여 제공하는 것은 위치 기반 서비스가 가져야 할 필수적인 기능이다. 이 기능은 데이타 마이닝을 통해 실현될 수 있다. 하지만 기존의 데이터 마이닝 연구는 시간 및 공간 속성을 동시에 고려하고 있지 않다. 따라서 시간에 따라 공간 위치 속성이 변경되는 특성을 갖는 위치 기반 서비스의 대상에는 적절하지 않다. 이 논문에서는 시간 및 공간 속성을 가지는 이동 객체의 위치 데이타로부터 유용한 시간 패턴을 탐사하기 위한 새로운 데이타 마이닝 기법을 제안하였다. 평면 상에서 좌표로 표현되는 이동 객체의 위치 정보를 일반화하기 위하여 contains와 같은 공간 연산을 사용하였다. 또한 이동 패턴 탐사 시 실제 유효한 시퀀스를 만들기 위해 객체의 위치 사이에 시간 제약조건을 적용하였다. 이렇게 생성된 이동 객체 위치의 시퀀스로부터 빈발 이동 시퀀스를 구하여 시간 패턴을 생성하였다. 제안한 기법은 기존과는 다른 시, 공간적 접근을 취함으로써 시간과 공간 의미가 중요시되는 위치 기반 서비스에 적합한 새로운 유형의 지식을 제공할 수 있다.

물 공급량 예측을 위한 데이터 마이닝 기법 (Data Mining for Water Supply Forecasting)

  • 신강욱;김연권
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2021년도 추계학술대회
    • /
    • pp.233-235
    • /
    • 2021
  • 본 논문에서는 물 공급량 예측을 위한 다양한 알고리즘 적용에 있어서 데이터 마이닝의 효용성을 검토하고자 하였다. 물 공급분야에 있어서, 물 이용 지역의 특성에 따라 공급량과 이용 시간이 매우 상이한 특성을 나타낸다. 물 이용 지역은 주택지역, 상업지역, 산업단지지역 등 다양한 형태로 분류할 수 있고, 이에 따라 물 이용 시간의 상이함에 따른 물 공급패턴이 일정하지 않게 된다. 특히, 주택지역과 상업지역이 복합적으로 이루어진 경우, 물 이용 단위인 블록 단위에서의 물 특성이 불규칙적인 패턴을 나타낸다. 따라서, 각 블록 단위 특성에 적합한 물 이용량을 예측하여 효율적 물 공급 방안을 마련할 필요가 있다. 또한, 물 이용량 데이터 중 이상 데이타 감지와 이상 데이터 보정을 통하여 물 이용량 예측의 정확도가 향상된다. 따라서, 블록 단위의 물 이용량에 대한 원시데이타의 효율적인 데이터 마이닝 방안이 요구된다. 본 연구에서는 물 공급지역의 특성에 따른 물 공급 패턴을 분석하고, 이에 적합한 데이터 마이닝 기법을 제시하고 비교 분석하였다. 제안된 데이터 마이닝 기법은 딥러닝 예측모델을 적용하여 적합성을 검증하고, 이를 물 공급량 예측알고리즘에 폭넓게 활용될 수 있음을 확인하였다.

  • PDF

통신이력 데이타에 기반한 교우관계 분석 (Peer Relationship Analysis Based on Communication History Records)

  • 문양세;최훈영;김진호
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제33권8호
    • /
    • pp.730-740
    • /
    • 2006
  • 최근 청소년의 교우관계에 있어서 집단 따돌림과 불량 그룹이 사회적으로 큰 문제가 되고 있다. 본 논문에서는 학생들의 교우관계를 보다 객관적으로 분석하는 방법을 제안한다. 분석을 위한 객관적인 데이타로는 교우관계 정보를 묵시적으로 내포하고 있는 통신이력 데이타를 사용하며, 체계적 분석을 위하여 데이타 마이닝 기법을 활용한다. 제안하는 분석 방법은 다음과 같다. 첫째, 교우간 친밀도 (degree of familiarity) 개념을 정형적으로 정의하고, 여러 통신도구에서 발생한 통신이력 데이타를 기반으로 교우 간 친밀도를 수학적으로 계산하는 방법을 제안한다. 제안하는 방법은 학생 x가 y로 통신을 많이 시도할수록, 학생 x 의 y 에 대한 교우간 친밀도가 높다는 직관을 사용한다. 둘째, 계산한 교우간 친밀도를 사용하여 집단 따돌림의 가능성이 높은 학생을 파악한다. 이는 집단 따돌림 가능성이 높은 학생은 다른 학생으로부터의 통신 시도가 적을 것이라는 직관에 기반한다. 셋째, 교우간 친밀도를 데이타 마이닝 기법 중 하나인 클러스터링으로 분석하여 의미 있는 교우집단을 파악한다. 클러스터링 기법을 사용하기 위하여, 본 논문에서는 교우간 친밀도를 기반으로 교우간 유사도 (similarity) 개념을 정형적으로 정의하고, 이를 사용하여 클러스터링을 수행한다. 마지막으로, 제안한 방법의 실용성을 입증하기 위하여, 실제 구현 및 분석 실험을 수행하고, 그 의미를 해석한다. 이 같은 결과를 볼 때, 본 연구는 학생들의 교우관계를 보다 객관적으로 파악할 수 있는 효과적인 방법론이라 사료된다.