• 제목/요약/키워드: 연관규칙 마이닝

검색결과 287건 처리시간 0.036초

비트 클러스터링을 이용한 빈발 패턴 탐사의 성능 개선 방안 (Advanced Improvement for Frequent Pattern Mining using Bit-Clustering)

  • 김의찬;김계현;이철용;박은지
    • 한국공간정보시스템학회 논문지
    • /
    • 제9권1호
    • /
    • pp.105-115
    • /
    • 2007
  • 데이터마이닝은 데이터베이스에 저장되어 있는 많은 일반적인 정보들을 가지고 의미있는 정보를 찾아내는 것이다. 많은 데이터 마이닝 기법들 중에 클러스터링과 연관규칙을 다루는 연구가 많이 이뤄지고 있다. 클러스터링 기법에는 공간데이터를 다루거나 속성데이터(비공간 데이터)를 다루는 많은 기법들이 연구되고 있고, 연관규칙 또한 빈발 패턴을 찾아내는 연구가 활발히 진행되고 있다. 기존의 연구 중 apriori 연관규칙 알고리즘을 개선하는 방법으로 비트 클러스터링을 이용하는 방법이 있다. 우리는 apriori 연관규칙 보다 더 나은 성능을 나타내는 FP-Growth에 대해 살펴보고 FP-Growth의 문제점을 찾아 이를 해결하기 위한 방법으로 비트 클러스터링을 이용하여 해결할 수 있는지에 대해 연구하였다. 본 논문에서는 전체 데이터베이스를 비트 클러스터링을 통해 몇 개의 클러스터로 나누어 FP-Growth 방법에 사용할 것을 제안하였다. 이렇게 하면 기존의 FP-Growth 방법보다 더 나은 성능을 가질 수 있으며 이를 증명하기 위한 실험을 수행하였다. 실험은 패턴 마이닝 연구에서 사용하는 chess 데이터를 이용하였으며, 최소지지도를 다르게 적용하면서 FP-Tree를 생성하는 실험을 하였다. 최소지지도가 높은 경우에는 기존의 방법과 비슷한 결과를 얻었지만 그 외 경우에는 기존의 방법보다 본 논문에서 제안하는 방법이 더 우수한 결과를 얻을 수 있었다. 본 논문의 주요 결론으로서 비트 클러스터링을 이용한 방법이 상대적으로 우수한 데이터 마이닝 방법임을 정리하였으며, 아울러 GML 데이터를 위한 비트 클러스터링의 적용방법론에 대하여도 논의하였다.적 성분으로 평가된다. 이러한 잠재적 추적자들에 근거할 때, 한국 서남해에 발달하고 있는 니질 퇴적대의 전퇴적물은 한국과 중국의 혼합 기원으로 해석되나, 실트와 점토 구간의 퇴적물로 나누어 볼 때 그기원이 각각 다르게 나타났다. 즉, 점토 퇴적물은 한국과 중국의 혼합 기원으로, 실트 퇴적물은 한국 기원이 우세한 것으로 해석된다. 과립에 황금입자가 표지되었다. 따라서 1일 동안 배설되는 분비배설항원은 선모충 유충의 표피와 stichocyte의 ${\alpha}_0\;{\alpha}_1$ 과립에서 유도되는 반면에 3일 동안 배설되는 분비배설항원은 표피와 stichocyte의 ${\alpha}_0$ 과립에서 유도되고, 선모충유충 감염후 1주, 4주에 실험쥐에서 형성되는 감염항체는 선모충의 표피와 기저층 그리고 EIM에서 분비되는 항원에 의하여 생성된다. 이상의 결과로 선모충의 분비배설항원과 감염항원은 선모충 유충의 표피와 EIM및 stichocyte의 ${\alpha}_0\;{\alpha}_1$ 과립에서 유도되며 이들은 45 kDa 단백을 포함하고 있는 것으로 생각된다.성하고 있는 세포들에는 세포질이 어두운 세포와 밝은 세포가 있었으며, 세포질내에는 전자밀도가 높은 분비과립이 관찰되었다. 전체적인 특징은 눈물샘분비세포 중 장액세포의 것과 비슷하였으나, 과립의 크기는 작았다. 분비관을 구성하는 세포들 사이에도 연접복합체가 매우 잘 발달되어 있었다. 샘포에서 사이관으로 이행되는 곳에서도 샘포세포와 사이관세포 사이에서도 연접복합체가 관찰되었다. 분비관세포의 분비과립 가운데는 중심부분에 전자밀도가

  • PDF

텍스트 마이닝을 활용한 4차 산업혁명 핵심기술 연관분석 (The Fourth Industrial Revolution Core Technology Association Analysis Using Text Mining)

  • 류재한;유연우
    • 디지털융복합연구
    • /
    • 제16권8호
    • /
    • pp.129-136
    • /
    • 2018
  • 본 연구는 기술을 이전하겠다고 KIAT의 NTB에 등록된 이전기술이 4차 산업혁명 핵심기술의 어느 분야와 관련되어 있으며, 이러한 기술의 기술이전 유형에 관해 분석하였다. 분석에 사용된 기술은 대학과 공공연구소에서 개발한 최근 3년(2015 - 2017)간의 것이다. 연구는 R프로그램을 활용해 빅데이터 텍스트 마이닝의 빈도분석, 시각화, 연관분석 등으로 진행하였다. 연구 결과는 첫째, 4차 산업혁명 핵심기술 응용분야와 관련된 이전기술은 로봇, 3D, 자율주행, 웨어러블 등과 관련한 기술이 많았고 둘째, 연도가 지날수록 사물인터넷, 클라우드, 증강현실 등과 같은 응용분야 기술의 등록이 증가하고 있으며 셋째, 응용분야 기술의 기술이전 유형의 연관규칙을 분석한 결과 사물인터넷(IoT)과 VR 기술은 기술매매 라이센싱, 자율주행 기술은 기술매매, 웨어러블 기술은 라이센싱, 로봇 관련기술은 기술협력 라이센싱 기술매매 등으로 이전하겠다고 나타났다. 이에, 기업은 4차 산업혁명 시대에 필요한 관련 기술을 이전받고자 할 경우 이의 계획적 준비가 필요하다고 하겠다.

데이터 마이닝 기반 침입탐지 패턴 알고리즘의 설계 및 구현 (Design and Implementation of the Intrusion Detection Pattern Algorithm Based on Data Mining)

  • 이상훈;소진
    • 정보처리학회논문지C
    • /
    • 제10C권6호
    • /
    • pp.717-726
    • /
    • 2003
  • 본 논문에서 우리는 방대한 패킷 데이터로부터 침입탐지를 위한 규칙들을 자동으로 생성하는 방법으로 기존 연관규칙을 연역적 알고리즘을 분석하고, 그 결과를 기반으로 침입탐지 시스템에 적용되기 위한 침입 패턴 규칙들을 빠르게 생성할 수 있도록 연연적 알고리즘을 제안하였다. 본 논문에서 제안한고 있는 연역적 알고리즘은 대량의 데이터를 항목별로 분류하고 제거하는 클러스터링 개념에 적합하도록 설계하였다. 이 알고리즘은 적용될 침입탐지 시스템 패턴 생성 및 분석 모듈 방식에 직접적으로 연계되어 있으며, 이것은 침입탐지 시스템에 관한 패턴관리를 위한 규칙 데이터베이스를 구축함으로서 응용범위의 확장은 물론 기존 침입탐지 시스템의 탐지속도를 높일 수 있다. 제안된 연역적 알고리즘의 패텅 생성 기법은 침입탐지 시스템에서 생성되는 데이터의 지원율에 따라 적절히 변경될 수 있는 알고리즘을 사용하였으며, 이 기법에 의한 규칙 생성율의 향상에 따른 규칙생성 속도개선 가능성에 대해 알고리즘 시뮬레이션을 통하여 분석하였다.

단백질 모티프간 연관성 탐사 (Exploring Association Among Protein Motifs)

  • 이현숙;이도헌
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2002년도 춘계학술발표논문집 (상)
    • /
    • pp.47-50
    • /
    • 2002
  • 단백질 모티프(motif)란 유사한 기능을 가진 여러 단백질 서열에서 공통적으로 발견되는 패턴으로서 단백질의 기능을 예측하는 단서로 활용된다. 현재 Prosite, Pfam 등의 데이터베이스에서 정규식(regular expression), 가중치 행렬(weighted matrix). 은닉 마코프 모델(hidden Markov model)의 형태로 4천여종 이상의 모티프가 등록되어 있다. 하지만, 이러한 데이터베이스는 모티프와 단백질간의 일대일 관계만을 저장하고 있기 때문에, 모티프 간의 연관성을 파악하기는 어렵다. 본 논문에서는 모티프 간의 연관 관계를 연관 규칙의 형태로 발견하는 데이터 마이닝 기법을 제시한다. 아울러 HITS 데이터베이스로부터 입수한 단백질-모티프 데이터베이스에 본 기법을 적용함으로써 상당히 높은 연관성을 갖는 모티프 집단이 실제로 존재한다는 것을 밝힌다.

  • PDF

빈발 유전자 발현 패턴과 연쇄 규칙을 이용한 유전자 조절 네트워크 구축 (Constructing Gene Regulatory Networks using Frequent Gene Expression Pattern and Chain Rules)

  • 이헌규;류근호;정두영
    • 정보처리학회논문지D
    • /
    • 제14D권1호
    • /
    • pp.9-20
    • /
    • 2007
  • 유전자들의 그룹은 복잡한 상호작용들을 통해 세포의 기능이 조절되며 이러한 상호작용을 하는 유전자 그룹들을 유전자 조절 네트워크 (GRNs: Gene Regulatory Networks)라고 한다. 이전의 유전자 발현 분석 기법인 군집화와 분류는 단지 상동성에 의한 유전자들 사이의 소속을 결정하는 데에는 유용하나 분자 활동에서의 같은 클래스에서 발견되어지는 유전자들 사이의 조절 관계를 식별할 수 없다. 더욱이 유전자들이 어떻게 연관되는 지와 유전자들이 서로 어떻게 조절하는지에 대한 매커니즘의 이해가 필요하다. 따라서 이 논문에서는 시계열 마이크로어레이 데이터로부터의 유전자들의 조절 관계를 발견하기 위해서 빈발 패턴 마이닝과 연쇄 규칙을 이용한 새로운 접근법을 제안하였다. 이 기법에서는 먼저, 빈발 패턴 마이닝 적용을 위한 적절한 데이터 변환 방법을 제안하였고 FP-growth을 이용하여 유전자 발현 패턴들을 발견한다. 그런 다음, 연쇄 규칙을 이용하여 빈발한 유전자 패턴들로부터 유전자 조절 네트워크를 구축하였다. 마지막으로 제안된 기법의 검증은 공개된 유전자들의 조절 관계와 실험 결과의 일치함을 보임으로써 평가하였다.

자유트리 기반의 그래프마이닝 기법 분석 (Analysis of Graph Mining based on Free-Tree)

  • 노영상;윤은일;류근호;김명준
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2008년도 추계학술발표대회
    • /
    • pp.275-278
    • /
    • 2008
  • 데이터마이닝은 현재 매우 각광 받고 있는 분야다. 연관규칙탐사는 트랜잭션 데이터베이스에서 일정빈도 이상의 패턴을 찾아내는 작업을 말한다. 그중 빈발서브그래프패턴 마이닝은 최근 관심이 늘어나고 있으며, 그 활용도 또한 매우 높다. 그래프마이닝은 아이템셋마이닝보다 훨씬 더 많은 계산을 필요로 한다. 중복을 최소화 하는 방법이 필요하며, 그중 가장 좋은 성능을 보이는 GASTON 알고리즘을 분석한다.

프로모터 염기서열 분석을 위한 데이터 마이닝 기법 (Data Mining Techniques for Analyzing Promoter Sequences)

  • 김정자;이도헌
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2000년도 추계종합학술대회
    • /
    • pp.328-332
    • /
    • 2000
  • 최근 지놈(Genome) 프로젝트를 통해 DNA 염기서열에 대한 정보가 밝혀짐에 따라 분자 수준의 유전자 정보를 다루는 기법이 활발히 연구되고 있다. 그리고 밝혀진 서열정보들의 방대함으로 미루어볼 때 이들 정보를 데이터베이스화하고 효과적인 분석을 행하기 위한 새로운 컴퓨터의 알고리즘의 개발 또한 시급한 일이다. 이러한 측면에서 ,본 논문에서는 분자생물학에서 매우 중요한 연구 대상으로 삼고있는 프로모터 서열과 유전자간의 연관성으로 발현되는 특징을 알아내기 위한 연관 규칙 탐사 알고리즘을 연구한다. 기존의 탐사 알고리즘은 트랜잭션 데이터를 대상으로 하지만 본 논문에서는 생물학적 데이터를 대상으로 하였기 때문에 데이터의 형태와 생물학적인 특성을 수용하는 변형된 연관규칙 알고리즘을 설계한다. 본 연구를 통하여 얻어진 결과는 실제 생물학적 실험'대상의 후보조합을 최소화 하므로써 많은 시간과 노력 비용을 절감할 수 있다.

  • PDF

프로모터 염기서열 분석을 위한 데이터 마이닝 기법 (Data Mining Techniques for Analyzing Promoter Sequences)

  • 김정자;이도헌
    • 한국정보통신학회논문지
    • /
    • 제4권4호
    • /
    • pp.739-744
    • /
    • 2000
  • 최근 지놈(Genome) 프로젝트를 통해 DNA 염기서열에 대한 정보가 밝혀짐에 따라 분자 수준의 유전자 정보를 다루는 기법이 활발히 연구되고 있다. 그리고 밝혀진 서열정보들의 방대함으로 미루어볼 때 이들 정보를 데이터베이스화하고 효과적인 분석을 행하기 위한 새로운 컴퓨터의 알고리즘의 개발 또한 시급한 일이다. 이러한 측면에서 본 논문에서는 분자생물학에서 매우 중요한 연구 대상으로 삼고있는 프로모터 서열과 유전자간의 연관성으로 발현되는 특징을 알아내기 위한 연관 규칙 탐사 알고리즘을 연구한다. 기존의 탐사 알고리즘은 트랜잭션 데이터를 대상으로 하지만 본 논문에서는 생물학적 데이터를 대상으로 하였기때문에 데이터의형태와 생물학적인 특성을 수용하는 변형된 연관규칙 알고리즘을 설계한다. 본 연구를 통하여 얻어진 결과는 실제 생물학적 실험대상의 후보조합을 최소화 하므로써 많은 시간과 노력 비용을 절감할 수 있다.

  • PDF

데이터 베이스 특성에 따른 효율적인 데이터 마이닝 알고리즘 (An Efficient Data Mining Algorithm based on the Database Characteristics)

  • 박지현;고찬
    • Journal of the Korean Society for Industrial and Applied Mathematics
    • /
    • 제10권1호
    • /
    • pp.107-119
    • /
    • 2006
  • 인터넷과 웹 기술 발전에 따라 데이터베이스에 축적되는 자료의 양이 급속히 늘어나고 있다. 데이터베이스의 응용 범위가 확대되고 대용량 데이터베이스로부터 유용한 지식을 발견하고자 하는 데이터 마이닝(Data Mining) 기술에 대한 연구가 활발하게 진행되고 있다. 기존의 알고리즘들은 대부분 후보 항목 집합들을 줄임과 동시에 데이터베이스의 크기를 줄이는 방법으로 발전해 오고 있다. 그러나 후보 항목집합들을 줄이는 노력이나 데이터베이스의 크기를 줄이는 방법들이 빈발 항목집합들을 생성하는 전 과정에서 필요로 하지는 않는다. 그러한 방법들이 어느 과정에서는 시간을 줄이는데 효과가 있지만 다른 과정에서는 오히려 그러한 방법들을 적용하는데 더 많은 시간이 소요되기 때문이다. 본 논문에서는 트랜잭션들의 길이가 짧거나 데이터베이스를 이루는 항목들의 수가 비교적 적은 트랜잭션 데이터베이스에서 해슁 기법을 사용하여 데이터베이스를 한 번 스캔하고 동시에 각 트랜잭션에서 발생 가능한 모든 부분집합들을 해쉬 테이블에 저장함으로써 최소 지지도에 영향을 받지 않고 기존의 알고리즘보다 더 짧은 시간에 빈발항목집합을 발견할 수 있는 효과적인 연관 규칙 탐사 알고리즘을 제안하고 실험하였다.

  • PDF

지능형 침입 탐지 시스템에 관한 연구 (On Design of the intelligent Intrusion Detection System)

  • 이민규;한명묵
    • 한국지능시스템학회:학술대회논문집
    • /
    • 한국퍼지및지능시스템학회 2002년도 춘계학술대회 및 임시총회
    • /
    • pp.23-27
    • /
    • 2002
  • 본 논문에서는 정보보호에서 지능형 침입탐지시스템(Intrusion Detection System :IDS) 의한 모델을 제안한다. 이 모델은 데이터 마이닝 분야와 정보보호 분야의 결합된 방법을 이용한다. 즉, 계산환경을 격상하거나 새로운 공격 방법들 때문에 내장된 IDS를 보완 할 필요가 종종 있다. 현재 사용하고 있는 많은 IDS들은 전문적인 지식을 손으로 작성했기 때문에 IDS들의 변환은 가격이 매우 비싸며, 속도가 느리다는 단점이 있다. 이에 본 모델은 침입탐지 모델을 적응 적으로 구축하는데 데이터 마이닝 구조를 활용한다. 데이터 마이닝(Data Mining : DM)의 기술인 연관 규칙, 순차 패턴, 분류, 군집화, 유전자 알고리즘 기법(GA)인 Selection, Crossover, Mutation, Evaluation, Fitness Function의 기능을 접목하여 단점을 보안하고 처리 성능을 최대로 하는 즉, 보다 안전한 지능형 침입 탐지 시스템(IDS) 모델을 제안한다.

  • PDF