• 제목/요약/키워드: Sequence Mining

검색결과 163건 처리시간 0.026초

제조업분야의 고객 성향 및 추이 분석 (Analysis of Customer Behavior and Trend of Manufacture)

  • 이병엽;임승빈;박용훈;유재수
    • 한국콘텐츠학회논문지
    • /
    • 제9권6호
    • /
    • pp.336-343
    • /
    • 2009
  • 최근 기업은 업무의 효율적 수행을 위해 데이터베이스를 사용하고, 저장된 데이터베이스의 데이터로부터 분석을 통해 행동 패턴을 추출해내어 그 결과를 마케팅과 생산의 효율성 증대를 위해 데이터마이닝을 많이 사용한다. 데이터마이닝을 통해 얻어진 지식의 활용은 기업 활동을 정비하고 활동방향을 제시하며 의사결정의 순간에 기반 자료로 활용될 수 있는 부가적 경쟁력이라 할 수 있다. 본 논문에서는 제조업체의 실제 데이터를 가지고 데이터마이닝 방법론을 이용하여 기존고객의 등급 및 소비행위 파악을 위한 예측모델을 설계한다. 이를 통해 고객의 등급 및 소비행위를 파악하여 이를 마케팅까지 연결, 수익을 창출하고, 기업의 브랜드 가치를 향상시키는데 목적이 있다.

범주형 시퀀스 데이터의 K-Nearest Neighbor알고리즘 (A K-Nearest Neighbor Algorithm for Categorical Sequence Data)

  • 오승준
    • 한국컴퓨터정보학회논문지
    • /
    • 제10권2호
    • /
    • pp.215-221
    • /
    • 2005
  • 최근에는 단백질 시퀀스, 소매점 거래 데이터, 웹 로그 등과 같은 상업적이거나 과학적인 데이터의 폭발적인 증가를 볼 수 있다. 이런 데이터들은 순서적인 면을 가지고 있는 시퀀스 데이터들이다. 본 논문에서는 이런 시퀀스 데이터들을 분류하는 문제를 다룬다. 분류 기법 으로는 의사결정 나무나 베이지안 분류기, K-NN방법 등 석러 종류가 있는데, 본 연구에서는 또-U방법을 이용하여 시퀀스들을 분류한다. 또한, 시퀀스들간의 유사도를 구하기 위한 새로운 계산 방법과 효율적인 계산 방법도 제안한다.

  • PDF

Bridging a Gap between DNA sequences and expression patterns of genes

  • Morishita, Shinichi
    • 한국생물정보학회:학술대회논문집
    • /
    • 한국생물정보시스템생물학회 2000년도 International Symposium on Bioinformatics
    • /
    • pp.69-70
    • /
    • 2000
  • The completion of sequencing human genome would motivate us to map millions of human cDNAs onto the unique ruler "genome sequence", in order to identify the exact address of each cDNA together with its exons, its promoter region, and its alternative splicing patterns. The expression patterns of some cDNAs could therefore be associated with these precise gene addresses, which further accelerate studies on mining correlations between motifs of promoters and expressions of genes in tissues. Towards the realization of this goal, we have developed a time-and-space efficient software named SQUALL that is able to map one cDNA sequence of length a few thousand onto a long genome sequence of length thirty million in a couple of minutes on average. Using SQUALL, we have mapped twenty thousand of our Bodymap (http://bodymap.ims.u-tokyo.ac.jp) cDNAs onto the genome sequences of Chr.21st and 22nd. In this talk, I will report the status of this ongoing project.

  • PDF

근사 알고리즘을 이용한 순차패턴 탐색 (Searching Sequential Patterns by Approximation Algorithm)

  • 산사볼트가람라흐차;황영섭
    • 한국컴퓨터정보학회논문지
    • /
    • 제14권5호
    • /
    • pp.29-36
    • /
    • 2009
  • 서열데이터베이스에 있는 자주 발현하는 부분 서열을 패턴으로 찾아내는 순차패턴 탐색은 넓은 응용 분야를 가지는 중요한 데이터 마이닝 문제이다. DNA 서열에서 순차패턴이 모티프가 될 수 있으므로 DNA 서열에서 순차패턴을 찾는 것을 연구하였다. 대부분의 기존 마이닝 방법은 순차패턴의 정의에 따라 정확한 정합에 주력하여 노이즈가 있는 환경이나 실제 문제에서 발생하는 부정확한 데이터에 대하여 제대로 작동하지 않을 수 있다. 이러한 문제가 생물 데이터인 DNA 서열에서 자주 나타난다. 이러한 문제를 다루기 위한 근사 정합 방법을 연구하였다. 본 연구의 아이디어는 자주 발생하는 패턴을 근사 패턴이라 부르는 그룹으로 분류할 수 있다는 관찰에서 기반을 둔다. 기존의 Prefixspan 알고리즘은 주어진 긴 서열에서 순차패턴을 잘 찾을 수 있다. 본 연구는 Prefixspan 알고리즘을 개선하여 유사한 순차패턴을 찾을 수 있게 하였다. 실험 결과는 PreFixSpan보다 제안한 방법이 패턴 길이가 4일 때, 근사 순차패턴의 빈도가 5배 높아짐을 보였다.

Copper Tolerance of Novel Rhodotorula sp. Yeast Isolated from Gold Mining Ore in Gia Lai, Vietnam

  • Kim Cuc Thi Nguyen;Phuc Hung Truong;Cuong Tu Ho;Cong Tuan Le;Khoa Dang Tran;Tien Long Nguyen;Manh Tuan Nguyen;Phu Van Nguyen
    • Mycobiology
    • /
    • 제51권6호
    • /
    • pp.379-387
    • /
    • 2023
  • In this study, twenty-five yeast strains were isolated from soil samples collected in the gold mining ore in Gia Lai, Vietnam. Among them, one isolate named GL1T could highly tolerate Cu2+ up to 10 mM, and the isolates could also grow in a wide range of pH (3-7), and temperature (10-40 ℃). Dried biomass of GL1 was able to remove Cu2+ effectively up to 90.49% with a maximal biosorption capacity of 18.1 mg/g at pH 6, temperature 30 ℃, and incubation time 60 min. Sequence analysis of rDNA indicated this strain was closely related to Rhodotorula mucilaginosa but with 1.53 and 3.46% nucleotide differences in the D1/D2 domain of the 28S rRNA gene and the ITS1-5.8S rRNA gene-ITS2 region sequence, respectively. Based on phylogenetic tree analysis and the biochemical characteristics, the strain appears to be a novel Rhodotorula species, and the name Rhodotorula aurum sp. nov. is proposed. This study provides us with more information about heavy metal-tolerant yeasts and it may produce a new tool for environmental control and metal recovery operations.

Collapse failure mechanism of subway station under mainshock-aftershocks in the soft area

  • Zhen-Dong Cui;Wen-Xiang Yan;Su-Yang Wang
    • Geomechanics and Engineering
    • /
    • 제36권3호
    • /
    • pp.303-316
    • /
    • 2024
  • Seismic records are composed of mainshock and a series of aftershocks which often result in the incremental damage to underground structures and bring great challenges to the rescue of post-disaster and the repair of post-earthquake. In this paper, the repetition method was used to construct the mainshock-aftershocks sequence which was used as the input ground motion for the analysis of dynamic time history. Based on the Daikai station, the two-dimensional finite element model of soil-station was established to explore the failure process of station under different seismic precautionary intensities, and the concept of incremental damage of station was introduced to quantitatively analyze the damage condition of structure under the action of mainshock and two aftershocks. An arc rubber bearing was proposed for the shock absorption. With the arc rubber bearing, the mode of the traditional column end connection was changed from "fixed connection" to "hinged joint", and the ductility of the structure was significantly improved. The results show that the damage condition of the subway station is closely related to the magnitude of the mainshock. When the magnitude of the mainshock is low, the incremental damage to the structure caused by the subsequent aftershocks is little. When the magnitude of the mainshock is high, the subsequent aftershocks will cause serious incremental damage to the structure, and may even lead to the collapse of the station. The arc rubber bearing can reduce the damage to the station. The results can offer a reference for the seismic design of subway stations under the action of mainshock-aftershocks.

개방 데이터 마이닝에 효율적인 이동 윈도우 기법 (A Sliding Window Technique for Open Data Mining over Data Streams)

  • 장중혁;이원석
    • 정보처리학회논문지D
    • /
    • 제12D권3호
    • /
    • pp.335-344
    • /
    • 2005
  • 근래들어 구성 요소가 빠른 속도로 지속적으로 발생되는 무한 집합으로 정의되는 데이터 스트림에 대한 개방 데이터 마이닝 방법들이 활발히 제안되고 있다. 데이터 스트림에 내재된 정보들은 시간 흐름에 따른 변화의 가능성이 매우 높다. 따라서, 이러한 변화를 빠른 시간에 분석할 수 있다면 해당 데이터 스트림에 대한 분석에서 보다 유용한 정보를 제공할 수 있다. 본 논문에서는 개방 데이터 마이닝 환경에서 효율적인 최근 빈발 항목 탐색을 위한 이동 윈도우 기법을 제시한다. 해당 기법에서는 데이터 스트림이 지속적으로 확장되더라도 지연 추가 및 전지 작업을 적용하여 마이닝 수행과정에서의 메모리 사용량이 매우 작게 유지되며, 분석 대상 범위의 데이터 객체들을 반복적으로 탐색하지 않기 때문에 각 시점에서 마이닝 결과를 짧은 시간에 구할 수 있다. 더불어, 해당 방법은 데이터 스트림의 최근 정보에 집중한 분석을 통해 해당 데이터 집합의 변화를 효율적으로 감지할 수 있다.

웹 사용 데이타와 하이퍼링크 구조를 통합한 웹 네비게이션 마이닝 (Web Navigation Mining by Integrating Web Usage Data and Hyperlink Structures)

  • 구흠모;최중민
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제32권5호
    • /
    • pp.416-427
    • /
    • 2005
  • 웹 네비게이션 마이닝은 웹 접근 로그 데이타를 분석하여 웹을 항해하는 패턴을 발견하는 기법이다. 하지만 사용자들은 웹을 항해할 때 정상적인 계층적 경로를 따르지 않는 경우가 많기 때문에 웹 접근 로그 데이타에는 웹 항해 패턴 발견에 장애가 되는 잡음 정보가 많이 포함된다. 결과적으로 웹 접근 로그 데이타만을 이용한 기존의 웹 네비게이션 마이닝은 이런 잡음을 해결하기 위한 전처리 과정의 복잡성 등으로 인하여 웹 항해 패턴을 효율적으로 발견하는 데 좋은 성능을 보여주지 못했다. 이런 문제를 해결하기 위해 본 논문에서는 웹 접근 로그 데이타 외에 웹의 하이퍼링크 구조 정보를 함께 이용하여 웹 네비게이션 패턴을 효율적으로 발견하는 기법을 제시하였다. 웹 사이트의 계층적인 하이퍼링크 구조로부터 생성된 WebTree라 불리는 구조를 이용하여 웹 접근 로그 데이타에 포함된 비정상적인 경로에 대한 잡음을 효율적으로 제거하였다. 이 기법을 이용해 구현된 SPMiner(Sequence Pattern Miner) 시스템은 로그 데이타와 하이퍼링크 계층구조를 함께 이용함으로써 전처리의 오버헤드를 현저히 감소시켰고 결과적으로 효율적으로 네비게이션 패턴을 찾아주고 이를 추천에 이용할 수 있는 기반을 제시하였다.

시간간격을 고려한 시간관계 규칙 탐사 기법 (Discovering Temporal Relation Rules from Temporal Interval Data)

  • 이용준;서성보;류근호;김혜규
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제28권3호
    • /
    • pp.301-314
    • /
    • 2001
  • 데이터마이닝은 대용량 데이터베이스에 내재된 유용한 지식을 탐사하는 기술로 정의된다. 데이터마이닝에 대한 연구가 진행되면서 순차 패턴, 유사 시계열 탐사, 시간 연관규칙 탐사 등과 같이 시간 값을 가진 데이터로부터 지식을 탐사하고자 하는 시간 데이터마이닝에 대한 연구가 수행되었다. 그러나 기존 연구는 트랜잭션의 발생 시점만을 가진 데이터를 다루고 있으며 시간 간격을 가진 데이터는 거의 고려하고 있지 않다. 실세계에서는 환자의 병력, 상품 구매 이력, 웹 로그 등과 같은 시간간격을 가진 다양한 데이터가 존재하며 이로부터 여러 유용한 지식을 찾아낼 수 있다. Allen은 시간간격 데이터 사이에 발생할 수 있는 시간 관계와 시간 관계를 구할 수 있는 시간간격 연산자를 정의하였다. 본 논문에서는 Allen의 정의를 기반으로 시간간격 데이터로부터 시간관계 규칙을 효율적으로 탐사하기 위한 새로운 데이터마이닝 기법을 제안하였다. 이 기법은 발생 시점을 가진 시간 데이터를 시간간격 데이터로 요약하여 일반화하는 전처리 알고리즘과 시간간격 데이터로부터 시간관계 규칙을 생성하는 규clr 탐사 알고리즘으로 구성된다. 이 기법은 기존 데이터마이닝 기법에서 찾지 못하는 유용한 시간 규칙을 탐사할 수 있다.

  • PDF

위치 기반 서비스를 위한 이동 객체의 시간 패턴 탐사 기법 (Temporal Pattern Mining of Moving Objects for Location based Services)

  • 이준욱;백옥현;류근호
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제29권5호
    • /
    • pp.335-346
    • /
    • 2002
  • 위치 기반 서비스는 이동중인 사용자에게 위치와 관련된 정보를 제공한다. 최소한의 자원으로 사용자에게 유용한 정보를 개인화하여 제공하는 것은 위치 기반 서비스가 가져야 할 필수적인 기능이다. 이 기능은 데이타 마이닝을 통해 실현될 수 있다. 하지만 기존의 데이터 마이닝 연구는 시간 및 공간 속성을 동시에 고려하고 있지 않다. 따라서 시간에 따라 공간 위치 속성이 변경되는 특성을 갖는 위치 기반 서비스의 대상에는 적절하지 않다. 이 논문에서는 시간 및 공간 속성을 가지는 이동 객체의 위치 데이타로부터 유용한 시간 패턴을 탐사하기 위한 새로운 데이타 마이닝 기법을 제안하였다. 평면 상에서 좌표로 표현되는 이동 객체의 위치 정보를 일반화하기 위하여 contains와 같은 공간 연산을 사용하였다. 또한 이동 패턴 탐사 시 실제 유효한 시퀀스를 만들기 위해 객체의 위치 사이에 시간 제약조건을 적용하였다. 이렇게 생성된 이동 객체 위치의 시퀀스로부터 빈발 이동 시퀀스를 구하여 시간 패턴을 생성하였다. 제안한 기법은 기존과는 다른 시, 공간적 접근을 취함으로써 시간과 공간 의미가 중요시되는 위치 기반 서비스에 적합한 새로운 유형의 지식을 제공할 수 있다.