• 제목/요약/키워드: trie

검색결과 87건 처리시간 0.022초

DNA 시퀀스 데이타베이스를 위한 실용적인 유사 서브 시퀀스 검색 기법 (A Practical Approximate Sub-Sequence Search Method for DNA Sequence Databases)

  • 원정임;홍상균;윤지희;박상현;김상욱
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제34권2호
    • /
    • pp.119-132
    • /
    • 2007
  • 유사 서브 시퀀스 검색은 분자 생물학 분야에서 사용되는 매우 중요한 연산이다. 본 논문에서는 대규모 DNA 시퀀스 데이타베이스를 처리 대상으로 하여 효율성과 정확도를 보장하는 실용적인 유사 서브 시퀀스 검색 기법을 제안한다. 제안된 기법은 이진 트라이를 인덱스 구조로 채택하여 DNA 시퀀스로부터 추출한 일정 길이의 윈도우 서브 시퀀스를 인덱싱 대상으로 한다. 유사 서브 시퀀스 검색 알고리즘은 기본적으로 다이나믹 프로그래밍 기법에 근거하여 이진 트라이를 루트로부터 너비 우선(breadth-first)방식으로 운행하며, 경로 상에 존재하는 모든 유사 서브 시퀀스를 검색해 낸다. 그러나 질의 길이가 윈도우의 크기보다 큰 일반적인 경우에는 질의를 일정 길이의 서브 시퀀스로 분해하여 각 서브 시퀀스에 대하여 유사 서브 시퀀스 검색을 수행한 후, 후처리 과정에 의하여 정확도에 손상 없이 이들 결과를 결합하는 분할 질의 처리 방식을 채택한다. 제안된 기법의 우수성을 검증하기 위하여, 실험을 통한 성능 평가를 수행한다. 실험 결과에 의하면 제안된 인덱스 기법은 접미어 트리에 비하여 약 40%의 작은 저장 공간을 가지고도 약 4-17배의 검색 성능의 개선 효과를 나타낸다. 또한 분할 질의 처리 방식에 의한 유사 서브 시퀀스 검색 알고리즘은 질의 길이가 긴 경우에도 효율적으로 동작하여 Suffix와 Smith-Waterman 알고리즘에 비하여 각각 수배에서 수십배의 검색 성능의 개선 효과를 나타낸다.

Syntactic Verifier as a Filter to Compound Unit Recognizer

  • Jung, Han- Min;Yuh, Sang-Hwa;Kim, Tae-Wan;Park, Dong-In
    • 한국언어정보학회:학술대회논문집
    • /
    • 한국언어정보학회 1998년도 Language, Information and Computation = Selected Papers from the 12th Pacific Asia Conference on Language, Information and Computation, Singapore
    • /
    • pp.303-309
    • /
    • 1998
  • PDF

Finite State Transducer를 이용한 한국어 전자 사전의 구조 (A Structure of Korean Electronic Dictionary using the Finite State Transducer)

  • 백대호;이호;임해창
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1995년도 제7회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.181-187
    • /
    • 1995
  • 한국어 형태소 해석기와 같은 한국어 정보 치리 시스템은 많은 전자 사진 검색 작업을 요구하기 때문에 전자 사전의 성능은 전체 시스템의 성능에 많은 영향을 미친다. 이에 본 논문은 적은 기억 장소를 차지하면서 탐색 속도가 빠른 Finite State Transducer(FST)를 이용한 전자 사전 구조를 제안한다. 제안된 전자 사진은 Deterministic Finite State Automata(DFA)로 표제어를 표현하고 DFA 상태수 최소화 알고리즘으로 모든 위치에 존재하는 중복된 상태를 제거하여 필요한 기억 장소가 적으며, FST를 일차원 배열에 매핑하고 탐색시 이 배열내에서의 상태 전이만으로 탐색을 하기 때문에 탐색 속도가 매우 빠르다. 또한 TRIE 구조에서와 같이 한번의 탐색으로 입력된 단어로 가능한 모든 표제어들을 찾아 줄 수 있다. 실험 결과 표제어 수가 증가하여도 FST를 이용한 전자 사전의 크기는 표제어 수에 비례하여 커지지 않고, 전자 사전 탐색 시간은 표제어 수에 영향을 받지 않으며, 약 237만 단어를 검색하는 실험에서 TRIE나 $B^+-Tree$구조를 사용한 전자 사전보다 빠름을 알 수 있었다.

  • PDF

위치통사론을 통해 살펴 본 몇 가지 통사론의 본질적 문제 (Certains problemes fondamentaux de la syntaxe $reconsid{\acute{e}}r{\acute{e}}s$ du point de vue de la syntaxe positionnelle)

  • 임재호
    • 인문언어
    • /
    • 제7집
    • /
    • pp.271-289
    • /
    • 2005
  • Dans cet article, nous discutons de certains $probl{\grave{e}}mes$ syntaxiques en ayant recours $\grave{a}$ la $th{\acute{e}}orie$ linguistique de Milner. Nous remettons en question $l'ind{\acute{e}}pendance$ et $l'identit{\acute{e}}$ de la structure syntaxique, la relation entre le plan syntaxique et le plan lexical, le $caract{\grave{e}}re$ de la $g{\acute{e}}om{\acute{e}}trie$ de la syntaxe, etc.. La discussion est non seulement linguistique mais aussi interdisciplinaire et ${\acute{e}}pist{\acute{e}}mologique$, dans la mesure $o{\grave{u}}$ nous examinons la nature de $l'entit{\acute{e}}$ syntaxique et la $m{\acute{e}}thode$ "scientifique" de la syntaxe qui donne $acc{\grave{e}}s$ $\grave{a}$ $l'entit{\acute{e}}$ syntaxique. Selon Milner, il faut distinguer la place du terme lexical avec la position syntaxique qui est $l'entit{\acute{e}}$ syntaxique. La $premi{\grave{e}}re$ n'est pas syntaxique $\grave{a}$ strictement parler, mais elle, observable contrairement $\grave{a}$ la seconde, sert $\grave{a}$ conjecturer la dimension syntaxique, $c'est-\grave{a}-dire$ le $syst{\grave{e}}me$ positionnel. Le dispositif $th{\acute{e}}orique$ dans la $th{\acute{e}}orie$ linguistique de Milner n'est rien d'autre que l'ensemble des propositions qui permet, en absence d'observatoire, de conjecturer le $syst{\grave{e}}me$ positionnel sur la base du $syst{\grave{e}}me$ des places. Dire $l'ind{\acute{e}}pendance$ de la structure syntaxique revient $\grave{a}$ dire qu'il y a une coupure entre le $syst{\grave{e}}me$ positionnel et le $syst{\grave{e}}me$ des places. Autrement dit, sans cette coupure, on ne peut parler de $l'ind{\acute{e}}pendance$ de la structure syntaxique. Ainsi $distingu{\acute{e}}s$, les deux $syst{\grave{e}}mes$ en cause se mettent en relation soit naturels soit non naturels ou par distorsion $d'apr{\grave{e}}s$ Milner. La relation naturelle est une relation lexico-syntaxique $n{\acute{e}}e$ au moment $o{\grave{u}}$ un terme lexical occupe une position syntaxique dont la $cat{\acute{e}}gorie$ est identique $\grave{a}$ celle de son occupant. A la $diff{\acute{e}}rence$ de cette relation d'occupation naturelle $suppos{\acute{e}}e$ chez Milner comme une tendance du langage naturel, la relation d'occupation non naturelle est "paradoxale" dans le sens $o{\grave{u}}$ elle est produite dans la rencontre plus ou moins "anomale" entre l'occupant lexical et $l'occup{\acute{e}}$ syntaxique. Le $degr{\acute{e}}$ de l'anomalie qu'une langue autorise peut ${\hat{e}}tre$ $mesur{\acute{e}}$ empiriquement et doit ${\hat{e}}tre$ $vari{\acute{e}}$ en fonction de la langue $concern{\acute{e}}e$. Le $caract{\grave{e}re$ $g{\acute{e}}om{\acute{e}}trique$ de la syntaxe $am{\grave{e}}ne$ ${\grave{a}}$ remettre en cause, entre autres, $l'empiricit{\acute{e}}$ et la $mat{\acute{e}}rialit{\acute{e}}$ de la $g{\acute{e}}om{\acute{e}}trie$ syntaxique. En ce qui concerne ces sujets, nos $th{\grave{e}}ses$ sont les suivantes : la nature de la $g{\acute{e}}om{\acute{e}}trie$ syntaxique n'est pas a priori mais empirique ; la $g{\acute{e}}om{\acute{e}}trie$ de la syntaxe peut et doit ${\hat{e}}tre$ construite $\grave{a}$ l'aide de la logique "empirique".

  • PDF

고속의 최장 IP 주소 프리픽스 검색을 위한 비트-맵 트라이 (A Bit-Map Trie for the High-Speed Longest Prefix Search of IP Addresses)

  • 오승현;안종석
    • 한국정보과학회논문지:정보통신
    • /
    • 제30권2호
    • /
    • pp.282-292
    • /
    • 2003
  • 본 논문은 IPv4와 IPv6을 지원하는 라우터에서 기가비트의 속도로 포워딩 검색을 수행하는 효율적인 포워딩 테이블 구조를 제안한다. 포워딩 검색은 최장 프리픽스 일치검색, LPM(Longest Prefix Matching)의 복잡도가 포워딩 테이블 및 주소크기에 따라 증가하여 라우터 성능의 병목지점으로 알려져 있다. 포워딩 검색의 고속화를 위해 본 논문에서는 빈번한 메모리 접근을 최소화할 수 있는 BMT(Bit-Map Trie) 자료구조를 소개한다. BMT 포워딩 검색은 필요한 모든 검색연산이 캐쉬에 저장된 소형 인덱스 테이블에서만 발생한다. 포워딩 테이블의 트라이로부터 소형 인덱스 테이블을 구축하기 위해서 BMT는 차일드(child) 노드 포인터와 포워딩 테이블 엔트리에 대한 포인터를 각각 한 비트로 표현하는 비트-맵을 구성한다. 또한 IPv6와 같이 주소길이가 증가하면 트라이의 깊이가 깊어져서 전통적인 트라이 검색속도가 느려지는 문제점을 해결하기 위해서 BMT에서는 검색을 시작할 적절한 트라이의 레벨을 결정하는 이진검색 알고리즘을 사용한다. 실험 결과 BMT는 IPv4 백본 라우팅 테이블을 펜티엄-II 프로세서의 L2 캐쉬 크기인 512KB 보다 작게 압축하였으며, 최대 250ns/패킷의 검색속도를 제공하여 기존의 알려진 가장 빠른 최장 검색 알고리즘의 성능과 같은 속도를 실현하였다.

Wildcard character를 포함하는 String Data 사이의 Subsumption 관계 확인을 위한 효율적인 알고리즘 (An effective algorithm for checking subsumption relation on string data containing wildcard characters)

  • 김도한;박희진;백은옥
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 가을 학술발표논문집 Vol.31 No.2 (1)
    • /
    • pp.712-714
    • /
    • 2004
  • 본 논문에서는 wildcard character를 포함하는 문자열의 집합을 대상으로, 이들 사이의 subsumption 관계를 파악하여 더 구체적인 정보를 가지는 문자열들의 집합을 구하고자 하는 것이다. 이를 위해 기존의 suffix tree 알고리즘이 wildcard character를 포함하는 문자열을 처리할 수 있도록 단순 적용한 방법과 trie의 집합을 이용하여 wildcard character를 포함한 문자열을 처리하는 두 가지 방법을 고려하였다

  • PDF

CBDS 트리를 이용한 모바일 기기용 저용량 사전 구현에 관한 연구 (A Study on the Implementation of Small Capacity Dictionary for Mobile Equipments Using a CBDS tree)

  • 정규철;이진관;장혜숙;박기홍
    • 한국컴퓨터정보학회논문지
    • /
    • 제10권5호
    • /
    • pp.33-40
    • /
    • 2005
  • 최근 저가의 모바일 기기들이 출시되면서 단순한 휴대용 전자수첩에서 벗어나 학습과 업무용을 많은 이용되고 있으며 일반적인 응용프로그램 또한 많이 생산되고 있다. 그러나 휴대용 모바일 기기들의 단점중 하나가 저속의 소용량 시스템이라는 것이다. 이로 인해 일반 시스템에서 가동 중인 데이터베이스나 검색 알고리즘을 이식 시킬 경우 시스템의 성능을 저하되고 만다. CBDS trio알고리즘을 적용하여 모바일 환경에 맞는 저 용량 색인과 빠른 검색을 실현시킬 수 있게 되었다. 성능을 파악하기 위해 B-tree로 구현된 자바 Treeset API와 비교해본 결과 속도에서는 약간 느렸으나 저장 공간에서는 약 29$\%$의 공간 절약을 할 수 있어 실용 가능함을 보여주고 있다.

  • PDF

XML 데이타베이스에서 경로-지향 질의처리를 위한 병렬 매치 방법 (A Parallel Match Method for Path-oriented Query Processing in iW- Databases)

  • 박희숙;조우현
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제32권5호
    • /
    • pp.558-566
    • /
    • 2005
  • XML은 인터넷상에서 데이타를 표현하고 교환하기 위한 새로운 표준이다. 본 논문에서는, XML문서에 대한 경로-지향 질의어의 평가를 위한 새로운 접근법에 대하여 기술한다. 본 논문의 접근법에서는, 경로-지향 질의어의 평가속도를 개선하기 위해 경로서명을 이용하는 병렬 매치 인덱싱 구조의 제안과 함께 데이타베이스 안에 저장된 엘리먼트들의 경로서명들과 입력된 질의어의 경로서명 사이에 매치작업을 수행하기 위한 병렬 매치 알고리즘을 설계한다. 먼저, 병렬 매치 구조를 형성하기 위해서는 XML 문서상의 모든 경로서명들에 대한 이진 트라이를 구성한 다음 이들을 병렬 매치 인덱싱 구조로 변환한다. 경로-지향 질의어의 검색 연산을 수행하기 위해 병렬 매치 인덱싱 구조와 병렬 매치 알고리즘을 사용한다. 본 논문에서 제안한 방법에서 알고리즘의 시간 복잡도는 XML 문서내의 경로서명의 수에 대하여 로그값에 비례한다.

USN 미들웨어에서 트라이 구조 쿼드 트리를 이용한 영역 질의 재구성 기법 (Region Query Reconstruction Method Using Trie-Structured Quad Tree in USN Middleware)

  • 조숙경;정미영;정현민;김종훈
    • 한국공간정보시스템학회 논문지
    • /
    • 제10권1호
    • /
    • pp.15-28
    • /
    • 2008
  • 유비쿼터스 센서 네트워크(USN) 환경에서 사용자 중심의 서비스를 하기 위해서는 영역 질의 처리가 필수적이다. In-network 질의에서 영역 질의를 처리하는 방법으로 R-tree를 이용하는 방법이 선호되었다. 유비쿼터스 센서 네트워크 환경하에서는 센서의 수명이 전체 네트워크의 수멍을 좌우하기 때문에 질의가 전달될 센서를 정확하게 선별할 수 있어야 한다. 그러나, R-tree를 이용한 방법은 질의 영역과 MBR(Minimum Boundary Rectangle) 간의 교집합 연산에 의해 센서를 선별하기 때문에 실제 센서가 없는 영역임에도 불구하고 센서 값 측정을 요청하는 메시지를 전달하게 된다. 이러한 문제를 해결하기 위해 본 논문에서는 기지국의 미들웨어에 트라이 구조 쿼드 트리를 구축하여 이를 이용하여 정확하게 질의 영역에 포함되는 센서 노드들에게만 질의를 전달한다. 이 기법은 질의 수행시 R-tree를 이용한 방법보다 응답 시간이 늦어지지만, 필요한 센서 노드에만 정확히 질의를 전달하기 때문에 USN의 전력 소모를 감소시키는 장점이 있다.

  • PDF

인터넷 라우터에서의 패킷 분류를 위한 2차원 이진 검색 트리 (Two-dimensional Binary Search Tree for Packet Classification at Internet Routers)

  • 이고은;임혜숙
    • 전자공학회논문지
    • /
    • 제52권6호
    • /
    • pp.21-31
    • /
    • 2015
  • 현재의 인터넷 사용자들은 실시간으로 다양한 멀티미디어 서비스를 제공 받길 원한다. 이에 네트워크 트래픽의 속도는 매우 빨라지고 있으며, 처리하여야 하는 데이터의 양은 해마다 기하급수적으로 증가하고 있다. 데이터는 '패킷'이라는 단위의 데이터 형식으로 전송되며, 패킷분류는 인터넷 라우터의 가장 어려운 기능 중 하나로 모든 패킷에 대하여 선속도로 처리되어야 한다. 다양한 패킷 분류 알고리즘 중, 영역분할 패킷분류 알고리즘은 5개의 패킷 헤더 필드 정보를 동시에 검색할 수 있는 효율적인 알고리즘이다. 영역 분할 사분 트라이는 가장 대표적인 영역분할 패킷분류 알고리즘으로 메모리 요구량이 적은 알고리즘이지 만, 빠른 검색성능을 보장하지 못하는 단점이 있다. 본 논문에서는, 영역 분할 사분 트라이의 단점을 이진 검색 트리를 사용해 보완하는 새로운 알고리즘을 제안한다. 실험을 통하여 제안하는 알고리즘은 입력과 비교되는 룰의 수에 있어 영역 분할 사분 트라이 보다 검색 성능이 향상됨을 보았다.