• 제목/요약/키워드: 다중 서열 정렬

검색결과 24건 처리시간 0.069초

클러스터링 기반 다중 서열 정렬 알고리즘 (Algorithm of Clustering-based Multiple Sequence Alignment)

  • 이병일;이종연;정순기
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2005년도 춘계학술발표대회
    • /
    • pp.27-30
    • /
    • 2005
  • 3개 이상의 DNA 혹은 단백질의 염기서열을 정렬하는 다중 서열 정렬(multiple sequence alignment, MSA)은 서열들 사이의 진화관계, 단백질의 구조와 기능에 관한 연구에 필수적인 도구이다. 최적화된 다중서열 정렬을 얻기 위해 사용되는 가장 유용한 방법은 동적 프로그래밍이다. 그러나 동적프로그래밍은 정렬하고자 하는 서열의 수가 증가함에 따라 시간도 지수함수($O(n^k)$)로 증가하기 때문에 다중 서열 정렬에는 효율적이지 못하다. 따라서, 본 논문에서는 최적의 MSA 문제를 해결하기 위해 클러스터링 기반의 새로운 다중 서열 정렬 (Clustering-based Multiple Sequence Alignment, CMSA) 알고리즘을 제안한다. 결과적으로 제안한 CMSA 알고리즘의 기여도는 다중 서열 정렬의 질적 향상과 처리 시간 단축($O(n^3L^2)$)이 기대된다.

  • PDF

웹 기반 고성능 다중서열정렬시스템 설계 및 구현 (A Web-Based High Performance Multiple Sequence Alignment System Design and Implementation)

  • 김태경;김훈기;최치환;정승현;허보경;조완섭
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2010년도 제42차 하계학술발표논문집 18권2호
    • /
    • pp.79-82
    • /
    • 2010
  • 다중서열정렬 알고리즘은 생명정보학 분야에서 서열기반의 계통분류 분석에 가장 많이 사용되며, 가장 대표적인 공개 프로그램은 ClustalW로 사용자가 로컬시스템에 설치하여 이용할 수 있다. 그러나 실제로 사용자들이 ClustalW을 설치한 후, 서열데이터의 준비, 가공, 처리 및 타 시스템과 연동 등과 같은 작업을 하는데 여러 가지 어려움이 있다. 따라서 본 논문에서는 다중서열정렬 작업을 편리하고 빠르게 수행할 수 있는 웹기반의 고성능 다중서열정렬시스템을 제안한다. 제안된 시스템의 특징은, (1) Inter-Query 라우팅 알고리즘을 통해 다수의 PC 자원을 효율적으로 활용하여 계산 성능을 극대화하였으며, (2) 사용자 편의성을 고려한 웹인터페이스의 제공을 통해 개인화된 데이터관리, 실시간 모니터링, 데이터 편집 등을 지원하여 사용자가 손쉽게 서열데이터의 수집, 관리 및 처리할 수 있도록 지원한다.

  • PDF

다중서열정렬에 기반한 종의 차이 (Differences between Species Based on Multiple Sequence Alignment Analysis)

  • 권혁주;김상진;김근무
    • 한국전자통신학회논문지
    • /
    • 제19권2호
    • /
    • pp.467-472
    • /
    • 2024
  • 다중서열정렬(MSA : multiple sequence alignment)은 다양한 생명체에서 같은 기능을 하는 여러 개의 단백질 서열이나 핵산 서열을 한 번에 모아서 서로 정렬하는 방법이다. 바이오파이썬을 이용하여 인간이 다른 동물과 어떻게 다른지 조사하였다. 대표적인 다중서열정렬 알고리즘인 clustalW는 열의 위치별로 정렬된 정도를 비교한다. 또한, 웹로고와 계통수를 만들어서 보존서열을 가시화하여 이해도를 향상한다. 인간과 다른 동물의 차이점을 확인하는 예를 제시하고 바이오파이썬을 활용도를 제시한다.

다중 지역 정렬 알고리즘 구현 및 응용 (Implementation and Application of Multiple Local Alignment)

  • 이계성
    • 문화기술의 융합
    • /
    • 제5권3호
    • /
    • pp.339-344
    • /
    • 2019
  • 서열 정렬에 있어서 전체를 비교하여 두 서열 사이의 최대의 유사성 또는 상동성을 찾는 전역 정렬은 넓은 범위를 선호하게 되는 편향성을 갖게 된다. 비일치 부분을 과감히 제거하고 높은 일치도를 갖는 부분 영역을 정렬하게 되면 정렬점수를 높이는 효과를 갖게 된다. 여러 개의 부분 지역 정렬을 탐색하게 하는 다중 지역정렬 방법을 적용하여 다수의 지역정렬을 수행하는 알고리즘을 구현하고 결과를 분석해 본다. 지역 정렬에 일반적으로 사용되는 Smith-Waterman 알고리즘의 제한점 중 하나인 서열이 길어지는 것을 방지하고, sub-optimal sequence를 찾기 위한 방법을 응용하여 다중지역 정렬을 수행한다.

정규화된 지역 정렬 알고리즘을 적용한 다중 지역 정렬 알고리즘 (An Algorithm for multiple local alignment with Normalized Local Alignment Algorithm)

  • 장석봉;이계성
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2003년도 춘계학술발표논문집 (중)
    • /
    • pp.1019-1022
    • /
    • 2003
  • 두 서열을 비교하여 유사성(similarity)이나 상동성(homology)를 찾기 위한 서열 정렬 방법 중에서 지역 정렬에 많이 사용되는 Smith-Waterman 알고리즘의 제한점인 Mosaic effect와 Shadow effect를 극복하기 위한 효율적인 방법을 살펴보고, 하나의 최대 값이 아닌 다수개의 최대 값을 찾아 다수개를 정렬함으로써 서열내에 존재 할 수 있는 다수개의 지역 정렬을 찾고 Normalized sequence alignment 알고리즘을 이용하여 서열 정렬된 결과들의 우선 순위를 매겨본다.

  • PDF

콜러스터링 분기를 이용한 다중 서열 정렬 알고리즘 (A Multiple Sequence Alignment Algorithm using Clustering Divergence)

  • 이병일;이종연;정순기
    • 한국컴퓨터정보학회논문지
    • /
    • 제10권5호
    • /
    • pp.1-10
    • /
    • 2005
  • 다중 서열 정렬(multiple sequence alignment, MSA)은 단백질과 핵산 서열들의 분석에 필요한 가장 중요한 도구이다. 생물학적인 서열들은 그들 사이의 유사성과 차이점을 보여주기 위하여 각각의 서열들을 수직적으로 정렬한다. 본 논문에서는 클러스터링 분기를 이용하여 두 그룹의 서열들 사이에서 정렬을 수행하는 효율적인 그룹 정렬 방법을 제안하였다. 제안한 알고리즘(Multiple Sequence Alignment using Clustering Divergence : CDMS)은 하향식 발견 방법인 트리 형태의 병합을 위해 클러스터링 방법으로 구축하였다. 클러스터링 방법은 가장 긴 거리를 가지는 서열을 두 개의 클러스터로 나눌 수 있다는 것에 기초하였다. 제안한 새로운 서열 정렬 알고리즘은 기존의 Clustal W알고리즘 보다 질적 향상과 처리 시간 단축 O($n^{3} L^{2}$)이 기대된다.

  • PDF

다중 지역 정렬을 위한 알고리즘 (An Algorithm for multiple local alignment)

  • 장석봉;이계성
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2002년도 추계학술발표논문집 (하)
    • /
    • pp.2337-2340
    • /
    • 2002
  • 본 연구는 생물정보학(Bioinformatics)의 가장 기초적인 분야중 하나인, 새롭게 밝혀진 유전자 서열과 이미 밝혀진 유전자 서열 사이의 유사성(similarity)이나 상동성(homology)을 찾기 위한 방법에 대한 연구 중 지역 서열정렬로 사용하는 알고리즘인 Smith-Waterman 알고리즘이 갖고 있는 문제를 파악한다. 긴 서열에 대한 선호를 막고 대신 부분적인 지역 정렬을 다수 개 찾아 정렬시키는 알고리즘을 제안하기로 한다.

  • PDF

다중 서열 정렬 기법을 이용한 악성코드 패밀리 추천 (Malware Family Recommendation using Multiple Sequence Alignment)

  • 조인겸;임을규
    • 정보과학회 논문지
    • /
    • 제43권3호
    • /
    • pp.289-295
    • /
    • 2016
  • 악성코드 개발자들은 악성코드 탐지를 회피하기 위하여 변종 악성코드를 유포한다. 정적 분석 기반의 안티 바이러스로는 변종 악성코드를 탐지하기 어려우며, 따라서 API 호출 정보 기반의 동적 분석이 필요하다. 본 논문에서는 악성코드 분석가의 변종 악성코드 패밀리 분류에 도움을 줄 수 있는 악성코드 패밀리 추천 기법을 제안하였다. 악성코드 패밀리의 API 호출 정보를 동적 분석을 통하여 추출하였다. 추출한 API 호출 정보에 다중 서열 정렬 기법을 적용하였다. 정렬 결과로부터 각 악성코드 패밀리의 시그니쳐를 추출하였다. 시그니쳐와의 유사도를 기준으로, 제안하는 기법이 새로운 악성코드의 패밀리 후보를 3개까지 추천하도록 하였다. 실험을 통하여 제안한 악성코드 패밀리 추천 기법의 정확도를 측정하였다.

분할 순차 패턴과 SVM을 이용한 HPV 타입 예측 시스템 (HPV-type Prediction System using SVM and Partial Sequential Pattern)

  • 김진수
    • 디지털융복합연구
    • /
    • 제12권12호
    • /
    • pp.365-370
    • /
    • 2014
  • 기존의 시스템에서는 서열 전체 혹은 정렬되지 않은 서열로부터 패턴들을 생성하기 때문에 패턴의 수가 기하급수적으로 증가하여 많은 시간과 비용이 소모된다. 본 논문에서는 단백질의 전체 서열로부터 패턴을 찾아내는 것이 아니라, 다중 서열 정렬 기법을 이용하여 단백질의 분할 서열 구간을 생성하고 분할 서열 구간의 순차 패턴을 생성하며 생성된 패턴들을 통합하여 전체 모티프 후보 집합을 만들어 SVM의 훈련 집합으로 선택 및 학습하며, 최종적으로 미지의 혹은 알려진 단백질 서열의 HPV 타입을 SVM을 통해 학습된 정보를 적용하여 예측하는 시스템을 제안한다. 제안된 시스템은 기존의 시스템에 비해 최소 지지도 30%에서 정확도와 재현율 측면에서 보다 향상된 성능을 보였다.

다중서열정렬을 이용한 변형단어집합의 분류 기법 (A Classification Method for Deformed Words Using Multiple Sequence Alignment)

  • 김성환;조환규
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2012년도 한국컴퓨터종합학술대회논문집 Vol.39 No.1(B)
    • /
    • pp.264-266
    • /
    • 2012
  • 인터넷 상에서의 변형 단어들을 처리하는 문제는 정보 검색, 기계 번역, 웹 마이닝, 욕설 및 스팸 필터링과 같은 다양한 분야에서 사용될 수 있다. 특히 단어의 변형 추이를 파악하는 등 데이터 수집 및 분석을 위해서는 주어진 단어가 어떤 변형 단어의 집합으로 이루어진 부류에 포함되는지 여부를 파악해야 할 필요성이 있다. 본 논문에서는 같은 부류에 속한 변형 단어 집합에 대하여 다중 서열 정렬(multiple sequence alignment)을 수행함으로써 해당 집합을 하나의 대표 문자열로 취급하는 변환 기법을 제안하고, 이를 이용해 주어진 단어가 해당 부류에 속하는지 여부를 효과적으로 분류하는 기법을 소개한다. 실험결과 제안 기법의 분류 성능은 민감도 93.4% 수준에서 89.1%의 특이도를 보여 전수 비교를 통한 분류에 비하여 결코 성능은 하락하지 않으면서 분류 속도는 16.5배 향상되었음을 확인할 수 있었다.