• 제목/요약/키워드: 준구조적 데이터

검색결과 198건 처리시간 0.026초

분산된 준구조적 데이터 검색을 위한 경로 질의 처리 기법 (A Path Query Processing Scheme for Distributed Semi-structured Data Retrieval)

  • 이재형;정연돈;김덕현;김명호
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제28권1호
    • /
    • pp.95-103
    • /
    • 2001
  • 본 논문에서는 분산된 준구조적 데이터에 대한 질의 처리 문제를 다룬다. 분산된 준구조적 데이터는 루트가 있고 간선에 레이블이 있는 그래프 모델로 표현될 수 있으며, 그래프의 조드들은 한 사이트 또는 여러 사이트들에 위치할 수 있다. 분산된 준구조적 데이터의 효율적인 검색을 위해 ‘질의 단축 및 확산’ 방법에 기반을 둔 질의 처리 모델을 제안한다. 이 방법은 사용자 질의가 사이트 내부에서 단축되고 다른 사이트로 분산되는 과정을 통해 데이터를 검색한다. 또한, 제안된 모델에 필요한 알고리즘들을 제시하고 정확성을 증명한다.

  • PDF

A Data Model for XML

  • 이대우;최옥;김영찬
    • 한국정보기술응용학회:학술대회논문집
    • /
    • 한국정보기술응용학회 2001년도 추계공동학술대회 논문자료집 정보화 젼략 패러다임의 변화에 대한 보기술의 대응
    • /
    • pp.169-171
    • /
    • 2001
  • 본 논문에서는 XML(eXtensible Markup Language)을 위한 데이터 모델을 제시하기 위해 현재 광범위하게 사용되고 있는 관계형 데이터베이스(relational database) 개념을 적용한다. 관계형 데이터베이스는 업무 요구사항의 분석으로부터 고수준의 개념적 데이터 모델을 사용해서 데이터베이스에 대한 개념적 스키마(conceptual schema)를 생성한 다음, 고수준 개념적 데이터 모델을 구현 데이터 모델로 변환하여 논리적 데이터베이스 스키마를 생성한다. 이때, 고수준 개념적 데이터 모델링의 대표적인 방법으로 ER모델을 사용하고, 구현 데이터 모델로 관계 모델(relation model)을 사용한다. XML은 문서의 논리적 구조를 정의하는 DTD와 XML Schema 등을 갖는다. XML의 DTD와 정보 모델링 기법인 E/R 모델은 모두 작은 세계(real world)를 모델링하는 도구들이라고 할 수 있다. 본 논문에서는 XML의 DTD와 E/R 모델의 구성요소들을 분석하여 서로 사상(mapping)시키는 'XML을 위한 데이터 모델(A Data Model for XML)'을 제시한다. 최종적으로 제시된 XML을 위한 데이터 모델에 의해 작은 세계(real world)을 모델링하는 XML DTD에서 정의한 구조(XML Structure)을 따르는 유효한 XML문서(validate XML document)들은 관계형 데이터베이스에 저장할 수 있게 된다.

  • PDF

SCOPML과 SCOPBrowser (SCOPML and SCOPBrowser)

  • 윤형석;황의윤;안건태;김진홍;이명준
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2002년도 가을 학술발표논문집 Vol.29 No.2 (1)
    • /
    • pp.286-288
    • /
    • 2002
  • 포스트지놈 시대에 있어서 가장 주된 연구는 단백질의 구조적 유사성이나 분류학적인 연관성을 밝히는 것이다. SCOP 단백질 구조 분류는 이러한 목적을 위하여 3차원 구조가 알려진 단백질에 대한 구조적, 분류학적 관계에 대해 상세한 정보를 제공한다. 그러나 SCOP의 데이터는 단순 텍스트 기반의 자료만 제공되고 있어서, 이를 이용한 다른 분석 도구를 개발하거나 유용한 정보 추출을 할 경우 그 작업이 매우 힘들며 오류 발생의 확률이 높다. 본 논문에서는 단백질 구조 관련 연구자들이 SCOP 데이터를 보다 효과적으로 이용할 수 있도록 구조화된 문서의 표준인 XML을 이용하여 개발된 SCOPML에 대하여 기술한다. 그리고 SCOPML을 이용하여 SCOP 데이터에 대한 효율적인 검색을 지원하는 SCOPBrowser의 개발에 대해 기술한다.

  • PDF

단백질 구조 분류의 통합 검색을 위한 웹 정보시스템 (A Web-Based Information System for the Integrated Search for Protein Structure Classifications)

  • 신원준;황의윤;김진홍;안건태;이명준
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 봄 학술발표논문집 Vol.31 No.1 (B)
    • /
    • pp.274-276
    • /
    • 2004
  • 단백질은 대부분 공간상의 특징을 고려할 때 유사한 부분을 기준으로 분류되는 경우가 많다 단백질 구조 분류 데이터베이스는 단백질이 가지는 다양한 구조 정보를 바탕으로 단백질 구조 분류 정보를 제공하고 있다. 대표적인 단백질 구조 분류 데이터베이스에는 CATH와 SCOP 데이터베이스가 있다. 이들 데이터베이스는 서로 다른 구조 분류 기준으로 단백질 구조를 분류하고 있으며, 단백질 구조 분류 정보를 검색하는 웹 서비스를 개별적으로 제공하고 있다. 따라서 여러 종류의 단백질 구조 분류 정보를 하나의 웹 사이트에서 검색할 수 있으면 유용할 것이다. 본 논문에서는 CATH와 SCOP에서 정의한 단백질 구조 분류 정보의 통합적인 검색 기능 일 통계 정보를 체계적으로 제공하는 웹 정보시스템에 관하여 기술한다. 제안된 시스템은 CATH와 SCOP에서 제공하는 각각의 데이터를 가공하여 효과적인 구조 분류 검색을 지원하는 구조화된 데이터베이스를 구축하였다. 개발된 시스템은 PDB 식별자, CAT터 식별자. 그리고 SCOP 식별자 또는 단백질 분류 이름으로 한번의 검색으로 두 데이터베이스에서 제공하는 계층적 구조 분류 정보를 제공한다. 또한, 단백질 구조에 대한 유용한 통계 정보를 제공한다.

  • PDF

SDTS와 GOTHIC간의 데이터 변환 시스템의 개발 (Development of a Data Conversion System between SDTS and Gothic)

  • 김준종;설영민;이강준;한기준
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1998년도 가을 학술발표논문집 Vol.25 No.2 (1)
    • /
    • pp.170-172
    • /
    • 1998
  • 지리 정보 시스템(GIS)은 그 특성상 대용량의 GIS 데이터를 사용하며, 다양한 소프트웨어와 하드웨어 상에서 구현된다. 이렇게 상이한 하드웨어, 소프트웨어, 그리고 운영 체제상에서 공간 데이터들 간의 효율적인 데이터 교환이 불가능하다면 데이터 공유가 매우 어려울 뿐만 아니라 데이터의 중복 보관 및 관리로 인해 막대할 경제적 손실을 가져온다. 이와 같은 문제점을 해결하기 위해서 국가 차원에서 지리 정보 시스템에 관해 국가 표준을 설정하고, 공간 데이터베이스를 구축하고 있는데 공통데이터교환 포맷으로 채택된 것은 SDTS이다. 본 논문에서는 국가 공통데이타교환 포맷인 SDTS 데이터와 GOTHIC의 데이터를 상호 교환할 수 있는 데이터 변환 시스템을 설계 및 구현한다. 데이터 변환 시스템의 대상이 되는 GOTHIC은 영국 Laser-Scan에서 개발한 GIS 개발 도구로 실세계를 구성하는 개체들을 서로 구분될 수 있는 하나의 객체로 표현하고 있다. 본 논문에서는 우선 GOTHIC과 SDTS의 데이터 포맷 및 데이터의 저장 방법에 대해 분석한다. 그리고, 구현하려고 하는 데이터 변환 시스템의 전체적인 구조를 설계하고, 구조의 각 단계별로 수행될 작업을 구현함으로써 데이터 변환 시스템을 개발한다.

복수 대규모 언어 모델에 기반한 제어 가능형 데이터 증강 프레임워크 (Controllable data augmentation framework based on multiple large-scale language models)

  • 강현석;남궁혁;정지수;정상근
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2023년도 제35회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.3-8
    • /
    • 2023
  • 데이터 증강은 인공지능 모델의 학습에서 필요한 데이터의 양이 적거나 편향되어 있는 경우, 이를 보완하여 모델의 성능을 높이는 데 도움이 된다. 이미지와는 달리 자연어의 데이터 증강은 문맥이나 문법적 구조와 같은 특징을 고려해야 하기 때문에, 데이터 증강에 많은 인적자원이 소비된다. 본 연구에서는 복수의 대규모 언어 모델을 사용하여 입력 문장과 제어 조건으로 프롬프트를 구성하는 데 최소한의 인적 자원을 활용한 의미적으로 유사한 문장을 생성하는 방법을 제안한다. 또한, 대규모 언어 모델을 단독으로 사용하는 것만이 아닌 병렬 및 순차적 구조로 구성하여 데이터 증강의 효과를 높이는 방법을 제안한다. 대규모 언어 모델로 생성된 데이터의 유효성을 검증하기 위해 동일한 개수의 원본 훈련 데이터와 증강된 데이터를 한국어 모델인 KcBERT로 다중 클래스 분류를 수행하였을 때의 성능을 비교하였다. 다중 대규모 언어 모델을 사용하여 데이터 증강을 수행하였을 때, 모델의 구조와 관계없이 증강된 데이터는 원본 데이터만을 사용하였을 때보다 높거나 그에 준하는 정확도를 보였다. 병렬 구조의 다중 대규모 언어 모델을 사용하여 400개의 원본 데이터를 증강하였을 때에는, 원본 데이터의 최고 성능인 0.997과 0.017의 성능 차이를 보이며 거의 유사한 학습 효과를 낼 수 있음을 보였다.

  • PDF

은닉 조건부 랜덤 필드를 이용한 인간 행위 인식 시스템의 설계 (Design of a Human Activity Recognition System using Hidden Conditional Random Fields)

  • 김혜숙;한유미;김인철
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2013년도 추계학술발표대회
    • /
    • pp.1332-1335
    • /
    • 2013
  • 본 논문에서는 키넥트 센서 데이터에 은닉 조건부 랜덤 필드 모델을 적용하여 인간의 일상 행위를 인식하는 시스템을 제안한다. 많은 고수준의 일상 행위들은 다수의 부속 행위들이 순차적 혹은 반복적으로 수행되어 나타나는 하나의 계층구조로 볼 수 있다. 따라서 제안하는 시스템에서는 이러한 고수준의 일상 행위들을 순차성과 계층성을 잘 표현할 수 있는 확률 그래프 모델의 하나인 은닉 조건부 랜덤 필드 모델로 모델링함으로써, 행위 인식률을 높이려고 시도하였다. 또한 제안하는 시스템에서는 효과적인 행위 모델의 학습과 적용을 위해, 모션 특징, 구조 특징, 손 위치 특징과 같은 다양한 종류의 특징들을 키넥트 센서 데이터로부터 추출하여 이들을 이용하였다. 그리고 12 가지 일상 행위들에 관한 코넬 대학의 CAD-60 데이터 집합을 이용한 다양한 실험을 통해, 제안하는 시스템의 우수한 인식 성능을 확인할 수 있었다.

센서 네트워크에서의 상황인지를 위한 컨텍스트 모델

  • 김강석;허지완;송왕철
    • 한국지능정보시스템학회:학술대회논문집
    • /
    • 한국지능정보시스템학회 2006년도 춘계학술대회
    • /
    • pp.159-163
    • /
    • 2006
  • 최근 도메인에 기반한 개념과 이들 개념간의 관계를 설정할 수 있는 온톨로지 기반 컨텍스트 모델들이 유비쿼터스 컴퓨팅 환경에서 연구되고 있다. 그러나 새로운 개념의 추가에 따른 온톨로지 재구성은 시간이나 비용적으로 많은 오버헤드를 초래한다. 즉 하위 레벨에 있는 임의의 데이터 구조가 수정될 때마다 계속 적으로 기존 온톨로지를 변경해야만 한다. 따라서 센서 노드의 동적인 컨텍스트 표현보다 미들웨어와 같은 최상위의 추상적이고 정적인 컨텍스트 표현에 적합하다. 한편 센서 네트워크에서의 베이스 스테이션 기반 상황인지 기법은 상황 조건을 만족시키지 못하는 저수준 센싱 정보를 베이스 스테이션으로 전송하는데 많은 에너지를 소모한다. 본 논문에서는 센서 노드에서의 동적인 컨텍스트의 표현과 저수준 센싱 정보의 전송량을 줄이기 위해 메타데이터와 RDF 기반 구조의 변형인 Triple 구조를 결합한 컨텍스트 모델은 제안한다.

  • PDF

Template 을 이용한 동영상 비정규 구조 색인 방법 (Indexing for irregular structured video using template)

  • 권순용;오상욱;윤자천;설상훈
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2005년도 춘계학술발표대회
    • /
    • pp.189-192
    • /
    • 2005
  • 동영상 데이터가 급증하면서 뉴스 검색과 같은 검색 서비스를 위한 내용 기반의 색인 방법에 대한 관심이 높아지고 있다. 이에 따른 최근의 동영상 색인 기술들은 특히 용량이 큰 동영상에서 자동 또는 반자동으로 색인하기 위한 방법들을 소개하고 있으며, 대부분 저수준 특징(low-level feature)들을 이용하여 특정 구간을 검출하는 방법을 사용하고 있다. 그러나 저수준 특징만을 이용할 경우 고수준 특징(high-level feature)이 나타내는 인지적 측면에서의 동영상 내용을 다룰수 없어, 사용자가 일일이 내용에 따른 구분 작업을 병행해야 하는 단점을 갖고 있다. 본 논문에서는 뉴스와 같이 시간적으로 비정규적이지만 내용에 따라 구조를 지니고 있는 동영상에 대해서, 저수준 특징만을 사용하여 고수준 특징을 이용한 것과 같은 성능으로 사용자가 수행해야 하는 작업을 최소화하는 내용 기반 구간 검출 방법에 의한 색인 방법을 제안한다. 특히 저수준 특징을 이용한 프로그램 구간 검출은 빠른 처리 및 효과적인 검출 성능 보이고 있어, 본 논문에서 제안한 비정규 구조 색인 방법이 내용 기반 색인에 매우 효과적임을 보여주고 있다.

  • PDF

클러스터링을 이용한 R-Trees 구축방법 (R-Trees construction using clustering)

  • 차정숙;이기준
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1999년도 가을 학술발표논문집 Vol.26 No.2 (1)
    • /
    • pp.171-173
    • /
    • 1999
  • 공간 데이터베이스에서 사용되는 데이터는 그 양이 방대하고 복잡하여 이를 효율적으로 저장, 관리하는 색인이 필요하다. 여러 공간 색인 방법들 중에서 R-tree는 삽입과 삭제가 빈번히 발생하는 동적인 환경에서 효율적인 질의 성능을 보이는 것으로 알려져 있다. R-tree는 삽입되는 데이터의 순서에 따라 트리의 구조가 달라질 수 있는데, 주어진 데이터가 수정이 자주 발생하지 않는다며 데이터 입력 순서를 결정하여 질의 성능이 가장 좋은 트리를 구성할 수 있다. 본 논문에서는 데이터가 자주 수정되지 않는 환경에서 노드간의 중첩을 가장 최소화 할 수 있는 데이터 입력 순서를 결정하기 위해 클러스터링을 이용한 새로운 방법인 CSR-tree를 제안하고자 한다. CSR-tree는 일반 R-tree와 hilbert packed R-tree 방법보다 향상된 질의 성능을 보인다.

  • PDF