• 제목/요약/키워드: 데이터유사성

검색결과 1,578건 처리시간 0.029초

OWL 속성을 이용한 온톨로지 간 의미 유사도 측정 방법 (Similarity Measure between Ontologies using OWL Properties)

  • 안우식;박정은;오경환
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2006년도 한국컴퓨터종합학술대회 논문집 Vol.33 No.1 (B)
    • /
    • pp.169-171
    • /
    • 2006
  • 인터넷이 보다 대중화되고 광범위해지면서 의미적 관계에 따라 정보를 저장하는 온톨로지 시스템이 미래의 지능적인 컴퓨터를 위한 적절한 수단으로 각광받고 있다. 하지만 온톨로지와 같은 메타 데이터를 사용한 방법은 그 사용 목적 또는 작성자의 개인적인 관점에 따라 다양한 이질적인(heterogeneous) 형태를 띠게 된다. 이러한 이질적인 정보들은 데이터가 다른 시스템에서 처리되는 것을 어렵게 한다. 정보의 상호운용성을 보장하기 위해서는 서로 다른 온톨로지 시스템간의 개체에 대한 유사도를 평가할 수 있어야 한다. 따라서 두 개의 다른 OWL 언어로 정의된 온톨로지 사이에서 두 개의 엔티티의 유사도를 측정하기 위한 새로운 유사도 척도(similarity measure)를 제안하였다. 이는 온톨로지 상의 이질적인 정보를 통합하는데 사용되며, 온톨로지 비교(comparison), 정렬(alignment), 매칭(matching) 그리고 병합(merging)의 기반이 되는 중요한 기법이다. 새로운 유사도 척도는 특정한 매핑 정보를 사용하지 않고 온톨로지 언어의 속성을 기반으로 하므로 OWL을 사용한 온톨로지 간의 유사도 검색에 곧바로 적용될 수 있는 장점을 지닌다.

  • PDF

연관 규칙 마이닝에서의 코사인 순수 신뢰도의 제안 (The proposition of cosine net confidence in association rule mining)

  • 박희창
    • Journal of the Korean Data and Information Science Society
    • /
    • 제25권1호
    • /
    • pp.97-106
    • /
    • 2014
  • 빅 데이터 기술의 발전은 다변화된 현대 사회를 보다 정확하게 예측하고 효율적으로 작동하도록 정보를 제공하는 동시에 과거에는 불가능 했던 기술을 가능케 하였다. 이러한 빅 데이터 분석 기법은 국가 차원에서의 사회, 경제, 정치, 문화, 과학 기술 등 여러 분야에 활용될 수 있다. 빅 데이터 분석을 위해서는 먼저 데이터 마이닝 기술로 방대한 양의 데이터 속에서 가치 있는 정보를 찾는 것이 선행 되어야 하는데, 빅 데이터와 관련된 데이터 마이닝 기법으로는 텍스트 마이닝, 평판 분석, 군집 분석, 연관성 규칙 등이 있다. 본 논문에서는 데이터 마이닝 기법 중에서 많이 활용되고 있는 연관성 규칙의 평가 기준으로 코사인 순수 신뢰도를 제안한 후, Piatetsky-Shapiro가 제안한 흥미도 측도의 기준에 대한 충족여부를 점검하는 동시에 여러 가지 특성을 살펴보았다. 또한 예제를 통하여 고찰한 결과, 기존의 신뢰도와 코사인 유사성 측도는 모두 양의 값을 가지므로 연관성의 방향을 알 수 없어서 그 값만으로는 양의 연관성이 있는지 아니면 음의 연관성이 있는지를 알 수 없었다. 그러나 본 논문에서 제안한 코사인 순수 신뢰도는 그 부호에 의해 연관성 규칙의 방향을 알 수 있으므로 신뢰도와 코사인 유사성 측도가 가지고 있는 약점을 보완할 수 있는 측도라는 사실을 확인하였다.

클라우드 환경에서 검색 효율성 개선과 프라이버시를 보장하는 유사 중복 검출 기법 (Efficient and Privacy-Preserving Near-Duplicate Detection in Cloud Computing)

  • 한창희;신형준;허준범
    • 정보과학회 논문지
    • /
    • 제44권10호
    • /
    • pp.1112-1123
    • /
    • 2017
  • 최근 다수의 콘텐츠 서비스 제공자가 제공하는 콘텐츠 중심 서비스가 클라우드로 이전함과 동시에 온라인 상의 유사 중복 콘텐츠가 급격히 증가함에 따라, 불필요한 과잉 검색 결과를 초래하는 등 클라우드 기반 데이터 검색 서비스의 품질이 저하하고 있다. 또한 데이터 보호법 등에 의거, 각 서비스 제공자는 서로 다른 비밀키를 이용하여 콘텐츠를 암호화하기 때문에 데이터 검색이 어렵다. 따라서, 검색 프라이버시를 보장하면서 유사 중복 데이터 검색의 정확도까지 보장하는 서비스의 구현은 기술적으로 어려운 실정이다. 본 연구에서는, 클라우드 환경에서 데이터 복호 없이 불필요한 검색 결과를 제거함으로써 검색서비스 품질을 제고하며, 동시에 효율성까지 개선된 유사 중복 검출 기법을 제안한다. 제안 기법은 검색 프라이버시와 콘텐츠 기밀성을 보장한다. 또한, 사용자 측면의 연산 비용 및 통신 절감을 제공하며, 빠른 검색 평가기능을 제공함으로써 유사 중복 검출 결과의 신뢰성을 보장한다. 실제 데이터를 통한 실험을 통해, 제안 기법은 기존 연구 대비 약 70.6%로 성능이 개선됨을 보인다.

유사구조를 갖는 XML 문서의 재구성을 위한 점진적인 시스템 설계 (Design of an Incremental System for Reconstruction of Similar Structured XML Documents)

  • 설진안;정계동;최영근
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2003년도 춘계학술발표논문집 (중)
    • /
    • pp.1031-1034
    • /
    • 2003
  • XML은 통합된 데이터 모델을 지원하기 위한 언어로, 특정 분야의 데이터에 대한 친환 및 통합의 필요성이 증대되어지고 있다. 일반적으로 데이터 교환은 다양한 공급자에 의해 독립적으로 운용 및 서비스됨으로서 개별적으로 데이터를 수집해야 하며 재배포 과정 또한 어렵다. 따라서 데이터 재배포 과정을 간소화하고 데이터 교환의 최적화를 위해 데이터 통합을 위한 재구성 방법이 필요하다. 본 논문에서는 특정 분야의 유사한 구조로 구성된 여러 문서를 입력받아 하나의 통합된 문서로 재구성할 수 있는 시스템을 제안한다. 제안된 시스템은 색인기법을 기반으로 추출된 정보를 하나의 문서로 매핑하기 위해 데이터 사전을 선계하고, 하나의 통합된 문서를 점진적인 과정을 통하여 재구성한다 따라서 재구성된 문서는 재배포 과정을 간소화할 수 있으며, 데이터 교환의 최적화는 물론 전자문서교환(EDI)에 있어서 정보교환 능력을 증가시킬 수 있다.

  • PDF

Acceleration sensor, and embedded system using location-aware

  • He, Wei;Nayel, Mohamed
    • 중소기업융합학회논문지
    • /
    • 제3권1호
    • /
    • pp.23-30
    • /
    • 2013
  • 본 논문에서는 실제 값과 같은 데이터의 불확실성과 유사성을 측정 할 수 있는 퍼지 엔트로피와 유사성 측정이 소개되고 있다. 퍼지 엔트로피와 유사성 측정의 디자인이 설명하고 입증했다. 획득 수단은 연산 프로세스에 적용되고 논의되었다. 이러한 의사 결정과 퍼지 게임 이론과 같은 데이터 정량화 결과의 연장도 논의되었다.

  • PDF

림프종 암의 정확한 분류를 위한 산술연산자 분류규칙의 결합 (Ensemble of Classification Rules with Arithmetic Operators for the Accurate Classification of Lymphoma Cancer)

  • 홍진혁;조성배
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 가을 학술발표논문집 Vol.31 No.2 (1)
    • /
    • pp.202-204
    • /
    • 2004
  • 앙상블은 다수의 분류기를 효과적으로 결합하여 분류의 성능을 향상시키는 대표적인 기술이다. 효과적인 앙상블을 위해서는 다양한 특성을 지닌 분류기를 확보하여야 한다. 기존의 앙상블은 개별 분류기의 결과를 바탕으로 분류기 사이의 의존성이나 유사성을 평가하여 분류기 결합을 시도하였다. 따라서 분류기 사이의 유사도의 정확한 측정에 한계를 지니고 있다. 본 연구에서는 이를 극복하기 위해서 다수의 산술연산자 기반 분류규칙을 유전자 프로그래밍을 이용하여 획득하고, 실제 표현형의 유사성을 측정한 후 이를 바탕으로 분류기를 결합한다. 생물정보학에서 많이 사용되는 유전자 데이터 중 하나인 림포마 암 데이터에 제안하는 방법을 적용하여 97% 수준의 높은 분류 성능과 해석 가능한 분류규칙을 획득하였다.

  • PDF

시계열 데이터베이스에서의 트렌드 유사도 탐색 (Trend Similarity Search In Time-Series Databases)

  • 이지은;윤종필
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1999년도 가을 학술발표논문집 Vol.26 No.2 (1)
    • /
    • pp.337-339
    • /
    • 1999
  • 최근 시계열 데이터에서 유사한 패턴을 탐색하는 기법이 다양한 응용분야에서 중요한 연구 주제로 자리잡고 있다. 본 논문에서는 시계열의 트랜드를 정의하고 유사한 트랜드를 가지 시계열을 찾음으로써 유사성의 개념을 좀 더 확장, 발전시켰다. 즉, 시계열에서의 트렌드를 두 개의 이동 평균 선의 관계를 통해 정의함으로써 두 시계열 간의 거리만으로 유사도를 측정했던 기존 연구와는 달리 좀 더 패턴을 가진 수열들을 찾고 이것을 기존의 DFT방법을 이용하여 대용량의 시계열 데이터베이스에서 사용자가 정의한 임계치 이하로 차이가 나는 시계열에 대해 유사 시계열로서 최종적으로 검색하게 된다.

  • PDF

의미적으로 확장된 문장 간 유사도를 이용한 한국어 텍스트 자동 요약 (Korean Text Automatic Summarization using Semantically Expanded Sentence Similarity)

  • 김희찬;이수원
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2014년도 추계학술발표대회
    • /
    • pp.841-844
    • /
    • 2014
  • 텍스트 자동 요약은 수많은 텍스트 데이터를 처리함에 있어 중요한 연구 분야이다. 이중 추출요약은 현재 가장 많이 연구가 되고 있는 자동 요약 분야이다. 본 논문은 추출 요약의 선두 연구인 TextRank는 문장 간 유사도를 계산할 때 문장 내 단어 간의 의미적 유사성을 충분히 고려하지 못하였다. 본 연구에서는 의미적 유사성을 고려한 새로운 단어 간 유사도 측정 방법을 제안한다. 추출된 문장 간 유사도는 그래프로 표현되며, TextRank의 랭킹 알고리즘과 동일한 랭킹 알고리즘을 사용하여 실험적으로 평가하였다. 그 결과 문장 간 유사성을 고려할 때 단어의 의미적 요소를 충분히 고려하여 정보의 유실을 최소화하여야 한다는 것을 실험 결과로써 확인할 수 있었다.

연속적 I/O와 클러스터 인덱싱 구조를 이용한 이미지 데이타 검색 연구 (A study on searching image by cluster indexing and sequential I/O)

  • 김진옥;황대준
    • 정보처리학회논문지D
    • /
    • 제9D권5호
    • /
    • pp.779-788
    • /
    • 2002
  • 이미지, 비디오, 오디오와 같은 멀티미디어 데이터들은 텍스트기반의 데이터에 비하여 대용량이고 비정형적인 특성때문에 검색이 어렵다. 또한 멀티미디어 데이터의 특징은 행렬이나 벡터의 형태로 표현되기 때문에 완전일치 검색이 아닌 유사 검색을 수행하여 원하는 이미지와 유사한 이미지를 검색해야 한다. 본 논문에서는 멀티미디어 데이터 검색에 클러스터링과 인덱싱 기법을 같이 적용하여 유사한 이미지는 인접 디스크에 클러스터하고 이 클러스터에 접근하는 인덱스를 구축함으로써 이미지 근처의 클러스터를 찾아 빠른 검색 결과를 제공하는 유사 검색방법을 제시한다. 본 논문에서는 트리 유사 구조의 인덱스 대신 해싱 방법을 이용하며 검색시 I/O 시간을 줄이기 위해 오브젝트를 가진 클러스터 위치를 찾는데 한번의 I/O를 사용하고 이 클러스터를 읽기 위해 연속적인 파일 I/O를 사용하여 클러스터를 찾는 비용을 최소화한다. 클러스터 인덱싱 접근은 클러스터링을 생성하는 알고리즘과 해싱 기법의 인덱싱을 이용함으로써 고차원 데이터가 갖는 차원의 문제를 해결하며 클러스터링 또는 인덱싱 만을 이용하는 내용기반의 이미지 검색보다 효율적인 검색 적합성을 보인다.

XML 문서의 효율적인 경로 통합 기법 (An Efficient Path Combining Strategy of XML Document)

  • 이범석;황병연
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2005년도 춘계학술발표대회
    • /
    • pp.19-22
    • /
    • 2005
  • XML은 비즈니스 메시징, 웹사이트 정보 통합, 그리고 카탈로그 통합 등의 분야에서 다양한 데이터를 표현하기 위한 포맷으로 급격하게 성장했다. 그러나 XML 데이터의 형태가 고정되어 있지 않기 때문에 전통적인 질의 방법이 항상 정확한 결과를 보여주지는 않는다. 또한 객체 지향 DBMS가 이 영역에 적합한지의 여부는 아직 명확하지 않다. 따라서 XML 데이터를 효율적으로 검색하기 위해 기존의 관계형 DBMS와 연계하여 구조 유사성을 기반으로 하는 검색 기법이 연구되고 있다. 그 중 문서, 경로, 단어로 구성된 3차원 비트맵 인덱스를 이용한 검색 시스템은 다른 XML 문서 검색 시스템보다 훨씬 빠른 수행 속도를 보여주지만, 3차원의 메모리 구조를 사용하여 많은 저장공간을 필요로 하는 단점이 있다. 본 논문에서는 XML 문서를 저장할 때 경로들 사이의 유사성을 이용하여 XML 데이터의 경로를 통합하는 기법에 대해 소개한다. 이렇게 통합된 경로를 이용하여 생성하는 3차원 비트맵 인덱스는 그 크기가 상당히 줄어들게 되고, 기존의 연구에서 보여주었던 문제점들을 해결하게 되었다.

  • PDF