• 제목/요약/키워드: relevant information retrieval

검색결과 186건 처리시간 0.021초

메타 검색에서 외래어 질의 정제 효과 (The Refinement Effect of Foreign Word Transliteration Query on Meta Search)

  • 이재성
    • 정보처리학회논문지B
    • /
    • 제15B권2호
    • /
    • pp.171-178
    • /
    • 2008
  • 문서에서 외래어가 일관되게 사용되지 않고 여러 이형태로 사용되고 있기 때문에, 정확한 질의어 일치를 지원하는 검색 시스템에서 외래어 질의로 문서를 검색하는데 어려움이 많다. 본 논문에서는 하나의 외래어로 질의할 경우, 원 질의어와 같은 뜻의 다양한 이형태 외래어 질의로 자동 확장하고 정제하여 더 많은 관련 문서를 손쉽게 검색할 수 있는 메타 검색 방법을 제안한다. 이 방법은 1차로 원 질의어에서 다양한 외래어 이형태를 통계적 방법으로 확장하고, 2차로 그 결과를 각 검색 엔진에게 질의하여 일정 개수 이상의 질의어가 문서에 나타났는지, 원 질의어의 문맥과 유사한 문맥에서 그 질의어가 쓰였는지를 비교하여, 같은 뜻의 유효한 외래어를 판별해 내고 이를 이용하여 검색할 수 있도록 한다. 실험 결과, 기준점으로 쓰인 1차로 만든 이형태로 검색했을 때 F값은 평균 38%이었으나, 제안된 방법인 2차로 정제된 질의어로 검색했을 때의 F값은 평균 81%로 매우 향상된 결과를 보였다.

A Study on Improving the Effectiveness of Information Retrieval Through P-norm, RF, LCAF

  • Kim, Young-cheon;Lee, Sung-joo
    • International Journal of Fuzzy Logic and Intelligent Systems
    • /
    • 제2권1호
    • /
    • pp.9-14
    • /
    • 2002
  • Boolean retrieval is simple and elegant. However, since there is no provision for term weighting, no ranking of the answer set is generated. As a result, the size of the output might be too large or too small. Relevance feedback is the most popular query reformulation strategy. in a relevance feedback cycle, the user is presented with a list of the retrieved documents and, after examining them, marks those which are relevant. In practice, only the top 10(or 20) ranked documents need to be examined. The main idea consists of selecting important terms, or expressions, attached to the documents that have been identified as relevant by the user, and of enhancing the importance of these terms in a new query formulation. The expected effect is that the new query will be moved towards the relevant documents and away from the non-relevant ones. Local analysis techniques are interesting because they take advantage of the local context provided with the query. In this regard, they seem more appropriate than global analysis techniques. In a local strategy, the documents retrieved for a given query q are examined at query time to determine terms for query expansion. This is similar to a relevance feedback cycle but might be done without assistance from the user.

Medical Image Retrieval with Relevance Feedback via Pairwise Constraint Propagation

  • Wu, Menglin;Chen, Qiang;Sun, Quansen
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제8권1호
    • /
    • pp.249-268
    • /
    • 2014
  • Relevance feedback is an effective tool to bridge the gap between superficial image contents and medically-relevant sense in content-based medical image retrieval. In this paper, we propose an interactive medical image search framework based on pairwise constraint propagation. The basic idea is to obtain pairwise constraints from user feedback and propagate them to the entire image set to reconstruct the similarity matrix, and then rank medical images on this new manifold. In contrast to most of the algorithms that only concern manifold structure, the proposed method integrates pairwise constraint information in a feedback procedure and resolves the small sample size and the asymmetrical training typically in relevance feedback. We also introduce a long-term feedback strategy for our retrieval tasks. Experiments on two medical image datasets indicate the proposed approach can significantly improve the performance of medical image retrieval. The experiments also indicate that the proposed approach outperforms previous relevance feedback models.

칼라 히스토그램 기반 영상 검색을 위한 효율적인 칼라 특징 정보 추출 기법 (Efficient Color Feature Information Extraction Method for Color Histogram-based Image Retrieval)

  • 이호영;김영태;김희수;배태면;하영호
    • 한국통신학회논문지
    • /
    • 제25권8B호
    • /
    • pp.1413-1423
    • /
    • 2000
  • 칼라 히스토그램 방법은 영상 획득 시 광원의 위치나 광원색의 변화에 따라서 칼라 분포가 변하게 되어 동일한 내용을 담고 있는 영상이라 할 지라도 검색 효율이 떨어지는 단점을 가진다 그래석 본 논문에서는 이러한 문제점을 해결하기 위해 조명의 변화가 배제된 칼라 정보를 추출한 후 이에 대한 칼라 히스토그램을 이용한 영상 검색 방법을 제안한다 제안한 방법은 생동폭 조절을 통하여 광원의 위치 변화 때문에 발생하는 음영으로 인한 색 분별력 저하를 방지하였으며 물체의 확산 반사 성분만을 이용한 gray world 가정 기반의 광원색 제거 방법으로 조명 조건 변화가 배제된 칼라 정보를 추출하였다 실험 결과 추출된 칼라정보를 이용한히스토그램 방법이 조명의 영향이 배제되지 않은 입력 영상의 칼라 정보를 이용한 히스토그램 방법보다 높은 검색 효율을 보임을 확인 할 수 있었다.

  • PDF

인터넷에서 잠재적 의미 분석을 이용한 지능적 정보 검색 (Intelligne information retrieval using latent semantic analysis on the internet)

  • 임재현;김영찬
    • 한국통신학회논문지
    • /
    • 제22권8호
    • /
    • pp.1782-1789
    • /
    • 1997
  • 인터넷에서 분산 정보를 검색하는 대부분의 시스템들은 사용자가 요구하는 검색 용어의 의미를 반영하지 못해 관련된 정보를 정확히 찾지 못하고 있다. 본 논문에서는 정보 검색 성능을 향상시키는 방안으로 검색 용어의 의미를 반영할 수 있는 용어 분포에 기반한 자동화된 질의어 확장을 제안한다. 먼저, 사용자가 부여한 질의어와 전체 문서에서 용어의 중요도를 반영한 가중치(weight)를 계산하고, LSI의 SVD기법을 이용해 모든 문서에서 질의어와 유사하게 출현하는 용어의 분포를 측정하여, 이들 수치와 질의어 용어의 유사성을 측정하였다. 또한 자동적으로 추가할 용어를 줄이기 위한 방안을 연구하였으며 본 논문에서 제안한 방법을 사용해 검색 성능을 평가하였다.

  • PDF

A New Approach of Domain Dictionary Generation

  • Xi, Su Mei;Cho, Young-Im;Gao, Qian
    • International Journal of Fuzzy Logic and Intelligent Systems
    • /
    • 제12권1호
    • /
    • pp.15-19
    • /
    • 2012
  • A Domain Dictionary generation algorithm based on pseudo feedback model is presented in this paper. This algorithm can increase the precision of domain dictionary generation algorithm. The generation of Domain Dictionary is regarded as a domain term retrieval process: Assume that top N strings in the original retrieval result set are relevant to C, append these strings into the dictionary, retrieval again. Iterate the process until a predefined number of domain terms have been generated. Experiments upon corpus show that the precision of pseudo feedback model based algorithm is much higher than existing algorithms.

내용기반 검색을 이용한 선박매매 정보추출 에이전트의 구현에 관한 연구 (A Study on the Implementation of Information Extraction Agency for Ship Sale and Purchase using Content Based Retrieval)

  • 하창승;정이상
    • 한국컴퓨터정보학회논문지
    • /
    • 제12권1호
    • /
    • pp.43-50
    • /
    • 2007
  • 정보 추출 작업에서의 처리지연은 인터넷 문서의 분류나 표현규칙이 아직 표준화되어 있지 않아 특정 요소에 대한 사용자의 정보 요구를 정확하게 인식하지 못하기 때문이다. 또한 정보추출에 wrapper 규칙을 사용하는 경우 같은 규칙을 서로 다른 문서에는 적용할 수 없는 확장성의 결여와 같은 문제점이 있다. 선박매매와 같이 선박의 거래를 위해 선박가격, 선박 제원, 인도 장소, 검사장소 등의 판매정보만으로도 거래가 가능한 경우에는 선박매매와 관련된 온톨로지(Ontology)를 이용하여 내용기반 검색 (content based retrieval)을 수행하면 선박 매매에 필요한 정보를 선택적으로 추출할 수 있다. 이 방법은 사이트마다 개별적으로 wrapper를 구성하거나 인터넷 문서에서 불필요한 정보를 단계적으로 제거해 나가는 방법을 개선하여 정보 추출 과정을 단순화시키는 이점을 제공한다.

  • PDF

재사용 부품 검색 시스템에서 객체기반 시소러스를 이용한 패싯 질의의 확장 (Facet Query Expansion with an Object-Based Thesaurus in Reusable Component Retrieval Systems)

  • 최재훈;김기헌;양재동;이동길
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제27권2호
    • /
    • pp.168-179
    • /
    • 2000
  • 패싯기반 재사용 부품 검색 시스템에서 사용자가 검색하고자 하는 부품들의 특징은 일반적으로 패싯 질의에 의해 명시된다. 본 논문에서는 객체기반 시소러스를 이용하여 사용자의 검색 요구를 명확히 표현할 수 있는 확장된 패싯 질의를 정형화하며, 이 질의를 평가할 수 있는 부품 검색 시스템을 설계하고 구현한다. 시스템의 정확한 검색을 위해 사용자 질의는 검색하고자 하는 부품들의 특징을 구체적으로 명시할 수 있어야 한다. 그러나, 기존의 패싯 질의는 단지 사용자에 의해 직접 입력된 패싯 값들의 나열로만 표현되기 때문에 구체적인 사용자 의도를 자연스럽게 표현할 수 없다는 단점을 가지고 있다. 본 논문에서 정형화되는 확장된 패싯 질의는 이 단점을 보완하기 위해 퍼지 불리언 연산자와 객체기반 시소러스를 이용한다. 전자는 패싯 질의와 관련 부품에 대한 퍼지 연관 정도를 논리적으로 표현할 수 있게 하며, 후자는 사용자가 구체적인 의미의 패싯 값들을 질의에 쉽게 이용할 수 있도록 한다. 즉, 사용자는 시소러스 질의를 통해 자신의 의도와 의미적으로 일치하는 패싯 값들을 그 퍼지 관련 정도와 함께 시소러스로부터 효과적으로 탐색할 수 있으며, 사용자가 요구할 경우 검색 시스템은 이들을 이용하여 퍼지 패싯 질의를 자동으로 구성할 수도 있다.

  • PDF

분야연상어를 이용한 화제의 계속성과 전환성을 추적하는 단락분할 방법 (Passage Retrieval based on Tracing Topic Continuity and Transition by Using Field-Associated Term)

  • 이상곤
    • 정보처리학회논문지B
    • /
    • 제10B권1호
    • /
    • pp.57-66
    • /
    • 2003
  • 복수의 화제가 혼합되어 있는 문서에서 각 화제의 경계부분을 구분하여 결정하는 기술을 단락분할이라 한다. 이 기술은 정보검색의 분야에만 한정되지 않고 다양한 분야에서 중요한 역할을 담당할 기술이다. 잘 정의된 분야체계에 따라 구축된 분야연상어를 이용하여 단락분할을 시도한다. 분야연상어란 특정한 분야를 정확하게 연상할 수 있는 단어로서 잘 분류된 문서 컬렉션에서 구축할 수 있다. 이 분야연상어를 이용하여 문서를 관련된 분야별로 추출하여 의미기반 단락추출 방법을 제안한다. 화제의 계속성에 주목하여 분야연상어의 수준(범위)이나 연속출현성에 의해 계산된 계속도에 의해 화제의 실마리를 추적하고, 화제의 전환성을 고려한 방법을 제안한다. 문서 내 각 화제의 단락구분을 명확히 하여, 단락을 화제분야별로 추출하는 방법을 제안한다. 일본어 50문서를 실험한 결과 82%의 정확율과 63%의 재현율을 얻어 실용성을 기대할 수 있었고, 한국어에 적용하여도 좋을 것으로 예상한다.

색상특징과 웨이블렛 기반의 특징을 이용한 영상 검색 (Image Retrieval Using the Color Feature and the Wavelet-Based Feature)

  • 박종현;박순영;조완현
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 1999년도 추계종합학술대회 논문집
    • /
    • pp.487-490
    • /
    • 1999
  • In this paper we propose an efficient content-based image retrieval method using the color and wavelet based features. The color features are extracted from color histograms of the global image and the wavelet based features are extracted from the invariant moments of the high-pass band image through the spatial-frequency analysis of the wavelet transform. The proposed algorithm, called color and wavelet features based query(CWBQ), is composed of two-step query operations for efficient image retrieval: the coarse level filtering operation and the fine level matching operation. In the first filtering operation, the color histogram feature is used to filter out the dissimilar images quickly from a large image database. The second matching operation applies the wavelet based feature to the retained set of images to retrieve all relevant images successfully. The experimental results show that the proposed algorithm yields more improved retrieval accuracy with computationally efficiency than the previous methods.

  • PDF