• 제목/요약/키워드: 검색어

검색결과 1,262건 처리시간 0.027초

DBMS을 활용한 파일 검색엔진 연구 (A Study on File Search Engine Based on DBMS)

  • 김형석;유헌창
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2016년도 추계학술발표대회
    • /
    • pp.548-551
    • /
    • 2016
  • 기존 그리드 기반의 전통적인 RDBMS는 비구조적 데이터에 대한 색인이 지원되지 않았다. 이러한 제약 조건들로 인해 파일 문서 및 비 구조화된 데이터의 검색 엔진으로는 부적합하였다. 최근에 다양한 검색 오픈소스(Solr, Lucene)등으로 검색 엔진이 개발되어 활용되고 있지만, 검색한 결과와 기존 데이터의 연동이 쉽지 않고 구조 변경이 어려우며, 사용자의 다양한 요구 사항 수용이 쉽지 않은 단점을 가지고 있다. 따라서 본 연구에서는 빠른 검색을 위한 색인 (index) 최적화와 대용량 데이터 처리를 위한 파티션 기반 데이터의 분할 및 정복 (divide and conquer) 처리, 이중화된 검색어 색인 기능을 구현하였다. 또한 동의어 사전을 구축하여 연관 관계 분석이 가능하도록 DB를 구축하여 검색어와 동의어의 상호 관계성을 유지하였으며 오픈 소스보다 발전한 형태의 검색 엔진을 개발하는 것을 목표로 하였다. 본 연구를 위해 약 400만건 이상의 다양한 포맷 (Ms-office, Hwp, Pdf, Text)등의 파일 문서를 샘플로 실험을 진행하였다.

재미 감성 주제 온톨로지를 이용한 질의어 확장 멀티미디어 데이터 검색 시스템 구현 (Implementation of Query Expansion Multimedia Data Retrieval System using "FUN" Based Ontology of Emotion)

  • 이정송;변동률;박순철
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2010년도 한국컴퓨터종합학술대회논문집 Vol.37 No.1(C)
    • /
    • pp.279-284
    • /
    • 2010
  • 최근 컴퓨터와 네트워크의 기술 발달로 멀티미디어 데이터가 폭발적으로 증가하고 있다. 따라서 정보검색 시스템도 텍스트 데이터 위주에서 벗어나 멀티미디어 데이터 검색이 큰 비중을 차지하고 있다. 또한 멀티미디어 데이터 질의어처리도 기술적인 변화와 함께 다양한 질의어 확장으로 검색의 정확성을 높이고 있다. 본 논문에서는 인간의 감성에 대한 '재미' 주제 온톨로지를 구축하여 질의어 확장에 응용하였고, 한편의 동영상에서 재미 요소를 찾아내는 멀티미디어 데이터 검색 시스템을 구축하였다. 온톨로지 구축은 한글 워드넷(KorLex)에서 "재미"라는 특정 감소 요소의 의미 계층 구조를 파악하고 토픽맵을 이용하여 구축하였다. 또한, 온톨로지에 정의된 용어들 사이의 가중치는 실시간으로 계산하여 질의어를 확장에 적용하였으며, 따라서 검색의 효율성과 질을 높였다. 검색방법은 사용자가 질의어를 직접 입력하는 텍스트 입력 검색과 온톨로지 구조를 이용한 GUI 인터페이스 검색방법으로 나누어 사용자의 편의성을 증대시켰다.

  • PDF

정보검색에서 사용자 검색 패턴을 이용한 질의 확장 (Query Expansion Using User Search Pattern in Information Retrieval)

  • 천우관;김영도;정인정
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2001년도 춘계학술발표논문집 (하)
    • /
    • pp.771-774
    • /
    • 2001
  • 정보검색에서 가장 많이 사용되는 불리언(Boolean)검색에서는 키워드 일치에 의해서만 검색하는 단점을 가지고 있다. 이를 보완하기 위해 다양한 정보원에서 추출한 관련 용어들을 원질의어에 첨가하여 검색의 효율을 높이기 위한 질의 확장 방법들이 모색되어 왔다. 본 논문에서는 질의 확장을 위하여 사용자가 검색에 사용하였던 질의어들의 연속성을 찾아내어 첨가할 용어를 선택하고 질의 확장을 하는 방법을 제시한다. 사용자가 입력한 질의어의 연속성을 찾아내는 방법으로는 데이터 마이닝 기법중 연관 규칙 탐사 방법을 이용한다. 실험은 현재 구축된 정보통신 기술기준 정도시스템에서 사용자들이 검색한 키워드 정보를 이용하였으며 사용자 검색 패턴(USP) 정보를 이용함으로써 사용자가 검색하고자 하는 질의어와 좀더 연관성 있는 용어로 확장하여 사용자 중심적 결과를 얻을 수 있다.

  • PDF

의미적 언어자원을 활용한 과학기술정보 검색 서비스 개선 (Improvement of Science and Technology Information Retrieval Service using Semantic Language Resource)

  • 조민희;최성필;최호섭;윤화묵
    • 한국콘텐츠학회:학술대회논문집
    • /
    • 한국콘텐츠학회 2006년도 추계 종합학술대회 논문집
    • /
    • pp.570-574
    • /
    • 2006
  • 현재 한국과학기술정보연구원의 과학기술정보 포털 서비스는 방대한 전문용어를 포함한 문서를 서비스하고 있으므로 포괄적인 질의어만으로는 사용자의 의도를 반영한 검색 결과를 얻을 수 없다. 따라서 본 연구에서는 의미적 언어자원으로 알려진 사용자 어휘지능망(U-WIN)의 동의어, 유의어, 관련어, 하위어, 상위어 관계 정보를 활용하여 검색어 자동 추천, 관련 단어 제시, 질의어 확장 등을 서비스에 반영하는 사용자 중심의 검색 서비스 요소를 제안한다. 이러한 어휘지능망의 의미 관계 정보를 활용한 서비스 요소를 통해 현재의 과학기술정보서비스의 검색 만족도를 향상시키는 동시에 사용자가 요구하는 정보를 빠르고 정확하게 검색할 수 있는 서비스 환경으로 개선시키고자 한다.

  • PDF

유의어 사전 기반 환경기술 검색 시스템 설계 (Design of environmental technology search system using synonym dictionary)

  • ;;구영현;유성준
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송∙미디어공학회 2020년도 하계학술대회
    • /
    • pp.582-586
    • /
    • 2020
  • 국가기후기술정보시스템은 국내 환경기술과 국외의 수요기술 정보를 제공하는 검색 시스템이다. 그러나 기존의 시스템은 유사한 뜻을 가진 단일 단어와 복수 단어들을 모두 식별하지 못하기에 유의어를 입력했을 경우 검색 결과가 다르다. 이런 문제점을 해결하기 위해 본 연구에서는 유의어 사전을 기반으로한 환경기술 검색 시스템을 제안한다. 이 시스템은 Word2vec 모델과 HDBSCAN(Hierarchical Density-Based Spatial Clustering of Application with Noise) 알고리즘을 이용해 유의어 사전을 구축한다. Word2vec 모델을 이용해 한국어와 영어 위키백과 코퍼스에 대해 형태소 분석을 진행한 후 단일 단어와 복수 단어를 포함한 단어를 추출하고 벡터화를 진행한다. 그 다음 HDBSCAN 알고리즘을 이용해 벡터화된 단어를 군집화 해주고 유의어를 추출한다. 기존의 Word2vec 모델이 모든 단어 간의 거리를 계산하고 유의어를 추출하는 과정과 대비하면 시간이 단축되는 역할을 한다. 추출한 유의어를 통합해 유의어 사전을 구축한다. 국가기후기술정보시스템에서 제공하는 국내외 기술정보, 기술정보 키워드와 구축한 유의어 사전을 Multi-filter를 제공하는 Elasticsearch에 적용해 최종적으로 유의어를 식별할 수 있는 환경기술 검색 시스템을 제안한다.

  • PDF

지식기반 의미 메타 검색엔진 (Knowledge-based Semantic Meta-Search Engine)

  • 이인근;손세호;권순학
    • 한국지능시스템학회논문지
    • /
    • 제14권6호
    • /
    • pp.737-744
    • /
    • 2004
  • 웹으로부터 사용자가 원하는 정보에 잘 부응하는 정보를 추출하는 것은 검색엔진이 갖추어야 할 기본적 요소라 할 수 있다. 그러나 질의어와의 패턴 매칭 방식에 의존하는 기존의 대부분의 검색엔진은 질의어가 갖는 애매성으로 인하여 사용자의 요구에 부합하는 검색결과를 제공하기가 쉽지 않다는 단점을 지니고 있다. 이를 극복하기 위하여 본 논문에서는 다음과 같은 5가지 과정, 즉, (i) 질의어 형성, (ii) 질의어 확장, (iii) 검색, (iv) 순위 재생성 및 (v) 지식베이스로 구성되는 지식기반 의미 메타 검색엔진의 기본 구조를 제안한다 영어로 구현된 웹 문서에 대한 모의실험을 통하여 본 논문에서 제안된 지식기반 의미 메타 검색엔진이 기존의 검색엔진(구글)을 사용하여 얻은 결과보다 좋은 결과를 보임을 확인할 수 있었다.

웹 검색질의어 분석을 통한 사회·문화적 특성에 관한 연구 (A Study on the Social and Cultural Characteristics of Web Queries)

  • 김성희
    • 정보관리연구
    • /
    • 제42권4호
    • /
    • pp.155-174
    • /
    • 2011
  • 본 연구에서는 인터넷 정보 검색엔진으로부터 2007년부터 2009년까지 3년 동안 인기 검색어를 주제별로 분석함으로써 이용자의 검색어들이 시간이 흐름에 따라 주제별 변화양상을 살펴보았다. 또한 2009년도 네이버에서 제공하고 있는 상위 500개의 인기 검색어를 이용자의 검색의도에 따라 정보획득형(informational), 탐색형(navigational), 트랜잭션(transactional)형태로 구분하여 특성을 분석하였다. 그 결과 시간의 흐름에 따라 이용자의 관심 주제가 다르게 나타남을 알 수 있었다. 또한 이용자의 검색의도에 따라 인기 검색어를 분류한 결과 정보획득형 82%, 탐색형 10.8%, 트랜잭션형 7.2%로 나타났다. 이러한 연구는 미래의 검색엔진 또는 포털시스템에서 주제별 콘텐트를 구축하여 제공하는 정책수립에도 도움이 될 것으로 기대한다. 더 나아가서 이용자들의 사회적, 문화적 관심사를 분석함으로써 인기키워드의 주제 분석을 통해 나타난 사회 문화적 특성을 파악하는 데 도움이 될 수 있을 것이다.

인접한 단어와 키워드 주제어 정보에 기반한 유사 문헌 검색 시스템 개발 (Development of Similar Bibliographic Retrieval System based on Neighboring Words and Keyword Topic Information)

  • 김광영;곽승진
    • 한국도서관정보학회지
    • /
    • 제40권3호
    • /
    • pp.367-387
    • /
    • 2009
  • 유사 문헌 검색 시스템은 추출된 색인어 중에서 어떤 것을 선택하는가에 따라 검색 결과에 많은 차이점이 발생한다. 본 연구에서는 추출된 후보 색인어의 선정의 오류를 최소한으로 하는 방법을 제공한다. 본 연구에서는 유사문헌에서 추출된 후보 색인어들을 이용하여 인접한 단어들의 정보와 추출된 키워드 주제어 정보를 이용하였다. 그리고 관련 저자들 정보와 검색 결과의 재순위화 방법을 이용하여 보다 정확도가 높은 유사 문헌 검색 시스템을 개발하였다. 본 논문에서는 과학기술 학회마을 데이터베이스를 이용하여 실험하였다. 실험과 사용자 평가를 통해서 유사 문헌 검색 시스템의 성능을 입증하였다.

  • PDF

색인어 말뭉치 처리를 기반으로 한 웹 정보검색 시스템의 설계 (Design of WWW IR System Based on Keyword Clustering Architecture)

  • 송점동;이정현;최준혁
    • 정보학연구
    • /
    • 제1권1호
    • /
    • pp.13-26
    • /
    • 1998
  • 대부분의 정보검색시스템들은 부적절한 색인어들에 의해 가끔 사용자의 의도에 맞지 않는 전혀 다른 검색 결과가 나타난다. 그것은 시스템이 색인어들을 검색하기 위해 그 의미가 아닌, 단지 용어로서만 고려하기 때문이다. 검색 정확도의 증진을 위해 색인어는 연관된 용어 사용 빈도와 역 빈도 사용으로 검색되고 동시 발생어는 원시 문서로부터 추출된다. 결과적으로 색인어는 계산된 상호 정보들을 사용함으로써 그들의 세맨틱에 의해 클러스팅된다. 이 논문은 재현율의 감소없이 클라이언트 사용자 모듈로부터 피드백에 따라 세분된 세맨틱 정보를 사용하여 부적절한 검색 결과를 거절함으로써 검색 효율을 높일 수 있도록 설계하였다.

  • PDF

질의어 확장에 기반을 둔 클러스터링 및 필터링 문서의 검색효율 제고에 관한 연구 (A Study on the Improvement of Retrieval Effectiveness to Clustered and Filtered Document through Query Expansion)

  • 노동조
    • 한국비블리아학회지
    • /
    • 제14권1호
    • /
    • pp.219-230
    • /
    • 2003
  • 인터넷을 비롯한 대다수의 정보검색에서 사용자가 느끼는 공통된 어려움중의 하나는 검색결과가 너무 많다는 것이다. 본 연구는 검색결과를 줄이는 방법의 하나로써 검색 문헌에 대한 정제 방법에 대하여 논의한 것이다. 궁극적으로 종전의 검색시스템에서 제대로 고려하지 않은 개념망을 통한 질의어 확장과 확장 질의어와 전처리된 문서와의 유사도 측정을 통한 문서의 선택, 백과사전 정보에 의한 의미 확장과 클러스터링, 필터링 기법 등이 정보검색의 효율을 향상시키는데 효과적인 방안임을 제안한다.

  • PDF