• 제목/요약/키워드: 검색 엔진

검색결과 825건 처리시간 0.028초

오디세우스/Parallel-OOSQL: 오디세우스 정보검색용 밀결합 DBMS를 사용한 병렬 정보 검색 엔진 (Odysseus/Parallel-OOSQL: A Parallel Search Engine using the Odysseus DBMS Tightly-Coupled with IR Capability)

  • 류재준;황규영;이재길;권혁윤;김이른;허준석;이기훈
    • 한국정보과학회논문지:컴퓨팅의 실제 및 레터
    • /
    • 제14권4호
    • /
    • pp.412-429
    • /
    • 2008
  • 최근 들어 인터넷의 성장으로 인하여 문서의 양이 기하급수적으로 증가함에 따라, 대용량의 문서를 마르게 검색 할 수 있는 병렬 정보 검색 엔진에 대한 중요성이 더욱 대두되고 있다. 병렬 정보 검색 엔진을 구현하기 위하여서는 역 색인을 분할하고, 분할된 역 색인을 통하여 병렬적으로 검색하는 것이 필요하다. 역 색인을 분할하는 기존 방법으로는 1) 문서 식별자 분할 방법과 2) 식별자 분할 방법이 있다. 그러나 각 분할 방법은 다음과 같은 단점들을 가지고 있다. 문서 식별자 분할 방법은 문서의 추가가 용이하고 처리량(throughput)이 높은 반면에 top-k 질의 처리 성능이 좋지 않다. 그리고 식별자 분할 방법은 top-k 질의 처리 성능이 좋은 반면에 문서의 추가가 어렵고 처리량이 낮다. 본 논문에서는 이러한 단점들을 해결하기 위하여 혼합 분할 방법을 제안하고 이를 정보 검색 기능과 밀결합된 DBMS인 오디세우스에 실현한 병렬 정보 검색 엔진을 설계하고 구현한다. 먼저, 제안된 병렬 정보 검색 엔진인 오디세우스/parallel-OOSQL의 아키텍쳐를 설명한다. 그리고 체계적인 실험을 통하여 제안된 시스템의 유용성을 보인다. 실험 결과, 문서 식별자 분할 방법은 질의 처리 시간이 역 색인 분할의 블록의 개수에 근사적으로 역 비례함을 보였으며, 키워드 식별자 분할 방법은 top-k 질의 처리에 좋은 성능을 보였다. 본 논문에서 제안된 병렬 정보 검색 엔진은 세 가지 분할 방법을 모두 제공하기 때문에 응용 환경에 따라 분할 방법을 커스터마이즈함으로써 항상 좋은 성능을 낼 수 있다. 오디세우스/parallel-OOSQL 병렬 정보 검색 엔진은 각 슬레이브 노드 당 1억 건의 웹 문서를, 시스템 전체로는 수십억 건의 웹 문서를 인덱스하여 저장하고 질의를 처리할 수 있다.

인터넷 탐색엔진의 분류체계에 관한 연구 (A study on the classification scheme of the Internet search engine)

  • 김영보
    • 한국정보관리학회:학술대회논문집
    • /
    • 한국정보관리학회 1997년도 제4회 학술대회 논문집
    • /
    • pp.99-102
    • /
    • 1997
  • 인터넷 도구 중의 하나인 탐색엔진은 월드 와이드 웹의 보편화와 함께 중요한 매개체로 자리잡고 있다. 탐색엔진은 서비스 제공형태에 의해 크게 분류체계 제공형과 주제어 검색 제공형으로 나뉘어 지는데, 분류체계 제공형 엔진에 대한 연구는 그 이용빈도에 비해 부족한 편이다. 따라서, 인터넷 이용자의 탐색노력을 줄이는데 보다 유용한 분류체계 제공형 엔진에 대한 연구가 필요하다. 본 연구에서는 분류체계 제공에 중점을 두고 있는 국내외의 대표적인 탐색엔진 6종과 문헌 분류이론인 KDC와 DDC를 선정하여 그 분류체계를 비교ㆍ분석하여 적합한 형태의 탐색엔진 분류체계의 모형을 구축하고자 한다.

  • PDF

개념 검색어 확장을 통해 질의 형식화를 도와주는 “개념 마법사”의 설계 및 구현 (Design and Implementation of “Concept Wizard” Supporting Query Formulation with Concept Term Expansion)

  • 강현규
    • 정보처리학회논문지B
    • /
    • 제9B권4호
    • /
    • pp.437-444
    • /
    • 2002
  • 정보 검색 시스템이나 웹(Web)이 방대해지고 초보적 수준의 사용자들이 늘어남에 따라 간단한 조작만으로 원하는 정보를 얻어낼 수 있는 도구의 개발이 점점 중요해지고 있다. 일반적으로 정보 검색 시스템이나 검색 엔진을 통한 질의 입력 방법이나 연산자들이 매우 다양하며 일반 사용자들은 질의를 형식화 하는 것이 쉽지 않다. 본 논문은 일반 사용자가 정보 검색 시스템이나 검색 엔진을 통하여 정보를 검색하기 위한 검색어 형식화를 도와주는 개념 마법사를 제안한다. 본 논문에서 제시한 개념 마법사는 실세계 지식의 부족을 시소러스를 이용하여 인터렉티브(interactive) 하게 제시하고 웹을 기반으로 하는 플러그인(plug-in)으로 제공함으로써 유용성 및 확장성이 크다.

PVR에서 실시간 브라우징을 위한 클러스터링 (Image Clustering for Real-time Browsing in DTV PVR)

  • 장경훈;이동호
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2001년도 제14회 신호처리 합동 학술대회 논문집
    • /
    • pp.19-22
    • /
    • 2001
  • 현재 수 많은 공중파 채널을 비롯하여 각종 케이블 TV 와 위성 TV 등의 채널이 대량으로 디지털화 되어 가고 있지만 파국의 디지털 TV 의 규격은 MPEG2 라는 표준 규격으로 통일 되어 우리에게 전해지고 있다. 이런 수많은 동영상 정보들은 디지털이라는 특성상 기록과 보관이 용이하므로 사용자는 수 많은 정보를 저장, 관리 할 수 있게 되었다. 따라서 방대한 데이터의 바다 속에서 원하는 정보를 검색하는데 있어서 기존의 방식 즉 일정 속도를 가진 검색 엔진을 사용하는 것 보다는 MPEG2 규격의 표준들을 보다 효율적으로 이용하여 사용자들이 동영상 정보 중에 이동하기 원하는 부분으로 이동하기 위한 비선형 검색엔진을 소개한다. 이를 이용한 PVR(Penonal Video Recorder)은 현재 hardware 부분은 완료되었고 일부 software 엔진을 적용하여 개발 중이다.

  • PDF

K-최근접 이웃 추천 엔진에서의 벡터 유사도 사용에 대한 실험적 분석 (Empirical Analysis of K-Nearest Neighbor Recommendation Engine using Vector Similarity)

  • 김혜재;손기락
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2001년도 봄 학술발표논문집 Vol.28 No.1 (B)
    • /
    • pp.103-105
    • /
    • 2001
  • 인터넷 사용 인구의 폭증으로 인터넷 사이트가 경쟁적으로 유용한 각종 정보를 사용자들에게 제공하여 보다 많은 수의 회원을 확보하기 위해 노력하고 있지만 여러 사이트를 동시에 사용하고 있는 대부분의 인터넷 사용자들에게는 각 사이트에서 날아드는 정보를 매번 일일이 검색해야 하는 일이 여간 번거롭지 않을 뿐만 아니라 이런 무분별하고 획일적인 정보 서비스는 오히려 사용자들의 인터넷 사용을 불편하게 하며 더욱이 그 내용이 관심 밖의 것이 경우 네트워크의 효율적인 사용을 저해하는 정보공해에 지나지 않게 된다. 추천엔진은 기본으로 끊임없이 유입되는 다량의 정보 중에서 필요한 것을 추천해 주는 것이다. 이에 본 논문에서는 사용자들에게 필요한 정보만을 효율적으로 전달 해주기 위해서 먼저 개인화된 정보의 전달을 위해 사용자의취향을 파악하여 선택 가능성이 높은 항목을 예측할 수 있어야 한다. 그리고 사용자와 가까운 K 명의 사용자들을 효율적으로 검색하기 위해서 K-최근접 이웃 방식을 사용하고 인덱싱을 사용할 수 있는 세가지 벡터 유사도를 기존의 피어슨 상관계수(Pearson Correlation)와 비교하여 제안한다. 이를 통해 정보의 효율적인 제공방법, 즉 일반적인 검색으로 인한 정보의 제공이 아닌 일반 사용자들의 추천에 의해 정보를 제공하는 K-최근접 이웃 추천 엔진을 세가지 벡터 유사도를 이용해서 분석한다.

  • PDF

URL 리다이렉션 스팸 탐지 기법 (Detecting Method for URL Redirection Spam)

  • 백지현;김성권
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2007년도 가을 학술발표논문집 Vol.34 No.2 (D)
    • /
    • pp.540-544
    • /
    • 2007
  • 인터넷의 급속한 성장은 사람들의 정보 습득 방식에 큰 변화를 주었다. 인터넷 이용자들은 과거와 비교도 할 수 없을 만큼의 많은 지식을 손쉽게 접할 수 있게 되었다. 하지만, 그로 인해 여러 가지 문제점들이 생겨나게 됐는데, 웹 스팸도 그 중 하나이다. 웹 스팸은 웹을 통한 불법적인 활동으로 이득을 보려는 활동을 통칭할 수 있다. 웹 스팸은 검색 엔진 결과 리스트의 순위를 올리기 위해 사용되는 것이 대부분이지만, 점점 검색 엔진 결과 리스트의 순위와 관련 없는 것들에서도 나타나 생겨나고 있다. 웹 스팸은 종류도 다양할뿐더러, 아직까지 모든 웹 스팸을 예방할 확실한 방법이 제시되지 못하고 있다. 이 논문에서는 여러 웹 스팸 중 페이지-하이딩 스팸에 속하는 URL 리다이렉션에 대해 다루고자 한다. 다른 웹 스팸과 마찬가지로, 현재까지 자동적으로 URL 리다이렉션을 탐지하는 방법이 제시되지 못하고 있는 실정이다. 이 논문에서는 검색 엔진 결과 리스트의 순위를 사용하여 URL 리다이렉션을 탐지 기법을 제안하고자 한다.

  • PDF

상품평 데이터와 웹 검색엔진을 이용한 상품별 평가항목 자동 추출 (Automatic Product Attribute Extraction from Reviews Using Web Search Engine)

  • 이우철;이현아
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2008년도 춘계학술발표대회
    • /
    • pp.107-110
    • /
    • 2008
  • 상품평은 인터넷 쇼핑 이용자들의 최종 구매결정에 큰 영향을 미치는 것으로 알려져 있다. 많은 쇼핑몰에서 상품평 활성화를 위해 노력하고 있지만, 상품평을 모으는 것에만 주력할 뿐 기존에 수집된 상품평을 제공하는 방법에 있어서는 원시적인 수준에 그치고 있다. 상품평을 좀 더 효율적으로 제공하려면 사용자들이 상품평에서 찾게 될 평가항목들을 미리 예측하여 그 항목에 따라 상품평을 분류/요약해서 제공하는 방법을 생각할 수 있다. 본 논문에서는 상품평과 웹 검색엔진을 이용하여 각 상품별 평가항목들을 자동으로 추출하는 방법을 제안한다. 상품평 데이터의 특성상 노이즈가 많기 때문에 먼저 데이터를 정제하고, 정제된 상품평 데이터를 형태소 분석하여 후보명사들을 선택한다. 선택된 후보명사를 웹 검색엔진에 질의하여 반환된 결과 값으로 상품 카테고리와 후보명사 간 연관도를 계산하여 평가항목을 추출한다. 실험은 5개 상품 카테고리의 170,294개 실제 상품평을 대상으로 각 카테고리별 평가항목을 추출하였다.

인터넷 www검색엔진 비교 평가

  • 신동한
    • 디지털콘텐츠
    • /
    • 2호통권33호
    • /
    • pp.63-66
    • /
    • 1996
  • 인터넷에 산재해 있는 각종정보들을 모아 주제별로 게재하며, 이번호에는 본격적으로 주제별 데이터베이스 검색에 들어가기에 앞서 개요를 살펴보았다.

  • PDF

검색어의 연관법칙 (ARMS : Association Rule for sMall Set)

  • 문상준;최재걸
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 가을 학술발표논문집 Vol.31 No.2 (2)
    • /
    • pp.10-12
    • /
    • 2004
  • 검색엔진에 사용자가 입력한 검색어를 분석하면 상호 연관이 있는 검색어들을 찾아낼 수 있다. 검색어들간의 상호 연관성을 찾기 위해서 데이타 마이닝 분야의 연관법칙을 위한 알고리즘을 적용하였다. 그러나 이 알고리즘들은 모두 일정 횟수 이상 검색된 검색어간의 연관법칙에 집중되어 있어서 일정 횟수 이상 검색되지 않은 검색어들은 버려진다. 이 연구에서는 이런 검색어들을 스몰 셋(small set)이라고 정의하고 스몰 셋의 연관법칙을 찾기 위한 방법을 제시한다. 실험결과는 이 연구에 제시한 방법이 효과적으로 동작하는 것을 입증해준다.

  • PDF

대용량 멀티미디어 데이터의 효율적인 검색엔진 설계

  • 이광형;민소연
    • 한국산학기술학회:학술대회논문집
    • /
    • 한국산학기술학회 2009년도 춘계학술발표논문집
    • /
    • pp.503-506
    • /
    • 2009
  • 본 논문에서는 대용량 멀티미디어 데이터에 대한 사용자의 다양한 의미검색을 지원하는 비디오 검색 시스템의 설계를 제안한다. 제안하는 시스템은 주석기반검색과 특징기반 검색을 각각의 에이전트를 통하여 자동으로 처리하였다. 먼저 주석기반검색은 사용자의 검색어를 입력하게 되면 가중치를 적용하여 의미를 더욱 구체화 하여 오류율을 최소화 하였으며, 특징기반검색은 주석기반검색에서 선택된 키프레임에 의해 데이터베이스의 영상들과 유사도를 검사하여 검색하였다. 시스템의 구현결과 기본시스템보다 0.5%의 재현율의 향상과 97.8%의 정확률을 나타내었다.

  • PDF