• 제목/요약/키워드: 웹 검색

검색결과 2,249건 처리시간 0.025초

범주 기반 평가를 이용한 검색시스템의 성능 향상 (Improving Performance of Search Engine Using Category based Evaluation)

  • 김형일;윤현님
    • 한국콘텐츠학회논문지
    • /
    • 제13권1호
    • /
    • pp.19-29
    • /
    • 2013
  • 정보에 대한 공간 복잡도가 높은 현재의 인터넷 환경에서는 사용자가 원하는 정보를 정확히 제공하는 것이 검색엔진의 목표이다. 그러나 대다수 검색엔진이 활용하는 내용 기반 기법은 현재의 인터넷 환경에서는 효과적인 도구로 사용될 수 없다. 내용 기반 기법은 어휘의 형태적 특성을 이용하여 웹페이지 가중치를 결정하기 때문에 웹페이지에 대한 변별력이 우수하지 못하다는 단점이 있다. 이러한 문제점을 해결하여 사용자에게 효과적인 정보를 제공하기 위해, 본 논문에서는 범주 기반 평가 기법을 제안한다. 범주 기반 평가 기법은 질의어를 의미관계로 확장하여 웹페이지와 유사성을 측정한다. 웹페이지 가중치 적용에 있어서, 범주 기반 평가 기법은 웹페이지 검색에 대한 사용자 반응과 질의어 범주를 가중치에 활용함으로써 웹페이지에 대한 변별력을 증가시킨다. 본 논문에서 제안한 기법은 사용자가 원하는 정보를 검색엔진을 통해 효과적으로 제공할 수 있는 장점이 있으며, 다양한 실험을 통해 범주 기반 평가 기법의 활용성을 확인하였다.

하이퍼텍스트 정보 관점에서 의도적으로 왜곡된 웹 페이지의 검출에 관한 연구 (Detecting Intentionally Biased Web Pages In terms of Hypertext Information)

  • 이우기
    • 한국컴퓨터정보학회논문지
    • /
    • 제10권1호
    • /
    • pp.59-66
    • /
    • 2005
  • 웹(World Wide Web)은 정보의 저장 및 검색에 있어서 보편적인 매체가 되고 있다 웹에서는 일반적으로 검색엔진(Web search engine)을 통해 정보 검색을 수행하지만, 그 결과가 사용자의 요구와 늘 일치하는 것은 아니며 때로는 의도적으로 조작된 검색 결과가 제시되기도 한다. 웹 페이지에 대한 평가를 조작하는 것을 의도적 조작이라고 부른다. 최근에 가장 각광을 받는 링크 기반 검색 방식에는 의도적 조작이 상대적으로 어렵지만, 링크 기반 검색 방식의 대표격인 구글의 페이지 점수법(PageRank algorithm)도 구글밤처럼 조작할 수 있는 방법이 있다 본 논문에서는 기본적으로 링크 기반 검색 방식을 기초로 웹을 하나의 유향그래프(directed graph)로 인식하여 각 웹 페이지들은 하나의 노드로, 하이퍼텍스트 링크를 에지(edge)로 표현하며. 하이퍼텍스트 정보관점에서 링크 내역과 대상 페이지(target page) 사이의 유사도(similarity)를 구하고. 이것을 이용하여 페이지 점수화 (PageRank) 접근법의 전이 행렬(transition matrix)을 재구성하는 방법을 취했다 결과적으로 기존의 점수화 방법과 비교하여 효과가 $60\%$ 이상 될 수 있음을 입증했다.

  • PDF

트리즈 기법을 활용한 인터넷 웹 페이지의 프린터 인쇄에 따른 광고 Filtering 방법에 관한 연구

  • 백종근;김호종
    • 한국반도체및디스플레이장비학회:학술대회논문집
    • /
    • 한국반도체및디스플레이장비학회 2007년도 춘계학술대회
    • /
    • pp.287-292
    • /
    • 2007
  • 네이버, 야후 등의 각종 포털 사이트 및 신문, 잡지 등의 매체 사이트의 거의 모든 웹 페이지에 광고가 삽입되어 있다. 물론 구글과 같이 광고를 게재하지 않는 검색 사이트도 있기는 하지만 국내외에서 사용되는 거의 모든 포털 및 매체 사이트는 광고를 게재하여 웹 사이트의 각 페이지마다 표시하고 있다. 그러나, 유저가 어떤 정보를 검색한 후 해당 웹 페이지의 내용을 프린터로 출력할 경우 상기 웹 페이지에 삽입되어 표시되는 광고들도 같이 인쇄되는 문제가 있다. 다시 말해 실제로 유저는 검색 결과인 텍스트 정보와 그것에 관련된 이미지 정보만 인쇄되기를 원하는 경우가 대부분일 것이다. 본 논문에서는 실용트리즈의 6단계창의성을 적용하여 인터넷 웹 페이지 프린터 인쇄에 따른 광고 Filtering 방법을 설명하고 문제해결에 대한 기술적인 평가를 실시하고자 한다.

  • PDF

웹 검색을 활용한 기사 표절 탐지 시스템 (A Plagiarism Detection System for Newspaper Articles by using Web Search)

  • 조정현;김유섭
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2008년도 한국컴퓨터종합학술대회논문집 Vol.35 No.1 (C)
    • /
    • pp.420-424
    • /
    • 2008
  • 최근 문서 저작권에 대한 관심과 중요도가 높아지고 있고 문서 표절에 관한 연구도 지속적으로 이루어지고 있다. 최근 기사의 표절 또는 무단도용 문제가 적지 않게 발생하고 있다. 현재까지의 문서 표절 연구는 실시간 특성이 매우 강한 신문 기사의 표절 문제에 적용하기 어려웠다. 따라서 현재는 이러한 표절 기사를 가려내기 위해 수 많은 신문사에서 하루 수천 건씩 올라오는 기사들을 눈으로 일일이 가려내는 상황이다. 본 논문에서는 이러한 시간과 비용의 문제를 줄이기 위해 네이버와 다음에서 제공하는 웹 검색 OpenAPI를 활용해 표절 가능성이 있는 기사들을 자동으로 탐지해 내는 시스템을 제안한다. 제안하는 시스템은 하나의 원본 기사에서 5개의 문장을 랜덤으로 추출하고 각각의 문장을 검색어(query)로 사용해 연동된 OpenAPI를 사용하여 웹에서 기사를 검색한다. 또한 5번의 검색에서 추출되는 URL의 검색 빈도를 계산하여 해당 기사의 표절 가능성을 사용자가 쉽게 예측 할 수 있도록 하였다.

  • PDF

사용자 검색 패턴 기반의 공공보건 시스템 (Public Health System Using Search Engine Query Trends)

  • 박정은;정진영;박구락
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2010년도 제42차 하계학술발표논문집 18권2호
    • /
    • pp.425-428
    • /
    • 2010
  • 웹을 통해서 수천 또는 심지어는 수백만 명의 정보 수집이 가능해짐에 따라 이러한 사용자들로부터 생성된 데이터를 결합하는 알고리즘을 사용하여 새로운 비즈니스를 창출하는 집단지성이 크게 대두되고 있다. 최근 건강정보에 있어서도 웹을 통하여 사용자들이 정보의 획득이 일반화되면서 웹을 이용하는 사용자의 패턴을 이용하여 식중독이나 독감 같은 공공보건 관련 예후를 예측하는데 사용될 수 있다. 본 논문에서는 인터넷 사용자들의 검색 동향을 통해 독감의 유행을 예측하기 위해 국내외의 인플루엔자 표본감시 데이터 및 검색 동향을 비교하였다. 이러한 사용자들이 독감 관련 검색어의 증가는 실제 독감의 유행과 높은 상관관계(p=0.5, p=0.76)를 보였으며, 이는 인터넷 검색 동향만으로도 초기 단계에서 감시하고자 하는 질병의 발생 양상과 유행 양상의 전개를 예측하는데 중요한 역할을 수행할 수 있음을 의미하는 것으로 인터넷 검색 동향을 통해 공공보건을 예측하는 시스템을 제시한다.

  • PDF

진화연산을 이용한 웹 문서의 특성 학습 (Learning Web-Document Characteristics Using Evolutionary Computation)

  • 김선;장병탁
    • 한국지능시스템학회:학술대회논문집
    • /
    • 한국퍼지및지능시스템학회 2000년도 춘계학술대회 학술발표 논문집
    • /
    • pp.43-46
    • /
    • 2000
  • 대용량의 문서를 대상으로 한 정보 검색은 인터넷과 WWW이 대중화되면서 웹 분서로 확장되었다. 기존의 문서는 주로 텍스트만으로 구성되는데 반해 웹 문서는 HTML을 기반으로 문서가 작성된다. HTML은 문서의 형태를 이루게 하는 여러 종류의 태그들로 구성되어 있고 문서 작성자는 이를 이용, 자기 의도를 홈페이지에 반영한다. 따라서 태그 정보의 학습은 검색 효율을 향상시키는데 도움을 줄 수 있다. 본 논문에서는 이러한 HTML의 태그 특성을 이용해 검색 효율을 향상하는 방법을 제시한다. 제시된 방법은 진화 알고리즘을 사용하여 질의와 검색결과를 담고 있는 데이터를 학습한다. 학습을 통해 얻어지는 결고는 각 태그에 대한 가중치 정보들이며, 이는 검색엔진의 문서 가중치 정보로 사용된다. TREC 데이터를 사용하여 실험 하였으며 태그 정보를 이용함에 따른 검색 성능 변화를 비교 분석하였다.

  • PDF

효율적인 물류정보 서비스를 위한 XML 중심의 물류데이터 색인 및 검색

  • 백대원;조이현;백억종;권혁철
    • 한국지능정보시스템학회:학술대회논문집
    • /
    • 한국지능정보시스템학회 2005년도 공동추계학술대회
    • /
    • pp.264-270
    • /
    • 2005
  • 다양한 XML 데이터를 통합 관리하고, 여러 애플리케이션에 정보를 제공하는 웹 서비스 기반의 정보시 스템에서는 체계적이고 효과적인 XML 데이터의 저장 및 검색을 요구한다. 특히, 물류 분야의 정보시스 템에서는 다양한 물류 객체의 정보를 저장하고 관리 하여야 하며, 여러 애플리케이션의 물류 정보 요청에 지능적인 XML 데이터 검색으로 대처할 수 있어야 한다. XML은 데이터를 구조적으로 표현하고, 체계적인 정보 전달을 위해 많은 분야에서 이용하고 있다. XML 데이터는 데이터 구조적 형식을 정의하는 태그와 해당 값으로 구성되어 있다. 각각의 데이터 구조를 가지는 다양한 물류 데이터의 통합 관리 및 검색서비스를 위해서는 XML 데이터의 섹인이 매우 중요하다. 본 논문에서는 웹 서비스 기반의 물류정보 시스템에서 효율적인 정보 검색서비스 제공을 위한 XML 데이터 색인 기법을 제안한다. 또한, 다양한 물류데이터의 효율적인 통합 관리 및 검색을 위한 온톨로지의 적용을 제안한다.

  • PDF

메타검색엔진의 특징에 관한 연구 (A Study on the Characteristics of Meta Search Engines)

  • 이란주
    • 정보관리학회지
    • /
    • 제17권2호
    • /
    • pp.85-100
    • /
    • 2000
  • 본 연구 목적은 웹 정보원의 효과적인 정보 검색을 위하여 국내외 메타검색엔진 17개의 성격과 특징을 본 연구에서 제시한 메타검색엔진의 평가 요소와 함께 일반검색엔진의 평가 요소들을 중심으로 조사ㆍ분석하였다. 메타검색엔진은 여러 검색엔진들을 한번에 쉽게 검색할 수 있기 때문에 종종 웹 검색을 위한 첫 의뢰 검색엔진으로 사용되고 있다. 분석 결과에 의하면, 선정된 메타검색엔진들은 공통된 점을 갖고 있기도 하나 제각기 특성을 갖고 있다. 성능이 뛰어난 메타검색엔진이라면, 특별한 검색 질의를 위하여 초기 화면에 체크 상자 기능을 제공하여 검색엔진을 선택할 수 있도록 하며 개인의 희망에 맞추어 쉽게 제시되는 리스트를 제공하여야 한다. 메타검색엔진도 현재 주제별 검색엔진과 키워드형 검색엔진들이 이용자의 편의를 위해서 지향하고 있는 개인화, 주문화, 웹 문서 외의 다른 정보원을 검색 대상으로 포함하고 있는 추세를 잘 반영하고 있다. 본 연구 결과는 메타검색엔진의 선정과 효과적인 정보 검색에 반영될 수 있으며 국내 메타검색엔진 개발과 설계에 관심 있는 연구자들에게 기초자료로 활용될 수 있다.

  • PDF

시맨틱 웹에서 온토로지를 기반한 Annotation 시스템 (An Ontology-based Annotation System for Semantic Web)

  • 강상구;양재영;최중민
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2002년도 가을 학술발표논문집 Vol.29 No.2 (2)
    • /
    • pp.298-300
    • /
    • 2002
  • 시맨틱 웹은 인간이 이해하는 것처럼 웹 문서의 의미를 컴퓨터가 이해할 수 있도록 하는데 있다. 이를 위해 본 논문에서는 Annotation Editor를 사용하여 논문에 대한 RDF 메타데이타의 자동 생성 방법을 제안한다. 사용자가 논문을 주석 처리할 때, 문서에 대한 특징을 추출하고 온토로지 인터페이스를 사용하여 문서를 분류한다. 구현된 시스템을 통해 사용자는 추출된 메타데이타를 메타데이타 뷰를 통해 수정하고 RDF Store로 저장할 수 있으며, 주석 뷰를 통하여 수동으로 RDF 메타데이타를 입력할 수 있다. 본 논문은 검색 엔진을 통하여 논문 검색 시 전체 내용보다 RDF 메타데이타 정보만으로 효율적인 검색을 할 수 있는 방법에 초점을 둔다.

  • PDF

u-GIS 환경에서 OpenAPI와 매쉬업 가능 서비스에 대한 통합 검색 기법 개발 (Development Integrated Retrieval Methods for OpenAPIs and Mashup Capable Services in u-GIS Environments)

  • 천동석;차승준;김경옥;이규철
    • 한국공간정보시스템학회 논문지
    • /
    • 제11권1호
    • /
    • pp.25-34
    • /
    • 2009
  • 웹의 양상이 '웹 2.0'으로 변화해감에 따라, '웹 2.0'의 핵심요소인 OpenAPI의 사용이 늘어가고 있다. OpenAPI란 자신들의 사이트에서만 이용할 수 있는 서비스를 외부에서도 이용할 수 있도록 공개한 프로그래밍 인터페이스이다. u-GIS 국토정보도 이러한 OpenAPI를 활용하여 여러 벤더들이 제공하는 서비스를 매쉬업하여 제공할 수 있다. 하지만, OpenAPI는 이미 많이 존재하며 빠르게 증가하기 때문에 사용자가 원하는 서비스를 정확하게 찾는 것은 어렵게 되었다. 또한 여러 개의 OpenAPI를 연결하여 새로운 서비스를 만드는 매쉬업 서비스를 위한 서비스 검색에 어려움이 있다. 본 논문은 이러한 서비스 검색의 문제점을 해결하기 위해서 웹서비스 검색 엔진을 확장하여 통합서비스 정보모델을 정의하고, 정보모델을 바탕으로 통합 검색과 매쉬업 가능 서비스 검색 기법을 개발하였다. 또한 개발한 검색 기법을 관계형 데이터베이스와 JSP를 통해 구현함으로써 유사도 기반의 순위화 된 검색 결과, OpenAPI 통합검색, 카테고리 검색, 매쉬업가능 서비스 검색을 제공함을 확인하였다.

  • PDF