• 제목/요약/키워드: 웹검색엔진

검색결과 10건 처리시간 0.037초

데이터베이스 관리 시스템에 기반한 웹검색엔진의 구현 (Web Search Engine based on Database Management System)

  • 강병주;이지동;최기선
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1997년도 제9회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.211-218
    • /
    • 1997
  • 웹검색엔진은 색인되는 웹문서가 많아질수록 시스템 확장성(scalability)이라든지, 데이터베이스 유지 관리의 용이성, 데이터의 안전성 문제, 등의 많은 문제가 웹검색엔진에 부담으로 주어지게 된다. 반면에 인트라넷(intranet)용 검색엔진의 경우는 확장성보다는 검색엔진 자체의 개발의 용이성이 더욱 중요하다. Oracle $ConText^{TM}$는 오라클 사(社의) RDBMS인 $Oracle7^{TM}$의 정보검색 확장 옵션으로 텍스트를 Oracle7의 기본 데이터 타입으로 사용될 수 있게 한다. Oracle7+ConText는 대용량의 문서 베이스와 개발의 용이성을 동시에 보장할 수 있는 매우 훌륭한 웹검색엔진 개발 도구이다. 우리는 이를 검증하기 위하여 Oracle7+ConText에 기반한 WEBSECT(Web Search Engine With ConText)라는 웹검색엔진을 개발하였다. 본 논문은 WEBSECT의 개발과 시험 운영을 통해 데이터베이스에 기반한 웹검색엔진의 우수한 확장성과 텍스트 애플리케이션 개발의 용이성 등을 소개한다.

  • PDF

웹문서분류체계의 분석 및 새로운 설계 (Analysis and Design for the System of Korean Web Document Classification)

  • 남영준
    • 한국문헌정보학회지
    • /
    • 제32권3호
    • /
    • pp.207-230
    • /
    • 1998
  • 인터넷에 존재하는 웹문서와 사이트들은 충분히 학술적 가치를 갖고 있기 때문에 중요한 정보원으로 간주된다. 도서관은 이 새로운 정보원을 대상으로 도서관 이용자를 위한 새로운 검색기법과 관리기법을 개발할 필요가 증대되었다. 왜냐하면 현재 웹검색엔진에서 제공하는 분류체계는 도서관학적 관점에서 개발되지도 않았으며 또한 웹검색엔진간 분류체계의 설계원칙도 없기 때문이다. 본 논문에서는 이점에 착안하여 웹 문서를 효율적으로 검색할 수 있는 실험적인 새로운 웹문서 분류체계를 설계하였다. 설계는 해당 분류항목과 연관된 웹문서의 수와 접속비율에 근거하였으며, 설계의 수준은 1차적으로 류${\cdot}$강항목까지 제한하였다.

  • PDF

이용자정의형 적합성 기준을 토대로 한 웹검색엔진 인터페이스 평가 (Appraising the Interface Features of Web Search Engines Based on User-defined Relevance Criteria)

  • Kim, Yang-Woo
    • 한국비블리아학회지
    • /
    • 제22권1호
    • /
    • pp.247-262
    • /
    • 2011
  • 이용자 정의형 적합성 연구가 적합성의 유형 및 기준 식별에 큰 진전을 이룬 반면, 그 결과를 실제 시스템 디자인에 적용시키는데는 큰 발전이 없었다. 이러한 전제하에 본 연구는 식별된 적합성기준이 주요 웹검색엔진의 인터페이스 기능에 어느정도 접목되었는지를 조사하고 무엇이 더 이루어져야 하는지를 제안하였다. 시스템 기능에 접근하기전에 본 연구에서는 적합성연구와 정보학 및 HCI에서 이와 유사한 이용자중심 연구를 비교하여 제시하였다. 인터페이스기능을 지원하기위한 제안점은 (1) 인터페이스 디자인의 추가적인 개인화, (2) 웹 컨텐츠를 위한 저자제공 메타 태그, 그리고 (3) 링크구조에 입각한 비주제적 표현의 확장 등이다.

웹검색 트래픽 정보를 활용한 유커 인바운드 여행 수요 예측 모형 및 유커마이닝 시스템 개발 (Development of Yóukè Mining System with Yóukè's Travel Demand and Insight Based on Web Search Traffic Information)

  • 최유지;박도형
    • 지능정보연구
    • /
    • 제23권3호
    • /
    • pp.155-175
    • /
    • 2017
  • 최근 독감 예측이나 당선인 예측, 구매 패턴, 투자 등 다방면에서 웹검색 트래픽 정보. 소셜 네트워크 내용 등 거대한 데이터를 통해 사회적 현상, 소비 패턴을 분석하는 시도가 이전보다 늘어났다. 구글, 네이버, 바이두 등 인터넷 포털 업체들의 웹검색 트래픽 정보 공개 서비스와 함께 웹검색 트래픽 정보를 활용하여 소비자나 사용자와 관련된 연구가 실시되기 시작했다. 웹검색 트래픽 정보를 활용한 사회 현상, 소비 패턴 분석을 연구는 많이 수행되었으나, 그에 비해서 도출된 여행 수요 모델을 토대로 의사결정을 위한 실질적 대책 수립으로 이어지는 연구는 많이 진행되지 않은 실정이다. 관광산업은 상대적으로 많은 고용을 가능하게 하고 외자를 유치하는 등 고부가가치를 창출하여 경제 전체에 선순환 효과를 일으키는 중요한 산업이다. 그 중에서도 국내 입국외래객중 수년간 2위와의 큰 차이로 1위를 차지해왔던 중국 국적의 관광객 '유커' 및 그들이 지출하는 1인당 평균 관광 수지는 한국 경제에 매우 중요한 한 부분이다. 관광 수요의 예측은 효율적인 자원 배분과 합리적인 의사 결정에 있어서 공공부문 및 민간부문 모두 중요하다. 적절한 관광 수요 예측을 통해서 한정된 자원을 더욱 효과적으로 활용하여 더욱 많은 부가가치를 창출하기 위한 것이다. 본 연구는 중국인 인바운드를 예측하는 방법에 있어, 이전보다 더 최신의 트렌드를 즉각적으로 반영하고 개인들의 집합의 관심도가 포함되어 예측 성능이 개선된 방법을 제안한다. 해외여행은 고관여 소비이기 때문에 잠재적 여행객들이 입국하기 전 웹검색을 통해 적극적으로 자신의 여정과 관련된 정보를 취득하기 위한 활동을 한다. 따라서 웹검색 트래픽 수치가 중국인 여행객의 관심정도를 대표할 수 있다고 보았다. 중국인 여행객들이 한국 여행을 준비하는 단계에서 검색할만한 키워드를 선정해 실제 중국인 입국자 수와 상관관계가 있음을 검증하고자 하였다. 중국 웹검색 엔진 시장에서 80%의 점유율을 가지는 중국 최대 웹검색 엔진 '바이두'에서 공개한 웹검색 데이터를 활용하여 그 관심 정도를 대표할 수 있을 것이라 추정했다. 수집에 필요한 키워드의 선정 단계에서는 잠재적 여행객이 여정을 계획하고 구체화하는 단계에서 일반적으로 검색하게 되는 키워드 후보군을 선정하였다. 키워드의 선정에는 중국 국적의 잠재적 여행객 표본과의 인터뷰를 거쳤다. 트래픽 대소 관계 확인 결과에 따라서 최종 선정된 키워드들을 한국여행이라는 주제와 직접적인 연관을 가지는 키워드부터, 간접적인 연관을 가지는 키워드까지 총 세 가지 레벨의 카테고리로 분류하였다. 분류된 카테고리 내의 키워드들은 바이두'가 제공하는 웹검색 트래픽 데이터 제공 서비스 '바이두 인덱스'를 통해 웹검색 트래픽 데이터를 수집했다. 공개된 데이터 페이지 특성을 고려한 웹 크롤러를 직접 설계하여 웹검색 트래픽 데이터를 수집하였고, 분리되어 수집된 변수에는 필요한 변수 변환 과정을 수행했다. 자동화 수집된 웹검색 트래픽 정보들을 투입하여 중국 여행 인바운드에 대한 유의한 영향 관계를 확인하여 중국인 여행객의 한국 인바운드 여행 수요를 예측하는 모형을 개발하고자 하였다. 정책 의사결정 및 관광 경영 의사결정 같은 실무적 활용을 고려하여 각 변수의 영향력을 정량적으로 설명할 수 있고 설득이 명료한 방법인 다중회귀분석방법을 적용해 선형 식을 도출하였다. 수집된 웹검색 트래픽 데이터를 기존 검증된 모형 독립변인들에 추가적으로 투입함으로써 전통적인 독립변인으로만 구성된 연구 모형과 비교하여 가장 뛰어난 성능을 보이는 모형을 확인하였다. 본 연구에서 검증하려는, 웹검색 트래픽으로 대표되는 독립변인을 투입한 최종 도출된 모형을 통해 중국인 관광 수요를 예측할 때 유의한 영향을 끼치는 웹검색 트래픽 변수를 확인할 수 있다. 최적 모형 설명력을 가지는 모형을 기반으로 최종 회귀 식을 만들었고 이를 '유커마이닝' 시스템 내부에 도입하였다. 데이터 분석에서 더 나아가 도출된 모형을 직관적으로 시각화하고, 웹검색 트래픽 정보를 활용하여 도출할 수 있는 인사이트를 함께 보여주는 데이터 분석 기반의 '유커마이닝' 솔루션의 시스템 알고리즘과 UX를 제안하였다. 본 연구가 제안하는 모형과 시스템은 관광수요 예측모형 분야에서 웹검색 트래픽 데이터라는 정보 탐색을 하는 과정에 놓인 개인들의 인터랙티브하고 즉각적인 변수를 활용한 새로운 시도이다. 실무적으로 관련 정책결정자나 관광사, 항공사 등이 활용 가능한 실제적인 가치를 가지고, 정책적으로도 효과적인 관광 정책 수립에 활용될 수 있다.

인터넷 검색엔진: 사용자의 관심을 흡수하여 전문성을 강화하는 기술 (Internet Search Engine: Technological Mode that Draws User's Attention to Make Its Expertise Reinforce)

  • 김지연
    • 과학기술학연구
    • /
    • 제13권1호
    • /
    • pp.181-216
    • /
    • 2013
  • 본 논문에서는 일반적인 웹검색 기술에 대한 분석을 포함하여, 한글검색엔진에 대한 접근도 전개하고자 한다. 최근 검색엔진의 독점적 지위문제, 검색순위의 공정성 문제가 발생하면서 우려가 높아지고 있다. 검색엔진을 둘러싸고 발생하는 상이한 해석적 주장들에는 기술결정론적 관점에서부터 도구주의적 관점까지 다양하다. 여러 해석적 주장들은 강한 지향성을 가지고 있지만 또한 그럴만한 기원도 가지고 있다. 이처럼 다양한 해석이 병존하는 것은 이 기술에 대한 통합적 재해석이 제기되고 있다는 의미일 것이다. 검색엔진은 사용자의 관심을 흡수하여 자신의 질서를 부여하는 기술양식이다. 이는 검색엔진의 합리성으로부터 기원한다. 특히 한글검색엔진은 사용자들의 관심을 끌어들임으로서 자신의 합리성을 증식시켜왔다. 한글검색은 일반적인 검색엔진이 수행하는 문서들 사이의 관계만이 아니라, 사용자들이 입력하는 단어들 사이의 기호학적 관계를 양식화해냈고 그로써 강력한 권위를 구성해냈다. 이제 검색엔진의 판단은 단순한 안내자의 지위를 넘어서 민주주의의 문제가 되었다. 어떻게 검색엔진의 전문성을 승인하면서도 민주주의에 봉사하도록 할 것인가? 검색엔진과 인간행위자를 분절적으로 보는 대신에, 둘 사이의 관계방식에 초점을 둘 때 검색기술에 대한 새로운 전망을 내놓을 수 있을 것이다.

  • PDF

학술정보포털에 대한 이용자만족 관련 인식에 관한 연구 - NAVER 전문정보의 학술자료 검색 기능을 중심으로 - (User Satisfaction related Perception of the Web Portal for Scholarly Information: Focused on the Academic Version of NAVER Search Engine)

  • 김양우
    • 한국문헌정보학회지
    • /
    • 제51권2호
    • /
    • pp.255-279
    • /
    • 2017
  • 본 연구는 NAVER 전문정보의 학술자료 검색 기능에 대한 이용자 만족과 관련된 인식을 조사한 질적 연구이다. 다양한 전공영역의 학부 학생들이 자신의 전공영역과 관련된 학술목적의 정보요구를 기반으로 스스로 선정한 탐색주제를 가지고 검색을 수행하는 과정에서 학술정보 전문포털에 대한 만족이나 불만족 등의 인식과 그 이유에 대한 조사가 이루어졌다. 수집된 데이터를 기반으로 한 연구결과는 인터페이스, 검색메커니즘 및 검색결과 등 세 가지 범주에 속하는 다양한 평가 항목 별로 제시되었다. 본 연구의 제언점은 1) 이용자들의 기본적인 관련 용어에 대한 제한한 지식 등을 토대로 한 시스템 인터페이스 개선 및 도움말 기능의 확대, 2) 상이한 맥락에서 사용된 검색어를 토대로 한 검색결과가 이용자 불만족으로 연결됨에 따른 검색 메커니즘의 개선 필요성, 그리고 3) 이용자들의 기본 용어 이해 부족과 더불어 검색 메커니즘 및 탐색기능에 대한 미흡한 식견을 기반으로 한 이용자교육의 제공 필요성으로 요약된다.

이미지 검색 과정에 나타난 질의 전환 및 재구성 패턴에 관한 연구 (Examining Categorical Transition and Query Reformulation Patterns in Image Search Process)

  • 정은경;윤정원
    • 정보관리학회지
    • /
    • 제27권2호
    • /
    • pp.37-60
    • /
    • 2010
  • 이 연구는 이미지 특성 범주와 관련하여 질의 재구성 패턴을 탐색하고자 하였다. 이러한 연구 목적을 수행하기 위해서 Excite 웹검색 엔진 로그 데이터가 사용되었으며, 총 592 세션과 2,445 질의어가 분석되었다. 데이터 분석은 Batley의 정보 형태 구분과 선행 연구에서 밝혀진 팻싯과 서브팻싯을 활용하여 수행되었다. 분석결과는 두가지 형태로 구분하여 제시되었다. 첫째, 질의 재구성에 관한 분석결과이다. 질의 분석 결과, 가장 많은 부분을 차지하는 범주는 특정어(specific)와 지칭어(nameable)이며, 이러한 경향은 다양한 정보 탐색 단계에서도 지속적으로 나타났다. 둘째, 질의 재구성 패턴과 관려하여, 평행이동이 가장 많이 나타났으며, 이러한 경향은 최초 혹은 직전 질의 범주에 따라 근소한 차이를 보였다. 범주 전환 분석에서는 높은 비율(60%-80%)로 검색 질의의 범주가 지속적으로 동일한 범주에 머무르는 경향을 밝혀내었다. 이러한 결과는 이미지 검색 시스템 설계와 구현에 있어서, 이용자의 질의 선정 과정에 도움을 제공하고 효과적인 시소러스 구축 등에 활용될 수 있을 것으로 기대된다.

국내 거주 외국인 유학생의 정보검색행위에 관한 탐색적 연구 (An Exploratory Study of Information Search Behaviors of International Students in Korea)

  • 윤정원
    • 한국비블리아학회지
    • /
    • 제33권1호
    • /
    • pp.259-277
    • /
    • 2022
  • 본 연구는 외국인 유학생들의 웹 검색엔진을 사용한 정보검색행위를 분석하였다. 실험에 참가한 15명의 외국인 유학생들은 3가지 검색 태스크에 포함된 6개의 검색질문에 대한 답을 찾도록 하였으며, 각 태스크 별로 사전 설문지 작성, 검색 수행, 사후 설문지 작성으로 실험이 진행되었다. 검색 태스크의 특성에 따라 검색성과와 검색행동에는 차이가 있었으나 공통적으로 한국어의 유창성이 높은 참가자들의 검색 성과가 높은 것으로 나타났다. 그러나 검색주제에 관한 사전지식이 검색성과에 항상 영향을 미치는 것은 아닌 것으로 나타났다. 메뉴와 링크를 통하여 웹사이트를 탐색해서 답을 찾는 태스크의 경우, 정답이 포함된 웹페이지 앞에서도 정답을 간과하는 경우가 발견되었다. 또한 오답을 찾고 그것을 인지하지 못하는 경우도 있었다. 국내의 외국인 거주자들에게 정보를 제공하기 위해서는 비원어민들이 탐색하기에 용이한 웹사이트를 디자인하고 양방향 소통 수단이 소셜미디어를 사용하는 것이 필요하다고 제안되었다.

LSA모형에서 다의어 의미의 표상 (Representation of ambiguous word in Latent Semantic Analysis)

  • 이태헌;김청택
    • 인지과학
    • /
    • 제15권2호
    • /
    • pp.23-31
    • /
    • 2004
  • 잠재의미분석은 단어 의미를 동일한 맥락 (문장/문서) 하에서 동시에 제시되는 단어들의 공기성(co-occurence)으로 정의한다. 이 분석에서 한 단어는 맥락들을 대표하는 측들로 구성된 다차원 상의 한 점으로 표상 되며, 단어 의미는 각 단어가 맥락 속에서 등장한 빈도로 정의된다. 이 다차원 의미공간은 SVD를 통하여 차원이 축소되어 추상된 의미를 표상 한다. 이 연구는 다의어의 표상이 가능하도록 LSA를 발전시켰다. 제안된 LSA는 축에 대한 해석이 가능하도록 축의 회전을 도입하였으며 다의어 표상을 가능하게 하였다. 시뮬레이션에서는, 먼저 LSA에 의해 산출된 단어-맥락 빈도표에서 다의어를 포함하고 있는 문서들만을 재 수집한 다음 문서들을 다의어 의미별로 분류하였다. 두 번째 단계에서는 다의어의 특정의미에 대한 표상을 분류된 단어-맥락 빈도표에서 비해당 의미에 대한 맥락들을 제거한 후 LSA를 적용하여 구성하였다. 시뮬레이션 결과는 다의어의 의미들을 LSA가 표상 할 수 있음을 보여주었다. 이는 축회전을 포함한 LSA가 다의어 다중의미를 표상 할 수 있고 실용적인 측면에서 웹검색 엔진에도 적용될 수 있음을 시사한다.

  • PDF

질의 언어 및 복잡성이 대학생의 웹 정보탐색에 미치는 영향에 관한 연구 (Exploring the Effects of Task Language and Complexity in College Students' Web Searching)

  • 심원식;안혜연;변제연
    • 한국문헌정보학회지
    • /
    • 제49권2호
    • /
    • pp.51-73
    • /
    • 2015
  • 인터넷은 20-30년 전에는 상상할 수 없었던 엄청난 양의 정보에 대한 즉각적인 접근을 가능하게 하고 있다. 하지만 정보를 표현한 언어가 다양한 국가의 언어로 제공됨으로 이용자는 인터넷상에서 제공되는 컨텐츠를 온전히 사용하기 위해 반드시 외국어에 대한 이해를 수반해야 한다. 2015년 한 통계에 따르면 전 세계 웹사이트의 약 55%가 영어로 제작되어 있다고 한다. 따라서 정보탐색에 있어 웹 컨텐츠의 절반 이상에서 사용되고 있는 영어의 중요성을 간과할 수 없는 것이다. 본 연구는 인터넷을 활용한 정보문제 해결에 있어 검색 질의의 언어와 질의문의 복잡성이 검색 성과에 어떤 영향을 미치는지 살펴보고자 하였다. 실험은 서울 시내 종합사립대학교에 재학 중인 30명의 학생들을 대상으로 실시하였다. 연구자는 피험자들에게 각각 총 8개의 검색과제를 무선방식으로 제공하였다. 이들 과제는 각각 4개씩의 한글과 영어로 된 질의로, 이는 다시 같은 수의 단순 질의와 복합 질의로 나누어진다. 실험 결과 단순 질의와 복합 질의 간 검색에 소요된 시간, 검색 횟수, 정답률에 있어 통계적으로 유의미한 차이를 보였다. 하지만 질의 언어가 검색 성과 지표에는 영향을 미치지 않는 것으로 나타났다. 또 학생들의 영어구사수준 역시 검색성과에 영향을 미치지 않았다. 그러나 검색과 관련된 다른 지표(검색 언어의 사용 및 검색엔진 선택)에 있어서는 검색 언어와 검색 복잡성이 영향을 미치는 것으로 나타났다.