• 제목/요약/키워드: Vector Space Model(VSM)

검색결과 9건 처리시간 0.025초

Empirical Comparison of Word Similarity Measures Based on Co-Occurrence, Context, and a Vector Space Model

  • Kadowaki, Natsuki;Kishida, Kazuaki
    • Journal of Information Science Theory and Practice
    • /
    • 제8권2호
    • /
    • pp.6-17
    • /
    • 2020
  • Word similarity is often measured to enhance system performance in the information retrieval field and other related areas. This paper reports on an experimental comparison of values for word similarity measures that were computed based on 50 intentionally selected words from a Reuters corpus. There were three targets, including (1) co-occurrence-based similarity measures (for which a co-occurrence frequency is counted as the number of documents or sentences), (2) context-based distributional similarity measures obtained from a latent Dirichlet allocation (LDA), nonnegative matrix factorization (NMF), and Word2Vec algorithm, and (3) similarity measures computed from the tf-idf weights of each word according to a vector space model (VSM). Here, a Pearson correlation coefficient for a pair of VSM-based similarity measures and co-occurrence-based similarity measures according to the number of documents was highest. Group-average agglomerative hierarchical clustering was also applied to similarity matrices computed by individual measures. An evaluation of the cluster sets according to an answer set revealed that VSM- and LDA-based similarity measures performed best.

노드정보를 이용한 문서검색의 성능에 관한 연구 (A Study on the Performance of Structured Document Retrieval Using Node Information)

  • 윤소영
    • 정보관리학회지
    • /
    • 제24권1호
    • /
    • pp.103-120
    • /
    • 2007
  • 노드는 문서를 구성하는 작은 크기의 의미 있는 정보 단위이다. 정보검색에 문서의 구조정보를 이용함과 더불어 문서보다 작은 검색단위에 대한 연구가 활발히 이루어지고 있다. 이 연구에서는 노드정보를 이용한 검색실험을 위해 벡터공간모델 검색기법을 사용하여 다양한 유사도 산출방식을 적용한 실험과 구조정보를 활용한 확장 실험을 수행하였다. 실험결과 문서의 유사도를 산출하는 방식에 따른 검색성능의 차이는 거의 나타나지 않았으며, 구조정보를 적용하는 확장 노드검색이 가장 좋은 성능을 나타냈다.

텍스트 마이닝을 위한 그래프 기반 텍스트 표현 모델의 연구 동향 (A Study on Research Trends of Graph-Based Text Representations for Text Mining)

  • 장재영
    • 한국인터넷방송통신학회논문지
    • /
    • 제13권5호
    • /
    • pp.37-47
    • /
    • 2013
  • 텍스트 마이닝은 비정형화된 텍스트를 분석하여 그 안에 내재된 패턴, 추세, 분포 등의 고급정보들을 추출하는 분야이다. 텍스트 마이닝은 기본적으로 비정형 데이터를 가정하므로 텍스트를 단순화된 모델로 표현하는 것이 필요하다. 현재까지 가장 많이 사용되고 있는 모델은 텍스트를 단순한 단어들의 집합으로 표현한 벡터공간 모델이다. 그러나 최근 들어 단어들의 의미적 관계까지 표현하기 위해 그래프를 이용한 텍스트 표현 모델을 많이 사용하고 있다. 본 논문에서는 텍스트 마이닝을 위한 기존의 연구 중에서 그래프에 기반한 텍스트 표현 모델의 방법들과 그들의 특징들을 기술한다. 또한 그래프 기반 텍스트 마이닝의 향후 발전방향에 대해서도 논한다.

UN 지속가능개발목표(SDGs)의 관점에서 벡터공간모델을 통해 정량적으로 분석한 한국농촌계획학회의 연구동향, 1995-2016 (UN's Sustainable Development Goals (SDGs) Oriented Research Trend in Publications of Korean Society of Rural Planning, 1995-2016: quantitatively analyzed with the Vector Space Model)

  • 이제명
    • 농촌계획
    • /
    • 제23권2호
    • /
    • pp.29-42
    • /
    • 2017
  • Sustainable development is no longer an option, but a requirement. Under this awareness, UN adopted 17 goals for a new sustainable development agenda on September 2015, named 'Sustainable Development Goals(SDGs)'. The Korean Society of Rural Planning(KSRP) is established on July 1994 for the sustainable development of rural areas. On the purpose to quantitatively analyze the research trend of KSRP's publications with the viewpoint of SDGs, the qualitative documents of 17 SDGs and 771 publications were mathematically transformed into vectors and the similarity was numerically measured with the 'Vector Space Model(VSM)'. The results show that 'Sustainable cities and communities(SDG 11)', 'Zero hunger(SDG 2)', 'Life on land(SDG 15)' and 'Responsible consumption and production(SDG 12)' have strong relationships with KSRP, while those of 'Affordable and clean energy(SDG 7)', 'Peace, justice and strong institution(SDG 16)' and 'Gender equality(SDG 5)' are weak. It is also found that the relationships of KSRP publications with 'energy' and 'climate change' issues(SDG 7, 13) were greatly increased during the period of 1995-2016, in spite of their weak relationships.

의미 벡터 확장을 통한 유전자 클러스터링 (Genetic Clustering with Semantic Vector Expansion)

  • 쏭웨이;박순철
    • 한국콘텐츠학회논문지
    • /
    • 제9권3호
    • /
    • pp.1-8
    • /
    • 2009
  • 본 논문에서는 퍼지 논리 기반의 유전자 알고리즘(GA)과 의미 벡터 확장 기술을 이용한 문서 클러스터링 시스템을 제안한다. GA에 관련된 여러 논문에서 이미 알려졌듯이 GA알고리즘의 성공 여부는 군체의 다양성과 수렴하는 능력에 따라 결정된다. 이러한 두 인자 사이의 영향력을 조절하기 위하여 우리는 퍼지 논리 기반의 연산자를 사용한다. 전통적인 문서 클러스터링 알고리즘에서 문서를 나타내기 위한 가장 일반적이고 직선적인 방법은 벡터 공간 모델이다. 그러나 이 방법은 다차원 특징 공간의 원인이 될 뿐만 아니라, 클러스터링의 정확성에 영향을 미칠 수 있는, 단어 간의 의미상 관계성을 무시한다. 본 논문에서는 LSA를 사용하여 문서를 관련되는 의미상의 벡터 개념으로 확장시킨다. 또한 이것은 벡터의 크기를 크게 줄일 수 있다. 본 논문에서 제안한 클러스터링 알고리즘을 테스트하기 위하여 20개의 뉴스 그룹과 로이터 데이터를 사용했다. 제안된 방법은 문서를 표현하는 다양한 환경에서 일반적인 GA보다 더 나은 결과를 보여준다.

질의어의 근접성 정보 및 그래프 프로파일링 기법을 이용한 태그 기반 개인화 검색 (Exploiting Query Proximity and Graph Profiling Method for Tag-based Personalized Search in Folksonomy)

  • 한기준;장진철;이문용
    • 정보과학회 논문지
    • /
    • 제41권12호
    • /
    • pp.1117-1125
    • /
    • 2014
  • 최근 폭소노미라고 불리는 데이터들이 사용자의 의도 파악 및 흥미를 분석하는 데에 매우 유용하게 쓰이고 있다. 본 논문은 폭소노미 데이터를 이용한 개인화 검색에서, 기존의 벡터 기반 프로파일링 및 유사도 계산 모델의 한계점을 지적하고, 이러한 한계를 극복하기 위한 방법으로 그래프 기반의 프로파일링 및 유사도 계산법을 제안한다. 최종적으로 그래프 기반의 개인화 검색 모델에 추가적으로 질의어간의 근접성까지 고려한 보다 발전된 개인화 검색 기법을 제안하였다. 본 연구에서는 복수의 데이터셋을 사용한 객관적인 성능 평가 실험을 통해 제안한 모델이 기존의 벡터 스페이스 모델에 기반한 프로파일링 기법 및 프로파일 간의 유사도 계산 기법보다 더 뛰어난 개인화 검색 결과를 제공함을 확인하였다. 또한 추가적인 파라미터 실험을 통하여, 제안하는 모델은 어떠한 형태의 데이터셋에도 쉽게 적용가능함을 보였다.

헬름홀츠머신 학습 기반의 의미 커널을 이용한 문서 유사도 측정 (Estimation of Document Similarity using Semantic Kernel Derived from Helmholtz Machines)

  • 장정호;김유섭;장병탁
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2003년도 봄 학술발표논문집 Vol.30 No.1 (B)
    • /
    • pp.440-442
    • /
    • 2003
  • 문서 집합 내의 개념 또는 의미 관계의 자동 분석은 보다 효율적인 정보 획득과 단어수준 이상의 개념 수준에서의 운서 비교를 가능하게 한다. 본 논문에서는 은닉변수모델을 이용하여 문서 집합으로부터 단어들 간의 의미관계를 자동적으로 추출하고 이를 통해 문서간 유사도 측정을 효과적으로 하기 위한 방안을 제시한다. 은닉변수 모델로는 다중요인모델의 학습이 용이한 헬름홀츠 머신을 활용하묘 이의 학습 결과에 기반하여, 문서간 비교를 한 의미 커널(semantic kernel)을 구축한다. 2개의 문서 집합 HEDLINE과 CACM 데이터에 대한 검색 실험에서, 제안된 기법을 적응함으로써 기본 VSM(Vector Space Model) 에 비해 20% 이상의 평균 정확도 향상을 이를 수 있었다.

  • PDF

예약어 시퀀스 탐색을 통한 소스코드 표절검사 (Source Codes Plagiarism Detection By Using Reserved Word Sequence Matching)

  • 이영주;김승;강석호
    • 한국경영과학회:학술대회논문집
    • /
    • 대한산업공학회/한국경영과학회 2006년도 춘계공동학술대회 논문집
    • /
    • pp.1198-1206
    • /
    • 2006
  • 프로그램 소스코드 표절 검사에 대한 기존 방법은 크게 지문(finger-print)법과 구조기반 검사법으로 나뉘며, 주로 단어의 유사성이나 발생빈도를 사용하거나 소스코드 구조상의 특징으로 두 소스간의 유사성을 비교한다. 본 연구에서는 프로그래밍 언어의 예약어 시퀀스를 사용하여 소스코드들 간의 유사성을 비교하고, 이 결과를 FCA(Formal Concept Analysis)를 통해 해석하고 시각화 하는 방법을 제시한다. 일반적인 VSM(Vector Space Model)과 같은 단일 단어 분석으로는 단어의 인접성을 구분할 수 없으므로 단어의 시퀀스 분석이 가능하도록 알고리즘을 구성하였으며 이러한 방식은 지문법의 단점인 소스코드의 부분적인 표절 탐지의 난점을 해결할 수 있고 함수의 호출 순서나 수행 순서에 상관없이 표절을 탐지할 수 있는 장점을 가진다. 마지막으로 유사도 측정결과는 FCA를 이용하여 격자(lattice)로 시각화됨으로써 이용자의 이해도를 높일 수 있다.

  • PDF

의미커널과 한글 워드넷에 기반한 지능형 채점 시스템 (An Intelligent Marking System based on Semantic Kernel and Korean WordNet)

  • 조우진;오정석;이재영;김유섭
    • 정보처리학회논문지A
    • /
    • 제12A권6호
    • /
    • pp.539-546
    • /
    • 2005
  • 최근 인터넷 사용자가 급증하면서 원격교육의 발전과 함께 평가에서도 원격을 이용한 방법이 많이 사용되고 있다. 하지만 현재까지는 자연언어처리의 어려움으로 객관식이나 단답식 평가가 주류를 이루고 있다. 본 논문에서는 서술형 주관식 문제의 빠르고 공정한 지능형 채점을 위하여, 다양한 언어 지식을 활용하였다. 이를 위하여, 가공되지 않은 말뭉치에서 의미커널을 구축하고, 수험자가 작성한 답안과 이미 구축된 정답을 벡터로 구성하여 이 답안간의 유사도를 의미커널을 통해 계산하여 정답여부를 자동으로 판단하도록 하였다. 의미커널을 구축하기 위하여 벡터 공간 모델에 기반한 은닉 의미 분석을 이용하였으며, 또한 한글 워드넷을 이용하여 답안의 정보부족 문제를 줄여보고자 하였다. 실험을 위하여 3000 문항의 주관식 문제를 구축하였으며, 의미커널의 구축을 위하여 38,727개의 신문기사를 모아 말뭉치로 구성하고 75,175개의 색인어를 추출하였다. 의미커널에 기반한 자동 채점 시스템으로 실제 수험자에 의하여 작성된 답안을 채점한 결과, 출제자가 실제로 채점한 결과를 기준으로 하여 최고 0.894의 상관관계를 얻을 수 있었다