• 제목/요약/키워드: 의미 연관성 기반 추출

검색결과 50건 처리시간 0.027초

A Development Method of Framework for Collecting, Extracting, and Classifying Social Contents

  • Cho, Eun-Sook
    • 한국컴퓨터정보학회논문지
    • /
    • 제26권1호
    • /
    • pp.163-170
    • /
    • 2021
  • 빅데이터가 여러 분야에서 다양하게 접목됨에 따라 빅데이터 시장이 하드웨어로부터 시작해서 서비스 소프트웨어 부문으로 확장되고 있다. 특히 빅데이터 의미 파악 및 이해 능력, 분석 결과 등 총체적이고 직관적인 시각화를 위하여 애플리케이션을 제공하는 거대 플랫폼 시장으로 확대되고 있다. 그 중에서 SNS(Social Network Service) 등과 같은 소셜 미디어를 활용한 빅데이터 추출 및 분석에 대한 수요가 기업 뿐만 아니라 개인에 이르기까지 매우 활발히 진행되고 있다. 그러나 이처럼 사용자 트렌드 분석과 마케팅을 위한 소셜 미디어 데이터의 수집 및 분석에 대한 많은 수요에도 불구하고, 다양한 소셜 미디어 서비스 인터페이스의 이질성으로 인한 동적 연동의 어려움과 소프트웨어 플랫폼 구축 및 운영의 복잡성을 해결하기 위한 연구가 미흡한 상태이다. 따라서 본 논문에서는 소셜 미디어 데이터의 수집에서 추출 및 분류에 이르는 과정을 하나로 통합하여 운영할 수 있는 프레임워크를 개발하는 방법에 대해 제시한다. 제시된 프레임워크는 이질적인 소셜 미디어 데이터 수집 채널의 문제를 어댑터 패턴을 통해 해결하고, 의미 연관성 기반 추출 기법과 주제 연관성 기반 분류 기법을 통해 소셜 토픽 추출과 분류의 정확성을 높였다.

의미속성 기반의 개념망을 위한 어휘 연관도 측정 (A Measurement of Lexical Relationship for Concept Network Based on Semantic Features)

  • 옥은주;이왕우;이수동;옥철영
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2001년도 제13회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.146-154
    • /
    • 2001
  • 본 논문에서는 개념망 구축을 위해 사전 뜻풀이말에서 추출 가능한 의미속성의 분포 정보를 기반으로 어휘 연관도를 측정하고자 한다. 먼저 112,000여 개의 사전 뜻풀이말을 대상으로 품사 태그와 의미 태그가 부여된 코퍼스에서 의미속성을 추출한다. 추출 가능한 의미속성은 체언류, 부사류, 용언류 등이 있는데 본 논문에서는 일차적으로 명사류와 수식 관계에 있는 용언류 중 관형형 전성어미('ㄴ/은/는')가 부착된 것을 대상으로 한다. 추출된 공기쌍 45,000여 개를 대상으로 정제 작업을 거쳐 정보이론의 상호 정보량(MI)을 이용하여 명사류와 용언류의 연관도를 측정한다. 한편, 자료의 희귀성을 완화하기 위해 수식 관계의 명사류와 용언류는 기초어휘를 중심으로 유사어 집합으로 묶어서 작업을 하였다. 이러한 의미속성의 분포 정보를 통해 측정된 어휘 연관도는 의미속성의 공유 정도를 계산하여 개념들간에 계층구조를 구축하는 데 이용할 수 있다.

  • PDF

웹 도큐먼트 기반 연관 지식 추출 기법 : 생명정보분야에의 적용 (Web Document-based Associate Knowledge Extraction Method : Applying to Bioinformatics)

  • 문현정;김교정
    • 인터넷정보학회논문지
    • /
    • 제2권5호
    • /
    • pp.9-19
    • /
    • 2001
  • 본 논문에서는 웹 도큐먼트로부터 사용자의 관심과 선호도를 반영하는 지식을 자동으로 확장 탐색하고 추출하기 위한 연관지식 추출 기법을 제시한다. 사용자의 학습의도를 내포한 중심어와 연관된 정보를 예제 도큐먼트로부터 탐색 추출하기 위하여 연관 규칙 탐색 데이터 마이닝 기법을 웹 도큐먼트상의 연관 객체 추출에 적용한다. 또한 추출된 연관 정보들의 가중치 부여를 위하여 연관 태그 블록 기반 가중치 기법을 제시한다. 본 논문에서 제시된 연관 지식 추출 기법을 생명정보학 분야에 적용하여 의미적으로 연관성 있는 지식 추출 실험을 수행한 결과 매우 높은 정확성을 보이는 것으로 나타났다.

  • PDF

문항 응답 데이터에서 문항간 연관규칙의 질적 향상을 위한 도구 개발 (A Measure for Improvement in Quality of Association Rules in the Item Response Dataset)

  • 곽은영;김현철
    • 컴퓨터교육학회논문지
    • /
    • 제10권3호
    • /
    • pp.1-8
    • /
    • 2007
  • 본 논문은 연관규칙 마이닝을 이용하여 성취도 평가 결과인 문항 응답 데이터를 대상으로 의미있는 문항간 관련성을 찾아낼 수 있는 도구를 개발하는데 연구의 목적이 있다. 제안된 도구는 의미없는 데이터들을 제거하여 보다 더 흥미(interestingness)있는 연관규칙을 생성하도록 하며, 이러한 결과는 교수-학습 방법이나 문제은행의 질을 향상시키는데 필요한 많은 정보를 제공할 수 있을 것이다. 이를 위하여 임의의 문항 응답 실험 데이터 집합을 생성하고 정보이론(Information Theory) 기반의 surprisal 이라는 도구를 개발하여 의미 없는 데이트를 제거한 후, 연관규칙을 추출하였다. 실험 데이터는 특정 문항간 관계가 의도적으로 빈발 생성되도록 만들어지며, 추출된 연관규칙이 그러한 문항간 관계를 적절히 반영하고 있는지의 여부를 평가하고, 원본 데이터와 지지도(support) 기반으로 추출된 연관규칙과 비교함으로써 surprisal 도구의 타당성을 증명하였다.

  • PDF

비연계 DB 테이블상에서의 데이터 추출을 위한 규칙 기반의 데이터 마이닝 기법 (A Rule-Based Data Mining Method among the Unrelated DataBase Table)

  • 김찬일;조대호
    • 한국지능시스템학회:학술대회논문집
    • /
    • 한국퍼지및지능시스템학회 2000년도 추계학술대회 학술발표 논문집
    • /
    • pp.220-224
    • /
    • 2000
  • 데이터 마이닝란 대량의 실제 데이터에서 묵시적이고 잠재적으로 유용한 정보를 추출하는 작업이다. 본 논문에서 서로 관계가 정의되지 않은 데이터베이스의 각 테이블간에서 필요한 정보를 추출 또는 가공하기 위해 데이터 마이닝 기법을 사용한다. 마이닝 기법인 연관 규칙은 어떤 사건이 일어나면 다른 사건이 일어나는 관련성을 의미하는 것이고, 제시된 규칙 기반의 데이터 마이닝 기법은 연관 규칙의 한 분야로서 데이터를 규칙 맞게 분류하는 기법이다. 이런 마이닝 기법을 구현하기 위해 인공지능 분야의 규칙 기반의 전문가 시스템을 사용하였고, 실 시스템인 GDS(Grating automatic Drawing System)에 적용하였다.

  • PDF

SIFT 알고리즘을 이용한 플리커 이미지 자동분류 (Flickr Image Classification using SIFT Algorism)

  • 장현웅;조수선
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2013년도 추계학술발표대회
    • /
    • pp.1394-1396
    • /
    • 2013
  • 플리커와 같은 대용량 영상저장 및 공유 사이트가 인기를 끌면서 이미지 정보의 양은 점점 늘어나고 있고 사용자들은 정확한 이미지 정보 검색을 요구하고 있다. 태그기반의 이미지 검색에서 정확도를 높이기 위하여 태그들의 의미적 연관성을 이용하는 등 다양한 연구가 진행되고 있다. 본 논문에서는 특징점 추출에 기반하여 이미지를 분류하는데 뛰어난 성능을 가진 SIFT알고리즘을 사용하여 플리커 이미지를 분류하는 방법을 제안한다. 위키피디아 의미 연관성을 이용해 태그 정보로 1차 분류된 데이터베이스에 SIFT알고리즘을 사용해본 결과 기존의 SURF를 사용한 연구보다 높은 정확성을 보이는 것을 확인하였다. 따라서 이 방법을 통하여 다양한 이미지를 더욱 정확하게 분류할 수 있을 것으로 기대한다.

이미지 단어집과 관심영역 자동추출을 사용한 이미지 분류 (Image Classification Using Bag of Visual Words and Visual Saliency Model)

  • 장현웅;조수선
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제3권12호
    • /
    • pp.547-552
    • /
    • 2014
  • 플리커, 페이스북과 같은 대용량 소셜 미디어 공유 사이트의 발전으로 이미지 정보가 매우 빠르게 증가하고 있다. 이에 따라 소셜 이미지를 정확하게 검색하기 위한 다양한 연구가 활발히 진행되고 있다. 이미지 태그들의 의미적 연관성을 이용하여 태그기반의 이미지 검색의 정확도를 높이고자 하는 연구를 비롯하여 이미지 단어집(Bag of Visual Words)을 기반으로 웹 이미지를 분류하는 연구도 다양하게 진행되고 있다. 본 논문에서는 이미지에서 배경과 같은 중요도가 떨어지는 정보를 제거하여 중요부분을 찾는 GBVS(Graph Based Visual Saliency)모델을 기존 연구에 사용할 것을 제안한다. 제안하는 방법은 첫 번째, 이미지 태그들의 의미적 연관성을 이용해 1차 분류된 데이터베이스에 SIFT알고리즘을 사용하여 이미지 단어집(BoVW)을 만든다. 두 번째, 테스트할 이미지에 GBVS를 통해서 이미지의 관심영역을 선택하여 테스트한다. 의미연관성 태그와 SIFT기반의 이미지 단어집을 사용한 기존의 방법에 GBVS를 적용한 결과 더 높은 정확도를 보임을 확인하였다.

차세대 네비게이션 서비스를 위한 기술개발 요인분석 (Factor Analysis on Development Technology for Next generation Navigation Service)

  • 진희채;조성익
    • 한국GIS학회:학술대회논문집
    • /
    • 한국GIS학회 2006년도 GIS/RS 공동춘계학술대회
    • /
    • pp.55-62
    • /
    • 2006
  • 본 논문에서는 차세대 네비게이션 서비스의 개발을 위하여 사용자 요구사항 분석에 기반한 기술개발 요인을 분석하고 이를 추출해 보고자 한다. 사용자 요구분석을 위하여는 네비게이션 서비스의 6대 기능 요소를 기준으로 소항목을 도출하여 실제 네비게이션 서비스 사용자들을 통하여 기능요소의 중요성을 척도분석 하도록 한다. 이렇게 분석된 요소들의 중요성 척도를 바탕으로 우성 기능요소 인자들을 추출하고 우성 기능요소 인자들을 바탕으로 상관분석을 수행한다. 우리는 상관 분석을 통하여 기능요소들간의 연관성을 찾아낼 수 있으며 여기서 요소들간의 연관성을 바탕으로 한 주요한 기술개발 요인을 찾아낼 수 있다. 이렇게 찾아진 기술개발 요인은 다시 한번 요인분석의 통계량 검정과정을 거쳐 의미 있는 요인이 추출되고 있는가 다시 한번 확인하게 된다.

  • PDF

캡슐내시경 검사의 진단 보조를 위한 연관성 기반 지식 모델 (Association-Based Knowledge Model for Supporting Diagnosis of a Capsule Endoscopy)

  • 황규본;박예슬;이정원
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제6권10호
    • /
    • pp.493-498
    • /
    • 2017
  • 캡슐내시경 검사는 일반적인 내시경의 접근이 어려운 소장을 관찰하는 데 특화되어 있다. 캡슐내시경 검사를 통한 진단 과정은 크게 적응증 판단, 내시경 검사, 진단의 세 단계로 이루어진다. 이 때, 진단을 위해 필요한 핵심 의료 정보로는 적응증, 병변, 질환 정보가 있다. 본 논문에서는 이와 같은 핵심 정보를 의미적 특징 정보, 이를 추출하는 과정을 의미 기반 분석이라 정의한다. 이와 같은 의미 기반 분석은 내시경 검사 전 과정에 걸쳐 수행된다. 먼저 캡슐내시경 검사에 앞서 환자의 증상을 확인하여 예상 질병 정보를 획득한다. 다음, 획득한 정보를 기반으로 캡슐내시경 검사를 실시한 후 발견된 병변의 위치와 진단을 위한 조직, 혈관, 산도와 같은 보조 정보들을 활용하여 최종 진단을 내린다. 이때, 예상 질병을 확인하기 위한 증상과 질병 간의 연관성이나 병변의 위치로부터 확인해야할 보조 정보 간의 해부학적 연관성이 고려되어야 한다. 그러나 기존의 내시경 관련 의료 정보 표준과 같은 지식 모델은 단순히 내시경 검사와 관련된 용어들이 나열된 형태로 의미적 연관성이 고려되지 않는다. 따라서 본 논문에서는 캡슐내시경 검사의 진단 보조를 위한 의미적 연관성 기반의 지식 모델을 제안한다. 제안하는 모델은 캡슐내시경 검사의 주요 대상 기관인 소장에 특화된 질병 모델과 해부학 모델로, 캡슐내시경 검사를 위한 효과적인 의료 정보 제공을 가능케 한다.

단어 간 의미적 연관성을 고려한 어휘 체인 기반의 개선된 자동 문서요약 방법 (An Improved Automatic Text Summarization Based on Lexical Chaining Using Semantical Word Relatedness)

  • 차준석;김정인;김판구
    • 스마트미디어저널
    • /
    • 제6권1호
    • /
    • pp.22-29
    • /
    • 2017
  • 최근 스마트 디바이스의 급속한 발달과 보급으로 인하여 인터넷 웹상에서 등장하는 문서의 데이터는 하루가 다르게 증가 하고 있다. 이러한 정보의 증가로 인터넷 웹상에서는 대량의 문서가 증가하여 사용자가 해당 문서의 데이터를 이해하는데, 어려움을 겪고 있다. 그렇기 때문에 자동 문서 요약 분야에서 문서를 효율적으로 요악하기 위해 다양한 연구가 진행 되고 있다. 효율적으로 문서를 요약하기 위해 본 논문에서는 텍스트랭크 알고리즘을 이용한다. 텍스트랭크 알고리즘은 문장 또는 키워드를 그래프로 표현하며, 단어와 문장 간의 의미적 연관성을 파악하기 위해 그래프의 정점과 간선을 이용하여 문장의 중요도를 파악한다. 문장의 상위 키워드를 추출 하고 상위 키워드를 기반으로 중요 문장 추출 과정을 거친다. 중요 문장 추출 과정을 거치기 위해 단어 그룹화 과정을 거친다. 단어그룹화는 특정 가중치 척도를 이용하여 가중치 점수가 높은 문장을 선별하여 선별된 문장들을 기반으로 중요 문장을 중요 문장을 추출하여, 문서를 요약을 하게 된다. 이를 통해 기존에 연구 되었던 문서요약 방법보다 향상된 성능을 보였으며, 더욱 효율적으로 문서를 요약할 수 있음을 증명하였다.