• 제목/요약/키워드: Pattern Dictionary

검색결과 49건 처리시간 0.026초

주가지수 방향성 예측을 위한 주제지향 감성사전 구축 방안 (Predicting the Direction of the Stock Index by Using a Domain-Specific Sentiment Dictionary)

  • 유은지;김유신;김남규;정승렬
    • 지능정보연구
    • /
    • 제19권1호
    • /
    • pp.95-110
    • /
    • 2013
  • 최근 다양한 소셜미디어를 통해 생성되는 비정형 데이터의 양은 빠른 속도로 증가하고 있으며, 이를 저장, 가공, 분석하기 위한 도구의 개발도 이에 맞추어 활발하게 이루어지고 있다. 이러한 환경에서 다양한 분석도구를 통해 텍스트 데이터를 분석함으로써, 기존의 정형 데이터 분석을 통해 해결하지 못했던 이슈들을 해결하기 위한 많은 시도가 이루어지고 있다. 특히 트위터나 페이스북을 통해 실시간에 근접하게 생산되는 글들과 수많은 인터넷 사이트에 게시되는 다양한 주제의 글들은, 방대한 양의 텍스트 분석을 통해 많은 사람들의 의견을 추출하고 이를 통해 향후 수익 창출에 기여할 수 있는 새로운 통찰을 발굴하기 위한 움직임에 동기를 부여하고 있다. 뉴스 데이터에 대한 오피니언 마이닝을 통해 주가지수 등락 예측 모델을 제안한 최근의 연구는 이러한 시도의 대표적 예라고 할 수 있다. 우리가 여러 매체를 통해 매일 접하는 뉴스 역시 대표적인 비정형 데이터 중의 하나이다. 이러한 비정형 텍스트 데이터를 분석하는 오피니언 마이닝 또는 감성 분석은 제품, 서비스, 조직, 이슈, 그리고 이들의 여러 속성에 대한 사람들의 의견, 감성, 평가, 태도, 감정 등을 분석하는 일련의 과정을 의미한다. 이러한 오피니언 마이닝을 다루는 많은 연구는, 각 어휘별로 긍정/부정의 극성을 규정해 놓은 감성사전을 사용하며, 한 문장 또는 문서에 나타난 어휘들의 극성 분포에 따라 해당 문장 또는 문서의 극성을 산출하는 방식을 채택한다. 하지만 특정 어휘의 극성은 한 가지로 고유하게 정해져 있지 않으며, 분석의 목적에 따라 그 극성이 상이하게 나타날 수도 있다. 본 연구는 특정 어휘의 극성은 한 가지로 고유하게 정해져 있지 않으며, 분석의 목적에 따라 그 극성이 상이하게 나타날 수도 있다는 인식에서 출발한다. 동일한 어휘의 극성이 해석하는 사람의 입장에 따라 또는 분석 목적에 따라 서로 상이하게 해석되는 현상은 지금까지 다루어지지 않은 어려운 이슈로 알려져 있다. 구체적으로는 주가지수의 상승이라는 한정된 주제에 대해 각 관련 어휘가 갖는 극성을 판별하여 주가지수 상승 예측을 위한 감성사전을 구축하고, 이를 기반으로 한 뉴스 분석을 통해 주가지수의 상승을 예측한 결과를 보이고자 한다.

동형이의어 분별에 의한 한국어 의존관계 분석 (An Analysis of Korean Dependency Relation by Homograph Disambiguation)

  • 김홍순;옥철영
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제3권6호
    • /
    • pp.219-230
    • /
    • 2014
  • 의존관계 분석은 문장의 어절 간에 의존소-지배소를 결정하는 작업이다. 용언은 문형 및 하위범주화 정보의 선택제약에 의해 다른 어절과의 의존관계를 형성한다. 본 논문은 형태소 분석 단계에서 동형이의어 분별된 용언의 문형을 이용하여 용언의 의존관계를 분석하는 방법을 제안한다. 특히, 형태소분석 단계에서 품사 및 동형이의어 태깅을 위해 사용하는 단계별 전이모델의 학습사전을 재활용하여 {명사+격조사, 용언} 간의 의존관계를 확정하는 방안을 제안하고 그의 정확률 및 영향을 분석한다. 동형이의어가 부착되고 의존관계로 변경된 21개의 세종구문분석말뭉치를 이용하여 실험한 결과, 동형이의어 분별된 의존관계 분석 정확률이 80.38%로, 동형이의어가 분별되지 않은 의존관계분석에 비해 0.42%의 정확률 향상이 있었으며, 유의수준 1%의 검정통계량 Z는 ${\mid}Z{\mid}=4.63{\geq}z_{0.01}=2.33$으로 동형이의어 분별이 의존관계 분석에 영향이 있음을 보였다. 또한, 단계별 전이모델이 의존관계 분석 정확률에 약 7.14% 영향을 미치는 것을 알 수 있었다.

자동 문제 생성 기술을 이용한 한국어 어휘학습시스템 (Korean Word Learning System Using Automatic Question Generation Technique)

  • 최수일;임지희;최호섭;옥철영
    • 인지과학
    • /
    • 제17권4호
    • /
    • pp.271-286
    • /
    • 2006
  • 본 논문은 한국어 어휘에 대한 풍부한 정보를 담고 있는 한국어사전과 사용자 어휘지능망(User-Word Intelligent Network: U-WIN)등의 언어자원을 이용한 자동 문제 생성 기술을 소개하고, 이 기술을 이용한 한국어 어휘학습시스템을 제시한다. 대부분의 학습시스템에서 사용하는 문제 은행식 출제 방식의 문제점을 해소하기 위하여, 자동 문제 생성을 위한 한국어 어휘 문제의 유형을 8가지로 분류하고, 각 문제 유형별 자동 문제 생성 패턴을 구축하였다. 이러한 자동 문제 생성 패턴에 따라 언어자원이 가지고 있는 한국어 어휘의 형태적 정보와 의미적 정보를 이용하여 어휘 문제를 자동으로 출제하는 한국어 어휘학습 시스템을 구현하였다.

  • PDF

띄어쓰기 및 철자 오류 동시교정을 위한 통계적 모델 (A Joint Statistical Model for Word Spacing and Spelling Error Correction Simultaneously)

  • 노형종;차정원;이근배
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제34권2호
    • /
    • pp.131-139
    • /
    • 2007
  • 본 논문에서는 띄어쓰기 오류와 철자 오류를 동시에 교정 가능한 전처리기를 제안한다. 제시된 알고리즘은 기존의 전처리기 알고리즘이 각 오류를 따로 해결하는 데에서 오는 한계를 극복하고, 기존의 noisy-channel model을 확장하여 대화체의 띄어쓰기 오류와 철자 오류를 동시에 효과적으로 교정할 수 있다. N-gram과 자소변환확률 등의 통계적 방법과 어절변환패턴 사전을 이용하여 최대한 사전을 적게 이용하면서도 효과적으로 교정 후보들을 생성할 수 있다. 실험을 통해 현재 단계에서는 만족할 만한 성능을 얻지는 못하였지만 오류 분석을 통하여 이와 같은 방법론이 실제로 효용성이 있음을 알 수 있었고 앞으로 더 많은 개선을 통해 일상적인 대화체 문장에 대해서 효과적인 전처리기로서 기능할 수 있을 것으로 기대된다.

주문자 요구에 유연하게 대응하는 금형 부품의 전자 거래 (E-Machining of Engineering-to-Order Mold Park from e-Catalog)

  • 문두환;장광섭;한순흥;김준환;황호진
    • 한국전자거래학회지
    • /
    • 제12권1호
    • /
    • pp.1-24
    • /
    • 2007
  • 많은 금형 부품의 거래에서는, 고객이 표준화된 기성품에서 대해서, 제조업체의 제조 가능한 범위에서 설계 사양을 수정하여 주문하는 패턴이 일반적이다. 기존의 전자카탈로그 시스템은 기성품의 거래에 최적화 되어 있어서 이와 같은 주문품의 거래에 적용하기가 어렵다. 이와 같은 문제를 해결하기 위해서 본 논문에서는, 제품에 대한 설계 지식 및 제조 업체의 생산 지식을 적용하여, 전자카탈로그 시스템에서 주문품의 거래를 가능하게 하는, 주문자 설계변경을 통한 거래 (ETO: engineering-to-order) 방법을 제안한다. 그리고 ETO 방법의 구현을 위해 필요한 주요 요소기술에 대해서 분석하고, 금형 부품 중 하나인 이젝터핀과 몰드베이스에 대해서 실험한 결과에 대해서 소개한다.

  • PDF

기계번역용 한국어 품사에 관한 연구 (A Study on the Korean Parts-of-Speech for Korean-English Machine Translation)

  • 송재관;박찬곤
    • 한국컴퓨터정보학회논문지
    • /
    • 제5권4호
    • /
    • pp.48-54
    • /
    • 2000
  • 본 논문에서는 한ㆍ영 기계번역을 위한 한국어의 품사를 분류하였고 각 품사의 형태론적 특징을 고찰하였다. 한국어 표준문법에서 제시되는 품사 분류 기준은 의미, 기능, 형태의 세 가지 기준을 적용하고 있으며, 자연언어처리에서도 같은 분류 기준을 바탕으로 하고 있다. 품사 분류에 여러 가지 기준을 적용하는 것은 문법구조 이해 및 품사 분류를 어렵게 한다. 또한 한 영 기계번역시 품사의 불일치로 전처리가 필요하다. 이러한 문제를 해결하기 위하여 본 논문에서는 하나의 기준을 적용하여 품사를 분류하였다. 방법으로 한국어 표준문법에 의하여 말뭉치에 태깅하고 문제점을 찾아내며, 새로운 기준에 의하여 품사를 분류하였다. 본 논문에서 분류된 품사는 한국어 문장에서 통사적 역할이 동일하고, 영어에서의 사전 품사와 동일하며, 품사 분류의 모호성을 제거하고, 한국어의 문장 구조를 명확히 표현한다. 또한 한ㆍ영 기계번역시 패턴 매칭에 의한 목적언어 생성이 가능하게 한다.

  • PDF

자동 구축된 구문패턴사전과 규칙을 이용한 구묶음 (Chunking Using Automatic Constructed Syntactic Pattern Dictionary and Rule)

  • 임지희;최호섭;이정철;옥철영
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2004년도 제16회 한글.언어.인지 한술대회
    • /
    • pp.35-39
    • /
    • 2004
  • 본 논문은 실용적인 구문분석기의 전단계로서, 자동 구축된 구문패턴사전과 규칙을 이용하여 구묶음하는 방법을 제안한다. 우선 규칙은 구문분석 말뭉치(30,875어절)를 대상으로 자동 추출된 고빈도의 규칙(Rewriting Rule)을 본 논문에 맞게 수동으로 구축하였다. 규칙은 조건부, 행위부로 이루어진 이진 규칙(binary rule)의 형태를 이루며, 명사구(NP), 수식어구(AP, DP), 인용구(X), 용언구(VP, VC)을 대상으로 15개를 구축하였다. 그리고 구문패턴은 중심어와 중심어 선행 요소의 특성뿐만 아니라 중심어 후행 요소도 고려하여 형식화시킨 것으로, 중심어의 복합용언 여부에 따라 일반용언패턴과 본+보조용언패턴으로 구분한다. 부분적인 언어 현상의 처리보다는 실세계에서 사용되는 수많은 문장들에 내재되어 있는 매우 광범위한 언어 현상의 처리를 하기 위해, 구문패턴은 형태소주석 말뭉치(460만 어절)을 대상으로 자동 구축하였다. 구축된 구문패턴사전과 규칙을 이용하여 구묶음을 수행한 결과 정확율 83.09%가 나타났다.

  • PDF

디자이너 계한희의 카이(KYE) 컬렉션에 나타난 스테이트먼트 (The Statement in KYE Collection by Designer Kathleen Kye)

  • 이다예;박주희
    • 복식
    • /
    • 제67권4호
    • /
    • pp.1-20
    • /
    • 2017
  • Centered on Kathleen Kye, a designer who conveyed messages on social issues through her dresses, and established her own identity, this study aimed to examine what theme, method of expression and inner meaning her 'statement' had, as a way of expressing a critical awareness. After reviewing discussions by Duggan G. G. as well as dictionary definitions, statement fashion design can be defined as a work or fashion shows containing a message of a designer who is free from a particular trend or consumerism in various social issues. Statement fashion designers give opposing messages on social issues through their fashion collections. As a result, research shows that contemporary statement fashion designers are expressing themes of a fashion systems, fetishism, body image, collision, environment, as well as the socially disadvantaged by appropriation, reuse, slogan, metaphorical pattern and performance. Satire, awakening, challenge and support can be derived from the inner meaning of contemporary statement fashion design. In terms of the theme, method of expression and inner meaning, this study showed that KYE collection of the designer Kathleen Kye expresses critical awareness on the modern society. Research findings reveal that KYE collection include the following themes: long-term youth unemployment, conflict collision in war or on the Internet, fetishism by youth in a get-rich-quick fever, environmental issue causing destruction of an ecosystem by decrease in bee population, school violence and the socially disadvantaged related to alienated immigrants. Also, as a method of expression themes, such as metaphorical patterns, were used. The patterns used images including a skeleton, gun, heart, rope, plaster, homeless box, bee, honeycomb, chain and a slot machine. On the other hand, the inner meaning of statement in KYE collection showed satire on social issues, awakening on social issues unrecognized by the masses, and support for the socially disadvantaged.

조합회로에 대한 고장 진단 검사신호 생성 (Diagnostic Test Pattern Generation for Combinational Circuits)

  • 박영호;민형복;이재훈;신용환
    • 전자공학회논문지C
    • /
    • 제36C권9호
    • /
    • pp.44-53
    • /
    • 1999
  • 조합회로에 대하여 고장 진단 검사신호를 생성하는 것은 매우 어려운 문제로 남아있다. ISCAS85 c7552회로의 경우, 약 1억 개의 고장짝(Fault pair)을 가지고 있기 때문에 적은 노력과 시간을 사용하여 좀 더 많은 정보를 얻을 필요가 있다. 본 연구에서는 새로운 고장 진단 검사신호 생성 알고리즘이 제안되었고 구현되었다. 또 새로운 알고리즘과의 비교를 위하여 PODEM을 기본으로 하여 DIATEST 알고리즘을 구현하였다. 구현된 두 개의 알고리즘을 ISCAS85 회로에 적용하여 실행하였으며, 그 결과 두 개 알고리즘 모두 99%의 고장 진단율을 보였으나, 새로운 알고리즘은 각 고장의 검출 및 구별을 동시에 고려하기 때문에 고장 진단 사전과, 고장 진단 결정 트리의 제작시 더 많은 정보를 줄 수 있다. 또한 검사신호의 수를 비교했을 때 새로운 고장 진단 검사신호 생성 알고리즘이 절반이하의 개수만이 필요했다. 다만, vector 생성 속도에 있어서는 DIATEST가 우수하였다.

  • PDF

n-Gram 색인화와 Support Vector Machine을 사용한 스팸메일 필터링에 대한 연구 (A study on the Filtering of Spam E-mail using n-Gram indexing and Support Vector Machine)

  • 서정우;손태식;서정택;문종섭
    • 정보보호학회논문지
    • /
    • 제14권2호
    • /
    • pp.23-33
    • /
    • 2004
  • 인터넷 환경의 급속한 발전으로 인하여 이메일을 통한 메시지 교환은 급속히 증가하고 있다. 그러나 이메일의 편리성에도 불구하고 개인이나 기업에서는 스팸메일로 인한 시간과 비용의 낭비가 크게 증가하고 있다. 이러한 스팸메일에 대한 문제들을 해결하기 위하여 많은 방법들이 연구되고 있으며, 대표적인 방법으로 키워드를 이용한 패턴매칭이나 나이의 베이지안 방식과 같은 확률을 이용한 방법들이 있다. 본 논문에서는 기존의 연구에 대한 문제점을 보완하기 위하여 패턴 분류문제에 있어서 우수한 성능을 보이는 Support Vector Machine을 사용하여 정상적인 메일과 스팸메일을 분류하는 방안을 제시하였으며, 특히 n-Gram을 사용하여 생성된 색인어와 단어사전을 학습데이터 생성에 사용함으로서 효율적인 학습을 수행하도록 하였다. 결론에서는 제안된 방법에 대한 성능을 검증하기 위하여 기존의 연구 결과와 비교함으로서 제안된 방법의 성능을 검증하였다.