• Title/Summary/Keyword: 부분구문분석

Search Result 94, Processing Time 0.024 seconds

Study on Domain-dependent Keywords Co-occurring with the Adjectives of Non-deterministic Opinion (휴먼 오피니언 자동 분류 시스템 구현을 위한 비결정 오피니언 형용사 구문에 대한 연구)

  • Ahn, Ae-Lim;Han, Yong-Jin;Park, Se-Young;Nam, Jee-Sun
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2011.06c
    • /
    • pp.248-251
    • /
    • 2011
  • 본 연구에서는, 웹 문서로부터 특정 상품에 대한 의견 문장을 분석하는 오피니언 마이닝(Opinion Mining) 연구의 일환으로, 특히 함께 공기하는 자질 명사에 따라 그 극성 값이 달라지는 '비결정 오피니언어휘'의 처리를 위해서 도메인을 '맛집'으로 한정하여 공기하는 도메인 키워드의 목록을 결정하고, 이를 부분문법그래프(Local Grammar Graphs) 방법론을 통해서 이들 간의 어휘 통사적 관계를 결정해 주었다.

A Comparison of Programming Language Size for Programming Teacher (프로그래밍 교육자를 위한 프로그래밍 언어의 크기 비교)

  • Kim, Gunwoo;Woo, Gyun
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2013.05a
    • /
    • pp.1081-1084
    • /
    • 2013
  • 사람들은 모국어가 아닌 다른 언어를 배울 때 대부분 단어, 문법 등에 많은 부담을 느낀다. 그리고 이런 부분이 언어를 습득하는데 흥미를 반감시키고 쉽게 포기하게 하기도 한다. 다른 언어와 마찬가지로 프로그래밍 언어 또한 문법이 복잡하면 배우는 사람이 쉽게 지치기 마련이다. 이 논문에서는 프로그래밍 언어의 어휘적, 구문적 요소를 이용해 몇 가지 프로그래밍 언어의 크기를 비교하고, 어떤 언어가 프로그래밍 언어를 처음 배우는 사람에게 적합한지 보여준다. 그리고 어떤 순서로 프로그래밍 언어를 배우는 것이 효과적인지 프로그래밍 언어의 크기 측면에서 분석한다.

The Development of an Automatic Indexing System based on a Thesaurus (시소러스를 기반으로 하는 자동색인 시스템에 관한 연구)

  • 임형묵;정상철
    • Korean Journal of Cognitive Science
    • /
    • v.4 no.1
    • /
    • pp.213-242
    • /
    • 1993
  • During the past decades,several automatic indexing systems have been developed such as single term indexing.phrase indexing and thesaurus basedidndexing systems.Among these systems,single term indexing has been known as superior to others despte its simpicity of extracting meaningful terms.On the other hand,thesaurus based one has been conceived as producing low retrival rate ,mainly because thesauri do not usually have enough index terms.so that much of text data fail to be indexed if they do not match with any of index terms in thesauri.This paper develops a thesaurus based indexing system THINS that yields higher retrieval rate than other systems.by doing syntactic analysis of text data and matching them with index terms in thesauri partially.First,the system analyzes the input text syntactically by using the machine translation suystem MATES/EK and extracts noun phrases.After deleting stop words from noun phrases and stemming the remaining ones.it tries to index these with similar index terms in the thesaurus as much as possible. We conduct an experiment with CACM data set that measures the retrieval effectiveness with CACM data set that measures the retrieval effectuvenss of THINS with single term based one under HYKIS-a thesaurus based information retrieval system.It turns out that THINS yields about 10 percent higher precision than single term based one.while shows 8to9 percent lower recall.This retrieval rate shows that THINS improves much better than privious ones that only yields 25 or 30 percent lower precision than single term based one.We also argue that the relatively lower recall is cause by that CRCS-the thesaurus included in CACM datea set is very incomplete one,having only more than one thousand terms,thus THINS is expected to produce much higher rate if it is associated with currently available large thesaurus.

An Analysis of Complement Structures of a Sentence in Indonesian: Based on the Analyses of Current Studies (인도네시아어 보어 문장구조 분석: 학자들 시각 분석을 토대로)

  • IM, Youngho
    • The Southeast Asian review
    • /
    • v.28 no.4
    • /
    • pp.223-252
    • /
    • 2018
  • The purpose of this paper is to substantially analyse the patterns of complements considering the aspects of not only syntax but also morphology since the concept of complement has been used as a term to analyse the components of a sentence. However, it cannot be denied that there seemed to be limitations due to the partial explanation or different explanations of the same sentence. Thus, this paper aims at dealing with the close relation between sentential components and suffixes to examine the sentence patterns; subject, predicate, object, complement, and adjunct focusing on the terms of complement which has been seen problematic due to incomplete explanations and different interpretations of the same sentence. Finally, this paper synthesises various opinions of many scholars and integrates them to get explicit and practical patterns of complement of a sentence based on not only syntax but also morphology through close relation between sentential components and morphological suffixes.

Meta Information Retrieval using Sentence Analysis of Korean Dialogue Style (한국어 대화체 문장 분석을 이용한 메타 정보검색)

  • 박인철
    • Journal of the Korea Computer Industry Society
    • /
    • v.4 no.10
    • /
    • pp.703-712
    • /
    • 2003
  • Today, documents existing on internet by the development of communication network increase in number. And it is required the information retrieval system that can efficiently acquire the necessary information. Most information retrieval systems retrieve documents using a simple keyword or a boolean query of keywords. But, the method is not fit for novice users to use and has many difficulties than user's dialogue query from the viewpoint of convenience and precise understanding for query. So, this paper has an aim to suggest the method that will cope with above problems and to design and implement a meta query processing system for information retrieval using Korean dialogue sentences. The system implemented in this paper can generates a new boolean query for a given Korean dialogue sentence and resolve lexical ambiguities through morphological analysis, syntactic analysis and extension of query using thesaurus.

  • PDF

Development of Data Model for Design Information Representation of Steel Bridges (강교량 설계정보 표현을 위한 데이터모델 개발)

  • 정연석;이상호
    • Journal of the Computational Structural Engineering Institute of Korea
    • /
    • v.17 no.2
    • /
    • pp.105-117
    • /
    • 2004
  • In each industry field, many engineers have tried to develop integrated environments using information technology. The core technology in building integrated environments is the database based on standardized information. To meet the requirements, this study builds a database with detailed design information as a part of integrating digital information generated from every work of steel bridges. The data model used to build the database was developed based on the international standard, namely ISO/STEP. The data model is classified into geometric and non-geometric parts to represent the design information of steel bridges. The geometric parts are represented by a three dimensional solid model so that they may be able to reuse existing information. Also, the non-geometric parts represent information requirements that are analyzed by the development method of standard data model. To verify the data model, this study validates the syntax of the model on EXPRESS Engine and verifies the validation of the model by applying the design data of Hannam bridge to the database.

Robust Part-of-Speech Tagger using Statistical and Rule-based Approach (통계와 규칙을 이용한 강인한 품사 태거)

  • Shim, Jun-Hyuk;Kim, Jun-Seok;Cha, Jong-Won;Lee, Geun-Bae
    • Annual Conference on Human and Language Technology
    • /
    • 1999.10d
    • /
    • pp.60-75
    • /
    • 1999
  • 품사 태깅은 자연 언어 처리의 가장 기본이 되는 부분으로 상위 자연 언어 처리 부분인 구문 분석, 의미 분석의 전처리로 사용되고, 독립된 응용으로 언어의 정보를 추출하거나 정보 검색 등의 응용에 사용되어 진다. 품사 태깅은 크게 통계에 기반한 방법, 규칙에 기반한 방법, 이 둘을 모두 이용하는 혼합형 방법 등으로 나누어 연구되고 있다. 포항공대 자연언어처리 연구실의 자연 언어 처리 엔진(SKOPE)의 품사 태깅 시스템 POSTAG는 미등록어 추정이 강화된 혼합형 품사 태깅 시스템이다 본 시스템은 형태소 분석기, 통계적 품사 태거, 에러 수정 규칙 후처리기로 구성되어 있다. 이들은 각각 단순히 직렬 연결되어 있는 것이 아니라 형태소 접속 테이블을 기준으로 분석 과정에서 형태소 접속 그래프를 생성하고 처리하면서 상호 밀접한 연관을 가진다. 그리고, 미등록어용 패턴사전에 의해 등록어와 동일한 방법으로 미등록어를 처리함으로써 효율적이고 강건한 품사 태깅을 한다. 한편, POSTAG에서 사용되는 태그세트와 한국전자통신연구원(ETRI)의 표준 태그세트 간에 양방향으로 태그세트 매핑을 함으로써, 표준 태그세트로 태깅된 코퍼스로부터 POSTAC를 위한 대용량 학습자료를 얻고 POSTAG에서 두 가지 태그세트로 품사 태깅 결과 출력이 가능하다. 본 시스템은 MATEC '99'에서 제공된 30000어절에 대하여 표준 태그세트로 출력한 결과 95%의 형태소단위 정확률을 보였으며, 태그세트 매핑을 제외한 POSTAG의 품사 태깅 결과 97%의 정확률을 보였다.

  • PDF

Introduction of SATS for Verification of Flight Software on Spacecraft Development Tool (위성전자전산시스템 개발검증장비의 탑재소프트웨어 시험을 위한 자동 시험 스크립트 프로그램 소개)

  • 이재승;최종욱;채동석;이종인;김학정
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2004.10c
    • /
    • pp.511-513
    • /
    • 2004
  • 위성의 부분체 또는 탑재컴퓨터 및 탑재소프트웨어에 대한 검증시험을 수행하기 위해서는 위성개발에 사용하며 그 기능이 검증된 상용프로그램을 사용하는 것이 일반적이다. 그러나 위성 영령의 전송 및 텔레메트리 데이터의 전송과 분석을 위한 프로그램은 위성에 사용되는 종류 및 포맷에 따라 다양한 형태로 수정되어야 하기 때문에 자체 제작한 프로그램을 사용하게 된다. 99년에 발사되어 성공적으로 임무를 수행하고 있는 다목적실용위성 1호 및 현재 개발이 진행 중인 다목적실용위성 2호의 개발과정에서는 LEX와 YACC이라는 구문분석기를 이용한 VTSP(Verification Test Script Parser) 프로그램이 탑재소프트웨어의 검증시험에 사용되었다. VT5P는 실시간 데이터 전송 및 분석이 가능하지만 UNIX 환경에서만 실행되므로 윈도우 환경에서 작업하던 일반 사용자들에게는 익숙하지 않은 시험환경을 제공하여 텍스트 기반의 작업이 필요하므로 시험 수행에 여러 어려움들이 발생한다. 이러한 단점들을 보완하기 위하여 윈도우 기반의 검증시험 프로그램인 SATS(Spacecraft Automatic Test Script)를 개발하였다. 본 논문에서는 대부분의 사용자들에게 익숙한 윈도우 환경을 제공하며 이더넷을 통하여 장소에 상관없이 다중의 개발자가 시험을 수행할 수 있는 SATS의 개발현황과 수행환경에 대하며 소개한다.

  • PDF

Variable Length Passage Retrieval for Q&A System (질의 응답 시스템을 위한 가변 길이 단락 검색)

  • Lee, Young-Shin;Hwang, Young-Sook;Rim, Hae-Chang
    • Annual Conference on Human and Language Technology
    • /
    • 2002.10e
    • /
    • pp.259-266
    • /
    • 2002
  • 질의 응답 시스템에서 보다 정확하게 정답을 판별하기 위해서는 구문분석 혹은 의미분석 등과 같은 복잡도가 높은 분석작업이 요구되며, 이러한 질의 응답 시스템 성능의 상한을 결정하는 검색 시스템은 가급적 적은 양의 검색 결과를 내주어서 질의 응답 시스템이 처리해야 할 작업량에 대한 부담을 덜어주어야 한다. 본 논문에서는 이러한 요구를 만족시키는 검색 시스템으로 가변 길이 단락 검색 시스템(variable length passage retrieval system)을 제안한다. 제안하는 검색 시스템은 질의에 대한 정답을 포함하고 있을 가능성이 있는 텍스트 영역은 질의에 따라 그 크기가 다를 것이라는 가정으로부터 출발한다. 그러므로 문서 전체를 검색하거나 고정 길이 단락으로 나누어져 색인되어 있는 부분 문서들을 검색하는 기존의 검색 방법과 달리, 제안된 시스템은 문서에서 임의의 길이로 이루어진 단락을 대상으로 동적인 단락 검객을 수행한다. TREC QA track의 질의집합 중 1번부터 100번까지의 질의에 대해 실험을 수행한 견과, 문서 검색 시스템이나 고정 길이 단락 검색 시스템은 상위 1000개의 문장까지 검색을 하였을 때 각각 96%, 98%의 재현율을 보인 반면, 가변 길이 단락 검색 시스템은 800개의 문장만으로도 98%의 재현율을 보이고, 900개의 문장을 검색하였을 경우 100%의 재현율을 보였다.

  • PDF

Application portable Part-Of-Speech tagger mapping (응용을 위한 품사 태깅 시스템의 매핑)

  • Kim, Jun-Seok;Cha, Jung-Won;Lee, Geun-Bae
    • Annual Conference on Human and Language Technology
    • /
    • 2000.10d
    • /
    • pp.368-375
    • /
    • 2000
  • 품사 태깅 시스템은 자연 언어 처리의 가장 기본이 되는 부분으로 상위 자연 언어 처리 분야인 구문분석, 의미분석의 전처리로 사용되거나, 기계번역, 정보검색이나 음성인식 및 합성 등과 같은 많은 응용 시스템을 위해서도 필요하다. 이렇게 여러 가지 목적을 위해 품사 태깅 시스템은 존재하는데, 각각의 응용을 위해서 최적화된 태깅 시스템을 따로 구성하기도 하고, 하나의 태깅 시스템을 여러 가지 응용을 위해서 사용하기도 한다. 이때, 문제가 되는 것 중에 하나는 각 응용마다 요구하는 품사 태그 세트가 다르다는 것이다. 품사 태그세트가 고정되어 있다면 어떤 응용을 위해서는 사용되는 품사 태그세트가 너무 적어서 문제가 되고, 반대로 품사태그세트가 너무 많아서 시스템의 수행속도가 중요시되는 응용에서 성능저하의 요인이 되기도 한다. 본 논문에서는 하나의 태깅 시스템의 품사태그세트를 조절할 수 있도록 하여 몇 가지 응용시스템에 맞게 최적화시킬 수 있는 방법론을 제시하고 실험을 통해서 시스템의 성능, 유지보수 및 시스템의 여러 리소스 관리 측면에서도 가장 효율적인 방법론임을 입증하고자 한다.

  • PDF