• 제목/요약/키워드: Entity

검색결과 2,079건 처리시간 0.035초

효율적 대화 정보 예측을 위한 개체명 인식 연구 (A Study on Named Entity Recognition for Effective Dialogue Information Prediction)

  • 고명현;김학동;임헌영;이유림;지민규;김원일
    • 방송공학회논문지
    • /
    • 제24권1호
    • /
    • pp.58-66
    • /
    • 2019
  • 대화 문장 내 고유명사와 같은 개체명에 대한 인식 연구는 효율적 대화 정보 예측을 위한 가장 기본적이며 중요한 연구 분야이다. 목적 지향 대화 시스템에서 가장 주요한 부분은 대화 내 객체가 어떤 속성을 가지고 있느냐 하는 것을 인지하는 것이다. 개체명 인식모델은 대화 문장에 대하여 전처리, 단어 임베딩, 예측 단계를 통해 개체명 인식을 진행한다. 본 연구는 효율적인 대화 정보 예측을 위해 전처리 단계에서 사용자 정의 사전을 이용하고 단어 임베딩 단계에서 최적의 파라미터를 발견하는 것을 목표로 한다. 그리고 설계한 개체명 인식 모델을 실험하기 위해 생활 화학제품 분야를 선택하고 관련 도메인 내 목적 지향 대화 시스템에서 적용 할 수 있는 개체명 인식 모델을 구축하였다.

개인정보 비식별화를 위한 개체명 유형 재정의와 학습데이터 생성 방법 (Re-defining Named Entity Type for Personal Information De-identification and A Generation method of Training Data)

  • 최재훈;조상현;김민호;권혁철
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2022년도 춘계학술대회
    • /
    • pp.206-208
    • /
    • 2022
  • 최근 빅데이터 산업이 큰 폭으로 발전하는 만큼 개인정보 유출로 인한 사생활 침해 문제의 관심도 높아졌다. 자연어 처리 분야에서는 이를 개체명 인식을 통해 자동화하려는 시도들이 있었다. 본 논문에서는 한국어 위키피디아 문서의 본문에서 비식별화 정보를 지닌 문장을 식별해 반자동으로 개체명 인식 데이터를 구축한다. 이는 범용적인 개체명 인식 데이터에 반해 비식별화 대상이 아닌 정보에 대해 학습되는 비용을 줄일 수 있다. 또한, 비식별화 정보를 분류하기 위해 규칙 및 통계 기반의 추가적인 시스템을 최소화할 수 있는 장점을 가진다. 본 논문에서 제안하는 개체명 인식 데이터는 총 12개의 범주로 분류하며 의료 기록, 가족 관계와 같은 비식별화 대상이 되는 정보를 포함한다. 생성된 데이터셋을 이용한 실험에서 KoELECTRA는 0.87796, RoBERTa는 0.88575의 성능을 보였다.

  • PDF

자질 보강과 양방향 LSTM-CNN-CRF 기반의 한국어 개체명 인식 모델 (Bi-directional LSTM-CNN-CRF for Korean Named Entity Recognition System with Feature Augmentation)

  • 이동엽;유원희;임희석
    • 한국융합학회논문지
    • /
    • 제8권12호
    • /
    • pp.55-62
    • /
    • 2017
  • 개체명 인식(Named Entity Recognition) 시스템은 문서에서 인명(PS), 지명(LC), 단체명(OG)과 같은 개체명을 가지는 단어나 어구를 해당 개체명으로 인식하는 시스템이다. 개체명 인식을 하기위한 전통적인 연구방법으로는 hand-craft된 자질(feature)을 기반으로 모델을 학습하는 통계 기반의 모델이 있다. 최근에는 딥러닝 기반의 RNN(Recurrent Neural Networks), LSTM(Long-short Term Memory)과 같은 모델을 이용하여 문장을 표현하는 자질을 구성하고 이를 개체명 인식과 같이 순서 라벨링(sequence labeling) 문제 해결에 이용한 연구가 제안되었다. 본 연구에서는 한국어 개체명 인식 시스템의 성능 향상을 위해, end-to-end learning 방식이 가능한 딥러닝 기반의 모델에 미리 구축되어 있는 hand-craft된 자질이나 품사 태깅 정보 및 기구축 사전(lexicon) 정보를 추가로 활용하여 자질을 보강(augmentation)하는 방법을 제안한다. 실험 결과 본 논문에서 제안하는 방법에 따라 자질을 보강한 한국어 개체명 인식 시스템의 성능 향상을 확인하였다. 또한 본 연구의 결과를 한국어 자연어처리(NLP) 및 개체명 인식 시스템을 연구하는 연구자들과의 향후 협업 연구를 위해 github를 통해 공개하였다.

목적성취에 대한 프라이드 유형별 노력과 자질의 귀인과 사고의 틀 (Attribution of Goal Achievement to Efforts and Traits according to Pride Types and Lay Theory)

  • 최낙환
    • 유통과학연구
    • /
    • 제14권2호
    • /
    • pp.57-63
    • /
    • 2016
  • Purpose - The present study aimed to investigate the difference between entity theorists and incremental theorists in the extent of attributing efforts and traits of consumers for the realization of pursued goals. Furthermore, the present study was conducted to determine the difference depending on circumstances. In this regard, the circumstances where consumers felt pride were divided into those in which important goals and ordinary life goals were achieved. Research design, data, and methodology - An empirical study was performed, which was divided into group 1 and 2. Group 1 is the experimental group concerned with the important goal achievement, and group 2 is the control group related to daily ordinary goal achievement. 80 college students were assigned to each group, respectively. The empirical study for each of the two groups was performed respectively by means of questionnaire survey. In the experimental group, t-test was used to verify the hypotheses for the empirical study. In the circumstances of the control group, t-test was also used to examine whether the results were same as those shown from the analysis of experimental group data or not. Results - According to the group 1 and 2, the t-test of the empirical study showed that entity theorists tended to attribute the achievements of goals to their traits more than incremental theorists did, whereas the incremental theorists tended to attribute achievements of goals to their efforts more than entity theorists did in the important goals-achieved circumstance. In the circumstance of daily life goals-achieved, additional questionnaire survey and analysis were conducted, however, there was no difference between incremental and entity theorists in regard to attributing realization of goals to their efforts, and it leads to assess the difference in the meaning of invested efforts between important goal and ordinary goal achievement. Conclusions - Considering that the feeling of consumers has been regarded as one of the significant factors in marketing mix management, the results of this study are considered as significant implications for management. The implications can be said that when incremental consumers feel authentic pride in the important goals-achieved circumstance, marketers are requested to emphasize the fact that the efforts of consumers have contributed to realization of the important goals. By contrast, when consumers feel hubristic pride in both circumstances, marketers are requested to approach to entity-oriented consumers by way of trait. Authentic and hubristic pride are pervasive and engendered by important events or daily routines, and they could have effect on delaying making decisions. Therefore, it is necessary for future research to examine the unexplored difference of effect between incidental authentic and hubristic pride on consumer's self-control. In particular, future researches are related to the extent of difference in attributing efforts and traits. The consumers'realization for the previously pursued goals between entity theorists and incremental theorists affects their present or long distant decisions in self-control dilemmas. The consumers are faced with choosing one between virtuous long term- related option and vice immediate option.

개체명 인식 코퍼스 생성을 위한 지식베이스 활용 기법 (Automatic Training Corpus Generation Method of Named Entity Recognition Using Knowledge-Bases)

  • 박영민;김예진;강상우;서정연
    • 인지과학
    • /
    • 제27권1호
    • /
    • pp.27-41
    • /
    • 2016
  • 개체명 인식은 미리 정의된 개체 범주로 텍스트의 요소를 분류하는 과정을 의미하며 최근 주목 받고 있는 음성 비서 서비스 등 다양한 응용 분야에 널리 활용되고 있다. 본 논문에서는 지식베이스를 사용하여 개체명 인식 코퍼스를 자동으로 생성하는 방법을 제안한다. 지식베이스의 종류에 따라 두 가지 방법을 적용하며 그 중 첫 번째 방법은 위키피디아를 기반으로 위키피디아 본문의 문장에 개체명 표지를 부착하여 학습 코퍼스를 생성하는 방법이다. 두 번째 방법은 인터넷으로부터 다양한 형태의 문장을 수집하고 다양한 개체들 간의 관계를 데이터베이스에 보유 중인 프리베이스를 이용하여 개체명 표지를 부착하는 방법으로 학습 코퍼스를 생성한다. 자동 생성된 학습 코퍼스의 질과 본 논문에서 제안하는 학습 코퍼스 자동 생성 기법을 평가하기 위해 두 가지로 실험했다. 첫 번째, 다른 형태의 지식베이스인 위키피디아와 프리베이스(Freebase)를 기반으로 생성된 학습 코퍼스의 표지 부착 성능을 수동으로 측정하여 코퍼스의 질을 평가하였다. 두 번째, 각 코퍼스로 학습된 개체명 인식 모델의 성능을 통해 제안하는 학습 코퍼스 자동 생성 기법의 실용성을 평가하였다. 실험을 통해 본 방법이 타당함을 증명하였으며 특히 실제 응용에서 많이 사용되는 웹 데이터 환경에서 의미 있는 성능 향상을 보여주었다.

  • PDF

능동 학습 기법을 활용한 개체명 사전 반자동 구축 도구 개발 (Development of Semi-automatic Construction Tool for Named Entity Dictionary based on Active Learning)

  • 윤보현;오효정
    • 컴퓨터교육학회논문지
    • /
    • 제18권6호
    • /
    • pp.81-88
    • /
    • 2015
  • 웹 3.0 시대의 도래와 IoT(Internet of Things) 기술을 발달에 따라 생산된 정보의 양 역시 기하급수적으로 늘고 있다. 본 논문에서는 이 중에서 사용자의 관심도가 높은 개체명(NE: Named Entity) 사전을 반자동으로 구축하는 도구를 개발하였다. 제안된 방법은 초기 학습 모델을 통해 인식된 결과로부터 오류 후보를 자동으로 생성하고 사용자로부터 최소한의 보정 작업을 수행하여 이를 재학습한다, 특히 공개지식자원인 위키피디아 내의 다양한 메타데이터의 특성을 활용하여 능동 학습에 필요한 학습 예제 작성을 위한 수작업을 최소화하고자 한다. 도구 활용 효과를 분석한 결과, 능동 학습을 통해 자동 인식 결과의 오류의 약 68.6%가 보정됨을 보였다.

다중 개체 중심적 통합 방식의 버티컬 검색 - 학술 연구 정보 분석 서비스에의 적용 사례를 중심으로 - (Vertical Search Based on Multiple Entity-centric Unification)

  • 정한민;이미경;성원경;류범종
    • 한국HCI학회:학술대회논문집
    • /
    • 한국HCI학회 2009년도 학술대회
    • /
    • pp.253-256
    • /
    • 2009
  • 본 논문은 기존의 단일 분야를 대상으로 서비스되고 있는 버티컬 검색의 한계를 지적하고 사용자의 검색 욕구를 보다 충실히 만족시키기 위해, 여러 분야 (개체 유형)들을 포함하는 실체 (개체)들이나 단일 분야 내의 실체들을 포함하는 질의어를 처리할 수 있는 다중 개체 중심적 통합 방식의 버티컬 검색을 제시한다. 이를 위해, 질의어를 분석하여 개체 유형 간 결합이 필요한 지를 판단한 후 동적으로 상황에 맞는 서비스 컴포넌트들을 결합하는 기술과 개체 유형 별 필드들을 구축하고 필드 별 검색을 수행하는 기술을 도입하였다. 버티컬 검색 서비스 분야로서 학술 연구 정보를 대상으로 하여 약 453,000 편의 해외 학술 저널 논문을 메타데이터 기반으로 등록하였으며, 개체 유형으로는 연구 주제와 연구자를 다루고 있다.

  • PDF

확장된 개체 관계 모델 기반 XML의 개념적 모델 비교 (Comparison of Conceptual Models of XML Based on Extended Entity Relationship Model)

  • 김영웅
    • 한국인터넷방송통신학회논문지
    • /
    • 제19권6호
    • /
    • pp.197-202
    • /
    • 2019
  • XML은 문서의 표현 및 교환을 위한 사실상의 표준으로 자리 잡아 왔으며, 논리적 데이터 모델로 널리 사용되어 왔다. XML을 논리적 모델로 사용하기 위해서는 XML이 갖는 의미론에 대한 개념적 모델이 필요하다. 하지만, XML의 고유한 특성을 표현하기 위해 기존의 개념적 모델인 개체관계 모델이나 UML 등을 이용하여 모델을 확장하여 사용해 왔지만 현재까지 표준화된 모델은 없다. 본 논문은 데이터베이스 분야 관점에서 개체 관계 모델을 확장하여 XML의 개념적 모델로 사용하는 대표적인 모델들의 특징을 비교한다. 이를 위해 XML의 개념적 모델이 충족해야 할 요구사항들을 제시하고, 이를 근거로 각 모델들의 접근방식을 비교한다.

이력 영상의 시간 간격과 연관성에 의한 데이터 관리 기법 (Management of Historical Images by Time Interval and Interrelation)

  • 윤홍원
    • 한국멀티미디어학회논문지
    • /
    • 제4권6호
    • /
    • pp.543-553
    • /
    • 2001
  • 본 논문에서는 기존 의료 영상 이동 방법에서 생기는 문제점을 해결하기 위해서 의료 영상 데이터의 관리기법을 제안하였다. 의료영상 데이터의 관리기법으로써 EAT(Expanded Average Transaction time) 데이터 이동 기법과 시간 연관성 기반 데이터 저장 방법을 제안하였다. EAT데이터 이동 기법에서는 각 저장 영역에 저장되는 개체 버전을 구분하는 경계값과 각 영역에 저장되는 개체 버전을 정의하였다 시간 연관성에 기반한 데이터 저장 방법에서는 임의 두 개체 버전에 대한 겹침의 정도와 간격의 정도를 정의하였고, 두 값을 통합하여 개체 버전을 저장 장치에 배치하는 방법을 보였다. 시간 질의의 비율을 변화시키면서 클러스터의 참조 회수를 비교한 실험에서 기존의 방법보다 제안한 방법의 클러스터 참조 회수가 적게 나타났다.

  • PDF

인테리어 디자인에서 커뮤니케이션 관계구조와 표현방법에 관한 연구 - 실무 디자인 프로세스 커뮤니케이션 중심으로 - (A Study on the Communication Relationship Structure and Expression Methods in Interior Design - Focused on the Practical design process of communication -)

  • 서지혜;홍일태
    • 한국실내디자인학회논문집
    • /
    • 제22권5호
    • /
    • pp.199-206
    • /
    • 2013
  • Design is one of diverse human communication activities. Development of technologies has led to execution of more active design communication functions, stirring social and cultural changes. The concept of design communication has become stronger by overcoming the limitations of verbal communication and expanding the methods of communication. These social changes are highlighted In the design of modern space. Even though communication in interior design activities is so important, detailed studies on communication of each entity are still very insufficient. Design communication refers to tools and activities for overall communications in the design process. In design activities, relevant communication is indispensible. Therefore, studies on practical communication methods are essential for accurate communication of content that has to be shared in the results or in the process of obtaining the results, rather than only focusing on the future techniques and functions of design. In other words, improving the efficiency of interior design communication requires establishing a communication relationship structure of each entity, which calls for proper expression methods depending on each entity. Therefore, this study is aimed at exploring efficient expression methods in line with the relationship structure of each entity in the interior design process.