• 제목/요약/키워드: random fields

검색결과 416건 처리시간 0.025초

자동 띄어쓰기에서 글쓴이 의도를 반영한 자질의 활용 (Exploiting Features of Writer's Intent in Automatic Spacing)

  • 이정욱;김재훈
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2021년도 제33회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.528-531
    • /
    • 2021
  • 띄어쓰기에 대한 오류는 한국어 처리 전반에 영향을 주므로 자동 띄어쓰기는 필수적인 요소이다. 글쓴이의 대부분은 띄어쓰기 오류를 범하지 않으므로 글쓴이의 의도가 띄어쓰기 시스템에 반영되어야 한다. 그러나 대부분의 자동 띄어쓰기 시스템은 모든 띄어쓰기 정보를 제거하고 새로이 공백문자를 추가하는 방법으로 띄어쓰기를 수행한다. 이런 문제를 완화하기 위해서 본 논문에서는 기계학습에서 글쓴이의 의도가 반영된 자질을 추가하는 방법을 제안한다. 실험을 위해서 CRFs(Conditional Random Fields)를 사용하여 기존 시스템과 사용자의 의도를 반영한 띄어쓰기 시스템과의 성능을 비교하고 분석한다.

  • PDF

ELECTRA와 Label Attention Network를 이용한 한국어 개체명 인식 (Korean Named Entity Recognition Using ELECTRA and Label Attention Network)

  • 김홍진;오신혁;김학수
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2020년도 제32회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.333-336
    • /
    • 2020
  • 개체명 인식이란 문장에서 인명, 지명, 기관명 등과 같이 고유한 의미를 갖는 단어를 찾아 개체명을 분류하는 작업이다. 딥러닝을 활용한 연구가 수행되면서 개체명 인식에 RNN(Recurrent Neural Network)과 CRF(Condition Random Fields)를 결합한 연구가 좋은 성능을 보이고 있다. 그러나 CRF는 시간 복잡도가 분류해야 하는 클래스(Class) 개수의 제곱에 비례하고, 최근 RNN과 Softmax 모델보다 낮은 성능을 보이는 연구도 있었다. 본 논문에서는 CRF의 단점을 보완한 LAN(Label Attention Network)와 사전 학습 언어 모델인 음절 단위 ELECTRA를 활용하는 개체명 인식 모델을 제안한다.

  • PDF

인간 단백질 분석을 위한 빅 데이타 기반 RMF 방법 (A Big Data Based Random Motif Frequency Method for Analyzing Human Proteins)

  • 김은미;정종철;이배호
    • 한국전자통신학회논문지
    • /
    • 제13권6호
    • /
    • pp.1397-1404
    • /
    • 2018
  • 입체적 단백질 구조를 이용한 단백질의 분석은 3차원 데이타를 생성하기 위한 기술적인 어려움과 요구되는 높은 비용으로 인해 크게 발전하지 못하였다. 모티프(motif)는 단백질이나 유전자 염기서열의 단편(segment) 정보로 정의된다. 단순성 때문에 모티프는 다양한 분야에서 활발하고 폭넓게 응용되고 있다. 그러나 모티프 자체에 대한 포괄적인 이해와 연구는 미미하다. 이 논문이 가지는 중요성은 인공지능 기법을 활용하여 인간 단백질을 분석하는 방법으로 3가지 측면에서 찾아볼 수 있다. (1) 현재 단백질 데이타 뱅크 (PDB)에 저장된 모든 인간의 단백질 구조를, 이에 상응하는 효소위원회 (EC)의 데이타베이스와 단백질의 구조적 특성에 따른 분류 데이타베이스 (SCOP)를 연동하여, 단백질이 가지는 고유의 특성을 모티프를 응용한 새로운 방법으로 컴퓨터를 이용하여, 분석한 최초의 종합적이고 심층적인 인간 단백질의 분석법이다. (2) 본 연구는 모티프에 의해 생성된 새로운 단백질의 특성을 계층적 클러스터링을 이용하여 단백질이 가지는 고유한 특징을 패턴 분석법과 통계 그리고 단백질 기능 분석의 세 가지 범주로 단백질의 특성을 분석한다. (3) 임의로 생성된 모티프가 단백질 내에서 가지는 빈도에 대해 빅 데이타를 활용하여 모티프의 길이를 다양화시킴과 동시에 접촉 염기와 단백질의 기능을 다각도로 분석할 수 있는 임의 모티프 빈도 (RMF)를 이용한 단백질 분석 방법론을 제안한다.

데이터의 불균형성을 제거한 네트워크 침입 탐지 모델 비교 분석 (Experimental Comparison of Network Intrusion Detection Models Solving Imbalanced Data Problem)

  • 이종화;방지원;김종욱;최미정
    • KNOM Review
    • /
    • 제23권2호
    • /
    • pp.18-28
    • /
    • 2020
  • 컴퓨팅 환경의 발전에 따라 IT 기술이 의료, 산업, 통신, 문화 등의 분야에서 사람들에게 제공해주는 혜택이 늘어나 삶의 질도 향상되고 있다. 그에 따라 발전된 네트워크 환경을 노리는 다양한 악의적인 공격이 존재한다. 이러한 공격들을 사전에 탐지하기 위해 방화벽, 침입 탐지 시스템 등이 존재하지만, 나날이 진화하는 악성 공격들을 탐지하는 데에는 한계가 있다. 이를 해결하기 위해 기계 학습을 이용한 침입 탐지 연구가 활발히 진행되고 있지만, 학습 데이터셋의 불균형으로 인한 오탐 및 미탐이 발생하고 있다. 본 논문에서는 네트워크 침입 탐지에 사용되는 UNSW-NB15 데이터셋의 불균형성 문제를 해결하기 위해 랜덤 오버샘플링 방법을 사용했다. 실험을 통해 모델들의 accuracy, precision, recall, F1-score, 학습 및 예측 시간, 하드웨어 자원 소모량을 비교 분석했다. 나아가 본 연구를 기반으로 랜덤 오버샘플링 방법 이외에 불균형한 데이터 문제를 해결할 수 있는 다른 방법들과 성능이 높은 모델들을 이용하여 좀 더 효율적인 네트워크 침입 탐지 모델 연구로 발전시키고자 한다.

이수식 TBM 데이터와 랜덤포레스트를 이용한 일축압축강도 분류 예측에 관한 연구 (A Study on the Prediction of Uniaxial Compressive Strength Classification Using Slurry TBM Data and Random Forest)

  • 강태호;최순욱;이철호;장수호
    • 터널과지하공간
    • /
    • 제33권6호
    • /
    • pp.547-560
    • /
    • 2023
  • 최근 국내외에서 기계학습 기법으로 TBM 굴진 데이터와 지반데이터를 분석하는 지반 분류예측 연구가 증가하고 있다. 본 연구에서는 다양한 분야에서 널리 사용되고 있는 머신러닝 기법들 중 의사결정트리 기반 랜덤포레스트 모델을 3곳의 이수식 TBM 현장에서 획득한 기계 데이터와 지반 데이터에 적용하여 일축압축강도에 대한 다중 분류예측 연구를 하였다. 일축압축강도의 다중 분류 예측을 위해서 학습과 테스트 데이터를 7:3으로 분할하였으며, 최적의 파라미터를 선정을 위해서 분할 교차검증을 포함하는 그리드 서치를 활용하였다. 의사 결정 트리를 기반으로 한 랜덤 포레스트를 사용하여 일축압축강도 분류 학습을 수행한 결과, 다중 분류 예측 모델의 정확도는 학습 세트와 테스트 세트에서 각각 0.983 및 0.982로 모두 높게 나타났다. 다만, 클래스 간 데이터 분포의 불균형으로 인하여 클래스 4에서는 재현율이 낮게 평가되었다. 다양한 현장에서 획득한 일축압축강도의 측정 데이터양을 늘리는 연구가 필요한 것으로 판단된다.

목적지향 대화에서 화자 의도의 통계적 예측 모델 (A Statistical Prediction Model of Speakers' Intentions in a Goal-Oriented Dialogue)

  • 김동현;김학수;서정연
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제35권9호
    • /
    • pp.554-561
    • /
    • 2008
  • 사용자 의도 예측 기술은 음성인식기의 탐색 공간을 줄이기 위한 후처리 방법으로 사용될 수 있으며, 시스템 의도 예측 기술은 유연한 응답 생성을 위한 전처리 방법으로 사용될 수 있다. 이러한 실용적인 필요성에 따라 본 논문에서는 화행과 개념열의 쌍으로 일반화된 화자의 의도를 예측하는 통계 모델을 제안한다. 단순한 화행 n-그램 통계만을 이용한 기존의 모델과는 다르게 제안 모델은 현재 발화까지의 대화 이력을 다양한 언어 레벨의 자질 집합(화행과 개념열 쌍의 n-그램, 단서 단어, 영역 프레임의 상태정보)으로 표현한다. 그리고 추출된 자질 집합을 CRFs(Conditional Random Fields)의 입력으로 사용하여 다음 발화의 의도를 예측한다. 일정 관리 영역에서 실험을 수행한 결과, 제안 모델은 사용자의 화행과 개념열 예측에서 각각 76.25%, 64.21%의 정확률을 보였다. 그리고 시스템의 화행과 개념열 예측에서 각각 88.11%, 87.19%의 정확률을 보였다. 또한 기존 모델과 비교하여 29.32% 높은 평균 정확률을 보였다.

Do Inner Planets Modulate the Space Environment of the Earth?

  • Kim, Jung-Hee;Chang, Heon-Young
    • Journal of Astronomy and Space Sciences
    • /
    • 제31권1호
    • /
    • pp.7-13
    • /
    • 2014
  • Variabilities in the solar wind cause disturbances throughout the heliosphere on all temporal and spatial scales, which leads to changeable space weather. As a view of space weather forecasting, in particular, it is important to know direct and indirect causes modulating the space environment near the Earth in advance. Recently, there are discussions on a role of the interaction of the solar wind with Mercury in affecting the solar wind velocity in the Earth's neighborhood during its inferior conjunctions. In this study we investigate a question of whether other parameters describing the space environment near the Earth are modulated by the inner planets' wake, by examining whether the interplanetary magnetic field and the proton density in the solar wind observed by the Advanced Composition Explorer (ACE) spacecraft, and the geomagnetic field via the Dst index and Auroral Electrojet index (AE index) are dependent upon the relative position of the inner planets. We find there are indeed apparent variations. For example, the mean variations of the geomagnetic fields measured in the Earth's neighborhood apparently have varied with a timescale of about 10 to 25 days. Those variations in the parameters we have studied, however, turn out to be a part of random fluctuations and have nothing to do with the relative position of inner planets. Moreover, it is found that variations of the proton density in the solar wind, the Dst index, and the AE index are distributed with the Gaussian distribution. Finally, we point out that some of properties in the behavior of the random fluctuation are to be studied.

이천관측소에서 측정된 지자기장 및 지자기 전달함수의 시간적 변동성 (On the Temporal Variability of Geomagnetic Field and Transfer Function at Icheon Observatory)

  • 이덕기;권병두;윤용훈;양준모
    • 한국지구과학회지
    • /
    • 제25권7호
    • /
    • pp.604-614
    • /
    • 2004
  • 경기도 이천에서 2002년 7월부터 12까지 총 6개월 동안 측정된 지자기 3성분 자료를 이용하여 일별 각 성분의 스펙트럼, 지자기 전달함수의 크기, 위상, 오차 등을 계산하였다. 지자기 스펙트럼은 관측기간 동안 태양활동에 의한 무작위적 강약이 반복되는 형태를 보여주었고, 유의미한 시간적 변동은 존대하지 않았다. 지자기 전달함수의 크기, 위상, 오차의 경우, 주기 100초 이하와 주기 1000초 이상에서 부분적으로 무작위적인 경향을 확인할 수 있었으나, 시간에 따른 증감추세 없이 대체로 안정적인 값을 보였다. 이와 더불어, 전기장의 P$_{1}\;^{0}$ 소스(zonal harmonics) 가정을 통하여 시간에 따른 근사적인 겉보기 전기비저항의 변동을 조사하였는데, 근사된 전기비저항의 변화는 지각의 자체적인 물성 변화보다는 수평 자기장 성분의 시간적 강약에 지배적임을 확인할 수 있었다.

확률론적 침투해석을 통한 무한사면 파괴의 특성 연구 (Study on the Characteristics of Infinite Slope Failures by Probabilistic Seepage Analysis)

  • 조성은
    • 한국지반공학회논문집
    • /
    • 제30권10호
    • /
    • pp.5-18
    • /
    • 2014
  • 세계의 많은 지역이 강우에 의한 사면파괴가 취약하다. 사면파괴의 발생 메커니즘을 파악하기 위해 지금까지 다양한 방법들이 제안되어져 왔으나 현재 사용되는 방법들은 비균질한 지반분포와 수리학적 거동이 강우로 인한 사면파괴에 미치는 효과를 고려하지 못한다. 본 연구에서는 강우 시 토층의 두께에 따른 사면파괴의 발생 메커니즘을 연구하기 위하여 불투수 기반암 위에 존재하는 풍화 잔류토 사면에 대한 확률론적 사면안정 해석을 수행하였다. 불균질한 투수계수의 공간적 분포로 인한 불확실성이 강우침투에 의한 불포화 사면의 파괴에 미치는 영향을 고려하기 위하여 일차원 랜덤필드에 기초한 일련의 침투해석과 사면 안정해석을 수행하였다. 해석결과에 의하면 확률론적 해석법은 사면에 대한 강우의 침투 평가 시 투수계수의 공간적인 변동에 의하여 발생하는 다양한 파괴 패턴을 효과적으로 고려할 수 있음을 보여준다.

발달 독성학에서 비대칭 로짓 모형을 사용한 이진수 자료와 연속형 자료에 대한 결합분석 (Joint analysis of binary and continuous data using skewed logit model in developmental toxicity studies)

  • 김영화;황범석
    • 응용통계연구
    • /
    • 제33권2호
    • /
    • pp.123-136
    • /
    • 2020
  • 하나의 개체에서 여러가지 측정치가 동시에 관찰되는 경우는 다양한 연구 분야에서 흔히 나타난다. 발달 독성학 연구에서는 특정 독성 물질의 각기 다른 수준에 노출된 임신한 어미 쥐에 대해 기형인 태아의 존재와 태아의 무게가 동시에 측정된다. 이런 두 변수를 결합하여 모형화하는 것은 각기 독립적인 두 모형으로 분석하는 것보다 더 효율적인 결과를 낸다고 알려져 있다. 대부분의 결합 모형은 정규분포를 랜덤효과로 가정하여 분석한다. 그러나 발달 독성학 연구에서처럼 반응변수들의 분포가 독성 물질이 변함에 따라 불규칙하게 변하는 경우 정규분포의 가정으로는 그 특징을 잡아낼 수 없게 된다. 본 논문에서는 이진수 자료와 연속형 자료에 대해 비대칭 로짓 모형을 사용한 베이지안 결합모형을 제시한다. 본 모형은 비대칭 로짓 모형을 사용함으로써 반응변수의 분포의 형태가 독성 물질의 수준에 따라 대칭/비대칭의 형태를 자유롭게 띨 수 있는 장점을 가지고 있다. 모형의 적합성을 살펴보기 위해 발달 독성학 연구에서 독성 물질 DEHP에 적용하여 그 결과를 확인해본다.