• 제목/요약/키워드: 단위모델

검색결과 2,104건 처리시간 0.031초

Sequence-to-sequence 기반 한국어 형태소 분석 및 품사 태깅 (Sequence-to-sequence based Morphological Analysis and Part-Of-Speech Tagging for Korean Language with Convolutional Features)

  • 이건일;이의현;이종혁
    • 정보과학회 논문지
    • /
    • 제44권1호
    • /
    • pp.57-62
    • /
    • 2017
  • 기존의 전통적인 한국어 형태소 분석 및 품사 태깅 방법론은 먼저 형태소 후보들을 생성한 뒤 수많은 조합에서 최적의 확률을 가지는 품사 태깅 결과를 구하는 두 단계를 거치며 추가적으로 형태소의 접속 사전, 기분석 사전 및 원형복원 사전 등을 필요로 한다. 본 연구는 기존의 두 단계 방법론에서 벗어나 심층학습 모델의 일종인 sequence-to-sequence 모델을 이용하여 한국어 형태소 분석 및 품사 태깅을 추가 언어자원에 의존하지 않는 end-to-end 방식으로 접근하였다. 또한 형태소 분석 및 품사 태깅 과정은 어순변화가 일어나지 않는 특수한 시퀀스 변환과정이라는 점을 반영하여 음성인식분야에서 주로 사용되는 합성곱 자질을 이용하였다. 세종말뭉치에 대한 실험결과 합성곱 자질을 사용하지 않을 경우 97.15%의 형태소 단위 f1-score, 95.33%의 어절단위 정확도, 60.62%의 문장단위 정확도를 보여주었고, 합성곱 자질을 사용할 경우 96.91%의 형태소 단위 f1-score, 95.40%의 어절단위 정확도, 60.62%의 문장단위 정확도를 보여주었다.

음소단위 코드북간의 확률적 전이 모델을 이용한 한국어 숫자음 인식에 관한 연구 (Isolated Korean Digits Recognition Using Stochasitc Transition Models With Phoneme-based VQ Codebooks)

  • 최환진;오영환
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1993년도 제5회 한글 및 한국어정보처리 학술대회
    • /
    • pp.149-157
    • /
    • 1993
  • 음성인식을 위해 다양한 방법들이 제안되어 있다. 본 연구에서는 음소단위 각각의 벡터 양자화된 코드북의 색인을 학습하는 HMM을 이용하여 한국어 숫자음을 대상으로 인식 실험을 수행하였다. 실험결과, 기존의 단어단위 HMM과 음소단위로 이루어진 유한상태기계(FSM)구조의 인식기에 비해 높은 인식율을 보였다.

  • PDF

UFID를 이용한 객체기반 수치지도 공간 데이터 모델 (Spatial Data Model of Feature-based Digital Map using UFID)

  • 김형수;김상엽;이양구;서성보;박기석;류근호
    • 한국공간정보시스템학회 논문지
    • /
    • 제11권1호
    • /
    • pp.71-78
    • /
    • 2009
  • 최근 ITS, 텔레매틱스, 유비쿼터스 등의 도입으로 공간 데이터는 다양한 환경에 응용되거나 활용 분야가 점차 증가하고 있고, 수치지도를 일반인들에게 제공함으로써 공간 데이터에 대한 수요가 급증하고 있다. 기존의 수치지도 관리 시스템은 도엽이라는 일정한 단위로 구분하여 공간 데이터를 관리하고 있기 때문에 데이터의 구축은 용이하지만 객체 단위의 데이터 구축, 관리 및 갱신을 효율적으로 지원하기 어렵다. 따라서 이 논문에서는 이러한 문제를 해결하기 위하여 객체기반의 연속적인 지형지물 표현, 공간 데이터의 객체별 이력관리 및 수시갱신이 가능한 객체기반의 데이터 모델을 제안하였다. 제안 모델에서 객체기반 공간 데이터는 각 지형지물에 UFID를 부여하고 도엽 단위로 구축된 수치지도 데이터의 조인 연산을 통해 연속적인 지형지물을 표현하였다. 아울러 갱신으로 인한 변경 데이터를 이력 DB에 시간간격 단위로 저장, 관리하였으며, 제안된 모델의 효율성을 검증하기 위하여 타당성을 분석하였다.

  • PDF

콘크리트의 기건단위질량을 고려한 콘크리트 압축강도의 크기효과 (Size Effect of Concrete Compressive Strength Considering Dried Unit Weight of Concrete)

  • 심재일;양근혁;이성태
    • 콘크리트학회논문집
    • /
    • 제27권2호
    • /
    • pp.169-176
    • /
    • 2015
  • 현재까지 발표된 크기효과법칙은 보통중량 콘크리트에 기반하고 있어 파괴특성이 다른 경량골재 콘크리트에서는 그 활용성이 의문시되고 있다. 따라서 이 연구에서는 콘크리트의 기건단위질량이 압축강도의 크기효과에 미치는 영향을 예측할 수 있는 모델을 개발하고 기존 연구결과들을 모아 데이터베이스화하였다. 그리고 비선형 파괴역학에 근거한 Ba${\check{z}}$ant와 Kim and Eo의 예측모델 및 이 연구에서 제안한 식에 대한 실험상수들을 결정한 후, 상호 비교 분석하였다. 그 결과, 콘크리트의 기건단위질량을 고려한 본 연구의 예측모델이 Ba${\check{z}}$ant와 Kim and Eo의 예측모델보다 경량골재 콘크리트에 대한 실험결과를 더 잘 예측하고 있음을 알 수 있었다.

농업용수 유역 물수지 분석 모델 개발 및 적용성 평가 (Development and applicability of water balance analysis model for agricultural watershed)

  • 윤동현;남원호;신지현;김경모;김상우;박진현
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2023년도 학술발표회
    • /
    • pp.71-71
    • /
    • 2023
  • 국가물관리기본법에 의거하여 통합물관리 정책에 부합하는 농어촌용수 계획 및 관리를 위해 유역 및 용수구역 단위의 농업용수 공급 및 수요 분석이 요구되고 있다. 현재 농업용수는 개수로 방식 용수공급체계 및 수문 직접조작에 의한 용수배분체계로 공급량 대비 사용량의 비율이 48%에 불과하다. 또한, 농경지 상류와 하류의 공급량 차이가 크게 발생하며, 경지면적 감소가 공급 필요량 감소로 연결되지 않는다. 농업용수의 경우 기존 국가유역수자원 모델 (K-WEAP, MODISM)을 통한 물수지 분석시 순물소모량 개념의 회귀수량 산정으로 공급량과 회귀량의 왜곡이 발생하고 있으며, 이에 따른 공급량 왜곡, 유역내 복잡하고 다양한 농업용수 공급체계를 하나의 가상저수지로 단순화함으로서 유역내 들녘별 농업용수 과부족 분석 불가능, 하천과 저수지 공급 우선순위 현장과 불일치 등 농어촌용수구역의 특성 및 실제 현장을 반영하는데 한계가 있다. 본 연구에서는 기존 물수지 분석 모델을 개선하기 위한 농업용수 유역 물수지 분석 모델의 방법론을 제시하고 시범지역 적용을 통한 검증 및 적용성을 평가하고자 한다. 경기 안서 농촌용수구역을 대상으로 농어촌공사 및 지자체 관리 저수지, 양수장, 취입보, 관정 등 총 106개 개별 시설물 자료를 구축하였으며, 39개 지구로 세분화하였다. 한국농어촌공사의 계측 공급량 기반 수요량 및 개별 시설물에 대한 물수지 분석 후 지구 단위, 소유역 단위, 표준유역 단위의 상하류 및 시설물을 연계한 유역 물수지 모델을 제시하고자 한다.

  • PDF

인식 단위로서의 한국어 음절에 대한 연구 (A Study on the Korean Syllable As Recognition Unit)

  • 김유진;김회린;정재호
    • 한국음향학회지
    • /
    • 제16권3호
    • /
    • pp.64-72
    • /
    • 1997
  • 본 논문에서는 한국어 대용량 어휘 인식 시스템에 적합한 인식 단위에 대하여 연구 및 실험하였다. 특히 현재 인식 시스템의 인식 단위로 주로 사용되는 음소와 한국어의 특징을 잘 나타내는 음절을 선택하고, 인식 실험을 통해 음절이 한국어 인식 시스템의 인식 단위로서 적합한가를 음소와 비교하였다. 객관적인 비교 인식 실험 결과를 제시하기 위하여 동일한 남성 화자의 음성 데이터를 수집하고, 수작업 음소 경계 및 레이블링 과정을 거친 음성 데이터 베이스를 구축하였다. 또한 각 인식 단위에 동일한 HMM 기반의 훈련 및 인식 알고리즘을 적용하기 위해 Entropic사의 HTK (HMM Tool Kit) 2.0을 사용하였다. 각 인식 단위의 훈련을 위해 5상태 3출력, 8상태 6출력 HMM 모델의 연속 HMM (Continuous HMM)을 적용하였고, PBW 3회분, POW 1회분을 훈련에 사용하고 PBW 1회분을 각 인식 단위로서 인식하는 화자 종속 단어 인식 실험을 구성하였다. 실험 결과 8상태 6출력 모델을 사용한 경우 음소 단위는 95.65%, 음절 단위는 94.41%의 인식률을 나타내었다. 한편 인식 속도에서는 음절이 음소보다 약 25% 빠른 것으로 나타났다.

  • PDF

객체 재사용성 향상을 위한 레거시 시스템 인터페이스기반 객체추출 기법 (A Technique of Object Extraction Based on the Legacy System Interface for the Improvement of Object Reusability)

  • 이창목;최성만;유철중;장옥배
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 가을 학술발표논문집 Vol.31 No.2 (2)
    • /
    • pp.472-474
    • /
    • 2004
  • 본 연구는 레거시 시스템의 인터페이스 정보로부터 의미 있는 정보를 파악하여 새로운 시스템에 통합될 수 있도록 하기 위한 기존 레거시 시스템의 인터페이스에 기반한 객체추출 기법을 제안한다. 본 논문에서 제안하는 객체추출 기법은 인터레이스 사용사례 분석 단계, 인터페이스 객체 분할 단계, 객체구조 모델링 단계, 객체 모델 통합 단계 등 4단계로 구성되어 있다. 인터페이스 사용사례 분석 단계는 인터페이스 구조, 레거시 시스템과 사용자간의 상호작용 정보를 획득하는 단계이다. 인터페이스 객체분할 단계는 인터페이스 정보를 의미 있는 필드들로 구분하는 단계이며, 객체구조 모델링 단계는 인터페이스 객체들간의 구조적 관계와 협력 관계를 파악하여 모델링 하는 단계이다. 마지막으로 객체 모델 통합 단계는 객체 단위의 단위 모델들을 통합하여 추상화된 정보를 포함한 상위 수준의 통합 모델을 유도하는 단계다. 객체추출 기법에 의해 생성된 객체 통합 모델은 역공학 기술자들의 레거시 시스템 이해와 레거시 시스템의 정보를 새로운 시스템에 적용하는데 있어 효율성을 극대화할 수 있다.

  • PDF

HMM을 이용한 연속음성인식 시스템의 화자적응화에 관한 연구 (A Study on Speaker Adaptation of HMM in a Continous Speech Recognition System)

  • 김상범
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1995년도 제12회 음성통신 및 신호처리 워크샵 논문집 (SCAS 12권 1호)
    • /
    • pp.100-104
    • /
    • 1995
  • 일반적으로 화자적응화는 이미 학습되어 있는 불특정 화자 모델을 표준모델로 하고 소량의 적응화용 발화로 추가적인 학습을 실시하여 특정화자 모델의 성능에 가깝게 하는 기술로서 연속음성 인식에 있어서 매우 중요하다. ML 추정법을 이용한 화자적응화는 카테고리마다 모델의 학습패턴들을 다수개 준비한 후 학습시에 일괄적으로 적용시켜 모델 파라메터를 추정 갱신하므로 추가되는 화자데이터에 대해 데이터를 모두 공급하여야 한다. 본 연구에서는 문발화 데이터의 음절단위를 자동추출한 후 추가되는 화자데이터가 주어질 때 마다 적응화할 수 있는 화자적응화 방법을 검토하였다. 이 방법은 문발화 데이터를 잘라내지 않고 음절 단위를 자동추출시켜 추가 데이터마다 최대 사후확률 추정법을 이용하여 적응화 시키는 것으로 수소의 데이터로서도 적응화를 가능하게 하는 것이다. 본 연구에서 사용되는 음성데이터는 신문사설에서 발췌한 연속음성 10문장을 사용하고, 이 음성 데이터중 6명분은 HMM 학습용으로 하고 나머지 3명분은 적응화용 및 평가용 데이터로 사용하였다. 6명의 화자를 DDCHMM으로 학습하고 나머지 3명분을 MAP법으로 적응화시켰다. 그 결과 적응전과 비교해 볼 때 약 32%의 인식율 향상을 얻을 수 있었다.

  • PDF

기능어용 음소 모델을 적용한 한국어 연속음성 인식 (Korean Continuous Speech Recognition using Phone Models for Function words)

  • 명주현;정민화
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2000년도 봄 학술발표논문집 Vol.27 No.1 (B)
    • /
    • pp.354-356
    • /
    • 2000
  • 의사형태소를 디코딩 단위로 한국어 연속 음성 인식에서의 조사, 어미, 접사 및 짧은 용언의 어간등의 단어가 상당수의 인식 오류를 발생시킨다. 이러한 단어들은 발화 지속시간이 매우 짧고 생략이 빈번하며 결합되는 다른 형태소의 형태에 따라서 매우 심한 발음상의 변이를 보인다. 본 논문에서는 이러한 단어들은 한국어 기능어라 정의하고 실제 의사형태소 단위의 인식 실험을 통하여 기능어 집합 1, 2를 규정하였다. 그리고 한국어 기능어에 기능어용 음소를 독립적으로 적용하는 방법을 제안했다. 또한 기능어용 음소가 분리되어 생기는 음향학적 변이들을 처리하기 위해 Gaussian Mixture 수를 증가시켜 보다 견고한 학습을 수행했고, 기능어들의 음향 모델 스코어가 높아짐에 따른 인식에서의 삽입 오류 증가를 낮추기 위해 언어 모델에 fixed penalty를 부여하였다. 기능어 집합1에 대한 음소 모델을 적용한 경우 전체 문장 인식률은 0.8% 향상되었고 기능어 집합2에 대한 기능어 음소 모델을 적용하였을 때 전체 문장 인식률은 1.4% 증가하였다. 위의 실험 결과를 통하여 한국어 기능어에 대해 새로운 음소를 적용하여 독립적으로 학습하여 인식을 수행하는 것이 효과적임을 확인하였다.

  • PDF

토픽 모델을 이용한 방송 대본 분석 사례 연구 (A case study of a broadcast script by using topic model)

  • 노윤석;곽창욱;김선중;박성배;이상조
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2015년도 제27회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.228-230
    • /
    • 2015
  • 방송 대본은 방송 콘텐츠에 대해 얻을 수 있는 가장 주요한 텍스트 데이터 중에 하나이다. 본 논문에서는 토픽 모델을 통해 방송 대본 분석을 수행하고 그 결과를 제시한다. 방송 대본을 토픽 모델로 학습하기 위해 대본의 장면 단위로 문서를 구성하여 학습하여 대본의 장면을 분석하고 등장인물 단위로 문서를 구성하여 등장인물을 분석하여 그 특징을 살펴본다. 토픽 모델을 사용하여 방송 대본을 분석하는 과정에서 방송 대본이 가지는 특징을 분석하고 그로부터 향후 연구방향에 대해 논의한다.

  • PDF