• Title/Summary/Keyword: Domain Adaptation

Search Result 155, Processing Time 0.025 seconds

Language Model Adaptation Based on Topic Probability of Latent Dirichlet Allocation

  • Jeon, Hyung-Bae;Lee, Soo-Young
    • ETRI Journal
    • /
    • 제38권3호
    • /
    • pp.487-493
    • /
    • 2016
  • Two new methods are proposed for an unsupervised adaptation of a language model (LM) with a single sentence for automatic transcription tasks. At the training phase, training documents are clustered by a method known as Latent Dirichlet allocation (LDA), and then a domain-specific LM is trained for each cluster. At the test phase, an adapted LM is presented as a linear mixture of the now trained domain-specific LMs. Unlike previous adaptation methods, the proposed methods fully utilize a trained LDA model for the estimation of weight values, which are then to be assigned to the now trained domain-specific LMs; therefore, the clustering and weight-estimation algorithms of the trained LDA model are reliable. For the continuous speech recognition benchmark tests, the proposed methods outperform other unsupervised LM adaptation methods based on latent semantic analysis, non-negative matrix factorization, and LDA with n-gram counting.

한국어 의미역 결정을 위한 Korean PropBank 확장 및 도메인 적응 기술 적용 (Extending Korean PropBank for Korean Semantic Role Labeling and Applying Domain Adaptation Technique)

  • 배장성;이창기
    • 인지과학
    • /
    • 제26권4호
    • /
    • pp.377-392
    • /
    • 2015
  • 한국어 의미역 결정(Semantic Role Labeling)은 주로 기계학습에 의해 이루어지며 많은 말뭉치 자원을 필요로 한다. 그러나 한국어 의미역 결정 시스템에 사용되는 Korean PropBank는 의미역이 부착된 용언과 용언 격틀이 PropBank에 비해 각각 1/5, 1/2 수준에 불과하다. 따라서 본 논문에서는 한국어 의미역 결정 시스템을 위해 의미역이 부착된 용언과 용언 격틀을 확장하여 Korean PropBank를 확장 시키고자 한다. 대부분의 의미역 결정 시스템은 학습 도메인에 의존적이기 때문에 적용 도메인 변경에 따른 성능 하락이 나타날 수 있다. 본 논문에서는 기존의 학습 말뭉치와 적은 양의 새로운 학습 말뭉치를 활용하여 새로운 도메인에 대해 의미역 결정 시스템의 성능 하락을 최소화 할 수 있는 도메인 적응 기술을 Structural SVM(S-SVM)과 Deep Neural Network(DNN) 기반 한국어 의미역 결정 시스템에 적용하여 그 실효성을 알아보고자 한다.

Domain Adaptation 방법을 이용한 기계학습 기반의 미세먼지 농도 예측 (Machine Learning-based Estimation of the Concentration of Fine Particulate Matter Using Domain Adaptation Method)

  • 강태천;강행봉
    • 한국멀티미디어학회논문지
    • /
    • 제20권8호
    • /
    • pp.1208-1215
    • /
    • 2017
  • Recently, people's attention and worries about fine particulate matter have been increasing. Due to the construction and maintenance costs, there are insufficient air quality monitoring stations. As a result, people have limited information about the concentration of fine particulate matter, depending on the location. Studies have been undertaken to estimate the fine particle concentrations in areas without a measurement station. Yet there are limitations in that the estimate cannot take account of other factors that affect the concentration of fine particle. In order to solve these problems, we propose a framework for estimating the concentration of fine particulate matter of a specific area using meteorological data and traffic data. Since there are more grids without a monitor station than grids with a monitor station, we used a domain adversarial neural network based on the domain adaptation method. The features extracted from meteorological data and traffic data are learned in the network, and the air quality index of the corresponding area is then predicted by the generated model. Experimental results demonstrate that the proposed method performs better as the number of source data increases than the method using conditional random fields.

작물 수확 자동화를 위한 시각 언어 모델 기반의 환경적응형 과수 검출 기술 (Domain Adaptive Fruit Detection Method based on a Vision-Language Model for Harvest Automation)

  • 남창우;송지민;진용식;이상준
    • 대한임베디드공학회논문지
    • /
    • 제19권2호
    • /
    • pp.73-81
    • /
    • 2024
  • Recently, mobile manipulators have been utilized in agriculture industry for weed removal and harvest automation. This paper proposes a domain adaptive fruit detection method for harvest automation, by utilizing OWL-ViT model which is an open-vocabulary object detection model. The vision-language model can detect objects based on text prompt, and therefore, it can be extended to detect objects of undefined categories. In the development of deep learning models for real-world problems, constructing a large-scale labeled dataset is a time-consuming task and heavily relies on human effort. To reduce the labor-intensive workload, we utilized a large-scale public dataset as a source domain data and employed a domain adaptation method. Adversarial learning was conducted between a domain discriminator and feature extractor to reduce the gap between the distribution of feature vectors from the source domain and our target domain data. We collected a target domain dataset in a real-like environment and conducted experiments to demonstrate the effectiveness of the proposed method. In experiments, the domain adaptation method improved the AP50 metric from 38.88% to 78.59% for detecting objects within the range of 2m, and we achieved 81.7% of manipulation success rate.

신경망과 퍼지논리를 이용한 음소인식에 관한 연구 (A Study on Phoneme Recognition using Neural Networks and Fuzzy logic)

  • 한정현;최두일
    • 대한전기학회:학술대회논문집
    • /
    • 대한전기학회 1998년도 하계학술대회 논문집 G
    • /
    • pp.2265-2267
    • /
    • 1998
  • This paper deals with study of Fast Speaker Adaptation Type Speech Recognition, and to analyze speech signal efficiently in time domain and time-frequency domain, utilizes SCONN[1] with Speech Signal Process suffices for Fast Speaker Adaptation Type Speech Recognition, and examined Speech Recognition to investigate adaptation of system, which has speech data input after speaker dependent recognition test.

  • PDF

Domain Adaptation Image Classification Based on Multi-sparse Representation

  • Zhang, Xu;Wang, Xiaofeng;Du, Yue;Qin, Xiaoyan
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제11권5호
    • /
    • pp.2590-2606
    • /
    • 2017
  • Generally, research of classical image classification algorithms assume that training data and testing data are derived from the same domain with the same distribution. Unfortunately, in practical applications, this assumption is rarely met. Aiming at the problem, a domain adaption image classification approach based on multi-sparse representation is proposed in this paper. The existences of intermediate domains are hypothesized between the source and target domains. And each intermediate subspace is modeled through online dictionary learning with target data updating. On the one hand, the reconstruction error of the target data is guaranteed, on the other, the transition from the source domain to the target domain is as smooth as possible. An augmented feature representation produced by invariant sparse codes across the source, intermediate and target domain dictionaries is employed for across domain recognition. Experimental results verify the effectiveness of the proposed algorithm.

領域適應法을 利용한 彈性體 形狀의 最適設計 (Shape optimal design of elastic structures by the domain adaptive method)

  • 정균양
    • 대한기계학회논문집
    • /
    • 제11권2호
    • /
    • pp.234-242
    • /
    • 1987
  • 본 논문에서는 변분법으로 유도한 최적조건을 수치계산에 적용키 위해 영역적 응법이 사용되었으며 불규칙한 형상의 방지에는 격자 적응법이 제시되었다. 설계 문 제로는 '국부 응력치의 일정 한도내에서 구조물 무게의 최소화' 또는 대등한 문제로 '제한된 구조물의 무게한도내에서 최대 국부응력치의 최소화'를 다루었다.

레일레이 패이딩 채널에서 다중 반송자 DS/CDMA 통신 시스템의 전력-전송율 적응 방식 (Power and Rate Adaptations in Multi-carrier DS/CDMA Communications over Rayleigh Fading Channel)

  • 안희준;이예훈
    • 한국통신학회논문지
    • /
    • 제30권6C호
    • /
    • pp.423-433
    • /
    • 2005
  • 다중 반송자를 사용하는 CDMA 통신 시스템에서 주파수 영역의 전력과 시간 영역의 전송율을 적응적으로 사용하는 시스템을 분석하였다. 수신단으로 부터 얻는 이상적인 채널상태 정보를 가정하고, 주파수 영역에서는 각 사용자의 부채널 중에서 가장 채널상태가 좋은 한 대역을 선택하고, 시간영역에서는 목표 수신 품질을 만족하도록 전송율을 조정한다. 단일 사용자의 경우에 평균 BER을 최소화 할 수 있는 최적의 전송 방식의 식을 유도하였다. 채널 상태 역수 법이 사용 대역의 수나, 평균 전송양이 증가할 때 최적의 알고리듬이라는 사실 또한 증명하였다. 수학적 분석과 시뮬레이션 결과 제안된 주파수 시간 적응 알고리듬을 사용한 방식이 주파수영역에서만 선택적인 방법을 사용하는 MC-CDMA 방식과 비교하여 현격히 좋은 성능을 보임을 보였다. 또한 제안된 적응형 MC-CDMA 전송방식과 기존의 RAKE 수신기를 사용하고 시간 영역에서 적응적 방식을 사용하는 DS-CDMA 시스템과 성능을 비교하였다.

도메인 적응 기술을 이용한 한국어 의미역 인식 (Korean Semantic Role Labeling Using Domain Adaptation Technique)

  • 임수종;배용진;김현기;나동렬
    • 정보과학회 논문지
    • /
    • 제42권4호
    • /
    • pp.475-482
    • /
    • 2015
  • 높은 성능의 의미역 인식 시스템의 개발을 위해서는 대상 도메인에 대한 대량의 수동 태깅 학습 데이터가 필요하다. 그러나 충분한 크기의 의미역 인식용 학습 데이터는 오직 소수의 도메인에서만 존재한다. 소스 도메인의 시스템을 상대적으로 매우 작은 학습 데이터를 가진 다른 도메인에 적용할 경우 한국어 의미역 인식 기술은 15% 정도 성능 하락이 발생한다. 이러한 도메인 변경에서의 성능 하락 현상을 최소화하기 위해 본 논문에서는 2 가지 기법을 제시한다. 첫째, 도메인 적응 방법론의 하나인 Prior 모델에 기반하여 개발된 한국어 의미역 인식 시스템을 위한 도메인 적응 알고리즘을 제안한다. 둘째, 크기가 작은 타겟 도메인 데이터를 이용할 때 데이터 희귀 문제의 감소를 위해 소스 도메인 데이터 이용시 보다 단순화된 형태소 태그와 구문 태그 자질을 사용할 것을 제안한다. 뉴스 도메인에서 개발된 시스템의 위키피디아 도메인에의 적용과 관련하여 다른 연구의 도메인 적응 기술과 우리가 제안한 방법을 비교 실험하였다. 우리의 두 가지 방법을 같이 사용할 때 더 높은 성능을 달성하는 것을 관찰하였다. 우리 시스템은 F1-score 64.3% 성능으로서 기존의 다른 도메인 적응 기술들과 비교하여 2.4~3.1% 더 높은 성능을 가지는 것으로 관찰되었다.

Style-Specific Language Model Adaptation using TF*IDF Similarity for Korean Conversational Speech Recognition

  • Park, Young-Hee;Chung, Min-Hwa
    • The Journal of the Acoustical Society of Korea
    • /
    • 제23권2E호
    • /
    • pp.51-55
    • /
    • 2004
  • In this paper, we propose a style-specific language model adaptation scheme using n-gram based tf*idf similarity for Korean spontaneous speech recognition. Korean spontaneous speech shows especially different style-specific characteristics such as filled pauses, word omission, and contraction, which are related to function words and depend on preceding or following words. To reflect these style-specific characteristics and overcome insufficient data for training language model, we estimate in-domain dependent n-gram model by relevance weighting of out-of-domain text data according to their n-. gram based tf*idf similarity, in which in-domain language model include disfluency model. Recognition results show that n-gram based tf*idf similarity weighting effectively reflects style difference.