• 제목/요약/키워드: Multiple regression model

검색결과 2,523건 처리시간 0.032초

Clustering Observations for Detecting Multiple Outliers in Regression Models

  • Seo, Han-Son;Yoon, Min
    • 응용통계연구
    • /
    • 제25권3호
    • /
    • pp.503-512
    • /
    • 2012
  • Detecting outliers in a linear regression model eventually fails when similar observations are classified differently in a sequential process. In such circumstances, identifying clusters and applying certain methods to the clustered data can prevent a failure to detect outliers and is computationally efficient due to the reduction of data. In this paper, we suggest to implement a clustering procedure for this purpose and provide examples that illustrate the suggested procedure applied to the Hadi-Simonoff (1993) method, reverse Hadi-Simonoff method, and Gentleman-Wilk (1975) method.

VARIANCE ESTIMATION OF ERROR IN THE REGRESSION MODEL AT A POINT

  • Oh, Jong-Chul
    • Journal of applied mathematics & informatics
    • /
    • 제13권1_2호
    • /
    • pp.501-508
    • /
    • 2003
  • Although the estimate of regression function is important, some have focused the variance estimation of error term in regression model. Different variance estimators perform well under different conditions. In many practical situations, it is rather hard to assess which conditions are approximately satisfied so as to identify the best variance estimator for the given data. In this article, we suggest SHM estimator compared to LS estimator, which is common estimator using in parametric multiple regression analysis. Moreover, a combined estimator of variance, VEM, is suggested. In the simulation study it is shown that VEM performs well in practice.

A Score test for Detection of Outliers in Nonlinear Regression

  • Kahng, Myung-Wook
    • Journal of the Korean Statistical Society
    • /
    • 제22권2호
    • /
    • pp.201-208
    • /
    • 1993
  • Given the specific mean shift outlier model, the score test for multiple outliers in nonlinear regression is discussed as an alternative to the likelihood ratio test. The geometric interpretation of the score statistic is also presented.

  • PDF

Is it Possible to Predict the ADI of Pesticides using the QSAR Approach?

  • Kim, Jae Hyoun
    • 한국환경보건학회지
    • /
    • 제38권6호
    • /
    • pp.550-560
    • /
    • 2012
  • Objectives: QSAR methodology was applied to explain two different sets of acceptable daily intake (ADI) data of 74 pesticides proposed by both the USEPA and WHO in terms of setting guidelines for food and drinking water. Methods: A subset of calculated descriptors was selected from Dragon$^{(R)}$ software. QSARs were then developed utilizing a statistical technique, genetic algorithm-multiple linear regression (GA-MLR). The differences in each specific model in the prediction of the ADI of the pesticides were discussed. Results: The stepwise multiple linear regression analysis resulted in a statistically significant QSAR model with five descriptors. Resultant QSAR models were robust, showing good utility across multiple classes of pesticide compounds. The applicability domain was also defined. The proposed models were robust and satisfactory. Conclusions: The QSAR model could be a feasible and effective tool for predicting ADI and for the comparison of logADIEPA to logADIWHO. The statistical results agree with the fact that USEPA focuses on more subtle endpoints than does WHO.

GLS와 Bass 모형을 결합한 하이브리드 모형을 이용한 영화 관객 수 예측 (Prediction of movie audience numbers using hybrid model combining GLS and Bass models)

  • 김보경;임창원
    • 응용통계연구
    • /
    • 제31권4호
    • /
    • pp.447-461
    • /
    • 2018
  • 국내 영화 산업 매출은 매년 증가하고 있다. 극장은 영화의 1차 판매 경로이며, 극장을 이용하는 관객 수는 부가판권에 영향을 준다. 따라서 극장을 이용하는 관객의 수는 영화 산업 매출에 직결되는 중요한 요소이다. 본 논문에서 특정일의 관객 수를 예측하기 위하여 다중선형회귀모형과 Bass 모형을 결합한 Hybrid 모형을 고려한다. 두 모형을 결합함으로써 회귀분석의 예측값을 Bass 모형의 예측값으로 보정하였다. 분석에는 개봉일이 모두 다른 세 영화를 이용하였다. All subset regression 방법을 이용해 모든 가능한 조합을 생성하고 5중 교차검증(5-fold cross validation)을 통해 5번 모형을 추정한다. 이 때 제곱근평균오차가 가장 작은 모형으로 예측값을 구한 뒤 Bass 모형의 예측값과 결합해 최종 예측값을 구하게 된다. 과거데이터가 존재할수록 Bass 모형의 가중치는 증가하면서 예측값에 보정효과를 준다는 것을 확인할 수 있었다.

다중회귀에서 회귀계수 추정량의 특성 (Comments on the regression coefficients)

  • 강명욱
    • 응용통계연구
    • /
    • 제34권4호
    • /
    • pp.589-597
    • /
    • 2021
  • 단순회귀와 다중회귀에서 회귀계수의 의미는 차이가 있고 회귀계수의 추정값은 같지 않을 뿐 아니라 그 부호가 서로 다른 경우도 발생한다. 회귀모형에서 설명변수의 상대적 기여도의 파악은 회귀분석의 수행의 중요한 부분이다. 표준화 회귀모형에서 표준화 회귀계수는 해당 설명변수를 제외한 나머지 설명변수의 값이 고정되어있는 상황에서 설명변수가 표준편차만큼 증가하였을 때 반응변수가 표준편차를 기준으로 얼마나 변화했는가로 해석할 수 있지만 표준화 회귀계수의 크기가 각 설명변수의 상대적 중요도를 나타내는 척도라고 할 수 없음은 잘 알려져 있다. 본 논문에서는 다중회귀에서 회귀계수의 추정량을 상관계수와 결정계수의 함수로 나타내고 이를 추가적인 설명력과 추가적인 결정계수의 관점에서 생각해 본다. 또한 다양한 산점도에서의 상관계수와 회귀계수 추정값의 관계를 알아보고 설명변수가 두 개인 경우에 구체적으로 적용해 본다.

다중선형회귀모형에서의 변수선택기법 평가 (Evaluating Variable Selection Techniques for Multivariate Linear Regression)

  • 류나현;김형석;강필성
    • 대한산업공학회지
    • /
    • 제42권5호
    • /
    • pp.314-326
    • /
    • 2016
  • The purpose of variable selection techniques is to select a subset of relevant variables for a particular learning algorithm in order to improve the accuracy of prediction model and improve the efficiency of the model. We conduct an empirical analysis to evaluate and compare seven well-known variable selection techniques for multiple linear regression model, which is one of the most commonly used regression model in practice. The variable selection techniques we apply are forward selection, backward elimination, stepwise selection, genetic algorithm (GA), ridge regression, lasso (Least Absolute Shrinkage and Selection Operator) and elastic net. Based on the experiment with 49 regression data sets, it is found that GA resulted in the lowest error rates while lasso most significantly reduces the number of variables. In terms of computational efficiency, forward/backward elimination and lasso requires less time than the other techniques.

하천의 지형학적 인자와 식생종수의 관계 -한강수계를 중심으로- (Relationship between Stream Geomophological Factors and the Vegetation Abundance - With a Special Reference to the Han River System -)

  • 이광우;김태균;심우경
    • 한국조경학회지
    • /
    • 제30권3호
    • /
    • pp.73-85
    • /
    • 2002
  • The purpose of this study was to develop prediction models for plant species abundance by stream restoration. Generally the stream plant is affected by stream gemophology. So in this study, the relationship between the vegetation abundance and stream gemophology was developed by multiple regression analysis. The stream characteristics utilized in this study were longitudinal slope, transectional slope, micro-landforms through the longitudinal direction, riparian width and geometric mean diameter and biggest diameter of bed material, and cumulated coarse and fine sand weight portion. The Pyungchang River with mountainous watershed and the Kyungan stream and the Bokha stream in the agricultural region were selected and vegetation species abundance and stream characteristics were documented from the site at 2~3km intervals from the upper stream to the lower. The Models for predicting the vegetation abundance were developed by multiple regression analysis using SPSS statistics package. The linear relationship between the dependant(species abundance) and independant(stream characteristics) variables was tested by a graphical method. Longitudinal and transectional slope had a nonlinear relationship with species abundance. In the next step, the independance between the independant variables was tested and the correlation between independant and dependant variables was tested by the Pearson bivariate correlation test. The selected independant variables were transectional slope, riparian width, and cumulated fine sand weight portion. From the multiple regression analysis, the $R^2$for the Pyungchang river, Kyungan stream, Bokga stream were 0.651, 0.512 and 0.240 respectively. The natural stream configuration in the Pyungchang river had the best result and the lower $R^2$for Kyunan and Bokha stream were due to human impact which disturbed the natural ecosystem. The lowest $R^2$for the Bokha stream was due to the shifting sandy bed. If the stream bed is fugitive, the prediction model may not be valid. Using the multiple regression models, the vegetation abundance could be predicted with stream characteristics such as, transection slope, riaparian width, cumulated fine sand weigth portion, after stream restoration.

다중선형회귀모델 기반 고출력 직렬 배터리 팩의 전압 불균형 추정 (Multiple linear regression model-based voltage imbalance estimation for high-power series battery pack)

  • 김승우;이평연;한동호;김종훈
    • 전기전자학회논문지
    • /
    • 제23권1호
    • /
    • pp.1-8
    • /
    • 2019
  • 본 논문에서는 18650 원통형 NCA 리튬이온 배터리로 구성된 고출력 직렬 배터리로 다양한 C-rate의 전기적 특성을 테스트한다. 테스트를 통해 추출한 14S1P 배터리 팩의 방전 용량 데이터와 4S1P 배터리 팩의 EV cycle 데이터를 통해 C-rate의 변화에 따른 전기적 특성을 분석한다. 분석을 통해 얻은 데이터를 기반으로 C-rate에 따른 방전용량 실험의 셀 간 전압 편차와 EV cycle 실험의 셀 간 전압 편차를 다중선형회귀 모델로 추정하여 선형적인 특징을 가진 데이터와 비선형적인 특징을 가진 데이터에 대한 각각의 추정성능을 검증한다. 모델의 추정성능을 검증하기 위해 추정 데이터와 실제 데이터의 RMSE를 구해 알고리즘의 정확성을 평가한다. 논문의 결과는 14S1P 배터리 팩의 방전 용량의 셀 간 전압 불균형과 4S1P 배터리 팩의 EV cycle의 셀 간 전압 불균형 중 선형적인 데이터인 방전 용량의 셀 간 불균형 데이터의 추정 성능이 더 뛰어난 것을 검증하는데 기여한다.

서울지역 PM10 농도 예측모형 개발 (Development of statistical forecast model for PM10 concentration over Seoul)

  • 손건태;김다홍
    • Journal of the Korean Data and Information Science Society
    • /
    • 제26권2호
    • /
    • pp.289-299
    • /
    • 2015
  • 본 연구는 PM10 농도에 대한 계량치 예측모형 개발을 목적으로 한다. 세 종류의 자료 (기상관측 자료, 세계기상통신망 중국 관측자료, 대기질 화학수치모델자료)를 예측인자로 사용하였으며, 일일 단기예보 시스템에 쉽게 적용할 수 있도록 시간자료를 일자료로 변환하였고 시차변환을 수행하였다. 상관분석과 다중공선성 진단을 통하여 예측인자를 선택하고 두 종류의 모형 (중회귀모형, 문턱치 회귀모형)을 각각 적합하였다. 모형 안정성 검사를 위하여 모형검증을 수행하였으며, 전체자료를 사용하여 모형을 재추정한 후 예측치와 관측치 사이의 산점도와 시계열그림, RMSE, 예측성 평가측도를 작성 및 산출하여 두 모형을 비교하였다. 문턱치 회귀모형의 예측력이 고농도 PM10예측에서 다소 우수한 결과를 보였다.