• 제목/요약/키워드: Log-Linear Regression Model

검색결과 70건 처리시간 0.024초

로지스틱회귀모형에서 로그-밀도비를 이용한 변수의 선택 (Variable Selection with Log-Density in Logistic Regression Model)

  • 강명욱;신은영
    • Communications for Statistical Applications and Methods
    • /
    • 제19권1호
    • /
    • pp.1-11
    • /
    • 2012
  • 로지스틱회귀모형에서 반응변수가 주어졌을 때 설명변수의 조건부 확률분포의 로그-밀도비는 어떤 설명변수가어떻게모형에포함되는지에대한변수선택문제에서유용한정보를제공한다. 설명변수의 조건부 확률분포가 좌우대칭이 아닌 경우 감마분포로 가정하는 것이 적절하다. 여러 가지 모의실험을 수행한 결과를 보면, $x{\mid}y$ = 0과 $x{\mid}y$ = 1의 두 분포가 겹치는 경우에서는 x항과 log(x)항 모두 필요하다. 그리고 두 분포가 분리된 경우에는 x항 또는 log(x)항 중 하나만 필요하다.

로지스틱회귀모형의 변수선택에서 로그-오즈 그래프를 통한 로그-밀도비 연구 (A study on log-density with log-odds graph for variable selection in logistic regression)

  • 강명욱;신은영
    • Journal of the Korean Data and Information Science Society
    • /
    • 제23권1호
    • /
    • pp.99-111
    • /
    • 2012
  • 반응변수가 주어졌을 때 설명변수의 조건부 확률분포의 로그-밀도비는 로지스틱회귀모형에서 어떤 설명변수가 어떻게 모형에 포함되는지에 대한 변수선택문제에서 유용한 정보를 제공한다. 설명변수의 조건부 확률분포가 좌우대칭이 아닌 경우 감마분포로 가정하는 것이 적절하고 이 경우 x항과 log(x)항이 모형에 포함되어야 한다. 로그-오즈 그래프는 변수선택문제를 연구하는데 매우 중요한 도구가 된다. 이러한 그래픽적 연구에 의하면, x|y = 0과 x|y = 1의 두 분포가 겹치는 경우에서는 x항과 log(x)항 모두 필요하다. 그리고 두 분포가 분리된 경우에는 x항 또는 log(x)항 중 하나만 필요하다.

A study on log-density ratio in logistic regression model for binary data

  • Kahng, Myung-Wook
    • Journal of the Korean Data and Information Science Society
    • /
    • 제22권1호
    • /
    • pp.107-113
    • /
    • 2011
  • We present methods for studying the log-density ratio, which allow us to select which predictors are needed, and how they should be included in the logistic regression model. Under multivariate normal distributional assumptions, we investigate the form of the log-density ratio as a function of many predictors. The linear, quadratic and crossproduct terms are required in general. If two covariance matrices are equal, then the crossproduct and quadratic terms are not needed. If the variables are uncorrelated, we do not need the crossproduct terms, but we still need the linear and quadratic terms.

Analysis of Online Behavior and Prediction of Learning Performance in Blended Learning Environments

  • JO, Il-Hyun;PARK, Yeonjeong;KIM, Jeonghyun;SONG, Jongwoo
    • Educational Technology International
    • /
    • 제15권2호
    • /
    • pp.71-88
    • /
    • 2014
  • A variety of studies to predict students' performance have been conducted since educational data such as web-log files traced from Learning Management System (LMS) are increasingly used to analyze students' learning behaviors. However, it is still challenging to predict students' learning achievement in blended learning environment where online and offline learning are combined. In higher education, diverse cases of blended learning can be formed from simple use of LMS for administrative purposes to full usages of functions in LMS for online distance learning class. As a result, a generalized model to predict students' academic success does not fulfill diverse cases of blended learning. This study compares two blended learning classes with each prediction model. The first blended class which involves online discussion-based learning revealed a linear regression model, which explained 70% of the variance in total score through six variables including total log-in time, log-in frequencies, log-in regularities, visits on boards, visits on repositories, and the number of postings. However, the second case, a lecture-based class providing regular basis online lecture notes in Moodle show weaker results from the same linear regression model mainly due to non-linearity of variables. To investigate the non-linear relations between online activities and total score, RF (Random Forest) was utilized. The results indicate that there are different set of important variables for the two distinctive types of blended learning cases. Results suggest that the prediction models and data-mining technique should be based on the considerations of diverse pedagogical characteristics of blended learning classes.

Some Results on the Log-linear Regression Diagnostics

  • Yang, Mi-Young;Choi, Ji-Min;Kim, Choong-Rak
    • Communications for Statistical Applications and Methods
    • /
    • 제14권2호
    • /
    • pp.401-411
    • /
    • 2007
  • In this paper we propose an influence measure for detecting potentially influential observations using the infinitesimal perturbation and the local influence in the log-linear regression model. Also, we propose a goodness-of-fit measure for variable selection. A real data set are used for illustration.

Analysis of Temperature Effects on Microbial Growth Parameters and Estimation of Food Shelf Life with Confidence Band

  • Park, Jin-Pyo;Lee, Dong-Sun
    • Preventive Nutrition and Food Science
    • /
    • 제13권2호
    • /
    • pp.104-111
    • /
    • 2008
  • As a way to account for the variability of the primary model parameters in the secondary modeling of microbial growth, three different regression approaches were compared in determining the confidence interval of the temperature-dependent primary model parameters and the estimated microbial growth during storage: bootstrapped regression with all the individual primary model parameter values; bootstrapped regression with average values at each temperature; and simple regression with regression lines of 2.5% and 97.5% percentile values. Temperature dependences of converted parameters (log $q_o$, ${\mu}_{max}^{1/2}$, log $N_{max}$) of hypothetical initial physiological state, maximum specific growth rate, and maximum cell density in Baranyi's model were subjected to the regression by quadratic, linear, and linear function, respectively. With an advantage of extracting the primary model parameters instantaneously at any temperature by using mathematical functions, regression lines of 2.5% and 97.5% percentile values were capable of accounting for variation in experimental data of microbial growth under constant and fluctuating temperature conditions.

로지스틱 회귀모형에서 이변량 정규분포에 근거한 로그-밀도비 (Log-density Ratio with Two Predictors in a Logistic Regression Model)

  • 강명욱;윤재은
    • 응용통계연구
    • /
    • 제26권1호
    • /
    • pp.141-149
    • /
    • 2013
  • 로지스틱회귀모형에서 두 설명변수의 조건부 분포가 모두 이변량 정규분포라고 할 수 있다면 설명변수들의 함수로 표현되는 로그-밀도비를 통해 모형에 포함시켜야하는 항을 알 수 있다. 두개의 이변량 정규분포에서 분산-공분산행렬이 같은 경우에는 이차항과 교차항 없이 일차항만으로 충분하다. 상관계수가 모두 0이면 교차항은 설명변수의 분산과 관계없이 필요하지 않다. 또한 로지스틱회귀모형에서 로그-밀도비를 통해 이차항과 교차항이 필요하지 않게 되는 다른 조건들도 알아본다.

기운 일반화 t 분포를 이용한 이진 데이터 회귀 분석 (Binary regression model using skewed generalized t distributions)

  • 김미정
    • 응용통계연구
    • /
    • 제30권5호
    • /
    • pp.775-791
    • /
    • 2017
  • 이진 데이터는 일상 생활에서 자주 접할 수 있는 데이터이다. 이진 데이터를 회귀 분석하는 방법으로 로지스틱(Logistic), 프로빗(Probit), Cauchit, Complementary log-log 모형이 주로 쓰이는데, 이 방법 이외에도 Liu(2004)가 제시한 t 분포를 이용한 로빗(Robit) 모형, Kim 등 (2008)에서 제시한 일반화 t-link 모형을 이용한 방법 등이 있다. 유연한 분포를 이용하면 유연한 회귀 모형이 가능해지는 점에 착안하여, 이 논문에서는 Theodossiou(1998)에서 제시된 기운 일반화 t 분포 (Skewed Generalized t Distribution)의 이용하여 우도 함수를 최대로 하는 이진 데이터 회귀 모형을 소개한다. 기운 일반화 t 분포를 R glm 함수, R sgt 패키지를 연결하여 이 논문에서 제시한 방법을 R로 분석할 수 있는 방법을 소개하고, 피마 인디언(Pima Indian) 데이터를 분석한다.

의사우도추정법에 의한 분산함수를 고려한 수위-유량 관계 곡선 산정법 개선 (Improvement of Rating Curve Fitting Considering Variance Function with Pseudo-likelihood Estimation)

  • 이우석;김상욱;정은성;이길성
    • 한국수자원학회논문집
    • /
    • 제41권8호
    • /
    • pp.807-823
    • /
    • 2008
  • 수위-유량 관계 곡선을 나타내는 곡선식에 포함되어 있는 매개변수의 추정을 위해 많이 사용되는 로그선형 회귀분석은 잔차의 비등분산성(heteroscedasticity)을 고려하지 못하므로 본 연구에서는 의사우도추정법(pseudolikelihood estimation, P-LE)에 의해 분산함수를 추정하고 이와 함께 회귀계수를 추정할 수 있는 방법을 제시하였다. 이 과정에서 제시된 회귀잔차를 최소화하기 위하여 SA(simulated annealing)이라는 전역 최적화 알고리즘을 적용하였다. 또한 수위-유량 관계 곡선은 단면 등의 영향으로 인해 구간에 따라 각각 다르게 구축되어져야 하므로 이를 보다 객관적으로 판단하고 분리 위치를 추정하기 위하여 Heaviside 함수를 의사우도함수에 포함시켜 결과를 추정하도록 하였으며, 2개의 구간을 가지는 유량자료를 이용하여 제시된 방법의 합리성을 통계적으로 실험하였다. 이와 같이 통계적 실험을 통해 제시된 방법들이 기존 방법과 비교하여 가질 수 있는 장점을 파악하였으며, 제시된 방법들을 금강유역 5개 지점에서 대해 수행하여 효율성을 검증하였다.

Prediction of Solvent Effects on Rate Constant of [2+2] Cycloaddition Reaction of Diethyl Azodicarboxylate with Ethyl Vinyl Ether Using Artificial Neural Networks

  • Habibi-Yangjeh, Aziz;Nooshyar, Mahdi
    • Bulletin of the Korean Chemical Society
    • /
    • 제26권1호
    • /
    • pp.139-145
    • /
    • 2005
  • Artificial neural networks (ANNs), for a first time, were successfully developed for the modeling and prediction of solvent effects on rate constant of [2+2] cycloaddition reaction of diethyl azodicarboxylate with ethyl vinyl ether in various solvents with diverse chemical structures using quantitative structure-activity relationship. The most positive charge of hydrogen atom (q$^+$), dipole moment ($\mu$), the Hildebrand solubility parameter (${\delta}_H^2$) and total charges in molecule (q$_t$) are inputs and output of ANN is log k$_2$ . For evaluation of the predictive power of the generated ANN, the optimized network with 68 various solvents as training set was used to predict log k$_2$ of the reaction in 16 solvents in the prediction set. The results obtained using ANN was compared with the experimental values as well as with those obtained using multi-parameter linear regression (MLR) model and showed superiority of the ANN model over the regression model. Mean square error (MSE) of 0.0806 for the prediction set by MLR model should be compared with the value of 0.0275 for ANN model. These improvements are due to the fact that the reaction rate constant shows non-linear correlations with the descriptors.