• 제목/요약/키워드: Lasso 모형

검색결과 52건 처리시간 0.022초

PGA 투어의 골프 스코어 예측 및 분석 (Prediction of golf scores on the PGA tour using statistical models)

  • 임정은;임영인;송종우
    • 응용통계연구
    • /
    • 제30권1호
    • /
    • pp.41-55
    • /
    • 2017
  • 최근 골프는 많은 사람들의 취미 생활로서 자리를 잡아가고 있으며 골프와 관련된 연구도 다양하게 이루어지고 있다. 본 연구에서는 데이터 마이닝 기법을 사용하여 PGA 투어에 참여하는 선수들의 평균스코어를 예측하고 스코어에 유의한 영향을 미치는 변수들을 제시하고자 한다. 그리고 추가적으로 4개의 PGA 투어 플레이오프에 대해 상위 10명, 상위 25명의 선수들을 예측하는 것을 목표로 한다. 우리는 다양한 선형/비선형 회귀분석 방법을 이용하여 평균스코어를 예측하는데, 선형회귀분석 방법으로는 단계적 선택법, 모든 가능한 회귀모형, 라소(LASSO), 능형회귀, 주성분회귀분석을 사용하였으며 비선형회귀분석 방법으로는 트리(CART), 배깅, 그래디언트 부스팅, 신경망 모형, 랜덤 포레스트, 최근접이웃방법(KNN)을 사용하였다. 대부분의 모형에서 공통적으로 선택된 변수들을 살펴보면 페어웨이의 단단함와 그린의 풀의 높이, 평균최대풍속이 높을수록 선수들의 평균스코어는 높아지며 반대로 한 번에 퍼팅을 성공시키는 횟수와 그린적중률 실패 후 버디나 이글로 점수를 만드는 scrambling 변수들, 그리고 공을 멀리 보낼 수 있는 능력을 나타내는 longest drive는 그 값이 높아짐에 따라 선수들의 평균스코어가 낮아지는 경향이 있음을 알 수 있었다. 11가지 모형 모두 테스트 데이터인 2015년 경기 결과를 예측하는데 낮은 오류율을 보였으나 배깅과 랜덤 포레스트의 예측률이 가장 좋았으며 두 모형 모두 상위 10명과 상위 25명의 랭킹을 예측할 때 상당히 높은 적중률을 보였다.

유튜브 먹방과 온라인 배달 주문: 영향력 분석과 예측 모형 (Youtube Mukbang and Online Delivery Orders: Analysis of Impacts and Predictive Model)

  • 최사라;이상용
    • 지능정보연구
    • /
    • 제28권4호
    • /
    • pp.119-133
    • /
    • 2022
  • 음식 문화 및 산업과 관련한 대표적 특징들 중에는 음식 배달 주문 산업이 성장하고 있다는 것과 유튜브와 같은 1인 미디어에서의 소위 '먹는 방송' (먹방)이 최고의 인기 콘텐츠로 자리 잡았다는 사실 등을 거론할 수 있다. 본 연구는 이러한 배경에 근거하여 두가지 초점을 두어 연구하고자 하였다. 먼저, 유튜브 먹방과 먹방 댓글에서 확인되는 대중들의 감성이 관련 음식의 배달 이용 건수에 영향을 미치는지를 회귀분석 모형을 통하여 확인하고자 하였다. 다음으로, 대한민국에서 대표적인 주문 음식인 치킨의 배달 이용 건수 데이터와 유튜브 먹방 댓글 데이터와 날씨 데이터를 활용하여, 머신 러닝을 통한 치킨 배달 주문 예측 모형을 구현하였다. 2015년 6월 3일부터 2019년 9월 30일까지 총 1,580개의 데이터를 활용하였고, 날씨 변수로서의 온도, 습도, 강수량과 유튜브 먹방 변수로의 영상에 달린 댓글 수, 댓글의 긍정어 수, 중립어 수, 부정어 수 등을 수집하였다. 본 연구에 활용된 데이터의 유튜브 먹방과 먹방 댓글의 감성이 배달 이용 건수에 영향 미침을 확인하기위해 선형 회귀 방법론을 사용하였으며, 예측모델을 위해 사용된 머신 러닝은 Linear Regression, Ridge, Lasso, Random Forest, Gradient Boost이다. 본 연구를 통해 유튜브 먹방과 댓글의 감성이 배달 이용 건수에 영향 미침을 확인하였고 예측 모형 또한 기존 모델보다 성능이 좋아짐을 Root Mean Square Error 값을 통하여 확인하였다. 본 연구는 먹방의 광고 효과를 확인하였으며, 배달 업종에서의 경영에 활용할 수 있는 함의를 제공하고자 하였다.

성근 바인 코풀라 모형을 이용한 고차원 금융 자료의 VaR 추정 (Value at Risk calculation using sparse vine copula models)

  • 안광준;백창룡
    • 응용통계연구
    • /
    • 제34권6호
    • /
    • pp.875-887
    • /
    • 2021
  • 최대예상손실액(VaR)은 위험관리수단으로 금융에서 시장위험을 측정하는 대표적인 값이다. 본 논문에서는 다양한 자산으로 이루어진 고차원 금융자료에서 자산들 간의 의존성 구조를 잘 설명할 수 있는 성근 바인 코풀라를 이용한 VaR 추정에 대해서 논의한다. 성근 바인 코풀라는 정규 바인 코풀라 모형에 벌점화를 적용한 방법으로 추정하는 모수의 개수를 벌점화를 통해 축소하는 방법이다. 모의 실험 결과 성근 바인 코풀라를 이용한 VaR 추정이 더 작은 표본 외 예측오차를 줌을 살펴볼수 있었다. 또한 최근 5년간의 코스피 60개 종목을 바탕으로 실시한 실증 자료 분석에서도 성근 바인 코풀라 모형이 더 좋은 예측 성능을 보임을 확인할 수 있었다.

혼합회귀모형에서 콤포넌트 및 설명변수에 대한 벌점함수의 적용 (Joint penalization of components and predictors in mixture of regressions)

  • 박종선;모은비
    • 응용통계연구
    • /
    • 제32권2호
    • /
    • pp.199-211
    • /
    • 2019
  • 주어진 회귀자료에 유한혼합회귀모형을 적합하는 경우 적절한 성분의 수를 선택하고 선택된 각각의 회귀모형에서 의미있는 예측변수들의 집합을 선택하며 동시에 편의와 변동이 작은 회귀계수 추정치들을 얻는 것은 매우 중요하다. 본 연구에서는 혼합선형회귀모형에서 성분의 개수와 회귀계수에 벌점함수를 적용하여 적절한 성분의 수와 각 성분의 회귀모형에 필요한 설명변수들을 동시에 선택하는 방법을 제시하였다. 성분에 대한 벌점은 성분들의 로그값에 SCAD 벌점함수를 적용하였고 회귀계수들에는 SCAD와 더불어 MCP 및 Adplasso 벌점함수들을 사용하여 가상자료와 실제자료들에 대한 결과를 비교하였다. SCAD-SCAD 벌점함수 조합과 SCAD-MCP 조합의 경우 기존의 Luo 등 (2008)의 방법에서 문제가 되었던 과적합 문제를 해결함과 동시에 선택된 성분의 수와 회귀계수들을 효과적으로 선택하였으며 회귀계수들의 추정치에 대한 편의도 크지 않았다. 본 연구는 성분의 수가 알려져 있지 않은 회귀자료에서 적절한 성분의 수와 더불어 각 성분에 대한 회귀모형에서 모형에 필요한 예측변수들을 동시에 선택하는 방법을 제시하였다는데 의미가 있다고 하겠다.

1 추세필터의 변화점 식별에 있어서의 비일치성 (An empirical evidence of inconsistency of the ℓ1 trend filtering in change point detection)

  • 유동현;임요한;손원
    • 응용통계연구
    • /
    • 제35권3호
    • /
    • pp.371-384
    • /
    • 2022
  • 구간별 상수 구조를 가지는 관측값으로부터 변화점을 식별하기 위해 FLSA가 자주 사용되고 있다. FLSA는 총변동벌점을 이용하기 때문에 평균 수준이 단조성을 가지는 경우에는 변화점 식별에서의 일치성이 보장되지 않는다는 특징이 있다. ℓ1 추세필터는 오차제곱합과 기울기 차이에 대한 ℓ1 벌점의 합을 목적함수로 가지는 구간별 선형 구조 추정방법으로 구간별 선형 구조에서의 변화점을 식별하기 위해 활용할 수 있다. 한편, ℓ1 추세필터의 경우에도 총변동벌점을 이용하므로 FLSA와 마찬가지로 변화점 식별에 있어서 비일치성을 보일 것으로 예상할 수 있는데 이와 관련된 연구는 아직까지 많이 이루어져 있지 않다. 이 연구에서는 모의실험을 통해 구간별 선형 모형에서 변화점을 식별하기 위해 사용되는 ℓ1 추세필터의 비일치성에 대해 살펴본다.

신경망 내 잔여 블록을 활용한 콕스 모델 개선: 자궁경부암 사망률 예측모형 연구 (Cox Model Improvement Using Residual Blocks in Neural Networks: A Study on the Predictive Model of Cervical Cancer Mortality)

  • 이낭경;김주영;탁지수;이형록;전현지;양지명;이승원
    • 정보처리학회 논문지
    • /
    • 제13권6호
    • /
    • pp.260-268
    • /
    • 2024
  • 자궁경부암은 전 세계적으로 여성에게 발생하는 암 중 네 번째로 흔한 암이며, 2020년 한 해 동안 60만 4천 건 이상의 신규 케이스가 보고되었고 이로 인한 사망자 수는 약 34만 1천 831명에 달했다. 콕스 회귀 모델은 암 연구에서 널리 채택되고 있는 주요 모델이지만, 비선형 연관성의 존재를 고려하면 선형 가정으로 인해 한계에 부딪힌다. 이러한 문제를 해결하기 위해, 본 논문에서는 ResNet의 잔여 학습 프레임워크를 활용하여 자궁경부암 사망률 예측의 정확성을 개선한 새로운 모델인 ResSurvNet을 제안한다. 이 모델은 본 연구에서 비교한 DNN, CPH, CoxLasso, Cox Gradient Boost, RSF 모델들을 능가하는 정확도를 보여주었기에 이러한 우수한 예측 성능은 자궁경부암 환자 관리에 있어 조기 진단 및 치료 전략 수립에 기여할 수 있고 임상적으로 적용할 때 큰 가치가 있음을 입증하며, 생존 분석 분야에서도 의미 있는 진전을 나타낸다.

랜섬웨어 탐지를 위한 동적 분석 자료에서의 변수 선택 및 분류에 관한 연구 (A study on variable selection and classification in dynamic analysis data for ransomware detection)

  • 이승환;황진수
    • 응용통계연구
    • /
    • 제31권4호
    • /
    • pp.497-505
    • /
    • 2018
  • 최근 랜섬웨어는 일반 PC 사용자에 비해 상대적으로 수준 높은 보안 체계를 갖추고 있는 기업과 정부 기관에 침입하여 상당한 피해를 입히는 등 기존 보안 체계의 허점을 찾아 진화하는 모습을 보이고 있다. 이처럼 계속해서 변화하는 랜섬웨어를 탐지하기 위해 랜섬웨어의 특징을 파악하는 정적 분석과 동적 분석과 관련된 연구가 활발히 이루어지고 있다. 본 연구에서는 582개의 랜섬웨어 샘플과 942개의 정상 샘플 프로그램을 쿠쿠 샌드박스 가상환경 내에서 실행시킨 뒤, PC에서 이루어지는 30,967가지의 행동 여부를 기록한 동적 분석 자료를 활용하여 랜섬웨어 분류에 유의한 변수를 탐색하기 위한 여러 변수 선택 방법의 적용과 랜섬웨어 분류를 위한 기계학습 모형들을 구축하고자 하였다. 변수 선택법으로 LASSO와 이항변수 만으로 이루어진 고차원 자료라는 특성을 활용하기 위한 카이제곱검정을 이용한 변수 선택, 선행 연구에서 이용된 방법인 상호정보를 이용한 변수 선택법을 적용하였으며 기계 학습 모형으로는 능형 로지스틱 회귀, 서포트 벡터 머신, 랜덤 포레스트, XGBoost가 활용되었다. 연구 결과, 정상 프로그램과 구별되는 랜섬웨어 프로그램만의 특징적인 행동을 확인할 수 있었으며 여러 변수 선택법과 기계학습 분류 모형들의 조합 중, 주어진 자료에서 카이제곱검정을 이용한 변수 선택법과 랜덤 포레스트 모형의 조합이 가장 높은 탐지율과 정분류율을 보이는 것을 확인하였다.

사례연구: 대구 파티마 병원 폐렴 입원 환자 수에 영향을 미치는 날씨 변수 선택 (Case study: Selection of the weather variables influencing the number of pneumonia patients in Daegu Fatima Hospital)

  • 최소현;이학래;박천건;이경은
    • Journal of the Korean Data and Information Science Society
    • /
    • 제28권1호
    • /
    • pp.131-142
    • /
    • 2017
  • 매년 폐렴 입원 환자 수는 증가하는 추세이며, 국내 질환 중 입원율 1위이기도 하다. 주로 박테리아와 바이러스가 주된 원인인 폐렴은 날씨의 영향을 받기도 한다. 본 연구에서는 날씨 변수로는 습도, 일조량, 일교차, 평균온도, 미세먼지 농도를 각각 1일 전부터 27일 전까지의 총 135개 변수를 고려하였다. 날씨와 입원 환자 수에 잠재적으로 영향을 미치는 위험 요인으로 연도 효과, 휴일 효과, 계절 효과를 추가적으로 고려하였다. 벌점화 일반화 선형 모형을 이용하여 폐렴 입원 환자 수와 관련된 변수를 선택하였다.

계층적 벌점함수를 이용한 주성분분석 (Hierarchically penalized sparse principal component analysis)

  • 강종경;박재신;방성완
    • 응용통계연구
    • /
    • 제30권1호
    • /
    • pp.135-145
    • /
    • 2017
  • 주성분 분석(principal component analysis; PCA)은 서로 상관되어 있는 다변량 자료의 차원을 축소하는 대표적인 기법으로 많은 다변량 분석에서 활용되고 있다. 하지만 주성분은 모든 변수들의 선형결합으로 이루어지므로, 그 결과의 해석이 어렵다는 한계가 있다. sparse PCA(SPCA) 방법은 elastic net 형태의 벌점함수를 이용하여 보다 성긴(sparse) 적재를 가진 수정된 주성분을 만들어주지만, 변수들의 그룹구조를 이용하지 못한다는 한계가 있다. 이에 본 연구에서는 기존 SPCA를 개선하여, 자료가 그룹화되어 있는 경우에 유의한 그룹을 선택함과 동시에 그룹 내 불필요한 변수를 제거할 수 있는 새로운 주성분 분석 방법을 제시하고자 한다. 그룹과 그룹 내 변수 구조를 모형 적합에 이용하기 위하여, sparse 주성분 분석에서의 elastic net 벌점함수 대신에 계층적 벌점함수 형태를 고려하였다. 또한 실제 자료의 분석을 통해 제안 방법의 성능 및 유용성을 입증하였다.

머신러닝 분석을 활용한 초등학교 1학년 ADHD 위험군 아동 종단 예측모형 개발 (Development of a Machine-Learning Predictive Model for First-Grade Children at Risk for ADHD)

  • 이동미;장혜인;김호정;배진;박주희
    • 한국보육지원학회지
    • /
    • 제17권5호
    • /
    • pp.83-103
    • /
    • 2021
  • Objective: This study aimed to develop a longitudinal predictive model that identifies first-grade children who are at risk for ADHD and to investigate the factors that predict the probability of belonging to the at-risk group for ADHD by using machine learning. Methods: The data of 1,445 first-grade children from the 1st, 3rd, 6th, 7th, and 8th waves of the Korean Children's Panel were analyzed. The output factors were the at-risk and non-risk group for ADHD divided by the CBCL DSM-ADHD scale. Prenatal as well as developmental factors during infancy and early childhood were used as input factors. Results: The model that best classifies the at-risk and the non-risk group for ADHD was the LASSO model. The input factors which increased the probability of being in the at-risk group for ADHD were temperament of negative emotionality, communication abilities, gross motor skills, social competences, and academic readiness. Conclusion/Implications: The outcomes indicate that children who showed specific risk indicators during infancy and early childhood are likely to be classified as being at risk for ADHD when entering elementary schools. The results may enable parents and clinicians to identify children with ADHD early by observing early signs and thus provide interventions as early as possible.