1. 서론
우울증은 개인의 기능 저하와 삶의 질 감소뿐 아니라 심혈관질환, 대사질환, 사망률 증가와도 연관되는 중대한 공중보건 문제이다. 특히 우울증의 발현이 단순한 심리·사회적 스트레스의 반응을 넘어, 염증반응, 대사 이상, 지질 불균형과 같은 생물학적 기전에 의해 영향을 받을 수 있다는 근거가 지속적으로 축적되고 있다. 대규모 종단 메타분석에서는 혈중 CRP와 IL-6의 상승이 이후 우울증 발생 위험을 증가시키는 것으로 보고되었으며[1], 저등급 만성 염증이 우울 증상의 지속성과 관련된다는 연구도 제시되었다[2]. 또한, 미국 성인을 대상으로 한 연구에서는 TG/HDL-C 비율이 우울증과 유의한 연관을 보여 지질대사 지표가 정신건강 위험의 중요한 생체지표가 될 수 있음을 시사한다[3].
국내 연구에서도 비전형 우울증과 대사증후군 구성요소 간의 연관성이 확인되었고[4], 체질량지수·혈당·지질 수치 등 대사 변수들이 우울 증상과 밀접한 관계를 보인다는 분석이 보고되었다[5]. 더 나아가 노인 코호트를 기반으로 한 연구에서는 CRP 증가가 우울 증상 악화와 독립적으로 연관되었으며[6], 국민건강영양조사 기반 분석에서도 hs-CRP 상승이 우울 고위험군의 비율 증가와 관련됨이 확인되었다[7].
기존 연구 중 일부는 다변량 바이오마커를 활용하거나 기계학습 기법을 적용한 예측모델을 제시한 바 있다[9,10]. 그러나 이러한 연구는 특정 연령군(예: 노인 대상) 또는 제한된 임상 집단을 중심으로 수행된 경우가 많으며, 염증·대사·지질 지표와 사회경제적· 생활습관 요인을 동시에 통합하여 전국 단위 대표표본 기반으로 비교 분석한 연구는 상대적으로 제한적이다. 이에 본 연구는 NHANES의 전국 단위 데이터를 활용하여 생물학적 지표와 사회환경적 요인을 포괄적으로 통합하고, 다양한 기계학습 알고리즘을 동일 조건에서 비교함으로써 각 변수의 예측 기여도를 정량적으로 평가하고자 하였다.
2. 연구 방법
2.1. 연구자료
본 연구는 미국 질병예방통제센터(CDC)가 수행하는 국민건강영양조사(NHANES)의 2017–2018년(J cycle)과 2021–2023년(L cycle) 자료를 활용하여 분석을 수행하였다. 2019–2020 cycle은 COVID-19로 인한 조사 중단 및 표본 대표성 저하 문제로 제외하였다. 2017–2018과 2021–2023 cycle은 조사방법이 동일하고 변수 정의가 일치함을 확인한 후 통합 분석을 수행하였다. 다만, 두 시기 사이의 사회적 환경 변화에 따른 잠재적 cohort effect 가능성을 완전히 배제할 수는 없다. 두 시기의 데이터를 통합한 후, PHQ-9 문항에 완전하게 응답한 7,543명을 최종 분석대상으로 선정하였다. 종속변수는 PHQ-9 총점이 10점 이상일 경우 우울 고위험군으로 정의하였으며, 설명변수는 생물학적 지표, 사회인구학적 요인, 생활습관 정보를 포함하도록 구성하였다. 생물학적 지표에는 고감도 C-반응단백(CRP), HbA1c, HDL-콜레스테롤, 중성지방, 공복혈당, 체질량지수(BMI)를 포함하였고, 사회인구학적 요인은 연령, 성별, 인종, 교육수준, 가구 규모, 소득지수(INDFMPIR)를 활용하였다. 또한, 생활습관 변수로 흡연 여부 및 강도(SMQ020, SMD030), 음주 빈도(ALQ130), 신체활동(PAQ650, PAQ665)을 포함하였다. 전체 분석 절차는 데이터 수집, 전처리, 학습용·검증용 데이터 분할, 모델 학습 및 평가의 흐름으로 구성되며, 이러한 과정은 Fig 1에 도식화하였다.

그림 1. 고위험 우울증 예측을 위한 전반적인 머신러닝 워크플로우
Fig. 1. Overall machine learning workflow for prediction of high-risk depression
2.2 연구 절차
연구 절차는 먼저 수집된 데이터에 대한 결측치 처리와 변수 변환을 수행하는 전처리 단계로 시작되었다. 수치형 변수는 중앙값을 이용해 결측치를 대체하였으며, 범주형 변수는 결측치를 ‘Missing’이라는 새로운 수준으로 지정하여 정보 손실을 최소화하였다. 인종 변수(RIDRETH3)는 5개 범주로 구분되었으며, one-hotencoding 방식으로 더미변수화하였다. 이후 모든 범주형 변수에 대해 원핫 인코딩을 적용하여 기계학습 알고리즘이 처리할 수 있는 구조로 변환하였다. 전처리가 완료된 데이터는 8:2 비율로 학습용(training set)과 검증용(test set)으로 무작위 분할하였으며, 우울 고위험군 비율이 낮은 불균형 라벨 문제를 고려하여 class_weight 적용 및 threshold 조정 전략을 병행하였다.
이후 Logistic Regression, Random Forest, Gradient Boosting, Extra Trees, XGBoost의 다섯 가지 모델을 동일한 조건에서 학습시켜 예측 성능을 비교하였다. 각 모델은 ROC-AUC, Precision, Recall, F1-score로 평가하였고, 특히 분류 성능을 개선하기 위해 예측 확률에 기반한 최적의 threshold를 별도로 탐색하였다. 마지막으로 Gradient Boosting 모델을 대상으로 변수 중요도 분석과 SHAP 기반 설명가능성 분석을 수행하여 예측에 기여하는 핵심 변수를 탐색하였다. 이러한 전 과정을 통해 우울 고위험군 예측에 영향을 미치는 생물학적·사회인구학적 요인의 상대적 중요성을 정량적으로 평가하였다.
2.3. 모델 학습 및 평가
모델 학습은 학습용 데이터셋을 기반으로 수행되었으며, 각 알고리즘은 동일한 전처리 및 설정하에서 비교되도록 구성하였다. Random Forest, Extra Trees, Gradient Boosting, XGBoost는 트리 기반 알고리즘으로 변수 간 비선형 관계와 상호작용을 포착할 수 있다는 장점이 있으며, Logistic Regression은 비교 기준 모델로 사용하였다. 검증용 데이터셋을 활용해 예측 확률을 기반으로 ROC Curve와 Precision–Recall Curve를 산출하였고, 이를 통해 모델 전반의 판별 성능 및 양성 클래스(우울 고위험군)에 대한 예측 민감도를 평가하였다. Gradient Boosting 모델에서는 추가적으로 SHAP 값을 활용하여 변수별 기여도와 영향 방향을 시각화하였으며, 이를 통해 우울 위험 예측에 특히 중요하게 작용하는 바이오마커 및 사회인구학적 요인을 규명하였다.
2.4. 윤리적 고려사항
본 연구는 미국 질병예방통제센터(CDC)가 공개한 NHANES 자료를 활용한 2차 분석 연구로서, 모든 데이터는 비식별화된 상태로 제공된다. 개인 식별이 가능한 정보는 포함되어 있지 않으며, 연구자는 원시 데이터에 직접 접근하지 않고 공개된 파일을 다운로드하여 분석을 수행하였다. 이러한 특성으로 인해 본 연구는 기관생명윤리위원회(IRB)의 심의 면제 대상에 해당하며, 추가적인 윤리적 위험은 존재하지 않는다. 연구 절차는 헬싱키 선언의 윤리 원칙을 준수하였다.
3. 연구 결과
3.1 ROC-AUC 비교
Fig 2는 Logistic Regression, Random Forest, Gradient Boosting, Extra Trees, XGBoost의 총 다섯 가지 기계학습 모델에 대해 검증용 데이터셋을 기반으로 산출한 ROC 곡선을 제시한 것이다. 전체적으로 Random Forest가 ROC-AUC 0.647로 가장 높았으며, Gradient Boosting은 0.646으로 유사한 수준의 판별력을 보였다(Table 1). 우울 고위험군 판별에 가장 높은 민감도와 특이도의 균형을 확보한 모델로 나타났다. 다른 모델들과 비교했을 때 Gradient Boosting은 완만하지만, 안정적인 상승 곡선을 보이며, 다양한 threshold 범위에서도 상대적으로 우수한 구분 능력을 유지하였다. 이는 비선형 관계가 강한 건강·행동 데이터에서 트리 기반 부스팅 알고리즘의 장점이 잘 나타난 결과라 할 수 있다.

그림 2. 5개 모델의 ROC 곡선 비교
Fig. 2. ROC curve comparison of five machine learning models
표 1. 기계학습 모델 간 성능 비교(최적화된 임계값)
Table 1. Performance comparison across machine learning models (optimized threshold)

3.2 Precision-Recall 성능
우울 고위험군은 전체 대상자의 약 15.8% 수준으로 분포가 불균형한 특성을 보이기 때문에, 단순 ROC-AUC만으로 모델 성능을 평가하는 것은 충분하지 않다. 이에 Fig 3에서는 각 모델의 Precision–Recall(PR) 곡선을 제시하였다.

그림 3. 5개 모델의 Precision-Recall 곡선 비교
Fig. 3. Precision-Recall curve comparison of five machine learning models
분석 결과, Gradient Boosting과 Random Forest는 상대적으로 높은 AUPRC(Area Under Precision–Recall Curve)를 보여 희귀 클래스인 우울 고위험군을 보다 효과적으로 탐지하는 모델임을 확인할 수 있었다. 특히 Gradient Boosting은 낮은 threshold에서도 일정 수준 이상의 Precision을 유지하면서 Recall을 확장하는 특성을 보여, PR 곡선에서 상대적으로 우수한 성능을 보였으나, F1-score가 0.333 수준에 머물러 실제 임상 스크리닝 도구로 직접 적용하기에는 한계가 있다.
최적 threshold 기준으로 산출한 모델별 정량적 성능 비교 결과는 Table 1에 제시하였다. Random Forest가 ROC-AUC 0.647로 가장 높았으며, Gradient Boosting은 F1-score 0.333으로 가장 높은 값을 보였다.
다만, 전체 모델의 ROC-AUC는 0.61–0.65 범위로 poor to fair 수준에 해당하며, 최적 threshold에서도 F1-score가 0.333 이하로 나타나 양성 클래스에 대한 예측 균형에는 한계가 있는 것으로 평가된다.
3.3 Gradient Boosting 변수 중요도
Fig 4는 전체 모델 중 가장 높은 예측 성능을 보인 Gradient Boosting 모델의 변수 중요도 상위 20개를 제시한 것이다. 소득지수(INDFMPIR), 체질량지수(BMI), hs-CRP, HbA1c, HDL 등 주요 혈액·대사 지표가 높은 중요도를 보였으며, 이들은 우울 고위험군 예측에 가장 크게 기여한 변수로 나타났다. 생물학적 요인뿐 아니라 사회경제적 요인, 건강행동 변인도 함께 높은 예측 기여도를 보여, 본 모델에서 우울 고위험군 분류에 상대적으로 높은 예측 기여도를 보였음을 의미하며, 이는 해당 변수들이 우울 고위험군과 통계적 관련성을 가질 가능성을 시사한다. 다만, 본 연구는 단면 자료 기반 예측모델 연구로서 변수와 우울 위험 간의 인과관계를 의미하지 않는다.

그림 4. Gradient Boosting 모델의 상위 20개의 변수 중요도
Fig. 4. Top 20 feature importances in the Gradient Boosting model
주요 변수 설명: INDFMPIR(소득-빈곤비율), BMX BMI(체질량지수), LBXGH(HbA1c), LBDHDD(HDL 콜레스테롤), LBXGLU(공복혈당), LBXHSCRP(hs-CRP), ALQ130(음주빈도), SMQ020(흡연 여부), PAD645(신체활동)
3.4 SHAP 기반 모델 해석
Gradient Boosting 모델을 보다 정교하게 해석하기 위해 SHAP(Shapley Additive exPlanations) 분석을 수행하였으며, Fig 5는 각 변수의 영향 방향과 기여 크기를 요약한 SHAP summary plot을 제시한다.

그림 5. Gradient Boosting 모델의 SHAP 요약 플롯
Fig. 5. SHAP summary plot for Gradient Boosting model
분석 결과, 소득지수(INDFMPIR)가 높을수록 우울 고위험군으로 분류될 확률이 감소하는 경향을 보였으며, 이는 사회경제적 취약성이 우울 위험과 관련될 가능성을 시사한다. 이는 예측모델 수준의 통계적 연관성을 의미하며, 인과적 기전을 단정하는 것은 아니다. 이러한 결과는 우울증이 단순 정신적 요인에 의해 발생하는 것이 아니라 만성염증, 대사 이상, 신체활동 부족, 사회경제적 취약성과 같은 요인이 복합적으로 상호 작용함을 지지한다. 또한, SHAP 분석은 개별 변수의 기여뿐 아니라, 동일 변수 내에서도 값의 분포에 따라 모델 예측에 미치는 영향이 달라지는 비선형 패턴을 시각적으로 보여준다는 점에서 중요한 의미를 가진다. 이를 통해 기계학습 모델의 예측 결과가 특정 변수에 의해 왜곡되거나 과도하게 좌우되는지 여부를 확인할 수 있으며, 향후 임상적 해석과 개입 전략 수립 과정보다 투명한 의사결정을 가능하게 한다.
4. 고찰
본 연구는 NHANES 2017–2018 및 2021–2023 자료를 기반으로 혈액 바이오마커와 사회인구학적·생활습관 요인을 통합하여 우울 고위험군을 예측하는 기계학습 모델을 개발하고 그 성능을 비교하였다. 다섯가지 모델 중 Gradient Boosting은 최적 threshold 기준에서 가장 높은 F1-score를 보였으며, Random Forest는 가장 높은 ROC-AUC를 나타냈다. 이는 비선형 구조를 갖는 건강·행동 데이터에서 부스팅 알고리즘의 장점을 확인한 결과라 할 수 있다. 또한, Gradient Boosting 모델에서 도출된 변수 중요도와 SHAP 분석 결과, 우울 고위험군 예측에는 소득수준(INDFM PIR), BMI, CRP, HbA1c, HDL 등 생물학적·사회경제적 지표가 핵심적인 기여하는 것으로 나타났다.
이러한 결과는 기존 연구들이 제시해 온 염증반응과 우울증의 관련성[1,2], 대사지표(특히 TG/HDL-C 및 HbA1c)와 우울 위험 간의 연관성[3], 그리고 비전형 우울증과 대사증후군 구성요소 간의 유의한 관계를 보고한 국내 연구[4,5]의 결과와 일맥상통한다. 특히 hs-CRP와 HbA1c가 높은 경우 우울 고위험군 예측 확률이 증가하는 패턴으로 만성염증 및 대사 불균형과 우울 위험 간의 통계적 관련 가능성을 지지한다는 점에서 해석될 수 있다. 반면 소득수준(INDFMPIR)이 높을 수록 우울 고위험군으로 분류될 확률이 낮은 경향을 보였다, 이는 사회경제적 취약성이 우울증의 위험요인으로 지속적으로 보고되어 온 공중보건 연구 맥락과 일치한다. 이처럼 생물학적 지표뿐 아니라 사회경제적 요인이 함께 중요한 설명력을 가진다는 점은 우울증이 단일 병태생리적 요인으로 설명되기 어렵고, 다차원적 접근이 필요하다는 점을 재확인시킨다.
본 연구의 장점은 생물학적·사회인구학적·생활습관요인을 동시에 통합하여 예측모델을 구축하고, ROC-AUC뿐 아니라 Precision–Recall Curve, threshold 최적화, SHAP 분석 등을 활용해 모델 성능과 해석력을 균형 있게 평가했다는 점이다. 특히 SHAP 분석을 통해 각 변수의 영향 방향과 크기를 시각적으로 확인함으로써 기존 역학연구에서 제기된 기전적 가설들을 데이터 기반으로 재확인할 수 있었다. 그러나 본 연구는 몇 가지 한계점을 가진다. 첫째, NHANES 자료는 단면조사(cross-sectional) 설계이므로 예측요인과 우울 고위험군 간의 인과관계를 추론하는 데 한계가 있다. 둘째, 자기보고식 설문 기반의 우울 측정(PHQ-9)은 임상진단을 완전히 대체하기 어렵다. 셋째, 혈액 바이오마커 외에도 염증성 사이토카인(IL-6, TNF-α), 호르몬 지표(코르티솔) 등 추가 변수들을 포함하지 못했기 때문에 생물학적 기전을 보다 깊이 분석하는 데 한계가 있을 수 있다. 마지막으로 클래스 불균형 문제로 인해 F1-score는 상대적으로 낮은 수준을 보였으며, 향후 SMOTE, ensemble resampling, cost-sensitive learning 등의 추가 기법 적용이 성능 향상에 도움이 될 수 있다.
그럼에도 불구하고 본 연구는 대규모 국가 단위 자료를 활용하여 객관적 바이오마커와 사회환경적 정보를 종합한 우울 고위험군 예측모델을 제시함으로써, 정신건강 연구에서 생물학적·사회경제적 요인을 통합한 기계학습 접근의 가능성을 제시했다는 점에서 의의가 크다. 나아가 본 연구 결과는 임상·공중보건 영역에서 고위험군 조기 선별 및 맞춤형 중재 전략 설계에 기초 자료로 활용될 수 있을 것이다.
특히 본 연구는 2017–2018년과 2021–2023년 자료를 통합 분석하였으나, COVID-19 이후 사회적·경제적 변화가 정신건강에 미친 인과적 영향을 직접적으로 검증하지는 못하였다. 향후 연구에서는 종단적 데이터 분석을 통해 팬데믹 이후 사회구조 변화와 생물학적 지표 간의 매개효과 및 조절효과를 분석할 필요가 있다. 또한, IL-6, TNF-α, 코르티솔 등 추가 염증·호르몬 지표를 포함한 변수 확장과 국내 코호트 자료(KNHANES 등) 및 해외 외부 코호트를 활용한 외부 검증(external validation)을 수행함으로써 모델의 일반화 가능성과 임상적 활용성을 강화할 필요가 있다. 궁극적으로 본 모델은 단독 진단 도구가 아닌 1차 선별(screening) 보조 도구로서의 활용 가능성을 추가 연구를 통해 검증해야 할 것이다.
5. 결론
본 연구는 NHANES 2017–2018 및 2021–2023년 자료를 기반으로 혈액 바이오마커, 사회인구학적 요인, 생활습관 변수를 통합한 우울 고위험군 예측모델을 구축하고 다양한 기계학습 알고리즘의 성능을 비교하였다. Random Forest는 가장 높은 ROC-AUC를, Gradient Boosting은 최적 threshold 기준에서 가장 높은 F1-score를 나타냈으나, 전반적인 분류 성능은 ‘poor to fair’ 수준에 머물렀다. 주요 기여 변수로는 소득수준(INDFMPIR), BMI, CRP, HbA1c, HDL 등이 확인되었으며, 이는 우울 위험이 생물학적 요인과 사회 경제적 요인의 복합적 상호작용과 통계적으로 연관될 수 있음을 시사한다.
본 연구는 단면자료 기반 예측모델로서 인과관계를 규명하는 데에는 한계가 있으며, 특히 COVID-19 이후 사회·경제적 환경 변화가 정신건강에 미친 영향을 직접적으로 검증하지는 못하였다. 향후 종단자료를 활용한 인과적 추론, 추가 바이오마커 확장, 불균형 데이터 보정 기법 적용, 국내외 코호트를 통한 외부 검증을 통해 모델의 일반화 성능을 강화할 필요가 있다.
이러한 후속 검증이 이루어진다면, 본 예측모델은 임상진단을 대체하는 도구가 아니라 공중보건 및 1차 선별 단계에서 고위험군을 조기에 식별하는 보조적 의사결정 지원 도구로 활용될 수 있을 것이다.
References
- Valkanova, V., Ebmeier, K. P., & Allan, C. L. (2013). CRP, IL-6 and depression: a systematic review and meta-analysis of longitudinal studies. Journal of Affective Disorders, 150(3), 736-744. https://doi.org/10.1016/j.jad.2013.06.004
- Zalli, A., Jovanova, O., Hoogendijk, W. J., Tiemeier, H., & Carvalho, L. A. (2016). Low-grade inflammation predicts persistence of depressive symptoms. Psychopharmacology, 233(9), 1669-1678. https://doi.org/10.1007/s00213-015-3919-9
- Tang, X., He, Q., Liu, X., & Fu, Q. (2025). Association between TG/HDL-C and depression in US adults. Medicine, 104(18), e42337. https://doi.org/10.1097/MD.0000000000042337
- Lee, C. Y., Jeong, D. W., Kim, S. J., Kang, J. W., Moon, J. J., Jeon, D. W., ... & Nam, S. H. (2019). The association between atypical depression and metabolic syndrome in Korean adults. Journal of Psychosomatic Medicine (psychiatry), 27(2), 90-100.
- Im, M. Y. (2021). The impact of depression on metabolic syndrome and its components in Korean adults. Stress, 29(4), 235-241. https://doi.org/10.17547/kjsr.2021.29.4.235
- Song, B. M., et al. (2015). Association between CRP level and depressive symptoms in an elderly Korean population. BMJ Open, 5(2), e006429. https://doi.org/10.1136/bmjopen-2014-006429
- Ahn, M. H., Um, Y. J., & Park, Y. G. (2021). Association between depression and serum hs-CRP levels in Korean adults: Analysis of KNHANES 2018 data. Korean Journal of Family Practice, 11(3), 191-196. https://doi.org/10.21215/kjfp.2021.11.3.191
- Heo, N. W., Kim, H. C., Waite, L., & Youm, Y. (2018). Is the relationship between depression and C-reactive protein level moderated by social support in the elderly? Korean Social Life, Health, and Aging Project (KSHAP). Psychiatry Investigation, 15(1), 24-33. https://doi.org/10.4306/pi.2018.15.1.24
- Lee, S. M., & Ha, H. J. (2025). Depression prediction in older adults using automated machine learning. Journal of Korean Information Technology, 23(4), 1-10. https://doi.org/10.14801/jkiit.2025.23.4.01
- Park, S. H., Ha, Y. J., & Kim, K. W. (2025). Hyperparameter optimization for improving DNN-based depression risk prediction performance. Journal of Korean Information Technology, 23(10), 11-22. https://doi.org/10.14801/jkiit.2025.23.10.11
- Yoo, H. W., & Oh, H. Y. (2023). Depression diagnosis model using multimodal deep learning. The Journal of Korean Institute of Communications and Information Sciences, 27(5), 603-610. https://doi.org/10.6109/jkiice.2023.27.5.603