DOI QR코드

DOI QR Code

Development of a Disease Prediction Model on AI Multimodal Using Health Data

건강 데이터를 이용한 AI 다중질환 통합 예측 프레임 워크

  • Han-bin Seon (Department of AI Healthcare Major, Catholic Kwandog University) ;
  • Jae-Hyun Jo (Department of AI Healthcare Major, Catholic Kwandog University) ;
  • Sang-Sik Lee (Department of AI Healthcare Major, Catholic Kwandog University) ;
  • Jin-Hyoung Jeong (Department of Medical Management, Catholic Kwandog University)
  • Received : 2026.02.12
  • Accepted : 2026.02.27
  • Published : 2026.02.28

Abstract

Liver disease, cardiovascular disease, and diabetes are major chronic illnesses that can lead to severe complications and rising medical costs when not detected early. This study proposes a machine learning based multimodal prediction model integrating health screening data to estimate the risks of these diseases. Using preprocessed Kaggle datasets, logistic regression, random forest, and XGBoost algorithms were trained for single-disease prediction, achieving accuracies and ROC-AUCs of 0.9000 / 0.9525 (liver), 1.0000 / 1.0000 (heart), and 0.7546 / 0.8302 (diabetes). The metadata-merge stacking multimodal model achieved an accuracy of 0.9268 and a ROC-AUC of 0.9469, showing a 2~10 percentage-point improvement compared with single models. These results demonstrate the feasibility of early risk prediction and disease interaction modeling using routine health screening data, suggesting future potential for nonlinear meta-learners and multimodal data integration.

간질환, 심혈관 질환, 당뇨병은 대표적인 만성질환으로 조기 진단 실패 시 심각한 합병증과 의료비 증가를 초래한다. 본 연구는 건강검진 데이터를 활용하여 세 질환의 위험도를 예측하고, 이를 다중질환 통합 예측 구조로 통합한 머신러닝 기반 예측 모델을 제안하였다. Kaggle 공개 데이터를 전처리한 후 로지스틱 회귀, 랜덤 포레스트, XGBoost 알고리즘을 적용하여 단일 모델을 학습한 결과, 간질환(정확도 0.9000, ROC-AUC 0.9525), 심혈관 질환(정확도 1.0000, ROC-AUC 1.0000), 당뇨병(정확도 0.7546, ROC-AUC 0.8302)으로 평가되었다. 이후 metadata merge 기반 스태킹 구조를 적용한 다중질환 통합 예측 모델은 정확도 0.9268, ROC-AUC 0.9469를 기록하며 단일 모델 대비 약 2~10%p 수준의 성능 향상을 보였다. 본 연구는 건강검진 데이터만으로 복합 질환의 상호작용을 반영한 조기 예측 가능성을 제시하며, 향후 비선형 메타 학습기와 다양한 모달리티 통합을 통한 고도화 가능성을 확인하였다.

Keywords

1. 서론

현대 사회에서 간질환, 심혈관 질환, 당뇨병과 같은 만성 질환은 전 세계적으로 높은 유병률과 사망률을 보이며 인류 건강에 심각한 위협이 되고 있다. 이들 질환은 대부분 증상이 서서히 진행되거나 초기 단계에서 뚜렷한 임상적 징후가 나타나지 않기 때문에 조기 진단이 어렵고, 치료가 지연될 경우 심각한 합병증과 의료비 증가로 이어진다[1][2].

따라서 질환이 발병하기 이전 단계에서 위험 요인을 조기에 파악하고, 이를 기반으로 예방 및 관리 전략을 수립하는 것은 현대 의학의 핵심 과제로 떠오르고 있다.

최근 인공지능(AI)과 머신러닝(Machine Learning, ML) 기술이 의료 분야에 적극적으로 도입되면서 이러한 문제 해결에 새로운 가능성이 열리고 있다[3]. 특히, 의료 데이터 분석을 통해 질환 발생 가능성을 예측하고 조기 진단을 지원하는 연구가 활발히 이루어지고 있으며, 이는 임상 의사결정 보조, 환자 맞춤형 치료계획 수립, 의료 자원 효율화 등 다양한 측면에서 높은 활용 가치를 가진다. 그중에서도 건강검진 데이터를 활용한 예측 모델은 비침습적이며 반복 측정이 용이하다는 점에서 중요한 의미를 지닌다[4].

그러나 기존 연구들은 대부분 단일 질환에 초점을 맞추거나 특정 지표만을 활용한 예측에 그치는 경우가 많다. 이러한 접근은 질환 간의 상호작용과 복합적인 위험요인을 고려하지 못하기 때문에 실제 임상 환경에서의 활용성에 한계가 존재한다. 예를 들어, 당뇨병 환자에게서 심혈관 질환의 발병 위험이 높거나, 간 기능 이상이 다른 대사성 질환과 연관될 수 있음에도 불구하고 이러한 복합 관계를 분석하는 연구는 상대적으로 부족하다.

이에 본 연구는 단일 질환 중심의 기존 예측 모델을 넘어, 간질환, 심혈관 질환, 당뇨병이라는 대표적 만성질환을 통합적으로 분석하는 다중질환 통합 예측 모델을 제안한다. 본 연구에서는 먼저 각 질환별 혈액검사 및 건강검진 데이터를 이용하여 독립적인 머신러닝 모델을 구축하고 성능을 비교·평가한다. 이후 개별 모델에서 산출된 확률값을 통합하여 질환 간 상호작용을 고려한 다중질환 통합 예측 모델을 설계하며, 최종적으로 위험도 스코어링을 통해 환자의 건강 상태를 정량적으로 평가하고 질환 예방 및 관리 전략 수립에 활용 가능한 의사결정 지원 지표를 제시함으로써 예방 및 관리 전략 수립에 기여하고자 한다.

2. 이론적 배경 및 관련 연구

2.1 만성 질환과 조기 예측의 필요성

만성 질환은 현대인의 생활 습관 변화, 고령화, 식습관 불균형 등의 요인으로 인해 꾸준히 증가하고 있으며, 전체 사망 원인의 70% 이상을 차지할 정도로 중요한 보건 문제로 자리 잡고 있다. 특히 간질환, 심혈관 질환, 당뇨병은 상호 관련성이 높고 동반 발병률이 높아 개별 질환에 대한 접근만으로는 효과적인 예방과 관리가 어렵다. 조기 예측 모델을 통해 위험군을 조기에 선별하고 예방적 개입을 실현하는 것은 의료비 절감, 삶의 질 향상, 의료 자원의 효율적 활용 측면에서 매우 중요한 의미를 지닌다[5].

2.2 의료 데이터와 머신러닝의 활용

머신러닝과 딥러닝 기술은 대규모 의료 데이터를 분석하여 질환의 발생 가능성을 예측하고 조기 진단을 지원하는 데 널리 활용되고 있다. 특히 혈액검사 데이터, 유전자 정보, 생활습관 요인과 같은 정량적 데이터를 통해 질병 위험 요인을 추출하고, 이를 기반으로 질환 발병 확률을 예측하는 연구가 활발히 진행되고 있다. 이러한 접근법은 전통적인 통계적 분석보다 높은 예측 정확도와 일반화 능력을 보여주며, 임상 현장에서 조기 진단 및 환자 위험도 평가를 위한 의사결정 지원 도구로서의 활용 가능성을 입증하고 있다[6].

머신러닝 기법 중에서도 랜덤 포레스트(Random Forest) 알고리즘은 의료 분야에서 가장 많이 활용되는 방법 중 하나이다. 이 기법은 다수의 의사결정 트리를 결합하여 앙상블(ensemble) 형태로 예측을 수행함으로써 단일 모델보다 높은 정확도와 안정성을 확보할 수 있다. 또한 각 변수의 중요도를 계산할 수 있어 질환 발생에 영향을 미치는 주요 요인을 식별하고, 임상의가 해석 가능한 형태로 정보를 제공한다는 점에서 큰 장점을 지닌다.

반면, 로지스틱 회귀(Logistic Regression) 모델은 비교적 단순한 구조를 가지고 있음에도 불구하고 해석력이 뛰어나 의료 데이터 분석에서 꾸준히 사용되고 있다. 특히 질환의 발생 여부를 확률 형태로 표현할 수 있어 예측 결과를 직관적으로 이해할 수 있으며, 임상 의사결정에 필요한 임계값(threshold) 설정에도 용이하다. 이러한 특성으로 인해 로지스틱 회귀는 예측 정확도뿐만 아니라 모델의 설명 가능성(explainability) 측면에서도 여전히 중요한 역할을 한다.

이와 더불어 부스팅(Boosting) 계열 알고리즘인 LightGBM과 XGBoost 역시 의료 분야에서 각광받고 있다. 이들은 다수의 약한 분류기(weak classifier)를 순차적으로 학습시켜 예측 성능을 극대화하며, 특히 대규모 데이터셋을 빠른 속도로 처리할 수 있다는 장점이 있다. 이러한 특징 덕분에 의료 빅데이터 분석과 같이 대량의 변수와 복잡한 상호작용이 존재하는 상황에서도 높은 성능을 유지할 수 있다.

2.3 단일 질환 예측 연구의 한계

기존 연구는 대체로 하나의 질환을 대상으로 한 단일 예측 모델에 초점을 맞추었다. 예를 들어, 간 수치와 관련된 혈액 데이터만을 사용한 간질환 예측, 심전도 및 혈압을 이용한 심혈관 질환 예측, 생활 습관 요인을 활용한 당뇨병 예측 모델 등이 이에 해당한다. 하지만 이러한 접근은 복합적인 위험 인자를 충분히 반영하지 못하고, 질환 간 연관성을 고려하지 않아 실제 임상 적용 시 예측 정확도가 떨어지는 한계가 있다.

3. 연구 방법

3.1 데이터셋 구성 및 전처리

본 연구에서는 간질환, 심혈관 질환, 당뇨병이라는 세 가지 주요 만성 질환을 대상으로 다중질환 통합 예측 모델을 구축하기 위해 서로 다른 성격의 의료 데이터를 활용하였다. 이들 질환은 모두 높은 유병률과 상호 연관성을 지니며, 조기 예측과 위험군 선별이 임상적으로 매우 중요하다는 공통점을 가진다. 이를 위해 공공 데이터 플랫폼인 Kaggle에서 제공하는 질환별 데이터셋을 수집하였으며, 혈액검사 수치, 인구통계학적 정보, 생활 습관, 생리적 지표 등 질환 발생에 영향을 미칠 수 있는 다양한 특성을 포함하도록 하였다.

단, 본 연구에서 사용한 간질환, 심혈관질환, 당뇨병 데이터셋은 각각 서로 다른 공개 Kaggle 데이터셋에서 수집되었으며, 동일 환자 코호트를 구성하지 않는다. 따라서 본 연구의 통합 단계는 동일 환자에 대한 다질환 동시예측의 임상 검증이 아니라, 질환별 독립 예측기의 출력 신호를 통합하는 탐색적 프레임워크로 설계되었다.

간질환 데이터셋은 연령, 성별, 체질량지수(BMI), 음주 및 흡연 여부, 유전적 요인, 신체 활동 지수, 당뇨 및 고혈압 여부, 간 기능 검사 수치 등의 변수를 포함하며 최종 진단 결과를 예측 대상으로 삼았다. 심혈관질환 데이터셋에는 나이, 성별, 흉통 유형, 혈압, 혈중 콜레스테롤 수치, 심전도 소견, 최대 심박수, 운동 유발 협심증 여부, ST 분절 변화량 등의 임상 지표가 포함되었고, 심질환의 존재 여부를 라벨로 사용하였다. 당뇨병 데이터셋은 체질량지수, 고혈압 및 고콜레스테롤 여부, 흡연 및 신체 활동 정보, 전반적 건강 상태, 정신적·신체적 건강 지표 등을 포함하며 당뇨병 진단 여부를 목표 변수로 설정하였다. 본 연구에서 활용된 세 가지 질환별 데이터셋은 모두 Kaggle 공개 데이터를 기반으로 독립적으로 수집되었으므로, 데이터 수집기관 및 시점이 상이하며 데이터 간 환자들의 물리적인 중복(Patient Overlap)은 존재하지 않는다. 이에 따라 각 데이터셋의 인구통계학적 분포 역시 해당 질환군의 특성에 따라 차이를 보인다.

그럼에도 불구하고 이질적인 데이터를 통합하여 다중모달 구조를 설계한 타당성은 다음과 같다. 첫째, 본 연구는 완벽하게 연동된 단일 코호트 데이터가 부재한 상황에서, 이질적 데이터를 통합하여 복합 질환의 상호작용을 예측하는 모델링 아키텍처의 유효성을 검증하는 '방법론적 사전 검증(Proof of Concept)'에 목적이 있다. 둘째, 각 데이터셋에 공통으로 존재하는 인구통계학적 정보 및 기본 임상 지표를 메타데이터 병합(metadata merge)의 매개체로 활용함으로써 데이터 간 분포적 이질성을 보정하고 모델이 질환 간 상관관계를 학습하도록 설계하였다. 이는 향후 실제 병원 단위의 통합 데이터가 확보되었을 때 본 연구의 프레임워크가 즉각적으로 활용될 수 있음을 시사한다.

데이터 전처리 과정에서는 분석의 정확도를 높이기 위해 결측치 제거 및 이상치 처리를 수행하였다. 범주형 변수는 원-핫 인코딩을 통해 수치형 데이터로 변환하였으며, 연속형 변수는 표준화 과정을 통해 평균 0, 분산 1의 정규 분포로 변환하여 모델 학습의 효율성을 높였다. 이후 전체 데이터는 학습용(80%)과 테스트용(20%)으로 분리하여 모델의 일반화 성능을 검증할 수 있도록 하였다.

표 1. 질환 예측 데이터셋의 기본 통계 및 클래스 분포

Table 1. Basic statistics and class distributions of disease prediction datasets

JBJTBH_2026_v19n1_159_4_t0001.png 이미지

3.2 단일 질환 예측 모델 설계

각 질환별로 독립적인 예측 모델을 구축하여 개별질환에 대한 예측 성능을 평가하고, 이를 기반으로 다중질환 통합 예측 모델 개발의 기초를 마련하였다. 단일 모델 학습에는 대표적인 지도학습 알고리즘을 적용하였으며, 이들은 질환별 특성과 데이터 구조에 따라 적합성이 높다고 판단되는 모델들이다.

로지스틱 회귀(Logistic Regression)는 비교적 단순한 구조를 가지고 있지만, 결과를 확률 형태로 제공하여 임상적 해석이 용이하고, 질환 예측의 임계값 설정에도 유리하다. 랜덤 포레스트(Random Forest)는 여러 개의 의사결정 트리를 앙상블하여 예측을 수행함으로써 높은 정확도와 안정성을 확보할 수 있으며, 변수 중요도를 통해 질환 발생에 영향을 미치는 주요 요인을 식별할 수 있다. 또한 LightGBM과 같은 부스팅 계열 알고리즘은 비선형 관계를 효과적으로 학습하고, 대규모 데이터에서도 빠른 학습 속도와 높은 성능을 보인다.

이러한 알고리즘들을 동일한 조건에서 교차 검증을 통해 비교하였으며, 정확도(Accuracy), 정밀도(Precision), 재현율(Recall), F1-score, ROC-AUC 등의 지표를 종합적으로 분석하여 최적의 성능을 보이는 모델을 선정하였다. 선정된 단일 모델은 이후 다중질환 통합 예측 모델 통합 구조에서 각각의 질환 예측기(base model)로 활용된다.

3.3 다중질환 통합 예측 모델통합 구조 설계

본 연구는 단일 질환 모델의 예측 확률만 단순 결합하는 방식의 한계를 보완하기 위해, metadata merge 기반 feature-level stacking 구조를 적용하였다.

단일 질환 예측기(간질환, 심혈관 질환, 당뇨병)의 양성 클래스 예측 확률을 각각 pliver, pheart, pdiabetes로 정의하고, 샘플 I의 환자 메타데이터 벡터를 mi∈Rk라 할 때, 메타모델 입력 베타는 다음과 같이 구성하였다.

zi = [plicer,i, pheart,i, pdiabebetes,i, mi]

따라서 입력 차원은 dim(zi) = 3 + k이다.

메타데이터 mi 는 세 질환 데이터셋 간 공통 매핑이 가능하고 임상적으로 관련성이 높은 변수(예: 연령, 성별, BMI, 흡연 여부, 신체활동 여부, 고혈압 여부 등)로 구성하였으며, 변수 목록과 인코딩 방식은 표 X에 제시하였다. 3.1절에서 기술한 바와 같이 범주형 변수는 원-핫 인코딩, 연속형 변수는 표준화(z-score)를 적용하였다.

건강 데이터를 이용한 AI 다중모달 질환 예측 모델 개발 구현 시에는 각 단일 질환 모델의 예측 확률과 메타데이터를 샘플 기준으로 정렬한 후, 열 방향(column-wise) concatenation으로 결합하여 메타모델 입력 행렬 Z∈Rn*(3+k)를 생성하였다. 메타모델은 해석 가능성과 확률 출력 안정성을 고려하여 로지스틱 회귀(Logistic Regression)를 사용하였다.

3.4 위험도 스코어링 설계

본 연구는 단순히 질환 유무를 예측하는 데서 나아가, 개인의 건강 상태를 정량적으로 평가할 수 있는 위험도 스코어링 체계를 설계하였다. 각 모델의 예측 확률을 기반으로 환자를 고위험, 중간위험, 저위험 그룹으로 분류하였으며, 이를 통해 질환 발생 가능성을 계층적으로 파악할 수 있도록 하였다. 예측 확률이 0.8 이상인 경우를 고위험군, 0.5~0.8을 중간위험군, 0.5 미만을 저위험군으로 설정하였다. 이후 각 위험군 내에서의 실제 질환 발생률을 분석하여 모델의 임상적 활용 가능성을 평가하였다.

위험도 스코어링은 단순한 예측 결과보다 더 풍부한 정보를 제공하며, 환자 맞춤형 예방 전략 수립, 사전 건강 관리 계획 수립 등 다양한 의료적 의사결정에 활용될 수 있다. 특히 이러한 접근은 질환이 발생하기 전에 위험군 환자를 선별하고 조기 개입을 가능하게 한다는 점에서 예방 중심 의료 패러다임과도 부합한다.

3.5 성능 평가 및 실험 환경

모델의 성능을 평가하기 위해 다양한 지표를 활용하였다. 전체 예측 중에서 실제 결과와 일치하는 비율을 나타내는 정확도는 모델의 전반적인 성능을 평가하는 지표로 사용되었다. 그러나 의료 데이터의 특성상 불균형한 클래스 분포를 고려해야 하기 때문에, 정밀도와 재현율을 함께 분석하였다. 정밀도는 모델이 질환이라고 예측한 사례 중 실제로 질환자인 비율을 의미하며, 재현율은 실제 질환자 중에서 모델이 질환으로 올바르게 분류한 비율을 나타낸다. 두 지표의 조화평균인 F1-score는 불균형 데이터에서도 모델의 예측 성능을 보다 정확히 평가할 수 있도록 도와준다.

또한, 분류 임계값을 변화시키며 모델의 판별 능력을 종합적으로 평가할 수 있는 ROC-AUC 지표도 활용하였다. ROC-AUC는 민감도와 특이도 간의 균형을 평가함으로써 모델의 판별 성능을 임계값에 관계없이 비교할 수 있도록 한다. 이러한 다양한 지표를 종합적으로 분석함으로써 본 연구는 모델의 성능을 다각적으로 검증하고, 임상 적용 가능성을 평가하였다.

실험은 Jupyter Notebook 기반 Python 환경에서 수행되었으며, 주요 라이브러리로는 scikit-learn, Light GBM, pandas, numpy를 사용하였다. 모든 알고리즘은 동일한 조건에서 학습 및 평가를 진행하여 결과의 공정성과 재현성을 확보하였으며, Jupyter Notebook 환경을 통해 코드, 시각화, 결과를 통합 관리하여 실험 과정의 투명성과 재현 가능성(reproducibility) 을 강화하였다.

JBJTBH_2026_v19n1_159_5_f0001.png 이미지

그림 1. 연구 전체 절차 개요도

Fig. 1. Overall Research Procedure

4. 실험 및 결과

본 연구에서는 간질환, 심혈관 질환, 당뇨병이라는 세 가지 주요 만성질환에 대해 개별 예측 모델을 구축한 후, 이를 다중질환 통합 예측 모델 구조로 통합하여 질환 간 상관관계를 반영한 통합 예측 모델을 구현하였다. 각 질환별 모델 학습과 평가 과정은 동일한 데이터 전처리 절차를 거쳤으며, 이후 예측 확률을 기반으로 한 위험도 스코어링과 성능 지표 비교를 통해 모델의 효과성을 분석하였다.

4.1 개별 질환 예측 모델의 성능 평가

각 질환별 데이터셋에 대해 단일 모델을 학습하고, 성능은 [Stratified K-fold, K=[ ]] 교차 검증을 통해 평가하였다. 클래스 비율 보존을 위해 stratified 분할을 적용하였으며, shuffle=[True/False], random_state=[ ] 조건에서 로지스틱 회귀, 랜덤 포레스트, XGBoost, LightGBM을 동일한 분할 기준으로 비교하였다. 비교 대상 알고리즘으로는 로지스틱 회귀(Logistic Regression), 랜덤 포레스트(Random Forest), XGBoost, LightGBM을 사용하였다.

그 결과, 간질환 예측에서는 XGBoost가 최적 모델로 선정되어 정확도 0.9000, ROC-AUC 0.9525를 기록하였다. 심혈관 질환 예측에서는 Random Forest가 학습 데이터에 완전히 적합하여 정확도와 ROC-AUC 모두 1.0000으로 나타났으나, 이는 데이터 규모가 작고 변수 간 상관성이 높아 과적합(overfitting) 현상이 발생한 결과로 해석된다. 또한, 과적합 가능성이 있는 base model의 출력 확률이 메타모델 입력으로 사용된 경우, 통합 모델 성능 역시 낙관적으로 추정되었을 가능성을 배제할 수 없다.

당뇨병 예측에서는 XGBoost가 가장 안정적인 성능을 보여 정확도 0.7546, ROC-AUC 0.8302를 기록하였다.

JBJTBH_2026_v19n1_159_6_f0001.png 이미지

그림 2. 각 단일 모델 ROC/PR 곡선

Fig. 2. ROC (left) and Precision–Recall (right) curves for single-disease models

표 2. 단일 모델 테스트 지표 요약

Table 2. Test-set performance of single-disease models

JBJTBH_2026_v19n1_159_6_t0001.png 이미지

Confusion Matrix 분석 결과, 각 질환별 모델은 정상군과 질환군을 명확히 구분하는 양상을 보였다. 특히 간질환과 심혈관 질환 모델에서는 음성(정상)과 양성(질환)의 분류 경계가 뚜렷하게 나타났으며, 오분류율이 매우 낮았다. 반면 당뇨병 모델은 클래스 불균형의 영향으로 일부 음성 환자를 질환군으로 예측하는 경향을 보였으나, 전반적인 판별 성능은 안정적으로 유지되었다. Calibration 곡선에서는 모든 단일 모델이 전반적으로 실제 발생률의 경향성을 추종하였으나, 당뇨병 모델의 경우 클래스 불균형의 영향으로 특정 확률 구간에서 예측치와 실제 관측치 간의 편차가 관찰되었다. 또한, 심혈관 질환 모델은 캘리브레이션 곡선상 이상적인 선형성을 보였으나 이는 소규모 데이터셋에서의 과적합(overfitting) 결과가 반영된 것으로 해석된다.

JBJTBH_2026_v19n1_159_7_f0001.png 이미지

그림 3. 단일 모델 Confusion Matrix

Fig. 3. Confusion matrices for single-disease models

JBJTBH_2026_v19n1_159_7_f0002.png 이미지

그림 4. 단일 모델 Calibration 곡선

Fig. 4. Calibration reliability diagrams for single-disease models

이러한 결과는 질환별 데이터 특성에 따라 최적 알고리즘이 다를 수 있음을 보여주며, 특히 앙상블 기반 모델(Random Forest, XGBoost)이 전반적으로 우수한 예측력과 일반화 가능성을 확보함을 시사한다. 다만, 심혈관 질환 모델의 경우 추가 교차 검증 및 외부 검증 데이터로의 성능 확인이 필요하다. 한편, 당뇨병 데이터셋은 클래스 불균형(class imbalance)으로 인해 정확도가 다소 낮았으나, ROC-AUC 0.83 수준으로 안정적인 판별 능력을 유지하였다.

4.2 다중질환 통합 예측 모델의 구축 및 성능

본 연구의 다중모달 스태킹 모델은 간질환·심혈관 질환·당뇨병 단일 모델의 예측 확률 3개와 환자 수준 메타데이터 벡터를 결합한 3+k 차원 입력 벡터를 메타모델에 입력하는 방식으로 구성하였다. 기존 원고에서 개념적으로 서술된 metadata merge 절차를 보완하기 위해, 수정본에서는 입력 벡터 구성, 변수 목록 및 인코딩 방식, 그리고 column-wise concatenation 방식을 명시하였다. 메타모델은 로지스틱 회귀를 사용하였다.

실험 결과, metadata merge 기반 feature-level stacking 모델의 성능은 정확도 0.9268, 정밀도 0.9545, 재현율 0.9130, F1-score 0.9333, ROC-AUC 0.9469로 나타났다.

본 연구 결과는 질환별 예측 확률과 메타데이터를 결합한 통합 구조의 가능성을 보여주나, simple averaging, voting 등 다른 앙상블 baseline과의 직접 비교가 충분히 수행되지 않아 metadata merge 방식의 우수성을 단정적으로 결론내리기에는 제한이 있다. 따라서 본 결과는 탐색적 성격의 결과로 해석하며, 향후 연구에서는 probability-only stacking, simple averaging, voting 등과의 체계적 비교를 통해 metadata merge의 기여도를 정량적으로 검증할 필요가 있다.

JBJTBH_2026_v19n1_159_7_f0003.png 이미지

그림 5. 멀티모달 ROC/PR 곡선

Fig. 5. ROC and Precision-Recall curves for the stacking-based multimodal classifier

표 3. 멀티모달 테스트 지표 요약

Table 3. Test-set performance of stacking-based multimodal classifier

JBJTBH_2026_v19n1_159_8_t0001.png 이미지

다중질환 통합 예측 모델의 Confusion Matrix에서는 질환 예측의 민감도와 특이도가 균형 있게 유지되어, 고위험군과 저위험군 간 구분 성능이 단일 모델보다 향상된 것으로 나타났다. Calibration 분석에서도 예측 확률과 실제 질환 발생률이 거의 일치하여, 다중질환 통합 예측 모델 구조가 확률적 예측의 신뢰성을 강화하는 데 기여했음을 확인하였다. 이는 메타데이터 병합(feature-level stacking)을 통해 개별 모델의 출력 불일치를 완화하고, 질환 간 상호작용 정보를 추가적으로 학습한 결과로 해석된다.

JBJTBH_2026_v19n1_159_8_f0001.png 이미지

그림 6. 멀티모달 Confusion Matrix

Fig. 6. Confusion matrix for multimodal classifier

JBJTBH_2026_v19n1_159_8_f0002.png 이미지

그림 7. 멀티모달 Calibration 곡선

Fig. 7. Calibration reliability diagram for the stacking-based multimodal classifier

특히 메타데이터 병합 방식을 적용한 스태킹 모델은 정보 손실을 최소화하고, 개별 질환 모델 간 상호 보완적 특징을 학습하여 예측 신뢰도(calibration)와 일반화 성능 모두 향상된 결과를 보였다.

4.3 위험도 스코어링 분석

최종적으로 각 모델의 예측 확률(predicted probability) 을 기반으로, 환자를 ‘고위험(High)’, ‘중위험(Medium)’, ‘저위험(Low)’의 세 구간으로 분류하는 위험도 스코어링(Risk Stratification) 을 수행하였다. 간질환 및 심혈관 질환 모델에서는 고위험군의 실제 양성률(positivity rate)이 100%로 나타나, 모델의 예측 확률이 임상적 위험 수준과 높은 일관성을 보였다. 이는 본 모델이 예측 확률을 임상적 위험 평가 지표(clinical risk indicator) 로 활용할 수 있는 가능성을 제시한다. 또한, 당뇨병 모델에서도 중위험군의 양성률이 63.6%로 확인되어, 관리 및 중재가 필요한 대상군을 효과적으로 식별(risk identification) 할 수 있음을 보였다.

표 4. 위험도 스코어링 결과 및 실제 양성률

Table 4. Risk Scoring Results and Actual Positivity Rates

JBJTBH_2026_v19n1_159_9_t0001.png 이미지

JBJTBH_2026_v19n1_159_9_f0001.png 이미지

그림 8. 위험도 스코어링 결과 및 실제 양성률

Fig. 8. Risk Scoring Results and Actual Positivity Rates

5. 결론 및 향후 연구 과제

본 연구에서는 건강검진 데이터를 활용하여 간질환, 심혈관 질환, 당뇨병의 세 가지 주요 만성질환에 대한 예측 모델을 구축하고, 이를 다중질환 통합 예측 모델 구조로 통합하여 질환 간 연관성을 반영한 통합 예측 시스템을 구축하였다. 개별 질환 모델의 경우 대부분 높은 정확도와 재현율을 기록하였으며, 특히 심혈관 질환 예측에서는 ROC-AUC가 1.000에 근접하였으나, 이는 데이터 특성상 과적합 가능성을 포함하므로 추가 검증이 필요하다. 이는 건강검진 데이터 내 변수들이 해당 질환과 높은 상관성을 지니며, 랜덤 포레스트나 로지스틱 회귀와 같은 비교적 전통적인 머신러닝 알고리즘만으로도 충분히 높은 예측력을 확보할 수 있음을 시사한다.

한편, 개별 모델의 출력 결과를 통합한 다중질환 통합 예측 모델에서는 metadata merge 기반 feature-level 스태킹 구조를 통해 단일 질환 모델 대비 성능이 전반적으로 향상되었다. 특히 ROC-AUC가 0.9469로 개선되며, 다중 질환의 복합적 위험 요인을 효과적으로 반영할 수 있음을 확인하였다. 이는 모델 간 출력 불일치로 인한 정보 손실을 완화하고, 질환 간 상호작용을 학습함으로써 예측 안정성과 신뢰도를 높인 결과로 해석된다. 향후에는 잠재표현(latent representation) 기반의 비선형 메타 학습기, 시계열 추적 데이터, 의료영상 데이터 등 다양한 모달리티를 추가하여 다중질환 통합 예측 모델를 고도화할 계획이다.

본 연구의 의의는 다음과 같다. 첫째, 단일 질환에 국한되지 않고 복수의 질환을 동시에 예측할 수 있는 기반을 마련함으로써 실제 임상 환경에서의 활용 가능성을 높였다. 둘째, 예측 결과를 단순한 이진 분류에 그치지 않고 위험도 스코어링을 통해 ‘고위험-중위험-저위험’ 으로 세분화함으로써 예방적 관리 및 의료 자원 분배 측면에서의 활용성을 제시하였다. 셋째, 질환 간 연관성을 반영한 다중질환 통합 예측 모델를 적용함으로써 복합 만성질환 관리의 새로운 접근 가능성을 탐색하였다.

향후 연구에서는 다음과 같은 방향으로 발전이 필요하다. 첫째, 장기 추적 관찰 데이터(Longitudinal Data)를 확보하여 3~5년간의 질환 발생 확률을 예측하는 시계열 기반 모델로 확장함으로써 조기 경고 시스템(Early Warning System)의 실현 가능성을 높여야 한다. 둘째, 의료 영상(CT, MRI) 또는 생활습관 데이터(활동량, 식습관)와 같은 다양한 모달리티를 통합하여 보다 정교한 다중질환 통합 예측 모델을 구축할 필요가 있다. 셋째, 임상 현장에서 사용 가능한 웹·모바일 기반의 사용자 인터페이스(UI)를 개발하여 의료 전문가 및 일반 사용자가 모델의 예측 결과를 직관적으로 활용할 수 있도록 해야 한다. 넷째, 본 연구의 한계는 스태킹 메타모델 입력 생성 과정에서 OOF 예측값을 사용하지 않았다는 점이다. 이로 인해 data leakage 가능성을 완전히 배제하기 어려우며, 스태킹 성능이 실제보다 높게 추정되었을 수 있다. 또한 nested cross-validation을 적용하지 않아 하이퍼파라미터 선택과 성능 평가의 분리도 충분히 엄밀하지 않을 수 있다. 향후 연구에서는 OOF 기반 스태킹 및 nested CV를 적용하여 보다 엄밀한 성능 검증을 수행할 예정이다.

결론적으로, 본 연구는 건강검진 데이터를 활용한 다중질환 예측 및 위험도 분석을 통해 의료 인공지능 기반의 예방 중심 건강관리 시스템 구축 가능성을 입증하였다. 향후 데이터 확장과 모델 고도화를 통해 본 연구의 성과는 조기 진단, 맞춤 치료, 의료 자원 관리 등 다양한 분야에서 실질적인 응용으로 이어질 것으로 기대된다. 이는 향후 실제 임상 환경에서의 조기 진단 및 맞춤형 의료 지원 체계로 확장될 수 있음을 시사한다.

References

  1. Rajkomar, A., Dean, J., & Kohane, I. (2019). Machine learning in medicine. New England Journal of Medicine, 380(14), 1347-1358. https://doi.org/10.1056/NEJMra1814259
  2. Miotto, R., Wang, F., Wang, S., Jiang, X., & Dudley, J. T. (2018). Deep learning for healthcare: Review, opportunities and challenges. Briefings in Bioinformatics, 19(6), 1236-1246. https://doi.org/10.1093/bib/bbx044
  3. E. Choi, M. T. Bahadori, L. Song, W. F. Stewart, and J. Sun, "GRAM: Graph-based attention model for healthcare representation learning," in Proceedings of the 23rd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD '17), Halifax, NS, Canada, Aug. 13-17, 2017, pp. 787-795.
  4. Wu, J., Roy, J., & Stewart, W. F. (2010). Prediction modeling using EHR data: Challenges, strategies, and a comparison of machine learning approaches. Medical Care, 48(6), S106-S113. https://doi.org/10.1097/MLR.0b013e3181de9e17
  5. Esteva, A., Robicquet, A., Ramsundar, B., Kuleshov, V., DePristo, M., Chou, K., ... & Dean, J. (2019). A guide to deep learning in healthcare. Nature Medicine, 25(1), 24-29. https://doi.org/10.1038/s41591-018-0316-z
  6. A. M. Alaa and M. van der Schaar, "Attentive state-space modeling of disease progression," in Advances in Neural Information Processing Systems 32 (NeurIPS 2019), Vancouver, Canada, Dec. 8-14, 2019.