1. 서론
인공지능의 성능이 폭발적으로 증가하면서 실생활의 여러 분야에서 인공지능이 활용되고 있다 [1]. 예를들어, 제조 산업에서도 인공지능을 도입하였으며 [2], 사물인터넷 기반의 센서 네트워크에서도 인공지능을 활용하고 있다 [3].
일반적으로 인공지능의 성능을 증대시키기 위해서 는 많은 양의 데이터가 필수적이다. 따라서 많은 인공지능 애플리케이션에서는 데이터를 수집 및 활용에 대한 동의를 필수적으로 요구한다.
그러나 대부분의 데이터는 사용자 활동과 관련되어 생성되며 특히 일부 데이터는 사람의 건강 정보나 금융 정보와 같은 민감한 개인정보를 포함하는 경우가 많아 높은 수준의 데이터 보안을 요구한다. 또한 이러한 대규모 데이터셋을 수집하고 중앙 집중적으로 처리하는 데는 상당한 비용이 수반되는 문제가 있다. 이러한 문제를 해결하기 위해 연합 학습(Federated Learning)이 제시되어 유망한 해결책으로 주목받고 있다 [4].
연합 학습 시스템은 일반적으로 하나의 서버와 다수의 엣지 기기로 구성된다. 연합 학습에서는 서버나 다른 기기가 분산된 로컬 데이터에 직접 접근하는 것이 제한된다. 각 기기는 자체 데이터를 사용하여 로컬 모델을 업데이트하고 업데이트 결과를 서버로 전송한다. 서버는 이를 집계하여 글로벌 모델을 업데이트하며 업데이트된 글로벌 모델은 다음 라운드를 위해 다시 기기로 전송된다.
이러한 과정은 사용자의 데이터를 중앙 서버나 다른 기기가 열람 및 활용하지 않아 높은 보안성을 보이며 각 기기가 분산적으로 데이터를 처리하여 병렬 연산을 활용할 수 있어서 경제적이다 [5].
하지만 중앙 서버를 포함한 어떠한 기기도 전체 데이터에 접근할 수 없으므로 최적의 모델을 찾기 위해서는 많은 양의 통신이 필수적이다. 이러한 맥락에서 통신은 연합 학습 성능의 병목 점으로 작용한다 [6].
이러한 병목 현상을 해결하기 위해 여러 연구에서는 효율적인 연합 학습 방법을 제안하였다. 예를 들어 [7]에서는 장치가 여러 차례 로컬 업데이트를 수행한 후 이를 서버에 전송하는 기법을 제안하였다. 또한 [8]에서는 통신 페이로드의 크기를 줄이기 위한 양자화(quantization) 기법이 제안되었다.
그러나 앞선 연구에서는 모든 기기가 동기화되어 작동한다는 가정을 따른다. 즉 모든 기기가 같은 글로벌 모델을 받아 활용하고 동시에 로컬 업데이트를 시작한다. 또한 모든 기기가 로컬 업데이트를 완료한 후에 통신이 이루어진다. 이런 동기화 조건으로 인해 연합 학습 과정에서 컴퓨팅 과정과 통신 과정은 명확히 분리된다. 특히 연합 학습에 참여하는 기기 간 연산 능력이 다른 경우, 먼저 로컬 업데이트를 완료한 기기는 아직 완료하지 못한 기기를 기다려야 하므로 전체 시스템의 효율성이 저하된다.
이러한 문제를 해결하기 위해, 비동기 연합 학습(Asynchronous Federated Learning)이 제안되었다[9]. 비동기 연합 학습에서는 일부 장치가 로컬 업데이트를 수행하는 동안에도 다른 기기가 서버와 통신하여 최신의 글로벌 모델이 변경될 수 있으므로 각 기기가 로컬 훈련에 사용한 글로벌 모델과 로컬 업데이트가 적용되는 글로벌 모델 간에 차이가 존재한다 [10].
비동기 연합 학습에서 현재 글로벌 모델과 로컬 업데이트가 활용한 글로벌 모델의 차이는 통신 방식에 따라 달라진다. 본 논문에서는 시분할 기반 통신 방식을 활용할 때 비동기 연합 학습의 성능을 분석한다. 특히 시분할 기반 통신 방식에서 매 학습 라운드 별 통신에 참여하는 기기의 개수에 따라 모델 차이가 달라짐을 확인하였다. 또한 최적의 통신 참여 기기 숫자를 실제 데이터를 활용한 실험을 통하여 찾아내었다.
2. 시스템 모델
2.1 연합 학습
본 논문에서는 그림 1과 같이 중앙 서버와 N개의 단말로 구성된 연합 학습 시스템을 고려한다. 각 단말은 정수 n∈{1, … N}로 구분한다. 단말 n이 보유한 로컬 데이터셋은 Dn로 나타내며, 전체 데이터셋은 D로 나타낸다.

그림 1. 연합 학습 시스템 구조도
Fig. 1. Structure of federated learning system
글로벌 모델이 파라미터 벡터 w로 표현될 때, 글로벌 손실 함수는 다음과 같이 정의된다
\(\begin{align}f(w)=\frac{1}{D} \sum_{\zeta \in D} l(w, \zeta)\end{align}\) (1)
여기서 ξ는 하나의 데이터 표본이며, l(w, ξ)는 각 데이터 표본에 대한 현재 모델 w의 손실 함수이다.
연합 학습의 목표는 글로벌 손실 함수 f(w)를 최소화하는 최적의 글로벌 모델 w*를 찾는 것이다.
연합 학습은 일반적으로 다음 네 단계로 구성된 라운드 단위 학습 절차를 반복한다:
(1) 서버가 최신 글로벌 모델을 단말에 전송,
(2) 각 단말이 로컬 데이터를 이용해 로컬 모델 업데이트 수행,
(3) 단말이 갱신된 로컬 모델을 서버에 전송,
(4) 서버가 이를 집계하여 새로운 글로벌 모델을 갱신한다.
각 단말의 로컬 업데이트는 확률적 경사 하강 알고리즘을 활용하여 진행한다. 단말 n이 라운드 k에서 무작위로 선택한 데이터 표본을 Bn, k라 할 때, 로컬 모델 업데이트는 다음과 같다.
\(\begin{align}w_{n}^{\prime}=w_{n}-\eta \frac{1}{\left|B_{n, k}\right|} \sum_{\zeta \in B_{n, k}} \nabla l\left(w_{n}, \zeta\right)\end{align}\) (2)
여기서 η는 로컬 학습 비율을 나타낸다. 각 단말은 위 과정을 E회 반복 수행한다.
서버는 단말의 업데이트를 수신하여 글로벌 모델을 갱신한다. 수신된 로컬 업데이트를 \(\begin{align}\overline {g_k}\end{align}\) 라고 할 때 글로벌 모델은 다음과 같이 업데이트된다.
\(\begin{align}w^{(k+1)}=w^{(k)}-\eta, \overline{g_{k}}\end{align}\) (3)
2.2 동기식 연합 학습
동기식 연합 학습에서는 매 라운드 별 통신에 참여하는 단말이 동일한 글로벌 모델을 받아 동시에 학습을 시작한다. 서버도 통신에 참여하는 단말의 로컬 업데이트가 서버에 다 도착한 후에만 글로벌 모델을 갱신한다. 즉, 매 라운드 모든 단말이 활용하는 글로벌 모델은 동기화된 상태를 유지한다.
따라서 동기식 연합 학습에서는 매 라운드 별 학습 시간이 로컬 업데이트 시간과 통신 시간으로 확실히 분리할 수 있다. 본 연구에서는 시간이 양자화된 슬롯으로 모델링 한다. 따라서 임의의 시간 t는 정수의 값을 가지며 일정 길이의 시간 슬롯을 의미한다. 시간 슬롯 길이는 하나의 통신 심볼의 길이와 같다고 가정한다.
로컬 업데이트에 걸리는 시간은 아래와 같이 도출된다.
\(\begin{align}\tau^{\text {comp }}=\left\lceil\frac{E\left|B_{n, k}\right|}{x}\right\rceil\end{align}\) (3)
이때 x는 각 기기의 연산 처리 속도를 의미한다.
매 라운드 통신에 참여하는 단말 숫자를 S로 나타내고 하나의 단말이 로컬 업데이트를 전송하는데 r개의 타임 슬롯이 필요하다면, 동기식 연합 학습의 통신 시간은 아래와 같다.
τcomm = r(S + 1) (6)
동기식 연합 학습에서는 매 라운드 별 로컬 업데이트 시간과 통신 시간이 명확히 분리 되므로 매 라운드에 걸리는 시간은 아래와 같다.
τsyn = τcomp + τcomm (7)
2.3 비동기식 연합 학습
비동기식 연합 학습은 이러한 비효율성을 완화하기 위해 제안된 방식으로, 모든 단말이 로컬 업데이트 상태 혹은 통신 상태로 동기화 되지 않고 일부는 로컬 업데이트를 하고 일부는 통신하는 것을 허용한다.
따라서 일부 단말이 학습을 수행하는 동안 다른 단말은 통신을 수행할 수 있어, 계산과 통신이 시간적으로 중첩된다.
서버가 매 라운드 별 S개의 기기와 통신한다고 가정하였으므로 전체 단말을 \(\begin{align}G =[ \frac{N}{S}]\end{align}\) 개의 그룹으로 나눌 수 있다.
이를 바탕으로 비동기식 FL에서 한 라운드당 평균시간 슬롯 수는
\(\begin{align}\tau^{\mathrm{asy} \mathrm{n}}=\frac{\tau^{\mathrm{comp}}+r(S+1)}{G}\end{align}\) (8)
로 나타낼 수 있다.
그러나 비동기식 연합 학습 시스템에서는 글로벌 모델이 매 그룹이 통신할 때마다 달라지고 일부 기기는 로컬 업데이트를 시작할 때의 글로벌 모델과 로컬 업데이트를 전송할 때의 글로벌 모델이 다를 수 있다. 라운드 k에서 비동기식 연합 학습에서 집계된 로컬 업데이트는 다음과 같이 표현된다.
\(\begin{align}\overline{h_{k}}=\frac{1}{S\left|B_{n, k}\right|} \sum_{n \in S_{k}} \sum_{\xi \in B_{n k}} \nabla l\left(w_{n}^{\left(\hat{k}_{n}\right)}, \zeta\right) \end{align}\) ...... (9)
여기서 \(\begin{align}\hat {k}_n\end{align}\) 는 기기 n이 로컬 학습을 시작한 라운드를 의미한다.
동기식 연합 학습 시스템의 경우 \(\begin{align}\hat {k}_n=k\end{align}\) 를 보장하나 비동기식 연합 학습 시스템에서는 이것이 보장되지 않는다. 따라서 글로벌 모델 간 차이가 발생하게 된다.
만약 S = N 인 경우 G = 1이 되며 모든 기기가 하나의 그룹으로 중앙 서버와 통신하게 된다. 따라서 이때는 비동기식 연합 학습이 동기식 연합 학습 시스템과 같아진다.
반면에 S = 1인 경우 G = N이 되고 모든 기기는 서로 다른 라운드에 전송하게 된다. 따라서 한번 로컬 업데이트를 전송한 기기는 다음 번에 전송할 때까지 나머지 기기가 모두 전송한 뒤에 보낼 수 있다. 이는 글로벌 모델이 N - 1번 업데이트 된 뒤에 로컬 업데이트를 전송할 수 있으므로 글로벌 모델 차이가 N - 1이 된다.
따라서 S의 크기에 따라 글로벌 모델 차이가 달라짐을 알 수 있다.
본 연구에서는 실제 데이터를 기반으로 인공지능 모델을 학습하면서 S의 크기에 따라 비동기식 연합 학습 성능을 측정하고 이를 분석하였다.
3. 실험 결과
시분할 통신 기반 비동기식 연합 학습 시스템의 성능을 실제 데이터를 활용하여 측정하였다. 실험에 사용된 실제 데이터셋은 한자리 십진 수(0~9)를 손 글씨로 작성한 이미지 데이터셋 (MNIST)을 활용하였다.
연합 학습에 참여하는 기기는 N = 100로 가정하여 전체 60,000장의 사진을 임의로 나누었다. 서버가 매 라운드 별 통신하는 그룹 크기를 다르게 했을 때 시간 슬롯별 글로벌 손실과 분류 정확도를 측정하였다.
그림 2에서는 매 시간 슬롯 당 모델의 이미지 분류 정확도를 그래프로 나타냈다. 매 시간 슬롯 당 모델의 정확도는 증가와 감소를 반복하며 우상향 하는 형태로 나타난다. 또한 전체 시간 슬롯 50,000이 상대적으로 크고 증감하는 현상과 맞물려 S=1일 때 정확도 그래프가 영역의 형태로 표현되었다.

그림 2. MNIST 데이터를 활용한 비동기 연합 학습 시스템의 시간 슬롯 별 성능 비교
Fig. 2. Performance comparison of asynchronous federated learning system for MNIST dataset with respect to time slot
S가 변화 함에 따라 글로벌 모델의 손실 함수와 이미지 분류 정확도가 크게 달라진다. 특히 통신하는 기기 숫자가 1개이거나 전체 기기 수와 같아지는 경우 성능 저하가 뚜렷하게 나타나는 것을 알 수 있다.
이는 S = N의 경우 전체 기기가 동기화되어 글로벌 모델 차이가 없는 상황이지만 라운드별 전체 기기와 통신이 필요하므로 통신 시간이 많이 증가한다. 수식 (8)에서 나타나듯이 비동기 연합 학습의 라운드 당 통신 시간은 통신 그룹 크기에 비례한다. 다시 말해서 제한된 학습 시간 동안 수행 할 수 있는 학습 라운드 숫자가 통신 그룹 크기가 클수록 줄어 들게 되어 시간효율이 떨어진다.
반면에 S = 1의 경우 글로벌 모델 차이가 최대가 되고 로컬 업데이트를 하더라도 적용되는 글로벌 모델이 많이 달라져 있어 업데이트 효율이 떨어진다.
이는 그림 3을 통해 더욱 명확히 나타난다. 그림 3의 (a)와 (b)를 보면 S가 커질수록 그래프의 기울기가 가파라짐을 알 수 있다. 이는 라운드 별 성능 증가가 커짐을 의미한다. 이는 한 라운드에 참여하는 통신 기기 수가 커질수록 학습 효율이 좋아짐을 나타낸다.

그림 3. MNIST 데이터를 활용한 비동기 연합 학습 시스템의 통신 라운드 별 성능 비교
Fig. 3. Performance comparison of asynchronous federated learning system for MNIST dataset with respect to communication round
하지만 그림 3에서 통신에 참여하는 기기 수에 따라 수행할 수 있는 학습 라운드 숫자가 달라짐을 알 수 있다. S = 1인 경우에는 25000라운드를 진행할 수 있지만 S = 100인 경우 500라운드도 진행하지 못한다. 따라서 라운드 별 학습 효율이 좋아도 전체 학습 횟수가 감소하여 최종 학습 성능은 낮아지게 된다. 이러한 상관관계를 바탕으로 학습 효율과 학습 횟수를 적절히 높이는 S = 25,50일 때가 최적의 성능을 보인다.
4. 결론
본 연구에서는 시분할 통신 기반 비동기식 연합 학습의 성능을 분석하였다. 시분할 통신 기반의 비동기식 연합 학습 시스템에서는 통신 그룹 크기에 따라 글로벌 모델과 로컬 업데이트 간 차이가 달라지며 이는 성능에 큰 영향을 미친다. 실제 데이터를 기반으로 다양한 실험을 수행한 결과 통신 그룹 크기가 커질수록 라운드 당 학습 성능 증가량이 비례함을 확인하였다. 반면에 통신 그룹 크기가 커질수록 매 라운드 당 걸리는 시간이 증가하여 제한된 시간 내에 수행 가능한 라운드 수가 감소함을 확읺였다. 이러한 상관관계를 최적화하여 통신 그룹 크기를 결정하는 것이 높은 성능을 보임을 확인하였다.
References
- Hong-Jin Park, "Trend Analysis of Korea Papers in the Fields of 'Artificial Intelligence', 'Machine Learning' and 'Deep Learning'," Journal of Korea Institute of Information, Electronics, and Communication Technology, vol. 13, no. 4, pp. 283-292, Aug. 2020. https://doi.org/10.17661/JKIIECT.2020.13.4.283
- Jinhong Yang and Namhyun Yoo, "A Study on the Methodology for Implementing AI-based Multi-Agent Systems in Manufacturing Environments," Journal of Korea Institute of Information, Electronics, and Communication Technology, vol. 18, no 3, pp 155-171, Jun. 2025. https://doi.org/10.17661/JKIIECT.2025.18.3.155
- J. Song, D. Gündüz and W. Choi, "Optimal Scheduling Policy for Minimizing Age of Information With a Relay," in IEEE Internet of Things Journal, vol. 11, no. 4, pp. 5623-5637, Feb. 2024 https://doi.org/10.1109/JIOT.2023.3308113
- B. McMahan, E. Moore, D. Ramage, S. Hampson, and B. A. yArcas, "Communication-efficient learning of deep networks from decentralized data," in Proceeding of the 20th Artificial intelligence and statistics, pp. 1273-1282, Apr. 2017.
- T. Li, A. K. Sahu, A. Talwalkar and V. Smith, "Federated Learning: Challenges, Methods, and Future Directions," IEEE Signal Processing Magazine, vol. 37, no. 3, pp. 50-60, May 2020. https://doi.org/10.1109/MSP.2020.2975749
- J. H. Konečný, B. McMahan, F. X. Yu, P. Richtárik, A. T. Suresh, and D. Bacon. "Federated learning: Strategies for improving communication efficiency." in arXiv preprint arXiv:1610.05492, 2016.
- S. U. Stich, "Local sgd converges fast and communicates little," in arXiv preprintarXiv:1805.09767, 2018.
- A. Reisizadeh, A. Mokhtari, H. Hassani, A. Jadbabaie, and R. Pedarsani, "Fedpaq: A communication-efficient federated learning method with periodic averaging and quantization," in Proceedings of International Conference on Artificial Intelligence and Statistics, pp. 2021-2031, 2020.
- Y. Chen, Y. Ning, M. Slawski and H. Rangwala, "Asynchronous Online Federated Learning for Edge Devices with Non-IID Data," 2020 IEEE International Conference on Big Data, pp. 15-24, Dec. 2020.
- Z. Wanget al., "Asynchronous Federated Learning Over Wireless Communication Networks," in IEEE Transactions on Wireless Communications, vol. 21, no. 9, pp. 6961-6978, Sep. 2022. https://doi.org/10.1109/TWC.2022.3153495