1. 서론
최근 에지 컴퓨팅은 에지 디바이스와 같은 모바일 네트워크 인프라를 활용하여 에지 디바이스에서 데이터 처리와 서비스를 제공하고 있다[1, 2]. 이러한 인프라 지능화의 중심에는 사물인터넷(IoT, Internet of Things)이 있으며, 사물인터넷은 인공지능과 융합되어 지능형 사물인터넷(AIoT, Artificial Intelligent of Things)으로 발전하고 있다. 특히 지능형 군 사물인터넷(AIoMT, Artificial Intelligent of Military Things)은 민간 첨단 기술을 활용 각종 군 무기체계와 정보시스템인 전투 클라우드(Combat Cloud), 클라우드렛 등 에지 노드(Node)를 중심으로 지능화가 추진되고 있다. 또한 노드의 지능화와 함께 소형/모바일 장치와 같은 단말 레이어(Layer)는 딥러닝 추론을 수행하기 위해 On-device AI를 넘어 초소형 기계 학습(Tiny-ML)을 적용한 On-sensor AI 필요성이 높아지고 있다. 따라서 본 논문에서 구현하는 보안 통신 명령 기반 인공 신경망 처리기는 소형 에지 장치에 지능화 기능을 추가하고 가중치(Wn)와 바이어스(Bn)를 모두 적용한 MCU 기반 소프트웨어적 처리 방식으로 구현된 기존 연구(시스템)의 제약 사항인 통신을 통한 재구성이 어려운 문제점과 인식 정확도를 개선하고자 본 연구에서는 바이어스(Bn)를 제외하고 가중치(Wn)만을 적용하며 보안 통신을 통한 재구성이 가능하도록 명령어 처리(Command Processing) 기반의 하드웨어적인 방식을 적용한다. 이를 위해 RISC-V 기반의 Soft-core CPU SoC에[3, 4, 5] 에지 노드(Edge Node)와 연동을 위한 보안 통신 처리기(SCU)와 인공 신경망 처리기(NPU)를 탑재한 SecureTinyNPU-SoC를 제안한다. 본 연구에서는 기존 장치에 탑재된 FPGA(EP4C115F324I7)를 활용하였다. 시스템의 설계 및 구현은 Schematic과 HDL로 하고 Quartus-II로 합성하였다. 에지 노드로부터 명령어가 입력되면 FPGA(Field Programmable Gate Array)의 기능별 데이터 처리기(SCU, NPU)를 통해 개별적 처리 과정을 수행한다. 또한 SecureTinyNPU-SoC의 성능 평가를 위해 MNIST 기반 인식 정확도 실험을 통한 성능 검증을 수행하다. 본 논문은 다음과 같이 기존 연구(시스템)의 기능/성능 개선에 기여하였다. 첫 번째로 기존 시스템의 제약 사항인 통신을 통한 재구성의 한계를 극복하고자 보안 통신 명령 처리 방식의 SCU를 적용하여 재구성할 수 있게 했다. 두 번째로는 가중치(Wn)와 바이어스(Bn)를 모두 사용한 SW 처리 방식을 가중치(Wn)만을 사용한 FPGA 기반의 HW 처리 방식의 NPU를 적용하여 성능을 개선하였다. 다음으로 본 논문의 구성을 살펴보면 2. 장 본론 시스템의 설계 및 구현에서는 제안하는 시스템의 보안 통신 기반 기능별 2개의 처리기(SCU, NPU)를 Schematic과 HDL로 설계 및 구현한다. 3. 실험 결과 및 평가에서는 시스템의 실험을 하고 그 결과에 대해 평가를 수행한다. 마지막으로 4. 장 결론에서는 기존 MCU 처리 방식 대비 제안한 NPU 처리 방식의 성능 개선 효과를 확인한다.
2. 본론
2.1 시스템의 설계 및 구현
2.1.1 Secure Neural Processing Unit - SoC
본 논문에서 제안하는 보안 통신 (Secure Communication) 및 명령어 처리 기반 신경망 처리기(Neural Processing Unit based on Command Processing) SoC는 기존 신경망 처리 기능이 없는 소형 에지 장치에 시스템 모니터링 또는 디버깅용으로 탑재 운용되는 비동기통신(Asynchronous Receiver and Transmitter, ART) 포트를 활용하여 프로그램이 가능한 소형 인공 신경망 처리기(Neural Processing Unit)를 추가한다. 이를 통해 소형 레거시(Legacy) 에지 장치를 별도의 회로 수정이나 재제작 없이 변경을 최소화하여 지능화된 에지 장치로 성능 개량을 할 수 있다. 외부 에지 장치 또는 노드로부터 암호화되어 비동기통신(ART) 방식으로 입력되는 원시 데이터를 복호화(Decryption) 하고, 명령어 처리 인터페이스를 통해 인공 신경망 처리 기능을 수행한다. 본 논문에서 제안된 보안 통신(Secure Communication) 기반 인공 신경망 처리기(Secure Neural Processing Unit) SoC에 적용된 하드웨어 가속기인 FPGA(Field Programmable Gate Array) 내부 데이터 처리 과정을 살펴보면 크게 2단계로 구분된다.
첫 번째 단계인 보안 통신 암/복호화 처리기(Secure Communication Processing Unit, SCU)는 AES(Advanced Encryption Standard) 128로 암호화(Encryption) 되어 수신된 명령어 포함 원시 데이터 프레임(raw data frame)을 복호화(Decryption)한다.
두 번째 단계인 명령어-데이터 처리(Command Processing) 기반 인공 신경망 처리기(Neural Processing Unit)는 복호화된 프레임으로부터 명령어(command)와 원시 데이터(raw data)를 분리한다. 분리된 명령어에 따라 원시 데이터 처리한다. 제안된 SecureTinyNPU-SoC의 시스템 아키텍처와 디자인 결과를 간략히 살펴보면 그림1, 2와 같다. 또한 합성 결과는 표 1과 같다.

그림 1. 제안하는 보안 통신 명령 기반 인공 신경망 처리 시스템 온 칩의 아키텍처
Fig. 1. Architecture of proposed SecureTinyNPU-SoC

그림 2. 인공 신경망 처리기 시스템 디자인
Fig. 2. Design of proposed SecureTinyNPU-SoC
표 1. 보안 통신 명령 신경망 처리 시스템 합성 결과
Table 1. Synthesis result of SecureTinyNPU-SoC

학습 모델은 파이선(Python)을 사용하여 MNIST(Modified National Institute of Standards and Technology) 데이터 세트의 인식 정확도가 0.99 이상이 되도록 그림 3과 같이 학습을 통해 모델과 INT8로 양자화(Quantization)된 파라미터(가중치, Weights)를 생성한다. 생성된 Weight 값은 FPGA의 NPU(Neural Processing Unit)에 메모리 파일(MIF)로 저장된다.

그림 3. 학습 모델 기반 8비트 양자화된 파라미터 생성
Fig. 3. 8-Bit Quantized Parameter Generation
학습 모델(LM, Learning Model)의 훈련 데이터 세트 기반 정확도(Accuracy)와 로스(Loss)를 살펴보면 그림 4, 그림 5과 같다.

그림 4. 훈련 데이터 세트 기반 학습 모델 정확도
Fig. 4. Accuracy of LM based on Train Data-Set

그림 5. 훈련 데이터 세트 기반 학습 모델 손실
Fig. 5. Loss of LM based on Train Data-Set
학습을 통해 추출된 FPGA NPU 메모리 파일(MIF) 가중치 파라미터(Weights) 기반 추론 검증(Inference Validation) 결과는 그림 6, 표 2와 같다.

그림 6. 신경망 처리기 가중치 파라미터 적용 추론 검증
Fig. 6. Inference Validation using weight parameters
표 2. 신경망 처리기 파라미터 파일 기반 추론 정확도
Table 2. Inference accuracy based on FPGA MIF

2.2 제안하는 Secure NPU-SoC
본 장에서는 소형/모바일 에지 장치에서 에지 노드(Edge Node)와의 연동을 위한 보안 통신, 딥러닝 추론 수행을 위해 제안된 보안 통신 명령 기반 인공 신경망 처리 SoC(System on Chip)의 보안 통신 처리기(Secure Communication Unit), 명령어 처리 기반 신경망 처리기(Neural Processing Unit based on command processing)의 설계 구현한다.
2.2.1 Secure Communication Unit
SCU(Secure Communication Unit)는 비동기통신(Asynchronous Receiver and Transmitter, ART) 방식으로 암호화된 데이터 프레임을 복호화하여 명령어 처리 기반 개별 프로세스 엔진에 전달 하는 기능을 수행한다. 보안 통신 처리기(Secure Communication Unit)에 사용된 암호화 방식은 AES(Advanced Encryption Standard) 방식으로 명령어가 포함된 원시 데이터 프레임(raw data frames)을 대칭키(Symmetric-key)로 암/복호화한다[6]. 본 논문에 적용된 AES 블록 암호화 방식에 대하여 간략히 살펴보면 그림 7과 같다. 일반적으로 암호화를 위한 키(Key)의 경우 128, 192와 256비트[7]를 지원하며 본 논문에서는 보안 통신 처리기의 프레임 명령어 길이(128비트)와 AES의 키 길이(128비트)를 동일한 구조로 설계하였다. 라운드 수는 10라운드로 각 라운드는 SUB BYTE, SHIFT ROWS, MIX COULUMNS와 ADD ROUND KEY 과정을 수행한다[8, 9].

그림 7. 암/복호화 알고리즘 처리 구조
Fig. 7. Structure of AES algorithm processing

그림 8. 제안하는 보안 통신 처리기 아키텍처
Fig. 8. Architecture of proposed SCU

그림 9. 제안하는 보안 통신 처리기 디자인
Fig. 9. Design of proposed SCU

그림 10. 제안하는 보안 통신 처리기 시뮬레이션
Fig. 10. Simulation of proposed SCU
2.2.2 Neural Processing Unit
NPU(Neural Processing Unit)는 내부 적으로 명령어 처리 엔진과 인공 신경망 처리기 가속기로 구성된다. 명령어 처리 엔진(Command Processing Engine)은 보안 통신 처리기(Secure Communication Unit)로부터 복호화된 명령어가 포함된 통신 프레임(Frame)으로부터 명령어와 원시 데이터(raw data)를 분리하고 명령어 처리 및 신경망 처리 가속기(Neural Processing Accelerator)의 하드웨어 프로세서를 통해 연산을 수행한다. 본 논문에서는 신경망 처리 가속 엔진(Nerual Processing Accelerator, NPA)의 신경망 모델로[10] 딥러닝 추론(Deep Learning Inference)모델 중 심층 신경 네트워크의 한 종류로, 시각 이미지 분석에 광범위하게 적용되고 있는 CNN(Convolution Neural Network)[11] 및 활성 함수로 ReLU(Rectified Linear Unit)를 사용한다. 제안된 Secure TinyNPU-SoC의 명령어 처리 기반 하드웨어 프로세싱은 일반적인 소프트웨어적 처리가 아닌 하드웨어적으로 명령어와 원시 데이터(raw data)를 분리하고 명령에 따라 프레임별 데이터 처리 기능을 수행한다. 아키텍처와 명령어 집합 아키텍처(Instruction Set Architecture)와 NPU의 구조를 살펴보면 그림 11, 그림 12와 같다.

그림 11. 제안하는 하드웨어 처리 명령어 집합 아키텍처
Fig. 11. HW Processing Instruction Set Architecture

그림 12. 제안하는 신경망 처리기 아키텍처
Fig. 12. Architecture of proposed NPU

그림 13. 제안하는 인공 신경망 처리기 디자인
Fig. 13. Design of proposed NPU

그림 14. 제안하는 인공 신경망 처리기 시뮬레이션
Fig. 14. Simulation of proposed NPU
3. 실험 결과 및 평가
본 장에서는 소형/모바일 에지 장치의 지능화를 위해 제안한 보안 통신 명령 기반 신경망 처리 시스템 (SecureTinyNPU-SoC)의 성능을 검증하고 평가한다.

그림 15. 보안 통신 신경망 처리 SoC 실험 환경
Fig. 15. Test-bed of proposed SecureTinyNPU-SoC
실험 및 평가를 위한 테스트 베드(Test-Bed)는 테스트 보드, PC1 로 구성하며 MNIST 데이터 세트 기반 학습/검증, 학습/구현 및 처리 방식(NPU-SoC(Wn), MCU(Wn+Bn)에 따른 인식 정확도 비교 평가를 통해 검증한다.

그림 16. 신경망 처리기 하드웨어 모델 성능 비교(1)
Fig. 16. Comparison(1) of Performance NPU-SoC

그림 17. 신경망 처리기 하드웨어 모델 성능 비교(2)
Fig. 17. Comparison(2) of Performance NPU-SoC
실험을 통해 첫 번째 MNIST 데이터 세트 기반 인공 신경망 모델의 학습과 검증 단계의 인식 정확도 차이를 확인하였다. 두 번째로는 8비트 양자화 파라미터 적용 시 학습 대비 구현단계의 정확도 차이를 확인하였다. 또한 세 번째로는 파라미터 처리 방식에 따라 가중치(Wn)와 바이어스(Bn)를 모두 적용한 소프트웨어적 처리 방식(MCU 처리 방식)과 가중치(Wn)만을 적용한 하드웨어적 처리 방식(NPU 처리 방식)의 인식 정확도 차이를 확인하였다. 실험 결과 첫 번째 인공 신경망 모델의 학습과 검증 단계의 인식 정확도 차이는 표 3에서 보듯이 학습 단계에서 0.9982(99.82%), 검증 단계에서 0.9836(98.36%)으로 학습 대비 검증 정확도가 0.0146(1.46%) 감소하였다. 두 번째로는 학습모델을 기반으로 INT8로 양자화하여 추출한 파라미터를 적용하여 구현 시 표 4에서 보듯이 학습과 구현 정확도 차이는 구현단계의 정확도는 0.9720(97.20%)으로 학습 대비 0.0262(2.62%) 감소 했다. 또한 세 번째로는 파라미터 처리 방식(MCU/NPU 처리 방식)에 따른 인식 정확도는 표 7, 표 8에서 확인 할 수 있듯이 기존의 가중치(Wn)와 바이어스(Bn)를 적용한 MCU 처리 방식은 0.9483(94.83%), 가중치(Wn)만을 적용한 NPU 처리 방식은 0.9720(97.20%)으로 MCU 대비 NPU 처리 방식이 0.0237(2.37%) 상승하였다. 제안한 보안 통신 명령 기반 신경망 처리기(SecureTinyNPU-SoC)의 성능(표 5)은 시뮬레이션 단계에서 0.9801(98.01%), 구현/테스트 단계에서 0.9720(97.20%)으로 시뮬레이션 대비 구현/테스트 단계의 정확도가 0.0081(0.81%) 감소했으며, 표 6과 같이 가중치(Wn)만 적용 시 0.9720(97.20%), 가중치(Wn)와 바이어스(Bn) 모두 적용 시 0.9638(96.38%)로 가중치(Wn)만을 적용한 경우가 가중치(Wn)와 바이어스(Bn) 모두 적용 대비 0.0082(0.082%) 상승했다.
표 3. 모델의 학습/검증 정확도 비교
Table 3. Comparison of Training and Validation Accuracy of CNN Model

표 4. 신경망 처리기의 학습/구현 정확도 비교
Table 4. Comparison of Training and Test Accuracy of SecureTinyNPU-SoC

표 5. 신경망 처리기의 테스트/시뮬레이션 정확도 비교
Table 5. Comparison of Test and Simulation Accuracy of SecureTinyNPU-SoC

표 6. 신경망 처리기의 바이어스 적용 테스트 비교
Table 6. Comparison of Test Accuracy by applying the Bias of SecureTinyNPU-SoC

표 7. 신경망 처리기의 처리 방식별 정확도 비교
Table 7. Comparison of Accuracy by processing method of SecureTinyNPU-SoC

표 8. 가중치와 바이어스 적용 정확도 테스트 비교
Table 8. Comparison of Accuracy Test with Weights and Bias applied

4. 결론
본 논문에서는 소형/모바일 에지 장치(Edge Device)에 지능화 기능을 추가하고 가중치(Wn)와 바이어스(Bn)를 모두 적용한 MCU 기반 소프트웨어적 처리 방식으로 구현된 기존 연구(시스템)의 제약 사항인 통신을 통한 재구성이 어려운 문제점과 인식 정확도를 개선하고자 보안 통신 명령어 처리(Secure Communication Command Processing) 기반의 인공 신경망 처리기(Neural Processing Unit)를 FPGA에 탑재하는 것을 제안하고 실험을 통해 성능을 검증하였다. 검증 결과 인식 정확도는 학습 단계에서 99.82% 구현단계에서 97.20%로 학습 대비 구현 단계의 정확도가 2.62% 감소하였다. 파라미터 처리 방식에 따른 인식 정확도는 표 10, 그림 18에서 보듯이 가중치(Wn)와 바이어스(Bn)를 모두 적용한 기존 MCU 처리 방식은 94.83%, 가중치(Wn)만을 적용한 NPU 처리 방식은 97.20%로 MCU 대비 NPU 처리 방식이 2.37%로 개선되었다. 또한 제안한 SecureTinyNPU-SoC의 성능은 표 9, 그림 17에서와 같이 가중치(Wn)만을 적용하여도 가중치(Wn)와 바이어스(Bn)를 동시 적용 대비 개선된 성능을 확보할 수 있었다.
표 9. 신경망 처리기의 파라미터 적용 정확도 비교
Table 9. Comparison of Accuracy by Applying Parameters of SecureTinyNPU-SoC


그림 17. 신경망 처리기 하드웨어 모델 성능 비교(3)
Fig. 17. Comparison(3) of Performance NPU-SoC
표 10. 기존 방식과 제안 방식의 정확도 비교
Table 10. Comparison of Accuracy of the existing method and the proposed method


그림 18. 기존 방식과 제안 방식의 개선 성능 비교
Fig. 18. Comparison of Accuracy of the existing method and the proposed method
References
- Young-Joo Kim, & In-Geol Chun (2024). MEC-based AI Computing Partition Model for Distribution Execution of AI Applications on Heterogeneous Edge Devices. Journal of the Korea Institute of Information and Communication Engineering, 28(9), 1020-1027. 10.6109/jkiice.2024.28.9.1020
- Seong-pyo Hong (2024). Technological advancement in the Internet of Things: Intelligent Internet of Things (AIoT). The Journal of The Korea Institute of Electronic Communication Sciences, 19(6), 1341-1346. https://doi.org/10.13067/JKIECS.2024.19.6.1341
- Lee, J. (2023). FPGA Implementation and Verification of RISC-V Processor. The Journal of The Institute of Internet, Broadcasting and Communication, 23(5), 115-121. https://doi.org/10.7236/JIIBC.2023.23.5.115
- Oh, H. B., & Kim, Y. (2025). Design and Analysis of an Optimized Cache Structure based on 32-bit RISC-V RV32I using FPGA. Journal of the Institute of Electronics and Information Engineers,, 27-35. 10.5573/ieie.2025.62.4.27
- Park, H., Kang, J., & Kim, Y. (2025). The Study on FPGA Implementation of Metadata Table-based In-order RISC-V Processor for Heap Memory Vulnerability Detection. Journal of the Institute of Electronics and Information Engineers,, 36-44. 10.5573/ieie.2025.62.4.36
- Yoon, G., Kwon, I., Kim, W., Kim, M., & Park, H. (2025). Implementation of an AES-128 Encryption System for DC/DC Converter Based Power Line Communication Security. The Transactions of the Korean Institute of Power Electronics, 30(5), 414-425. 10.6113/TKPE.2025.30.5.414
- Lee, Y., Kang, J., & Lee, J. (2025). A Lightweight AES-256 Accelerator Design through Processing Order Optimization for Low-cost Hardware Security. JOURNAL OF SEMICONDUCTOR TECHNOLOGY AND SCIENCE, 25(4), 406-413. 10.5573/JSTS.2025.25.4.406
- Ahn, Jae-uk, Choi, Jae-Hyuk, Ha, Ji-Ung, Jung, Yongchul, & Jung, Yunho (2019). Design of Crypto-processor for Internet-of-Things Applications. Journal of advanced navigation technology, 23(2), 207-213. https://doi.org/10.12673/JANT.2019.23.2.207
- Si-Woo Eum, Hyun-Jun Kim, Min-Joo Sim, Gyeong-Ju Song, & Hwa-Jeong Seo (2022). Implementation of Fixslicing AES-CTR Speed Optimized Using Pre-Computed on 32-Bit RISC-V. Journal of the Korea Institute of Information Security & Cryptology, 32(1), 1-9.
- Park, J., Choi, D., & Kim, H. (2025). RADAR: An Efficient FPGA-based ResNet Accelerator with Data-aware Reordering of Processing Sequences. JOURNAL OF SEMICONDUCTOR TECHNOLOGY AND SCIENCE, 25(4), 451-458. 10.5573/JSTS.2025.25.4.451
- Hyun-Wook Son, Dong-Yeong Lee, & HyungWon Kim (2021). Compact CNN Accelerator Chip Design with Optimized MAC And Pooling Layers. Journal of the Korea Institute of Information and Communication Engineering, 25(9), 1158-1165. https://doi.org/10.6109/JKIICE.2021.25.9.1158