우수국제학술대회 IEEE International Conference on Distributed Computing Systems (ICDCS) 2026 정규 논문 채택
첨부파일

데이터 중심 AI 컴퓨팅 및 시스템 연구실 (DISCOS) 정보돈 (박사과정), 변홍수 박사, 김영재 교수, Weikuan Yu 교수 (FSU), 양지훈 교수, 박성용 교수 (교신저자)가 작성한 “DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference” 논문이 IEEE International Conference on Distributed Computing Systems (ICDCS) 2026 에 게재가 확정되었습니다 (Acceptance Rate: 18.59%).
단일 GPU 기반의 엣지 AI 시스템에서 LLM을 구동할 경우, 처리할 컨텍스트(Context) 길이에 따라 폭증하는 KV-캐시가 기기의 가용 메모리를 초과하며 구조적인 병목을 유발한다. 기존 시스템들은 이를 NVMe SSD로 오프로딩해 해결하려 했으나, 운영체제의 커널 페이지 캐시(Page Cache)에 지나치게 의존하여 오히려 캐시 스래싱(Cache thrashing)과 극심한 소프트웨어 오버헤드를 유발하는 한계가 있었다.

그림 1. High-level architecture of dual-path KV cache residency.
이러한 문제의식에서 출발하여 본 연구는 런타임 메모리 가용성에 맞춰 동작하는 프레임워크인 DUAL-BLADE를 제안하였다. DUAL-BLADE는 KV 텐서를 '페이지 캐시 경로'와 'NVMe-Direct 경로'로 동적 분할한다. 특히 NVMe-Direct 경로는 파일 시스템을 우회하여 연속적인 논리 블록 주소(LBA) 영역에 데이터를 직접 매핑함으로써 불필요한 스토리지 오버헤드를 근본적으로 제거한다. 이에 더해 스토리지 I/O와 GPU DMA 작업을 중첩시키는 적응형 파이프라인 병렬화 기법을 도입해 전체 데이터 처리량을 극대화한 점이 핵심이다.
본 논문의 제1저자인 정보돈 박사과정은 "메모리가 제한된 엣지 시스템에서 LLM 추론을 가속하려면 무분별한 파일 시스템 의존을 끊고 I/O 비효율성을 극복해야 합니다. 본 연구의 이중 경로 설계와 커널 우회 기술이 그 실질적인 해결책이 될 것입니다."라고 연구의 의의를 전했다.
The IEEE International Conference on Distributed Computing Systems (ICDCS)는 IEEE Computer Society의 대표적인 플래그십 학술대회 중 하나로, 분산 컴퓨팅 시스템 분야의 권위 있는 국제 학술대회이다. 제46회를 맞이하는 본 학회는 올해 6월 22일부터 25일까지 대한민국 서울에서 개최되며, 동료 평가를 거친 정규 연구 논문은 학술대회의 main technical sessions에서 발표될 예정이다.