COMMUNITY

게시판

소식

최우수국제학술대회 ACM International Conference on Information and Knowledge Management (CIKM) 2026 정규 발표 논문 채택

작성자
소프트웨어융합대학
작성일
2026-08-27
조회수
41

첨부파일



데이터 중심 컴퓨팅 및 AI 시스템 연구실(DISCOS) 김기현(석박통합과정/제1저자), 장성(석박통합과정), 허민(석사과정), 김진우(석박통합과정), 김영재 교수(교신저자)가 작성한 “AegisKV: Runtime Headroom Control for Online LLM Serving via Adaptive Attention Offloading” 논문이 최우수국제학술대회 ACM International Conference on Information and Knowledge Management (CIKM) 2026​ (Acceptance Rate: 597/2216 = 26.9%)에 게재가 확정되었습니다.

최근 대규모 언어 모델(LLM)은 대화형 AI와 코딩 보조, AI 에이전트 등 다양한 온라인 서비스에 활용되고 있다. 그러나 동시에 많은 요청을 처리하거나 긴 문맥을 다루는 환경에서는 GPU의 메모리와 연산 자원이 중요한 제약으로 작용한다. 특히 요청 수와 문맥 길이가 증가하면 추론 과정에서 필요한 GPU 메모리가 빠르게 증가하며, 자원이 부족해질 경우 실행 중인 요청이 중단되거나 상태 복구를 위한 재연산이 발생할 수 있다. 연구팀의 실험에서는 제한된 GPU 메모리 환경에서 전체 GPU 연산의 최대 43.1%가 이러한 재연산에 사용되는 것으로 나타났다.

기존에는 이러한 문제를 해결하기 위해 고성능 GPU를 추가하거나 모델 연산을 여러 GPU에 분산하는 방법을 주로 사용해 왔다. 그러나 이러한 방식은 일부 자원만 부족한 상황에서도 고가의 GPU를 추가해야 하기 때문에 시스템 구축 비용과 자원 활용 효율 측면에서 한계가 있다.

연구팀은 이에 착안해 성능과 용량이 서로 다른 이기종 GPU를 하나의 LLM 추론 시스템에서 효율적으로 활용하는 동적 분산 처리 기술인 AegisKV를 개발했다. AegisKV는 GPU별 연산 성능과 메모리 여유 공간, 현재의 처리 상태를 지속적으로 파악하고, LLM 추론에 필요한 연산과 데이터를 각 GPU의 특성과 시스템 부하에 따라 동적으로 분산한다.

특히 모든 요청을 일률적으로 여러 GPU에 분산하는 기존 방식과 달리, 실행 중인 LLM 워크로드의 자원 사용 상태를 실시간으로 분석하고 필요한 시점에 필요한 작업만 선택적으로 분산 처리한다. 이를 통해 주 GPU의 자원 부족을 완화하면서도 보조 GPU 사용으로 인한 데이터 이동과 추가 연산 비용을 최소화한다.

AegisKV의 핵심은 단순히 여러 GPU를 사용하는 것이 아니라, 서로 다른 성능과 메모리 특성을 가진 GPU들의 역할을 실행 중인 LLM 워크로드 상태에 따라 동적으로 조정하는 것이다. 이를 위해 GPU별 자원 상태를 모니터링하고, 분산 처리 대상과 규모를 동적으로 결정하며, GPU 간 데이터 이동과 연산을 효율적으로 중첩하여 추가적인 지연을 줄인다. 연구팀은 이러한 기술을 대표적인 LLM 서빙 프레임워크인 vLLM에 통합해 실제 시스템으로 구현했다.

실험 결과 AegisKV는 다양한 LLM과 온라인 요청 환경에서 기존 방식보다 높은 처리 성능을 보였다. 특히 대규모 모델 환경에서는 첫 토큰 응답 시간(TTFT)을 최대 15.07배 단축했으며, 보조 GPU 한 장을 추가해 전체 하드웨어 비용이 4.8% 증가한 반면 처리 가능한 요청량은 42.9% 증가했다.

이번 연구는 동일한 고성능 GPU를 지속적으로 증설하는 기존 접근에서 벗어나, 성능과 용량이 서로 다른 이기종 GPU를 워크로드 상태에 따라 선택적으로 결합하고 동적으로 활용함으로써 LLM 서비스의 처리 용량과 비용 효율성을 동시에 향상시킬 수 있음을 보여준다.

본 논문의 제1저자인 김기현 석박통합과정은 “이번 연구는 어텐션 오프로딩을 단순한 KV 캐시 용량 확장이 아니라, 온라인 LLM 서빙에서 변화하는 메모리 압력에 따라 이기종 GPU 자원을 동적으로 활용하는 문제로 접근한 데 의미가 있습니다. 고성능 GPU를 단순히 증설하기보다, 서로 다른 성능과 용량의 GPU를 역할에 맞게 활용해 서비스 용량과 비용 효율을 함께 높일 수 있음을 확인했습니다. 앞으로도 스케줄링과 메모리 관리를 결합해 이기종 GPU 자원을 효율적으로 활용하는 LLM 서빙 시스템 연구를 확장하고자 합니다. 함께 연구한 장성, 허민, 김진우 공동연구자와 지도해주신 김영재 교수님께 감사드립니다.”라고 소감을 밝혔다.

ACM International Conference on Information and Knowledge Management (CIKM)는 정보검색, 지식관리, 데이터마이닝, 데이터베이스 및 인공지능 분야를 다루는 세계적인 권위의 국제학술대회이다. 또한 CIKM은 BK21 Computer Science 분야 우수국제학술대회 목록에 인정 IF=3으로 등재되어 있으며, 한국정보과학회 소프트웨어 분야 우수학술대회 목록에서 최우수 학술대회로 분류되어 있다. 본 학회는 올해 11월 7일부터 11일까지 이탈리아 로마에서 개최될 예정이다.

참고자료:

●           35th ACM International Conference on Information and Knowledge Management (CIKM 2026)

●           Website: https://cikm2026.diag.uniroma1.it/