COMMUNITY

게시판

소식

2026 한국컴퓨터종합학술대회 (KCC2026) 학부생부문 최우수상 수상

작성자
소프트웨어융합대학
작성일
2026-08-25
조회수
32

첨부파일


지난 2026년 6월 24일부터 3일간 열린 2026 한국컴퓨터종합학술대회(KCC2026) 학부생부문에서 컴퓨터공학과 최민석 학생(컴퓨터공학과 21, 지도교수: 김영재 교수)의 「LLM 서빙에서 Multi-GPU 병렬화 성능 분석」 논문이 학부생부문 최우수상을 수상하였다.

대규모 언어 모델(LLM) 서빙은 여러 GPU를 사용하더라도 모델과 요청을 어떤 단위로 나누는지에 따라 통신량, KV cache 여유, batching 효율과 지연이 달라진다. 본 연구는 동일한 2-GPU 환경에서 Tensor Parallelism(TP), Pipeline Parallelism(PP), Data Parallelism(DP), Prefill-Decode Disaggregation(PD)을 동일 조건으로 비교하여, 입력,출력 길이와 요청 부하에 따라 어떤 병렬화 방식이 유리하고 어떤 구조적 병목이 발생하는지 분석하였다.

vLLM과 Llama-3.2-1B-Instruct를 사용한 RTX 2080 Super 8GB 2-GPU 서버에서 synthetic 워크로드와 BurstGPT 실제 트레이스를 평가하였다. 실험 결과 출력이 긴 decode-heavy에서는 PD가 처리량과 ITL 모두에서 우위였으며, 응답 대기 시간보다 처리량을 우선하는 배치성 워크로드에서도 PD가 가장 적합했다. 그러나 입력이 긴 prefill-heavy에서는 prefill 병목으로 평균 TTFT가 4.71초까지 증가했다. 입출력이 균형 잡힌 general에서는 TP가 처리량과 TTFT의 균형이 가장 좋았다. TP는 일반 워크로드에서 처리량과 첫 토큰 지연의 균형이 가장 좋았고, DP는 긴 context와 높은 동시 요청에서 KV cache 압박과 요청 불균형으로 GPU 활용률 차이가 최대 94%까지 벌어지고 latency가 증가해 지연 안정성이 중요한 서비스에는 적합하지 않았다. 이를 통해 각 워크로드별로 우위인 병렬화 기법을 제시하고, 서비스의 우선 지표에 따라 적합한 전략을 선택해야 함을 입증하였다.