우수국제학술대회 Interspeech 2026정규 발표 논문 채택
첨부파일

지능형 컴퓨터 아키텍처 및 임베디드 컴퓨팅 연구실 (ECL) 박사과정 이태한(제1저자), 석사과정 정재한, 이혁준 교수(교신저자)가 다중 이벤트 음향 장면에서 오디오 대형언어모델(Audio LLM)의 신뢰성을 분석한 논문 「A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs」이 Interspsech 2026에 정규 논문으로 게재가 확정되었다.

그림 1. 오디오 이벤트 추출 및 정제 과정
연구팀은 일상에서 자주 접하는 여러 소리가 동시에 존재하는 실제 음향 신호에서 오디오 LLM이 실제로 존재하는 소리를 정확히 인식하고, 존재하지 않는 소리를 환각하는지를 신뢰성 있게 측정하기 위한 대규모 평가 방법론을 설계했다. 본 연구의 핵심은 다중 이벤트 음원에 적합한 ‘존재 이벤트(present-event)’와 ‘부재 이벤트(absent-event)’ 질의 구축 방식이다. 연구팀은 AudioCapsV2의 71,174개 음원에서 약 14만개의 오디오이벤트를 추출하였다. 실제 음원에 포함된 이벤트는 존재 질의로 바로 사용할 수 있으나, 임의의 부재 이벤트를 질문하면 입력 오디오의 소리와 의미·음향적으로 유사한 표현까지 오답으로 처리해 환각을 과대평가할 수 있는 문제가 있다. 따라서 연구팀은 부재 질의는 오디오-텍스트 정렬 임베딩 공간에서 음원 속 모든 이벤트와 충분히 멀리 떨어진 후보의 교집합에서 추출하여, 다중 이벤트 음원에서도 환각을 과대평가할 수 있는 항목들이 제외된 약 36만개의 부재 질의를 구축했다. 이후 연구팀은 최신 오디오 LLM 4종에 12가지 프롬프트를 적용하여 모델당 50만 건 이상의 모델의 응답을 평가한 결과, 이벤트 수가 증가할수록 실제 이벤트 탐지율은 약 29%p 감소하고 부재한 이벤트의 오탐률은 약 8%p 증가했다. 이번 연구는 정교한 존재·부재 질의를 통해 다중 이벤트 음원에서 오디오 LLM의 이해능력 및 환각문제 보다 정확하게 평가하고, 음향 복잡도와 프롬프트 변화가 모델 신뢰성에 미치는 영향을 대규모로 정량화했다는 점에서 의미가 있다.
[참고자료]
논문링크: https://arxiv.org/abs/2603.03855
학회링크: https://interspeech2026.org/en-AU