최우수국제학술대회 ACM International Conference on Information and Knowledge Management (CIKM) 2026 정규 발표 논문(Short Research Paper) 채택
첨부파일

Computer Vision and Image Processing Lab (CVIP)의 오승훈(석사과정/제1저자), 정강현(석사과정), 박운상 교수(교신저자)가 작성한 “Grounded Distractor Probing: A Diagnostic Protocol for Hard-Distractor Sensitivity in VLM Multiple-Choice Evaluation” 논문이 최우수국제학술대회 ACM International Conference on Information and Knowledge Management (CIKM) 2026 (Acceptance Rate: 236/764 = 30.9%)에 게재가 확정되었습니다.
최근 비전-언어 모델(Vision-Language Model, VLM)은 이미지 질의응답, 문서 이해, 차트 분석, 장면 추론 등 다양한 분야에서 활용되고 있다. 이러한 모델의 성능을 측정하기 위해 정답 후보 중 하나를 선택하는 객관식 평가가 널리 사용되고 있지만, 모델이 정답을 맞혔다는 사실만으로 이미지의 세부 내용을 정확히 이해했다고 판단하기는 어렵다.
객관식 문제에서는 모델이 이미지의 핵심 근거를 세밀하게 확인하지 않고도 선택지의 문장 형태, 정답 위치, 언어적 편향 또는 대략적인 이미지 단서에 의존해 정답을 선택할 수 있다. 특히 기존의 오답이 정답과 유형이나 표현 방식에서 크게 다르면, 모델은 실제 시각 정보를 충분히 활용하지 않고도 쉽게 오답을 제거할 수 있다.
연구팀은 이러한 문제에 착안해, 정답과 같은 유형을 가지면서도 이미지의 작은 숫자, 시계 바늘의 위치, 물체의 개수 등 세부적인 시각 정보를 확인해야만 배제할 수 있는 오답을 활용하는 Grounded Distractor Probing(GDP) 프로토콜을 제안했다. GDP는 동일한 이미지와 질문을 대상으로 세 가지 조건을 비교한다. 첫째, 기존 문제를 그대로 사용하는 original 조건, 둘째, 선택지의 의미는 유지하면서 순서만 변경하는 permutation-control 조건, 셋째, 기존 오답 하나를 정답과 같은 유형의 시각적으로 그럴듯한 near-miss 오답으로 교체하는 hard-distractor 조건이다. 이와 같은 구성은 모델의 성능 저하가 단순한 선택지 순서 변화 때문인지, 아니면 세밀한 시각적 근거가 필요한 hard distractor 때문인지를 구분할 수 있도록 한다. 연구팀은 또한 모델이 바로 답을 고르는 direct 방식과, 먼저 이미지에서 확인한 근거를 설명한 뒤 답을 고르는 evidence-first 방식을 비교했다.
연구팀은 VMCBench 개발 데이터에서 TextVQA, InfoVQA, DocVQA, ChartQA, RealWorldQA에 해당하는 문항을 선별하고, 각 문항마다 정답과 같은 유형의 near-miss hard distractor를 직접 구성해 GDP-Slice를 구축했다. 또한 주요 현상이 작은 진단용 데이터에만 한정되는지 확인하기 위해, 자동 제안 및 필터링 과정을 거친 GDP-v2-lite에서도 추가적인 규모 검증을 수행했다. GDP-v2-lite는 GDP-Slice를 대체하는 독립 벤치마크가 아니라, 주요 진단 패턴이 더 큰 규모에서도 나타나는지를 확인하기 위한 보조 분석으로 사용됐다. 이번 연구는 새로운 만능 프롬프트를 제시하기보다, 비전-언어 모델이 세밀한 시각적 근거가 필요한 오답에 어떻게 반응하는지를 분석하는 진단 프로토콜을 제안했다는 데 의미가 있다.
연구 결과는 VLM 객관식 평가에서 전체 정확도만 보고 모델의 시각적 이해 능력을 판단해서는 안 되며, 모델이 어떤 hard distractor에 취약한지, 그리고 근거 설명과 같은 추론 개입이 모델별로 어떤 효과를 내는지를 함께 측정해야 함을 보여준다. 이를 통해 실제 응용 환경에서 모델의 정답뿐 아니라, 정답을 선택하는 과정의 안정성과 취약성까지 보다 정밀하게 분석할 수 있다.
본 논문의 제1저자인 오승훈 석사과정은 “이번 연구는 비전-언어 모델이 정답을 맞혔다는 결과만으로 실제로 이미지의 세부 정보를 충분히 활용했다고 판단하기 어렵다는 문제에서 출발했습니다. 정답과 같은 유형이면서도 이미지의 작은 차이를 확인해야 배제할 수 있는 오답을 제시했을 때, 근거를 먼저 설명하게 하는 방식이 어떤 모델에는 도움이 되지만 다른 모델에는 오히려 혼동을 키울 수 있다는 점을 확인했습니다. 앞으로는 정확도뿐 아니라 모델이 어떤 오답에 취약한지, 추론 과정에 대한 개입이 실제로 도움이 되는지를 함께 분석하는 평가 연구를 확장하고자 합니다. 함께 연구한 정강현 공동연구자와 지도해주신 박운상 교수님께 감사드립니다.”라고 소감을 밝혔다.
ACM International Conference on Information and Knowledge Management (CIKM)는 정보검색, 지식관리, 데이터마이닝, 데이터베이스 및 인공지능 분야를 다루는 세계적인 권위의 국제학술대회이다. 또한 CIKM Short Paper는 BK21 Computer Science 분야 우수국제학술대회 평가 기준에서 인정 IF 2에 해당하며, 한국정보과학회 소프트웨어 분야 우수학술대회 목록에서 최우수 학술대회로 분류되어 있다. 본 학회는 올해 11월 7일부터 11일까지 이탈리아 로마에서 개최될 예정이다.
참고자료:
● 35th ACM International Conference on Information and Knowledge Management (CIKM 2026)
● Website: https://cikm2026.diag.uniroma1.it/