최우수국제학술대회 ACM International Conference on Information and Knowledge Management (CIKM) 2026 정규 발표 논문 채택
첨부파일

빅데이터처리 및 데이터베이스 연구실(Bigdata Processing & DB Lab) 김용담(박사과정/제1저자), 정성원 교수(교신저자)가 작성한 "CLARE: Cluster-Number-Independent Latent Representation Learning with Graph Autoencoders for Deep Clustering" 논문이 최우수국제학술대회 ACM International Conference on Information and Knowledge Management (CIKM) 2026 정규 논문(Short Research Paper, Acceptance Rate: 236/764 = 30.9%)으로 게재가 확정되었습니다.
딥 클러스터링은 문서 정리, 고객 세분화, 이미지 그룹화처럼 정답이 없는 데이터에서 구조를 찾아내는 데 쓰인다. 그런데 실제 분석 현장에서 군집의 개수를 미리 아는 경우는 거의 없다. 고객을 몇 개 그룹으로 나눠야 하는지, 문서에 몇 개 주제가 들어 있는지는 데이터를 여러 후보 개수로 나눠보고 비교해야 알 수 있다. 문제는 최근 성능이 좋은 딥 클러스터링 모델 대부분이 군집 개수를 손실 함수 안에 넣어 학습한다는 점이다. 개수를 하나 바꿀 때마다 모델을 처음부터 다시 학습해야 하고, 후보를 여러 개에 대해서 비교해보려면 매번 계산을 다시해야 한다. AgNews에서 최신 모델 COTC는 한 번 학습에만 2,700초 이상이 걸린다.
연구팀이 제안한 CLARE는 먼저, 키워드 기반의 TF-IDF(sparse representation) pretrained model로 만든 bge-m3(dense representation)을 함께 써서 하이브리드 유사도를 계산한다. 키워드 매칭과 의미 맥락 모두를 놓치지 않기 위한 구성이다. 이 유사도로 kNN 그래프를 만들되, 이웃을 무조건 k개 연결하지 않고, 충분히 비슷한 후보만 간선으로 남기는 선택적 필터링을 적용한다. 그 다음 개선된 Graph Autoencoder를 사용하여 만든 kNN그래프를 임베딩한다.
여기에 더해 군집 개수와 무관한 Cluster loss function을 새로 설계했다. 네트워크 과학 분야Global Clustering Coefficient의 개념을 확장한 것으로, A와 B가 이어져 있고 B와 C가 이어져 있으면 A와 C도 같은 군집일 가능성이 높다는 성질을 이용한다. 다만, 모든 두 홉 쌍이 같은 군집인 것은 아니므로, IQR 필터로 유사도 분포의 상위 이상치만 골라 강화한다. Graph Reconstruction loss와 새롭게 제안한 Clustering Loss 어느 쪽도 클러스터 개수를 참조하지 않기 때문에, 한 번의 학습으로 얻은 임베딩을 여러 클러스터 개수 지정한 클러스터링 비교 실험에 대해서 사용할 수 있다.
여덟 개 텍스트 데이터셋과 세 개 이미지 데이터셋에서 검증한 결과, CLARE는 군집 개수를 학습에 전혀 쓰지 않고도 장문 텍스트와 단문 네 개 중 두 개에서 최고 성능을 기록했다. 20Newsgroups에서는 정확도 80.8%로 COTC(67.2%)를 크게 앞섰다. 이미지에서는 인코더와 유사도 계산만 바꿔 그대로 적용했는데, 세부 분류가 어려운 ImageNet-Dogs에서 정확도 94.5%를 기록해 기존 최고 성능(72.6%)을 약 22포인트 끌어올렸다. 효율 면에서는 AgNews에서 군집 개수를 2에서 6까지 훑는 데 드는 시간이 매번 재학습하는 방식보다 38.1배 적었고, 20Newsgroups에서는 89.7배 이상 빨랐다.
이번 연구는 군집 개수를 미리 정해야 한다는 최근 딥 클러스터링의 전제를 걷어내고, 탐색적 데이터 분석 과정에서 여러 후보를 저렴하게 비교할 수 있는 표현 학습 방식을 제시했다는 점에서 의미가 있다.
본 논문의 제1저자인 김용담 박사과정은 "실제 데이터를 분석할 때 군집 개수를 미리 아는 경우는 거의 없는데, 성능이 좋은 방법일수록 그 개수를 먼저 정해야 한다는 점이 늘 어색했습니다. 개수를 학습 목적함수에서 빼내고 그래프 구조 자체에서 군집 신호를 끌어내자, 정확도를 유지하면서도 후보 개수를 훑는 비용을 크게 줄일 수 있었습니다. 앞으로는 더 큰 말뭉치를 위한 부분 그래프 학습과 텍스트·이미지를 함께 다루는 멀티모달 방식의 딥 클러스터링 연구로 확장하려 합니다. 연구를 지도해주신 정성원 교수님께 감사드립니다."라고 소감을 밝혔다.
ACM International Conference on Information and Knowledge Management (CIKM)는 정보검색, 지식관리, 데이터마이닝, 데이터베이스 및 인공지능 분야를 다루는 세계적인 권위의 국제학술대회이다. 또한 CIKM은 BK21 Computer Science 분야 우수국제학술대회 목록에 인정 IF=3으로 등재되어 있으며, 한국정보과학회 소프트웨어 분야 우수학술대회 목록에서 최우수 학술대회로 분류되어 있다. 본 학회는 올해 11월 7일부터 11일까지 이탈리아 로마에서 개최될 예정이다.
References:
- 35th ACM International Conference on Information and Knowledge Management (CIKM 2026)
- Website: https://cikm2026.diag.uniroma1.it/