COMMUNITY

게시판

소식

자연어처리 분야 최고 권위 학회 'EACL 2024'에 논문 채택

작성자
소프트웨어융합대학
작성일
2024-06-17
조회수
29

첨부파일

컴퓨터공학과 구명완 교수 연구팀,

자연어처리 분야 최고 권위 학회 'EACL 2024'에 논문 채택

 

sogang university

▲ (왼쪽부터) 컴퓨터공학과 구명완 교수, 대학원 인공지능학과 김민주 석사과정생, 연희연 석사

 

컴퓨터공학과 구명완 교수가 지도하는 지능형 음성대화 인터페이스 연구팀(ISDS)이 EACL 2024(The 18th Conference of the European Chapter of the Association for Computational Linguistics)에 발표한 논문 「Towards Context-Based Violence Detection A Korean Crime Dialogue Dataset」이 'EACL Findings Paper'로 채택됐다.

 

대학원 인공지능학과 김민주 석사과정생(공동 1저자)·연희연 석사(공동 1저자), 구명완 교수(교신저자)는 오프라인 상황에서 문맥을 반영한 폭력, 혐오 표현 검출을 위한 데이터셋과 프로토콜, 베이스라인을 EACL 2024(자연어처리 분야 BK 등재 IF 2)에 발표한다.

sogang university ▲ 연구팀이 논문에서 제안한 유해 대화 분류 모델 구조

 

그동안 자연어 처리 분야에서 혐오, 편향 표현을 자동으로 감지하기 위한 데이터셋과 방법론은 주목받아왔다. 이에 따라 유해 데이터를 판별하기 위한 데이터셋은 많이 공개되었으나, 주로 온라인 환경을 가정하고, 문맥을 반영하지 않은 데이터셋들이 주를 이룬다는 한계점이 있었다. 이러한 연구 동향에 기반하여 연구팀은 오프라인 환경에서 대화 문맥을 반영하여 폭력 및 혐오 상황을 검출하기 위한 데이터셋이 부재한다는 점을 지적하였고, 법률 전문가와 협업하여 국제 표준 범죄 분류 기준에 기반한 폭력 대화 분류를 위한 데이터셋을 공개하였다.

 

또한 연구팀은 해당 데이터셋을 구축하는 효과적인 프로토콜을 함께 공개했다. 연구팀은 크라우드 워커들이 단순히 어노테이션을 하여 데이터셋을 구축하는 것이 아닌 대화 데이터를 직접 작성해야 하는 환경에서 데이터의 퀄리티를 유지할 수 있는 데이터 생성 프로토콜인 ‘Legal Expert Collaborative Data Building Process’를 제안하였다. 뿐만 아니라 공개한 데이터셋에 대한 베이스라인인 ‘Relationship Aware BERT’를 공개하였다. 해당 모델은 대화 텍스트가 가지는 고유한 특성을 반영하여 모델링하여 성능을 높인 방법론으로, 연구팀은 ‘발화자 토큰’을 대화 텍스트에 추가하여 대화 내용 전체에 대한 분류와 함께 대화 발화자의 유형이 가해자, 피해자, 일반 사람 중 어떤 유형에 해당하는지 분류하도록 모델을 훈련하였다.

 

이번 연구에 참여한 석사과정생들은 각각 스마일게이트가 후원하는 DHE(Digital Human Entertainment) 장학생 1기, 2기이다. 이들은 “학과와 교수님의 연구 지원 그리고 선후배의 도움을 통해 성과를 얻을 수 있었다”며 “앞으로도 세상에 도움이 될 수 있는 기술을 개발할 수 있게 노력하겠다”라고 소감을 전했다.

 

구 교수는 “앞으로도 학생들이 연구 성과를 얻을 수 있도록 꾸준히 관심을 가지고 지도하겠다”며 소감을 밝혔다.

 

한편 EACL은 1982년부터 설립된 자연어처리 분야 최고 권위 학회 ACL의 유럽 학회이다. 오는 2024년에 열리는 EACL 2024는 18번째 회의로, 3월 18~20일 몰타의 세인트 줄리언스에서 개최된다.


출처 : 뉴스-연구성과  https://sogang.ac.kr/ko/story/media-center?tab=3