[추론효율화] 디코딩 신호 기반 추론 루프 조기 탐지·개입 기술
페이지 정보
작성자 최고관리자 댓글 0건 조회 47회 작성일 26-07-17 19:20본문
주개발자: 김재현
주제: 추론 루프 탐지/추론 효율화
개요
본 기술은 대형 추론모델(LRM)이 실질적 진전 없이 유사한 패턴을 반복하는 '추론 루프(Reasoning Loop)' 현상을 텍스트 반복이 심화되기 전에 조기 탐지하고 불필요한 생성을 중단시키는 프레임워크이다. 기존 완화 기법은 확률 페널티·n-gram 차단처럼 유효한 반복까지 억제해 성능을 저해하거나, 은닉 상태 기반 프로빙(probing)처럼 모델마다 재학습이 필요해 확장성이 부족하다. 본 기술은 디코딩 과정에서 노출되는 상위 K개 토큰의 확률 분포만을 누적 관측하여, 모델 내부 접근이나 추가 학습 없이 루프의 징후를 탐지한다. 특히 상위 토큰 집합의 자카드 유사도(Jaccard similarity) 등 기존 확률 기반 지표와 구별되는 패턴을 보이는 보완적 신호를 확인하였고, 이를 시계열 탐지 기법(MA/CUSUM)과 결합해 다수의 추론 시나리오에서 단일 파라미터로 작동하는 탐지 조합을 도출하였다. 제안된 기법은 오탐률(FAR) 2% 내외에서 조기 탐지율(EDR) 97% 이상을 달성하였다. 탐지 직후 추론을 강제 종료하는 개입을 결합한 결과, 표면 반복 궤적 비율이 7.33%에서 0% 수준으로 감소하였으며, 낭비되는 토큰의 최대 19.2%가 회수되었고 정답률 또한 소폭 상승하였다.
핵심 기술
연구 실적
학회: Top-Conf. 심사중
주제: 추론 루프 탐지/추론 효율화
개요
본 기술은 대형 추론모델(LRM)이 실질적 진전 없이 유사한 패턴을 반복하는 '추론 루프(Reasoning Loop)' 현상을 텍스트 반복이 심화되기 전에 조기 탐지하고 불필요한 생성을 중단시키는 프레임워크이다. 기존 완화 기법은 확률 페널티·n-gram 차단처럼 유효한 반복까지 억제해 성능을 저해하거나, 은닉 상태 기반 프로빙(probing)처럼 모델마다 재학습이 필요해 확장성이 부족하다. 본 기술은 디코딩 과정에서 노출되는 상위 K개 토큰의 확률 분포만을 누적 관측하여, 모델 내부 접근이나 추가 학습 없이 루프의 징후를 탐지한다. 특히 상위 토큰 집합의 자카드 유사도(Jaccard similarity) 등 기존 확률 기반 지표와 구별되는 패턴을 보이는 보완적 신호를 확인하였고, 이를 시계열 탐지 기법(MA/CUSUM)과 결합해 다수의 추론 시나리오에서 단일 파라미터로 작동하는 탐지 조합을 도출하였다. 제안된 기법은 오탐률(FAR) 2% 내외에서 조기 탐지율(EDR) 97% 이상을 달성하였다. 탐지 직후 추론을 강제 종료하는 개입을 결합한 결과, 표면 반복 궤적 비율이 7.33%에서 0% 수준으로 감소하였으며, 낭비되는 토큰의 최대 19.2%가 회수되었고 정답률 또한 소폭 상승하였다.
핵심 기술
- 디코딩 과정의 확률 분포 및 토큰 집합 유사도를 활용한 토큰 단위 탐지 신호 설계
- 시계열 통계 기법을 적용한 추론 루프 징후 탐지 알고리즘
- 조기 추론 차단을 통한 컴퓨팅 자원 회수 및 미완료 추론 궤적 구제 기법
연구 실적
학회: Top-Conf. 심사중
- Detecting Reasoning Loops in LRMs Using Token-Level Decoding Outputs
댓글목록
등록된 댓글이 없습니다.