연구진, 추론 과잉 사고를 줄이는 DASH 제안
이 세그먼트 수준 크레딧 방식은 중간 답변 확정을 활용해 추론 모델 학습을 조정한다.
왜 중요한가
이 연구는 추론 모델의 현실적인 비효율을 겨냥한다. 더 긴 추론 과정이 정확도 향상 없이 비용만 늘릴 수 있다는 점이다. 세그먼트 수준 크레딧은 학습 방식이 유용한 성찰에는 보상을 주고 생산적이지 않은 추론 반복은 억제하도록 돕는 데 활용될 수 있다.
핵심 포인트
- 1.DASH는 추론 세그먼트 수준에서 크레딧을 할당한다.
- 2.이 방식은 중간 답변 확정을 대리 신호로 활용한다.
- 3.대회 수준 수학 벤치마크에서 평균 정확도 59.45%를 기록했다고 보고했다.
arXiv 논문이 추론 언어 모델을 위한 세그먼트 수준 크레딧 할당 방식인 DASH(Drift Aware advantage SHaping)를 소개했다. 저자들은 추론 모델이 종종 유보적 표현, 포기한 접근법, 자기모순을 거치며 과도하게 생각하고, 답변 개선 없이 토큰을 소모한다고 설명한다. DASH는 중간 답변 확정을 저비용 대리 지표로 사용해 이후의 성찰이 정답에 가까워지는지 멀어지는지를 판단하며, 과잉 사고가 두드러지는 대회 수준 수학 벤치마크에서 평균 정확도 59.45%를 기록했다고 보고했다. Dr.GRPO는 58.1%, GRPO는 56.95%였다.
⚡ 오늘 바로 활용
긴 사고 과정을 보상하는 추론 모델 RL 목표를 조정하기 전에 이 논문을 읽어볼 필요가 있다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
DistilVDR, 시각 문서 검색을 압축하다
5억2400만 매개변수 규모의 검색 모델이 80억 매개변수 비전-언어 교사 모델로부터 양방향 증류를 활용한다.
연구진, Power Law Graph Attention 제안
PLGA는 scaled dot-product attention을 일반화하며, 정확한 불변성 조건에서 추론 붕괴가 발생한다고 보고했다.
장문 문서 VLM 추론을 겨냥한 새 논문들
InSight-doc, DocAtlas, DocMemo가 복잡한 문서 전반에서 근거를 찾아내는 에이전트형 접근법을 제안했다.