OPD², Qwen3 기반 다국어 수학 추론 성능 개선
이 arXiv 논문은 영어, 한국어, 일본어 수학 추론에서 온폴리시 델타 증류를 연구했다.
왜 중요한가
이 연구는 다국어 추론 모델의 후학습에서 증류가 강화학습의 대안이 될 가능성을 보여준다. 동시에 다국어 데이터 없이 교차언어 성능을 개선할 경우 목표 언어로 응답하는 능력이 저하될 수 있다는 실무적 위험도 부각한다.
핵심 포인트
- 1.OPD²는 teacher-base 확률 격차를 학습 신호로 사용한다.
- 2.Qwen3 실험에서 한국어와 일본어 성능 향상이 더 크게 나타났다.
- 3.영어 전용 OPD는 비영어 출력이 영어 쪽으로 이동하게 만들 수 있다.
연구진은 다국어 수학 추론을 위한 LLM 후학습 방식으로 온폴리시 증류의 변형인 On-Policy Delta Distillation, 즉 OPD²를 제안했다. Qwen3를 활용해 영어, 한국어, 일본어를 대상으로 진행한 실험에서 OPD²는 기존 OPD 방식보다 일관되게 높은 성능을 보였으며, 특히 한국어와 일본어에서 향상이 두드러졌다. 연구는 또한 영어 데이터만 사용한 OPD도 한국어와 일본어 성능을 높일 수 있지만, 응답이 영어 쪽으로 치우칠 수 있다는 점을 확인했다.
⚡ 오늘 바로 활용
OPD 계열 후학습을 적용할 때 목표 언어 응답을 유지하려면 다국어 학습 데이터를 사용해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.LGOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- arXiv cs.CLOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- HF Daily PapersOn-Policy Delta Distillation for Multilingual Math ReasoningAug 6, 4:00 AM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.CLLanguage-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASRAug 5, 12:00 PM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구
새 연구들, 비전 AI의 공간 지능을 검증하다
SpaRRTa, SMA, PinpointQA는 시각 및 구현형 AI 시스템의 공간 추론을 평가하거나 개선한다.
arXiv cs.LG+1 outlet·16h ago
연구
CW-BASS v2, DINOv2 기반 의사 라벨 선별 겨냥
이 방법은 파운데이션 모델 교사를 활용한 준지도 세그멘테이션에 맞춰 필터링 방식을 조정한다.
arXiv cs.LG+1 outlet·16h ago
연구
연구, 조직 내 ChatGPT Enterprise 활용 양상 분석
arXiv 논문은 2026년 3월까지의 엔터프라이즈 계정 기록을 직무, 작업, 기업 데이터와 연결해 분석했다.
Hacker News+1 outlet·1d ago