AAI News Hub
연구Fri, August 7, 2026·6d ago2 sources corroborating

연구진, 다국어 수학 추론에서 OPD² 성능 검증

Qwen3 실험에서 OPD²는 영어, 한국어, 일본어 수학 과제에서 OPD보다 더 나은 성과를 보였다.

왜 중요한가

이번 결과는 distillation 기반 후훈련이 강화학습에만 의존하지 않고도 다국어 추론을 개선할 수 있음을 시사한다. 동시에 목표 언어로 충실하게 출력하는 것이 중요할 때는 다국어 학습 데이터가 중요하다는 점도 보여준다.

핵심 포인트

  • 1.OPD²는 teacher-base 확률 격차를 학습 신호로 사용한다.
  • 2.Qwen3 실험에서는 한국어와 일본어에서 더 큰 성능 향상이 나타났다.
  • 3.영어 데이터만 사용한 OPD는 비영어 답변을 영어 쪽으로 밀어낼 수 있다.

새 arXiv 논문은 영어, 한국어, 일본어 수학 추론에서 On-Policy Distillation과 On-Policy Delta Distillation, 즉 OPD²를 분석했다. 저자들은 Qwen3를 사용한 실험에서 OPD²가 표준 OPD를 일관되게 앞섰으며, 특히 한국어와 일본어에서 개선 폭이 컸고 전반적으로 영어와 한국어 간 성능 격차를 줄였다고 보고했다. 또 영어 데이터만 사용한 OPD도 한국어와 일본어 성능을 높일 수 있지만, 답변이 영어 쪽으로 기울어질 수 있다고 밝혔다.

오늘 바로 활용

비영어 추론 과제에 OPD 방식의 후훈련을 적용할 때는 다국어 학습 데이터를 활용해야 한다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구