AAI News Hub
연구Fri, August 7, 2026·Aug 72 sources corroborating

OPD², Qwen3 기반 다국어 수학 추론 성능 개선

이 arXiv 논문은 영어, 한국어, 일본어 수학 추론에서 온폴리시 델타 증류를 연구했다.

왜 중요한가

이 연구는 다국어 추론 모델의 후학습에서 증류가 강화학습의 대안이 될 가능성을 보여준다. 동시에 다국어 데이터 없이 교차언어 성능을 개선할 경우 목표 언어로 응답하는 능력이 저하될 수 있다는 실무적 위험도 부각한다.

핵심 포인트

  • 1.OPD²는 teacher-base 확률 격차를 학습 신호로 사용한다.
  • 2.Qwen3 실험에서 한국어와 일본어 성능 향상이 더 크게 나타났다.
  • 3.영어 전용 OPD는 비영어 출력이 영어 쪽으로 이동하게 만들 수 있다.

연구진은 다국어 수학 추론을 위한 LLM 후학습 방식으로 온폴리시 증류의 변형인 On-Policy Delta Distillation, 즉 OPD²를 제안했다. Qwen3를 활용해 영어, 한국어, 일본어를 대상으로 진행한 실험에서 OPD²는 기존 OPD 방식보다 일관되게 높은 성능을 보였으며, 특히 한국어와 일본어에서 향상이 두드러졌다. 연구는 또한 영어 데이터만 사용한 OPD도 한국어와 일본어 성능을 높일 수 있지만, 응답이 영어 쪽으로 치우칠 수 있다는 점을 확인했다.

오늘 바로 활용

OPD 계열 후학습을 적용할 때 목표 언어 응답을 유지하려면 다국어 학습 데이터를 사용해야 한다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구