AAI News Hub
연구Wed, August 12, 2026·4d ago2 sources corroborating

MiLMMT 팀, 참조 번역 없는 평가 기반 번역 모델 공개

MiLMMT-46-v1.0은 GRPO와 체크포인트 보간을 활용해 오픈 다국어 번역 성능을 높였다.

왜 중요한가

이번 연구는 모든 언어 쌍에 대해 인간이 만든 참조 번역에 의존하지 않아도, 참조 번역 없는 보상으로 다국어 번역 성능을 개선할 수 있음을 시사한다. 또한 연구자들이 RL 기반 번역 사후 학습 방법을 시험할 수 있도록 오픈 모델과 코드를 제공한다.

핵심 포인트

  • 1.참조 번역 없는 GRPO가 46개 언어 전반에서 MiLMMT 성능을 높였다.
  • 2.이번 연구에서 체크포인트 보간은 온폴리시 증류보다 더 나은 결과를 냈다.
  • 3.연구용 모델과 코드가 공개됐다.

연구진이 MiLMMT-46-v0.1을 기반으로 참조 번역 없는 사후 학습을 적용한 오픈 다국어 기계번역 모델군 MiLMMT-46-v1.0을 공개했다. 이 방법은 언어 식별로 걸러낸 두 개의 참조 번역 없는 품질 평가 모델 보상을 활용해 GRPO를 적용한 뒤, SFT와 RL 체크포인트를 선형 보간한다. 46개 언어 전반에서 해당 모델들은 SFT 기반 모델보다 성능이 향상됐고, Seed-X, HY-MT2, TranslateGemma 등 인용된 오픈 기준 모델을 앞섰으며, 평가 대상 독점 시스템과 비교해도 참조 번역 없는 점수에서 선두권을 기록했다.

오늘 바로 활용

오픈 다국어 번역 기준 모델을 선택하기 전에 MiLMMT-46-v1.0과 공개된 코드를 평가해볼 필요가 있다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구