El equipo de MiLMMT lanza modelos de traducción sin referencias
MiLMMT-46-v1.0 usa GRPO e interpolación de checkpoints para mejorar la traducción multilingüe abierta.
Por qué importa
El trabajo sugiere que las recompensas sin referencias pueden mejorar la traducción multilingüe sin depender de traducciones humanas de referencia para cada par de idiomas. También ofrece a los investigadores modelos abiertos y código para probar métodos de posentrenamiento de traducción basados en RL.
Puntos clave
- 1.GRPO sin referencias mejoró MiLMMT en 46 idiomas.
- 2.La interpolación de checkpoints superó a la destilación on-policy en el estudio.
- 3.Los modelos y el código se publicaron para uso en investigación.
Investigadores lanzaron MiLMMT-46-v1.0, una familia abierta de modelos de traducción automática multilingüe construida a partir de MiLMMT-46-v0.1 con posentrenamiento sin referencias. El método aplica GRPO usando recompensas de dos modelos de estimación de calidad sin referencias, filtradas mediante identificación de idioma, y después interpola linealmente checkpoints de SFT y RL. En 46 idiomas, los modelos mejoraron frente a sus equivalentes SFT, superaron a referencias abiertas citadas como Seed-X, HY-MT2 y TranslateGemma, y obtuvieron puntuaciones líderes sin referencias frente a los sistemas propietarios evaluados.
⚡ Pruébalo hoy
Evalúa MiLMMT-46-v1.0 y su código publicado antes de elegir una referencia abierta de traducción multilingüe.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIWhen the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool UseAug 13, 12:00 PM↗
- arXiv cs.CLWhen the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool UseAug 13, 12:00 PM↗
- arXiv cs.AIReference-Free Post-Training of Open Large Language Models for Multilingual Machine TranslationAug 12, 12:00 PM↗
- arXiv cs.CLReference-Free Post-Training of Open Large Language Models for Multilingual Machine TranslationAug 12, 12:00 PM↗
- arXiv cs.CLReference-Free Post-Training of Open Large Language Models for Multilingual Machine TranslationAug 12, 12:00 PM↗
- arXiv cs.CLEmbedding Initialization for Unseen Low-resource Languages in Multilingual NMT: A Case Study on Limbum-English TranslationAug 11, 12:00 PM↗
- arXiv cs.LGEmbedding Initialization for Unseen Low-resource Languages in Multilingual NMT: A Case Study on Limbum-English TranslationAug 11, 12:00 PM↗
- HF Daily PapersReference-Free Post-Training of Open Large Language Models for Multilingual Machine TranslationAug 11, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores apuntan a las brechas de razonamiento espacial en los VLM
Nuevos artículos proponen memoria, RL y benchmarks para la inteligencia espacial en sistemas de visión-lenguaje.
Nuevos estudios examinan la inteligencia espacial en la IA de visión
SpaRRTa, SMA y PinpointQA evalúan o mejoran el razonamiento espacial en sistemas de IA visual y encarnada.
CW-BASS v2 apunta a la selección de pseudoetiquetas con DINOv2
El método adapta el filtrado para la segmentación semisupervisada con modelos fundacionales como docentes.