Un paper de Wnuan prueba el post-entrenamiento por etapas para QA empresarial
Una ruta de 32B elevó la tasa de respuestas aceptables en WnuanBench, aunque redujo las puntuaciones en benchmarks generales.
Por qué importa
Los resultados muestran que el post-entrenamiento por etapas puede mejorar de forma sustancial el rendimiento en QA de dominio, pero con contrapartidas medibles en capacidad general. Eso hace que evaluar tanto las mejoras en tareas empresariales como las regresiones más amplias sea central para las decisiones de despliegue.
Puntos clave
- 1.Wnuan apunta a la respuesta de preguntas empresariales propietarias mediante post-entrenamiento por etapas.
- 2.Una ruta de 32B alcanzó una tasa de respuestas aceptables del 91,51% después del RL.
- 3.El promedio en benchmarks generales descendió 5,17 puntos a lo largo de la ruta.
Un nuevo paper en arXiv presenta Wnuan, un pipeline de tres etapas para responder preguntas empresariales sobre conocimiento propietario. El método construye supervisión orientada a tareas a partir de documentos, aplica ajuste fino supervisado con reproducción de datos generales y usa aprendizaje por refuerzo sobre errores residuales. En WnuanBench, de 707 preguntas, la ruta principal de 32B mejoró la tasa de respuestas aceptables del 52,76% antes de la adaptación al 80,06% tras el SFT y al 91,51% después del RL, mientras que el promedio en benchmarks generales cayó 5,17 puntos.
⚡ Pruébalo hoy
Audita las adaptaciones de QA empresarial tanto con benchmarks de dominio como con pruebas generales de seguimiento de instrucciones antes del despliegue.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Google DeepMind presenta un modelo de lengua de señas a texto
SL2T de DeepMind impulsa nuevas funciones de lengua de señas para personas sordas y con dificultades auditivas.
El equipo de MiLMMT lanza modelos de traducción sin referencias
MiLMMT-46-v1.0 usa GRPO e interpolación de checkpoints para mejorar la traducción multilingüe abierta.
DistilVDR comprime la recuperación de documentos visuales
El recuperador de 524 millones de parámetros usa destilación bilateral a partir de un modelo docente de visión-lenguaje de 8B.