Investigadores proponen DASH para reducir el exceso de razonamiento
El método de crédito por segmentos usa compromisos de respuesta intermedios para orientar el entrenamiento de modelos de razonamiento.
Por qué importa
El trabajo aborda una ineficiencia práctica en los modelos de razonamiento: las trazas más largas pueden aumentar el coste sin mejorar la precisión. El crédito por segmentos podría ayudar a que los métodos de entrenamiento recompensen la reflexión útil y desalienten los bucles de razonamiento improductivos.
Puntos clave
- 1.DASH asigna crédito a nivel de segmento de razonamiento.
- 2.El método usa compromisos de respuesta intermedios como señal proxy.
- 3.Reporta una precisión media del 59,45% en benchmarks matemáticos de nivel competitivo.
Un artículo en arXiv presenta DASH, o Drift Aware advantage SHaping, un método de asignación de crédito por segmentos para modelos de lenguaje de razonamiento. Los autores afirman que los modelos de razonamiento suelen pensar de más mediante matices cautelosos, enfoques abandonados y autocontradicciones, consumiendo tokens sin mejorar las respuestas. DASH usa compromisos de respuesta intermedios como un indicador de bajo coste para evaluar si la reflexión posterior se acerca o se aleja de la corrección, y reporta una precisión media del 59,45% en benchmarks matemáticos de nivel competitivo, frente al 58,1% de Dr.GRPO y el 56,95% de GRPO en contextos donde prevalece el exceso de razonamiento.
⚡ Pruébalo hoy
Lee el artículo antes de ajustar objetivos de RL para modelos de razonamiento que premian cadenas largas de pensamiento.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.