Investigadores prueban arneses creados por IA para modelos más débiles
Un modelo más potente construyó estructuras de inferencia que elevaron las puntuaciones de modelos más débiles en benchmarks de Teoría de la Mente.
Por qué importa
Los resultados sugieren que parte de la transferencia de capacidades puede producirse mediante scaffolding en tiempo de inferencia, no solo mediante destilación durante el entrenamiento. Eso podría desplazar la atención hacia el diseño de arneses, el enrutamiento y los protocolos de evaluación al desplegar modelos más pequeños.
Puntos clave
- 1.Los arneses en tiempo de prueba mejoraron las puntuaciones de modelos más débiles de 0,49 a 0,91.
- 2.Las mejoras provinieron principalmente del código, el enrutamiento y la imposición del formato de respuesta.
- 3.El estudio utilizó cuatro benchmarks de Teoría de la Mente.
Un nuevo artículo estudia si un modelo “constructor” más potente puede mejorar en tiempo de prueba el rendimiento de un modelo más débil creando arneses de inferencia, sin modificar los parámetros del modelo más débil. En cuatro benchmarks de Teoría de la Mente, los constructores usaron el 5% de los datos como validación para refinar los arneses y luego los evaluaron en todo el conjunto de prueba. El enfoque casi duplicó el rendimiento medio del modelo objetivo, de 0,49 a 0,91, con mejoras atribuidas principalmente a código determinista, enrutamiento específico para cada benchmark y formato estricto de las respuestas.
⚡ Pruébalo hoy
Antes de ajustar un modelo más débil, comprueba si un modelo más potente puede diseñar un arnés de inferencia específico para la tarea.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.LGAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.LGTowards Understanding On-Policy Distillation through the Lens of Test-Time ScalingAug 13, 12:00 PM↗
- arXiv cs.CLAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.CLTowards Understanding On-Policy Distillation through the Lens of Test-Time ScalingAug 13, 12:00 PM↗
- HF Daily PapersAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 12, 4:00 AM↗
- arXiv cs.AIProxy OPD: On-Policy Distillation with Transferable Relative Proxy UpdateAug 11, 12:00 PM↗
- arXiv cs.AIWDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-TrainingAug 11, 12:00 PM↗
- arXiv cs.LGProxy OPD: On-Policy Distillation with Transferable Relative Proxy UpdateAug 11, 12:00 PM↗
- arXiv cs.LGWDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-TrainingAug 11, 12:00 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores presentan TTP-D para la planificación de rutas con camiones y drones
El nuevo benchmark combina selección de artículos, rutas dependientes de la carga y sincronización de drones.
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.