CalibForge calibra tareas de terminal según el comportamiento de los solucionadores
El sistema generó 5.431 tareas y mejoró las puntuaciones de agentes en benchmarks de terminal y programación.
Por qué importa
El trabajo aborda un cuello de botella central en el entrenamiento de agentes de terminal: crear tareas ejecutables, verificables y con la dificultad adecuada para el aprendizaje. Sus mejoras reportadas en Terminal-Bench 2.0, SWE-bench Pro y Doc2Repo sugieren que la calibración de tareas relativa al solucionador puede mejorar la supervisión más allá de la validación por sí sola.
Puntos clave
- 1.CalibForge generó 5.431 tareas de terminal calibradas.
- 2.El enfoque usa el comportamiento de los solucionadores para ajustar la dificultad de las tareas.
- 3.Las mejoras reportadas llegaron a 30,04 puntos en Doc2Repo.
Investigadores presentaron CalibForge, un sistema autónomo para sintetizar tareas de entrenamiento de agentes de terminal a partir de comportamientos verificados de solucionadores. El método revisa tareas candidatas mediante calibración adversarial con solucionadores, incluida la discrepancia entre múltiples solucionadores y la calibración contrastiva fuerte-aprueba/débil-falla. CalibForge produjo 5.431 tareas de terminal calibradas, y los modelos entrenados con la colección alcanzaron 32,58% y 47,57% en Terminal-Bench 2.0.
⚡ Pruébalo hoy
Revise el artículo de CalibForge antes de diseñar datos de entrenamiento para agentes de terminal o de depender solo de la validación ejecutable.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.