AAI News Hub
InvestigaciónThu, August 6, 2026·Aug 62 sources corroborating

CalibForge calibra tareas de terminal según el comportamiento de los solucionadores

El sistema generó 5.431 tareas y mejoró las puntuaciones de agentes en benchmarks de terminal y programación.

Por qué importa

El trabajo aborda un cuello de botella central en el entrenamiento de agentes de terminal: crear tareas ejecutables, verificables y con la dificultad adecuada para el aprendizaje. Sus mejoras reportadas en Terminal-Bench 2.0, SWE-bench Pro y Doc2Repo sugieren que la calibración de tareas relativa al solucionador puede mejorar la supervisión más allá de la validación por sí sola.

Puntos clave

  • 1.CalibForge generó 5.431 tareas de terminal calibradas.
  • 2.El enfoque usa el comportamiento de los solucionadores para ajustar la dificultad de las tareas.
  • 3.Las mejoras reportadas llegaron a 30,04 puntos en Doc2Repo.

Investigadores presentaron CalibForge, un sistema autónomo para sintetizar tareas de entrenamiento de agentes de terminal a partir de comportamientos verificados de solucionadores. El método revisa tareas candidatas mediante calibración adversarial con solucionadores, incluida la discrepancia entre múltiples solucionadores y la calibración contrastiva fuerte-aprueba/débil-falla. CalibForge produjo 5.431 tareas de terminal calibradas, y los modelos entrenados con la colección alcanzaron 32,58% y 47,57% en Terminal-Bench 2.0.

Pruébalo hoy

Revise el artículo de CalibForge antes de diseñar datos de entrenamiento para agentes de terminal o de depender solo de la validación ejecutable.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación