ScrambleToolBench evalúa agentes sin pistas semánticas sobre las herramientas
El benchmark examina si los agentes pueden inferir el comportamiento oculto de las herramientas y adaptarse cuando cambian las correspondencias.
Por qué importa
El trabajo aborda una brecha en la evaluación del uso de herramientas: muchos benchmarks permiten que los modelos se apoyen en esquemas semánticos en lugar de aprender el comportamiento de las herramientas mediante la interacción. Sus hallazgos sugieren que los agentes actuales pueden seguir siendo frágiles en entornos de mundo abierto donde las herramientas cambian o no hay documentación disponible.
Puntos clave
- 1.El benchmark elimina las pistas semánticas sobre herramientas en las tareas de agentes.
- 2.Las pruebas dinámicas incluyen cambios en las correspondencias y fallos estocásticos.
- 3.Los modelos mostraron una adaptación débil tras el descubrimiento inicial.
Investigadores presentaron ScrambleToolBench, un benchmark interactivo de terminal para evaluar el razonamiento conductual de agentes autónomos en entornos de herramientas desconocidos. El benchmark elimina las pistas semánticas sobre las herramientas, utiliza un currículo continuo de tareas e incorpora desafíos dinámicos como cambios en las correspondencias, fallos estocásticos de acciones y ventanas temporales de ejecución. La evaluación informa que los modelos de lenguaje de última generación pueden descubrir comportamientos al principio, pero tienen dificultades para adaptarse cuando cambian las estructuras.
⚡ Pruébalo hoy
Usa pruebas al estilo ScrambleToolBench al evaluar agentes que deben operar con herramientas no documentadas o cambiantes.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores presentan TTP-D para la planificación de rutas con camiones y drones
El nuevo benchmark combina selección de artículos, rutas dependientes de la carga y sincronización de drones.
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.