AAI News Hub
InvestigaciónTue, August 4, 2026·Aug 42 sources corroborating

PAST-Bench prueba si los agentes personales mejoran con el tiempo

El benchmark mide las mejoras derivadas de la experiencia retenida en distintos modelos, frameworks y tareas de agentes.

Por qué importa

El trabajo ofrece a los desarrolladores de agentes una forma más específica de evaluar afirmaciones sobre aprendizaje a largo plazo, separando las mejoras de rendimiento de la evidencia de que los mecanismos de memoria y actualización fueron realmente la causa.

Puntos clave

  • 1.PAST-Bench abarca 26 escenarios y 204 episodios.
  • 2.Las pruebas comparan ejecuciones con experiencia retenida frente a controles equivalentes.
  • 3.Las mejoras reportadas varían según las capacidades y las vías causales.

Investigadores presentaron PAST-Bench, un benchmark para evaluar si los agentes personales de IA convierten la experiencia retenida en un mejor comportamiento futuro. El benchmark compara secuencias de tareas en sesiones nuevas con la experiencia retenida activada o desactivada en 26 escenarios y 204 episodios. En siete modelos base y cuatro frameworks de agentes, los autores reportan mejoras reales pero desiguales, con avances generales similares que a veces difieren en si siguieron la ruta prevista de guardar, recuperar y actualizar.

Pruébalo hoy

Usa ablaciones al estilo de PAST-Bench antes de afirmar que un agente personal mejora gracias a la experiencia retenida.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación