Investigadores presentan HarnessOpt-Bench para agentes con LLM
El benchmark evalúa qué tan bien los LLM pueden mejorar los harnesses de agentes con presupuestos de evaluación fijos.
Por qué importa
El trabajo desplaza la evaluación desde los pesos del modelo por sí solos hacia los prompts, herramientas, flujo de control, memoria y código de orquestación que moldean el rendimiento de los agentes. Ofrece un protocolo común para medir si los LLM de frontera pueden mejorar sistemas de agentes mediante cambios en el harness bajo restricciones de evaluación realistas.
Puntos clave
- 1.HarnessOpt-Bench evalúa la optimización integral de harnesses para agentes con LLM.
- 2.La puntuación usa ganancia normalizada frente a un harness inicial en pruebas reservadas.
- 3.El benchmark incluye controles de ejecución para auditoría y medición de recursos.
Investigadores presentaron HarnessOpt-Bench, un benchmark para evaluar la optimización automatizada de harnesses en sistemas de agentes basados en LLM. En este esquema, un optimizador LLM recibe el harness inicial de un agente objetivo, retroalimentación de evaluación calificada y un presupuesto de evaluación fijo; luego edita el harness y presenta un candidato final. El candidato se califica mediante la ganancia normalizada frente al harness inicial en una partición de prueba reservada, con un entorno de ejecución confiable que hace cumplir los límites de evaluación, mide el uso de recursos y conserva versiones para auditoría.
⚡ Pruébalo hoy
Usa pruebas reservadas y medición de recursos al experimentar con optimización automatizada de prompts, herramientas u orquestación de agentes.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
- arXiv cs.AIWeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent NetworksAug 5, 12:00 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Google DeepMind presenta un modelo de lengua de señas a texto
SL2T de DeepMind impulsa nuevas funciones de lengua de señas para personas sordas y con dificultades auditivas.
El equipo de MiLMMT lanza modelos de traducción sin referencias
MiLMMT-46-v1.0 usa GRPO e interpolación de checkpoints para mejorar la traducción multilingüe abierta.
DistilVDR comprime la recuperación de documentos visuales
El recuperador de 524 millones de parámetros usa destilación bilateral a partir de un modelo docente de visión-lenguaje de 8B.