HarnessOpt-Bench pone a prueba a los LLM en la optimización de harnesses
El benchmark evalúa cómo los LLM mejoran prompts de agentes, herramientas, flujo de control y código de orquestación.
Por qué importa
El trabajo refleja la creciente atención a las mejoras de rendimiento de los agentes provenientes de prompts, herramientas, memoria y código de orquestación, no solo de los pesos del modelo. Un benchmark común podría hacer más comparables las afirmaciones sobre optimización de harnesses entre LLM de frontera y sistemas de agentes.
Puntos clave
- 1.HarnessOpt-Bench apunta a la optimización integral de harnesses de agentes.
- 2.Las puntuaciones usan ganancia normalizada sobre un harness inicial en pruebas reservadas.
- 3.La ejecución de confianza mide el uso de recursos y conserva trazas de auditoría.
Investigadores presentaron HarnessOpt-Bench, un benchmark para medir qué tan bien pueden los LLM optimizar los harnesses que rodean a los sistemas agénticos. En el protocolo, un LLM optimizador recibe un harness inicial, retroalimentación de evaluación calificada y un presupuesto de evaluación fijo, edita el harness y presenta un candidato final puntuado por ganancia normalizada en una partición de prueba reservada. El benchmark usa un entorno de ejecución de confianza para hacer cumplir los límites de evaluación, medir el uso de recursos del agente objetivo y conservar versiones candidatas para auditoría.
⚡ Pruébalo hoy
Usa pruebas reservadas y límites estrictos de evaluación cuando permitas que los LLM optimicen harnesses de agentes.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
El equipo de MiLMMT lanza modelos de traducción sin referencias
MiLMMT-46-v1.0 usa GRPO e interpolación de checkpoints para mejorar la traducción multilingüe abierta.
DistilVDR comprime la recuperación de documentos visuales
El recuperador de 524 millones de parámetros usa destilación bilateral a partir de un modelo docente de visión-lenguaje de 8B.
Investigadores proponen Power Law Graph Attention
PLGA generaliza la atención de producto punto escalado y reporta colapso de inferencia bajo invariancia exacta.