R^3-Bench pone a prueba el razonamiento de los LLM con presupuestos compartidos
El benchmark evalúa seis modelos en conjuntos de problemas con computación limitada.
Por qué importa
Los resultados sugieren que los LLM actuales tienen dificultades para gestionar presupuestos de razonamiento compartidos, incluso cuando han demostrado competencia en problemas individuales. Esa brecha importa para los sistemas de agentes que deben priorizar tareas bajo restricciones de tiempo o de cómputo.
Puntos clave
- 1.R^3-Bench evalúa conjuntos de seis problemas bajo presupuestos compartidos.
- 2.El oráculo superó o igualó el desempeño en competencia en las 72 celdas.
- 3.Los diagnósticos encontraron una actualización limitada de estrategias bajo presión.
Investigadores presentaron R^3-Bench, un benchmark para evaluar cómo los modelos de lenguaje asignan computación limitada en conjuntos de seis problemas. El benchmark abarca matemáticas, programación competitiva y razonamiento abstracto en entornos sin herramientas y agentic, y compara el desempeño de los modelos en competencia con oráculos empíricos offline construidos a partir de curvas de respuesta de problemas individuales. En las 72 celdas de la tabla principal correspondientes a seis modelos, el oráculo igualó o superó el desempeño en competencia en todas las celdas y fue estrictamente superior en 71.
⚡ Pruébalo hoy
Usa evaluaciones con presupuesto compartido, no solo benchmarks por tarea, al probar agentes de razonamiento para flujos de trabajo restringidos.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Una startup afirma que los datos son clave para avanzar contra el cáncer con IA
TechCrunch informa que la startup sostiene que la IA no está cerca de curar el cáncer sin mejores datos.
HarnessRisk evalúa fallos de seguridad en arneses de agentes
El benchmark prueba ataques en distintas fases de los arneses de agentes, mientras trabajos relacionados estudian el aprovisionamiento específico por tarea.
Agent Lightning v1.0 apunta al RL agéntico con harness
El framework conecta harnesses de agentes arbitrarios con el post-entrenamiento mediante aprendizaje por refuerzo.