AAI News Hub
InvestigaciónMon, August 17, 2026·3d ago2 sources corroborating

R^3-Bench pone a prueba el razonamiento de los LLM con presupuestos compartidos

El benchmark evalúa seis modelos en conjuntos de problemas con computación limitada.

Por qué importa

Los resultados sugieren que los LLM actuales tienen dificultades para gestionar presupuestos de razonamiento compartidos, incluso cuando han demostrado competencia en problemas individuales. Esa brecha importa para los sistemas de agentes que deben priorizar tareas bajo restricciones de tiempo o de cómputo.

Puntos clave

  • 1.R^3-Bench evalúa conjuntos de seis problemas bajo presupuestos compartidos.
  • 2.El oráculo superó o igualó el desempeño en competencia en las 72 celdas.
  • 3.Los diagnósticos encontraron una actualización limitada de estrategias bajo presión.

Investigadores presentaron R^3-Bench, un benchmark para evaluar cómo los modelos de lenguaje asignan computación limitada en conjuntos de seis problemas. El benchmark abarca matemáticas, programación competitiva y razonamiento abstracto en entornos sin herramientas y agentic, y compara el desempeño de los modelos en competencia con oráculos empíricos offline construidos a partir de curvas de respuesta de problemas individuales. En las 72 celdas de la tabla principal correspondientes a seis modelos, el oráculo igualó o superó el desempeño en competencia en todas las celdas y fue estrictamente superior en 71.

Pruébalo hoy

Usa evaluaciones con presupuesto compartido, no solo benchmarks por tarea, al probar agentes de razonamiento para flujos de trabajo restringidos.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación