AAI News Hub
PesquisaMon, August 17, 2026·3d ago2 sources corroborating

R^3-Bench testa o raciocínio de LLMs sob orçamentos compartilhados

O benchmark avalia seis modelos em conjuntos de problemas com computação limitada.

Por que importa

Os resultados sugerem que os LLMs atuais têm dificuldade para gerenciar orçamentos de raciocínio compartilhados, mesmo quando já demonstraram competência em problemas individuais. Essa lacuna é relevante para sistemas de agentes que precisam priorizar tarefas sob restrições de tempo ou computação.

Pontos-chave

  • 1.O R^3-Bench avalia conjuntos de seis problemas sob orçamentos compartilhados.
  • 2.O oráculo superou ou igualou o desempenho em disputa em todas as 72 células.
  • 3.Diagnósticos encontraram atualização limitada de estratégia sob pressão.

Pesquisadores apresentaram o R^3-Bench, um benchmark para avaliar como modelos de linguagem alocam computação limitada em conjuntos de seis problemas. O benchmark cobre matemática, programação competitiva e raciocínio abstrato em configurações sem ferramentas e agentivas, e compara o desempenho dos modelos em disputa com oráculos empíricos offline construídos a partir de curvas de resposta para problemas individuais. Em 72 células da tabela principal para seis modelos, o oráculo igualou ou superou o desempenho em disputa em todas as células e foi estritamente superior em 71.

Experimente hoje

Use avaliações com orçamento compartilhado, não apenas benchmarks por tarefa, ao testar agentes de raciocínio para fluxos de trabalho com restrições.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa