R^3-Bench testa o raciocínio de LLMs sob orçamentos compartilhados
O benchmark avalia seis modelos em conjuntos de problemas com computação limitada.
Por que importa
Os resultados sugerem que os LLMs atuais têm dificuldade para gerenciar orçamentos de raciocínio compartilhados, mesmo quando já demonstraram competência em problemas individuais. Essa lacuna é relevante para sistemas de agentes que precisam priorizar tarefas sob restrições de tempo ou computação.
Pontos-chave
- 1.O R^3-Bench avalia conjuntos de seis problemas sob orçamentos compartilhados.
- 2.O oráculo superou ou igualou o desempenho em disputa em todas as 72 células.
- 3.Diagnósticos encontraram atualização limitada de estratégia sob pressão.
Pesquisadores apresentaram o R^3-Bench, um benchmark para avaliar como modelos de linguagem alocam computação limitada em conjuntos de seis problemas. O benchmark cobre matemática, programação competitiva e raciocínio abstrato em configurações sem ferramentas e agentivas, e compara o desempenho dos modelos em disputa com oráculos empíricos offline construídos a partir de curvas de resposta para problemas individuais. Em 72 células da tabela principal para seis modelos, o oráculo igualou ou superou o desempenho em disputa em todas as células e foi estritamente superior em 71.
⚡ Experimente hoje
Use avaliações com orçamento compartilhado, não apenas benchmarks por tarefa, ao testar agentes de raciocínio para fluxos de trabalho com restrições.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Startup diz que dados são essenciais para avanços da IA contra o câncer
Segundo o TechCrunch, a startup afirma que a IA ainda não está perto de curar o câncer sem dados melhores.
HarnessRisk mede falhas de segurança em harnesses de agentes
O benchmark testa ataques em diferentes fases de harnesses de agentes, enquanto trabalhos relacionados analisam provisionamento específico por tarefa.
Agent Lightning v1.0 mira RL agêntico com harness
O framework conecta harnesses arbitrários de agentes ao pós-treinamento por aprendizado por reforço.