AAI News Hub
FerramentasThu, August 6, 2026·6d ago3 sources corroborating

Prime Agent é lançado enquanto agentes de programação enfrentam testes mais longos

A Prime Intellect lançou um agente open-source enquanto o LoopsBench mira a avaliação de programação de longo horizonte.

Por que importa

Os relatos apontam para uma mudança de benchmarks de programação de tentativa única para a avaliação da execução sustentada de agentes. Harnesses abertos e benchmarks de longo horizonte podem tornar o desempenho de agentes de programação mais fácil de inspecionar para além dos resultados finais.

Pontos-chave

  • 1.O Prime Agent é descrito como open-source, com licença aberta.
  • 2.O LoopsBench testa trabalho de programação de longo horizonte em 112 tarefas.
  • 3.A melhor configuração reportada no LoopsBench resolveu 25,00% das tarefas.

A Prime Intellect lançou o Prime Agent, um agente open-source de programação e pesquisa para trabalho autônomo de longa duração, segundo uma publicação no Reddit com links para seu GitHub e blog. A publicação diz que o Prime Agent usa chamadas programáticas de ferramentas, contexto como variável, mensagens entre múltiplos agentes e um estado de harness automodificável, e informa uma pontuação de 95,5% no ARC-AGI-3. Separadamente, um artigo no arXiv apresentou o LoopsBench, um benchmark de longo horizonte com 112 tarefas em oito linguagens de programação e nove domínios; a configuração mais forte avaliada, Opus-4.7 com Claude Code e continuação externa, resolveu 25,00% das tarefas.

Experimente hoje

Analise o código do Prime Agent e o LoopsBench antes de confiar em alegações de benchmarks de agentes de programação para trabalho de desenvolvimento de longa duração.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Ferramentas e OSS