AAI News Hub
PesquisaThu, August 13, 2026·5d ago2 sources corroborating

Artigo estuda caminhos de controle em GPU para agentes de LLM

Ready Cohorts modela quando o trabalho de controle de agentes pode permanecer na GPU em vez de voltar ao host.

Por que importa

O trabalho mira um gargalo de sistemas cada vez mais relevante em serviços de agentes: transições frequentes de controle entre chamadas de modelo e de ferramentas. Ele sugere que o roteamento residente em GPU pode reduzir idas e vindas ao host, mas os resultados baseados em traces são limitados pelas premissas do artigo e não provam identidade executável.

Pontos-chave

  • 1.Ready Cohorts delimita a oportunidade de uso de GPU em caminhos de controle de agentes de LLM.
  • 2.A reprodução do trace principal relata P*=43,00% nas condições especificadas.
  • 3.O roteamento residente no dispositivo foi mais rápido em todas as 36 configurações estudadas.

Um novo artigo no arXiv, também listado pelo HF Daily Papers, examina se pequenas transições determinísticas de controle em serviços de agentes de LLM expõem trabalho concorrente suficiente para execução em GPU. Usando uma reprodução estacionária de Poisson de um painel público fixado com 851 sessões, os autores relatam F=30,19%, P*=43,00% e U=45,85% na condição principal de 100.000 sessões ativas-alvo, K=256 e prazo de lançamento de 50 ms. Eles também estudam manter no dispositivo uma decisão binária de roteamento calculada pela GPU, em vez de retornar quatro bytes ao host e redistribuir a tarefa, constatando que o caminho residente no dispositivo foi mais rápido em todas as 36 configurações descritas nas fontes.

Experimente hoje

Leia o artigo antes de mover a orquestração de agentes para a GPU e compare seus próprios traces de roteamento com as premissas de ready cohort do estudo.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa