Artigo estuda caminhos de controle em GPU para agentes de LLM
Ready Cohorts modela quando o trabalho de controle de agentes pode permanecer na GPU em vez de voltar ao host.
Por que importa
O trabalho mira um gargalo de sistemas cada vez mais relevante em serviços de agentes: transições frequentes de controle entre chamadas de modelo e de ferramentas. Ele sugere que o roteamento residente em GPU pode reduzir idas e vindas ao host, mas os resultados baseados em traces são limitados pelas premissas do artigo e não provam identidade executável.
Pontos-chave
- 1.Ready Cohorts delimita a oportunidade de uso de GPU em caminhos de controle de agentes de LLM.
- 2.A reprodução do trace principal relata P*=43,00% nas condições especificadas.
- 3.O roteamento residente no dispositivo foi mais rápido em todas as 36 configurações estudadas.
Um novo artigo no arXiv, também listado pelo HF Daily Papers, examina se pequenas transições determinísticas de controle em serviços de agentes de LLM expõem trabalho concorrente suficiente para execução em GPU. Usando uma reprodução estacionária de Poisson de um painel público fixado com 851 sessões, os autores relatam F=30,19%, P*=43,00% e U=45,85% na condição principal de 100.000 sessões ativas-alvo, K=256 e prazo de lançamento de 50 ms. Eles também estudam manter no dispositivo uma decisão binária de roteamento calculada pela GPU, em vez de retornar quatro bytes ao host e redistribuir a tarefa, constatando que o caminho residente no dispositivo foi mais rápido em todas as 36 configurações descritas nas fontes.
⚡ Experimente hoje
Leia o artigo antes de mover a orquestração de agentes para a GPU e compare seus próprios traces de roteamento com as premissas de ready cohort do estudo.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.
InternLM propõe a arquitetura de modelo Mobius
O artigo no arXiv separa memória e raciocínio para melhorar a compressão e a eficiência na inferência.