AAI News Hub
PesquisaThu, August 20, 2026·16h ago2 sources corroborating

SkillGate mira a seleção de habilidades em agentes de longo horizonte

O artigo propõe canais de crédito separados para escolher e executar habilidades de agentes.

Por que importa

À medida que sistemas de agentes passam a depender de bibliotecas de habilidades maiores, escolher a habilidade certa se torna uma decisão de política, e não uma etapa fixa de orquestração. O trabalho destaca um modo de falha de treinamento que pode afetar a confiabilidade de agentes de longo horizonte.

Pontos-chave

  • 1.A seleção de habilidades é enquadrada como uma decisão dentro da política durante episódios de agentes.
  • 2.RL recompensado por resultado pode atribuir crédito de forma incorreta a tokens de escolha de habilidades.
  • 3.O SkillGate separa o crédito por escolher habilidades do crédito por executá-las.

Um novo artigo, "SkillGate", argumenta que frameworks de agentes de longo horizonte não têm um sinal de treinamento para decidir qual arquivo de habilidade procedural ler durante um episódio. Os autores identificam a "inanição de crédito do seletor", em que o aprendizado por reforço recompensado por resultado atribui crédito insuficiente e cada vez mais desviado aos tokens de seleção de habilidades à medida que as trajetórias ficam mais longas. O SkillGate enfrenta isso separando o crédito de resultado para tokens de execução de uma vantagem local da ação para tokens que nomeiam habilidades.

Experimente hoje

Leia o artigo antes de treinar agentes que selecionam entre grandes bibliotecas de habilidades com recompensas de RL em nível de sequência.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa