SkillGate mira a seleção de habilidades em agentes de longo horizonte
O artigo propõe canais de crédito separados para escolher e executar habilidades de agentes.
Por que importa
À medida que sistemas de agentes passam a depender de bibliotecas de habilidades maiores, escolher a habilidade certa se torna uma decisão de política, e não uma etapa fixa de orquestração. O trabalho destaca um modo de falha de treinamento que pode afetar a confiabilidade de agentes de longo horizonte.
Pontos-chave
- 1.A seleção de habilidades é enquadrada como uma decisão dentro da política durante episódios de agentes.
- 2.RL recompensado por resultado pode atribuir crédito de forma incorreta a tokens de escolha de habilidades.
- 3.O SkillGate separa o crédito por escolher habilidades do crédito por executá-las.
Um novo artigo, "SkillGate", argumenta que frameworks de agentes de longo horizonte não têm um sinal de treinamento para decidir qual arquivo de habilidade procedural ler durante um episódio. Os autores identificam a "inanição de crédito do seletor", em que o aprendizado por reforço recompensado por resultado atribui crédito insuficiente e cada vez mais desviado aos tokens de seleção de habilidades à medida que as trajetórias ficam mais longas. O SkillGate enfrenta isso separando o crédito de resultado para tokens de execução de uma vantagem local da ação para tokens que nomeiam habilidades.
⚡ Experimente hoje
Leia o artigo antes de treinar agentes que selecionam entre grandes bibliotecas de habilidades com recompensas de RL em nível de sequência.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Estudo encontra sinais de IA em um terço das páginas da web pós-ChatGPT
Pesquisadores identificaram indícios de autoria ou edição por IA em boa parte da web mais recente.
Soluções matemáticas da OpenAI geram debate entre matemáticos
The Verge relata que o trabalho da OpenAI em problemas matemáticos de longa data levantou questionamentos em toda a área.
Preprint propõe neurônio espectral para ML interpretável
O modelo usa matrizes simétricas aprendidas e autovalores para equilibrar expressividade e transparência.