SKILL-KD mira a destilação de habilidades para agentes de LLM
O framework transforma diferenças entre trajetórias de professor e aluno em patches textuais de habilidade reutilizáveis.
Por que importa
O trabalho aborda uma fragilidade prática no prompting baseado em habilidades: agentes mais fracos podem não expor evidências suficientes em execuções fracassadas para inferir estratégias ausentes. Tratar habilidades como um meio explícito de destilação pode tornar a melhoria de agentes mais sistemática diante de lacunas de capacidade.
Pontos-chave
- 1.O SKILL-KD compara falhas do aluno com trajetórias do professor.
- 2.Patches textuais de habilidade são testados executando novamente o agente aluno.
- 3.O Drift-Aware Skill Consolidation gerencia atualizações locais repetidas.
Pesquisadores propuseram o SKILL-KD, um framework de destilação contrastiva de habilidades para agentes de LLM. O método compara uma trajetória malsucedida do aluno com a trajetória de um professor na mesma tarefa, destila a discrepância acionável em um patch textual de habilidade, executa novamente o aluno para avaliá-lo e refina iterativamente o patch caso as falhas continuem. Ele também usa históricos de edição vinculados a traces e Drift-Aware Skill Consolidation para gerenciar atualizações repetidas de habilidades.
⚡ Experimente hoje
Leia o artigo antes de adotar atualizações de memória de habilidades para agentes que aprendem com trajetórias malsucedidas.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.