Pesquisadores propõem RST para tarefas de agentes em terminal
Recursive Synthetic Terminal Tasks gerou 37.484 tarefas verificadas a partir de tarefas-semente.
Por que importa
O trabalho mira um gargalo no treinamento de agentes em terminal: produzir tarefas consistentes de longo horizonte com instruções, ambientes, soluções e verificadores alinhados. Se for reproduzível, a síntese recursiva verificada pode reduzir o custo de criação de conjuntos de treinamento para agentes e de suítes de avaliação mais difíceis.
Pontos-chave
- 1.O RST gerou 37.484 tarefas sintetizadas para agentes em terminal.
- 2.O custo relatado foi de cerca de US$ 0,05 por tarefa.
- 3.O pass@4 do DeepSeek-V4-Pro caiu de 90% para 2,5% ao longo das rodadas.
Um artigo destacado pelo HF Daily Papers apresenta o Recursive Synthetic Terminal Tasks, um framework para gerar tarefas de treinamento de longo horizonte para agentes em terminal. Partindo de tarefas-semente verificadas, o RST expande soluções de referência, realinha verificadores e instruções, valida tarefas em sandboxes novos e reutiliza tarefas aceitas em rodadas posteriores. Ao longo de 15 rodadas recursivas, produziu 37.484 tarefas sintetizadas a cerca de US$ 0,05 por tarefa, com a dificuldade das tarefas aumentando a cada rodada.
⚡ Experimente hoje
Leia o artigo antes de criar benchmarks para agentes em terminal ou pipelines de treinamento sintético.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
- HF Daily PapersRecursive Synthesis for Long-Horizon Terminal TasksAug 5, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.