ReflectRL treina modelos de raciocínio com trajetórias malsucedidas de especialistas
O artigo no arXiv propõe usar rollouts falhos de especialistas como alvos de reflexão durante o treinamento on-policy.
Por que importa
O trabalho mira um gargalo no pós-treinamento de modelos de raciocínio: trajetórias de especialistas se tornam menos úteis quando o especialista falha em problemas difíceis. Se validada, a abordagem pode transformar rollouts malsucedidos em um sinal de treinamento utilizável, em vez de dados descartados.
Pontos-chave
- 1.O ReflectRL aprende com trajetórias de raciocínio malsucedidas de especialistas.
- 2.O método converte o comportamento de reflexão de volta em raciocínio direto.
- 3.As avaliações abrangem 9 benchmarks e 4 backbones de LLMs.
Pesquisadores apresentaram o ReflectRL, um framework leve e plug-and-play para melhorar o raciocínio de grandes modelos de linguagem durante o treinamento on-policy. O método usa “Golden Negative Trajectories”, saídas malsucedidas de modelos especialistas mais fortes, não como demonstrações a serem imitadas, mas como caminhos de raciocínio falhos sobre os quais o modelo deve refletir antes de transferir esse comportamento de volta para o raciocínio direto. Uma entrada no Hugging Face Daily Papers afirma que os autores avaliaram a abordagem em 9 benchmarks, 4 backbones de LLMs e 4 configurações on-policy.
⚡ Experimente hoje
Leia o artigo sobre o ReflectRL antes de descartar rollouts malsucedidos de especialistas em pipelines de pós-treinamento de modelos de raciocínio.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGPrefix-Guided On-Policy Distillation: Mining Golden Trajectories from RolloutsAug 4, 12:00 PM↗
- HF Daily PapersReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningAug 4, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Google avança em IA privada com criptografia homomórfica
O Google afirma estar tornando a IA privada mais prática com o uso de criptografia homomórfica.
Google diz que está tornando a IA privada viável
Uma publicação do Google Security gerou discussão no Hacker News em meio a críticas mais amplas à IA.
Pesquisadores lançam LittleLearner para estudo controlado de LLMs
O modelo de 5 bilhões de parâmetros foi treinado em um corpus curricular de 88 bilhões de tokens com conteúdo até o 5º ano.