AAI News Hub
PesquisaTue, August 4, 2026·Aug 42 sources corroborating

ReflectRL treina modelos de raciocínio com trajetórias malsucedidas de especialistas

O artigo no arXiv propõe usar rollouts falhos de especialistas como alvos de reflexão durante o treinamento on-policy.

Por que importa

O trabalho mira um gargalo no pós-treinamento de modelos de raciocínio: trajetórias de especialistas se tornam menos úteis quando o especialista falha em problemas difíceis. Se validada, a abordagem pode transformar rollouts malsucedidos em um sinal de treinamento utilizável, em vez de dados descartados.

Pontos-chave

  • 1.O ReflectRL aprende com trajetórias de raciocínio malsucedidas de especialistas.
  • 2.O método converte o comportamento de reflexão de volta em raciocínio direto.
  • 3.As avaliações abrangem 9 benchmarks e 4 backbones de LLMs.

Pesquisadores apresentaram o ReflectRL, um framework leve e plug-and-play para melhorar o raciocínio de grandes modelos de linguagem durante o treinamento on-policy. O método usa “Golden Negative Trajectories”, saídas malsucedidas de modelos especialistas mais fortes, não como demonstrações a serem imitadas, mas como caminhos de raciocínio falhos sobre os quais o modelo deve refletir antes de transferir esse comportamento de volta para o raciocínio direto. Uma entrada no Hugging Face Daily Papers afirma que os autores avaliaram a abordagem em 9 benchmarks, 4 backbones de LLMs e 4 configurações on-policy.

Experimente hoje

Leia o artigo sobre o ReflectRL antes de descartar rollouts malsucedidos de especialistas em pipelines de pós-treinamento de modelos de raciocínio.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa