AAI News Hub
PesquisaWed, August 5, 2026·Aug 52 sources corroborating

Pesquisadores propõem DASH para reduzir o excesso de raciocínio

O método de crédito em nível de segmento usa compromissos intermediários de resposta para orientar o treinamento de modelos de raciocínio.

Por que importa

O trabalho mira uma ineficiência prática dos modelos de raciocínio: cadeias mais longas podem aumentar custos sem melhorar a acurácia. A atribuição de crédito em nível de segmento pode ajudar métodos de treinamento a recompensar reflexões úteis e desencorajar ciclos improdutivos de raciocínio.

Pontos-chave

  • 1.O DASH atribui crédito no nível dos segmentos de raciocínio.
  • 2.O método usa compromissos intermediários de resposta como sinal aproximado.
  • 3.Ele relata acurácia média de 59,45% em benchmarks de matemática de nível competitivo.

Um artigo no arXiv apresenta o DASH, sigla para Drift Aware advantage SHaping, um método de atribuição de crédito em nível de segmento para modelos de linguagem voltados a raciocínio. Segundo os autores, modelos de raciocínio muitas vezes pensam demais por meio de ressalvas, abordagens abandonadas e autocontradições, consumindo tokens sem melhorar as respostas. O DASH usa compromissos intermediários de resposta como uma aproximação de baixo custo para avaliar se reflexões posteriores avançam em direção à resposta correta ou se afastam dela, e relata acurácia média de 59,45% em benchmarks de matemática de nível competitivo, ante 58,1% do Dr.GRPO e 56,95% do GRPO em cenários nos quais o excesso de raciocínio é comum.

Experimente hoje

Leia o artigo antes de ajustar objetivos de RL para modelos de raciocínio que recompensam longas cadeias de pensamento.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa