Pesquisadores propõem DASH para reduzir o excesso de raciocínio
O método de crédito em nível de segmento usa compromissos intermediários de resposta para orientar o treinamento de modelos de raciocínio.
Por que importa
O trabalho mira uma ineficiência prática dos modelos de raciocínio: cadeias mais longas podem aumentar custos sem melhorar a acurácia. A atribuição de crédito em nível de segmento pode ajudar métodos de treinamento a recompensar reflexões úteis e desencorajar ciclos improdutivos de raciocínio.
Pontos-chave
- 1.O DASH atribui crédito no nível dos segmentos de raciocínio.
- 2.O método usa compromissos intermediários de resposta como sinal aproximado.
- 3.Ele relata acurácia média de 59,45% em benchmarks de matemática de nível competitivo.
Um artigo no arXiv apresenta o DASH, sigla para Drift Aware advantage SHaping, um método de atribuição de crédito em nível de segmento para modelos de linguagem voltados a raciocínio. Segundo os autores, modelos de raciocínio muitas vezes pensam demais por meio de ressalvas, abordagens abandonadas e autocontradições, consumindo tokens sem melhorar as respostas. O DASH usa compromissos intermediários de resposta como uma aproximação de baixo custo para avaliar se reflexões posteriores avançam em direção à resposta correta ou se afastam dela, e relata acurácia média de 59,45% em benchmarks de matemática de nível competitivo, ante 58,1% do Dr.GRPO e 56,95% do GRPO em cenários nos quais o excesso de raciocínio é comum.
⚡ Experimente hoje
Leia o artigo antes de ajustar objetivos de RL para modelos de raciocínio que recompensam longas cadeias de pensamento.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Google DeepMind apresenta modelo de tradução de língua de sinais para texto
O SL2T da DeepMind impulsiona novos recursos de língua de sinais para pessoas surdas e com deficiência auditiva.
Equipe MiLMMT lança modelos de tradução sem referência
O MiLMMT-46-v1.0 usa GRPO e interpolação de checkpoints para aprimorar a tradução multilíngue aberta.
DistilVDR comprime a recuperação visual de documentos
O recuperador de 524 milhões de parâmetros usa destilação bilateral a partir de um professor visão-linguagem de 8B.