AAI News Hub
PesquisaWed, August 5, 2026·Aug 52 sources corroborating

Pesquisadores propõem Skill Entropy para avaliar raciocínio em LLMs

Skill^2-Bench testa como modelos alternam entre habilidades em tarefas de longo horizonte.

Por que importa

O trabalho mira uma lacuna na avaliação de raciocínio de longo horizonte: se os modelos conseguem combinar de forma confiável diferentes habilidades em cadeias dependentes. Ele sugere que a alternância de habilidades é uma fraqueza mensurável mesmo em modelos fortes atuais.

Pontos-chave

  • 1.Skill Entropy mede a dificuldade de alternar entre habilidades de raciocínio.
  • 2.Skill^2-Bench cobre 558 habilidades em nove domínios.
  • 3.Os modelos avaliados perderam precisão em tarefas de maior entropia.

Um novo artigo apresenta Skill Entropy, uma medida para avaliar a dificuldade de alternar entre habilidades de raciocínio em tarefas de LLM com várias etapas. Os autores também propõem o Skill^2-Bench, um benchmark que abrange 558 habilidades em nove domínios verificáveis e abertos, e relatam que oito modelos de fronteira e quatro modelos open-source perdem precisão em tarefas de maior entropia. O artigo ainda propõe o Skill-Entropy RL, que usa a entropia de habilidades como sinal de treinamento.

Experimente hoje

Use o Skill^2-Bench para testar sob estresse agentes ou sistemas de raciocínio que precisam combinar várias habilidades ao longo de etapas dependentes.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa