Pesquisadores propõem Skill Entropy para avaliar raciocínio em LLMs
Skill^2-Bench testa como modelos alternam entre habilidades em tarefas de longo horizonte.
Por que importa
O trabalho mira uma lacuna na avaliação de raciocínio de longo horizonte: se os modelos conseguem combinar de forma confiável diferentes habilidades em cadeias dependentes. Ele sugere que a alternância de habilidades é uma fraqueza mensurável mesmo em modelos fortes atuais.
Pontos-chave
- 1.Skill Entropy mede a dificuldade de alternar entre habilidades de raciocínio.
- 2.Skill^2-Bench cobre 558 habilidades em nove domínios.
- 3.Os modelos avaliados perderam precisão em tarefas de maior entropia.
Um novo artigo apresenta Skill Entropy, uma medida para avaliar a dificuldade de alternar entre habilidades de raciocínio em tarefas de LLM com várias etapas. Os autores também propõem o Skill^2-Bench, um benchmark que abrange 558 habilidades em nove domínios verificáveis e abertos, e relatam que oito modelos de fronteira e quatro modelos open-source perdem precisão em tarefas de maior entropia. O artigo ainda propõe o Skill-Entropy RL, que usa a entropia de habilidades como sinal de treinamento.
⚡ Experimente hoje
Use o Skill^2-Bench para testar sob estresse agentes ou sistemas de raciocínio que precisam combinar várias habilidades ao longo de etapas dependentes.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.CLToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 6, 12:00 PM↗
- arXiv cs.LGToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 6, 12:00 PM↗
- HF Daily PapersToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 5, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
InternLM propõe a arquitetura de modelo Mobius
O artigo no arXiv separa memória e raciocínio para melhorar a compressão e a eficiência na inferência.
Ferramentas e práticas de IA para desenvolvedores geram debate no Hacker News
Posts sobre MathCode, hábitos de programação com IA, Cloudflare e o HEIR do Google puxaram a discussão.
Google avança em IA privada com criptografia homomórfica
O Google afirma estar tornando a IA privada mais prática com o uso de criptografia homomórfica.