Novos artigos miram os limites de exploração dos LLMs
DORA, 3PO e RISE-RL propõem formas de melhorar a exploração em agentes e no treinamento com RL.
Por que importa
Os artigos apontam para uma limitação comum em métodos de exploração no nível de tokens, como o ajuste de temperatura: eles podem não produzir diversidade útil no nível de sequência. Uma exploração melhor poderia aprimorar agentes de LLM, treinamento de raciocínio e fluxos de alinhamento abertos sem depender apenas de mudanças no prompt ou de recompensas escalares.
Pontos-chave
- 1.DORA melhora a exploração em nível de sequência sem treinamento.
- 2.3PO amostra políticas para diversificar rollouts de RLVR.
- 3.RISE-RL mira critérios de rubrica repetidamente não atendidos.
Vários artigos no arXiv descrevem novos métodos para melhorar a exploração em grandes modelos de linguagem. O DORA Explorer é um algoritmo sem treinamento, usado em tempo de inferência, que gera múltiplas ações candidatas, pontua essas opções com estatísticas de log-probabilidade em nível de sequência e faz amostragem com um parâmetro ajustável de exploração. O 3PO explora no espaço de parâmetros para RLVR ao amostrar diferentes políticas a partir de uma distribuição posterior, enquanto o RISE-RL usa critérios de rubrica repetidamente não atendidos para orientar a exploração seletiva em RL aberto.
⚡ Experimente hoje
Leia os artigos sobre DORA e 3PO antes de depender apenas da temperatura para exploração em agentes ou rollouts de RL.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIRISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement LearningAug 11, 12:00 PM↗
- arXiv cs.LGParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- HF Daily PapersParameter Exploration for RLVR via Variational LearningAug 10, 8:28 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.
InternLM propõe a arquitetura de modelo Mobius
O artigo no arXiv separa memória e raciocínio para melhorar a compressão e a eficiência na inferência.