AAI News Hub
PesquisaThu, August 13, 2026·5d ago2 sources corroborating

Novos artigos miram os limites de exploração dos LLMs

DORA, 3PO e RISE-RL propõem formas de melhorar a exploração em agentes e no treinamento com RL.

Por que importa

Os artigos apontam para uma limitação comum em métodos de exploração no nível de tokens, como o ajuste de temperatura: eles podem não produzir diversidade útil no nível de sequência. Uma exploração melhor poderia aprimorar agentes de LLM, treinamento de raciocínio e fluxos de alinhamento abertos sem depender apenas de mudanças no prompt ou de recompensas escalares.

Pontos-chave

  • 1.DORA melhora a exploração em nível de sequência sem treinamento.
  • 2.3PO amostra políticas para diversificar rollouts de RLVR.
  • 3.RISE-RL mira critérios de rubrica repetidamente não atendidos.

Vários artigos no arXiv descrevem novos métodos para melhorar a exploração em grandes modelos de linguagem. O DORA Explorer é um algoritmo sem treinamento, usado em tempo de inferência, que gera múltiplas ações candidatas, pontua essas opções com estatísticas de log-probabilidade em nível de sequência e faz amostragem com um parâmetro ajustável de exploração. O 3PO explora no espaço de parâmetros para RLVR ao amostrar diferentes políticas a partir de uma distribuição posterior, enquanto o RISE-RL usa critérios de rubrica repetidamente não atendidos para orientar a exploração seletiva em RL aberto.

Experimente hoje

Leia os artigos sobre DORA e 3PO antes de depender apenas da temperatura para exploração em agentes ou rollouts de RL.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa