Pesquisadores lançam LittleLearner para estudo controlado de LLMs
O modelo de 5 bilhões de parâmetros foi treinado em um corpus curricular de 88 bilhões de tokens com conteúdo até o 5º ano.
Por que importa
O trabalho oferece um ambiente controlado para investigar se os comportamentos de LLMs vêm de conhecimento aprendido ou de técnicas posteriores de elicitação. Os resultados sugerem que os limites dos dados de pré-treinamento podem impor um teto efetivo às capacidades, que o pós-treinamento sozinho talvez não consiga superar.
Pontos-chave
- 1.O LITTLECURRICULUM contém 88 bilhões de tokens de material até o 5º ano.
- 2.O LITTLELEARNER é um modelo de 5 bilhões de parâmetros treinado do zero.
- 3.Pós-treinamento e prompting melhoraram o uso de conhecimento existente, não capacidades fora do escopo.
Pesquisadores apresentaram o LITTLECURRICULUM, um corpus de pré-treinamento com 88 bilhões de tokens, adaptado a materiais do ensino fundamental dos EUA e sem conceitos, fatos ou vocabulário acima do 5º ano. Eles treinaram do zero um modelo de linguagem de 5 bilhões de parâmetros, o LITTLELEARNER, usando esse corpus, e disponibilizaram ambos como um ambiente de testes para estudar a aquisição de conhecimento por modelos dentro de um escopo de treinamento definido. Experimentos iniciais indicaram que escalonamento, SFT combinado com pós-treinamento via GRPO e aprendizagem em contexto ajudaram o modelo a usar conhecimento existente, mas não melhoraram de forma significativa capacidades fora do escopo.
⚡ Experimente hoje
Use LITTLECURRICULUM e LITTLELEARNER para testar métodos de injeção de conhecimento antes de presumir que o pós-treinamento pode acrescentar capacidades fora do escopo.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Startup diz que dados são essenciais para avanços da IA contra o câncer
Segundo o TechCrunch, a startup afirma que a IA ainda não está perto de curar o câncer sem dados melhores.
HarnessRisk mede falhas de segurança em harnesses de agentes
O benchmark testa ataques em diferentes fases de harnesses de agentes, enquanto trabalhos relacionados analisam provisionamento específico por tarefa.
Agent Lightning v1.0 mira RL agêntico com harness
O framework conecta harnesses arbitrários de agentes ao pós-treinamento por aprendizado por reforço.