Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.
Por que importa
Os resultados sugerem que alguma transferência de capacidade pode ocorrer por meio de scaffolding em tempo de inferência, e não apenas por destilação durante o treinamento. Isso pode deslocar a atenção para o design de harnesses, roteamento e protocolos de avaliação na implantação de modelos menores.
Pontos-chave
- 1.Harnesses em tempo de teste melhoraram as pontuações de modelos mais fracos de 0,49 para 0,91.
- 2.Os ganhos vieram principalmente de código, roteamento e imposição do formato das respostas.
- 3.O estudo usou quatro benchmarks de Theory-of-Mind.
Um novo artigo investiga se um modelo “construtor” mais forte consegue melhorar o desempenho de um modelo mais fraco em tempo de teste ao criar harnesses de inferência, sem alterar os parâmetros do modelo mais fraco. Em quatro benchmarks de Theory-of-Mind, os construtores usaram 5% dos dados como validação para refinar os harnesses e depois os avaliaram no conjunto de teste completo. A abordagem quase dobrou o desempenho médio do modelo-alvo, de 0,49 para 0,91, com os ganhos atribuídos principalmente a código determinístico, roteamento específico para cada benchmark e formatação rigorosa das respostas.
⚡ Experimente hoje
Antes de ajustar finamente um modelo mais fraco, teste se um modelo mais forte consegue projetar um harness de inferência específico para a tarefa.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.LGAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.LGTowards Understanding On-Policy Distillation through the Lens of Test-Time ScalingAug 13, 12:00 PM↗
- arXiv cs.CLAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.CLTowards Understanding On-Policy Distillation through the Lens of Test-Time ScalingAug 13, 12:00 PM↗
- HF Daily PapersAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 12, 4:00 AM↗
- arXiv cs.AIProxy OPD: On-Policy Distillation with Transferable Relative Proxy UpdateAug 11, 12:00 PM↗
- arXiv cs.AIWDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-TrainingAug 11, 12:00 PM↗
- arXiv cs.LGProxy OPD: On-Policy Distillation with Transferable Relative Proxy UpdateAug 11, 12:00 PM↗
- arXiv cs.LGWDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-TrainingAug 11, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Google avança em IA privada com criptografia homomórfica
O Google afirma estar tornando a IA privada mais prática com o uso de criptografia homomórfica.
Google diz que está tornando a IA privada viável
Uma publicação do Google Security gerou discussão no Hacker News em meio a críticas mais amplas à IA.
Posts sobre privacidade e responsabilidade em AI geram debate no Hacker News
Seis threads do Hacker News abordam AI privada, revenda de tokens, críticas à AI e ferramentas práticas.