研究者ら、弱いモデル向けにAIが構築したハーネスを検証
より強力なモデルが推論時の足場を構築し、Theory-of-Mindベンチマークで弱いモデルのスコアを引き上げた。
なぜ重要か
結果は、能力の一部が学習時の蒸留だけでなく、推論時の足場作りを通じても移転し得ることを示している。これにより、小規模モデルの導入では、ハーネス設計、ルーティング、評価プロトコルへの注目が高まる可能性がある。
要点
- 1.テスト時ハーネスにより、弱いモデルのスコアは0.49から0.91へ向上した。
- 2.向上の主因はコード、ルーティング、回答フォーマットの強制だった。
- 3.研究では4つのTheory-of-Mindベンチマークが使われた。
新たな論文は、弱いモデルのパラメータを変更せずに、より強力な「ビルダー」モデルが推論時ハーネスを構築することで、テスト時に弱いモデルの性能を高められるかを検証している。4つのTheory-of-Mindベンチマークで、ビルダーはデータの5%を検証用として使いハーネスを改良したうえで、全テストセットで評価した。この手法により、対象モデルの平均性能は0.49から0.91へほぼ倍増し、主な向上要因は決定論的なコード、ベンチマーク別のルーティング、厳格な回答フォーマットにあるとされた。
⚡ 今日から使える
弱いモデルをファインチューニングする前に、より強力なモデルがタスク特化型の推論ハーネスを設計できるかを試すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.LGAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.LGTowards Understanding On-Policy Distillation through the Lens of Test-Time ScalingAug 13, 12:00 PM↗
- arXiv cs.CLAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.CLTowards Understanding On-Policy Distillation through the Lens of Test-Time ScalingAug 13, 12:00 PM↗
- HF Daily PapersAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 12, 4:00 AM↗
- arXiv cs.AIProxy OPD: On-Policy Distillation with Transferable Relative Proxy UpdateAug 11, 12:00 PM↗
- arXiv cs.AIWDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-TrainingAug 11, 12:00 PM↗
- arXiv cs.LGProxy OPD: On-Policy Distillation with Transferable Relative Proxy UpdateAug 11, 12:00 PM↗
- arXiv cs.LGWDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-TrainingAug 11, 12:00 PM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
Google、準同型暗号でプライベートAIを前進
Googleは、準同型暗号を活用してプライベートAIをより実用的にしようとしていると説明している。
Hacker News+8 outlets·14h ago
研究
Google、プライベートAIの実用化を進めていると説明
Google Securityの投稿がHacker Newsで議論を呼び、AI全般への批判とも並んだ。
Hacker News+5 outlets·14h ago
研究
研究者ら、LLMを制御下で研究するためのLittleLearnerを公開
50億パラメータのモデルは、小学5年生以下のカリキュラムに基づく880億トークンのコーパスで訓練された。
r/LocalLLaMA+1 outlet·19h ago