Forschende testen KI-gebaute Harnesses für schwächere Modelle
Ein stärkeres Modell baute Inferenzzeit-Gerüste, die die Ergebnisse schwächerer Modelle in Theory-of-Mind-Benchmarks verbesserten.
Warum es wichtig ist
Die Ergebnisse deuten darauf hin, dass ein Teil des Fähigkeitstransfers durch Scaffolding zur Inferenzzeit erfolgen kann, nicht nur durch Destillation während des Trainings. Das könnte den Fokus beim Einsatz kleinerer Modelle stärker auf Harness-Design, Routing und Evaluationsprotokolle verschieben.
Die Kernpunkte
- 1.Testzeit-Harnesses verbesserten die Ergebnisse schwächerer Modelle von 0,49 auf 0,91.
- 2.Die Zugewinne kamen vor allem durch Code, Routing und Durchsetzung des Antwortformats zustande.
- 3.Die Studie nutzte vier Theory-of-Mind-Benchmarks.
Eine neue Studie untersucht, ob ein stärkeres „Builder“-Modell ein schwächeres Modell zur Testzeit verbessern kann, indem es Inferenzzeit-Harnesses konstruiert, ohne die Parameter des schwächeren Modells zu verändern. Bei vier Theory-of-Mind-Benchmarks nutzten die Builder 5 % der Daten zur Validierung, um die Harnesses zu verfeinern, und evaluierten sie anschließend auf dem gesamten Testsatz. Der Ansatz verdoppelte die durchschnittliche Leistung der Zielmodelle nahezu von 0,49 auf 0,91; die Zugewinne werden vor allem deterministischem Code, benchmarkspezifischem Routing und strikter Antwortformatierung zugeschrieben.
⚡ Heute ausprobieren
Bevor ein schwächeres Modell feinabgestimmt wird, sollte geprüft werden, ob ein stärkeres Modell ein aufgabenspezifisches Inferenz-Harness entwerfen kann.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.LGAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.LGTowards Understanding On-Policy Distillation through the Lens of Test-Time ScalingAug 13, 12:00 PM↗
- arXiv cs.CLAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.CLTowards Understanding On-Policy Distillation through the Lens of Test-Time ScalingAug 13, 12:00 PM↗
- HF Daily PapersAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 12, 4:00 AM↗
- arXiv cs.AIProxy OPD: On-Policy Distillation with Transferable Relative Proxy UpdateAug 11, 12:00 PM↗
- arXiv cs.AIWDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-TrainingAug 11, 12:00 PM↗
- arXiv cs.LGProxy OPD: On-Policy Distillation with Transferable Relative Proxy UpdateAug 11, 12:00 PM↗
- arXiv cs.LGWDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-TrainingAug 11, 12:00 PM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Google treibt private KI mit homomorpher Verschlüsselung voran
Google will private KI mithilfe homomorpher Verschlüsselung praxistauglicher machen.
Google will private KI praxistauglich machen
Ein Beitrag im Google Security Blog sorgte auf Hacker News für Diskussionen, flankiert von breiterer Kritik an KI.
Forscher veröffentlichen LittleLearner für kontrollierte LLM-Studien
Das Modell mit 5 Milliarden Parametern wird auf einem Curriculum-Korpus mit 88 Milliarden Tokens trainiert, der Stoff bis einschließlich fünfter Klasse umfasst.