AAI News Hub
ForschungThu, August 13, 2026·3d ago2 sources corroborating

Forschende testen KI-gebaute Harnesses für schwächere Modelle

Ein stärkeres Modell baute Inferenzzeit-Gerüste, die die Ergebnisse schwächerer Modelle in Theory-of-Mind-Benchmarks verbesserten.

Warum es wichtig ist

Die Ergebnisse deuten darauf hin, dass ein Teil des Fähigkeitstransfers durch Scaffolding zur Inferenzzeit erfolgen kann, nicht nur durch Destillation während des Trainings. Das könnte den Fokus beim Einsatz kleinerer Modelle stärker auf Harness-Design, Routing und Evaluationsprotokolle verschieben.

Die Kernpunkte

  • 1.Testzeit-Harnesses verbesserten die Ergebnisse schwächerer Modelle von 0,49 auf 0,91.
  • 2.Die Zugewinne kamen vor allem durch Code, Routing und Durchsetzung des Antwortformats zustande.
  • 3.Die Studie nutzte vier Theory-of-Mind-Benchmarks.

Eine neue Studie untersucht, ob ein stärkeres „Builder“-Modell ein schwächeres Modell zur Testzeit verbessern kann, indem es Inferenzzeit-Harnesses konstruiert, ohne die Parameter des schwächeren Modells zu verändern. Bei vier Theory-of-Mind-Benchmarks nutzten die Builder 5 % der Daten zur Validierung, um die Harnesses zu verfeinern, und evaluierten sie anschließend auf dem gesamten Testsatz. Der Ansatz verdoppelte die durchschnittliche Leistung der Zielmodelle nahezu von 0,49 auf 0,91; die Zugewinne werden vor allem deterministischem Code, benchmarkspezifischem Routing und strikter Antwortformatierung zugeschrieben.

Heute ausprobieren

Bevor ein schwächeres Modell feinabgestimmt wird, sollte geprüft werden, ob ein stärkeres Modell ein aufgabenspezifisches Inferenz-Harness entwerfen kann.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung