AAI News Hub
ToolsThu, August 6, 2026·6d ago3 sources corroborating

Prime Agent startet, während Coding-Agents längeren Tests ausgesetzt werden

Prime Intellect hat einen Open-Source-Agenten veröffentlicht, während LoopsBench auf die Bewertung langfristiger Coding-Aufgaben zielt.

Warum es wichtig ist

Die Berichte deuten auf eine Verschiebung weg von Single-Shot-Coding-Benchmarks hin zu Bewertungen nachhaltiger Agent-Ausführung. Offene Harnesses und Long-Horizon-Benchmarks könnten die Leistung von Coding-Agents über reine Endergebnisse hinaus leichter überprüfbar machen.

Die Kernpunkte

  • 1.Prime Agent wird als Open Source mit offener Lizenz beschrieben.
  • 2.LoopsBench testet langfristige Coding-Arbeit über 112 Aufgaben hinweg.
  • 3.Das beste gemeldete LoopsBench-Setup löste 25,00 % der Aufgaben.

Prime Intellect hat Prime Agent veröffentlicht, einen Open-Source-Agenten für Coding und Recherche, der auf lang laufende autonome Arbeit ausgelegt ist. Das geht aus einem Reddit-Beitrag hervor, der auf GitHub und den Blog des Unternehmens verweist. Dem Beitrag zufolge nutzt Prime Agent programmatische Tool-Aufrufe, Kontext als Variable, Multi-Agent-Messaging und einen selbst veränderbaren Harness-Zustand; zudem wird ein ARC-AGI-3-Score von 95,5 % gemeldet. Separat stellte ein arXiv-Paper LoopsBench vor, einen Long-Horizon-Benchmark mit 112 Aufgaben in acht Programmiersprachen und neun Domänen. Das stärkste evaluierte Setup, Opus-4.7 mit Claude Code und äußerer Fortsetzung, löste 25,00 % der Aufgaben.

Heute ausprobieren

Prüfen Sie den Code von Prime Agent und LoopsBench, bevor Sie sich bei lang laufender Entwicklungsarbeit auf Benchmark-Behauptungen zu Coding-Agents verlassen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Tools & Open Source