26. September 2026·4 Min. Lesezeit·AIgentic.media

Nvidias SoL-Pi senkt Token-Verbrauch von KI-Agenten um fast die Hälfte

nvidiaai-agentstoolingefficiency
Nvidias SoL-Pi senkt Token-Verbrauch von KI-Agenten um fast die Hälfte

Jeder teure KI-Agent ist eine Verhandlung zwischen zwei Systemen: einem leistungsstarken Sprachmodell, das frei denken will, und einer Harness, die ihm sagt, welche Werkzeuge es verwenden darf, welcher Kontext wichtig ist und wann es aufhören soll zu denken.

Ein neues Papier von Nvidia-Forschern legt nahe, dass der schnellste Weg zu günstigeren KI-Agenten gar nicht in einem besseren Modell liegt. Sondern in einer besseren Harness. Und der beste Weg, diese Harness zu bauen, so die Forscher, ist es, eine KI damit zu beauftragen.

Das System namens SoL-Pi beobachtet die Ausführungsabläufe eines anderen Agenten, schlägt Änderungen an der Harness vor, die das Modell mit seinen Werkzeugen verbindet, und testet diese Änderungen automatisch. In mehr als 3.000 Durchläufen und 60.000 Agent-Umgebungs-Interaktionen senkte der Ansatz den Token-Verbrauch um bis zu 49 Prozent und behielt dabei 93,7 Prozent der ursprünglichen Harness-Leistung.

Das unsichtbare Kostenproblem

Je länger KI-Agenten unbeaufsichtigt arbeiten, desto teurer werden sie. Eine einzelne Vorhersage, die einen Bruchteil eines Cents kostet, verwandelt sich in lange Ketten aus Überlegungen, Werkzeugaufrufen und Rückkopplungsschleifen. Der Token-Verbrauch bläht sich dabei auf.

Die meisten Effizienzforschungen konzentrierten sich auf das Modell selbst: schnellere Attention-Kerne, Modellkompression durch Quantisierung und der Wechsel zu günstigeren Modellen. Die Harness, die zwischen dem Modell und der Umgebung sitzt, hat weit weniger Aufmerksamkeit erhalten.

Dieses Versäumnis könnte teuer sein. Die Harness steuert, wie ein Agent Zustände liest, Aktionen ausführt und Rückmeldungen verarbeitet. Werkzeugaufrufe geben lange Ausgaben zurueck. Kontext häuft sich bei jedem Planungsschritt an. Fehlerprotokolle werden wiederholt durch teure Modelle geschickt. Diese Kosten multiplizieren sich bei jeder Aufgabe.

Die manuelle Optimierung der Harness ist schwierig, weil Werkzeugnutzung, Kontextverwaltung, Verifikation und Abbruchlogik eng miteinander verbunden sind. Eine Änderung, die an einer Stelle Tokens spart, kann an anderer Stelle Fehler auslösen oder Kosten in eine spätere Phase verschieben.

Rekursive Optimierung

SoL-Pi automatisiert diese Arbeit. Ein Forschungsagent beobachtet die Abläufe eines anderen Agenten, schlägt Änderungen an der Harness vor und testet sie in vorbereiteten Umgebungen. Fähigkeitsprüfungen bestimmen, welche Kandidaten ueberleben. Effizienzmessungen prüfen, ob der Token-Verbrauch tatsächlich gesunken ist.

Dies ist eine Form der rekursiven Selbstverbesserung: Ein KI-System optimiert die Infrastruktur, auf der ein KI-System läuft.

In 535 ausführbaren Umgebungen erkundete SoL-Pi 152 verschiedene Richtungen. Es generierte 495 Aufgaben aus GitHub-Issue-Pull-Request-Paaren und 40 synthetische Testfälle. Insgesamt liefen mehr als 3.000 Agentensitzungen und über 60.000 Agent-Umgebungs-Interaktionen.

Die Forscher achteten darauf, eine häufige Forschungspitfalle zu vermeiden: die Kontamination der Evaluierungsdaten mit den Suchdaten. Sie verwendeten einen zurueckgehaltenen Satz von 11 EdgeBench-Aufgaben für die einmalige Validierung fertiger Kandidaten und reservierten die restlichen 40 für die endgültige Evaluierung. Ein automatischer Verifikationsschritt fängt Fälle ab, in denen eine günstigere Harness falsche Ergebnisse liefert.

Vier Mechanismen sparen Tokens

Die Suche brachte vier verschiedene Mechanismen hervor, die jeweils auf eine andere Quelle von Token-Verschwendung abzielen.

Action Fusion fasst zwei aufeinanderfolgende Schritte zu einem zusammen. Eine Code-Bearbeitung gefolgt von einem Testlauf wird beispielsweise zu einer einzigen Aktion. Dies eliminiert einen gesamten Sprachmodell-Aufruf.

Online Context Compact kürzt nach jedem Planungsschritt den angesammelten Kontext, wann immer dies ohne Informationsverlust für nachfolgende Schritte möglich ist.

ObservationPack archiviert lange Werkzeugausgaben und fügt in späteren Schritten eine kurze Zusammenfassung ein, anstatt jedes Mal den vollständigen Text erneut zu senden.

Evidence-Preserving Reducer leitet große Fehler- und Testprotokolle an ein günstigeres Modell weiter, das sie auf die wichtigsten Erkenntnisse reduziert. Ein automatischer Verifikationsschritt fängt verlorene Informationen auf.

Die effizienteste Konfiguration kombiniert alle vier Mechanismen und erreicht die 49-prozentige Reduktion bei 93,7 Prozent der ursprünglichen Harness-Leistung.

Lokal ausführbar

Der SoL-Pi-Ansatz ist nicht an ein bestimmtes Modell oder einen bestimmten Benchmark gebunden. Die Methode des Papiers zur Trennung von Suche und Evaluierung sowie die vier entdeckten Mechanismen sind auf jeden codierenden Agenten anwendbar, der eine Harness-Ebene verwendet.

Quellen

Mehr erfahren?

Lassen Sie uns besprechen, wie KI Ihr Business transformieren kann.

Entdecken KI-Agenten