Zum Inhalt springen
News

Wann ein Agent aufhören soll — mit nachprüfbarer Garantie

Mehrrundige Agenten brechen heute nach Faustregel oder festem Rundenbudget ab. Ein Preprint verteilt stattdessen ein Fehlerbudget über die Runden und kann so früher stoppen, ohne die zugesicherte Trefferquote zu verlieren.

Agentenschleifen, die abwechselnd abrufen, schlussfolgern und handeln, werden mit jeder zusätzlichen Runde besser — und teurer. Die Entscheidung, wann genug ist, fällt in der Praxis über Faustregeln oder ein fest gesetztes Rundenbudget. Beides gibt keine Auskunft darüber, ob die richtige Antwort zum Abbruchzeitpunkt überhaupt noch im Spiel war. In Anwendungen mit hohem Einsatz schlägt der Fehler in beide Richtungen durch: Jede überflüssige Runde kostet Geld und Zeit, jeder zu frühe Abbruch riskiert eine falsche Entscheidung.

Die vorgestellte Arbeit greift dafür auf konforme Vorhersage zurück, ein Verfahren, das Ergebnismengen mit einer statistisch zugesicherten Trefferquote ausstattet. Bisherige Übertragungen auf Sprachmodelle betrachteten nur eine einzelne Ausgabe und passten deshalb nicht auf mehrrundige Abläufe mit variablem Abbruch. Das Verfahren MiCP verteilt das erlaubte Fehlerbudget über die einzelnen Runden und darf dadurch früher aussteigen, ohne die Zusage für den Gesamtlauf zu verletzen. Erprobt wurde es an adaptivem Abruf und an ReAct-artigen Agenten auf Frage-Antwort-Aufgaben mit einem und mit mehreren Zwischenschritten; nach eigener Messung sinken Rundenzahl, Kosten und Umfang der Ergebnismenge bei eingehaltener Zielquote. Zusätzlich schlägt die Gruppe eine Kennzahl vor, die Trefferquote und Antwortaufwand gemeinsam bewertet.

Einordnung

Der Ansatz lohnt die Aufmerksamkeit weniger wegen der Methode als wegen der Frage dahinter. Ein hart kodiertes Rundenlimit ist in fast jedem Agenten zu finden, und es steht dort meist ohne Begründung — hoch genug, dass es selten stört, niedrig genug, dass die Rechnung erträglich bleibt. Wer das Limit stattdessen als Fehlerbudget denkt, bekommt eine Größe, über die sich tatsächlich diskutieren lässt.

Die Hürde ist die Form des Ergebnisses. Konforme Vorhersage liefert eine Menge plausibler Antworten, keine einzelne — das passt zu abgrenzbaren Antwortkandidaten, nicht zu frei erzeugtem Text oder offenen Werkzeugketten. Für Klassifikation, Extraktion und geschlossene Fragen ist der Weg gangbar, für einen Coding-Agenten vorerst nicht. Hinzu kommt: Preprint, Zahlen aus eigener Auswertung, kein veröffentlichter Code.

Quellen

Passt in die KI-Landkarte

Die Zusammenhänge hinter dieser Meldung stehen ausführlich im Kapitel Agenten.

Zu Agenten
  • agenten
  • rag
  • inferenz
Alle News