Zum Inhalt springen

industry · product

So bleibt ein KI-Agent nach dem Livegang genau

Eine begutachtete Studie fand bei 91% der 128 getesteten Modell-Datensatz-Paarungen einen Qualitätsverlust im Zeitverlauf. An Ihrem Setup muss sich nichts ändern, damit ein Live-Agent schlechter wird. Hier ist die Wartungsroutine, die das aufdeckt.

Entagl Team11 Min. Lesezeit
So bleibt ein KI-Agent nach dem Livegang genau

Die Wartung von KI-Agenten ist keine Aufräumarbeit. Sie ist die eigentliche Arbeit. Ein Agent, der zum Start jeden Test bestanden hat, kann im Produktivbetrieb messbar schlechter werden, ohne dass jemand einen Prompt, eine Schutzregel oder eine Zeile Code anfasst. Eine begutachtete Studie in Scientific Reports von Nature kombinierte vier Machine-Learning-Modelle mit 32 realen Datensätzen aus dem Gesundheitsbetrieb, dem Finanzwesen, dem Verkehr und der Wettervorhersage und verfolgte dann, wie sich jede Paarung hielt, je mehr Zeit seit ihrem letzten Training verging. In 91% der 128 Paarungen ging die Qualität zurück, ein Muster, das die Autoren AI aging nannten. Die Lösung ist kein besseres Modell. Es ist eine Prüfroutine, für die jemand verantwortlich ist.

Wir haben schon darüber geschrieben, wie ein Agent in vier Stufen sicher live geht. Hier geht es um den Teil danach, der weit weniger Aufmerksamkeit bekommt und mehr stillen Schaden anrichtet: was Sie in Woche sechs tun, und in Woche zwanzig.

Warum wird ein KI-Agent nach dem Start schlechter?

Vier Dinge lassen nach, und sie lassen unabhängig voneinander nach. Die meisten Teams beobachten nur eines davon.

Was nachlässt Wie es aussieht Wie Sie es bemerken
Das Verhalten des Modells Gleiche Frage, gleicher Prompt, eine schlechtere Antwort, die genauso selbstsicher klingt wie die richtige Ein festes Testset nach Zeitplan erneut laufen lassen und die Ergebnisse vergleichen
Ihr Wissen Der Agent zitiert korrekt eine Richtlinie, einen Preis oder eine Öffnungszeit, die Sie letzten Monat geändert haben Wissenseinträge mit Datum versehen, in festem Turnus prüfen
Ihr Geschäft Neue Leistung, neuer Standort, saisonale Öffnungszeiten, eine ausgelaufene Aktion Wissensaktualisierungen an die betriebliche Änderung koppeln, die sie ausgelöst hat
Der Aufgabenumfang Der Agent soll längere, verwickeltere Aufgaben erledigen, als für ihn vorgesehen war Übergabequote und die eingehenden Aufgabentypen beobachten

Die erste Zeile überrascht viele. Anwar Alis Kolumne in HousingWire nennt das Verhaltensdrift und trennt es von der Datendrift, von der die meisten Teams schon gehört haben. Verhaltensdrift ist die schwerer zu fassende der beiden, denn einer schlechteren Antwort sieht man nichts an.

Wie sieht Drift in einem echten Einsatz aus?

Anwar Ali, SVP und Head of Product Management bei BSI Financial Services, hat im September 2026 genau davon berichtet. Sein Team betrieb einen Sprach- und Chat-Agenten, der Fragen von Kreditnehmern anhand echter Kontodaten beantwortete, abgesichert durch Compliance-Regeln, an denen sie lange gefeilt hatten. Es funktionierte. Die Containment-Quote, also der Anteil der Kundinnen und Kunden, deren Anliegen ohne menschlichen Kontakt gelöst wurde, lag monatelang über dem Branchenschnitt.

Dann fiel sie um rund acht Punkte. Wochenlang bemerkte das niemand.

Die Untersuchung entlastete die Schutzregeln, den Gesprächsablauf und verändertes Kundenverhalten. Die Ursache war das Modell selbst, ein etabliertes Modell eines führenden Labors, das still und leise schlechtere Antworten auf dieselben Fragetypen lieferte. Sein Fazit lohnt sich zu übernehmen: Es war ein Messversagen, kein Technikversagen. Containment wurde wöchentlich geprüft, und ein wöchentlicher Spätindikator kann einen langsamen Abstieg erst zeigen, wenn schon viele Kundinnen und Kunden ihn durchlaufen haben.

Welche Zahlen sollten Sie beobachten, und wie oft?

Wählen Sie einen kleinen Satz, legen Sie für jede Kennzahl einen Turnus fest, und machen Sie den Turnus kürzer als das Schadensfenster. Eine monatlich geprüfte Kennzahl beschert Ihnen erst einen schlechten Monat und dann ein Signal. Das sind Betriebskennzahlen und keine Renditekennzahlen; zur finanziellen Seite siehe wie Sie den ROI von KI messen, wenn die meisten Projekte keinen zeigen.

Kennzahl Turnus Was eine schlechte Entwicklung bedeutet
Übergabequote an einen Menschen Täglich Der Agent lehnt häufiger ab oder scheitert öfter, oder die Fragen haben sich geändert
Zeit bis zur ersten Antwort Täglich Ein Zustell- oder Warteschlangenproblem, kein Qualitätsproblem
Lösung ohne Übergabe Täglich Der klassische Driftindikator. Achten Sie auf den Trend, nicht auf den einzelnen Tag
Daumen-runter-Quote bei KI-Antworten Wöchentlich Ihr Team sieht etwas, das die Gesamtzahlen verdecken
Buchungs- oder Abschlussquote aus Gesprächen Wöchentlich Der Agent antwortet, schließt aber nicht mehr ab
Ergebnis im Regressionstestset Monatlich und bei jedem Modellwechsel Modell oder Konfiguration haben sich unter Ihnen verschoben

Die Zeit bis zur ersten Antwort gehört auf diese Liste, auch wenn sie selten driftet. Unsere eigene Auswertung von 32,581 Gesprächen ergab, dass Antworten innerhalb von 60 Sekunden zu 35.1% konvertierten, gegenüber 7.1% bei Antworten, die eine bis vierundzwanzig Stunden brauchten. Tempo ist die Kennzahl, für die ein Agent gekauft wird, also lohnt es sich, immer wieder zu belegen, dass sie noch stimmt.

Wie oft sollten Sie einen KI-Agenten erneut testen?

Halten Sie ein festes Regressionstestset aus echten Gesprächen mit bekannten richtigen Ergebnissen bereit, und lassen Sie es bei drei Anlässen erneut laufen:

  1. Nach Zeitplan, mindestens monatlich. Das macht aus Drift eine Zahl statt einer Vermutung.
  2. Vor und nach jedem Modellwechsel, auch bei einem, den Sie nicht selbst angestoßen haben. Wenn Ihre Plattform auf ein neueres Modell umstellt, ist das eine Änderung an Ihrem System.
  3. Nach jeder nennenswerten Änderung am Wissen oder an den Anweisungen. Eine Korrektur für eine Beschwerde zerschießt oft eine Antwort, die vorher völlig in Ordnung war.

Bauen Sie es aus Gesprächen, die Sie ohnehin schon haben. Zwanzig bis fünfzig Fälle, die Ihre häufigen Fragen abdecken, Ihre unangenehmen Sonderfälle und die wenigen, die der Agent nie allein beantworten darf. Groß genug, um eine echte Verschlechterung zu erkennen, klein genug, dass Sie es auch wirklich durchführen.

Neu zu vergleichen, welches Modell Sie einsetzen, ist ein eigener, langsamerer Zyklus. Quartalsweise ist ein vernünftiger Standard, und er fällt deutlich leichter, wenn Ihr Setup nie fest an ein einzelnes Labor geschweißt war. Genau dafür haben wir in warum Sie Ihr Geschäft nicht auf ein einziges KI-Modell bauen sollten argumentiert.

Wie sieht eine wöchentliche Wartungsroutine aus?

Dreißig bis sechzig Minuten, jede Woche im selben Zeitfenster:

  1. Lesen Sie zehn echte Gespräche von Anfang bis Ende. Keine Zusammenfassungen. Nehmen Sie ein paar markierte und ein paar zufällige, denn die zufälligen zeigen Ihnen, wie normal aussieht.
  2. Sichten Sie jedes Daumen-runter, das Ihr Team erfasst hat. Sortieren Sie jedes in einen von drei Töpfen: Das Wissen war falsch oder fehlte, die Anweisungen waren falsch, oder der Agent hätte übergeben müssen.
  3. Reparieren Sie den Topf, nicht das Gespräch. Eine einmalige Korrektur in einem einzelnen Chat bringt dem System nichts bei. Aktualisieren Sie den Wissenseintrag, die Anweisung oder die Übergaberegel.
  4. Lassen Sie das Regressionstestset erneut laufen, wenn Sie etwas Tragendes geändert haben.
  5. Schreiben Sie auf, was Sie geändert haben und warum. Ein datiertes Änderungsprotokoll ist das, womit Sie sechs Wochen später die Frage "Wann hat das angefangen?" beantworten können.

Warum scheitern längere Aufgaben, obwohl das Modell in Ordnung ist?

Das ist eher eine Frage des Zuschnitts als eine Wartungsaufgabe, aber es sieht aus wie Verfall.

Ein arXiv-Preprint vom August 2026, How Fast Do Agents Rot?, maß die Zuverlässigkeit von Agenten über neun Modelle und 10,664 ausgewertete Verläufe hinweg. Der Aufgabenerfolg folgt einem geometrischen Gesetz, bestimmt durch die Zuverlässigkeit pro Schritt. Diese steigt mit der Modellgröße, bleibt aber selbst bei den stärksten Systemen deutlich unter 1. Bei der wirklich agentischen Werkzeugaufgabe fiel jedes getestete Modell, auch weit verbreitete proprietäre, innerhalb von sechzehn voneinander abhängigen Schritten von nahezu perfektem Erfolg auf nahezu null. Der Abbau folgte der Zahl der Schritte, nicht der Kontextlänge.

Es ist ein Preprint, und seine Aufgaben sind keine Kundenservicegespräche. Die praktische Lesart hält trotzdem: Zuverlässigkeit multipliziert sich mit jedem abhängigen Schritt nach unten. Ein Agent, der antworten, qualifizieren und buchen soll, steht damit auf viel festerem Boden als einer, der unbeaufsichtigt einen fünfzehnstufigen Prozess abarbeitet. Wenn die Aufgabe Ihres Agenten seit dem Start still gewachsen ist, haben Sie ein Problem des Zuschnitts im Kostüm eines Qualitätsproblems.

Wer ist eigentlich dafür verantwortlich?

Meistens niemand, und genau das ist der eigentliche Befund in Alis Text. Produktteams liefern aus, die Entwicklung hält die Infrastruktur am Laufen, der Betrieb führt das Geschäft, und niemand ist dafür zuständig zu bemerken, dass die Antworten schlechter geworden sind.

Benennen Sie eine Person, und übergeben Sie das nicht an ein Gremium. Sie beobachtet die täglichen Zahlen, führt die wöchentliche Routine durch und hat das Standing zu sagen, dass der Agent danebenliegt, und seinen Aufgabenumfang zurückzunehmen. Dieser letzte Teil macht die Rolle erst echt. Ali wird bei der Alternative deutlich: "Ein Prüfer, der nur abnicken kann, leistet keine Aufsicht, sondern nur deren Anschein."

Wo Entagl hineinpasst

Jede Person in Ihrem Team kann eine schlechte KI-Antwort direkt aus dem gemeinsamen Posteingang melden, mit einer Notiz dazu, was falsch war. Gemeldete Antworten landen mit einem Status in einer Prüfliste, sodass die wöchentliche Sichtung eine Arbeitsliste hat statt eines Gedächtnistests. Das Wissen liegt an einem Ort: Wenn Sie eine FAQ, eine Leistung oder Ihre Öffnungszeiten korrigieren, gilt das auf einen Schlag für WhatsApp, Instagram, Messenger, Telegram, Web-Chat, E-Mail und die API. Weil sich die vier Agenten ein Gehirn teilen, stimmt eine Korrektur, die Sie für den Chat vornehmen, auch beim nächsten Anruf.

Zwei strukturelle Dinge zählen mehr als jede einzelne Funktion. Das Modell-Routing hängt nicht an einem einzelnen Labor: Welches Modell hinter welcher Stufe steht, ist eine Einstellung, und dahinter lassen sich Backup-Modelle konfigurieren. Eine Verhaltensänderung beim Anbieter wird so zu einer Routing-Entscheidung und nicht zu einem Neuaufbau. Und die Übergabe an einen Menschen ist ein vollwertiger Weg statt eines Fehlerzustands, sodass die Zahl, die Ihnen Drift anzeigt, ohnehin schon bei Ihnen aufläuft.

Wenn Sie den Agenten von Anfang an sauber verankern, wird das alles günstiger. Das behandeln wir in wie Sie einen KI-Agenten auf Ihr eigenes Geschäftswissen trainieren.

Was Wartung nicht behebt

Sie macht keinen Agenten genau, der nie sauber verankert wurde. Wer einen schlecht zugeschnittenen Agenten überwacht, misst das Falsche sehr präzise.

Sie beseitigt keine Halluzinationen. Die Kontrollen, die sie verringern, sind ein eigener Stapel, beschrieben in wie Sie Ihren KI-Agenten vom Halluzinieren abhalten.

Und eine Zahl, die sich bewegt, ist noch keine Diagnose. Die Übergabequote kann steigen, weil der Agent schlechter geworden ist, oder weil Sie eine Werbekampagne gefahren haben, die eine ganz andere Art von Frage hereinbringt. Lesen Sie die Gespräche, bevor Sie etwas ändern. Deshalb ist Schritt eins der wöchentlichen Routine Lesen und nicht Messen.

FAQ

Wie oft sollten Sie die Leistung eines KI-Agenten prüfen?

Beobachten Sie Übergabequote, Zeit bis zur ersten Antwort und Lösungsquote täglich, denn das sind die Frühindikatoren für einen Abstieg. Prüfen Sie markierte Antworten und die Abschlussquote wöchentlich. Lassen Sie ein Regressionstestset monatlich und bei jedem Modellwechsel erneut laufen. Eine rein wöchentliche Prüfung ist der Grund, warum ein Rückgang um acht Punkte bei einem Finanzdienstleister wochenlang unbemerkt blieb.

Kann ein KI-Agent schlechter werden, wenn sich nichts geändert hat?

Ja, aus zwei getrennten Gründen, und es lohnt sich, sie auseinanderzuhalten. Verhaltensdrift übersehen die meisten Teams: Ein gehostetes Modell kann anfangen, schlechtere Antworten auf dieselben Fragen zu geben, ohne dass sich an Ihren Prompts oder Ihrer Konfiguration etwas ändert. Genau das hat Anwar Ali bei BSI Financial Services dokumentiert, als die Containment-Quote um rund acht Punkte fiel. Der zweite Grund ist AI aging: Ein unverändertes Modell wird allein dadurch ungenauer, dass seit seinem Training mehr Zeit vergangen ist. Scientific Reports von Nature beobachtete das bei 91% der 128 getesteten Modell-Datensatz-Paarungen. Unterschiedliche Mechanismen, dasselbe Symptom. Ein festes Regressionstestset erkennt beide.

Woran erkennen Sie, ob es am Modell liegt oder an Ihrer Wissensdatenbank?

Lassen Sie Ihr festes Regressionstestset erneut laufen. Wenn Fälle, die früher bestanden haben, jetzt durchfallen, während das zugrunde liegende Wissen unverändert ist, hat sich das Modell verschoben. Wenn der Agent selbstsicher aus schlicht veralteten Informationen antwortet, hat sich Ihr Wissen verschoben. Das Testset trennt die beiden Fälle, und genau deshalb muss es fest sein und wiederverwendet werden statt jedes Mal neu geschrieben.

Wer sollte in einem kleinen Unternehmen die Wartung des KI-Agenten verantworten?

Eine benannte Person, meist die, der das Kundenerlebnis gehört, und nicht die technischste. Die Arbeit besteht darin, Gespräche zu lesen, markierte Antworten zu sichten und Geschäftswissen zu aktualisieren. Nichts davon erfordert Entwicklungsarbeit, und alles davon erfordert jemanden mit dem Standing, den Aufgabenumfang des Agenten zurückzunehmen, wenn die Zahlen es sagen.

Macht ein besseres Modell das Monitoring überflüssig?

Nein. Die Zuverlässigkeit pro Schritt verbessert sich mit der Modellgröße, erreicht aber nicht 1. Längere Aufgabenketten bauen also weiter ab, und ein stärkeres Modell kann sein Verhalten trotzdem unter Ihnen ändern. Bessere Modelle heben den Boden an. Sie ersparen Ihnen nicht, den Boden im Blick zu behalten.

Fangen Sie mit der Zahl an, die Sie nicht erfassen

Mit ziemlicher Sicherheit machen Sie an anderer Stelle in diesem Unternehmen eine wöchentliche Zahlenrunde, führen für irgendein anderes System ein Änderungsprotokoll und wissen, wie man Arbeit stichprobenartig auf Qualität prüft. Ali kommt am Ende seiner Kolumne zum selben Schluss: Die Fähigkeit ist meist längst da, und fast niemand richtet sie auf die KI, die mit den eigenen Kundinnen und Kunden spricht.

Wählen Sie einen Frühindikator, den Sie nicht täglich beobachten, geben Sie ihm eine verantwortliche Person, und blocken Sie dreißig Minuten im Kalender für die wöchentliche Lesezeit. Allein das hätte die hier beschriebene Drift aufgedeckt.

Wenn Sie sehen möchten, wie die Prüfliste für gemeldete Antworten, das gemeinsame Wissen und die Übergabesteuerung in einem echten Workspace funktionieren, buchen Sie eine 30-minütige Demo, und wir gehen Ihre eigenen Gespräche damit durch.

Quellen: Nature Scientific Reports, "Temporal quality degradation in AI models" (2022); HousingWire, Anwar Ali, "The silent failure mode: what happens when your AI model quietly gets worse" (September 2026); arXiv:2609.01660, "How Fast Do Agents Rot?" (August 2026); Entagl Response Velocity Study (2026). Zahlen geprüft mit Stand September 2026.

Veröffentlicht von Entagl Team on