Die kurze Antwort
Testen Sie einen KI-Agenten an der vollständigen Aufgabe, die er erledigen soll: am Ergebnis, an den Aktionen, die er ausführt, und daran, wie er reagiert, wenn etwas schiefgeht. Eine überzeugende Demo ist hilfreich, doch Release-Entscheidungen brauchen wiederholbare Belege. Beginnen Sie mit repräsentativen Aufgaben, definieren Sie akzeptable Ergebnisse und lassen Sie eine verantwortliche Person entscheiden, wann das System bereit ist.
Warum das gerade jetzt wichtig ist
Sobald Agenten nicht mehr nur Fragen beantworten, sondern Geschäftsanwendungen bedienen, reicht eine flüssige Antwort nicht mehr aus. Der Leitfaden von Anthropic vom Januar 2026 beschreibt die Evaluierung von Agenten anhand von Aufgaben, wiederholten Durchläufen und unterschiedlichen Arten von Bewertern. Entscheidend ist die Unterscheidung zwischen dem, was ein Agent sagt, und dem Zustand, den er hinterlässt. Lesen Sie den Evaluierungsleitfaden von Anthropic.
Beginnen Sie mit einer Aufgabe und einem Freigabekatalog
Nehmen wir als Beispiel einen Support-Assistenten, der Antworten entwirft und Kontoänderungen vorschlägt. Bevor Sie ein Modell auswählen, formulieren Sie einen Freigabekatalog: Welche Anfragen darf er bearbeiten, welche Datensätze darf er lesen, welche Aktionen erfordern eine Freigabe und wann muss er übergeben? Legen Sie die akzeptable Fehlerquote für jede Aufgabe gemeinsam mit der Person fest, die für die Folgen verantwortlich ist.
Bauen Sie Ihr erstes Evaluierungsset aus anonymisierten Beispielen genau dieser Aufgabe auf. Nehmen Sie gewöhnliche Anfragen, unvollständige Informationen, widersprüchliche Datensätze und Anfragen außerhalb des vereinbarten Rahmens auf. Halten Sie ein separates Set für Release-Prüfungen vor, damit wiederholtes Prompt-Tuning dem System nicht einfach Ihre Entwicklungsbeispiele beibringt.
Messen Sie das Ergebnis und den Weg dorthin
Unsere empfohlene Scorecard hat fünf Spalten: korrektes Ergebnis, autorisierte Aktionen, angemessene Übergabe, Bearbeitungszeit und Kosten pro abgeschlossener Aufgabe. Erfassen Sie bei jedem Durchlauf die Modell- und Tool-Versionen. Ein günstiger Versuch, der immer wieder manuell nachgebessert werden muss, kann mehr kosten als ein langsamerer, zuverlässiger Workflow.
- Prüfen Sie den gespeicherten Datensatz oder die erledigte Aufgabe, nicht nur die abschließende Nachricht.
- Untersuchen Sie unerwartete Tool-Aufrufe, auch wenn das Ergebnis korrekt aussieht.
- Wiederholen Sie Fälle, in denen Schwankungen des Modells das Ergebnis verändern könnten.
- Machen Sie Fehler nach Kategorien sichtbar; ein Durchschnittswert kann einen schwerwiegenden Berechtigungsfehler verbergen.
Testen Sie die Fehler, auf die Ihre Nutzer stoßen werden
Entfernen Sie im Support-Beispiel vorübergehend ein Pflichtfeld, simulieren Sie ein Timeout und liefern Sie widersprüchliche Kontodaten zurück. Das gewünschte Verhalten wäre etwa eine klare Rückfrage oder eine Übergabe. Es sollte keine selbstsichere Vermutung sein. Dies sind vorgeschlagene technische Prüfungen, keine Aussagen über die Leistung eines bestimmten Modells.
Auch Dokumente und Tool-Antworten können feindselige Anweisungen enthalten. OWASP empfiehlt einen mehrschichtigen Schutz gegen Prompt Injection, einschließlich klarer Grenzen für Tools und sensible Aktionen. Behandeln Sie externen Text als Daten und testen Sie, ob er den Workflow umlenken kann. Lesen Sie die Empfehlungen von OWASP.
Schrittweise freigeben, weiter messen
Beginnen Sie in einem Modus, in dem Mitarbeitende vorgeschlagene Aktionen prüfen können. Weiten Sie den Zugang erst aus, wenn die Belege den Freigabekatalog erfüllen. Sorgen Sie dafür, dass sich Schreibaktionen deaktivieren lassen, ohne den Audit-Trail zu verlieren, und nehmen Sie neu beobachtete Fehler in das Evaluierungsset auf.
Beweist eine bestandene Evaluierung, dass ein Agent sicher ist?
Nein. Sie liefert Belege für die getesteten Fälle. Produktionsmonitoring, eingeschränkte Berechtigungen und ein klarer Eskalationspfad bleiben notwendig.
Was sollten Sie zuerst umsetzen?
Wählen Sie eine klar abgegrenzte Aufgabe mit sichtbarem Ergebnis und umkehrbaren Folgen. Entdecken Sie unsere Kompetenzen in KI-Integration und Testing oder erzählen Sie uns von dem Workflow, den Sie verbessern möchten.



