Was sind Guardrails?
Guardrails (Leitplanken für KI-Systeme) sind technische und organisatorische Leitplanken, die das Verhalten von KI-Systemen steuern und begrenzen. Sie legen fest, welche Eingaben verarbeitet, welche Informationen ausgegeben und welche Aktionen ausgeführt werden dürfen. Dadurch unterstützen sie dabei, KI-Anwendungen sicherer, zuverlässiger und besser kontrollierbar zu gestalten.
Guardrails kommen insbesondere bei Sprachmodellen und KI-Agenten zum Einsatz. Sie können beispielsweise verhindern, dass ein System vertrauliche Daten ausgibt, unerlaubte Inhalte verarbeitet oder eigenständig Aktionen mit weitreichenden Folgen ausführt. Dabei ersetzen Guardrails nicht die Fähigkeiten des zugrunde liegenden Modells, sondern ergänzen sie um zusätzliche Prüfungen und Regeln.
Guardrails entlang des Ablaufs
Guardrails können an verschiedenen Stellen einer KI-Anwendung eingesetzt werden. Bei der Eingabe prüfen sie, ob eine Anfrage zulässig, verständlich oder sicher ist. Während der Verarbeitung können sie kontrollieren, welche Werkzeuge ein Modell verwenden darf, auf welche Daten es zugreifen kann und wie viele Schritte ein Agent ausführt. Bei der Ausgabe bewerten sie, ob das Ergebnis den fachlichen, rechtlichen und qualitativen Anforderungen entspricht.
Ein typischer Ablauf besteht daher aus mehreren Kontrollpunkten: Eine Anfrage wird zunächst validiert, anschließend verarbeitet und die erzeugte Antwort vor der Ausgabe nochmals geprüft. Je nach Anwendung können Guardrails außerdem Aktionen zurückhalten, eine menschliche Freigabe anfordern oder eine Anfrage an einen spezielleren Prozess weiterleiten.
Typische Arten von Guardrails
Guardrails lassen sich nach ihrer Aufgabe und ihrem technischen Ansatz unterscheiden. Häufig eingesetzt werden unter anderem:
- Eingabeprüfungen: Sie erkennen beispielsweise unerlaubte Themen, schädliche Anweisungen, Prompt-Injection-Versuche oder unzulässige Dateiformate.
- Inhaltsfilter: Sie prüfen Antworten auf beleidigende, diskriminierende, gefährliche oder anderweitig nicht gewünschte Inhalte.
- Datenschutzkontrollen: Sie erkennen und maskieren personenbezogene Daten, Zugangsdaten oder vertrauliche Unternehmensinformationen.
- Format- und Schema-Prüfungen: Sie stellen sicher, dass eine Antwort einer erwarteten Struktur entspricht, etwa einem JSON-Schema oder einem festgelegten Datenmodell.
- Fachliche Validierung: Sie vergleichen Aussagen mit zugelassenen Datenquellen, Regeln oder Geschäftslogik.
- Berechtigungsprüfungen: Sie begrenzen, welche Nutzer, Modelle oder Agenten auf bestimmte Daten und Werkzeuge zugreifen dürfen.
- Aktionsfreigaben: Sie verlangen eine Bestätigung durch einen Menschen, bevor beispielsweise eine Bestellung ausgelöst, eine E-Mail versendet oder ein Datensatz verändert wird.
- Ressourcenbegrenzungen: Sie beschränken etwa die Anzahl von Modellaufrufen, die Ausführungszeit oder das verfügbare Budget.
In der Praxis werden meist mehrere dieser Ansätze kombiniert. Welche Kontrollen sinnvoll sind, hängt vom Einsatzgebiet, den verarbeiteten Daten und den möglichen Folgen einer fehlerhaften Antwort oder Aktion ab.
Regelbasierte und modellbasierte Guardrails
Ein Teil der Guardrails arbeitet regelbasiert. Dazu gehören reguläre Ausdrücke, festgelegte Listen, Berechtigungstabellen, JSON-Schemas oder Prüfungen gegen Datenbanken. Solche Regeln sind transparent, schnell und gut testbar. Sie eignen sich besonders für klar definierte Anforderungen wie die Prüfung von E-Mail-Adressen, Kundennummern oder Zugriffserlaubnissen.
Andere Guardrails verwenden selbst KI-Modelle, um Inhalte semantisch zu bewerten. Ein zusätzliches Modell kann beispielsweise einschätzen, ob eine Anfrage eine Sicherheitsrichtlinie verletzt oder ob eine Antwort thematisch zur Frage passt. Dieser Ansatz ist flexibler, bringt aber selbst eine gewisse Unsicherheit mit sich. Deshalb werden modellbasierte Prüfungen häufig mit festen Regeln, Schwellenwerten und Stichproben durch Menschen kombiniert.
Guardrails bei AI Agents
Bei AI Agents beziehen sich Guardrails nicht nur auf Text, sondern auch auf die vom Agenten ausgeführten Aktionen. Ein Agent kann beispielsweise darauf beschränkt werden, nur bestimmte APIs aufzurufen, ausschließlich lesend auf Daten zuzugreifen oder Aktionen mit finanziellen oder rechtlichen Auswirkungen zunächst zur Freigabe vorzulegen.
Zusätzlich können der Handlungsraum und der Ablauf begrenzt werden. Dazu gehören eine maximale Anzahl von Schritten, erlaubte Werkzeugkombinationen, definierte Zeit- und Kostenlimits sowie eine Prüfung der Parameter vor jedem externen Aufruf. So bleibt der Agent grundsätzlich autonom, arbeitet aber innerhalb eines kontrollierten Rahmens.
Herausforderungen und Grenzen
Guardrails verbessern die Kontrolle über KI-Anwendungen, können aber nicht jede unerwünschte Ausgabe oder Aktion vollständig ausschließen. Bei der Konzeption sollten insbesondere folgende Punkte berücksichtigt werden:
- Abwägung zwischen Schutz und Flexibilität: Zu strenge Regeln können legitime Anfragen blockieren oder die Anwendung unnötig unflexibel machen.
- Unvollständige Erkennung: Regel- und modellbasierte Prüfungen können problematische Inhalte übersehen oder unkritische Inhalte fälschlicherweise markieren.
- Unterschiedliche Modellreaktionen: Ein Guardrail kann je nach Modell, Prompt und Kontext unterschiedlich gut funktionieren und sollte deshalb mit realistischen Beispielen getestet werden.
- Pflegeaufwand: Richtlinien, Filter und Berechtigungen müssen regelmäßig an neue Anwendungsfälle, Modelle und gesetzliche Anforderungen angepasst werden.
- Leistung und Kosten: Zusätzliche Prüfungen können die Antwortzeit erhöhen und bei modellbasierten Kontrollen weitere Aufrufe und Kosten verursachen.
- Nachvollziehbarkeit: Für den Betrieb ist es hilfreich zu protokollieren, welche Prüfung eine Antwort oder Aktion zugelassen, verändert oder blockiert hat.
- Kein Ersatz für Architektur und Prozesse: Guardrails sind ein Baustein der Qualitätssicherung und sollten durch Berechtigungsmodelle, Tests, Monitoring und klare Verantwortlichkeiten ergänzt werden.
Sinnvoll konzipierte Guardrails sollen KI-Anwendungen nicht grundsätzlich einschränken, sondern ihren Einsatz verlässlicher und besser steuerbar machen. Entscheidend ist, die Regeln passend zum jeweiligen Risiko zu dimensionieren und regelmäßig zu überprüfen, ob sie im Alltag die gewünschten Ergebnisse liefern.