WAF-AGN-050 – Safety & Guardrails
Beschreibung
Fail-Safe, Alignment und Verifikation müssen in place sein. Content-Filter müssen konfiguriert sein, um unangemessene Inhalte zu blockieren. Aktions-Boundaries müssen verhindern, dass Agenten unautorisierte Aktionen ausführen. Human-in-the-Loop muss für sensible Entscheidungen konfiguriert sein. Guardrails müssen mit den organisatorischen Werten übereinstimmen.
Begründung
Agenten ohne Guardrails bergen erhebliche Risiken:
Content-Verstöße: Agenten können schädliche, beleidigende oder unangemessene Inhalte generieren, die Richtlinien oder Gesetze verletzen.
Unautorisierter Zugriff: Agenten können auf Daten oder Systeme zugreifen, auf die sie keinen Zugriff haben sollten.
Finanzieller Schaden: Agenten können unautorisierte Finanztransaktionen oder -entscheidungen treffen.
Reputationsschaden: Agentenverhalten kann den Firmennamen oder das Markenimage schädigen.
Bedrohungskontext
| Risk | Beschreibung |
|---|---|
Schädlicher Inhalt |
Agenten generieren Hassrede, Gewalt, sexuelle Inhalte oder anderes verbotenes Material. |
Unautorisierter Zugriff |
Agenten greifen auf Daten oder Systeme zu, auf die sie keinen Zugriff haben sollten. |
Finanzieller Verlust |
Agenten treffen unautorisierte Finanztransaktionen oder -entscheidungen. |
Reputationsschaden |
Agentenverhalten schädigt den Firmennamen oder das Markenimage. |
Anforderungen
-
Content-Filter müssen unangemessene Inhalte blockieren
-
Aktions-Boundaries müssen Agenten auf genehmigte Aktionen beschränken
-
Human-in-the-Loop ist für sensible Entscheidungen erforderlich
-
Guardrails müssen mit den organisatorischen Werten übereinstimmen
-
Fail-Safe-Mechanismen müssen bei Guardrail-Fehlern Schaden verhindern
Implementierungshinweise
-
Content-Filter konfigurieren: Guardrails mit Content-Policies einrichten (Hass, Gewalt, sexuell, PII)
-
Aktions-Boundaries definieren: IAM-Rollen mit Least-Privilege-Berechtigungen verwenden
-
Menschliche Überprüfung implementieren: Human-in-the-Loop für sensible Entscheidungstypen konfigurieren
-
Fail-Safes einrichten: Automatisches Herunterfahren, Alerts und Fallback-Antworten konfigurieren
-
Regelmäßige Alignment-Tests: Agentenverhalten periodisch gegen organisatorische Werte testen
Reifegradstufen
| Level | Name | Kriterien |
|---|---|---|
1 |
Keine Guardrails |
Keine Content-Filter. Keine Aktions-Boundaries. Keine menschliche Überprüfung. |
2 |
Basis-Filter |
Einige Content-Filter. Basis-Aktions-Bereichsdefinition. |
3 |
Vollständige Guardrails |
Umfassende Content-Filter. Strict Aktions-Boundaries. Menschliche Überprüfung für sensible Fälle. |
4 |
Automatisierte Compliance |
Guardrails werden automatisch durchgesetzt. Echtzeit-Policy-Updates. |
5 |
Predictive Guardrails |
AI-Modelle vorhersagen und verhindern potenzielle Verstöße, bevor sie auftreten. |
Terraform Checks
waf-agn-050.tf.aws.content-filters-enabled
Prüft: AWS Bedrock Guardrails sind für Agenten konfiguriert.
| Compliant | Nicht compliant |
|---|---|
|
Kein Guardrail konfiguriert |
waf-agn-050.tf.aws.action-boundaries-configured
Prüft: IAM-Rollen mit Least-Privilege-Berechtigungen für Agenten konfiguriert.
| Compliant | Nicht compliant |
|---|---|
|
Keine IAM-Beschränkungen |
waf-agn-050.tf.google.content-filters
Prüft: Google Vertex AI Agenten haben Content-Filter konfiguriert.
| Compliant | Nicht compliant |
|---|---|
|
Keine Content-Filter |
waf-agn-050.tf.azure.ai-guards
Prüft: Azure AI Agenten haben Sicherheitsgrenzen konfiguriert.
| Compliant | Nicht compliant |
|---|---|
|
Keine Sicherheitsgrenzen |
Evidenz
| Typ | Erforderlich | Beschreibung |
|---|---|---|
IaC |
✅ Erforderlich |
Guardrail-Konfiguration, IAM-Policies, Human-in-the-Loop-Einrichtung. |
Konfig |
✅ Erforderlich |
Content-Filter-Policies, Aktions-Bereichs-Definitionen, Approval-Workflows. |
Prozess |
✅ Erforderlich |
Guardrail-Testberichte, menschliche Review-Logs, Vorfallberichte. |
Governance |
✅ Erforderlich |
Safety-Policy, die Guardrail-Anforderungen und organisatorische Werte definiert. |
Regulatorische Zuordnung
| Rahmenwerk | Controls |
|---|---|
ISO 27001:2022 |
A.8.2 – Privileged access rights; A.8.3 – Information access restriction; A.13.1.1 – Control of information in sessions |
NIST SP 800-53 |
SI-4 – Information system monitoring; SI-5 – Malicious code protection |
NIST CSF 2.0 |
DE.CM – Continuous monitoring; DE.DP – Data protection |
GDPR |
Art. 32 – Security of processing; Art. 5(1)(f) – Integrity and confidentiality |
PCI DSS v4.0 |
Req 6.4 – Secure development lifecycle; Req 6.5 – Secure coding practices |
TISAX |
Information security – Monitoring and logging |
ANSSI SecNumCloud |
Domain – Security monitoring |
BIO |
BIO – Monitoring en beveiliging |
ENS High |
op.exp.6 – Gestión de cambios; op.sec.7 – Protección contra malware |
UK NCSC CAF |
A4 – Policy and assurance |
FedRAMP |
SI-4, SI-5 (Moderate baseline) |
CMMC 2.0 |
SI.L2-3.8.1 – Limit information system use |
IT-Grundschutz |
ORP.1 – Informationstechnisch-related Angriffsschutz |
IRAP |
ISM – Content filtering and protection |
CCCS PBMM |
SI-4 – Security monitoring |
MAS TRM |
Ch.9 – Change management |
ISMAP |
Security monitoring controls |
FISC |
Technical measures – Security monitoring |
AWS Well-Architected Framework |
Security Pillar – Threat detection; Security Pillar – Incident response |
Google Cloud Architecture Framework |
Security – Content filtering and protection |
BSI C5:2020 |
OPS-01 – Operational monitoring; OPS-02 – Operational control |
SOC 2 Type II |
CC4.1 – Monitoring activities; CC6.1 – Logical access security |
CSA STAR |
CCM Security Incident Management; CCM Logging and Monitoring |
CIS Controls v8 |
CIS 13 – Content Filtering |