WAF-AGN-050 – Safety & Guardrails

Beschreibung

Fail-Safe, Alignment und Verifikation müssen in place sein. Content-Filter müssen konfiguriert sein, um unangemessene Inhalte zu blockieren. Aktions-Boundaries müssen verhindern, dass Agenten unautorisierte Aktionen ausführen. Human-in-the-Loop muss für sensible Entscheidungen konfiguriert sein. Guardrails müssen mit den organisatorischen Werten übereinstimmen.

Begründung

Agenten ohne Guardrails bergen erhebliche Risiken:

Content-Verstöße: Agenten können schädliche, beleidigende oder unangemessene Inhalte generieren, die Richtlinien oder Gesetze verletzen.

Unautorisierter Zugriff: Agenten können auf Daten oder Systeme zugreifen, auf die sie keinen Zugriff haben sollten.

Finanzieller Schaden: Agenten können unautorisierte Finanztransaktionen oder -entscheidungen treffen.

Reputationsschaden: Agentenverhalten kann den Firmennamen oder das Markenimage schädigen.

Bedrohungskontext

Risk Beschreibung

Schädlicher Inhalt

Agenten generieren Hassrede, Gewalt, sexuelle Inhalte oder anderes verbotenes Material.

Unautorisierter Zugriff

Agenten greifen auf Daten oder Systeme zu, auf die sie keinen Zugriff haben sollten.

Finanzieller Verlust

Agenten treffen unautorisierte Finanztransaktionen oder -entscheidungen.

Reputationsschaden

Agentenverhalten schädigt den Firmennamen oder das Markenimage.

Anforderungen

  • Content-Filter müssen unangemessene Inhalte blockieren

  • Aktions-Boundaries müssen Agenten auf genehmigte Aktionen beschränken

  • Human-in-the-Loop ist für sensible Entscheidungen erforderlich

  • Guardrails müssen mit den organisatorischen Werten übereinstimmen

  • Fail-Safe-Mechanismen müssen bei Guardrail-Fehlern Schaden verhindern

Implementierungshinweise

  1. Content-Filter konfigurieren: Guardrails mit Content-Policies einrichten (Hass, Gewalt, sexuell, PII)

  2. Aktions-Boundaries definieren: IAM-Rollen mit Least-Privilege-Berechtigungen verwenden

  3. Menschliche Überprüfung implementieren: Human-in-the-Loop für sensible Entscheidungstypen konfigurieren

  4. Fail-Safes einrichten: Automatisches Herunterfahren, Alerts und Fallback-Antworten konfigurieren

  5. Regelmäßige Alignment-Tests: Agentenverhalten periodisch gegen organisatorische Werte testen

Reifegradstufen

Level Name Kriterien

1

Keine Guardrails

Keine Content-Filter. Keine Aktions-Boundaries. Keine menschliche Überprüfung.

2

Basis-Filter

Einige Content-Filter. Basis-Aktions-Bereichsdefinition.

3

Vollständige Guardrails

Umfassende Content-Filter. Strict Aktions-Boundaries. Menschliche Überprüfung für sensible Fälle.

4

Automatisierte Compliance

Guardrails werden automatisch durchgesetzt. Echtzeit-Policy-Updates.

5

Predictive Guardrails

AI-Modelle vorhersagen und verhindern potenzielle Verstöße, bevor sie auftreten.

Terraform Checks

waf-agn-050.tf.aws.content-filters-enabled

Prüft: AWS Bedrock Guardrails sind für Agenten konfiguriert.

Compliant Nicht compliant
resource "aws_bedrock_guardrail" "organizational_guardrail" {
  name = "organizational-guardrail"

  blocked_input_messages = [{
    text = "hate-speech"
  }]

  blocked_output_messages = [{
    text = "hate-speech"
  }]
}

resource "aws_bedrockagent" "filtered_agent" {
  agent_name = "content-filtered-agent"

  guardrail_configuration {
    guardrail_arn = aws_bedrock_guardrail.organizational_guardrail.arn
    guardrail_version = "DRAFT"
  }
}

Kein Guardrail konfiguriert

waf-agn-050.tf.aws.action-boundaries-configured

Prüft: IAM-Rollen mit Least-Privilege-Berechtigungen für Agenten konfiguriert.

Compliant Nicht compliant
resource "aws_iam_role" "agent_role" {
  name = "agent-role"

  assume_role_policy = jsonencode({
    Version = "2012-10-17"
    Statement = [{
      Effect = "Allow"
      Principal = {
        Service = "bedrock.amazonaws.com"
      }
      Action = "sts:AssumeRole"
    }]
  })
}

resource "aws_iam_role_policy" "agent_limits" {
  name = "agent-limits"
  role = aws_iam_role.agent_role.id

  policy = jsonencode({
    Version = "2012-10-17"
    Statement = [{
      Effect = "Allow"
      Action = ["s3:GetObject", "s3:ListBucket"]
      Resource = ["arn:aws:s3:::allowed-bucket/*"]
    }]
  })
}

Keine IAM-Beschränkungen

waf-agn-050.tf.google.content-filters

Prüft: Google Vertex AI Agenten haben Content-Filter konfiguriert.

Compliant Nicht compliant
resource "google_vertex_ai_agent" "filtered_agent" {
  display_name = "content-filtered-agent"
  # Content filtering konfiguriert
}

Keine Content-Filter

waf-agn-050.tf.azure.ai-guards

Prüft: Azure AI Agenten haben Sicherheitsgrenzen konfiguriert.

Compliant Nicht compliant
resource "azurerm_cognitive_deployment" "agent" {
  name                 = "governed-agent"
  cognitive_account_id = azurerm_cognitive_account.main.id

  # Safety guards konfiguriert
}

Keine Sicherheitsgrenzen

Evidenz

Typ Erforderlich Beschreibung

IaC

✅ Erforderlich

Guardrail-Konfiguration, IAM-Policies, Human-in-the-Loop-Einrichtung.

Konfig

✅ Erforderlich

Content-Filter-Policies, Aktions-Bereichs-Definitionen, Approval-Workflows.

Prozess

✅ Erforderlich

Guardrail-Testberichte, menschliche Review-Logs, Vorfallberichte.

Governance

✅ Erforderlich

Safety-Policy, die Guardrail-Anforderungen und organisatorische Werte definiert.

Regulatorische Zuordnung

Rahmenwerk Controls

ISO 27001:2022

A.8.2 – Privileged access rights; A.8.3 – Information access restriction; A.13.1.1 – Control of information in sessions

NIST SP 800-53

SI-4 – Information system monitoring; SI-5 – Malicious code protection

NIST CSF 2.0

DE.CM – Continuous monitoring; DE.DP – Data protection

GDPR

Art. 32 – Security of processing; Art. 5(1)(f) – Integrity and confidentiality

PCI DSS v4.0

Req 6.4 – Secure development lifecycle; Req 6.5 – Secure coding practices

TISAX

Information security – Monitoring and logging

ANSSI SecNumCloud

Domain – Security monitoring

BIO

BIO – Monitoring en beveiliging

ENS High

op.exp.6 – Gestión de cambios; op.sec.7 – Protección contra malware

UK NCSC CAF

A4 – Policy and assurance

FedRAMP

SI-4, SI-5 (Moderate baseline)

CMMC 2.0

SI.L2-3.8.1 – Limit information system use

IT-Grundschutz

ORP.1 – Informationstechnisch-related Angriffsschutz

IRAP

ISM – Content filtering and protection

CCCS PBMM

SI-4 – Security monitoring

MAS TRM

Ch.9 – Change management

ISMAP

Security monitoring controls

FISC

Technical measures – Security monitoring

AWS Well-Architected Framework

Security Pillar – Threat detection; Security Pillar – Incident response

Google Cloud Architecture Framework

Security – Content filtering and protection

BSI C5:2020

OPS-01 – Operational monitoring; OPS-02 – Operational control

SOC 2 Type II

CC4.1 – Monitoring activities; CC6.1 – Logical access security

CSA STAR

CCM Security Incident Management; CCM Logging and Monitoring

CIS Controls v8

CIS 13 – Content Filtering