Agent Safety

Agenten müssen:

  • In isolierten/sandgeboxten Umgebungen laufen

  • Guardrails haben (Inhaltsbeschränkungen, Content-Filter)

  • Fail-Safe-Mechanismen haben

Guardrails

  • Content-Filter

  • Aktions-Boundaries

  • Human-in-the-Loop für sensible Entscheidungen

Alignment

Agenten-Verhalten muss mit den organisatorischen Werten übereinstimmen.

Implementierungshinweise

  1. Content-Filter konfigurieren: Guardrails mit Content-Policies (Hass, Gewalt, sexuell, PII)

  2. Aktions-Boundaries definieren: IAM-Rollen mit Least-Privilege-Berechtigungen

  3. Fail-Safe-Mechanismen einrichten: Automatisches Herunterfahren oder Fallback bei Fehlschlag

  4. Regelmäßige Alignment-Tests: Agenten-Verhalten gegen organisatorische Werte testen

Best Practices

  • Verwenden Sie spezifische Guardrails für jede Domäne

  • Implementieren Sie Human-in-the-Loop für sensible Entscheidungstypen

  • Konfigurieren Sie automatische Alerts bei Guardrail-Verstößen

  • Dokumentieren Sie alle Sicherheits-Event-Logik

Evidenz

  • Guardrail-Konfiguration als Code (Terraform)

  • Content-Filter-Testberichte

  • Human-in-the-Loop Audit-Logs

  • Alignment-Test-Dokumentation