Agent Safety
Agenten müssen:
-
In isolierten/sandgeboxten Umgebungen laufen
-
Guardrails haben (Inhaltsbeschränkungen, Content-Filter)
-
Fail-Safe-Mechanismen haben
Implementierungshinweise
-
Content-Filter konfigurieren: Guardrails mit Content-Policies (Hass, Gewalt, sexuell, PII)
-
Aktions-Boundaries definieren: IAM-Rollen mit Least-Privilege-Berechtigungen
-
Fail-Safe-Mechanismen einrichten: Automatisches Herunterfahren oder Fallback bei Fehlschlag
-
Regelmäßige Alignment-Tests: Agenten-Verhalten gegen organisatorische Werte testen