Sicherheit für lokale AI-Agenten – ein wachsendes Problem
AI-Agenten entwickeln sich vom passiven Textgenerator zur aktiven Software. Sie führen Shell-Commands aus, modifizieren Dateien, rufen APIs auf und browsen das Web. Das macht die Sicherheit zur kritischen Anforderung.
Existierende Sicherheitsansätze konzentrieren sich auf Model-Alignment und Input-Filtering. Das reicht nicht aus. Sie schützen nicht vor dem Moment, wenn die Absicht des Agenten zu einer echten Aktion auf einem echten System wird. Besonders in lokalen Umgebungen fehlt es an Runtime-Kontrolle – Entwickler lassen Agenten direkt gegen ihre eigenen Dateisysteme, Credentials und Infrastruktur arbeiten.
Was AgentWall leistet
AgentWall funktioniert als Policy-durchsetzende Middleware zwischen Agent und Host-System. Jede vorgeschlagene Aktion wird interceptiert, bevor sie ausgeführt wird.
Das Tool:
- Evaluiert gegen explizite Richtlinien: Declarative Policies definieren, welche Aktionen erlaubt sind
- Erzwingt Human-in-the-Loop: Sensible Operationen erfordern Genehmigung
- Logged alles: Vollständige Execution-Trails für Audit und Replay
- Funktioniert übergreifend: Integriert sich als MCP-Proxy und nativer OpenClaw-Plugin für Claude Desktop, Cursor, Windsurf, Claude Code und OpenClaw
Architektur und Performance
Die Implementierung basiert auf einer Policy-Enforcing-Architektur mit klarem Threat-Model. Tests zeigen 92,9% Policy-Enforcement-Accuracy bei Sub-Millisekunden-Overhead über 14 Benchmark-Tests – also praktisch keine Performance-Einbußen.
Das Design trennt Sicherheits-Enforcement von Agent-Logik. AgentWall arbeitet transparent zwischen bestehenden Tools und kann mit einem einzelnen Install-Command aktiviert werden.
Praktischer Nutzen
Für Entwickler, die lokale Agenten einsetzen, ist das relevant. Man gewinnt Kontrolle über gefährliche Operationen – ob versehentlich oder durch Prompt-Injection – ohne die Agentenlogik selbst zu verändern.
Das Tool adressiert eine echte Lücke: Während Sicherheitsforschung oft auf Training und Modellausrichtung fokussiert, passieren Fehler nicht im Modell, sondern bei der Ausführung. AgentWall setzt dort an.
Das Projekt ist Open-Source verfügbar und damit für Teams unmittelbar einsatzbar.

