Wo steht AI Secure Code Generation wirklich?
KI-Systeme generieren zunehmend Code – doch wie sicher ist dieser Code eigentlich? Eine neue Systematisierung ("SoK") von Forschern zeigt: Das Bild ist differenzierter als oft angenommen.
Das Kernproblem: Knowledge-Actuation Gap
Die Studie führt einen dreistufigen Rahmen ein, um die Qualität von AI Secure Code Generation zu messen:
- Verständnis auf Sprachebene: Können Modelle sicherheitsrelevante Prinzipien in Text verstehen und erklären?
- Umsetzung auf Code-Ebene: Generieren sie tatsächlich sichere Code, wenn sie diese Prinzipien anwenden sollen?
- Knowledge-Actuation Gap: Wie groß ist die Lücke zwischen Wissen und tatsächlicher Ausführung?
Das zentrale Ergebnis ist überraschend: Das Verständnis von Sicherheitsprinzipien ist ein starker Prädiktor für sichere Code-Ausgaben – aber die Lücke zwischen Wissen und Umsetzung bleibt erheblich.
Was funktioniert, was nicht
Die Forscher testeten verschiedene Ansätze:
- Prompting-Strategien
- Fine-tuning auf Sicherheitsdaten
- Reinforcement Learning
- Agentic Workflows (KI-Agenten mit mehreren Iterationen)
Alle diese Techniken wurden auf zwei Arten von Herausforderungen getestet: isolierte Funktionen und vollständige Web-Anwendungen. Dabei zeigte sich: Modelle können Security-Prinzipien erkennen, scheitern aber oft bei der konsistenten Implementierung.
Konkrete Probleme
Ein Modell könnte beispielsweise verstehen, dass SQL-Injections durch Prepared Statements verhindert werden. Im generierten Code verwendet es diese Verteidigung dann aber möglicherweise nicht korrekt oder vergisst sie in kritischen Stellen. Auch funktionale Korrektheit und Sicherheit kollidieren manchmal: Code ist sicher, funktioniert aber nicht richtig – oder umgekehrt.
Pfade nach vorne
Die Studie schlägt konkrete Verbesserungen vor:
- Principle-guided Generation: Sicherheitsprinzipien nicht nur verstehen, sondern direkt in den Generierungsprozess einweben
- Bessere Benchmarks: Evaluation auf realistischeren Szenarien als nur isolierte Funktionen
- Agentische Workflows optimieren: Mehrere Iterationen mit Feedback-Schleifen können die Umsetzung verbessern
Praktische Implikation
Für Entwickler heißt das: KI-generierter Code sollte niemals blind vertraut werden – auch nicht, wenn das Modell Sicherheit "zu verstehen" scheint. Die fehlende Konsistenz bei der Umsetzung macht manuelle Review und Testing nach wie vor unverzichtbar.
Die Systematisierung bietet dabei einen strukturierten Weg, um zu verstehen, wo KI-Systeme scheitern und wie man sie gezielt verbessert.

