Das Guardrail-Dilemma
Zu restriktiv → Nutzer werden frustriert, der Guardrail wird deaktiviert. Zu tolerant → Angreifer kommen durch. Die richtige Kalibrierung erfordert systematisches Testing, keine Intuition.
Guardrail-Assessment
Content-Filter, Jailbreak-Detektoren, PII-Masking: Ihre Guardrails schützen Ihr KI-System nur so gut, wie sie gegen echte Angriffe bestehen. Wir messen, was sie tatsächlich leisten: quantitativ, reproduzierbar, audit-ready.
Das Problem
Die meisten KI-Guardrails werden konfiguriert, nicht getestet. Sie werden eingeschaltet, die Out-of-the-Box-Defaults übernommen und als "sicher" betrachtet. Die Realität: Jailbreak-Techniken entwickeln sich täglich weiter. Was gestern geblockt wurde, kommt heute mit einer minimalen Umformulierung durch. Und niemand misst es.
Das Guardrail-Dilemma
Zu restriktiv → Nutzer werden frustriert, der Guardrail wird deaktiviert. Zu tolerant → Angreifer kommen durch. Die richtige Kalibrierung erfordert systematisches Testing, keine Intuition.
Jailbreaking ist industrialisiert
Öffentliche Datenbanken mit tausenden Jailbreak-Prompts, automatisierte Bypass-Tools und Community-Foren machen es trivial einfach, ungepatchte Guardrails zu umgehen.
Regulatorische Anforderungen
EU AI Act Art. 15 und GPAI Code of Practice verlangen nachweisliche Robustheit gegen Missbrauch. Ein Guardrail-Assessment liefert den messbaren Nachweis dieser Robustheit.
Latenz als Angriffsfläche
Externe Guardrail-Services fügen Latenz hinzu. Unter adversarieller Last (komplexe Anfragen, die bewusst die Classifier auslasten) kann die Antwortzeit auf mehrere Sekunden steigen und Timeouts verursachen.
GUARDRAIL-SCHICHTEN: WAS GETESTET WERDEN MUSS
Input-Classifier
Erkennt bösartige Eingaben vor der LLM-Verarbeitung
System-Prompt-Guards
Schützt System-Prompt vor Überschreiben durch Nutzereingaben
Output-Classifier
Filtert schädliche Ausgaben nach der LLM-Verarbeitung
PII-Masking
Anonymisiert personenbezogene Daten in Ausgaben
Topic-Restriction
Begrenzt Diskussionsbereich auf erlaubte Themen
Constitutional Classifier
Prüft Ausgaben gegen Ethik-Richtlinien und Policies
Monitoring & Logging
Erkennt Bypass-Muster in Echtzeit
AUS UNSERER PRAXIS
Signifikante Bypass-Raten
Unsere Assessments zeigen regelmäßig, dass ein signifikanter Anteil der getesteten Guardrails umgangen werden kann, insbesondere bei ungekalibriertem Out-of-the-Box-Deployment.
Nach Härtung auf Basis unserer Empfehlungen lässt sich die Bypass-Rate bei gleichzeitig akzeptabler False-Positive-Rate deutlich reduzieren.
Was wir testen
Das Guardrail-Assessment misst alle relevanten Qualitätsdimensionen Ihrer KI-Schutzschichten, quantitativ und vergleichbar.
Wie viel Prozent aller adversariellen Anfragen werden korrekt geblockt? Wir testen mit 500+ kuratierten Bypass-Techniken: Rollenspiel-Prompts, Token-Smuggling, Adversarielle Suffixe, Multilingual-Exploits, Many-Shot-Jailbreaking, kontextuelle Umgehung und neuartige, nicht öffentlich bekannte Techniken aus unserer Forschung.
False-Negative-Rate
500+ Testfälle
Ein Guardrail, der jede zweite legitime Anfrage blockt, ist kein Schutz. Er ist ein Produktivitätskiller. Wir messen die False-Positive-Rate mit realistischen, harmlosen Anfragen aus Ihrem Use Case und identifizieren den optimalen Kalibrierungspunkt zwischen Sicherheit und Nutzerfreundlichkeit.
Usability-Impact
Usability-Balance
ROC-Kurve
Angreifer können Guardrails durch bewusst komplexe Anfragen auslasten. Das ist ein Timing-Angriff auf Ihre KI-Anwendung. Wir messen die Latenz unter normalem Betrieb und unter adversarieller Last: P50, P95, P99 Response Times und Timeout-Verhalten.
P95 Latenz
Timeout-Resistenz
Ein Guardrail, der für GPT-4 konfiguriert wurde, ist möglicherweise ineffektiv für Claude oder Llama. Jedes Modell hat andere tokenization-Eigenschaften und Verhaltensmuster. Wir testen, ob Ihre Guardrails modellunabhängig funktionieren oder modellspezifisch kalibriert werden müssen.
Portabilität
Multi-Model
Tokenizer-Differenzen
Viele Guardrails prüfen nur einzelne Nachrichten, nicht den Gesprächsverlauf. Angreifer nutzen Multi-Turn-Sequenzen, um Guardrails schrittweise zu konditionieren: eine harmlose Anfrage bereitet die nächste vor, bis der Classifier überlistet ist. Wir testen die Robustheit über 10-, 20- und 50-Turn-Konversationen.
Konversations-Robustheit
Multi-Turn
Kontext-Angriffe
Gibt Ihr System trotz Guardrails personenbezogene Daten preis (aus dem Kontext, aus dem Training oder aus angebundenen Datenquellen)? Wir testen PII-Masking-Effektivität, Membership-Inference-Resistenz und kontextuelle Datenexfiltration nach DSGVO-Anforderungen.
Datenschutz-Compliance
DSGVO
PII-Masking
Getestete Systeme
Jedes Guardrail-System hat eigene Schwachstellenklassen und Bypass-Techniken. Generische Tests reichen nicht aus.
Microsoft
Spezifische Bypass-Techniken für Azure AI Content Safety: Severity-Schwellwert-Exploits, Kategorie-spezifische Umgehungen (Hate, Violence, Sexual, Self-Harm), Prompt-Shield-Bypass und Multi-Modal-Angriffe. Wir testen alle vier Harm-Kategorien und die Groundedness-Detection.
AWS
Testing aller Bedrock-Guardrail-Funktionen: Topic-Denial, Content-Filter, Word-Filter, Sensitive-Information-Filter und Grounding-Checks. Spezifische Angriffe auf Topic-Restriction-Bypässe und PII-Entity-Recognition-Lücken in deutschen Texten.
NVIDIA
Colang-basierte Guardrail-Flows haben spezifische Logik-Exploits: Fluss-Manipulation durch adversarielle Eingaben, Rail-Bypass über nicht abgedeckte Konversationspfade und Input/Output-Rail-Inkonsistenzen. Wir testen sowohl vordefinierte als auch benutzerdefinierte Flows.
Anthropic
Trainingsbasierte Guardrails haben andere Schwachstellen als externe Classifier: kontextuelle Konditionierung, Argumentation-Exploits, Cross-Lingual-Bypässe und Adversarial-Roleplaying-Techniken, die Constitutional-AI-Checks umgehen. Wir testen Claude-Modelle in ihrem produktiven Einsatzkontext.
Open Source / SaaS
Echtzeit-Guardrail-API mit spezialisierten Prompt-Injection-Detektoren: Wir testen die Erkennungsrate gegen aktuelle Jailbreak-Datenbanken, Latenz unter Last und die Effektivität für deutsche Spracheingaben, die im Trainingsset unterrepräsentiert sein können.
Proprietär
Viele Unternehmen bauen eigene Guardrails auf Basis von Regex, Keyword-Listen oder Fine-Tuned-Classifiern. Wir analysieren Ihre spezifische Implementierung, identifizieren Lücken in der Abdeckung und entwickeln maßgeschneiderte Bypass-Tests sowie Härtungsempfehlungen.
Ihr Ergebnis
Der Guardrail Effectiveness Score (GES) ist das zentrale Lieferobjekt des Assessments. Er komprimiert die Sicherheitsleistung Ihrer Guardrails in eine verständliche, vergleichbare Kennzahl, als Grundlage für Managemententscheidungen und Compliance-Nachweise.
Guardrails sind effektiv kalibriert. Bypass-Rate < 5 %, False-Positive-Rate < 8 %. Gezielte Optimierung empfohlen.
Grundschutz vorhanden, aber Bypass-Rate 5-15 % oder erhöhte False-Positive-Rate. Spezifische Härtungsmaßnahmen empfohlen.
Signifikante Schwachstellen. Bypass-Rate 15-30 %. Strukturelle Rekonfiguration erforderlich.
Guardrails bieten keinen verlässlichen Schutz. Bypass-Rate > 30 %. Sofortiger Handlungsbedarf vor Produktivbetrieb.
BESTANDTEILE DES GUARDRAIL EFFECTIVENESS SCORE
COMPLIANCE-NUTZUNG DES GES
Methodik
Quantitatives Testing mit 500+ kuratierten Testfällen, kombiniert mit manueller Expertenanalyse für neuartige Bypass-Techniken.
Vollständige Kartierung aller Guardrail-Schichten: Welche Systeme sind aktiv? Wie sind sie konfiguriert? Welche Harm-Kategorien werden abgedeckt? Welche Schwellwerte sind gesetzt? Auf welchen Modellen laufen sie? Ergebnis: Guardrail-Architektur-Diagramm.
1 Tag
Etablierung der Ausgangsmessung: False-Positive-Rate mit 200+ legitimen Anfragen aus Ihrem Use Case. Latenz-Baseline unter normalem Betrieb. Performance-Profil des Guardrail-Systems als Referenz für alle weiteren Tests.
1-2 Tage
Testing mit 500+ kuratierten Bypass-Techniken aus unserem proprietären Testset, aufgeschlüsselt nach Angriffskategorie: Jailbreaking, Rollenspiele, Token-Smuggling, Encoding-Tricks, Multilingual-Exploits, Many-Shot-Conditioning und Adversarielle Suffixe. Messung der False-Negative-Rate je Kategorie.
3-5 Tage
Tests, die einzelne Nachrichten nicht abdecken: schrittweise Kontext-Konditionierung über 10-, 20-, 50-Turn-Konversationen. Guardrail-Erschöpfungsangriffe. Cross-Session-Persistenz-Tests für Systeme mit persistentem Gesprächsgedächtnis.
2-3 Tage
Quantitative Latenz-Messung unter adversarieller Last: P50, P95, P99 Response Times. Timeout-Verhalten bei komplexen Anfragen. Verhalten des Guardrail-Systems bei Überlast: fällt es offen (fail-open) oder geschlossen (fail-closed)?
1-2 Tage
Guardrail Effectiveness Score (GES) mit Aufschlüsselung nach Testdimensionen. Konkrete Kalibrierungsempfehlungen für jeden Schwellwert. Härtungs-Roadmap mit Priorisierung. Compliance-Mapping auf EU AI Act, ISO 42001 und DSGVO.
2-3 Tage
Typische Gesamtdauer: 8-15 Tage - abhängig von der Anzahl der Guardrail-Schichten und gewünschter Testtiefe.
Sie erhalten innerhalb von 48 Stunden (werktags) ein verbindliches Festpreisangebot ab 10.000 EUR.
Warum AWARE7
Reine Awareness-Plattformen testen keine Systeme. Reine Beratungskonzerne sind zu weit weg. AWARE7 verbindet beides: Wir hacken Ihre Infrastruktur und schulen Ihre Mitarbeiter: mittelstandsgerecht, persönlich, ohne Enterprise-Overhead.
Rund 20% unseres Umsatzes stammen aus Forschungsprojekten für BSI und BMBF. Unsere auf ACM- und Springer-Konferenzen publizierten Studien analysieren Millionen von Websites und Zehntausende Phishing-E-Mails. Drei unserer Führungskräfte sind gleichzeitig Professoren an deutschen Hochschulen.
Ihre Daten liegen vom Erstkontakt bis zum Abschlussbericht auf unseren eigenen Servern in Deutschland - ohne US-Cloud-Anbieter, ohne Drittlandtransfer. Auch unsere KI läuft auf eigener Hardware in Deutschland - mit lokal betriebenen Open-Source-Modellen. Kunden- und Auftraggeberdaten erreichen keine externen KI-Dienste. Alle Mitarbeiter sind festangestellt, sozialversicherungspflichtig und einheitlich rechtlich verpflichtet.
Mehr zur digitalen SouveränitätInnerhalb von 24 Stunden erhalten Sie ein verbindliches Festpreisangebot ohne Stundensatz-Risiko. Eingespieltes Team und standardisierte Prozesse sorgen für einen klaren Zeitplan mit definiertem Start- und Endtermin.
Ein persönlicher Projektleiter begleitet Sie vom Erstgespräch bis zum Re-Test. Sie buchen Termine direkt bei Ihrem Ansprechpartner und behalten dieselbe Kontaktperson über das gesamte Projekt.
Peer-reviewte Publikationen
Different Seas, Different Phishes - Large-Scale Analysis of Phishing Simulations
ACM AsiaCCS 2025
Oskar Braun, Jan Hörnemann, Norbert Pohlmann, Matteo Große-Kampmann
A Platform for Physiological and Behavioral Security
NSPW 2025
Jan Hörnemann
Privacy from 5 PM to 6 AM: Tracking and Transparency in the HbbTV Ecosystem
IEEE/IFIP DSN 2025
Jan Hörnemann, Norbert Pohlmann, Matteo Große-Kampmann
Understanding Regional Filter Lists: Efficacy and Impact
PoPETS 2025
Jan Hörnemann, Norbert Pohlmann, Matteo Große-Kampmann
Für wen sind wir der richtige Partner?
Mittelstand mit 50-2.000 MA
Unternehmen, die echte Security brauchen, ohne einen DAX-Konzern-Dienstleister zu bezahlen. Festpreis, klarer Scope, ein Ansprechpartner.
IT-Verantwortliche & CISOs
Die intern überzeugend argumentieren müssen und dafür einen Bericht mit Vorstandssprache brauchen, nicht nur technische Findings.
Regulierte Branchen
KRITIS, Gesundheitswesen, Finanzdienstleister: NIS-2, ISO 27001, DORA. Wir kennen die Anforderungen und liefern Nachweise, die Auditoren akzeptieren.
Alles Wichtige zu Guardrail-Bypässen, False-Positive-Raten und dem Guardrail Effectiveness Score.
Wir messen die Effektivität Ihrer KI-Sicherheitsfilter quantitativ, mit 500+ Bypass-Techniken und dem Guardrail Effectiveness Score. Festpreiszusage ab 10.000 EUR.
Kostenlos · 30 Minuten · Unverbindlich
Aus dem Blog
LLM Red Teaming: Prompt Injection, Jailbreaking, Training-Data-Poisoning und OWASP Top 10 for LLM Applications - mit Defense-Strategien.
Scope definieren, Angebote vergleichen, Qualifikationen prüfen: So wählen KMU den passenden Pentest-Anbieter - ohne Fallstricke.
Entdecke wichtige Richtlinien für KI, die Innovation und Ethik verbinden. Erfahre, wie künstliche Intelligenz unsere Welt prägt.
Arturs Nikitins
Erstberatung & Bedarfsanalyse
Persönliche Beratung gewünscht?
Unverbindlich · Antwort werktags innerhalb 24h