In der System Card zu Claude Opus 5 steht eine Zahl, die man zweimal liest: Bei Browser-Agenten liegt die Erfolgsquote von Prompt Injections über 129 Testszenarien bei 0%. Prompt Injection meint den Trick, einem Modell über manipulierte Eingaben neue Anweisungen unterzuschieben, etwa über versteckten Text auf einer Webseite. OpenAI hatte im Dezember eingeräumt, das Problem sei möglicherweise nie vollständig lösbar.
Die Null gilt allerdings nur mit eingeschaltetem Auto Mode, wie er etwa in Claude Cowork läuft. Auto Mode stapelt zwei Verteidigungsschichten: Eine durchsucht eingehende Daten nach versteckten Anweisungen, bevor das Modell sie überhaupt sieht, die andere blockiert gefährliche Aktionen vor der Ausführung. Ein Angreifer muss beide unabhängig voneinander überwinden. Ohne diese Schichten liegt Opus 5 bei 3,7%, und Sonnet 5 schneidet mit 0,93% sogar besser ab. Im allgemeinen Prompt-Injection-Test der Sicherheitsfirma Gray Swan sank die Erfolgsquote nach 15 Versuchen von 5,5% bei Opus 4.8 auf 2,0%, gefolgt von Mythos 5 mit 2,6% und Fable 5 mit 2,8%.
Für alle, die einen KI-Agenten im Browser arbeiten lassen, ist das die interessanteste Zahl des Monats. Prompt Injection war bisher der Grund, warum man solchen Agenten besser nicht die eigenen Mails, Konten und Formulare überlässt. Nicht das Modell allein macht den Unterschied, sondern die Kombination aus Modell und Schutzsoftware. Wer also die Null will, muss die Software mitbenutzen, in der sie gemessen wurde. Was ein Browser-Agent überhaupt anstellen kann, zeigt unser Text zur Claude-Erweiterung für Chrome.
Einschränkung, und sie wiegt: Die Zahlen stammen aus Anthropics eigener System Card, unabhängige Nachprüfungen stehen aus. 129 Szenarien sind ein Testfeld, kein Internet. Angreifer wiederum lesen System Cards auch. Bis zur ersten dokumentierten Umgehung ist die Null eine Momentaufnahme, keine Eigenschaft. Wer sich für die Ansteckungswege zwischen Agenten interessiert, findet dazu hier eine längere Überlegung.
Quellen
- Anthropic: Claude Opus 5 System Card
- The Decoder: Opus 5 may have solved browser-based prompt injection, the biggest security flaw haunting AI agents
Ähnliche News
- OpenAI Presence löst 75 Prozent der Anrufe ohne Menschen
- Mistral OCR 4 erkennt 170 Sprachen und bleibt auf deinem Server
- Vier Prozent klicken zur Quelle, der Rest glaubt der KI
Diese Meldung wurde mit Unterstützung von Claude (Anthropic) recherchiert und verfasst. Inhaltliche Fehler sind möglich. Die verlinkten Quellen ermöglichen eine eigene Prüfung. Fachbegriffe erläutert das Glossar.