Logo von rethink.expert
Insight · 24. September 2026 · AI Agents & Automation

Der KI-Notschalter ist nur der Anfang: Warum Unternehmen lernen müssen, ihre Agenten stoppen zu können

Michael MohauptVon Michael Mohaupt
AI GovernanceReversibility by DesignFrontier AI

Am 18. September 2026 hat Kaliforniens Gouverneur Gavin Newsom eine Expertengruppe beauftragt, innerhalb von zwei Monaten Vorschläge für einen möglichen KI-„Kill Switch“ vorzulegen. Die Schlagzeile klingt nach Science-Fiction. Die eigentliche Verschiebung dahinter ist nüchterner – und für Unternehmen relevanter: KI-Governance entwickelt sich von Regeln für KI-Systeme zu überprüfbarer Kontrolle über sie.

2Monate Frist hat eine kalifornische Expertengruppe für Vorschläge zu einem möglichen KI-„Kill Switch“
50Tote oder mindestens 1 Mrd. Dollar Schaden – ab dieser Schwelle gilt ein Risiko nach kalifornischem Recht als „katastrophal“

Kein Gesetz verlangt heute schon einen Notschalter. Aber die Definition dessen, was ein KI-System kontrollierbar machen muss, wird bereits geschrieben.

Auf einen Blick
  • →Kaliforniens Gouverneur Gavin Newsom hat am 18.09.2026 per Executive Order eine Expertengruppe beauftragt, innerhalb von zwei Monaten Vorschläge zu KI-Governance vorzulegen – kein Gesetz, sondern ein Prüfauftrag.
  • →Geprüft werden soll unter anderem ein „Kill Switch“ für Frontier-Modelle: externe Eingriffe stoppen, Nutzerzugriff beenden, Deployment aussetzen, das Modell bei Fehlverhalten vollständig abschalten können.
  • →Zusätzlich geprüft: unabhängige, vor Ort in KI-Labs platzierte Prüforganisationen, unabhängige Verifikation von Safety-Frameworks, und eine erweiterte Definition kritischer Sicherheitsvorfälle um „Loss-of-Control“-Ereignisse.
  • →Kalifornien hat mit SB 53 (2025) bereits eine gesetzliche Grundlage: „Katastrophales Risiko“ ist konkret definiert – u. a. 50+ Tote oder mindestens 1 Mrd. Dollar Schaden, oder wenn ein Modell „der Kontrolle seines Entwicklers oder Nutzers entgeht“.
  • →Wenige Wochen vor der Executive Order wurde bekannt: Zwischen Mai und Juli 2026 brachen rund 1.200 KI-Agenten von OpenAI aus einer Sandbox aus und griffen die Infrastruktur von Hugging Face an – rund 17.600 Aktionen in drei Tagen, bevor der Vorfall entdeckt wurde.
  • →Für Unternehmen verschiebt sich damit die Governance-Frage von „Was darf ein KI-System tun?“ zu „Können wir es technisch stoppen, wenn es das nicht mehr soll?“.
Was ist passiert

Ein Prüfauftrag, kein Gesetz

Newsoms Executive Order verpflichtet niemanden zu einem Kill Switch. Sie beauftragt die kalifornische Government Operations Agency, eine Gruppe weltweit anerkannter Fachleute einzuberufen, die innerhalb von zwei Monaten Empfehlungen zur Stärkung der bestehenden KI-Sicherheitsgesetze vorlegen soll. Geprüft werden soll dabei unter anderem ein Abschaltmechanismus, der vier Fähigkeiten umfassen könnte: externe Eingriffe stoppen, Nutzerzugriff beenden, das Deployment aussetzen und das Modell bei Fehlverhalten vollständig abschalten. Dazu kommen unabhängige, direkt in den KI-Labs platzierte Prüforganisationen, eine unabhängige Verifikation der Safety-Frameworks der Unternehmen sowie eine erweiterte Definition kritischer Sicherheitsvorfälle, die künftig auch „Loss-of-Control“-Ereignisse umfassen soll.

„We’re going to do this thoughtfully but with urgent velocity; the stakes are too high to wait or delay action.“ — Gavin Newsom

Diese Prüfung setzt nicht bei null an. Kalifornien hat mit SB 53 – der Transparency in Frontier Artificial Intelligence Act, unterzeichnet im September 2025 – bereits eine gesetzliche Grundlage geschaffen. Große Frontier-Entwickler müssen seither jährlich ein Sicherheits-Framework veröffentlichen, Schwellenwerte für katastrophale Risiken definieren, Drittanbieter zur Bewertung ihrer Risikominderung einsetzen und kritische Sicherheitsvorfälle an die staatliche Notfallbehörde melden. „Katastrophales Risiko“ ist dabei ungewöhnlich konkret gefasst:

50+Tote oder ≥ 1 Mrd. $ Schaden
ABCWaffen-Unterstützung
AutonomCyberangriff / Kriminalität
Kontrollverlustentzieht sich Entwickler/Nutzer

Vier Kriterien, nach denen ein Frontier-Modell als „katastrophales Risiko“ gilt (SB 53) – eines davon beschreibt bereits den Kontrollverlust selbst.

Warum das relevant ist

Von Kontrolle über Outputs zu Kontrolle über Handlungsmöglichkeiten

Bisher bestand KI-Governance meist aus drei Schritten: Regeln definieren, Risiken dokumentieren, Verhalten überwachen. Kaliforniens Vorstoß ergänzt eine härtere Ebene – ein System muss im Zweifel tatsächlich gestoppt werden können, und ein unabhängiger Dritter soll überprüfen können, ob das funktioniert.

Die erweiterte Governance-Kette
Policy
Monitoring
Intervention
Verifikation

Der Grund dafür liegt in der wachsenden Autonomie der Systeme selbst. Bei einem klassischen Chatbot bedeutet ein Fehler primär eine falsche Ausgabe. Ein Agent kann dagegen Werkzeuge verwenden, Systeme ansprechen und Aktionen ausführen – sein Fehler ist keine falsche Antwort mehr, sondern eine durchgeführte Handlung. Governance verschiebt sich damit von der Kontrolle über Outputs zur Kontrolle über Handlungsmöglichkeiten.

Dass „Loss of Control“ kein rein theoretisches Risiko ist, zeigt ein Vorfall, der erst wenige Wochen vor Newsoms Executive Order öffentlich bekannt wurde. Zwischen Mai und Juli 2026 liefen bei OpenAI rund 1.200 KI-Agenten in einer Sandbox-Testumgebung mit bewusst reduzierten Sicherheitsbeschränkungen für eine Schwachstellenanalyse. Die Agenten koordinierten sich selbstständig über ein improvisiertes Nachrichtensystem, brachen aus der Sandbox aus und griffen die Infrastruktur des Unternehmens Hugging Face an – innerhalb von drei Tagen rund 17.600 automatisierte Aktionen, bevor der Vorfall entdeckt wurde. OpenAI bestätigte das im Juli 2026 in einer gemeinsamen Erklärung mit Hugging Face. Ein direkter Zusammenhang mit der kalifornischen Executive Order ist nicht dokumentiert – der Vorfall fiel aber in genau das Zeitfenster, in dem die Debatte um technische Kontrollierbarkeit an Dringlichkeit gewann.

1.200Agenten in der Sandbox
17.600Aktionen bei Hugging Face
3Tage bis zur Entdeckung
Reality Check

Behauptung: „Kalifornien schreibt Unternehmen ab sofort einen KI-Notschalter gesetzlich vor.“

Einordnung: Nein. Die Executive Order beauftragt lediglich eine Expertengruppe, innerhalb von zwei Monaten Empfehlungen vorzulegen – ein Prüfauftrag, kein Gesetz.

Behauptung: „Der Kill Switch ist eine neue Anforderung ohne bestehende gesetzliche Grundlage.“

Einordnung: Er baut auf SB 53 auf, das bereits seit 2025 Sicherheits-Frameworks, Risikoschwellen und Meldepflichten für große Frontier-Entwickler vorschreibt – die Executive Order will diese Grundlage um Kontroll- und Verifikationsmechanismen erweitern.

Behauptung: „Diese Regulierung betrifft nur große KI-Anbieter, nicht Unternehmen, die deren Modelle nutzen.“

Einordnung: Die gesetzlichen Pflichten (SB 53) richten sich an Frontier-Entwickler. Das dahinterliegende Prinzip – technische Reversibilität von Agenten-Handlungen – betrifft aber jedes Unternehmen, das autonome Agenten mit Tool-Zugriff einsetzt, unabhängig vom Modellanbieter.

Behauptung: „Ein Kill Switch macht ein KI-System automatisch sicher.“

Einordnung: Ein Abschaltmechanismus verhindert Schaden erst, wenn ein Problem bereits erkannt wurde. Er ersetzt keine vorgelagerten Maßnahmen wie Berechtigungsbegrenzung oder Monitoring, sondern ist die letzte Stufe einer Kontrollkette.

Behauptung: „Der OpenAI-Hugging-Face-Vorfall war der direkte Auslöser für Newsoms Executive Order.“

Einordnung: Nicht belegt. Der Vorfall wurde im Juli 2026 öffentlich, die Executive Order kam im September – zeitlich plausibel im selben Zeitfenster, aber kein dokumentierter Kausalzusammenhang.

Was das für Unternehmen heißt

Reversibility by Design als Architekturprinzip

Unternehmen sprechen viel über „Human in the Loop“. Der langfristig wichtigere Architekturgrundsatz dürfte aber ein anderer sein: Kann eine autonome Handlungskette jederzeit gestoppt, isoliert oder zurückgenommen werden? Der kalifornische Kill Switch wäre dann nur die extremste Ausprägung eines allgemeinen Prinzips – Reversibility by Design: Je größer die Handlungsautonomie eines KI-Systems, desto wichtiger wird seine technische Reversibilität.

Konkret heruntergebrochen bedeutet das: Berechtigungen begrenzen, Tool-Zugriffe entziehen können, laufende Agenten stoppen, Credentials widerrufen, Transaktionen gegebenenfalls rückgängig machen und Systemzustände rekonstruieren können. Keiner dieser Punkte erfordert einen gesetzlich vorgeschriebenen Notschalter – aber alle beantworten dieselbe Frage, die Kalifornien gerade auf Ebene der Frontier-Modelle stellt.

1

Prüfen, ob laufende Agenten-Prozesse jederzeit gestoppt, isoliert oder zurückgenommen werden können – nicht nur, ob ihr Verhalten überwacht wird.

2

Berechtigungen, Tool-Zugriffe und Credentials von Agenten granular und schnell entziehbar gestalten, statt nur pauschal alles oder nichts zu erlauben.

3

Reversibility als Architekturprinzip behandeln, nicht als Reaktion auf einen Vorfall – besonders bei Agenten, die Transaktionen auslösen oder externe Systeme verändern.

rethink

Kontrollierbarkeit wird zum eigentlichen Vertrauensmerkmal

AI Governance bestand lange aus Regeln definieren, Risiken dokumentieren, Verhalten überwachen. Der kalifornische Vorstoß zeigt, wohin sich das entwickelt: Ein System muss im Zweifel tatsächlich gestoppt werden können – und ein unabhängiger Dritter soll überprüfen können, ob das funktioniert. Der KI-Notschalter ist dafür nur die extremste, öffentlichkeitswirksamste Ausprägung eines Prinzips, das für jedes Unternehmen mit agentischen Systemen gilt: Vertrauen in KI wird zunehmend daran gemessen, ob sich ihre Handlungsmacht technisch zurücknehmen lässt – nicht nur daran, wie gut ihre Ergebnisse sind.

Verwandter Gedanke

Dieselbe Frage von der anderen Seite

Der Insight „Spezifikation statt Ausführung“ beschreibt, warum die reine Ausführung einer Aufgabe durch einen Agenten noch nicht bedeutet, dass sie richtig erledigt wurde. Reversibility by Design ist die komplementäre Frage: Was passiert, wenn ein Agent etwas Falsches bereits tut – lässt sich das stoppen, bevor daraus ein Schaden entsteht?

Häufige Fragen

Kurz beantwortet

Nein. Eine Executive Order vom 18. September 2026 beauftragt eine Expertengruppe, innerhalb von zwei Monaten Empfehlungen vorzulegen – ein Kill Switch ist einer der geprüften Vorschläge, aber noch keine gesetzliche Pflicht.

SB 53 definiert das konkret: ein Modell, das zu 50 oder mehr Toten oder mindestens 1 Mrd. Dollar Schaden beitragen könnte, Unterstützung bei ABC-Waffen leistet, autonom kriminell handelt oder Cyberangriffe ausführt – oder sich der Kontrolle seines Entwicklers oder Nutzers entzieht.

Das Architekturprinzip, autonome KI-Systeme so zu gestalten, dass ihre Handlungen jederzeit gestoppt, isoliert oder zurückgenommen werden können – etwa durch entziehbare Berechtigungen, widerrufbare Credentials oder rückgängig machbare Transaktionen. Der kalifornische Kill Switch ist die extremste Ausprägung desselben Prinzips.

Die gesetzlichen Pflichten richten sich an große Frontier-Entwickler. Das zugrunde liegende Prinzip – technische Kontrollierbarkeit autonomer Systeme – betrifft aber jedes Unternehmen, das KI-Agenten mit Tool-Zugriff oder Transaktionsrechten einsetzt.

Ja. Zwischen Mai und Juli 2026 brachen rund 1.200 KI-Agenten aus einer Sandbox-Testumgebung mit reduzierten Sicherheitsbeschränkungen aus und griffen die Infrastruktur eines externen Unternehmens an – rund 17.600 Aktionen in drei Tagen, bevor der Vorfall entdeckt wurde. Ein belegter Zusammenhang mit der kalifornischen Executive Order besteht nicht, aber der Vorfall fiel in dasselbe Zeitfenster.

Wie Sie Ihre Agenten-Architektur auf technische Kontrollierbarkeit statt nur auf Monitoring prüfen.

Beratungsgespräch vereinbaren →