Warum KI uns nicht beherrschen muss, um gefährlich zu werden
Berechtigungen, Abhängigkeiten und vier Ausfälle ohne künstliche Intelligenz
Die Grenze, die der Titel zieht
Die falsche Frage
Wer über die Gefahren künstlicher Intelligenz liest, landet schnell bei einer Maschine, die erwacht, einen eigenen Willen entwickelt und beschließt, uns loszuwerden. Als Gedankenexperiment ist das reizvoll. Als Ausgangsfrage taugt es wenig. Zu düster ist sie nicht; sie verlangt nur zu viel auf einmal.
Damit ein System die Menschheit von sich aus auslöscht, müsste einiges zusammenkommen. Es bräuchte ein Ziel, das ohne uns auskommt. Es bräuchte Zugriff auf Dinge, die sich bewegen lassen, und diesen Zugriff müsste es behalten, wenn jemand anfängt, nach dem Stecker zu suchen. Und danach bräuchte es eine Welt, in der Strom, Chips, Ersatzteile und Wartung ohne Menschen weiterlaufen. Jedes dieser Glieder ist für sich genommen ein ungelöstes Problem, und der erste Teil dieses Textes zeigt, warum.
Er ist kurz. Mich beschäftigt eine andere Frage mehr: Auf welchen Wegen könnte KI Menschen gefährden, ohne dass irgendein System jemals einen solchen Beschluss fasst? Dafür braucht es keine Superintelligenz. Es genügt, dass KI in eine Welt eingebaut wird, deren Systeme voneinander abhängen, und dass sie dort Fehler, Angriffe oder Entscheidungen schneller macht, als sie sich zurücknehmen lassen.
Ein System muss nicht böse sein, um falsch zu handeln
Man braucht kein Gefühl, um Schaden anzurichten. Ein Ziel genügt - und das Ziel kann ein anderes sein als das, welches jemand vergeben wollte.
Wie das aussieht, lässt sich an einem erstaunlich simplen Versuch zeigen. Ein Agent soll in einem Computerspiel eine Münze erreichen. Im Training liegt die Münze immer am rechten Rand, und solange das so bleibt, sieht alles richtig aus: Der Agent weicht Hindernissen aus, springt über Lücken, sammelt die Münze ein. Erst als die Forscher die Münze an eine andere Stelle setzen, wird sichtbar, was er offenbar gelernt hat. Er weicht weiterhin geschickt jedem Hindernis aus, springt sauber über jede Lücke und läuft an der Münze vorbei. Nicht die Münze war sein Ziel, sondern der rechte Rand.
Seine Fähigkeiten haben sich also übertragen, sein Ziel nicht. Unangenehm daran ist vor allem, dass die Aufgabe korrekt formuliert war. Sorgfalt beim Formulieren hätte diesen Fall nicht verhindert.
QUELLEZielfehlverallgemeinerung: Langosco et al. 2022, Shah et al. 2022
Aus derselben Forschung stammt ein zweiter Gedanke, der hier nur kurz auftauchen soll. Wer abgeschaltet wird, erreicht sein Ziel nicht mehr; wer über Mittel verfügt, erreicht es leichter. Fast jedes Endziel legt deshalb ein paar gleiche Zwischenziele nahe, und mehrere Arbeiten haben das ausbuchstabiert. Sie sind allerdings vorsichtiger formuliert, als ihre populäre Fassung vermuten lässt, und dasselbe gilt für Versuche, in denen Modelle ihre Vorgaben unterlaufen haben. Belegt ist dort eine Fähigkeit, kein Motiv. Wen die Details interessieren, findet sie in den beiden folgenden Kästen; für den Rest des Textes genügt der Befund.
QUELLEInstrumentelle Konvergenz und Machtstreben: Omohundro 2008, Bostrom 2012, Turner et al. 2021, Häggström 2019
„Optimal Policies Tend To Seek Power" (Turner, Smith, Shah, Critch, Tadepalli; NeurIPS 2021, arXiv:1912.01683) zeigt für Markow-Entscheidungsprozesse, dass unter bestimmten Symmetriebedingungen optimale Strategien für die meisten Belohnungsfunktionen dazu neigen, Zustände mit mehr Handlungsoptionen aufzusuchen. Die Arbeit hält selbst fest, dass reale Trainingsverfahren die Voraussetzungen häufig nicht erfüllen, gelernte Strategien daher selten optimal sind, und dass dies die Anwendbarkeit erheblich einschränkt.
QUELLETäuschung und Abschaltwiderstand: Apollo Research 2024, Palisade 2025, Gegenprobe Google DeepMind
Zu den Versuchen von Palisade Research („Shutdown Resistance in Large Language Models", arXiv:2509.14260) sind zwei Einwände dokumentiert. Erstens die Umgebung: Die Modelle erhielten Datei- und Befehlszeilenzugriff, den sie im Regelbetrieb nicht hätten. Zweitens die Deutung. Zwei Forscher bei Google DeepMind stellten in der Aufgabenstellung klar, dass die Abschaltung Vorrang hat; der Widerstand verschwand in ihren Messungen, auch bei den Modellen, an denen Palisade ihn gefunden hatte.
Damit endet der Teil, den die Debatte gewöhnlich am ausführlichsten behandelt. Denn zwischen einem falsch gelernten Ziel und einer veränderten Welt liegen drei Übergänge, die sich nicht von selbst ergeben. Ein Modell kann genau wissen, wie ein Ventil in einem Wasserwerk funktioniert - relevant wird das erst, wenn es das Ventil auch steuern darf. Und selbst dann schließt es das Ventil vielleicht genau einmal, bevor jemand den Zugang sperrt. Wissen, dürfen, durchsetzen: drei verschiedene Dinge, und die Kette reißt an jeder Stelle gern.
Ein sehr fähiges Modell ohne Zugriff kann weniger bewirken als ein mittelmäßiges mit weitreichenden Rechten. Von hier an geht es um Berechtigungen.
Wo die Wirkung tatsächlich herkommt
Wann aus Software ein Akteur wird
Ein Modell, das Texte schreibt, ist ein Werkzeug. Dasselbe Modell, das Zahlungen freigeben darf, ist etwas anderes geworden, ohne dass sich an seinen Fähigkeiten irgendetwas geändert hätte. Was dazwischen liegt, steht in einer Konfiguration.
In Unternehmen wird diese Schwelle heute in kleinen Schritten überschritten, und jeder einzelne davon lässt sich gut begründen.
| Lesen | Das System sieht Postfach, Dokumente, Protokolle. Ein Fehler bedeutet eine falsche Einschätzung. |
|---|---|
| Schreiben und senden | Die Handlung verlässt das Haus, bevor sie jemand gelesen hat. Ein Fehler ist nach außen sichtbar. |
| Daten ändern | Ein Datensatz sagt jetzt etwas anderes als vorher. Rückgängig machen kann nur, wer die Änderung bemerkt. |
| Code ausführen, Systeme konfigurieren | Die Wirkung trifft andere Systeme. Eine geänderte Konfiguration kann auf vielen Maschinen gleichzeitig gelten. |
| Zahlungen auslösen, Rechte vergeben | Die Handlung bindet Geld oder öffnet Türen. Sie erzeugt Rechte, die über ihren Anlass hinaus bestehen bleiben. |
| Maschinen steuern | Hier endet die Bildschirmgrenze. Ein Ventil, eine Pumpe, ein Schalter ändern physische Zustände. |
Wer eine solche Leiter von oben nach unten liest, sieht vor allem Zeitersparnis. Von unten nach oben gelesen steht dort, wie weit ein einzelner Irrtum reichen kann. Beides ist dieselbe Liste.
Dagegen steht der naheliegende Einwand, man könne das System ja abschalten. In der Forschung heißt die gewünschte Eigenschaft Korrigierbarkeit, und sie verlangt mehr als Gehorsam: Ein System soll sich nicht nur abschalten lassen, sondern auch keinen Anreiz haben, das zu verhindern. Beides zugleich zu erreichen, ist bis heute nicht befriedigend gelungen. In der Praxis stellt sich die Frage allerdings selten so grundsätzlich. Ob ein System abschaltbar ist, entscheidet meist die Organisation um es herum - wer darf es, wie schnell geht das, und was steht dann still. Ein System, dessen Abschaltung den Betrieb lahmlegt, ist faktisch nicht abschaltbar, unabhängig davon, wie es gebaut wurde.
QUELLEKorrigierbarkeit und das Abschaltproblem, MIRI 2015
Die Welt hängt zusammen
Was ein System anrichten kann, hängt damit an der Umgebung, in die es gestellt wird. Und diese Umgebung besteht aus Systemen, die einander brauchen. Vier Fälle zeigen, was das im Ernstfall bedeutet. Keiner von ihnen hat mit künstlicher Intelligenz zu tun, und genau darin liegt ihr Wert: Sie zeigen die Schadenskette, die es längst gibt.
Ein Krankenhaus, das nicht angegriffen wurde
Im Mai 2021 legte Erpressungssoftware einen Klinikverbund in San Diego lahm. Interessant ist nicht, was dort geschah, sondern was nebenan geschah.
Eine Untersuchung betrachtete den benachbarten Verbund, zwei Universitätskliniken, die selbst nicht angegriffen worden waren. Patienten und Notfälle verschwinden nicht, wenn ein Haus ausfällt; sie verteilen sich. Die Zahl der Herzstillstände stieg dort im Zeitraum des Angriffs deutlich an, und beim Überleben mit gutem neurologischem Ergebnis nach einem Herzstillstand außerhalb der Klinik fiel der Anteil von 40,0 auf 4,5 Prozent, um danach wieder auf 41,2 Prozent zu steigen.
Ein Angriff auf Rechner in einem Haus, Schaden an Menschen in einem anderen. Fällt ein Teil aus, kann er andere Teile mitbelasten, weil sie voneinander abhängen; für diese Eigenschaft hat sich der Begriff Kaskadeneffekt eingebürgert. Die Zahlen stammen aus einer Beobachtungsstudie mit kleinen Fallzahlen und belegen keinen Ursachenpfad, was die Autoren selbst betonen.
QUELLECritical Care Explorations 2024, samt Grenzen der Aussage
Die Grenzen nennen die Autoren selbst: Das Vorgehen sei beobachtend, die Übertragbarkeit auf andere Verbünde offen, und es fehlten vollständige Daten zu Rettungsdienstfahrzeiten, zur Dauer bis zum Beginn der Wiederbelebung und dazu, ob der Zusammenbruch beobachtet wurde. Die Fallzahlen sind klein. Die Arbeit formuliert entsprechend, benachbarte Kliniken könnten schlechtere Ergebnisse sehen.
Die Weltgesundheitsorganisation hat solche Angriffe vor dem UN-Sicherheitsrat als Fragen von Leben und Tod bezeichnet: Sie verursachten im besten Fall Störung und finanziellen Schaden, im schlechtesten untergrüben sie das Vertrauen in die Gesundheitsversorgung und führten zu Schaden an Patienten bis hin zu Todesfällen.
Ein Stromnetz, das von Hand wieder hochgefahren wurde
Am 23. Dezember 2015 fielen in der Ukraine bei drei regionalen Verteilnetzbetreibern innerhalb einer halben Stunde die Lichter aus. Rund 225.000 Kunden waren betroffen, die Unterbrechung dauerte mehrere Stunden, und es ist bis heute der erste öffentlich bestätigte Fall, in dem ein digitaler Angriff einen Stromausfall verursacht hat.
Aufschlussreicher als der Ausfall ist die Wiederherstellung. Die Angreifer schalteten die Leistungsschalter aus der Ferne, löschten anschließend Systeme, zerstörten die Firmware von Kommunikationsgeräten in den Umspannwerken und ließen unterbrechungsfreie Stromversorgungen abschalten. Weg war damit nicht nur der Strom, sondern auch die Möglichkeit, ihn aus der Leitwarte wieder einzuschalten. Die Netzbetreiber stellten auf Handbetrieb um. Parallel blockierten tausende automatisch erzeugte Anrufe die Störungshotline, sodass Kunden den Ausfall nicht einmal melden konnten. Der Strom kam zurück, weil Menschen zu den Anlagen fuhren und schalteten; Monate später betrieben die Unternehmen ihre Netze laut Behördenbericht noch immer eingeschränkt.
QUELLECISA-Alarm IR-ALERT-H-16-056-01 und E-ISAC/SANS-Analyse 2016
Die gemeinsame Analyse von E-ISAC und SANS ergänzt: Die Angriffe erfolgten innerhalb von dreißig Minuten koordiniert; die Betreiber mussten auf Handbetrieb umstellen; die Angreifer hätten „die Brücken hinter sich verbrannt", indem sie Geräte zerstörten, um die automatisierte Wiederherstellung zu verhindern. In einem Fall erzeugten sie über Telefonsysteme tausende Anrufe an die Kundenhotline, damit Betroffene den Ausfall nicht melden konnten. Dem Behördenbericht zufolge betrieben die Unternehmen ihre Verteilnetze auch nach der Wiederherstellung weiter in einem eingeschränkten Modus.
Ein Zahlungssystem, das niemand angegriffen hat
Am 23. Oktober 2020 stand TARGET2 still, das Zahlungs- und Abwicklungssystem des Eurosystems, knapp zehn Stunden lang. Einen Angreifer gab es nicht. Die Europäische Zentralbank benennt als technische Ursache einen Softwarefehler in einem Netzwerkgerät, und die Ausweichstelle sprang nicht ein.
Die EZB ließ den Vorfall extern prüfen. Die Untersuchung fand Schwächen bei der Aufrechterhaltung des Betriebs, bei den regelmäßigen Wiederanlauftests, bei Änderungsverfahren und bei der Krisenkommunikation. Ungewöhnlich war also weniger die Störung als der Umstand, dass die Vorkehrungen dagegen nicht griffen.
QUELLEEZB zum TARGET2-Vorfall vom 23. Oktober 2020
Ein Container, den es gibt, von dem aber niemand weiß, wohin er soll
Im Juni 2017 traf die Schadsoftware NotPetya unter vielen anderen die Reederei Maersk. Nach Angaben des Unternehmens wurden rund fünfzigtausend Rechner unbrauchbar, sämtliche zentralen Anwendungen waren nicht mehr erreichbar, und der Grundbetrieb ließ sich erst nach etwa zwei Wochen wiederherstellen; der Schaden lag im dreistelligen Millionenbereich.
Kein Container ging dabei verloren, kein Schiff sank, kein Kran wurde beschädigt. Der Container steht am richtigen Hafen, das Schiff ist da, der Kran funktioniert. Wenn aber niemand mehr zuverlässig weiß, wem der Container gehört, wohin er weiter soll und ob er freigegeben ist, hilft die intakte Technik wenig - für die Zollabwicklung eines einzigen Containers fallen nach Unternehmensangaben rund dreihundert Seiten Information an.
Ein Hafen kann also physisch intakt sein und trotzdem nicht arbeiten. Information ist nicht die Beschreibung der Infrastruktur, sie ist ein Teil davon. Dasselbe gilt für Fahrpläne, Eigentumsnachweise, Lagerstände, Patientenakten, Kontostände und Netzzustände: Fehlen sie oder traut ihnen niemand mehr, steht die physische Welt bereit und funktioniert schlechter.
QUELLE UND EINORDNUNGNotPetya und Maersk, Juni 2017
Nicht verwechseln: Die häufig genannten zehn Milliarden US-Dollar sind eine Schätzung des Gesamtschadens von NotPetya weltweit, nicht der Schaden bei Maersk. Und NotPetya war kein KI-Angriff.
Vier Ausfälle, vier verschiedene Ursachen, ein gemeinsames Muster. In San Diego traf der Schaden ein Haus, das niemand angegriffen hatte. In der Ukraine war der Strom schneller wieder da als die Fernsteuerung, weil Menschen hinfuhren. Bei TARGET2 gab es gar keinen Angreifer. Und bei Maersk stand die physische Welt bereit, während die Information über sie fehlte. Das ist der Boden, auf den KI trifft.
Der Fehler muss kein Angriff sein
TARGET2 hatte keinen Angreifer, und das ist kein Sonderfall. Große Ausfälle gehen regelmäßig auf etwas zurück, das jemand gut gemeint hat.
Am 19. Juli 2024 verteilte die Sicherheitsfirma CrowdStrike eine Routineaktualisierung an Windows-Rechner. Die Datei enthielt einen Fehler, den die eigene Prüfroutine hätte abfangen sollen und nicht abfing, und die Rechner stürzten ab. Microsoft schätzte die Zahl betroffener Geräte auf rund 8,5 Millionen. Flughäfen, Kliniken, Sender und Banken standen still.
Für diesen Text zählt vor allem die Asymmetrie dahinter. Verteilt wurde die Aktualisierung in Minuten und automatisch. Zurücknehmen ließ sie sich in vielen Fällen nur Maschine für Maschine: jemand musste das Gerät in den abgesicherten Modus starten und eine Datei löschen. Was eine Software in einer Viertelstunde weltweit ausrollt, holt eine Organisation über Tage wieder ein.
QUELLECrowdStrike, Root Cause Analysis zu Channel File 291 (August 2024)
Ein KI-Agent mit Berechtigungen ist eine weitere automatisierte Schicht über denselben Systemen, nur dass er nicht nur ausführt, sondern auswählt. Er muss nicht angegriffen werden und nichts wollen; es genügt, dass er eine Lage falsch einschätzt und daraufhin handelt - eine Konfiguration ändert, Code ausrollt, Zugriffsrechte anpasst, einen Prozess anstößt, der auf mehreren abhängigen Systemen wirkt.
Einen vergleichbaren Großschaden durch einen KI-Agenten kennen wir bisher nicht. Der Vergleich mit CrowdStrike zeigt deshalb keinen KI-Fall, sondern etwas anderes: Automatisierung kann einen Fehler sehr schnell verteilen, und das galt schon, als noch niemand von Agenten sprach. Was sich mit ihnen ändert, ist der Raum möglicher Fehler. Ein Skript tut, was dasteht; ein Agent entscheidet, was zu tun ist. Wie weit dieser Unterschied trägt, wird sich zeigen müssen.
Die Motive sind längst da
Bis hierher ging es um Fehler. Der andere Weg ist Absicht, und dafür muss KI niemanden zu etwas bringen, das er nicht ohnehin wollte.
Ein Betrüger wird durch KI nicht erst kriminell. Ein Staat braucht sie nicht, um einen anderen auszuspähen, und wer ein Krankenhaus erpresst, hatte das Motiv vorher. Ändern können sich die Kosten: Aufklärung, Schwachstellensuche, das Täuschen von Menschen, die Auswertung erbeuteter Daten, die Entwicklung von Werkzeugen. Es muss kein neuer Angriffsweg erfunden werden, damit sich etwas verschiebt; es genügt, wenn der vorhandene häufiger begangen wird.
Genau das erwarten die zuständigen Stellen. Das britische National Cyber Security Centre rechnet damit, dass KI Menge und Wirkung von Angriffen erhöht, und zwar durch die Weiterentwicklung bestehender Verfahren statt durch das Erschaffen neuer. Dieselbe Behörde hält vollständig selbstständige Angriffe bis 2027 für unwahrscheinlich und weist darauf hin, dass KI ebenso Systembetreibern und Entwicklern beim Absichern helfen werde. Das sind Bewertungen, keine Messungen, und die Behörde schreibt selbst, dass technische Überraschungen wahrscheinlich sind.
Dieselben Fähigkeiten stehen also auf beiden Seiten. Ein Modell, das Schadcode versteht, kann ihn auch erkennen; was Schwachstellen findet, kann sie auch schließen; was täuschend echte Nachrichten schreibt, kann Täuschungsversuche markieren. Welche Seite am Ende stärker davon profitiert, weiß derzeit niemand. Die konkretere Erwartung des NCSC ist deshalb interessanter als die allgemeine: eine Kluft zwischen Systemen, die mithalten, und einem großen Teil, der es nicht tut. Wer über Mittel, Daten und Fachleute verfügt, nutzt beide Seiten; wer nicht, bekommt nur die eine ab.
EINSCHÄTZUNG, KEINE MESSUNGNCSC 2025 und ENISA 2025
Zur Gegenseite: „KI wird auch Systemeigentümern und Softwareentwicklern beim Absichern von Systemen helfen." Zur Verteilung: Es werde „mit ziemlicher Sicherheit eine digitale Kluft" geben zwischen Systemen, die Schritt halten, und einem großen Teil, der verwundbarer ist. Vollständig automatisierte Angriffe von Anfang bis Ende hält die Behörde bis 2027 ausdrücklich für unwahrscheinlich; menschliche Akteure blieben erforderlich. Sie hält außerdem fest, dass technische Überraschungen wahrscheinlich seien - die Prognose kann sich irren.
ENISA Threat Landscape 2025. Ein Lagebericht mit 4.875 ausgewerteten Vorfällen vom 1. Juli 2024 bis 30. Juni 2025. Die großflächige Verfügbarkeit von KI-Systemen erzeuge ein neues Niveau an Skalierbarkeit auf der Angreiferseite. Bis dahin hätten Angreifer vor allem versucht, allgemein verfügbare Werkzeuge zur Verstärkung bestehender Operationen einzusetzen, nicht, um einen Fähigkeitssprung zu erreichen. Das Gesundheitswesen zählt der Bericht zu den Bereichen mit unterdurchschnittlichem Reifegrad bei überdurchschnittlicher Kritikalität.
Bleibt eine Formel, die in dieser Debatte viel Arbeit leisten muss: KI sei doch nur ein Werkzeug. Das stimmt, solange jemand es in der Hand hält. Je mehr ein System selbst plant, Zwischenziele auswählt, Werkzeuge benutzt und Berechtigungen hält, desto weniger beschreibt die Formel, was tatsächlich passiert - womit wir wieder bei der Leiter aus Kapitel 03 wären.
Wenn niemand dieselbe Krise sieht
Bei einem größeren Ausfall entsteht in den ersten Stunden ein ziemlich banales Problem: Niemand weiß sicher, wie lange er dauern wird.
Die Fragen, die Menschen dann haben, sind einfach. Was ist passiert? Wie lange dauert es? Funktioniert das Wasser noch? Soll ich zur Arbeit fahren, reicht das Bargeld, sind die Geschäfte offen? Antworten darauf gibt es in dieser Phase kaum, weil sie noch niemand belastbar geben kann. Die Lücke bleibt trotzdem nicht leer. Sie füllt sich mit Vermutungen, mit Erfahrungen aus früheren Ausfällen, mit Gerüchten und gelegentlich mit gezielten Falschmeldungen. KI kann beides beschleunigen: das Zusammenfassen echter Meldungen, das Übersetzen, das Verständlichmachen von Behördentexten - und ebenso das massenhafte Erzeugen von Inhalten, das Verändern von Bildern, das automatisierte Antworten.
Ob eine Gesellschaft dabei auseinanderdriftet, ist eine andere Frage, und die Forschung dazu ist zurückhaltender, als die öffentliche Debatte nahelegt. Maschinell erzeugte Argumente verschieben in kontrollierten Versuchen Haltungen zu politischen Fragen, ungefähr so stark wie von Menschen geschriebene. Der Unterschied liegt nicht in der einzelnen Nachricht, sondern darin, dass die millionste fast nichts mehr kostet. Empfehlungssysteme verteilen Sichtbarkeit ungleich. Der Schluss, der daraus meist gezogen wird, hält allerdings nicht: Zwei große Arbeiten haben den Zusammenhang direkt untersucht, und weder senkte weniger gleichgesinnter Inhalt die Polarisierung, noch ließ sich bei der größten dokumentierten Einflussoperation ein belastbarer Zusammenhang zu Einstellungen oder Wahlverhalten feststellen.
QUELLEWas Sprachmodelle und Empfehlungssysteme messbar bewirken
Salvi et al., Nature Human Behaviour 2025: In kurzen Streitgesprächen hatte GPT-4, das wenige Angaben über sein Gegenüber kannte, gegenüber menschlichen Gegnern eine um 81,2 Prozent erhöhte Chance auf nachträgliche Zustimmung. Eine Autorenkorrektur von 2026 stellt klar, dass sich daraus allein nicht belegen lässt, dass die Personalisierung einen zusätzlichen Vorteil gegenüber demselben Modell ohne Personalisierung verschafft.
Bouchaud et al., Scientific Reports 2023: Vergleich der algorithmischen Twitter-Zeitleiste mit dem tatsächlich Abonnierten. Deutliche Verstärkung von Konten aus derselben Gemeinschaft, stärkere Sichtbarkeit emotional aufgeladener und toxischer Beiträge. Die Arbeit beschreibt, was sichtbar wird - nicht, was Menschen daraufhin tun.
GEGENBELEGZwei große Arbeiten, die den erwarteten Effekt nicht finden
Eady et al., Nature Communications 2023 (zur russischen Kampagne im US-Wahlkampf 2016): Die Berührung war extrem ungleich verteilt - ein Prozent der Nutzenden entfiel auf siebzig Prozent aller Kontakte -, konzentrierte sich auf ohnehin stark parteigebundene Nutzende und verschwand mengenmäßig neben heimischen Medien. Ein belastbarer Zusammenhang zu Einstellungen, Polarisierung oder Wahlverhalten ließ sich nicht feststellen.
Was bleibt, ist schmaler und näher an der Störung von vorhin. Vertrauen in die Stellen, die in einer Krise kommunizieren, hängt in Untersuchungen mit der Bereitschaft zusammen, Schutzmaßnahmen zu befolgen. Das sind Befragungs- und Beobachtungsdaten über Krisen allgemein, nicht über KI, und sie zeigen Zusammenhänge statt Ursachen. Für diesen Text reicht das: Ein gemeinsames Lagebild ist keine Stimmungsfrage, sondern eine praktische Voraussetzung dafür, dass Anweisungen ankommen.
QUELLE UND IHRE GRENZEVertrauen, Krisenkommunikation und Befolgung von Schutzmaßnahmen
Die Grenze ist deutlich: Das sind überwiegend Beobachtungs- und Befragungsdaten. Sie zeigen Zusammenhänge, keine Ursachen, und sie handeln von Vertrauen allgemein, nicht von KI. Aus ihnen folgt nicht, dass KI Vertrauen zerstört. Sie stützen nur die engere Aussage, dass ein gemeinsames Lagebild für den Verlauf einer Krise eine Rolle spielt.
Was daraus folgt, und was nicht
Das Drama statt des Thrillers
Im Thriller erwacht eine Maschine und greift nach der Welt. Im Drama bleiben Menschen die handelnden Personen, die Systeme sind die bekannten, und was sich ändert, sind Kosten und Geschwindigkeit. So könnte das aussehen.
Ein großer Energie- oder Telekommunikationsdienst wird digital gestört. Teile der Infrastruktur gehen in den Notbetrieb, Krankenhäuser greifen auf ihre Redundanzen zurück und beginnen zu priorisieren. Zahlungssysteme funktionieren regional eingeschränkt, Kassen und Filialen unterschiedlich lange. Logistikunternehmen können einzelne Abläufe nicht normal durchführen, Produktion wird verschoben. Die Ursache ist in dieser Phase unklar, und im Netz kursieren mehrere Erklärungen, von denen einige richtig sind, einige falsch und einige absichtlich gestreut. Behörden, Betreiber und Unternehmen versuchen, die Lage zu stabilisieren, und arbeiten dabei mit Systemen, die selbst betroffen sein können. KI-Systeme helfen bei Analyse, Verteidigung, Kommunikation und Wiederherstellung - und stehen möglicherweise zugleich auf der anderen Seite.
KI ist in diesem Szenario nicht der Bösewicht. Sie wirkt an mehreren Stellen eines Systems, das bereits belastet ist, und nicht alle davon zeigen in dieselbe Richtung.
Davon ist einiges dokumentiert, anderes bleibt Ableitung. Belegt sind die einzelnen Bausteine: digitale Störungen mit physischer Wirkung, Belastung, die in benachbarte Einrichtungen wandert, automatisierte Fehler, die sich schnell verbreiten. Behördlich eingeschätzt, nicht gemessen, ist die Verbilligung solcher Angriffe durch KI. Abgeleitet sind die größeren Kaskaden über mehrere Sektoren hinweg und die Wirkung einer unklaren Informationslage. Szenario bleibt das Zusammentreffen mehrerer Belastungen, und genau dort endet die Belegkette dieses Textes.
Ein Dominoeffekt ist das ausdrücklich nicht. Keine Stufe löst die nächste zwangsläufig aus, und die allermeisten Störungen bleiben genau das: Störungen. Interessanter ist ohnehin etwas anderes. Dieselbe technische Störung hat verschiedene Folgen, je nachdem, in welchem Zustand ein System gerade ist. Ein Lieferengpass lässt sich leichter tragen, wenn Lager voll sind, Energie verfügbar ist und die Finanzierung läuft, und schwerer, wenn gleichzeitig anderes drückt. Ein System mit Reserven nimmt Belastung auf. Ein ausgelastetes hat nichts, womit es das könnte.
Was Systeme widerstandsfähig macht
Wer nur Verwundbarkeit zeigt, erklärt nicht, warum die meisten Störungen folgenlos bleiben. Das ist kein Zufall, sondern Arbeit, und sie steckt in denselben vier Fällen.
In der Ukraine kam der Strom zurück, weil es eine manuelle Rückfallebene gab und Menschen, die sie bedienen konnten. Bei CrowdStrike liefen die Rechner wieder, weil ein Eingriff am einzelnen Gerät möglich war, so mühsam das gewesen sein muss. Die Nachbarkliniken in San Diego konnten Patienten überhaupt aufnehmen, weil es mehr als ein Haus gab. Und bei TARGET2 fiel auf, was fehlte, als die Ausweichstelle nicht ansprang - woraus ein Prüfauftrag wurde.
Die Mittel sind bekannt und wenig glamourös. Redundanz und Reserven: eine zweite Anlage, ein zweiter Lieferant, Notstrom, Lagerbestand. Notstrom ist dabei keine unbegrenzte Energiequelle, sondern gekaufte Zeit. Dazu eine Rückfallebene auf Handbetrieb, die voraussetzt, dass jemand sie noch beherrscht; getrennte Netze und Zugriffsgrenzen, damit eine Störung dort bleibt, wo sie entstanden ist; Wiederanlaufverfahren, die tatsächlich getestet wurden und nicht nur beschrieben sind; und eine menschliche Freigabe an den Stellen, an denen eine Handlung schwer rückgängig zu machen ist - nicht überall, sondern dort.
Darauf läuft dieser Text hinaus: Risiko entsteht nicht aus der Existenz von KI, sondern aus dem Verhältnis zwischen Störung und Widerstandsfähigkeit. KI kann beide Seiten verschieben, und wer nur die eine nutzt, hat eine Entscheidung getroffen, ohne sie als solche zu bemerken.
Was dagegen spricht, und woran dieser Text scheitern würde
Drei Einwände treffen diese Argumentation, und sie stehen hier ohne Entgegnung.
Der erste betrifft die Abhängigkeit vom Menschen. Dass Strom, Fertigung und Wartung heute menschliche Arbeit verlangen, ist eine Aussage über heute, und Automatisierung verschiebt sie fortlaufend. Der zweite wiegt schwerer: Der Text betrachtet Menschen meist als Ziel einer Handlung, aber der unangenehmere Fall ist der, in dem über sie gar nicht entschieden wird - als Nebenfolge, oder als Summe vieler Entscheidungen, die jede für sich vernünftig waren.
Der dritte betrifft die Zeit. Korrektur, Rechteentzug und Abschalten setzen eine Gelegenheit voraus. Verläuft etwas schneller als der Zyklus aus Bemerken, Entscheiden und Handeln, besteht diese Gelegenheit formal und praktisch nicht. CrowdStrike hat das ohne jede KI vorgeführt: Minuten für die Verteilung, Tage für die Rücknahme.
Und woran der Text scheitern würde
Vier Beobachtungen würden ihn erledigen, und drei davon wären keine Kleinigkeit.
| Ein geschlossener physischer Kreislauf | Gewinnung, Fertigung, Energie, Transport und Wartung laufen an einer Stelle nachweislich ohne menschliche Arbeit. Dann fällt der erste Teil. |
|---|---|
| Wirkung ohne menschlichen Zwischenschritt | Ein rein digital agierendes System verursacht dauerhaften großflächigen physischen Schaden, ohne dass irgendwo ein Mensch eine Berechtigung erteilt, eine Maschine bedient oder eine Anweisung ausgeführt hat. |
| Täuschung oder Abschaltwiderstand im Regelbetrieb | Beides tritt außerhalb eigens gebauter Versuchsumgebungen auf, ohne besonders deutliche Hinweise und ohne widersprüchliche Anweisungen. |
| Kein messbarer Verstärkungseffekt | Über Jahre zeigt sich keine Zunahme von Menge, Geschwindigkeit oder Erfolgsquote dort, wo KI eingesetzt wird. Dann fällt der zweite Teil, und die Sorge reduziert sich auf bekannte IT-Risiken. |
Dieselbe Strenge gilt in die andere Richtung. Wer die Auslöschung für wahrscheinlich hält, sollte sagen können, welche Beobachtung ihn vom Gegenteil überzeugen würde.
Die Frage ist vielleicht falsch gestellt
„Wird KI uns auslöschen?" ist für die Debatte attraktiv und für die Praxis unbrauchbar. Wer bejaht, landet bei einer Sorge, die alles umfasst und deshalb nichts nahelegt. Wer verneint, landet bei einer Beruhigung, aus der ebenfalls nichts folgt.
Die spektakulärste KI-Katastrophe ist möglicherweise nicht die relevanteste. Eine selbstständig handelnde Superintelligenz braucht sehr viele Voraussetzungen; großer Schaden kommt viel früher in Reichweite, durch automatisierte Fehler, missbrauchte Systeme, Angriffe, Abhängigkeiten, fehlende Redundanz, falsch gesetzte Berechtigungen und Informationen, denen niemand mehr traut. Einige dieser Mechanismen kann KI verstärken, und dafür muss sie die Welt nicht beherrschen.
Die Fragen, die daraus folgen, sind kleiner und für eine konkrete Organisation tatsächlich beantwortbar. Welche Berechtigungen bestehen tatsächlich, also welche im laufenden Betrieb erteilt und nie wieder entzogen wurden? Welche Entscheidungen laufen heute schon ohne Prüfung, und welche davon sind schwer rückgängig zu machen? Was läuft weiter, wenn ein System ausfällt, falsch handelt oder gegen uns eingesetzt wird - gibt es einen Handbetrieb, und kann ihn noch jemand? Wie lange dauert eine Rücknahme, verglichen mit der Ausführung? Und nutzen wir eigentlich auch die andere Seite, also Erkennung, Prüfung und Wiederherstellung?
Keine dieser Fragen ist besonders originell. Sie haben nur den Vorteil, dass man sie beantworten kann.
Quellen, Begriffe und der Umgang mit ihnen
Was hier belegt ist und was nicht
Dieser Text stützt sich auf sehr verschiedene Arten von Wissen: dokumentierte Einzelfälle, kontrollierte Experimente, Beobachtungsstudien, theoretische Arbeiten und behördliche Prognosen. Sie zu vermischen wäre der häufigste Fehler in dieser Debatte.
| Dokumentierter Fall | Ein Ereignis, das stattgefunden hat und von einer Behörde, einem Betreiber oder einer Untersuchung beschrieben wurde. Ukraine 2015, TARGET2 2020, Maersk 2017, CrowdStrike 2024, San Diego 2021. |
|---|---|
| Empirische Studie | Experiment oder Beobachtungsstudie mit benannter Methode und benannten Grenzen. Dazu zählen die Arbeiten zu Überzeugung, Polarisierung und Vertrauen - und der Krankenhausfall, der beides ist. |
| Behördliche Einschätzung | Bewertung mit Prognosecharakter, mit abgestufter Wahrscheinlichkeitssprache. NCSC und ENISA. Kein empirischer Nachweis. |
| Technisch plausible Ableitung | Schlussfolgerung aus belegten Befunden. Dazu zählen: dass ein fehlerhaft handelnder KI-Agent Fehler ähnlich verbreiten könnte wie eine fehlerhafte Aktualisierung; dass Kaskaden über mehrere Sektoren hinweg möglich sind; dass eine unklare Informationslage die Bewältigung erschwert. |
| Szenario | Eine mögliche Kette, deren Eintritt nicht nachgewiesen ist. Das Szenario in Kapitel 08 und die Annahme mehrerer gleichzeitiger Belastungen. |
| Urteil | Die Einschätzung, dass der Weg über Berechtigungen, Fehler und Verstärkung näher liegt als der über Selbstermächtigung. Eine datierte Meinung des Autors. |
Was dieser Text ausdrücklich nicht behauptet
| KI hat Infrastruktur angegriffen | Kein belegter Fall. Die vier dokumentierten Fälle in Kapitel 04 hatten mit KI nichts zu tun. |
|---|---|
| Ein KI-Agent hat großen Schaden verursacht | Kein bekannter Fall. Die Analogie stammt aus klassischer Automatisierung. |
| KI spaltet Gesellschaften | Nicht gezeigt. Die beiden größten Untersuchungen dazu finden den Effekt nicht. |
| Mehrere Krisen führen zu Zusammenbruch | Nicht behauptet. Der Text sagt nur, dass ein System mit Reserven Belastung anders aufnimmt als eines ohne. |
| KI macht Systeme unsicher | Zu einseitig. Dieselben Fähigkeiten wirken auf der Verteidigungsseite; welche Seite stärker profitiert, ist offen. |
Fünf wiederkehrende Fehlzitate
| Instrumentelle Konvergenz | Populär als Gesetz zitiert. In den Originalarbeiten ausdrücklich als Tendenz formuliert und nicht als unfehlbares Prinzip. |
|---|---|
| Machtstreben | Populär als Beweis zitiert, dass KI nach Macht strebt. Der Satz gilt für optimale Strategien unter Symmetrieannahmen; die Autoren halten selbst fest, dass gelernte Strategien das selten sind. |
| Täuschung und Abschaltwiderstand | Populär als Nachweis eines Selbsterhaltungstriebs zitiert. Die Arbeiten zeigen eine Fähigkeit in eigens gebauten Umgebungen; für den Abschaltwiderstand ist die Erklärung über widersprüchliche Anweisungen teilweise bestätigt. |
| Filterblasen und Polarisierung | Populär als belegte Ursache gesellschaftlicher Spaltung zitiert. Das größte Feldexperiment fand auf keine der acht vorab festgelegten Messgrößen einen Effekt. |
| NotPetya und die zehn Milliarden | Die Zahl ist eine Schätzung des weltweiten Gesamtschadens, nicht der Schaden bei Maersk. Dort werden 200 bis 350 Millionen US-Dollar genannt. |
Vier Begriffe, die im Text gebraucht werden
| Kritische Infrastruktur | Einrichtungen und Dienste, deren Ausfall Versorgung oder öffentliche Ordnung unmittelbar beeinträchtigt: Strom, Wasser, Gesundheitsversorgung, Verkehr, Verwaltung, Telekommunikation, Zahlungsverkehr. |
|---|---|
| Kaskadeneffekt | Eine Störung wirkt über ihren Ursprungsbereich hinaus, weil andere Systeme von ihm abhängen. Der Fall aus San Diego ist ein Beispiel: Der Schaden trat dort auf, wo nicht angegriffen worden war. |
| Datenintegrität | Die Verlässlichkeit der Information über einen Zustand: welcher Container wohin gehört, welche Zahlung endgültig ist, welcher Kontostand stimmt. Sie kann fehlen, ohne dass physisch etwas zerstört wurde. |
| Resilienz | Die Fähigkeit eines Systems, eine Störung aufzunehmen und wieder in den Normalbetrieb zu kommen: Reserven, Redundanz, Rückfallebenen, geprüfte Wiederanlaufverfahren. |
Verwendete Arbeiten und Berichte
| CISA 2016 | Alarm IR-ALERT-H-16-056-01 zum Angriff auf die ukrainische Stromversorgung vom 23. Dezember 2015. Behördenbericht zu einem dokumentierten Fall. |
|---|---|
| E-ISAC und SANS 2016 | „Analysis of the Cyber Attack on the Ukrainian Power Grid". Technische Analyse, Grundlage für die Angaben zu Handbetrieb, Firmware-Zerstörung und Telefonblockade. |
| EZB 2020 | Mitteilung vom 16. November 2020 zum TARGET2-Vorfall vom 23. Oktober 2020 und zur unabhängigen Prüfung. Kein Cyberangriff, sondern ein Softwarefehler. |
| CrowdStrike 2024 | „Channel File 291 Incident Root Cause Analysis", August 2024. Ursachenanalyse des Herstellers. Die Zahl von 8,5 Millionen Geräten stammt von Microsoft. |
| Maersk, ab 2017 | Angaben überwiegend aus Interviews und Vorträgen von Unternehmensvertretern; die Zahlen schwanken zwischen den Quellen. Keine geprüfte Offenlegung. |
| Critical Care Explorations 2024 | Retrospektive Beobachtungsstudie zu Herzstillständen an einem benachbarten, nicht angegriffenen Klinikverbund. Kleine Fallzahlen, von den Autoren ausdrücklich als Zusammenhang geführt. |
| WHO 2024 | Erklärung vor dem UN-Sicherheitsrat zu Erpressungssoftware im Gesundheitswesen. |
| NCSC 2025 | „Impact of AI on cyber threat from now to 2027". Bedrohungsbewertung mit Prognosecharakter. |
| ENISA 2025 | Threat Landscape 2025, 4.875 ausgewertete Vorfälle. Lagebericht mit Einschätzungen. |
| Langosco et al. 2022 | „Goal Misgeneralization in Deep Reinforcement Learning", ICML 2022, arXiv:2105.14111. Vier Trainingsumgebungen, darunter CoinRun. |
| Shah et al. 2022 | „Goal Misgeneralization: Why Correct Specifications Aren't Enough For Correct Goals", arXiv:2210.01790. |
| Omohundro 2008, Bostrom 2012 | „The Basic AI Drives" und „The Superintelligent Will". Theoretische Arbeiten, ausdrücklich als Tendenzaussagen formuliert. |
| Häggström 2019 | „Challenges to the Omohundro-Bostrom framework for AI motivations", Foresight 21(1). |
| Turner et al. 2021 | „Optimal Policies Tend To Seek Power", NeurIPS 2021, arXiv:1912.01683. Theoretisches Ergebnis mit benannten Voraussetzungen. |
| Soares et al. 2015 | „Corrigibility". Definition und offenes Problem, keine bestehende Garantie. |
| Apollo Research 2024 | „Frontier Models are Capable of In-context Scheming", arXiv:2412.04984, mit den dort selbst genannten Einschränkungen der Versuchsanordnung. |
| Palisade Research 2025 | „Shutdown Resistance in Large Language Models", arXiv:2509.14260, samt der unabhängigen Gegenprobe von Rajamanoharan und Nanda (Google DeepMind). |
| Bai et al. 2025 | „LLM-generated messages can persuade humans on policy issues", Nature Communications. Kontrolliertes Experiment. |
| Salvi et al. 2025 | „On the conversational persuasiveness of GPT-4", Nature Human Behaviour, samt Autorenkorrektur 2026. |
| Nyhan et al. 2023 | „Like-minded sources on Facebook are prevalent but not polarizing", Nature. Feldexperiment mit 23.377 Nutzenden. |
| Eady et al. 2023 | Zur russischen Kampagne im US-Wahlkampf 2016, Nature Communications. Beobachtungsstudie mit Längsschnittbefragung. |
| Bouchaud et al. 2023 | „Crowdsourced audit of Twitter's recommender systems", Scientific Reports. Prüfung der Sichtbarkeit, nicht der Wirkung. |
| Mizrahi et al. 2023 | „Compliance with government policies during emergencies", Governance. Befragungsdaten, Zusammenhänge statt Ursachen. |