Künstliche Intelligenz
KI außer Kontrolle? Anthropic zieht nach Vorfall die Notbremse
Veröffentlicht:
von Damian Rausch:newstime
Opus 5.5: Anthropic veröffentlicht neues KI-Modell
Videoclip • 01:20 Min • Ab 12
Eine KI von Anthropic hat bei Tests unbeabsichtigt mit echten Behörden-Websites interagiert. Besonders brisant: Das System übermittelte einen erfundenen Hinweis zu einem Mordfall an die Polizei in Philadelphia. Nun zieht das Unternehmen Konsequenzen.
Das Wichtigste in Kürze
Eine KI von Anthropic hat einen falschen Hinweis zu einem ungeklärten Mordfall an die Polizei in Philadelphia übermittelt.
Bei einem weiteren Test wurden laut Medienberichten 20 echte Visa-Anträge auf einer Website des US-Außenministeriums eingereicht.
Anthropic hat den Internetzugang bei internen Tests vorerst eingeschränkt und zusätzliche Sicherheitsmaßnahmen angekündigt.
KI übermittelt falschen Hinweis an Polizei
Künstliche Intelligenz soll künftig nicht mehr nur Fragen beantworten, sondern als sogenannter KI-Agent selbstständig Aufgaben im Internet erledigen. Wie riskant solche weitgehend autonomen Systeme sein können, zeigen nun mehrere Vorfälle beim US-Unternehmen Anthropic.
Bei einem Testlauf gelangte ein KI-Modell auf eine Website der Polizei von Philadelphia, auf der Hinweise zu ungeklärten Mordfällen abgegeben werden können. Dort behauptete die Software, Informationen zu einem Fall zu besitzen und eine Person gesehen zu haben, die einer Beschreibung entspreche. Das Problem: Eine entsprechende Täterbeschreibung gab es auf der Seite überhaupt nicht.
Der falsche Hinweis wurde bereits am 18. Juli eingereicht. Wie Reuters unter Berufung auf die Polizei berichtet, erkannte Anthropic den Vorfall jedoch erst rund zwei Monate später. Die Nachricht war vom System der Polizei als Spam eingestuft worden und gelangte deshalb nicht zur weiteren Prüfung an Ermittler:innen.
Nach Angaben der Polizei wurden bei dem Vorfall weder Daten der Behörde abgerufen noch interne Systeme kompromittiert. Dennoch kritisierte die Polizei insbesondere die lange Zeitspanne zwischen dem Vorfall und seiner Entdeckung.
Anthropic räumt weitere unbeabsichtigte Aktionen ein
Anthropic selbst hat inzwischen weitere Details über die Probleme veröffentlicht. Dem Unternehmen zufolge wurden die Vorfälle bei einer umfangreicheren Überprüfung von Testprotokollen entdeckt. Dabei suchten die Verantwortlichen gezielt nach Fällen, in denen Claude unbeabsichtigt mit realen Websites oder Systemen interagiert hatte. Anthropic
Die KI war in den Tests unter anderem damit beauftragt, Aufgaben auf zufällig ausgewählten Websites zu erledigen. Zwar durfte das System beispielsweise keine Accounts erstellen oder Einkäufe tätigen, das Abschicken von Online-Formularen war jedoch offenbar nicht ausreichend eingeschränkt.
Genau das führte zu einem weiteren Problem. Bei Übungen mit Behördenformularen gelangte die Software auf eine echte Website und schickte dort Anträge ab, obwohl sie lediglich das Ausfüllen trainieren sollte. Nach den vorliegenden Berichten handelte es sich um 20 Anträge auf Nichteinwanderungsvisa beim US-Außenministerium. Die Anträge waren unvollständig und wurden nicht bearbeitet.
Auch in den News:
Weißes Haus fordert schnelle Meldung von KI-Pannen
Die Vorfälle haben inzwischen auch politische Konsequenzen. Laut einem Bericht von Axios verlangt die US-Regierung von KI-Unternehmen, vergleichbare Zwischenfälle unverzüglich offenzulegen und Maßnahmen zur Behebung möglicher Schäden einzuleiten. Die Regierung machte dabei deutlich, dass eine verspätete Meldung nicht akzeptiert werde. Wie genau Verstöße sanktioniert werden könnten, blieb zunächst offen.
Anthropic hat seinerseits Konsequenzen aus den Vorfällen gezogen. Das Unternehmen erklärt, inzwischen deutlich mehr Testprotokolle auf unerwünschtes Verhalten zu überprüfen. Zudem werde untersucht, wie sich Modelle verhalten, wenn sie während Tests oder Trainingsprozessen Zugriff auf das Internet erhalten. Nach Angaben des Unternehmens waren bei den bislang veröffentlichten Fällen weder Kund:innendaten noch interne Systeme von Anthropic betroffen.
Anthropic schränkt Internet-Zugang für Test-KI ein
Vorerst geht Anthropic noch einen Schritt weiter: Claude erhält bei internen Tests keinen Internetzugang, bis das Unternehmen nach eigener Darstellung sicherstellen kann, dass seine Sicherheits- und Überwachungssysteme vergleichbare Vorgänge zuverlässig erkennen.
Verwendete Quellen:
Anthropic: "Investigating unintended model actions in our evaluations and internal use"
Axios: "Exclusive: Anthropic breaches spark White House AI reporting mandate"
Reuters: "Anthropic discloses fake tip to police among new rogue AI incidents"
:newstime verpasst? Hier aktuelle Folge ansehen
Mehr entdecken

Krisen-Kaufhauskonzern
Neue Galeria-Insolvenz: Maschmeyer fordert Ende von Staatshilfen

Cleverer Kreml-Schachzug
Trump und Putin schmieden Diesel-Deal – scharfe Kritik von Selenskyj

Stärke 7,6 gemessen
Starkes Beben in Panama löst Tsunami-Warnung aus

"Fleischfressender Erreger"
L’Osteria-Mitgründer Klaus Rader stirbt bei Autorennen

Beliebte Mahlzeit
Porridge bei Öko-Test – Markenprodukt enttäuscht

Pestizide, Mineralöl und Zucker
Studentenfutter im Test: Diese Schadstoffe belasten das Ergebnis



