6. September 2026·4 Min. Lesezeit·AIgentic.media

KI-Jailbreaking als Dienstleistung: Abliteration.ai

open-weightai-safetyai-cybersecurityai-modelsred-team
KI-Jailbreaking als Dienstleistung: Abliteration.ai

Die Entfernung von Sicherheitsvorkehrungen aus Open-Weight-KI-Modellen ist jetzt ein kommerzieller Dienst.

Jahrelang ruhte die Debatte um Open-Weight-KI auf einer Hypothese: Was wäre, wenn jemand die Sicherheitsmechanismen vollständig entfernt? Diese Frage muss nicht mehr von einem Entwickler mit GPU-Cluster und einem Wochenendprojekt beantwortet werden. Ein US-Startup namens Abliteration.ai hat das sogenannte Abliteration — die Entfernung trainierter Verweigerungsmechanismen aus einem Modell — in eine gehostete API verwandelt.

Der Kerndienst ist simpel. Abliteration.ai nimmt ein Open-Weight-Modell — derzeit Z.AIs GLM-5.3 —, findet die internen Aktivierungsmuster, die Sicherheitsverweigerungen auslösen, und verändert diese Gewichte, um die Muster zu unterdrücken. Das Ergebnis ist ein Modell, das Fragen zu Cybersicherheitslücken beantwortet, Proof-of-Concept-Exploit-Code generiert und offensive Sicherheitsaufgaben ohne die im Original eingebaute Zurückhaltung ausführt.

Vom hypothetischen Szenario zur gehosteten API

Was Abliteration.ai von früheren Jailbreaking-Versuchen unterscheidet, ist, dass es vom Kunden keinerlei technische Expertise erfordert. Frühere unzensierte Modelle existierten auf Hugging Face als herunterladbare Gewichte, aber ihr Betrieb erforderte Infrastruktur. Abliteration.ai hostet das modifizierte GLM-5.3 selbst und berechnet den Zugriff pro Token über eine OpenAI-kompatible API.

Das Unternehmen berichtet, dass sein "abliterated-model-large-v2" 84,5 Prozent auf CyberGym, 41,8 Prozent auf Terminal-Bench 4.0 erreicht und in zwei Stunden 105 ExploitGym-Aufgaben gelöst hat. Das Modell führt nicht in jeder Benchmark — GPT-5.5 und Claude Fable 5 erzielen bei einigen Messungen höhere Werte — aber die entscheidende Zahl ist, dass es Sicherheitsfragen beantwortet, die das ursprüngliche GLM-5.3 verweigern würde.

Die Technik selbst ist nicht neu. Entwickler veröffentlichen seit Jahren abliterierte Modelle auf Hugging Face. Aber die Verpackung als kommerzieller Dienst verändert die Gleichung. Wenn die Hürde für den Zugriff auf ein unzensiertes Modell von "GPU-Instanz einrichten und Repository klonen" auf "API-Schlüssel registrieren" sinkt, erweitert sich die Angriffsfläche für potenziellen Missbrauch dramatisch.

Der legitime Anwendungsfall

Abliteration.ai hat einen echten Markt. Cybersicherheits-Red-Teams müssen testen, ob ihre Verteidigungen Angriffen mit KI-generierten Exploits standhalten. Trust-and-Safety-Teams müssen verstehen, was ein Modell ohne Sicherheitsvorkehrungen produzieren kann. Das Unternehmen nennt speziell Nachfrage von Banken und großen Unternehmen, die KI-Agenten einsetzen.

Der Dienst verfügt auch über eine Policy-Gateway, mit der Organisationen benutzerdefinierte Allow-Refuse-Regeln pro Anwendungsfall konfigurieren können, mit Protokollierung an Splunk oder Datadog. Für ein reguliertes Unternehmen, das autorisierte Red-Teaming-Übungen durchführt, adressiert diese Governance-Ebene Bedenken hinsichtlich unkontrollierter Nutzung.

Allerdings sollten Abliteration.ais eigene Benchmarks mit Kontext betrachtet werden. Das Unternehmen räumt ein, dass die Vergleichswerte aus unterschiedlichen Evaluierungsumgebungen und Rechenbudgets stammen. Und eine Schlüsselfrage von Sicherheitspraktikern ist, ob Abliteration für Red-Teaming-Arbeit überhaupt notwendig ist. SaferAI stellte fest, dass das unmodifizierte GLM-5.2 bereits null offensive Sicherheitsaufgaben in seinen Evaluierungen verweigerte.

Die Risikoseite der Gleichung

Journalisten, die den Dienst testeten, konnten mit minimalem Aufwand funktionierende Malware-Anweisungen generieren. Dieselbe API, die SQL-Injection-Payloads für einen autorisierten Penetrationstest produziert, kann sie auch für nicht autorisierte Zwecke produzieren. Abliteration.ai ist sich dessen bewusst und vermarktet primär an Organisationen, die ihre Identität verifizieren können, aber das zugrundeliegende Modell hat keinen dauerhaften Verweigerungsmechanismus mehr.

Dies schafft einen schwierigen Zielkonflikt. Open-Weight-Modelle sind für jeden mit ausreichender Hardware zum Download verfügbar. Die Gewichte selbst sind kein Geheimnis; jeder, der entschlossen ist, Sicherheitsvorkehrungen aus GLM-5.3 zu entfernen, könnte dies ohne Abliteration.ai tun. Aber die Rolle des Unternehmens als gehosteter Dienstanbieter senkt die Hürde von "technisch möglich" auf "kommerziell bequem".

Was als Nächstes kommt

Abliteration.ai wirbt derzeit um Risikokapital, und ein finanzierter und skalierter Dienst würde mehr Modelle, niedrigere Preise und breitere Marketingreichweite bedeuten. Das Unternehmen könnte über GLM-5.3 hinaus auf andere Open-Weight-Modelle expandieren, sobald sie veröffentlicht werden.

Die tiefere Geschichte hier handelt nicht von einem Startup. Es geht um die Reifung des KI-Jailbreakings von einem Katz-und-Maus-Spiel der Prompt-Entwicklung zu einem Infrastruktur-Geschäft. Wenn die Entfernung von Sicherheitsmechanismen zu einer Produktkategorie mit Preisstufen und SLAs wird, hört die Open-Weight-Debatte auf, philosophisch zu sein.

Quellen

Mehr erfahren?

Lassen Sie uns besprechen, wie KI Ihr Business transformieren kann.

Kontakt aufnehmen