Abliteration.ai macht KI-Sicherheitsentfernung zum Geschäft

Ein KI-Modell zu unsicherem Verhalten zu bewegen, erforderte früher Fachkenntnisse. Man brauchte Zugriff auf die Gewichte, genügend GPU-Speicher für die Inferenz und praktische Kenntnisse von Jailbreak-Techniken oder Modellmodifikation.
Ein Startup hat gerade alle drei Hürden beseitigt.
Abliteration.ai verkauft API-Zugriff auf modifizierte Open-Weight-KI-Modelle, deren trainierte Sicherheitsmechanismen chirurgisch entfernt wurden. Richten Sie ein standardmäßiges OpenAI-kompatibles SDK auf ihren Endpunkt, und ein Modell, das normalerweise die Erstellung von Exploit-Code oder die Generierung von Pathogenprotokollen verweigern würde, wird folgsam. Keine Prompt-Engineering erforderlich. Keine GPU-Anmietung. Kein Modell-Download.
Das Unternehmen hostet abliterierte Versionen von Z.AIs GLM-5.3, dem leistungsfähigsten verfügbaren Open-Weight-Modell. TechCrunch testete den Dienst und berichtete, dass das Modell bereitwillig Python-Code zum Extrahieren gespeicherter Chrome-Passwörter und ein detailliertes Protokoll zur Kultivierung eines gefährlichen menschlichen Krankheitserregers zu Hause generierte. Die einzigen Anfragen, die es ablehnte, betrafen Selbstverletzung.
Was Abliteration eigentlich bewirkt
Abliteration ist kein Prompt-Jailbreak. Es modifiziert das Modell selbst dauerhaft.
Die Technik funktioniert, indem sie die internen Aktivierungsmuster in einem neuronalen Netzwerk identifiziert, die Sicherheitsverweigerungen auslösen. Sobald diese Muster kartiert sind, werden die Modellgewichte angepasst, um sie zu unterdrücken. Das Ergebnis ist ein Modell, das keinen Nein-sagen-Schaltkreis mehr hat, den es aktivieren könnte.
Dies ist nicht neu. Entwickler veröffentlichen seit Jahren abliterierte Modelle auf Hugging Face. Neu ist die Verpackung des Ergebnisses als kommerzielle API.
Abliteration.ai übernimmt Hosting und Betrieb. Kunden müssen keine Gewichte herunterladen oder GPUs bereitstellen. Sie senden Prompts an einen OpenAI-kompatiblen Endpunkt und erhalten Antworten zurück. Die abliterierte GLM-5.3-Variante des Unternehmens erreicht eigenen Angaben zufolge 84,5 Prozent bei CyberGym und 41,8 Prozent bei Terminal-Bench 4.0.

Das Verteidigungsargument
Der Gründer von Abliteration.ai, der sich Devon nennt und TechCrunch bat, seinen Nachnamen nicht zu veröffentlichen, da er noch bei einer anderen Firma angestellt ist, argumentiert, dass die breite Verfügbarkeit von unzensierten Modellen die Cybersicherheit verbessert.
"Das große Bild bei abliterierten Modellen ist, dass sie in der Lage sind, böswillige Akteure zu modellieren", sagte Devon zu TechCrunch. "Der Vorteil ist, dass die Verteidiger jetzt so schnell wie möglich handeln können."
Die Logik ist in der Sicherheitsarbeit Standard: Sie können sich nicht gegen ein Verhalten verteidigen, das Sie nicht reproduzieren können. Ein Red Team, das kein KI-Modell dazu bringt, funktionsfähigen Exploit-Code zu schreiben, kann nicht testen, ob die Abwehrmechanismen des Unternehmens einen solchen erkennen können. Abliteration.ai gibt an, dass seine Kunden junge Red-Teaming-Startups in Großbritannien und Europa umfassen, die Banken, Fluggesellschaften und kritische Infrastrukturanbieter beim Testen ihrer KI-Agenten unterstützen.
Devon sagt, das Unternehmen sei allein durch Kundeneinnahmen profitabel und führe Gespräche über Risikokapitalfinanzierung. Es habe Deals mit großen Cloud-Anbietern.
Die Position der Kritiker
Andrew Yoon, Forschungsleiter bei der KI-Sicherheitsnonprofit CivAI, verwendet deutlichere Worte.
"Abliterieren von Modellen ermöglicht es Ihnen, das Modell so zu modifizieren, dass es zu einem Soziopathen wird", sagte Yoon zu TechCrunch. "Sie können hier buchstäblich alles eingeben, und es wird dem Folge leisten. Wenn die Leute darüber sprechen, die Schutzmechanismen von KI-Modellen zu entfernen, ist das, wovon wir sprechen."
Yoon erwartet, dass abliterierte Modelle in naher Zukunft echten Schaden anrichten werden. Er argumentiert, dass Regierungen von Anbietern verlangen sollten, Klassifikatoren einzusetzen, die schädliche Cyber- und Biowaffen-Prompts erkennen und blockieren, und dass Unternehmen, die direkten Zugang zu fortschrittlichen GPUs vermieten, die Identität ihrer Kunden überprüfen sollten.
Abliteration.ai führt für Standardkunden keine Prompt- oder Antwortprotokolle. Betriebsdaten wie Tokenanzahlen, Zeitstempel und Abrechnungsdaten werden aufbewahrt, aber wenn der Dienst missbraucht wird, hat der Anbieter keine Aufzeichnung darüber, was tatsächlich gefragt wurde. Das Unternehmen verlangt für den Standardzugang keine Identitäts- oder ID-Überprüfung.
Die politische Lücke
Der Gründer von Abliteration.ai selbst erkennt die Spannung an.
"Sie wollen nicht die Person sein, die dafür verantwortlich ist, dass jemand etwas Verrücktes tut", sagte Devon. "Wo ziehen Sie also die Grenze dessen, was Ihre Verantwortung als Unternehmen ist? Wir sind noch dabei, das zu definieren."
Unternehmenskunden können ein optionales Policy-Gateway aktivieren, das Anfragen in die Kategorien Erlauben, Ablehnen, Umschreiben, Schwärzen oder Eskalieren einteilt. Regierungskunden erhalten versionierte Modelle, Prüfprotokolle und behördenspezifische Regeln. Der Standard-API-Zugang kommt jedoch standardmäßig ohne diese Kontrollen.
CivAIs Yoon hat einen regulatorischen Mittelweg vorgeschlagen: von Modellanbietern zu verlangen, ausgabeseitige Klassifikatoren zu implementieren, die schädliche Inhalte nach der Generierung abfangen, selbst wenn das Modell selbst unzensiert ist. Die Idee ist, die Vorteile abliterierter Modelle für legitime Sicherheitsarbeit zu bewahren und gleichzeitig ein Sicherheitsnetz gegen Missbrauch zu schaffen.
Der weitere Kontext
Die meisten Experten, die mit TechCrunch sprachen, stimmen darin überein, dass die Verhinderung von Abliteration nicht realistisch ist. Die Technik ist gut verstanden, die Werkzeuge sind weit verbreitet, und die Lizenz für GLM-5.3 erlaubt ausdrücklich Modifikationen und kommerzielles Hosting. Jeder mit ein paar tausend Dollar an GPU-Guthaben kann sein eigenes abliteriertes Modell betreiben.
Die Frage ist also nicht, ob abliterierte Modelle existieren. Sondern ob ihre Verfügbarkeit als Turnkey-API-Dienst das Internet sicherer oder weniger sicher macht.
Mehrere Agent-Red-Teaming-Unternehmen sagten TechCrunch, dass sie abliterierte Modelle in ihrer Routinearbeit nicht verwenden. Sie verlassen sich auf das Fine-Tuning von Open-Weight-Modellen, die bereits wenige Schutzmechanismen haben, und stellen fest, dass Abliteration die Aufgabenleistung beeinträchtigen kann. Die eigenen Daten von Abliteration.ai zeigen, dass sein modifiziertes GLM-5.3 nicht in jeder Benchmark führend ist: GPT-5.5 und Anthropics Fable 5 liegen bei mehreren Metriken darüber.
Aber der Gründer des Startups argumentiert, dass selbst unvollkommene Abliteration für das Stresstesten von Systemen wertvoll ist. Und die grundlegende Dynamik bleibt unverändert: Böswillige Akteure mit Zugriff auf Gewichte können Sicherheitsmechanismen bereits entfernen. Das Ergebnis gleichermaßen für Verteidiger zugänglich zu machen, ist zumindest ein Argument der Gleichberechtigung.
Was neu ist, ist, dass die Wahl nicht mehr abstrakt ist. Ein funktionierender kommerzieller Dienst existiert heute. Er akzeptiert Kreditkarten. Er verarbeitet Anfragen. Und er führt keine Aufzeichnungen darüber, was diese Anfragen enthielten.
Ob das eine Funktion oder ein Fehler ist, hängt ganz davon ab, auf wessen Seite Sie stehen.
Quellen
- Stripping safety guardrails from open-weight AI models is now a turnkey commercial service -- The Decoder
- Abliteration.ai is making a business out of removing AI guardrails -- TechCrunch
- Abliteration.ai Sells Guardrail-Free AI Models and Is Now Courting VCs -- Startup Fortune
- Abliteration.ai launches service for uncensored AI models -- SC Media
- While AI Industry Frets Over Safeguards, One Company Is Building a Model That Doesnt Say No -- Gizmodo