23. September 2026·6 Min. Lesezeit·AIgentic.media

Die Natur als Trainingsgrundlage für KI

ai-drug-discoveryresearchai-fundingnvidiabiotech
Die Natur als Trainingsgrundlage für KI

Basecamp Research sammelt genetische Proben aus Regenwäldern, Vulkanen und Tiefseegräben auf allen sieben Kontinenten und schafft damit den eigenen Angaben zufolge den größten biologischen KI-Trainingsdatensatz, der je zusammengestellt wurde.

Jahrelang folgte die Trainingsdaten-Beschaffung der KI-Industrie einem vorhersehbaren Muster: Texte aus dem Internet, Bilder aus dem Web, Code von GitHub. Der reichhaltigste unerschlossene Trainingssatz der Erde lag die ganze Zeit unter unseren Füßen.

Basecamp Research, ein in London ansässiges Startup, hat gerade 140 Millionen Dollar von Nvidia, dem Anthology Fund von Anthropic, dem NATO Innovation Fund und anderen eingesammelt, um zu beweisen, dass das stärkste Trainingssignal für KI nicht im offenen Web liegt - sondern in den Genomen von Mikroorganismen, die in Regenwaldböden, Tiefseegräben und vulkanischen heißen Quellen leben.

Die These ist so kühn wie einfach. Die Evolution führt seit 4 Milliarden Jahren Experimente durch. Jeder heute lebende Organismus ist eine Lösung für ein biologisches Problem. Basecamps KI, EDEN genannt, lernt die Muster hinter diesen Lösungen und entwickelt daraus neue Medikamente.

Das Skalenproblem in der Biologie

CTO Philip Lorenz zieht einen eindrucksvollen Vergleich. Sprachmodelle trainieren auf etwa fünf Billiarden Wörtern - im Wesentlichen der Summe aller jemals geschriebenen Texte. Basecamp schätzt die Anzahl der Nukleotide auf der Erde auf 10 hoch 37. "Wenn man einen Stapel Pokerkarten von 10 hoch 37 Karten nehmen würde, würde dieser Stapel das beobachtbare Universum eine Million Mal umgeben", sagt Lorenz.

Die Lücke zwischen den verfügbaren biologischen Daten und dem, was KI benötigt, ist atemberaubend. Noch problematischer: Öffentliche Genomdatenbanken sind dramatisch verzerrt. Etwa 68 Prozent aller Sequenzierungsdaten im Sequence Read Archive stammen von nur fünf Arten. Der Mensch allein macht 54 Prozent aus.

"Wenn man ein LLM nur mit Zeitungsartikeln von 1975 trainieren würde, wäre das ein wirklich, wirklich schlechtes Modell", sagte Lorenz im Interview mit The Decoder. "Genau da stehen wir in der Biologie."

Basecamps Lösung: eigene Daten sammeln, mit lokalen Forschungspartnern in mehr als 30 Ländern auf allen sieben Kontinenten. Der Datensatz umfasst derzeit rund 15 Billionen DNA-Token - vergleichbar mit den Textdatensätzen, die für das Training von Spitzen-Sprachmodellen wie GPT verwendet werden. Bis Ende nächsten Jahres plant das Unternehmen, im Rahmen seines Trillion-Gene-Atlas-Projekts mit Anthropic, Nvidia, PacBio und Ultima Genomics die Marke von einer Billiarde Token zu überschreiten.

EDEN: Das Modell, das von der Evolution lernt

EDEN - Basecamps Flaggschiff-Modell mit 28 Milliarden Parametern - verarbeitet keine Wörter. Es verarbeitet DNA-Bausteine und lernt, welche genetischen Muster mit nützlichen biologischen Eigenschaften korrelieren. Die erste Generation wurde auf 9,7 Billionen DNA-Bausteinen von mehr als einer Million neu sequenzierter Arten trainiert, auf Microsoft Azure mit Rechenleistung, die Berichten zufolge dem GPT-4-Training entsprach.

Die Ergebnisse sind früh, aber beeindruckend. Bei Tests mit antimikrobiellen Peptiden zeigten 97 Prozent der von EDEN entwickelten Kandidaten Aktivität im Labor. Ein Kandidat, EDEN-7, wirkte bei Mäusen mit multiresistenten Bakterien etwa so gut wie ein Reserveantibiotikum - ohne iterative Optimierung vor dem Test.

Für die Gentherapie entwickelt EDEN große Serin-Rekombinasen - Enzyme, die therapeutische DNA an präzisen Stellen im menschlichen Genom einsetzen können. Die Hälfte der generierten Rekombinasen war in menschlichen Zellen aktiv. Bei Tests mit CAR-T-Zellen - Immunzellen, die zur Krebsbekämpfung modifiziert wurden - eliminierte der Ansatz mehr als 90 Prozent der Tumorzellen im Labor.

Die Ironie hinter der Schlagzeile

Die Finanzierungsankündigung liest sich wie eine standardmäßige Biotech-Serie-C. Was sie wirklich überraschend macht, ist die Umkehrung in ihrem Kern. Die KI-Industrie hat jahrelang Modelle entwickelt, die aus menschlichen Outputs lernen - unseren Texten, unseren Bildern, unserem Code. Basecamp argumentiert, dass menschliche Outputs nur ein schmaler Ausschnitt der Intelligenz sind, die auf diesem Planeten existiert. Das Leben selbst hat Lösungen für Probleme generiert, die wir erst zu verstehen beginnen, und diese Lösungen sind in Genomen kodiert, die wir kaum erfasst haben.

Das ist nicht billig. Das Unternehmen hat eine globale Lieferkette für genetisches Material aufgebaut, die fünf Dutzend Länder umfasst, Zustimmungsvereinbarungen mit lokalen Regierungen erfordert und das Extrahieren und Sequenzieren von DNA aus Umgebungen beinhaltet, die die meisten Menschen nie besuchen werden. Jeder Token in EDENs Trainingssatz ist auf seinen genauen geografischen Ursprung und die Zustimmung zu seiner Sammlung zurückverfolgbar.

Der lange Weg zur Klinik

Basecamps Ambition ist nichts Geringeres, als Biologie programmierbar zu machen. "Du promptest auf eine Krankheit und heraus kommt ein Molekül, das diese adressiert", sagt Lorenz. Das Unternehmen ist transparent darüber, wie weit dieses Ziel noch entfernt ist. Keines seiner sechs therapeutischen Programme hat die Lead-Optimierung verlassen - die Phase, in der vielversprechende Kandidaten verfeinert werden, bevor sie in präklinische Studien und schließlich klinische Prüfungen eintreten.

Die Pipeline umfasst In-vivo-CAR-T-Zelltherapien gegen Blutkrebs und Autoimmunerkrankungen, eine Leber-Gentherapie für die Stoffwechselstörung Phenylketonurie (PKU), antimikrobielle Peptide gegen resistente Krankheitserreger sowie frühe Arbeiten an CAR-T-Therapie gegen solide Tumore und Diabetes-Behandlungen.

Verabreichung, Toxizität und die Immunantworten des Körpers bleiben offene Herausforderungen. Patrick Hsu vom Arc Institute hat darauf hingewiesen, dass ein im Labor funktionierender genetischer Eingriff nicht beantwortet, wie die notwendigen Komponenten die richtigen Zellen im Körper erreichen.

Warum das jetzt wichtig ist

Basecamps 140-Millionen-Dollar-Finanzierung kommt zu einem Zeitpunkt, an dem die KI-Industrie hinterfragt, ob Skalierungsgesetze außerhalb der Sprache gelten. Lorenz\u2019 Antwort ist ein eingeschränktes Ja. Basecamps interne Tests zeigen, dass Skalierungskurven für biologische Modelle gelten - allerdings mit anderen Verhältnissen als bei Sprachmodellen. Das Unternehmen reserviert ein Drittel seiner GPUs für Reinforcement-Learning-Experimente und setzt darauf, dass dieselben Techniken, die jüngste Fortschritte bei Modellen wie GPT-6 ermöglicht haben, auch für das Design von Molekülen funktionieren.

Das Unternehmen warnt auch davor, sich allein auf technische Metriken zu verlassen. In Tests, die verschiedene Modellarchitekturen verglichen, erreichte StripedHyena manchmal bessere Perplexity-Werte, aber Llama - die Architektur, die Basecamp letztendlich wählte - schnitt bei tatsächlichen biologischen Aufgaben besser ab. "Nicht zu versprechen, was KI kann oder nicht kann, sondern einfach die Experimente durchführen und herausfinden, was sie tut", sagt Lorenz.

Die Geschichte von Basecamp Research ist eine Geschichte über Daten. Nicht synthetische Daten, nicht aus dem Web gescrapte Daten, nicht von einer anderen KI generierte Daten - sondern Daten, die aus der realen Welt gesammelt wurden, aus Umgebungen, in denen das Leben Probleme löst, lange bevor Menschen existierten. Für eine Branche, die zunehmend erkennt, dass sie das Internet ausgeschöpft hat, ist das vielleicht das interessanteste Signal von allen.

Sources

Mehr erfahren?

Lassen Sie uns besprechen, wie KI Ihr Business transformieren kann.

Kontakt aufnehmen