28. September 2026·7 Min. Lesezeit·AIgentic.media

AWS CloudWatch Omni stellt die Frage für KI-Agenten neu: „Warum hat der Agent das getan?"

awski-observabilityagentic-kicloudwatchtooling
AWS CloudWatch Omni stellt die Frage für KI-Agenten neu: „Warum hat der Agent das getan?"

Drei\u00dfig Jahre lang fragte Observability nach einem. Agentic KI macht daraus die falsche Frage.

Alle paar Jahre kommt eine Technologie, die leise eine Frage umschreibt, die niemand mehr zu stellen wagte.

Drei\u00dfig Jahre lang beantworteten Observability-Tools eine einzige Frage: \u201eL\u00e4uft das System?\u201c Die Antwort war ein gr\u00fcnes Dashboard \u2014 Latenz unter dem Schwellwert, Fehleranzahl null, Betriebszeit 99,9 Prozent. Das war genug. Software war deterministisch: dieselbe Eingabe erzeugte dieselbe Ausgabe, und ein gesundes System war ein korrektes System.

Agentic KI zerbricht dieses Modell vollst\u00e4ndig.

Ein Agent kann eine saubere Antwort zur\u00fcckliefern, alle Latenzziele erf\u00fcllen und keine Fehler werfen \u2014 und trotzdem dem Kunden die falsche Antwort geben, das falsche Werkzeug aufrufen oder aus einer veralteten Wissensdatenbank sch\u00f6pfen. Nach allen traditionellen Metriken ist das System gesund. Nach der einzigen Metrik, die f\u00fcr das Gesch\u00e4ft z\u00e4hlt, ist es gescheitert.

AWS bringt Amazon CloudWatch Omni auf den Markt, um die Frage zu \u00e4ndern. Statt \u201eL\u00e4uft es?\u201c lautet die neue Frage: \u201eWarum hat mein Agent das getan?\u201c Und diese Verschiebung k\u00f6nnte der gr\u00f6\u00dfte Engpass sein, der die meisten Unternehmen von produktionsreifer agentischer KI trennt.

Die alte Frage war f\u00fcr deterministische Software gemacht

Observability als Industrie wurde im Zeitalter der Monolithen geboren und reifte durch verteilte Mikroservices, Container und Serverless. In jedem Paradigma blieb die Kernfrage dieselbe: Ist das System gesund? Entwickler instrumentierten Code, Dashboards leuchteten gr\u00fcn oder rot auf, und der Pager-Dienst alarmierte bei Anomalien.

Das funktionierte, weil Software vorhersagbar war. Ein Webserver, der HTTP 200 zur\u00fcckgab, lieferte den richtigen Inhalt aus. Eine Datenbankabfrage, die in 50ms abschloss, gab die richtigen Zeilen zur\u00fcck. Es gab keine L\u00fccke zwischen \u201eSystem ist gesund\u201c und \u201eAusgabe ist korrekt.\u201c

Agenten zerst\u00f6ren diese Annahme.

Ein Agent orchestriert LLM-Aufrufe, Werkzeug-Invokationen, Sub-Agenten-\u00dcbergaben und Reasoning-Ketten, um ein offenes Ziel zu erf\u00fcllen. Eine harmlos erscheinende Prompt-\u00c4nderung kann die Antwortqualit\u00e4t beeintr\u00e4chtigen, ohne dass dies Auswirkungen auf Latenz oder Fehlerraten hat. Der Agent kann das falsche Werkzeug ausw\u00e4hlen, aus der falschen Wissensquelle sch\u00f6pfen oder die falsche API aufrufen \u2014 und dabei durchweg gesunde Metriken melden.

Eine von AWS zitierte IDC-Prognose erwartet mehr als 1 Milliarde bereitgestellte Agenten bis 2029. Kein Betriebsteam kann dieses Volumen an nicht-deterministischem Verhalten manuell \u00fcberpr\u00fcfen. Aber Vertrauen erfordert Sichtbarkeit, und Sichtbarkeit f\u00fcr Agenten erfordert ein grundlegend anderes Observability-Modell.

Was CloudWatch Omni tats\u00e4chlich tut

CloudWatch Omni \u2014 das letzte Woche allgemein verf\u00fcgbar wurde \u2014 ist AWS\u2018 Antwort auf diese Vertrauensl\u00fccke. Es ist eine app-zentrierte, KI-gest\u00fctzte Observability-Plattform, die auf OpenTelemetry basiert und au\u00dferhalb der AWS Management Console arbeitet.

Der wichtigste Teil sind nicht die Dashboards. Es ist die Evaluierungs-Engine.

CloudWatch Omni erfasst jeden Agenten-Trace \u2014 jeden LLM-Aufruf, jede Werkzeug-Invokation, jeden Reasoning-Schritt und jede Sub-Agenten-\u00dcbergabe \u2014 als strukturierte Spans in einer hierarchischen Zeitleiste. Dann f\u00fchrt es 17 integrierte Evaluatoren aus, die jede Antwort auf Dimensionen wie Koh\u00e4renz, Hilfreichkeit, Faktenrichtigkeit, Routing-Korrektheit und Retrieval-Qualit\u00e4t bewerten.

Teams k\u00f6nnen Prompt-Versionen nebeneinander in einer Playground-Umgebung vergleichen, Testdatens\u00e4tze direkt aus Produktions-Traces erstellen und Experimente mit verschiedenen Modell- und Prompt-Konfigurationen durchf\u00fchren, um Regressionen zu erkennen, bevor sie Kunden erreichen. Evaluatoren k\u00f6nnen auch kontinuierlich gegen Live-Traffic laufen, sodass Qualit\u00e4tsabweichungen genauso gemeldet werden wie ein CPU-Ausrei\u00dfer.

Die Instrumentierung l\u00e4uft auf OpenInference und der AWS Distro for OpenTelemetry und funktioniert, ob Agenten auf AWS oder in anderen Clouds laufen. Die Plattform unterst\u00fctzt LangChain, LangGraph, CrewAI, das OpenAI Agents SDK, Strands und das Vercel AI SDK. Amazon Bedrock AgentCore-Agenten erhalten Omni-Instrumentierung automatisch.

Zwei Oberfl\u00e4chen, eine Datenebene

CloudWatch Omni bietet Observability \u00fcber zwei komplement\u00e4re Schnittstellen.

Entwickler erhalten eine native Erweiterung f\u00fcr Visual Studio Code und Kiro, in der Traces w\u00e4hrend der lokalen Agentenausf\u00fchrung erscheinen \u2014 ohne dass ein AWS-Konto f\u00fcr die grundlegende Nutzung erforderlich ist. Die Erweiterung integriert sich mit KI-Coding-Assistenten wie Claude Code und Codex, die die Instrumentierung automatisch einrichten k\u00f6nnen. Eine \u201eCloud Login\u201c-Funktion verbindet die lokale Umgebung optional mit einem AWS-Konto f\u00fcr persistenten Speicher und Team-Sharing.

Operatoren erhalten eine eigenst\u00e4ndige Web-Erfahrung mit Single Sign-On \u00fcber vorhandene Identit\u00e4tsanbieter wie Okta und Microsoft Entra ID. Beide Oberfl\u00e4chen teilen sich eine einzige Datenebene, sodass der Trace, den ein Entwickler lokal debuggt, derselbe ist, den ein Operator in der Produktion untersucht.

AWS r\u00e4umt ein, dass seine Management Console f\u00fcr Infrastruktur-Administratoren gebaut wurde \u2014 nicht f\u00fcr die Site-Reliability-Ingenieure, KI-Ingenieure und Anwendungseigent\u00fcmer, die jetzt die operative Verantwortung f\u00fcr Agenten tragen. Die Entwickler in der IDE abzuholen, wo Qualit\u00e4tsprobleme am g\u00fcnstigsten zu beheben sind, ist eine bewusste Designentscheidung.

Fr\u00fche Anwender: Sony, Capital One und die Realit\u00e4t von Hunderten von Agenten

Sony ist ein fr\u00fcher Anwender. Masahiro Oba, Senior General Manager der AI Acceleration Division bei Sony, beschrieb die agentische KI-Plattform des Unternehmens als laufend mit \u201eHunderten von Proof-of-Concept- und Produktions-Workloads.\u201c

Das Schl\u00fcsselwort ist \u201eHunderte.\u201c Die meisten Unternehmen scheitern nicht am Bau eines einzelnen Agenten. Sie scheitern an der Verwaltung von Dutzenden oder Hunderten, von denen jeder von einem anderen Team mit einer anderen Vorstellung davon gebaut wurde, was \u201egut\u201c bedeutet. Oba merkte an, dass die Zusammenstellung von Evaluierungsdatens\u00e4tzen oft ein gesch\u00e4ftlicher Engpass ist und dass die Ein-Klick-Erstellung von Datens\u00e4tzen aus Live-Traces diese Reibung beseitigt.

Capital One war als Design-Partner beteiligt. Parvez Naqvi, Managing Vice President f\u00fcr Cloud Platform and Resilience Engineering bei Capital One, sagte, die Bank habe dazu beigetragen, eine einzige KI-gest\u00fctzte Observability-L\u00f6sung zu formen, die \u201etopologiebewusste Intelligenz und Natural-Language-Querying \u00fcber alle Telemetrie von einer einzigen Oberfl\u00e4che\u201c bietet. F\u00fcr regulierte Branchen dient die aufgezeichnete Untersuchungshistorie als Pr\u00fcfnachweis \u2014 eine entscheidende Funktion, wenn Compliance-Teams rekonstruieren m\u00fcssen, wie ein KI-Vorfall behandelt wurde.

Die Wettbewerbslandschaft

CloudWatch Omni betritt ein stark umk\u00e4mpftes Feld. Datadog, Dynatrace, New Relic, Grafana Labs und Splunk erweitern alle ihre Angebote in Richtung Agent-Observability. LLM-fokussierte Tools wie LangSmith und Arize AI verf\u00fcgen \u00fcber spezialisierte Tracing-F\u00e4higkeiten.

AWS\u2018 Differenzierung ist die Integrationstiefe. Da Agenten-Traces, Anwendungstelemetrie und Infrastruktursignale alle im selben CloudWatch-Datenspeicher leben, kann eine Untersuchung bei einem Agenten beginnen, der ein schlechtes Tool-Ergebnis erh\u00e4lt, zu einem API-Fehler eines kapazit\u00e4tsbegrenzten Dienstes f\u00fchren und bei einem ersch\u00f6pften Datenbankverbindungspool enden. In den meisten Unternehmen sind das heute drei Tools, drei Teams und viele Meetings.

Der AWS DevOps Agent ist standardm\u00e4\u00dfig in Untersuchungssitzungen aktiviert, korreliert Signale \u00fcber den gesamten Stack und pflegt eine vollst\u00e4ndige Untersuchungshistorie.

Aber die Intelligence-Ebene ist nicht portabel. Die Topologie, Evaluatoren, Untersuchungshistorie und der DevOps Agent laufen alle auf AWS. Unternehmen, die bereits stark in AWS investiert haben, werden Omni als nat\u00fcrliche Standardl\u00f6sung sehen. Diejenigen mit ausgereiften Datadog- oder Splunk-Umgebungen in mehreren Clouds werden es wahrscheinlich f\u00fcr Agentenentwicklung und -evaluierung nutzen, w\u00e4hrend ihr Observability-System der Wahl bestehen bleibt.

Der Haken: Agenten sind gespr\u00e4chig

Es gibt einen Haken: Agenten erzeugen ein au\u00dfergew\u00f6hnliches Volumen an Telemetrie. Jeder Prompt, Modellaufruf, jede Werkzeug-Invokation und Sub-Agenten-\u00dcbergabe erzeugt einen Span. Multipliziert man das \u00fcber Hunderte von Workloads mit kontinuierlicher Evaluierung, k\u00f6nnen die Ingestion-Kosten das KI-Budget \u00fcbersteigen, das sie geschaffen hat.

Die IDE-Erweiterung ist kostenlos. Kunden zahlen f\u00fcr die Telemetrie, die sie senden und speichern. Dashboards und Alarme sind kostenlos, und Abfragen bis zum F\u00fcnffachen des monatlichen Ingestion-Volumens sind enthalten. Berechtigte Konten erhalten eine 30-Tage-Testversion und 1.000 Dollar OpenTelemetry-Ingestion-Gutschrift. Der DevOps Agent wird separat abgerechnet.

AWS empfiehlt, dass Unternehmen die Telemetriekosten im Produktionsma\u00dfstab modellieren und Richtlinien f\u00fcr Sampling, Aufbewahrung und Evaluierungsh\u00e4ufigkeit festlegen, bevor Agenten live gehen \u2014 nicht nachdem die erste Rechnung eintrifft.

Was das f\u00fcr die Enterprise-KI-Einf\u00fchrung bedeutet

CloudWatch Omni ist die Anerkennung des gr\u00f6\u00dften Cloud-Anbieters, dass agentische KI eine neue operative Disziplin erfordert. Die Industrie hat ein Jahrzehnt damit verbracht, verteilte Systeme zu beobachten. Die Beobachtung von KI-Agenten erfordert die Beobachtung von Entscheidungen, nicht nur der Systemgesundheit.

Die Unternehmen, die am meisten von Omni profitieren, werden diejenigen sein, die Evaluierung als operative Disziplin behandeln, nicht als ein Feature, das man einschaltet. Sie werden definieren, was \u201egut\u201c bedeutet, bevor sie den Evaluator kaufen. Sie werden die Instrumentierung auf OpenTelemetry standardisieren, unabh\u00e4ngig vom Backend. Und sie werden die aufgezeichnete Untersuchungshistorie in ihre KI-Risiko- und Compliance-Prozesse integrieren.

Die Vertrauensl\u00fccke zwischen \u201eder Agent lief erfolgreich\u201c und \u201eder Agent hat das Richtige getan\u201c ist derzeit die gr\u00f6\u00dfte H\u00fcrde f\u00fcr die Produktionsbereitstellung von KI-Agenten. AWS hat sich gerade positioniert, um die Ebene zu besitzen, die diese L\u00fccke schlie\u00dft.

Quellen

Mehr erfahren?

Lassen Sie uns besprechen, wie KI Ihr Business transformieren kann.

Kontakt aufnehmen