Was kostet ein KI-Agent im Dauerbetrieb wirklich?

Von Lars Decker

Ein Chat mit einer KI kostet ein paar Cent. Ein Agent, der dauerhaft auf einem Server läuft, Aufgaben abarbeitet und dabei immer wieder seinen Kontext mitschickt, kann im Monat so viel kosten wie ein kleiner Dienstwagen. Oder so viel wie ein Mittagessen. Der Unterschied liegt fast nur in der Wahl des Modells.

Seit wir unseren Agenten Watson dauerhaft auf OpenClaw betreiben, schaue ich deutlich öfter auf die Abrechnung als früher. Solange man selbst im Chat sitzt, merkt man die Kosten kaum. Ein Agent arbeitet aber auch dann, wenn niemand hinsieht: Er prüft Postfächer, fasst Tickets zusammen, ruft Tools auf, wiederholt fehlgeschlagene Schritte und schickt bei jedem Aufruf den gesamten bisherigen Kontext erneut ans Modell. Genau dieser Kontext ist der eigentliche Kostentreiber.


Warum Agenten teurer sind als Chats

Sprachmodelle werden über Tokens abgerechnet, getrennt nach Input (was ans Modell geht) und Output (was zurückkommt). Ein Agent liest bei jedem Schritt seinen Systemprompt, die geladenen Skills, die Tool-Definitionen, die bisherige Unterhaltung und die Ergebnisse der letzten Tool-Aufrufe. Bei einer Aufgabe mit zehn Schritten wird dieser Block zehnmal verschickt. Der Output ist dagegen meist klein: ein Tool-Aufruf, eine kurze Zusammenfassung, eine Entscheidung.

Dazu kommen Kosten, die in keiner Preistabelle stehen. Ein Agent, der in einer Schleife hängt und zwanzigmal dasselbe Tool aufruft, verbrennt Geld ohne Ergebnis. Heartbeats, also regelmäßige „Gibt es etwas zu tun?"-Abfragen, laufen auch nachts. Und jeder Fehler, den ein Mensch später korrigieren muss, kostet Arbeitszeit, die meistens teurer ist als die Tokens.


Eine Beispielrechnung

Damit die Zahlen greifbar werden, eine bewusst einfache Annahme für einen mittelgroßen Agenten im Unternehmen:

  • 200 Aufgaben pro Tag
  • pro Aufgabe rund 40.000 Input-Tokens (Kontext über mehrere Schritte summiert) und 2.000 Output-Tokens
  • 30 Tage im Monat

Das ergibt rund 240 Millionen Input-Tokens und 12 Millionen Output-Tokens pro Monat. Mit den Listenpreisen von Anfang Oktober 2026 sieht das so aus:

Tabelle 1 im Artikel Was kostet ein KI-Agent im Dauerbetrieb wirklich?
ModellInput / Output pro 1 Mio. TokensKosten pro Monat
Claude Fable 5.110,00 $ / 50,00 $ca. 3.000 $
Claude Opus 5.54,00 $ / 20,00 $ca. 1.200 $
Claude Sonnet 5.52,00 $ / 10,00 $ca. 600 $
Claude Haiku 4.51,00 $ / 5,00 $ca. 300 $
GLM 5.3 Flash (Z.ai)0,15 $ / 0,50 $ca. 42 $
DeepSeek V4 Flash0,14 $ / 0,28 $ca. 37 $

Zwischen dem teuersten und dem günstigsten Modell liegt also etwa der Faktor 80. Die Preise ändern sich allerdings häufig, Anbieter wie DeepSeek arbeiten zusätzlich mit Tageszeit-Rabatten, und über Plattformen wie OpenRouter weichen die Preise teils deutlich von den offiziellen ab. Die Tabelle ist eine Momentaufnahme, keine Preisliste zum Nachschlagen.

Prompt Caching verschiebt die Rechnung noch einmal. Wenn der stabile Teil des Kontexts (Systemprompt, Skills, Tools) aus dem Cache kommt, zahlt man dafür nur einen Bruchteil. Bei Opus 5.5 kosten Cache-Treffer 0,20 $ statt 4,00 $ pro Million Tokens. Liegt die Trefferquote bei 80 Prozent, sinkt die Monatsrechnung im Beispiel von rund 1.200 $ auf etwa 470 $. Bei GLM 5.3 Flash kosten gecachte Tokens 0,03 $, dort landet man dann bei unter 20 $. Wer einen Agenten dauerhaft betreibt und Caching nicht nutzt, verschenkt Geld.


Modelle aus China: deutlich günstiger und oft gut genug

In der Praxis hat sich bei mir eine Erkenntnis festgesetzt: Für viele Agenten-Aufgaben sind Modelle aus China völlig ausreichend und dabei um ein Vielfaches günstiger. Ich nutze gern GLM 5.3 Flash von Z.ai. Das Modell ist schnell, hat ein Kontextfenster von bis zu einer Million Tokens und kostet über die offizielle API 0,15 $ pro Million Input-Tokens. Für Zusammenfassungen, das Sortieren und Klassifizieren von Eingängen, das Extrahieren von Daten aus Texten oder das Vorbereiten von Entwürfen merke ich im Alltag kaum einen Unterschied zu deutlich teureren Modellen. DeepSeek V4 Flash, Qwen von Alibaba oder Kimi von Moonshot spielen in einer ähnlichen Liga, wobei die größeren Varianten wie Kimi K3 preislich näher an westlichen Modellen liegen.

Ein Punkt gehört dazu, der im Unternehmen nicht wegdiskutiert werden kann: Wer die Hosted-API eines chinesischen Anbieters nutzt, schickt seine Daten auf Server, deren Datenschutzbedingungen man genau prüfen sollte. Für interne Strategiepapiere, Kundendaten oder personenbezogene Daten ist das in vielen Fällen keine Option. Viele dieser Modelle sind allerdings Open-Weight-Modelle. GLM 5.3 Flash steht zum Beispiel unter MIT-Lizenz und wird auch von Hostern in Europa und den USA angeboten. Damit lässt sich der günstige Preis oft mit einem Hosting verbinden, das zu den eigenen Anforderungen passt.


Nicht jede Aufgabe braucht das größte Modell

Der teuerste Fehler, den ich bei Agenten-Setups sehe, ist ein einziges Spitzenmodell für alles. Das ist bequem, aber ungefähr so, als würde man jede E-Mail im Team vom Geschäftsführer beantworten lassen. Die meisten Schritte eines Agenten sind Routine: eingehende Nachrichten einordnen, eine Datei lesen und zusammenfassen, entscheiden, welcher Skill zuständig ist, ein Ergebnis in ein festes Format bringen.

Besser funktioniert eine Aufteilung nach Schwierigkeit. Ein günstiges, schnelles Modell übernimmt Routing, Klassifikation und einfache Zusammenfassungen. Ein mittleres Modell schreibt Texte, recherchiert und bereitet Entscheidungen vor. Das große Modell kommt nur dann zum Einsatz, wenn es wirklich um etwas geht: Architekturentscheidungen, komplexe Code-Änderungen, mehrstufige Analysen, bei denen ein Fehler teuer wäre. Wenn in unserem Beispiel 80 Prozent der Aufgaben auf GLM 5.3 Flash laufen und nur 20 Prozent auf Opus 5.5, kostet der Monat ohne Caching rund 275 $ statt 1.200 $.

Für Product Owner ist das übrigens eine vertraute Überlegung. Man fragt bei jeder Aufgabe, welches Qualitätsniveau nötig ist und was es kosten darf. Mit Modellen ist es nicht anders. Hilfreich ist, das Routing nicht dem Bauchgefühl zu überlassen, sondern in Skills festzuhalten: Welche Aufgabe läuft auf welchem Modell, und wann wird eskaliert. Wichtig ist auch, die Kosten pro erledigter Aufgabe zu betrachten, nicht pro Aufruf. Ein billiges Modell, das dreimal neu ansetzen muss oder dessen Ergebnis ein Mensch nacharbeitet, ist am Ende nicht billiger.


Lokale Modelle: für manches reicht der eigene Rechner

Für einige Aufgaben muss überhaupt keine API bezahlt werden. Kleinere Open-Weight-Modelle laufen mit Ollama oder LM Studio auf einem aktuellen Mac oder einem Rechner mit ordentlicher Grafikkarte. Für das Klassifizieren von E-Mails, das Umformulieren kurzer Texte, das Extrahieren von Feldern aus Dokumenten oder einfache Zusammenfassungen genügt das oft. Die Daten verlassen dabei das eigene Netz nicht, und die laufenden Kosten beschränken sich auf Strom.

Man sollte aber realistisch bleiben. Die großen Open-Weight-Modelle sind lokal kaum zu betreiben. GLM 5.3 Flash hat zum Beispiel 320 Milliarden Parameter (davon rund 18 Milliarden pro Token aktiv) und braucht selbst stark komprimiert um die 128 GB Arbeitsspeicher, für eine brauchbare 4-Bit-Variante eher 192 bis 256 GB. Lokal laufen deshalb meist die kleinen Geschwister, und die sind bei komplexen Agenten-Aufgaben mit vielen Tool-Aufrufen spürbar schwächer. Dazu kommen die Anschaffung der Hardware und der eigene Aufwand für Betrieb und Updates. Lokale Modelle sind gut für klar umrissene Teilaufgaben, als alleiniges Gehirn eines Agenten im Unternehmen eher nicht.


Abos bei Claude und ChatGPT lohnen sich derzeit

Für die eigene Arbeit gibt es noch einen Weg, der oft übersehen wird. Ein Abo bei Claude oder ChatGPT ist im Moment ziemlich günstig, gemessen an dem, was man dafür bekommt. Die Pakete beginnen bei rund 20 $ im Monat, die größeren Tarife wie Claude Max oder ChatGPT Pro liegen bei 100 bis 200 $. Darin enthalten ist nicht nur der Chat, sondern auch die Nutzung von Werkzeugen wie Claude Code oder Codex. Wer intensiv damit arbeitet, würde dieselbe Menge an Tokens über die API zum Listenpreis schnell um ein Vielfaches teurer bezahlen. Mein Eindruck ist, dass die Anbieter diese Abos im Moment kräftig subventionieren, um Nutzer zu gewinnen und zu halten. Das wird nicht ewig so bleiben, aber solange es so ist, sollte man es nutzen.

Die Einschränkung: Abos sind für die eigene, interaktive Nutzung gedacht und haben Nutzungslimits. Einen Agenten, der rund um die Uhr auf einem Server für das ganze Team arbeitet, betreibt man in der Regel über die API, und die Nutzungsbedingungen der Anbieter sollte man an dieser Stelle genau lesen. In der Praxis ergänzt sich das gut. Das Abo deckt die eigene Arbeit mit den Spitzenmodellen ab, der Agent im Hintergrund läuft über die API mit einem Mix aus günstigen und teuren Modellen.


Wie ich die Kosten im Griff behalte

Ein paar Regeln haben sich für mich bewährt:

  • Ein festes Monatsbudget pro Agent beim Anbieter einstellen, damit eine Endlosschleife nicht zur Überraschung auf der Rechnung wird.
  • Den Kontext schlank halten: Skills und Tools nur laden, wenn sie gebraucht werden, alte Tool-Ergebnisse aus dem Verlauf entfernen.
  • Prompt Caching aktivieren und prüfen, ob es tatsächlich greift. Ein Zeitstempel im Systemprompt reicht, um jeden Cache-Treffer zu verhindern.
  • Kosten pro Aufgabentyp messen, nicht nur die Gesamtsumme. Erst dann sieht man, wo sich ein günstigeres Modell lohnt.
  • Neue Modelle regelmäßig gegen die eigenen Aufgaben testen. Die Preise fallen schnell, und ein Modell, das vor drei Monaten nicht gereicht hat, reicht heute vielleicht.

Ein KI-Agent im Dauerbetrieb kostet also so viel, wie man ihn kosten lässt. Mit einem einzigen Spitzenmodell für alles landet man schnell im vierstelligen Bereich pro Monat. Mit sinnvollem Routing, Caching, günstigen Modellen wie GLM 5.3 Flash für die Routine und lokalen Modellen für einfache Teilaufgaben ist derselbe Agent oft für einen niedrigen dreistelligen oder sogar zweistelligen Betrag zu haben.

Weiterführende Artikel