Blog – Future Processing
Startseite Blog KI/ML Kosten für KI-Token: Wofür zahlen Sie eigentlich, und warum steigen die Kosten immer noch?
KI/ML

Kosten für KI-Token: Wofür zahlen Sie eigentlich, und warum steigen die Kosten immer noch?

Die Demo hat fast nichts gekostet. Der erste Monat in der Produktion war teurer als erwartet. Der zweite Monat war teurer als der erste. Wenn dann jemand eine Budgetdiskussion bis auf Ihre Ebene eskaliert, laufen Sie bereits der Kostenstruktur hinterher, die Sie nicht selbst entworfen haben.

Teilen auf:

Inhaltsverzeichnis

Auf teilen:

Das ist das Muster, das wir immer wieder beobachten. Ein Modell, das in Tests hervorragende Leistungen erbracht hat, steigert im realen Einsatz still und leise seinen Verbrauch – durch längere Konversationsverläufe, abgerufene Dokumente, Wiederholungsversuche und agentenbasierte Workflows, die acht Modellaufrufe miteinander verknüpfen, um das zu erledigen, was einst wie ein einzelner Vorgang erschien. Der Token-Verbrauch ist kein Posten, der konstant bleibt. Er summiert sich.

Das Ziel dieses Artikels ist es nicht, Sie davon zu überzeugen, dass KI teuer oder billig ist. Beide Sichtweisen sind irreführend. Die eigentliche Frage ist, ob Ihr Unternehmen über die nötige Transparenz und Kontrolle verfügt, um gezielt Ausgaben zu tätigen – und derzeit ist dies bei den meisten nicht der Fall.

Die wichtigsten Erkenntnisse

  • Eingabe- und Ausgabetoken werden aus architektonischen Gründen unterschiedlich bepreist, nicht willkürlich: Die Ausgabegenerierung erfolgt sequenziell und ist rechenintensiv; sie kostet in der Regel das Drei- bis Fünffache des Preises der Eingabe, oft sogar noch mehr. Daher weisen Systeme, die lange Antworten erzeugen, ein grundlegend anderes Kostenprofil auf als solche, die lange Eingabeaufforderungen auslesen.

  • Nicht jede Aufgabe erfordert das neueste, leistungsfähigste Modell; 70 bis 80 Prozent der Abfragen an kostengünstigere Modelle weiterzuleiten und die Spitzenleistung für wirklich komplexe Aufgaben zu reservieren, ist eine technische Entscheidung mit quantifizierbaren finanziellen Konsequenzen und kein Qualitätskompromiss.

  • Der heute verfügbare Kostenhebel mit der höchsten Rendite ist in der Regel am einfachsten umzusetzen: Allein durch das Zwischenspeichern von Eingabeaufforderungen lassen sich die Kosten einer stabilen System-Eingabeaufforderung um rund 90 Prozent senken, und diese Möglichkeit wird durchweg zu wenig genutzt.

Eingabe-AI-Token vs. Ausgabe-Token: Warum die Asymmetrie wichtiger ist als der Nominalpreis

Anbieter veröffentlichen ihre Preise paarweise: einen Eingangs- und einen Ausgangspreis, angegeben pro Million Token. Der Ausgangspreis ist durchweg höher: in der Regel das Drei- bis Fünffache des Eingangspreises, manchmal sogar noch mehr. Jedes Anthropic-Modell in der folgenden Tabelle liegt genau beim 5-fachen, und die Budget-Modelle liegen sogar noch höher. Die meisten Teams nehmen dies zur Kenntnis und zucken mit den Schultern. Das sollten sie jedoch nicht tun.

Der Grund für diese Asymmetrie liegt in der Architektur. Eingabetoken werden parallel über die GPU-Kerne hinweg verarbeitet. Das Modell liest Ihre Eingabeaufforderung, Ihre Systemanweisungen und den gesamten abgerufenen Kontext auf einmal in einem einzigen Vorwärtsdurchlauf. Das ist rechnerisch effizient. Ausgabe-Token werden nacheinander generiert: Jedes neue Wort erfordert einen vollständigen Vorwärtsdurchlauf durch das gesamte Modell, bevor das nächste erzeugt werden kann. Diese sequenzielle Abhängigkeit ist aufwendig, und die Kosten summieren sich mit jedem Zeichen, das das Modell schreibt.

Die praktische Konsequenz ist, dass sich derselbe Modellpreis je nach dem, was Sie entwickeln, sehr unterschiedlich auswirkt. Ein System, das lange Dokumente liest und kurze Antworten gibt, hat ein grundlegend anderes Kostenprofil als eines, das lange, detaillierte Ausgaben generiert. Eine Zusammenfassungs-Pipeline, ein Klassifizierungsdienst, ein Routing-Agent: Diese sind eingabeschwer und relativ kostengünstig im Betrieb. Ein Assistent zur Codegenerierung, ein Tool zum Verfassen langer Texte oder jeder Workflow, der umfangreiche, strukturierte Antworten erzeugt, ist ausgangsintensiv und entsprechend teuer.

Die meisten Business-Cases für den Einsatz von KI basieren auf einer groben Schätzung, die diesen Unterschied völlig außer Acht lässt. Die Teams, die korrekt kalkulierte Business-Cases erstellen, messen ihr tatsächliches Eingabe-Ausgabe-Verhältnis pro Anfragetyp in der Staging-Umgebung, bevor sie sich auf eine Architektur festlegen. Alle anderen erfahren es erst auf der Rechnung.

Wovon hängen die Kosten für AI-Token ab? Die wichtigsten Faktoren

Der Token-Preis ist nur der Ausgangspunkt. Die tatsächlichen Kosten für den Betrieb eines Modells in der Produktion werden von mehreren Variablen bestimmt, deren Wechselwirkungen nicht immer offensichtlich sind.

Die Modellklasse und der Anbieter legen die Untergrenze fest. Frontier-Modelle, also die leistungsfähigsten und neuesten Versionen von Anthropic, OpenAI oder Google, weisen die höchsten Preise pro Token auf. Modelle der mittleren Stufe und destillierte Modelle sind um eine Größenordnung günstiger. Die Wahl des Modells ist daher nicht nur eine Qualitätsentscheidung, sondern auch eine Entscheidung zur finanziellen Architektur – und beide sollten gemeinsam getroffen werden.

Die Größe des Kontextfensters ist einer der am meisten unterschätzten Kostenfaktoren. Jedes Token in Ihrem Kontextfenster – einschließlich Ihrer Systemaufforderung, des Konversationsverlaufs, der abgerufenen Dokumente und der Tool-Definitionen – wird bei jeder einzelnen Anfrage als Eingabe abgerechnet. Eine Systemaufforderung mit 4.000 Token, die mit 10.000 täglichen Anfragen gesendet wird, führt zu 40 Millionen Eingabetoken pro Tag oder rund 1,2 Milliarden pro Monat – und das noch bevor eine einzige Benutzeranfrage hinzukommt. Unternehmen, die den Overhead ihrer Prompts nicht erfasst haben, sind regelmäßig überrascht, wenn sie feststellen, dass 30–40 Prozent ihres Token-Budgets durch strukturelle Gerüste statt durch tatsächliche Nutzerinhalte verbraucht werden.

Die Art der Aufgabe spielt eine Rolle, die sich nicht immer eindeutig auf die Modellfähigkeiten übertragen lässt. Aufgaben, die ein ausgedehntes logisches Schlussfolgern erfordern, verbrauchen Token anders als reine Generierung oder Klassifizierung. Einige Modellfamilien berechnen einen Aufschlag für erweiterte Denkmodi; andere beziehen diesen implizit mit ein. Wenn Sie Schlussfolgerungsfunktionen aktivieren, ohne deren Token-Kostenprofil zu verstehen, agieren Sie blind.

Die Bereitstellungsmethode führt zu einer Gabelung in der Kostenstruktur. Der API-Zugriff über einen Anbieter wie Anthropic, OpenAI oder Google ist die Standardvariante: Sie zahlen pro Token zu veröffentlichten Tarifen, wobei der Anbieter die Infrastruktur verwaltet. Selbst gehostete Modelle verlagern die Kosten auf die Rechenleistung und umfassen GPU-Instanzstunden, Arbeitsspeicher und die Serving-Infrastruktur. Selbsthosting ist bei geringen bis mittleren Volumina fast nie günstiger, doch die Wirtschaftlichkeit kann sich bei sehr hohem Durchsatz ändern oder wenn Anforderungen an den Datenaufbewahrungsort den API-Zugriff über Dritte unmöglich machen.

Die Möglichkeit des Cachings ist ein Hebel, den viele Teams einfach vergessen zu nutzen, obwohl er zu den schnellsten Möglichkeiten gehört, um Erfolge zu erzielen. Wir werden in Kürze detailliert darauf eingehen.

AI Readiness Assessment

Verschaffen Sie sich einen klaren Überblick darüber, inwieweit Ihre Daten darauf vorbereitet sind, KI-Initiativen in Ihrem Unternehmen zu unterstützen und zu skalieren.

Wie die Preisgestaltung für KI-Modelle aufgebaut ist

Die Anbieter unterteilen die Modelle in drei große Preisstufen, und die Tarife ändern sich monatlich je nach Anbieter, sodass absolute Zahlen schnell veralten.

  • Budgetmodelle, also kompakte oder abgespeckte Versionen, befinden sich am unteren Ende.
  • Modelle der mittleren Preisklasse bieten die Ausgewogenheit, die die meisten Produktions-Workloads tatsächlich benötigen.
  • Frontier-Modelle, die leistungsstärksten und zuletzt veröffentlichten, befinden sich an der Spitze.

Die Spanne zwischen der günstigsten und der leistungsstärksten Stufe liegt in der Regel im Bereich des 20- bis 30-Fachen, sowohl bei den Eingangs- als auch bei den Ausgangspreisen, wobei sich diese Lücke im Laufe der Zeit verengt, da der Wettbewerb zwischen den Anbietern zunimmt. Eine Arbeitslast, die auf einem Budget-Modell wenige Dollar im Monat kosten würde, kann bei gleichem Volumen auf einem „Frontier“-Modell mehrere hundert Dollar kosten. Die Entscheidung, welche Stufe welche Aufgabe übernimmt, ist nicht allein eine Qualitätsentscheidung. Es handelt sich um eine Kostenentscheidung mit erheblichen finanziellen Konsequenzen.

Modellstufen und der Kompromiss zwischen Qualität und Kosten: Wann ist ein kostengünstigeres Modell die richtige technische Entscheidung?

In Diskussionen über den Einsatz von KI wird immer wieder davon ausgegangen, dass das neueste und leistungsfähigste Modell die richtige Standardwahl ist. Das ist jedoch nicht der Fall.

Jedes neue Modell ist darauf ausgelegt, Probleme zu lösen, die frühere Modelle nicht bewältigen konnten. Das ist sein ausdrückliches Designziel, und genau deshalb ist die Annahme, dass die neueste Version für jede Aufgabe das richtige Werkzeug ist, ein Irrtum, den es sorgfältig zu hinterfragen gilt. Nicht jede Aufgabe ist besonders anspruchsvoll. Das Verfassen eines Standardartikels, die Verarbeitung eines gut strukturierten Formulars, die Klassifizierung eines Support-Tickets: Das sind keine Probleme, die das leistungsfähigste verfügbare Modell erfordern. Sie erfordern ein Modell, das gut genug ist.

Das daraus folgende technische Prinzip ist einfach: Aufgaben nach Komplexität zuweisen, nicht nach Standard. Die Produktionssysteme, die wir in kostenbewussten Organisationen gut funktionieren sehen, leiten 70–80 Prozent der Anfragen an schnellere, kostengünstigere Modelle weiter und reservieren die Spitzenmodelle für die 10–20 Prozent der Aufgaben, die ihre Leistungsfähigkeit wirklich erfordern – sei es komplexes logisches Denken, mehrstufige Codesynthese oder mehrdeutige Randfälle, die kleinere Modelle nachweislich schlecht bewältigen.

Diese abgestufte Weiterleitung ist nicht nur eine Budgetmaßnahme. Sie reduziert auch die Latenz für die Mehrheit der Anfragen, da schlankere Modelle schneller reagieren, und sie zwingt die Entwicklerteams dazu, explizit darüber nachzudenken, was von jedem Modell tatsächlich verlangt wird – eine Disziplin, die sich sowohl in der Qualität als auch bei den Kosten auszahlt.

Es gibt jedoch einen wichtigen Vorbehalt: Die Verfügbarkeit der Modelle ist nicht statisch. Anbieter stellen ältere Versionen nach und nach ein und halten in der Regel nur die letzten paar Hauptversionen verfügbar.

Routing-Strategien, die auf bestimmten, nicht mehr unterstützten Versionen basieren, führen zu Anfälligkeiten. Die Routing-Logik muss den Lebenszyklus der Modelle berücksichtigen, nicht nur die aktuellen Preise.

Das Routing über mehrere Anbieter wird zunehmend praktikabel. Sowohl AWS Bedrock als auch Azure AI Studio bieten über eine einzige API-Oberfläche Zugriff auf Modelle verschiedener Anbieter. Es ist heute architektonisch machbar, eine Charge einfacher Klassifizierungsaufgaben an ein kostengünstiges Modell eines Anbieters weiterzuleiten, während komplexe Schlussfolgerungsaufgaben an ein Spitzenmodell eines anderen Anbieters gesendet werden – und die Kostenoptimierung ist real.

Der wachsende Wettbewerb – nicht nur durch etablierte US-Anbieter, sondern zunehmend auch durch chinesische und europäische Modellentwickler – beschleunigt diese Entwicklung. Die Anzahl der brauchbaren, glaubwürdigen Modelloptionen, die auf verwalteten Marktplätzen verfügbar sind, nimmt zu.

Wie lassen sich die Kosten für KI-Token kontrollieren?

Der Einsatz von Token ohne Governance ist kein technisches Problem, sondern ein organisatorisches. Bevor man einzelne API-Aufrufe optimiert, lautet die wichtigere Frage: Wer ist für das Token-Budget verantwortlich, welchen Überblick hat diese Person und wie werden Limits zur Laufzeit durchgesetzt, anstatt erst am Monatsende festgestellt zu werden?

Unternehmen, die ihre KI-Ausgaben gut kontrollieren, haben einige gemeinsame Vorgehensweisen:

  • Erfassen Sie jeden wesentlichen Workflow zum Zeitpunkt der Ausführung: Protokollieren Sie die Token-Anzahl pro Anfragetyp, pro Mitarbeiter und pro Team, bevor eine Kostenkrise Sie dazu zwingt.
  • Legen Sie Verbrauchsgrenzen pro Anwendung und pro Team fest: Lösen Sie Warnmeldungen aus oder drosseln Sie Anfragen, bevor die Rechnungen ins Unermessliche steigen, anstatt eine forensische Untersuchung der Kosten des letzten Monats durchzuführen.
  • Unterscheiden Sie zwischen den Kosten einer erfolgreich ausgeführten Anfrage und den Kosten einer fehlgeschlagenen Anfrage: Wiederholungsversuche, durch „Halluzinationen“ ausgelöste Kaskaden und Fehlerbehandlungspfade machen oft einen überraschend hohen Anteil der Produktionsausgaben aus.

Selbst das ausgefeilteste Modell der Welt kann minderwertige Eingabedaten nicht ausgleichen. Beginnen Sie mit den Grundlagen; die analytische Ebene ergibt sich dann ganz von selbst. 

Ein weiterer Aspekt, der häufig fehlt, ist ein klarer Verantwortlicher. Die Kosten für KI-Inferenz fallen oft in die Lücke zwischen dem Datenteam, dem Produktteam und der Finanzabteilung. Keines dieser Teams übernimmt die volle Verantwortung. Das Ergebnis ist, dass die Ausgaben für Token vierteljährlich und reaktiv überprüft werden – meist zu spät, um die architektonischen Entscheidungen zu beeinflussen, die zu diesen Ausgaben geführt haben.

Optimierung der Festivalplanung mit einem KI-Tool, das in weniger als 20 Sekunden
Vorschläge für das Programm erstellt – und das bei nahezu null Betriebskosten

Lesen Sie die Fallstudie

Fünf Hebel zur Kostenoptimierung, die Produktionsteams nutzen können

Prompt-Caching. Ein wiederverwendeter Teil Ihres Prompts – in der Regel Ihre Systemanweisungen, der statische Kontext oder Tool-Definitionen – kann serverseitig gespeichert werden, sodass nachfolgende Aufrufe diesen aus dem Cache mit einem Bruchteil der Standard-Eingaberate abrufen können. Anthropic berechnet bei Cache-Treffern 10 Prozent der normalen Eingaberate; OpenAI berechnet 50 Prozent.

Bei einer Produktionsanwendung mit einer konsistenten System-Prompt-Länge von 4.000 Token, die täglich 10.000 Anfragen mit einer Cache-Trefferquote von 90 Prozent verarbeitet, senkt die Aktivierung des Caching die täglichen Kosten für diese Prompt von etwa 120 Dollar auf etwa 25 Dollar. Die aus dem Cache gelesenen Daten kosten ein Zehntel des Standardtarifs, während für die 10 Prozent der Cache-Fehltreffer weiterhin der volle Preis zuzüglich eines geringen Schreibaufschlags anfällt. Das entspricht einer Ersparnis von fast 3.000 US-Dollar pro Monat durch eine einzige Konfigurationsänderung. Dies ist durchweg einer der Hebel mit der höchsten Rendite, der jedoch regelmäßig zu wenig genutzt wird.

Stufenweises Modell-Routing. Wie oben beschrieben: Klassifizieren Sie Aufgaben nach Komplexität, bevor Sie ein Modell aufrufen, und leiten Sie sie entsprechend weiter. Die Entwicklungskosten für die Erstellung der Routing-Logik amortisieren sich in der Regel innerhalb weniger Wochen nach der Produktivbereitstellung in nennenswertem Umfang.

Disziplin beim Kontextfenster. Jedes Token im Kontext wird in Rechnung gestellt. Eine straffe Begrenzung des Konversationsumfangs – mit weniger RAG-Blöcken, komprimierten Systemaufforderungen und dem Löschen des Konversationsverlaufs nach Abschluss der Aufgabe – senkt direkt die Kosten für die Eingaben. Eine Konversation so zu gestalten, dass Antworten prägnant und zielgerichtet sind, bedeutet nicht, die Qualität zu beeinträchtigen. Es geht darum, Verschwendung zu beseitigen. Wenn das Modell 800 Token erzeugt, obwohl 200 dem Nutzer ebenso gut gedient hätten, zahlen Sie für 600 Token, die keinen Nutzen haben. Bei größeren Projekten ist die hierarchische Strukturierung von Anweisungen – mit globalen Regeln, die für alle Aufgaben gelten, und lokalisierten Anweisungen, die nur für bestimmte Arbeitsabläufe aktiviert werden – eine der effektivsten Methoden, um redundanten Kontext zu reduzieren, ohne dabei an Leistungsfähigkeit einzubüßen.

Batch-API für asynchrone Arbeitslasten. Die meisten Anbieter bieten eine Batch-Verarbeitungsstufe mit einer Kostenersparnis von 50 Prozent für Anfragen an, die keine Echtzeitantwort erfordern. Die nächtliche Berichterstellung, die Anreicherung großer Datenmengen, Pipelines zur Dokumentenverarbeitung und Offline-Auswertungsaufträge kommen hierfür in Frage. Wenn Ihre Architektur jede Anfrage als interaktiv behandelt, zahlen Sie Echtzeit-Tarife für Arbeiten, die problemlos warten könnten.

Beschränkungen der Ausgabelänge. Das Modell ausdrücklich anzuweisen, sich kurz zu fassen, und ein Zielformat vorzugeben, ist der einfachste und am häufigsten übersehene Hebel, der zur Verfügung steht. Sprachmodelle erzeugen standardmäßig ausführliche, umfassende Antworten. In vielen Produktionskontexten entspricht dies jedoch nicht den Anforderungen der Anwendung. Schränken Sie die Ausgabelänge über die Systemaufforderung, durch strukturierte Ausgabeanforderungen oder durch Kürzung im Nachhinein ein. Die Kosteneinsparung kann erheblich sein, insbesondere in agentenbasierten Arbeitsabläufen, bei denen Modellausgaben in nachfolgende Schritte einfließen.

Aufstellung eines Token-Budgets: von der Rechnungsprüfung bis zur Steuerung der Umsetzung

Es besteht ein wesentlicher Unterschied zwischen der Überwachung der Kosten für KI und der Steuerung der zulässigen Kosten für KI. Die meisten Unternehmen tun heute Ersteres: Sie prüfen die Rechnung, analysieren die Kostenaufschlüsselung und lassen diese Erkenntnisse in den nächsten Planungszyklus einfließen. Was sie jedoch noch nicht tun, ist die Durchsetzung von Token-Budgets zur Laufzeit, d. h. die Festlegung von harten oder weichen Obergrenzen pro Anwendung, pro Agent und pro Team, die vor dem Aufruf der Inferenz überprüft werden.

Diese Unterscheidung ist wichtig, da KI-Workloads – im Gegensatz zu den meisten Softwarekosten – nicht linear verlaufen und sich anhand grundlegender Prinzipien nur schwer vorhersagen lassen. Eine einzige falsch konfigurierte Agenten-Pipeline oder ein plötzlicher Anstieg der Nutzeraktivität kann das Monatsbudget innerhalb weniger Stunden aufbrauchen. Reaktive Überwachung erkennt dies erst im Nachhinein. Proaktive Steuerung verhindert es.

Die sich daraus entwickelnde Disziplin wird manchmal als „AI FinOps“ bezeichnet: die Anwendung der Governance-Frameworks, die Cloud-FinOps für Infrastrukturausgaben entwickelt hat, auf die spezifischen Merkmale der Ausgaben für KI-Inferenz. Cloud-FinOps hat uns reservierte Instanzen, Sparpläne, Empfehlungen zur bedarfsgerechten Dimensionierung und die Kostenverteilung nach Teams beschert. Die KI-Inferenz benötigt ihre eigenen Entsprechungen:

  • Budgetrahmen pro Modell: Ausgabenobergrenzen, die auf Modellebene und nicht nur auf Kontoebene festgelegt werden
  • Routing-Richtlinien nach Aufgabentyp: Regeln, die festlegen, welche Modellstufe welche Art von Anfrage bearbeitet
  • Echtzeit-Ausgaben-Dashboards mit automatisierten Warnmeldungen: Transparenz vor der Rechnungsstellung, nicht erst danach
  • Regelmäßige Architekturüberprüfungen, ausgelöst durch Kostenschwellenwerte: Überprüfungen, die stattfinden, wenn Ausgaben eine bestimmte Grenze überschreiten, nicht nach einem festen Abrechnungskalender

Die Token-Optimierung entwickelt sich von einer Nebensache zu einer eigenständigen Funktion. Wir befinden uns bereits in einer Welt, in der Unternehmen aktiv überprüfen, wie ihre KI-Ausgaben strukturiert sind, welche Modelle für welche Aufgaben eingesetzt werden, welche Anbieter zum Einsatz kommen und wie die Governance aussieht. Das ist – unter welchem Namen auch immer – KI-FinOps, und es wird in den nächsten Jahren eine der bedeutendsten Disziplinen sein.

Bei Future Processing arbeiten wir bereits mit Kunden an dieser Schnittstelle zwischen KI-Architektur und Kosten-Governance zusammen. Die beteiligten technischen Disziplinen, darunter Instrumentierung, Kostenverrechnung, Durchsetzung von Richtlinien und Architekturüberprüfung, sind nicht neu. Neu ist jedoch ihre Anwendung auf eine Kostenstruktur, die sich unvorhersehbar zusammensetzt und sich einer intuitiven Einschätzung entzieht.

Data-driven design

KI-gestützte Lieferung

Reduzierung der Bearbeitungszeit für Stellenanzeigen um 66 % durch eine KI-gestützte Lösung auf Basis von AWS

Strategische Erkenntnisse für Entscheidungsträger

Die derzeit sinnvollste Maßnahme ist die Messung. Bevor Sie irgendetwas optimieren, sollten Sie erfassen, welche Kosten tatsächlich anfallen: pro Arbeitsablauf, pro Anfragetyp, pro Mitarbeiter. Die meisten Teams arbeiten mit Schätzwerten. Die Differenz zwischen Schätzwerten und Realität rechtfertigt – sobald sie gemessen wurde – fast immer den Aufwand.

Danach kommt es auf die Reihenfolge an. Das Caching von Prompts bietet einen nahezu sofortigen ROI und erfordert nur minimale Änderungen an der Architektur. Das Routing nach einem mehrstufigen Modell erfordert mehr Planungsaufwand, führt aber langfristig zu den größten Einsparungen. Die Einhaltung von Kontextfenstern und die Festlegung von Ausgabebeschränkungen sind fortlaufende Maßnahmen und keine einmaligen Korrekturen.

Die schwierigere Aufgabe, die die Bereiche Governance, Budgetverantwortung und Ausgabegrenzen pro Team umfasst, ist eher organisatorischer als technischer Natur. Sie erfordert, dass jemand die Verantwortung für die Token-Ausgaben übernimmt, so wie eine Cloud-FinOps-Funktion die Verantwortung für die Infrastruktur übernimmt.

Diese Rolle und die damit verbundenen Abläufe befinden sich in den meisten Unternehmen noch im Entstehungsprozess.

Die Teams, die dieses Governance-Rahmenwerk bereits jetzt aufbauen, noch bevor ihre KI-Workloads einen nennenswerten Umfang erreichen, werden einen erheblichen Vorteil gegenüber denen haben, die erst im Nachhinein entsprechende Maßnahmen ergreifen. Die Kosten für Fehler bei diesem Vorhaben beschränken sich nicht nur auf Budgetüberschreitungen. Es handelt sich vielmehr um die kumulierten Verzerrungen, die sich aus jeder Architekturentscheidung ergeben, die ohne genaue Kosteninformationen getroffen wird.

Häufig gestellte Fragen

Inwiefern treiben RAG, Agenten und Kontextfenster Ihre tatsächlichen Token-Ausgaben in die Höhe?

RAG fügt in jede Abfrage abgerufene Dokumente als zusätzlichen Kontext ein und fügt dabei in der Regel drei- bis fünfmal mehr Token pro Aufruf hinzu als eine einfache Eingabeaufforderung. Ein Agenten-Workflow verstärkt diesen Effekt noch weiter, indem er fünf bis dreißig Modellaufrufe pro Benutzeraufgabe auslöst, von denen jeder seine eigene Systemeingabeaufforderung, Tool-Definitionen und den gesammelten Verlauf enthält. Das Ergebnis ist, dass eine Benutzerinteraktion, die scheinbar nur einen einzigen Modellaufruf umfasst, in Wirklichkeit Dutzende davon beinhalten kann, die jeweils zum vollen Token-Tarif abgerechnet werden.

Das anschaulichste Beispiel hierfür ist die agentenbasierte Browser-Automatisierung. Wenn ein Modell die Aufgabe erhält, ein Webformular auszufüllen, muss es zunächst den gesamten Seiteninhalt lesen, die relevanten Felder identifizieren, die richtigen Werte ermitteln und jede Eingabe ausführen – oft in mehreren Schritten. Ich habe dies direkt beobachtet, als ich Claude in Chrome, dem Browser-Agenten von Anthropic, getestet habe. Es war aufschlussreich zu beobachten, wie die Token auf einer einzigen Webseite verschwanden. Der Agent muss die gesamte Seite verarbeiten, um sie zu verstehen, die Felder zu identifizieren und zu entscheiden, was eingegeben werden soll. Das ist eine völlig andere Größenordnung als wenn man dem Modell eine direkte Frage stellt und eine Antwort erhält. Der gleiche Informationsaustausch, nur anders strukturiert, könnte nur einen Bruchteil des Preises kosten.

Beim Prompt-Caching wird ein wiederverwendbarer Teil Ihrer Eingabeaufforderung – in der Regel die Systemanweisungen oder der statische Kontext – serverseitig gespeichert, sodass nachfolgende Aufrufe diesen Teil aus dem Cache mit einem Bruchteil der normalen Eingabekosten abrufen können. Anthropic berechnet bei Cache-Treffern 10 Prozent der Standard-Eingabekosten; OpenAI berechnet 50 Prozent.

Bei einer Produktionsanwendung mit einer konstanten System-Prompt-Länge von 4.000 Token und 10.000 Anfragen pro Tag senkt die Aktivierung des Caching bei einer Trefferquote von 90 Prozent die täglichen Kosten für diesen Prompt von etwa 120 Dollar auf etwa 25 Dollar, was einer Ersparnis von fast 3.000 US-Dollar pro Monat durch eine einzige Konfigurationsänderung entspricht.

Verwenden Sie folgende Formel: monatliche Kosten = (tägliche Anfragen × durchschnittliche Eingabetoken × Eingabepreis pro Million + tägliche Anfragen × durchschnittliche Ausgabetoken × Ausgabepreis pro Million) × 30.

Der Schritt, den die meisten Teams überspringen, ist die Ermittlung der tatsächlichen Token-Anzahl pro Anfragetyp in der Staging-Umgebung, anstatt diese anhand der Wortanzahl zu schätzen. Systemaufforderungen, Konversationsverlauf und RAG-Kontext führen regelmäßig dazu, dass die tatsächliche Token-Nutzung drei- bis fünfmal höher ausfällt als die naive Schätzung. Fügen Sie einen Puffer in Höhe des 1,5- bis 2-fachen des Ergebnisses hinzu, um Wiederholungsversuche, Fehlerbehandlung und das Volumenwachstum im ersten Quartal der Produktionsphase zu berücksichtigen.

Eingabetoken werden parallel über die GPU-Kerne hinweg verarbeitet: schnell, effizient und rechenmäßig kostengünstig. Ausgabe-Tokens müssen sequenziell generiert werden. Jedes Wort erfordert einen vollständigen Vorwärtsdurchlauf durch das gesamte Modell, bevor das nächste beginnen kann, was die Generierung drei- bis fünfmal rechenintensiver macht als das Einlesen. Ein System, das lange Antworten zurückgibt, ist grundsätzlich rechenintensiver als eines, das lange Dokumente einliest und kurz antwortet.

Ja, und der Effekt verstärkt sich schnell. Eine Systemaufforderung von 2.000 Token, die mit jeder Nachricht in 10.000 täglichen Konversationen gesendet wird, fügt täglich 20 Millionen Eingabetoken hinzu, noch bevor Nutzerinhalte hinzukommen. RAG-Pipelines fügen in der Regel zusätzlich noch 1.000 bis 5.000 Token pro Abfrage hinzu.

Teams, die die Promptlänge vor der Bereitstellung in der Produktion messen, stellen regelmäßig fest, dass 30–40 Prozent ihres Token-Budgets durch strukturellen Overhead und nicht durch die eigentliche Nutzeranfrage verbraucht werden. Dieser Overhead lässt sich beheben, aber nur, wenn man ihn zuerst misst.

Der von uns geschaffene Mehrwert

72

Kostensenkung nach einer reibungslosen Migration (innerhalb von 20 Tagen)

Lass uns reden

Nehmen Sie Kontakt mit uns auf und gestalten Sie Ihr Unternehmen mit unseren umfassenden Dienstleistungen neu.