Die KI-Ausgaben in Deutschland klettern 2026 auf rund 28,7 Mrd. Euro, berichtet Golem.de. Der Posten für generative KI verdopple sich auf 11,5 Mrd. Euro. Der sinkende Tokenpreis treibe die Nutzung stärker nach oben, als er die Rechnung entlaste. Goldman Sachs erwarte bis 2030 den 24-fachen Tokenverbrauch. Dabei benötige nur jede zehnte Aufgabe ein Spitzenmodell, doch lande mehr als die Hälfte der Anfragen dort. Gegenmittel seien Model-Routing, Prompt-Caching, Nutzungslimits und Schulungen.
Die Ausgaben für KI in Deutschland steigen deutlich: 2026 sollen sie nach Angaben aus dem Bericht auf rund 28,7 Milliarden Euro klettern, berichtet Golem.de. Besonders stark wächst der Bereich generativer KI. Die entsprechenden Ausgaben sollen sich auf 11,5 Milliarden Euro verdoppeln. Für Unternehmen wird damit eine Technologie, die Produktivität und Automatisierung verspricht, zunehmend zu einem relevanten Kostenblock.
Sinkende Tokenpreise erhöhen die Nutzung
Der zentrale Kostentreiber liegt im Abrechnungsmodell vieler großer Sprachmodelle: Bezahlt wird nach Token, also nach den verarbeiteten Texteinheiten. Zwar sinken die Preise pro Token durch technologische Fortschritte. Gleichzeitig führt genau dieser Preisrückgang dazu, dass Unternehmen KI-Anwendungen breiter einsetzen und häufiger abrufen. Der Verbrauch wächst dadurch schneller, als die günstigeren Einzelpreise entlasten. Goldman Sachs erwartet bis 2030 einen 24-fachen Tokenverbrauch, unter anderem durch den Einsatz autonomer KI-Agenten.
Auch von Accenture befragte Führungskräfte rechnen trotz fallender Tokenpreise mit weiter steigenden Gesamtausgaben. Die Entwicklung zeigt, dass Kostendisziplin bei KI nicht allein über günstigere Modelle entsteht. Unternehmen müssen genauer steuern, welche Anfragen an welche Systeme gehen und wie häufig rechenintensive Modelle tatsächlich benötigt werden.
Viele Aufgaben brauchen kein Spitzenmodell
Ein erheblicher Teil der Kosten entsteht durch ineffiziente Nutzung. Laut Accenture benötigen nur 10 Prozent der Aufgaben die modernsten und leistungsfähigsten KI-Modelle. Trotzdem wird derzeit mehr als die Hälfte aller Anfragen an diese teuren Systeme weitergeleitet. Automatisierte Verfahren, die Anfragen nach Komplexität dem passenden Modell zuordnen, sind bislang nur bei rund 30 Prozent der Unternehmen im Einsatz.
Erste Konzerne reagieren bereits mit technischen Gegenmaßnahmen. Siemens und SAP nutzen Model-Routing, bei dem eine vorgeschaltete Logik Anfragen an das günstigste geeignete Modell weiterleitet. Prompt-Caching soll zudem verhindern, dass wiederkehrende Kontexte bei ähnlichen Abfragen immer wieder vollständig verarbeitet werden. Beide Verfahren zielen darauf, den Nutzen pro eingesetztem Token zu verbessern und die Kosten transparenter steuerbar zu machen.
Regeln, Schulungen und Limits ergänzen die Technik
Neben technischen Lösungen setzen Unternehmen auf organisatorische Vorgaben. Zalando, SAP, Zeiss und die Deutsche Bank arbeiten mit flexiblen, rollen- oder projektbasierten Nutzungslimits. Mercedes, Merck und Eon nutzen Schulungsprogramme zu Tokenomics sowie transparente Kostenansichten, um Beschäftigte für effizientes Prompting zu sensibilisieren. Solche Maßnahmen sollen verhindern, dass leistungsstarke Modelle aus Gewohnheit oder Unkenntnis verwendet werden.
Für viele einfache Aufgaben reichen zudem lokale KI-Modelle aus, deren Leistung bereits genügt. Damit verschiebt sich der Fokus vom reinen Zugang zu KI hin zur wirtschaftlichen Orchestrierung der Systeme. Der nächste Prüfpunkt ist, wie schnell Unternehmen Routing, Caching und Nutzungslimits ausrollen, während der erwartete Tokenverbrauch bis 2030 auf das 24-Fache steigen könnte.
