Generative KI hat den schnellen Zugang zu Rechenleistung in den Vordergrund gerückt. Mit der nächsten Entwicklungsstufe – KI-Agenten, die Prozesse kontinuierlich ausführen – verschiebt sich der Fokus jedoch: Unternehmen müssen nicht mehr nur ausreichend Infrastruktur bereitstellen, sondern Inferenzkosten, Ressourcen und Datenflüsse effizient steuern.
Mit der Verbreitung von KI-Agenten wird die effiziente Vernetzung von Rechenleistung, Daten und Anwendungen zum Wettbewerbsfaktor.
Während künstliche Intelligenz (KI) täglich neue Fortschritte macht, stehen Unternehmen bei ihrem Einsatz in Bezug auf die wirtschaftliche Skalierung noch am Anfang. Der nächste Schritt nach generativer KI, bei der weniger die Kosteneffizienz, sondern vielmehr schnelle Verfügbarkeit im Vordergrund steht, wird zweifelsohne durch KI-Agenten geprägt werden. Durch immer leistungsfähigere Sprachmodelle und Agentensysteme, die nicht auf einzelne Prompts beschränkt sind, entstehen kontinuierliche Inferenzprozesse und entsprechend auch kontinuierliche Kosten. GPU-Ressourcen werden umverteilt – weg vom Training und hin zum laufenden Betrieb.
Noch ist der Einsatz von KI-Agenten nicht in der Breite angekommen. Die klassischen Beispiele sind Kundenservice, Softwareentwicklung oder Back-Office-Prozesse in der Finanzabteilung. Langfristig wird aber ein nicht unwesentlicher Anteil der Unternehmenskosten durch Inferenz entstehen und über den wirtschaftlichen Erfolg von KI mitentscheiden. Um dem zuvorzukommen, ist es sinnvoll schon jetzt die richtigen Weichen zu stellen, was Rechenkapazität, Skalierung und Kostenkontrolle angeht.
KI-Agenten machen Inferenz zum dauerhaften Kostenfaktor
Die Public Cloud bleibt ein zentraler Baustein der KI-Strategien von Unternehmen. Sie bietet schnellen Zugang zu Rechenleistung und besteht plötzlich mehr oder weniger Bedarf, wird diese schnell beim Hyperscaler seiner Wahl dazugebucht oder abbestellt – gut für einen unkomplizierten Einstieg in KI-Projekte. Laut aktuellen Zahlen einer Lenovo-Studie laufen 25 Prozent aller KI-Workloads in Deutschland in der Public Cloud. In Europa fällt der Anteil mit 18 Prozent geringer aus, da zum Beispiel hybride Infrastrukturmodelle für KI-Anwendungen beliebter werden.
Mit der Zunahme an Inferenz verschiebt sich die Diskussion nun weg von der reinen Verfügbarkeit von Infrastruktur zur Wirtschaftlichkeit einzelner Modellaufrufe. Kennzahlen wie Kosten pro Token oder Kosten pro Inferenzvorgang rücken statt den bisher gängigen FLOPS (Floating Point Operation Per Second) in den Vordergrund. Geht man von einem Hardwareerneuerungszyklus von fünf Jahren im Unternehmen und kontinuierlichen Inferenz-Workloads von über 20 Prozent aus, amortisiert sich On-Premises-Infrastruktur im Vergleich zur eingekauften Hyperscaler-Leistung bereits nach vier Monaten – bei vorherigen Zyklen waren es 12 bis 18 Monate.
Hybride Modelle gewinnen an Bedeutung
Nachdem in den letzten Jahren viele Unternehmen einer Cloud-first-Strategie gefolgt sind wird das Thema spätestens mit agentischer KI differenzierter betrachtet. Nicht jeder KI-Workload hat dieselben Anforderungen und erzeugt dieselbe Last. Nicht jeder verarbeitet dieselben Daten und muss unter dem Gesichtspunkt von Regulatorik, Datenschutz und Souveränität betrachtet werden. Die zentrale Infrastrukturfrage verschiebt sich also dahin, wo welcher Workload sinnvollerweise betrieben wird.
An dieser Stelle kommt das Konzept der hybriden KI ins Spiel. Diese beschreibt Architekturen, bei denen Anwendungen, Daten und Rechenleistung über verschiedene Umgebungen verteilt werden – abhängig von Kosten, Datenanforderungen, Latenz und Skalierungsbedarf.
So laufen zum Beispiel persönliche Assistenten oder kleine Sprachmodelle direkt über verschiedene Endgeräte, wie Laptops oder Smartphones. In der Industrie kommt Edge Computing zum Einsatz, um Latenzwerte in der Produktion oder Logistik möglichst niedrig zu halten. Gleichzeitig bleiben sensible Daten häufig in geschützten Unternehmensumgebungen, während rechenintensive Aufgaben oder große Foundation Models weiterhin auf die Public Cloud zurückgreifen.
Die reine Rechenleistung ist kein Maßstab mehr
Die Debatte um Cloud, Edge, On-Premises oder Endgerät greift jedoch zu kurz. Nicht nur die Umgebung ist entscheidend, sondern auch das Ressourcenmanagement. Agenten müssen innerhalb von festgelegten Leitplanken arbeiten. Dazu gehören zum Beispiel Begrenzungen bei den Modellaufrufen, Kontextfenster, Bearbeitungszeit oder Kostenbudget pro Workflow. Um den Überblick zu behalten und nachzuvollziehen welche Agenten, Prozesse oder Abteilungen welche Kosten verursachen, müssen Unternehmen in der Lage sein, Agenten auch in Echtzeit überwachen zu können. Hinzu kommt – ähnlich wie bei der Frage nach der richtigen Infrastruktur – die Frage nach dem richtigen Modell. Nicht jeder Prompt benötigt das beste und teuerste Modell. Stattdessen muss auch hier abgewogen werden, was zum Einsatz kommt.
Stand: 08.12.2025
Es ist für uns eine Selbstverständlichkeit, dass wir verantwortungsvoll mit Ihren personenbezogenen Daten umgehen. Sofern wir personenbezogene Daten von Ihnen erheben, verarbeiten wir diese unter Beachtung der geltenden Datenschutzvorschriften. Detaillierte Informationen finden Sie in unserer Datenschutzerklärung.
Einwilligung in die Verwendung von Daten zu Werbezwecken
Ich bin damit einverstanden, dass die Vogel IT-Medien GmbH, Max-Josef-Metzger-Straße 21, 86157 Augsburg, einschließlich aller mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen (im weiteren: Vogel Communications Group) meine E-Mail-Adresse für die Zusendung von Newslettern und Werbung nutzt. Auflistungen der jeweils zugehörigen Unternehmen können hier abgerufen werden.
Der Newsletterinhalt erstreckt sich dabei auf Produkte und Dienstleistungen aller zuvor genannten Unternehmen, darunter beispielsweise Fachzeitschriften und Fachbücher, Veranstaltungen und Messen sowie veranstaltungsbezogene Produkte und Dienstleistungen, Print- und Digital-Mediaangebote und Services wie weitere (redaktionelle) Newsletter, Gewinnspiele, Lead-Kampagnen, Marktforschung im Online- und Offline-Bereich, fachspezifische Webportale und E-Learning-Angebote. Wenn auch meine persönliche Telefonnummer erhoben wurde, darf diese für die Unterbreitung von Angeboten der vorgenannten Produkte und Dienstleistungen der vorgenannten Unternehmen und Marktforschung genutzt werden.
Meine Einwilligung umfasst zudem die Verarbeitung meiner E-Mail-Adresse und Telefonnummer für den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern wie z.B. LinkedIN, Google und Meta. Hierfür darf die Vogel Communications Group die genannten Daten gehasht an Werbepartner übermitteln, die diese Daten dann nutzen, um feststellen zu können, ob ich ebenfalls Mitglied auf den besagten Werbepartnerportalen bin. Die Vogel Communications Group nutzt diese Funktion zu Zwecken des Retargeting (Upselling, Crossselling und Kundenbindung), der Generierung von sog. Lookalike Audiences zur Neukundengewinnung und als Ausschlussgrundlage für laufende Werbekampagnen. Weitere Informationen kann ich dem Abschnitt „Datenabgleich zu Marketingzwecken“ in der Datenschutzerklärung entnehmen.
Falls ich im Internet auf Portalen der Vogel Communications Group einschließlich deren mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen geschützte Inhalte abrufe, muss ich mich mit weiteren Daten für den Zugang zu diesen Inhalten registrieren. Im Gegenzug für diesen gebührenlosen Zugang zu redaktionellen Inhalten dürfen meine Daten im Sinne dieser Einwilligung für die hier genannten Zwecke verwendet werden. Dies gilt nicht für den Datenabgleich zu Marketingzwecken.
Recht auf Widerruf
Mir ist bewusst, dass ich diese Einwilligung jederzeit für die Zukunft widerrufen kann. Durch meinen Widerruf wird die Rechtmäßigkeit der aufgrund meiner Einwilligung bis zum Widerruf erfolgten Verarbeitung nicht berührt. Um meinen Widerruf zu erklären, kann ich als eine Möglichkeit das unter https://contact.vogel.de abrufbare Kontaktformular nutzen. Sofern ich einzelne von mir abonnierte Newsletter nicht mehr erhalten möchte, kann ich darüber hinaus auch den am Ende eines Newsletters eingebundenen Abmeldelink anklicken. Weitere Informationen zu meinem Widerrufsrecht und dessen Ausübung sowie zu den Folgen meines Widerrufs finde ich in der Datenschutzerklärung.
Unternehmen müssen Transparenz schaffen, um die Verbindung zwischen Agententätigkeit und daraus resultierenden Kosten, sichtbar zu machen. Wie beim Cloud Computing entsteht die Vorteile nicht allein durch den schnellen Zugang zur Rechenleistung, sondern durch effiziente Steuerung und Nutzung. Voraussetzung dafür ist eine Analyse der Anwendungsfälle: Unternehmen müssen früh definieren, welche Prozesse künftig durch KI-Agenten unterstützt werden sollen. Auf dieser Grundlage lassen sich dann Infrastruktur, Bereitstellungsmodell und Governance sinnvoll planen.
Der Wettbewerbsvorteil entsteht durch den effizienten KI-Betrieb
Langfristig werden die Kosten pro Inferenz sinken – die Kosten für Inferenz insgesamt jedoch nicht. Effizientere Hardware, immer leistungsfähigere kleine Modelle und eine wachsende Anzahl an Open-Source-Alternativen machen einzelne Modellaufrufe günstiger. Mit der zunehmenden Verbreitung von Agenten und deren Integration in Geschäftsprozesse werden allerdings mehr Kosten entstehen, als durch Effizienzgewinne eingespart werden können.
Umso wichtiger ist es für Unternehmen, heute schon einen planbaren Rahmen bei Infrastruktur, Ressourcenmanagement und Kostenkontrolle zu treffen. Die nächste Phase der KI wird nicht durch immer größere Modelle entschieden, sondern durch die Fähigkeit von Unternehmen diese wirtschaftlich, sicher und skalierbar zu integrieren. Der langfristige Wettbewerbsvorteil entsteht nicht durch die reine Verfügbarkeit, sondern den effizienten Betrieb.
* Der Autor Patrick Rövekamp ist Sales Leader und Sr. Manager bei Lenovo SSG. Er verantwortet die Vertriebsstrategie für das Lösungs- und Serviceportfolio von Lenovo in der DACH-Region für Large-Enterprise- und Public-Sector-Kunden. Seine fachlichen Schwerpunkte liegen auf KI, Hybrid-IT, Cloud-Strategien sowie servicebasierten IT-Betriebsmodellen und deren wirtschaftlicher Skalierung.