Zum Inhalt

Blog

GPU as a Service: GPUs in der Cloud nutzen

GPUs in der Cloud mit Hikube GPU as a Service: Use-cases, Kosten und praktischer Weg. NVIDIA L40S, A100 und H100 sind in der 14-Tage-Trial.

Hidora-Artikel vom 23. Februar 2026. Zahlen, Preise und Vergleiche gelten zu diesem Datum.

Einleitung

Der Bedarf an Rechenleistung wächst beschleunigt, getrieben von generativer KI, Machine Learning und rechenintensiven Anwendungen. Der Zugang zu GPUs, lange auf Spezialumgebungen oder dedizierte Server beschränkt, ist für Unternehmen zu einer strategischen Frage geworden. Da Modelle komplexer werden und Hardwarezyklen kürzer, erscheinen GPU as a Service (GPUaaS) als Weg, sofort passende Rechenkapazität zu erhalten, ohne anfängliche Hardwareinvestition.

Während die GPU-Verfügbarkeit je nach Markt schwankt und die Nachfrage das Angebot zeitweise übersteigt, suchen Organisationen einen flexiblen Ansatz, um leistungsfähige Beschleuniger zu nutzen und dabei Kosten und Verfügbarkeit im Griff zu behalten.

GPUs auf Abruf

GPUaaS-Dienste stellen eine oder mehrere GPUs sofort bereit, über eine API, ein Portal oder einen Kubernetes-Cluster. Die Anbieter - souveräne Clouds, Hyperscaler oder spezialisierte Betreiber - bieten Infrastruktur, die KI-Workloads, Simulation oder umfangreiche Datenanalyse ausführen kann.

Diese Angebote stützen sich auf aktuelle Beschleuniger wie NVIDIA A100, H100, L40S oder je nach Umgebung Alternativen von AMD Instinct und Gaudi/TPU. Der Zugang ist meist auf drei Wegen möglich: über GPU-VMs, über Kubernetes-Pods (Device Plugin, GPU Operator) oder durch direkten Aufruf von Compute-APIs.

Das nutzungsbasiert abgerechnete On-Demand-Modell gibt für einige Stunden oder Tage Zugang zu aktuellen GPUs, ohne Kapital zu binden. Dieses Format eignet sich für Experimentierphasen ebenso wie für Produktions-Workloads.

Eine Architektur für intensive Lasten

Technisch laufen GPUaaS-Dienste auf Knoten mit modernen GPUs, verbunden über PCIe Gen4/Gen5 oder NVLink. Verteilte Umgebungen setzen auf Hochdurchsatznetze mit RDMA oder RoCEv2, unverzichtbar für die Synchronisation grosser Modelle. Lokale NVMe-Volumes oder verteilter Storage mit niedriger Latenz sind ebenso entscheidend, denn die Trainingsleistung hängt vom Datendurchsatz genauso ab wie von der reinen GPU-Leistung.

KI-Operatoren wie Kubeflow Training Operator, DeepSpeed, Megatron-LM, Ray Serve oder der MPI Operator orchestrieren Training, Inferenz und Aufgabenverteilung über mehrere GPUs. Anbieter unterstützen fortgeschrittene Funktionen wie Multi-Instance GPU (MIG) oder Formen von GPU-Sharing über MPS und Erweiterungen von Drittanbietern.

Zu den Anwendungsfällen zählen LLM-Fine-Tuning, Videoanalyse, wissenschaftliches Rechnen, Simulation und multimodale Generierung.

Kosten und Leistung optimieren

Der GPUaaS-Ansatz zeichnet sich durch Elastizität und nutzungsabhängige Preise aus. Unternehmen können Ressourcen nur während intensiver Trainingsphasen zuteilen und profitieren dabei von:

  • stündlicher oder bedarfsweiser Abrechnung,

  • automatischem Scaling zur Anpassung der GPU-Kapazität,

  • der Möglichkeit, GPUs längerfristig zu reservieren,

  • logischer Partitionierung über MIG zur gemeinsamen Nutzung.

Die Leistung hängt von Netzqualität, Storage und der Optimierung der ML-Frameworks ab (PyTorch, TensorFlow, JAX). GPUaaS-Lösungen bieten damit eine agile Alternative zu On-Premises-Architekturen und vermeiden zugleich die rasche Abschreibung, die mit den GPU-Generationen einhergeht.

Vergleich mit den Alternativen

Gegenüber dedizierten GPU-Servern

  • Vorteil GPUaaS: Flexibilität, schneller Zugang zu aktuellen GPUs, keine Hardwareverwaltung.

  • Grenze, Abhängigkeit vom Anbieter und je nach Nutzung schwankende Kosten.

Gegenüber Hyperscalern

  • Souveränes oder spezialisiertes GPUaaS kann bieten:

    • geringere Latenz,

    • besser planbare Kosten,

    • KI-orientierten Support,

    • geografisch kontrolliertes Hosting.

Gegenüber On-Premises

  • geringerer Capex,

  • kein Hardware-Beschaffungszyklus,

  • dynamische Zuteilung nach Last,

  • die Möglichkeit, je nach Bedarf zwischen GPU-Generationen zu wechseln.

Was das für Unternehmen bedeutet, und wie es weitergeht

Organisationen suchen heute Umgebungen, die intensive KI-Workloads ausführen und zugleich Souveränität, Flexibilität und planbare Leistung sichern. Cloud-native Plattformen wie Hikube, betrieben von Hidora SA auf drei Schweizer Rechenzentren (Genf, Gland, Luzern) mit NVIDIA-GPU-Knoten (L40S, A100, H100, im 14-Tage-Test enthalten), bieten ein Modell für Teams, die ernsthafte Rechenleistung ohne übermässige operative Komplexität wollen. Solche Infrastruktur trägt verteiltes Training, beherbergt Inferenz-Workloads in Produktion und erfüllt Anforderungen an Standort und Compliance.

Die nächsten Entwicklungen im Markt dürften umfassen:

  • topologiebewusstes Scheduling zur Optimierung der Multi-GPU-Platzierung,

  • breitere Unterstützung heterogener Beschleuniger (TPU, NPU, RDU),

  • Mechanismen für automatische GPU-Skalierung,

  • Verbesserungen bei GPU-Slicing und logischer Partitionierung,

  • engere Integration in MLOps-Workflows und Frameworks für verteiltes Training.

In einer Landschaft, in der der Bedarf an Rechenleistung weiter steigt, sind GPUaaS-Lösungen ein wesentlicher Hebel, um Fortschritte der KI zu nutzen, die Kosten im Griff zu behalten und die Flexibilität zu liefern, die technische Teams erwarten.

Bereit für 100 % Schweizer Infrastruktur?

14-Tage-Trial, keine Karte. GPUs inklusive.