Zum Inhalt springenZum Inhalt springen
Mein Konto
Sprache Deutsch, Preise in Euro — Angaben einblenden
Sprache
Deutsch
Währung
Euro (EUR)
Preise
netto, zzgl. 19 % MwSt.

Abrechnung in Euro aus Deutschland. Weitere Sprachen und Währungen sind derzeit nicht verfügbar.

NG-Serie · stundenweise abgerechnet, auf den Monat gedeckelt

GPU & KI

6 Kartentypen in 8 Konfigurationen: von der 72-Watt-Inferenzkarte, die ein fertig trainiertes Modell antworten lässt, bis zum 8-GPU-Knoten mit 1.128 GB Grafikspeicher. Stundenweise abgerechnet und auf den Monatspreis gedeckelt: Ein dreitägiger Trainingslauf kostet drei Tage.

Treiber, CUDA-Werkzeugkette (NVIDIAs Programmierplattform für die GPU) und Container-Laufzeit sind vorinstalliert. Die lokale NVMe, der schnelle Flash-Speicher der Instanz, steckt im selben Gehäuse wie die Karte — Datensätze werden nicht über das Netz gelesen.

Konfigurationen
8
6 Kartentypen, L4 bis H200
Einstieg
214,00 €
NG-L4, monatlich netto
VRAM im Knoten
1.128 GB
8 × H200 über NVLink
Standorte
4
mit GPU-Kapazität

Vor der Auswahl

Drei Fragen, und die Karte steht fest

Passt das Modell in den Speicher, müssen mehrere Karten miteinander reden, und was kostet die Stunde? Mehr braucht die Entscheidung nicht. Alles Weitere auf dieser Seite ist Nachweis.

  1. Frage 1

    Wie viel Speicher hat die Karte?

    24141 GB

    VRAM — der Speicher auf der Karte selbst — ist die erste Grenze. Was nicht hineinpasst, läuft nicht. Im größten Knoten summieren sich 8 Karten auf 1.128 GB.

  2. Frage 2

    Wie schnell reden die Karten miteinander?

    900 GB/s

    So viel trägt NVLink — die direkte Leitung zwischen zwei GPUs im selben Gehäuse — je Karte im NG-H200×8-Knoten. Alle übrigen Zeilen verständigen sich über PCIe, den Steckplatzbus des Mainboards, und liegen damit rund eine Größenordnung darunter.

  3. Frage 3

    Was kostet die Stunde?

    ab 0,2932 €

    Die Spanne endet bei 42,00 € je Stunde für den größten Knoten. Auf eine einzelne Karte umgelegt beginnt es bei 0,2932 € je GPU-Stunde; ein Lauf über 72 Stunden startet damit bei 21,11 € netto.

Zwei weitere Wörter fallen auf dieser Seite immer wieder. Durchsatz meint, wie viele Rechenschritte je Sekunde durchlaufen — gemessen in TFLOPS, hier zwischen 24 und 989 je Karte. Die TDP ist die Abwärme, die eine Karte im Dauerbetrieb abgibt; sie entscheidet, an welchem Standort ein Knoten stehen darf. Die kleinste Karte im Programm bleibt bei 72 Watt und kommt ohne zusätzlichen Stromanschluss aus.

ENTRONYX CLOUD führt jede Karte in mehreren Ausbaustufen. Die Wahl fällt deshalb zweimal: erst auf den Kartentyp, dann auf die Anzahl im Knoten.

Wofür es ausdrücklich nicht reicht

  • Die kleinste Karte trainiert nicht. Mit 24 GB und 24 TFLOPS antwortet sie gut und lernt schlecht. Ein Fine-Tuning — das Nachtrainieren eines fertigen Modells auf eigene Daten — wartet dort an der Speicherbandbreite.
  • Vier Karten sind kein Cluster. Ohne NVLink läuft die Abstimmung zwischen den Karten über PCIe. Für kommunikationslastiges Training über mehrere GPUs ist das der Engpass, nicht die Rechenleistung.
  • Ein Modell, das nicht hineinpasst, wird nicht schneller. Wer auslagert, verliert mehr Zeit am Bus, als die größere Karte an Rechenleistung bringt. Erst der Speicher, dann der Durchsatz.

Datenblatt

Welche Karte in Ihr Modell passt

Die GPU steht nie allein. Jede Zeile bringt dedizierte EPYC-Kerne, Hauptspeicher und lokale NVMe im festen Verhältnis mit — sonst wird der Datenpfad zum Engpass, bevor die Karte ausgelastet ist. 6 Kartentypen ergeben so 8 Konfigurationen.

GPU-Konfigurationen mit Modell, Grafikspeicher, Rechenleistung, vCPU, Arbeitsspeicher, lokaler NVMe, Traffic sowie Stunden- und Monatspreis
InstanzGPUVRAMTFLOPSvCPUCPU-TypRAMNVMe lokalTrafficPreis / Std.Preis / Monat
NG-RTX4000Einstieg1 × NVIDIA RTX PRO 4000 Blackwell SFF24 GB2420Intel Core i5-13500 (dediziert)64 GB1 TBunlimitiert0,2932 €214,00 €
NG-L4Inferenz1 × NVIDIA L424 GB1218AMD EPYC (dediziert)48 GB400 GB40 TB0,7397 €540,00 €
NG-L40S1 × NVIDIA L40S48 GB36216AMD EPYC (dediziert)96 GB800 GB50 TB1,3808 €1.008,00 €
NG-RTX60001 × NVIDIA RTX PRO 6000 Blackwell Max-Q96 GB11048Intel Xeon Gold 5412U (dediziert)256 GB1,9 TBunlimitiert1,6425 €1.199,00 €
NG-H100Training1 × NVIDIA H100 SXM80 GB98932AMD EPYC (dediziert)256 GB3,1 TB80 TB2,6575 €1.940,00 €
NG-H100×22 × NVIDIA H100 SXM160 GB1.978642× AMD EPYC (dediziert)512 GB6,3 TB100 TB5,3151 €3.880,00 €
NG-H100×44 × NVIDIA H100 SXM320 GB3.9561282× AMD EPYC (dediziert)1 TB12,5 TB140 TB10,6438 €7.770,00 €
NG-H200×8Cluster8 × NVIDIA H200 SXM1,1 TB7.9121282× AMD EPYC (dediziert)2 TB30 TB200 TB42,0000 €30.660,00 €
Vier Beschleunigerkarten nebeneinander in einem geöffneten Compute-Knoten, Kontaktleisten an den Steckplätzen, gebündelte Stromleitungen rechts.
Eine Beschleunigerkarte belegt immer einen eigenen Steckplatz mit voller Bahnbreite. Geteilte Karten gibt es hier nicht — was in der Zeile steht, steht der Instanz allein zur Verfügung.
Bündel gleich langer Kupferkabel zwischen zwei Serverschränken, jedes Ende beschriftet, dahinter die Rückseiten zweier Rechenknoten.

Innerhalb eines Knotens verbindet NVLink die 8 Karten mit 900 GB/s je GPU. Zwischen zwei Knoten trägt nur das Netz. ENTRONYX CLOUD legt dafür eine eigene RDMA-Fabric im vRack — ein privates Netz, in dem eine Karte direkt in den Speicher der Gegenseite schreibt. Gradienten laufen so nicht über gewöhnliches TCP.

NG-H200×8 · NVLink im Gehäuse, RDMA dazwischen

Einordnung

Welche Karte für welche Aufgabe

Die teuerste Karte ist selten die richtige. Entscheidend ist, ob Ihr Modell in den Speicher passt, ob Sie trainieren oder antworten, und ob mehrere GPUs miteinander reden müssen.

NG-L4

Inferenz und Transcoding

Die L4 ist eine Single-Slot-Karte mit 72 Watt und einem Encoder der siebten Generation. Ihr Zuhause sind ständig laufende Dienste: Antworten aus quantisierten Sprachmodellen bis etwa 13 Milliarden Parameter, Bildgenerierung, Embedding-Berechnung und Video-Transcodierung inklusive AV1.

VRAM
24 GB
TFLOPS (FP16)
121
Preis / Stunde
0,7397 €

Nicht für Training. Wer hier fine-tunt, wartet an der Speicherbandbreite.

NG-L40S

Fine-Tuning und Rendering

48 GB Grafikspeicher reichen für LoRA- und QLoRA-Anpassungen an Modellen bis rund 30 Milliarden Parameter, ohne den Umweg über Auslagerung in den Hauptspeicher. Die RT-Kerne machen dieselbe Karte zur besten Wahl für Rendering-Farmen und Simulationsvorschauen.

VRAM
48 GB
TFLOPS (FP16)
362
Preis je 100 TFLOPS/h
0,38 €

Keine NVLink-Brücke: Mehrere L40S kommunizieren über PCIe. Für kommunikationslastiges Multi-GPU-Training ist das der Flaschenhals.

NG-RTX6000

Inferenz und Fine-Tuning mittlerer Modelle

96 GB GDDR7 mit ECC — der größte Grafikspeicher unter den Einzelkarten im Katalog. Die RTX PRO 6000 Blackwell hält 8-Bit-quantisierte Modelle bis in den mittleren zweistelligen Milliardenbereich samt KV-Cache auf einer Karte und nimmt LoRA- wie QLoRA-Anpassungen ohne Auslagerung. Für bandbreitengebundenes Training bleibt die H100-Klasse mit HBM zuständig.

VRAM
96 GB
Lokale NVMe
1,92 TB
72-Stunden-Lauf
118,26 €
NG-H100

Großes Training

Hopper mit 80 GB HBM3, 3,35 TB/s Bandbreite und Transformer Engine. Der FP8-Pfad verdoppelt den Durchsatz gegenüber BF16, sofern das Trainingsskript ihn nutzt. Für Modelle, die in eine GPU passen, aber Wochen statt Tage bräuchten, ist das die wirtschaftlichste Einzelkarte im Katalog.

VRAM
80 GB
TFLOPS (FP16)
989
72-Stunden-Lauf
191,34 €
NG-H200×8

Verteiltes Cluster-Training

Acht H200 in einem Knoten, verbunden über NVLink mit 900 GB/s je GPU — nicht über Ethernet. Zusammen 1.128 GB Grafikspeicher, genug für Modelle, die auf einer einzelnen Karte nicht einmal geladen werden könnten. Tensor- und Pipeline-Parallelismus laufen innerhalb des Chassis, ohne Netzwerk-Sprung.

VRAM gesamt
1.128 GB
Hauptspeicher
2 TB
Lokale NVMe
30,72 TB

Nur nach Kapazitätsprüfung buchbar. Mehrere Knoten koppeln wir über eine dedizierte RDMA-Fabric im vRack.

Kostenrechnung

Ein Trainingslauf über 72 Stunden, durchgerechnet

Drei Tage sind ein realistisches Fenster für ein Fine-Tuning mit anschließender Auswertung. Die Beträge sind netto, gelten für Frankfurt und enthalten Instanz, Speicher und Traffic.

Kosten eines 72-Stunden-Laufs je Konfiguration, dazu der Preis je einzelner GPU-Stunde und je 100 TFLOPS
KonfigurationGPUsVRAM gesamtPreis / Stundeje GPU-Stundeje 100 TFLOPS/h72 Stunden
NG-RTX4000NVIDIA RTX PRO 4000 Blackwell SFF124 GB0,2932 €0,2932 €1,22 €21,11 €
NG-L4NVIDIA L4124 GB0,7397 €0,7397 €0,61 €53,26 €
NG-L40SNVIDIA L40S148 GB1,3808 €1,3808 €0,38 €99,42 €
NG-RTX6000NVIDIA RTX PRO 6000 Blackwell Max-Q196 GB1,6425 €1,6425 €1,49 €118,26 €
NG-H100NVIDIA H100 SXM180 GB2,6575 €2,6575 €0,27 €191,34 €
NG-H100×2NVIDIA H100 SXM2160 GB5,3151 €2,6576 €0,27 €382,69 €
NG-H100×4NVIDIA H100 SXM4320 GB10,6438 €2,6610 €0,27 €766,35 €
NG-H200×8NVIDIA H200 SXM81.128 GB42,0000 €5,2500 €0,53 €3.024,00 €

Zwei Spalten verdienen einen zweiten Blick. Die erste ist je GPU-Stunde. Der Acht-GPU-Knoten kostet dort 5,2500 € je Karte und liegt damit nur wenig über einer einzelnen H100 mit 2,6575 €. Er bringt dabei 76 % mehr Grafikspeicher je Karte und NVLink zwischen allen acht.

Die zweite ist je 100 TFLOPS. Gemessen an reiner Rechenleistung ist die H100 mit 0,27 € die günstigste Zeile der Tabelle. Die L40S ist mit 0,38 € der beste Kompromiss ohne HBM — den gestapelten Hochleistungsspeicher, den nur die H100-Klasse trägt. Die RTX PRO 6000 kauft mit 1,49 € dagegen Grafikspeicher, nicht Durchsatz: 96 GB für Modelle, die sonst auf zwei Karten müssten. Wer Rechenleistung statt Speicher braucht, sollte diese Reihenfolge kennen, bevor er nach der größten Zahl greift.

Der Weg bleibt in beiden Fällen derselbe. Erst prüfen, ob das Modell in den Speicher passt. Dann den Preis je Rechenleistung vergleichen. Und erst danach die Karte nach Namen auswählen.

Rechengrundlage

Laufzeit im Beispiel
72 h
Abrechnungstakt
volle Stunde
Standort
Frankfurt am Main (fra1)
Preisfaktor
1,00
Deckel je Monat
730 h
Enthalten
Instanz, lokale NVMe, Traffic

Für durchlaufende Knoten greift die Deckelung. Der Stundensatz wird auf 730 Stunden gerechnet, den Durchschnittsmonat. Ein Monat mit 31 Tagen hat 744 — die zusätzlichen Stunden berechnen wir nicht.

Preiseinheit wählen

Monatspreis ist zugleich die Obergrenze der stundenweisen Abrechnung

GPU-Konfigurationen mit Grafikspeicher, Rechenleistung und Preis wahlweise je Stunde oder je Monat
KonfigurationGPUsVRAM gesamtTFLOPS gesamt72 hPreis / Monat
NG-RTX4000NVIDIA RTX PRO 4000 Blackwell SFF124 GB2421,11 €214,00 €
NG-L4NVIDIA L4124 GB12153,26 €540,00 €
NG-L40SNVIDIA L40S148 GB36299,42 €1.008,00 €
NG-RTX6000NVIDIA RTX PRO 6000 Blackwell Max-Q196 GB110118,26 €1.199,00 €
NG-H100NVIDIA H100 SXM180 GB989191,34 €1.940,00 €
NG-H100×2NVIDIA H100 SXM2160 GB1.978382,69 €3.880,00 €
NG-H100×4NVIDIA H100 SXM4320 GB3.956766,35 €7.770,00 €
NG-H200×8NVIDIA H200 SXM81.128 GB7.9123.024,00 €30.660,00 €

Die Spalte für 72 Stunden bleibt unverändert — sie zeigt immer den Betrag, der bei einem dreitägigen Lauf tatsächlich anfällt.

Abrechnungsmodell

Stundenweise, monatlich oder mit fester Laufzeit

Drei Wege zur selben Karte. Welcher der günstigste ist, hängt allein an der Auslastung — nicht am Modell und nicht am Standort.

Monatspreis je Konfiguration nach Laufzeit, dazu die Ersparnis eines Jahres bei 24 Monaten Bindung
Konfigurationmonatlich12 Mon. −8 %24 Mon. −14 %Ersparnis / Jahr
NG-RTX4000214,00 €196,88 €184,04 €359,52 €
NG-L4540,00 €496,80 €464,40 €907,20 €
NG-L40S1.008,00 €927,36 €866,88 €1.693,44 €
NG-RTX60001.199,00 €1.103,08 €1.031,14 €2.014,32 €
NG-H1001.940,00 €1.784,80 €1.668,40 €3.259,20 €
NG-H100×23.880,00 €3.569,60 €3.336,80 €6.518,40 €
NG-H100×47.770,00 €7.148,40 €6.682,20 €13.053,60 €
NG-H200×830.660,00 €28.207,20 €26.367,60 €51.508,80 €

Kapazität

Was sofort startet — und was wir vorher prüfen

GPUs sind das einzige Produkt in diesem Katalog, für das wir keine sofortige Verfügbarkeit zusagen. Wir nennen die Lage deshalb vorher, statt Sie in eine Warteschleife zu schicken.

Beschaffungslage je Kartentyp — eine Zeile je Karte, gültig für alle Ausbaustufen dieser Karte: sofortiger Bezug, Reservierungsvorlauf und Kontingent je Projekt
KarteOn-DemandReservierungKontingent
NVIDIA RTX PRO 4000 Blackwell SFFBasiszeile NG-RTX4000durchgehend verfügbarnicht nötig8 GPUs
NVIDIA L4Basiszeile NG-L4durchgehend verfügbarnicht nötig8 GPUs
NVIDIA L40SBasiszeile NG-L40Sdurchgehend verfügbarab 30 Tagen möglich4 GPUs
NVIDIA RTX PRO 6000 Blackwell Max-QBasiszeile NG-RTX6000meist verfügbarab 30 Tagen, 2 Werktage Vorlauf2 GPUs
NVIDIA H100 SXMBasiszeile NG-H100nach Kapazitätab 30 Tagen, 5 Werktage Vorlauf2 GPUs
NVIDIA H200 SXMBasiszeile NG-H200×8nur nach Prüfungab 30 Tagen, 10 Werktage Vorlaufauf Anfrage
Kapazität abfragen und reservieren
# Freie Kapazität je Modell und Standort abfragen
entronyx gpu availability --model h100 --region fra1
# MODELL   STANDORT  FREI  RESERVIERBAR  NÄCHSTER SLOT
# h100     fra1         3            12  sofort
# h200x8   fra1         0             2  in 6 Werktagen
 
# Kapazität für 30 Tage verbindlich reservieren
entronyx gpu reservation create \
  --flavor ng-h100 --region fra1 --count 4 --term 30d
 
# Benachrichtigung, sobald ein H200-Knoten frei wird
entronyx gpu watch --flavor ng-h200x8 --region fra2 --notify webhook
Die Verfügbarkeitsabfrage ist nicht ratenbegrenzt und darf in Bereitstellungsskripten laufen. Reservierungen erscheinen als eigene Position auf der Rechnung.
Zwei Hände setzen eine Beschleunigerkarte in den Steckplatz eines geöffneten Servergehäuses, daneben der Halterahmen und der Schraubendreher.
Auf jede eingebaute Karte kommen 8 bis 48 dedizierte EPYC-Kerne. Das Verhältnis steigt mit der Karte, damit die Vorverarbeitung die GPU nicht ausbremst — kein Knoten wird bei ENTRONYX CLOUD schmaler bestückt.

Standortmatrix

Wo welche Karte steht

GPU-Knoten brauchen mehr Strom je Höheneinheit und eine andere Kühlung als ein Standard-Gehäuse. Deshalb steht nicht jede Konfiguration an jedem Standort — und die größte nur dort, wo Flüssigkühlung eingebaut ist.

Verfügbarkeit jeder GPU-Konfiguration je Standort
Konfigurationfra1Frankfurt am Mainfra2Frankfurt am Mainmuc1Münchenhel1Helsinki
NG-RTX4000NVIDIA RTX PRO 4000 Blackwell SFFverfügbarverfügbarverfügbarverfügbar
NG-L4NVIDIA L4verfügbarverfügbarverfügbarverfügbar
NG-L40SNVIDIA L40Sverfügbarverfügbarverfügbarverfügbar
NG-RTX6000NVIDIA RTX PRO 6000 Blackwell Max-Qverfügbarverfügbarnicht verfügbarverfügbar
NG-H100NVIDIA H100 SXMverfügbarverfügbarnicht verfügbarverfügbar
NG-H100×2NVIDIA H100 SXMverfügbarverfügbarnicht verfügbarverfügbar
NG-H100×4NVIDIA H100 SXMverfügbarverfügbarnicht verfügbarverfügbar
NG-H200×8NVIDIA H200 SXMverfügbarverfügbarnicht verfügbarverfügbar
  • Frankfurt am Mainfra1

    Standort Rhein-Main I

    RTX PRO 4000 Blackwell SFF · L4 · L40S · RTX PRO 6000 Blackwell Max-Q · H100 SXM · H200 SXM

    8 von 8 Konfigurationen · PUE 1,14 · 3 ms

    Vollständiges Programm

  • Frankfurt am Mainfra2

    Standort Rhein-Main II

    RTX PRO 4000 Blackwell SFF · L4 · L40S · RTX PRO 6000 Blackwell Max-Q · H100 SXM · H200 SXM

    8 von 8 Konfigurationen · PUE 1,09 · 3 ms

    Vollständiges Programm

  • Münchenmuc1

    Standort Isar

    RTX PRO 4000 Blackwell SFF · L4 · L40S

    3 von 8 Konfigurationen · PUE 1,11 · 5 ms

  • Helsinkihel1

    Standort Uusimaa

    RTX PRO 4000 Blackwell SFF · L4 · L40S · RTX PRO 6000 Blackwell Max-Q · H100 SXM · H200 SXM

    8 von 8 Konfigurationen · PUE 1,08 · 21 ms

    Vollständiges Programm

3 der 4 Standorte führen alle 8 Konfigurationen: Standort Rhein-Main I, Standort Rhein-Main II, Standort Uusimaa. Die übrigen tragen die Karten, die ihre Stromdichte hergibt. PUE ist das Verhältnis von Gesamtstrom zu Rechenstrom — je näher an 1,0, desto weniger geht in Kühlung und Verluste.

Trainingsdaten ohne Drittlandtransfer

Alle 4 GPU-Standorte liegen im Geltungsbereich der DSGVO, verteilt auf Deutschland und Finnland. Wer hier rechnet, lässt seine Trainingsdaten ohne Drittlandtransfer verarbeiten. Die Auftragsverarbeitung nach Art. 28 DSGVO ist Bestandteil des Hauptvertrags und kein Zusatzformular.

Auftragsverarbeitung Vertragstext und Unterauftragsverarbeiter

4Standorte, alle ohne Drittlandtransfer

Softwarestand

Vorbereitet, aber nicht bevormundend

Das Standardabbild bringt Treiber, CUDA-Werkzeugkette und Container-Laufzeit mit. Alles darüber gehört Ihnen — wir schreiben Ihnen kein Framework und keine Version vor.

Treiber
NVIDIA 570 LTS
Data-Center-Zweig, monatlich gepflegt
CUDA
12.8 und 12.4
über Module umschaltbar
Container
NVIDIA Container Toolkit
Docker und Podman, --gpus all
Betriebssystem
Ubuntu 24.04 LTS
auch Debian 13 und Rocky 10
Erste Schritte auf einer GPU-Instanz
# Treiber, CUDA und Container-Laufzeit sind im Abbild vorinstalliert
nvidia-smi --query-gpu=name,memory.total,driver_version --format=csv
 
# Einzelne GPU: Container mit Zugriff auf die lokale NVMe
docker run --rm --gpus all \
  -v /mnt/nvme/datasets:/data \
  -v /mnt/nvme/checkpoints:/ckpt \
  nvcr.io/nvidia/pytorch:25.06-py3 \
  python train.py --data /data --out /ckpt --precision bf16
 
# Acht GPUs in einem Knoten: NCCL läuft über NVLink, nicht über das Netz
torchrun --standalone --nproc_per_node=8 train.py \
  --precision fp8 --grad-accum 4 --checkpoint-every 500
 
# Belegung während des Laufs beobachten
nvidia-smi dmon -s pucm -d 5
Die lokale NVMe ist unter /mnt/nvme eingehängt. Sie überlebt Neustarts, aber nicht das Löschen der Instanz — Prüfpunkte gehören zusätzlich in den Object Storage.

Nicht nur Sprachmodelle

Die L4 dekodiert und kodiert bis zu acht 4K-Ströme gleichzeitig in AV1, dem lizenzkostenfreien Videoformat. Für Mediatheken und Live-Transkodierung ist sie damit die günstigste Zeile im Katalog. Die L40S bringt zusätzlich RT-Kerne — Recheneinheiten für Raytracing — für Blender, Omniverse und Unreal-Renderfarmen. Beide Fälle rechnen sich je Stunde ganz anders als Training.

Nächster Schritt

GPU-Instanz konfigurieren oder Kapazität reservieren

Für L4 und L40S startet die Instanz sofort. Für A100, H100 und den H200-Knoten prüft der Konfigurator die freie Kapazität am gewählten Standort und schlägt bei Bedarf eine Reservierung vor.

ab
214,00 €
VRAM im Knoten
1.128 GB
72-Stunden-Lauf ab
21,11 €
Standorte
4