KI-/GPU-Server - 8x individuelle VAST-AI-Server
8 individuelle KI-/GPU-Server, für einen Kunden zur Vermietung über Vast.ai gebaut. Supermicro TURIN2D24G, 2x EPYC 9754, 8x RTX 5090, 768GB DDR5 ECC.
Über das Projekt
8 individuelle KI-/GPU-Server, gebaut für einen Kunden, der die Kapazität über die Plattform Vast.ai vermietet. Aura Digital verantwortet den vollen Zyklus: von der Auslegung der Hardware-Konfiguration und der Beschaffung der Komponenten über Montage und Stresstest bis zum Deployment im Rechenzentrum. Jeder Server ist auf KI-Training und Inferenz ausgelegt, mit maximaler GPU-Dichte je Höheneinheit.
Spezifikation (pro Server)
- Gehäuse: individuelles 6U-Rack-Gehäuse
- Mainboard: Supermicro TURIN2D24G-2L+
- Prozessoren: 2x AMD EPYC 9754 (128 Kerne / 256 Threads pro Server)
- GPU: 8x NVIDIA RTX 5090 (32 GB GDDR7 je Karte)
- RAM: 12x 64 GB DDR5 ECC (768 GB pro Server)
- Speicher: 2x 4 TB Samsung 990 PRO NVMe (8 TB pro Server)
- Stromversorgung: 5x CRPS 1600 W (8.000 W gesamt, N+1-Redundanz)
Projektumfang
- 8 Server x 8 GPUs = 64x RTX 5090 insgesamt
- 8 Server x 256 Threads = 2.048 CPU-Threads insgesamt
- 8 Server x 768 GB = 6.144 GB RAM insgesamt
- Gebaut für einen Kunden, der die Kapazität über Vast.ai vermietet
Warum genau diese Konfiguration
Eine Vermietungsflotte wird an zwei Zahlen gemessen: wie viele GPU-Stunden sie tatsächlich abrechnen kann und was es kostet, diese GPUs mit Arbeit zu versorgen. Jede Entscheidung unten folgt daraus.
Warum RTX 5090 statt einer Rechenzentrumskarte. Für Inferenz- und Fine-Tuning-Jobs, die die Nachfrage auf dem Marktplatz dominieren, decken 32 GB GDDR7 je Karte den Großteil der vermieteten Workloads ab - zu einem Bruchteil der Anschaffungskosten eines Beschleunigers der H100-Klasse. Die Amortisationszeit bei Consumer-Silizium ist messbar kürzer, und genau das kauft der Kunde ein.
Warum zwei EPYC 9754 (256 Threads). Acht GPUs verhungern, wenn der Host sie nicht versorgt. Mieter lassen Data Loader, Video-Decoding und Preprocessing auf der CPU laufen; ein zu schwacher Host wird zum Flaschenhals und die Maschine sammelt schlechte Zuverlässigkeitswerte ein. 256 Threads und 12 Speicherkanäle pro Server sorgen dafür, dass die GPUs das Limit bleiben - genau so soll es sein.
Warum 768 GB ECC-RAM. Mieter fordern regelmäßig viel Host-Speicher zum Zwischenspeichern von Datensätzen. ECC ist nicht verhandelbar: Ein stiller Bitfehler in einem 30-Tage-Trainingslauf ist ein nicht abrechenbarer Job und ein Support-Ticket.
Warum N+1-Stromversorgung. 8.000 W auf fünf CRPS-Einheiten bedeuten, dass ein Netzteilausfall den Knoten drosselt statt ihn abzuschalten. Auf einer Vermietungsplattform kostet ein ungeplanter Neustart sowohl den laufenden Job als auch den Zuverlässigkeitswert, der über künftige Buchungen entscheidet.
Thermik und Packungsdichte
Acht Karten voller Bauhöhe in einem Gehäuse sind kein Montage-, sondern ein Luftstromproblem. Dicht nebeneinander sitzende Karten saugen die Abluft der Nachbarn an, die mittleren GPUs drosseln zuerst, und der Benchmark des ganzen Knotens fällt - sichtbar für jeden potenziellen Mieter.
Der Aufbau löst das mit einem strikten Druckpfad von vorn nach hinten: abgedichtete Kabelführung, damit keine Luft am Kartenstapel vorbeiströmt, gegenläufige Lüfterwände ausgelegt auf die volle thermische Last von 8.000 W, und validierte Eintrittstemperatur an den mittleren Slots statt nur am Gehäuserand. Der Stresstest fährt alle GPUs gleichzeitig unter Dauervolllast - der realistische schlimmste Fall auf einer Vermietungsplattform - und nicht eine Karte nach der anderen.
Ablauf der Umsetzung
- ROI-Modell zuerst. Bevor eine einzige Komponente bestellt wird, rechnen wir erzielbare Einnahmen gegen Anschaffung, Stromaufnahme und Colocation. Rechnet sich die Konfiguration nicht, wird sie nicht gebaut.
- Beschaffung. EU-Bezug, gleiche Fertigungslose, vollständige Garantieunterlagen auf den Namen des Kunden.
- Montage. Gehäusevorbereitung, Prüfung der PCIe-Topologie, Kabelführung für den Luftstrom statt für die Optik.
- Stresstest. Alle GPUs gleichzeitig unter Volllast, Thermik- und Leistungstelemetrie protokolliert, Speicher validiert.
- Deployment. Rack-Einbau, Netzwerk und Fernverwaltung (IPMI), Onboarding auf der Plattform.
- Übergabe. Dokumentation, Monitoring-Zugang - und ein Kunde, der die Flotte ohne uns betreiben kann.
Ergebnis
Derselbe Engineering-Ansatz floss später in den NEOXIS-Server ein, der die Vast.ai-Verifizierung mit 98,79 % Zuverlässigkeit bestanden hat - genau die Plattformkennzahl, die darüber entscheidet, ob eine Maschine überhaupt gemietet wird. Die Methodik ist in unserer Fallstudie zur Vast.ai-Verifizierung im Detail dokumentiert.
Was das Projekt besonders macht
Eines der größten Hardware-Projekte von Aura Digital - 64 High-End-GPUs in einer einheitlichen Infrastruktur. Der Prozess umfasst eine detaillierte ROI-Analyse zur Wirtschaftlichkeit auf VAST AI, die Komponentenauswahl für ein optimales Preis-Leistungs-Verhältnis und die Auslegung der Kühlung für unterbrechungsfreien 24/7-Betrieb unter Volllast.
Dasselbe für Ihre eigene Flotte? Server konfigurieren oder die Zahlen im GPU-ROI-Rechner durchrechnen.
Haben Sie ein ähnliches Projekt im Kopf?
Sagen Sie uns Bescheid - wir kalkulieren es und liefern ein Angebot binnen 2 Werktagen.

