Aura Digital
София · 42.69°N 23.32°E
Заявете консултация
Всички проекти
AI инфраструктура · 2025

AI/GPU сървъри - 8x Custom VAST AI сървъра

8 custom AI/GPU сървъра, изградени за клиент за отдаване под наем през Vast.ai. Supermicro TURIN2D24G, 2x EPYC 9754, 8x RTX 5090, 768GB DDR5 ECC.

AI/GPU сървъри - 8x Custom VAST AI сървъра
Осем custom GPU сървъра за Vast.ai - изглед на проекта

За проекта

8 custom AI/GPU сървъра, изградени за клиент за отдаване под наем през Vast.ai платформата. Aura Digital отговаря за пълния цикъл: от проектиране на хардуерна конфигурация и поръчка на компоненти, през сглобяване и стрес тестване, до deployment в data center. Всеки сървър е оптимизиран за AI training и inference workloads с максимална GPU density на rack unit.

Спецификация (на сървър)

  • Шаси: Custom 6U rack-mount
  • Дъно: Supermicro TURIN2D24G-2L+
  • Процесори: 2x AMD EPYC 9754 (128 cores / 256 threads на сървър)
  • GPU: 8x NVIDIA RTX 5090 (32GB GDDR7 на карта)
  • RAM: 12x 64GB DDR5 ECC (768GB общо на сървър)
  • Storage: 2x 4TB Samsung 990 PRO NVMe (8TB на сървър)
  • Захранване: 5x CRPS 1600W (8,000W общо, N+1 redundancy)

Мащаб на проекта

  • 8 сървъра x 8 GPU = 64x RTX 5090 общо
  • 8 сървъра x 256 threads = 2,048 CPU threads общо
  • 8 сървъра x 768GB = 6,144GB RAM общо
  • Изградено за клиент, който отдава капацитета под наем през Vast.ai

Защо точно тази конфигурация

Флот за отдаване под наем се мери по две числа: колко GPU-часа реално може да фактурира и колко струва тези GPU да бъдат захранени с работа. Всяко решение по-долу следва от това.

Защо RTX 5090, а не data-center карта. За inference и fine-tuning задачите, които доминират търсенето на платформата, 32 GB GDDR7 на карта покриват по-голямата част от наеманите workloads - на част от цената на ускорител от класа H100. Срокът на изплащане при потребителски силикон е осезаемо по-кратък, а точно това купува клиентът.

Защо два EPYC 9754 (256 threads). Осем GPU гладуват, ако хостът не смогва да ги захрани. Наемателите пускат data loaders, video decode и preprocessing на процесора; слаб хост се превръща в тясното място и машината събира ниски оценки за надеждност. 256 threads и 12 канала памет на сървър означават, че ограничението остават самите GPU - а това е целта.

Защо 768 GB ECC памет. Наемателите редовно искат голяма хост памет за кеширане на датасети. ECC не подлежи на компромис: един тих bit-flip в 30-дневен training run е нефактурируема задача и support тикет.

Защо N+1 захранване. 8000 W върху пет CRPS модула означават, че отказ на едно захранване понижава, а не убива възела. На платформа за отдаване под наем непланиран рестарт струва и текущата задача, и рейтинга за надеждност, който определя бъдещите резервации.

Термика и плътност

Осем карти с пълна височина в едно шаси не е проблем на монтажа, а проблем на въздушния поток. Карти, застанали рамо до рамо, всмукват изгорелия въздух на съседа, средните GPU тротлят първи и бенчмаркът на целия възел пада - видимо за всеки потенциален наемател.

Сглобката решава това със строг фронт-към-заден напорен път: уплътнено кабелно трасе, за да не може въздух да заобиколи стека от карти, стени от насрещно въртящи се вентилатори, оразмерени за пълните 8000 W топлинно натоварване, и валидирана входна температура при средните слотове, а не само в края на шасито. Стрес тестът натоварва всички GPU едновременно на пълни обороти - реалистичният най-лош случай на такава платформа - вместо карта по карта.

Как протича изпълнението

  1. Първо ROI моделът. Преди да бъде поръчан един компонент, моделираме постижимия приход спрямо покупната цена, консумацията и колокацията. Ако конфигурацията не се изплаща, тя не се строи.
  2. Снабдяване. Доставка от ЕС, съвпадащи производствени партиди, пълна гаранционна документация на името на клиента.
  3. Сглобяване. Подготовка на шасито, проверка на PCIe топологията, кабелен мениджмънт заради въздушния поток, а не заради външния вид.
  4. Стрес тест. Всички GPU едновременно под пълно натоварване, логната телеметрия за температура и мощност, валидирана памет.
  5. Deployment. Монтаж в rack, мрежа и отдалечено управление (IPMI), onboarding на платформата.
  6. Предаване. Документация, достъп до мониторинг - и клиент, който може да оперира флота без нас.

Резултат

Същият инженерен подход по-късно легна в основата на сървъра на НЕОКСИС, който премина верификацията на Vast.ai с 98.79% надеждност - точно показателят на платформата, който решава дали една машина изобщо ще бъде наета. Методиката е описана подробно в казуса ни за верификацията във Vast.ai.

Какво го прави специален

Един от най-мащабните хардуерни проекти на Aura Digital - 64 high-end GPU карти в единна инфраструктура. Процесът включва детайлен ROI анализ за VAST AI рентабилност, подбор на компоненти за оптимално съотношение цена/производителност и проектиране на cooling решение за непрекъсната 24/7 работа под пълно натоварване.

Искате същото за собствен флот? Конфигурирайте сървър или сметнете числата в GPU ROI калкулатора.


Изгледи

Имате идея за подобен проект?

Разкажете ни - ще преценим обхвата и ще върнем оферта до 2 работни дни.

Заявете консултация
Обадете се