AI/GPU сървъри - 8x Custom VAST AI сървъра
8 custom AI/GPU сървъра, изградени за клиент за отдаване под наем през Vast.ai. Supermicro TURIN2D24G, 2x EPYC 9754, 8x RTX 5090, 768GB DDR5 ECC.
За проекта
8 custom AI/GPU сървъра, изградени за клиент за отдаване под наем през Vast.ai платформата. Aura Digital отговаря за пълния цикъл: от проектиране на хардуерна конфигурация и поръчка на компоненти, през сглобяване и стрес тестване, до deployment в data center. Всеки сървър е оптимизиран за AI training и inference workloads с максимална GPU density на rack unit.
Спецификация (на сървър)
- Шаси: Custom 6U rack-mount
- Дъно: Supermicro TURIN2D24G-2L+
- Процесори: 2x AMD EPYC 9754 (128 cores / 256 threads на сървър)
- GPU: 8x NVIDIA RTX 5090 (32GB GDDR7 на карта)
- RAM: 12x 64GB DDR5 ECC (768GB общо на сървър)
- Storage: 2x 4TB Samsung 990 PRO NVMe (8TB на сървър)
- Захранване: 5x CRPS 1600W (8,000W общо, N+1 redundancy)
Мащаб на проекта
- 8 сървъра x 8 GPU = 64x RTX 5090 общо
- 8 сървъра x 256 threads = 2,048 CPU threads общо
- 8 сървъра x 768GB = 6,144GB RAM общо
- Изградено за клиент, който отдава капацитета под наем през Vast.ai
Защо точно тази конфигурация
Флот за отдаване под наем се мери по две числа: колко GPU-часа реално може да фактурира и колко струва тези GPU да бъдат захранени с работа. Всяко решение по-долу следва от това.
Защо RTX 5090, а не data-center карта. За inference и fine-tuning задачите, които доминират търсенето на платформата, 32 GB GDDR7 на карта покриват по-голямата част от наеманите workloads - на част от цената на ускорител от класа H100. Срокът на изплащане при потребителски силикон е осезаемо по-кратък, а точно това купува клиентът.
Защо два EPYC 9754 (256 threads). Осем GPU гладуват, ако хостът не смогва да ги захрани. Наемателите пускат data loaders, video decode и preprocessing на процесора; слаб хост се превръща в тясното място и машината събира ниски оценки за надеждност. 256 threads и 12 канала памет на сървър означават, че ограничението остават самите GPU - а това е целта.
Защо 768 GB ECC памет. Наемателите редовно искат голяма хост памет за кеширане на датасети. ECC не подлежи на компромис: един тих bit-flip в 30-дневен training run е нефактурируема задача и support тикет.
Защо N+1 захранване. 8000 W върху пет CRPS модула означават, че отказ на едно захранване понижава, а не убива възела. На платформа за отдаване под наем непланиран рестарт струва и текущата задача, и рейтинга за надеждност, който определя бъдещите резервации.
Термика и плътност
Осем карти с пълна височина в едно шаси не е проблем на монтажа, а проблем на въздушния поток. Карти, застанали рамо до рамо, всмукват изгорелия въздух на съседа, средните GPU тротлят първи и бенчмаркът на целия възел пада - видимо за всеки потенциален наемател.
Сглобката решава това със строг фронт-към-заден напорен път: уплътнено кабелно трасе, за да не може въздух да заобиколи стека от карти, стени от насрещно въртящи се вентилатори, оразмерени за пълните 8000 W топлинно натоварване, и валидирана входна температура при средните слотове, а не само в края на шасито. Стрес тестът натоварва всички GPU едновременно на пълни обороти - реалистичният най-лош случай на такава платформа - вместо карта по карта.
Как протича изпълнението
- Първо ROI моделът. Преди да бъде поръчан един компонент, моделираме постижимия приход спрямо покупната цена, консумацията и колокацията. Ако конфигурацията не се изплаща, тя не се строи.
- Снабдяване. Доставка от ЕС, съвпадащи производствени партиди, пълна гаранционна документация на името на клиента.
- Сглобяване. Подготовка на шасито, проверка на PCIe топологията, кабелен мениджмънт заради въздушния поток, а не заради външния вид.
- Стрес тест. Всички GPU едновременно под пълно натоварване, логната телеметрия за температура и мощност, валидирана памет.
- Deployment. Монтаж в rack, мрежа и отдалечено управление (IPMI), onboarding на платформата.
- Предаване. Документация, достъп до мониторинг - и клиент, който може да оперира флота без нас.
Резултат
Същият инженерен подход по-късно легна в основата на сървъра на НЕОКСИС, който премина верификацията на Vast.ai с 98.79% надеждност - точно показателят на платформата, който решава дали една машина изобщо ще бъде наета. Методиката е описана подробно в казуса ни за верификацията във Vast.ai.
Какво го прави специален
Един от най-мащабните хардуерни проекти на Aura Digital - 64 high-end GPU карти в единна инфраструктура. Процесът включва детайлен ROI анализ за VAST AI рентабилност, подбор на компоненти за оптимално съотношение цена/производителност и проектиране на cooling решение за непрекъсната 24/7 работа под пълно натоварване.
Искате същото за собствен флот? Конфигурирайте сървър или сметнете числата в GPU ROI калкулатора.
Имате идея за подобен проект?
Разкажете ни - ще преценим обхвата и ще върнем оферта до 2 работни дни.

