gpu vps
AI інференс та доналаштування
Цілий GPU, переданий повністю, на умовах, які роблять математику вигідною.
Що б ми розгорнули
287 EUR/міс
410 EUR−30% щорічно
Часові зрізи vGPU роблять бенчмарки безглуздими, а пам'яттє-залежний інференс непередбачуваним. FUSION передає всю фізичну карту через PCIe Gen5, тому пристрій, який ви бачите, — це пристрій, який у вас є: повна пам'ять, повні тактові частоти, прямий доступ до драйвера, без планувальника між вашими ядрами та кремнієм.
Чому ця конфігурація
Почніть з RTX 4090 для моделей до приблизно тридцяти мільярдів параметрів з квантуванням, перейдіть на L40S для сорока восьми гігабайт пам'яті, або візьміть H100 NVL, коли потрібна пропускна здатність. При річному циклі 4090 коштує приблизно як два місяці on-demand потужності в інших місцях, що робить довгі доналаштування доступними.
Що б ми розгорнули
Розміри
Вага плюс KV-кеш, потім округліть до реальної карти. Вага — це параметри, помножені на байти на параметр: 8B у fp16 — 16 ГБ, 70B у 4-бітному — близько 40 ГБ. KV-кеш — це частина, про яку забувають: він масштабується з батчем та контекстом. Отже: 8B fp16 на RTX 4090 (24 ГБ), 70B квантований на L40S (48 ГБ), 70B у fp8 з довгим контекстом та реальним батчингом на H100 NVL (94 ГБ). RTX 4000 Ada підходить для ембедінгів та невеликих vision-моделей.
Passthrough, а не vGPU
FUSION передає весь PCIe-пристрій вашій VM через IOMMU. Карта з'являється в lspci, nvidia-smi повідомляє про неї безпосередньо, і ви встановлюєте будь-яку версію драйвера та CUDA, яка потрібна вашому стеку. Нічого не ділиться за часом з іншим орендарем, і жоден ліцензійний сервер не стоїть між вами та залізом. vGPU — протилежна схема: гіпервізор розбиває карту, планує зрізи між гостьовими системами та прив'язує вас до гілки драйвера, яку запускає хост. Для інференсу це важливо двічі: MPS та CUDA graph ведуть себе передбачувано, а VRAM справді ваша, а не квота, яку алокація іншого гостя може виснажити.
Пропускна здатність — це проблема батчингу
Один запит залишає більшу частину сучасного GPU невикористаною. Декодування обмежене пропускною здатністю пам'яті, тому токени на секунду для одного потоку задаються пропускною здатністю VRAM і майже не рухаються зі збільшенням обчислень. Конкурентність — це те, де кремній окупається. Постійний батчинг у vLLM або TensorRT-LLM піднімає сукупну пропускну здатність у кілька разів порівняно з наївним сервінгом, ціною VRAM для зростаючого KV-кешу. Це справжня напруга розміру: кожен гігабайт, витрачений на вагу, недоступний для конкурентності. Квантування 70B до 4-біт часто швидше в сукупності, ніж fp16, лише тому, що звільняє місце для батчингу.
Що може піти не так
- Розрахунок лише за вагою. KV-кеш зростає лінійно з батчем та контекстом, тому модель 8B, яка завантажується в 16 ГБ, переповниться при контексті 32k та батчі 16. Обчисліть кеш перед вибором карти.
- Припущення, що споживчі карти масштабуються. 4090 не має NVLink, а peer-to-peer через PCIe вимкнено, тому тензорний паралелізм на двох таких картах буде повільним. Використовуйте одну більшу карту, а не дві менші.
- Очікування fp8 всюди. fp8 потребує Ada або Hopper. Квантування до fp8 на старішому кремнії відкочується до емуляції і працює повільніше, ніж fp16, який ви замінили.
Налаштуйте машину
- Сховище та шифрування — ZFS with hourly snapshots · 7 EUR
- Адресація та транзит — Uplink upgrade to 10 Gbps · 19 EUR
- Інше — Second-resolution metrics + alerting · 5 EUR
Більше
Створено для конкретних завдань
Хостинг ігрових серверів
Тик-рейт — це задача одного потоку. Все інше — шум.
Торговий та低латентний VPS
Відстань до торгового рушія — і нічого між вами та дротом.
Приватні VPN та проксі-ендпоінти
Власний вихід у юрисдикції, яку ви обрали свідомо.
Сідбокси та масове зберігання
Терабайти, які залишаються дешевими, та порт, який залишається відкритим.
Робочі вузли Kubernetes
Дешево за ядро, щільно та однаково щоразу.
Реселінг хостингу
Ваш бренд на панелі, наше залізо під капотом.