CrestVPS

gpu vps

AI інференс та доналаштування

Цілий GPU, переданий повністю, на умовах, які роблять математику вигідною.

Що б ми розгорнули

287 EUR/міс

410 EUR30% щорічно

Часові зрізи vGPU роблять бенчмарки безглуздими, а пам'яттє-залежний інференс непередбачуваним. FUSION передає всю фізичну карту через PCIe Gen5, тому пристрій, який ви бачите, — це пристрій, який у вас є: повна пам'ять, повні тактові частоти, прямий доступ до драйвера, без планувальника між вашими ядрами та кремнієм.

Чому ця конфігурація

Почніть з RTX 4090 для моделей до приблизно тридцяти мільярдів параметрів з квантуванням, перейдіть на L40S для сорока восьми гігабайт пам'яті, або візьміть H100 NVL, коли потрібна пропускна здатність. При річному циклі 4090 коштує приблизно як два місяці on-demand потужності в інших місцях, що робить довгі доналаштування доступними.

Що б ми розгорнули

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
Сховище1 TB
ОбразUbuntu Server 24.04 LTS

Розміри

Вага плюс KV-кеш, потім округліть до реальної карти. Вага — це параметри, помножені на байти на параметр: 8B у fp16 — 16 ГБ, 70B у 4-бітному — близько 40 ГБ. KV-кеш — це частина, про яку забувають: він масштабується з батчем та контекстом. Отже: 8B fp16 на RTX 4090 (24 ГБ), 70B квантований на L40S (48 ГБ), 70B у fp8 з довгим контекстом та реальним батчингом на H100 NVL (94 ГБ). RTX 4000 Ada підходить для ембедінгів та невеликих vision-моделей.

Passthrough, а не vGPU

FUSION передає весь PCIe-пристрій вашій VM через IOMMU. Карта з'являється в lspci, nvidia-smi повідомляє про неї безпосередньо, і ви встановлюєте будь-яку версію драйвера та CUDA, яка потрібна вашому стеку. Нічого не ділиться за часом з іншим орендарем, і жоден ліцензійний сервер не стоїть між вами та залізом. vGPU — протилежна схема: гіпервізор розбиває карту, планує зрізи між гостьовими системами та прив'язує вас до гілки драйвера, яку запускає хост. Для інференсу це важливо двічі: MPS та CUDA graph ведуть себе передбачувано, а VRAM справді ваша, а не квота, яку алокація іншого гостя може виснажити.

Пропускна здатність — це проблема батчингу

Один запит залишає більшу частину сучасного GPU невикористаною. Декодування обмежене пропускною здатністю пам'яті, тому токени на секунду для одного потоку задаються пропускною здатністю VRAM і майже не рухаються зі збільшенням обчислень. Конкурентність — це те, де кремній окупається. Постійний батчинг у vLLM або TensorRT-LLM піднімає сукупну пропускну здатність у кілька разів порівняно з наївним сервінгом, ціною VRAM для зростаючого KV-кешу. Це справжня напруга розміру: кожен гігабайт, витрачений на вагу, недоступний для конкурентності. Квантування 70B до 4-біт часто швидше в сукупності, ніж fp16, лише тому, що звільняє місце для батчингу.

Що може піти не так

  • Розрахунок лише за вагою. KV-кеш зростає лінійно з батчем та контекстом, тому модель 8B, яка завантажується в 16 ГБ, переповниться при контексті 32k та батчі 16. Обчисліть кеш перед вибором карти.
  • Припущення, що споживчі карти масштабуються. 4090 не має NVLink, а peer-to-peer через PCIe вимкнено, тому тензорний паралелізм на двох таких картах буде повільним. Використовуйте одну більшу карту, а не дві менші.
  • Очікування fp8 всюди. fp8 потребує Ada або Hopper. Квантування до fp8 на старішому кремнії відкочується до емуляції і працює повільніше, ніж fp16, який ви замінили.

Налаштуйте машину

  • Сховище та шифруванняZFS with hourly snapshots · 7 EUR
  • Адресація та транзитUplink upgrade to 10 Gbps · 19 EUR
  • ІншеSecond-resolution metrics + alerting · 5 EUR