CrestVPS

gpu vps

Inferencja AI i fine-tuning

Całe GPU, przepuszczone, na zobowiązaniu, które czyni matematykę sensowną.

Co byśmy wdrożyli

287 €/mies.

410 €30% rocznie

Time-sliced vGPU czynią benchmarki bezsensownymi i sprawiają, że inferencja ograniczona pamięcią jest nieprzewidywalna. FUSION przepuszcza całą fizyczną kartę przez PCIe Gen5, więc urządzenie, które widzisz, to urządzenie, które masz: pełna pamięć, pełne taktowania, bezpośredni dostęp do sterowników, żadnego schedulera między Twoimi kernelami a krzemem.

Dlaczego ta konfiguracja

Zacznij na RTX 4090 dla modeli do około trzydziestu miliardów parametrów skwantowanych, przejdź na L40S dla czterdziestu ośmiu gigabajtów pamięci, lub weź H100 NVL, gdy potrzebujesz przepustowości. W cyklu rocznym 4090 ląduje w okolicy kosztu dwóch miesięcy on-demand w innym miejscu, co czyni długie runy fine-tuningu w ogóle przystępnymi.

Co byśmy wdrożyli

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
Dysk1 TB
Obraz systemuUbuntu Server 24.04 LTS

Rozmiar

Wagi plus cache KV, potem zaokrąglij do realnej karty. Wagi to parametry razy bajty na parametr: 8B przy fp16 to 16 GB, 70B przy 4-bitach około 40 GB. Cache KV to część, o której ludzie zapominają — skaluje się z batchem razy kontekst. Więc: 8B fp16 na RTX 4090 (24 GB), 70B skwantowany na L40S (48 GB), 70B przy fp8 z długim kontekstem i realnym batchingiem na H100 NVL (94 GB). RTX 4000 Ada pasuje do embeddingów i małych modeli wizyjnych.

Passthrough, nie vGPU

FUSION oddaje całe urządzenie PCIe Twojej VM przez IOMMU. Karta pojawia się w lspci, nvidia-smi raportuje ją bezpośrednio, a Ty instalujesz sterownik i wersję CUDA, których potrzebuje Twój stack. Nic nie jest time-slicowane z innym tenantem i żaden serwer licencji nie stoi między Tobą a sprzętem. vGPU to przeciwny układ: hypervisor partycjonuje kartę, scheduleuje slice'y między gośćmi i przypina Cię do gałęzi sterownika, którą prowadzi host. Dla inferencji to ma znaczenie podwójnie — MPS i CUDA graphs zachowują się przewidywalnie, a VRAM jest naprawdę Twoja, nie kwota, na którą alokacja innego gościa może naciskać.

Przepustowość to problem batchingu

Pojedyncze żądanie zostawia większość nowoczesnego GPU bezczynną. Dekodowanie jest ograniczone przepustowością pamięci, więc tokeny na sekundę dla jednego strumienia są ustawiane przez przepustowość VRAM i ledwo ruszają się z większą mocą obliczeniową. Współbieżność to tam, gdzie krzem zarabia. Continuous batching w vLLM lub TensorRT-LLM podnosi zagregowaną przepustowość kilkakrotnie w porównaniu do naiwnego serwowania, kosztem VRAM dla rosnącego cache KV. To jest prawdziwe napięcie przy rozmiarowaniu: każdy gigabajt wydany na wagi to gigabajt niedostępny dla współbieżności. Kwantyzacja 70B do 4-bitów jest często szybsza w zagregowaniu niż fp16, wyłącznie dlatego, że zostawia miejsce na batching.

Co może pójść źle

  • Rozmiarowanie na samych wagach. Cache KV rośnie liniowo z batchem i kontekstem, więc model 8B, który ładuje się w 16 GB, zabraknie pamięci przy kontekście 32k i batchu 16. Oblicz cache, zanim wybierzesz kartę.
  • Zakładanie, że karty konsumenckie skalują się. 4090 nie ma NVLink, a peer-to-peer przez PCIe jest wyłączone, więc tensor parallel na dwóch jest wolny. Użyj jednej większej karty, nie dwóch mniejszych.
  • Oczekiwanie fp8 wszędzie. fp8 wymaga Ada lub Hoppera. Kwantyzacja do fp8 na starszym krzemie spada do emulacji i działa wolniej niż ścieżka fp16, którą zastąpiłeś.

Dostrojenie maszyny

  • Pamięć i szyfrowanieZFS with hourly snapshots · 7 €
  • Adresacja i tranzytUplink upgrade to 10 Gbps · 19 €
  • Wszystko inneSecond-resolution metrics + alerting · 5 €