gpu vps
Inferencja AI i fine-tuning
Całe GPU, przepuszczone, na zobowiązaniu, które czyni matematykę sensowną.
Co byśmy wdrożyli
287 €/mies.
410 €−30% rocznie
Time-sliced vGPU czynią benchmarki bezsensownymi i sprawiają, że inferencja ograniczona pamięcią jest nieprzewidywalna. FUSION przepuszcza całą fizyczną kartę przez PCIe Gen5, więc urządzenie, które widzisz, to urządzenie, które masz: pełna pamięć, pełne taktowania, bezpośredni dostęp do sterowników, żadnego schedulera między Twoimi kernelami a krzemem.
Dlaczego ta konfiguracja
Zacznij na RTX 4090 dla modeli do około trzydziestu miliardów parametrów skwantowanych, przejdź na L40S dla czterdziestu ośmiu gigabajtów pamięci, lub weź H100 NVL, gdy potrzebujesz przepustowości. W cyklu rocznym 4090 ląduje w okolicy kosztu dwóch miesięcy on-demand w innym miejscu, co czyni długie runy fine-tuningu w ogóle przystępnymi.
Co byśmy wdrożyli
Rozmiar
Wagi plus cache KV, potem zaokrąglij do realnej karty. Wagi to parametry razy bajty na parametr: 8B przy fp16 to 16 GB, 70B przy 4-bitach około 40 GB. Cache KV to część, o której ludzie zapominają — skaluje się z batchem razy kontekst. Więc: 8B fp16 na RTX 4090 (24 GB), 70B skwantowany na L40S (48 GB), 70B przy fp8 z długim kontekstem i realnym batchingiem na H100 NVL (94 GB). RTX 4000 Ada pasuje do embeddingów i małych modeli wizyjnych.
Passthrough, nie vGPU
FUSION oddaje całe urządzenie PCIe Twojej VM przez IOMMU. Karta pojawia się w lspci, nvidia-smi raportuje ją bezpośrednio, a Ty instalujesz sterownik i wersję CUDA, których potrzebuje Twój stack. Nic nie jest time-slicowane z innym tenantem i żaden serwer licencji nie stoi między Tobą a sprzętem. vGPU to przeciwny układ: hypervisor partycjonuje kartę, scheduleuje slice'y między gośćmi i przypina Cię do gałęzi sterownika, którą prowadzi host. Dla inferencji to ma znaczenie podwójnie — MPS i CUDA graphs zachowują się przewidywalnie, a VRAM jest naprawdę Twoja, nie kwota, na którą alokacja innego gościa może naciskać.
Przepustowość to problem batchingu
Pojedyncze żądanie zostawia większość nowoczesnego GPU bezczynną. Dekodowanie jest ograniczone przepustowością pamięci, więc tokeny na sekundę dla jednego strumienia są ustawiane przez przepustowość VRAM i ledwo ruszają się z większą mocą obliczeniową. Współbieżność to tam, gdzie krzem zarabia. Continuous batching w vLLM lub TensorRT-LLM podnosi zagregowaną przepustowość kilkakrotnie w porównaniu do naiwnego serwowania, kosztem VRAM dla rosnącego cache KV. To jest prawdziwe napięcie przy rozmiarowaniu: każdy gigabajt wydany na wagi to gigabajt niedostępny dla współbieżności. Kwantyzacja 70B do 4-bitów jest często szybsza w zagregowaniu niż fp16, wyłącznie dlatego, że zostawia miejsce na batching.
Co może pójść źle
- Rozmiarowanie na samych wagach. Cache KV rośnie liniowo z batchem i kontekstem, więc model 8B, który ładuje się w 16 GB, zabraknie pamięci przy kontekście 32k i batchu 16. Oblicz cache, zanim wybierzesz kartę.
- Zakładanie, że karty konsumenckie skalują się. 4090 nie ma NVLink, a peer-to-peer przez PCIe jest wyłączone, więc tensor parallel na dwóch jest wolny. Użyj jednej większej karty, nie dwóch mniejszych.
- Oczekiwanie fp8 wszędzie. fp8 wymaga Ada lub Hoppera. Kwantyzacja do fp8 na starszym krzemie spada do emulacji i działa wolniej niż ścieżka fp16, którą zastąpiłeś.
Dostrojenie maszyny
- Pamięć i szyfrowanie — ZFS with hourly snapshots · 7 €
- Adresacja i tranzyt — Uplink upgrade to 10 Gbps · 19 €
- Wszystko inne — Second-resolution metrics + alerting · 5 €
Więcej
Stworzone dla konkretnych zadań
Hosting serwerów gier
Tick rate to problem jednowątkowy. Reszta to szum.
VPS do tradingu i niskich opóźnień
Odległość do silnika dopasowującego zlecenia i nic między Tobą a siecią.
Prywatne punkty końcowe VPN i proxy
Twój własny punkt wyjścia, w jurysdykcji wybranej celowo.
Seedboxy i magazyn masowy
Terabajty, które pozostają tanie, i port, który pozostaje otwarty.
Węzły robocze Kubernetes
Tanio za rdzeń, gęsto i identycznie za każdym razem.
Reseller hostingu
Twoja marka na panelu, nasz sprzęt pod spodem.