CrestVPS

gpu vps

AI-inferentie en fine-tuning

Een hele GPU, doorgegeven, op een verbintenis die de wiskunde laat kloppen.

Wat wij zouden implementeren

€ 287/mnd

€ 41030% jaarlijks

Time-sliced vGPU's maken benchmarken betekenisloos en maken geheugen-gebonden inferentie onvoorspelbaar. FUSION geeft de hele fysieke kaart door via PCIe Gen5, dus het apparaat dat je ziet is het apparaat dat je hebt: volledig geheugen, volledige klokken, directe driver-toegang, geen scheduler tussen je kernels en het silicium.

Waarom deze configuratie

Begin op een RTX 4090 voor modellen tot ongeveer dertig miljard parameters gekwantiseerd, ga naar L40S voor achtenveertig GB geheugen, of neem een H100 NVL wanneer je de bandbreedte nodig hebt. Op de jaarlijkse cyclus landt een 4090 nabij de kosten van twee maanden on-demand-capaciteit elders, wat langdurige fine-tuning-runs überhaupt betaalbaar maakt.

Wat wij zouden implementeren

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
Opslag1 TB
ImageUbuntu Server 24.04 LTS

Sizing

Gewichten plus KV-cache, dan afronden naar een echte kaart. Gewichten zijn parameters keer bytes per parameter: 8B op fp16 is 16 GB, 70B op 4-bit ongeveer 40 GB. KV-cache is het deel dat mensen vergeten — het schaalt met batch maal context. Dus: 8B fp16 op een RTX 4090 (24 GB), 70B gekwantiseerd op een L40S (48 GB), 70B op fp8 met lange context en echte batching op een H100 NVL (94 GB). RTX 4000 Ada past bij embeddings en kleine vision-modellen.

Passthrough, niet vGPU

FUSION geeft het hele PCIe-apparaat aan je VM via IOMMU. De kaart verschijnt in lspci, nvidia-smi rapporteert het direct, en je installeert welke driver en CUDA-versie je stack nodig heeft. Niets is time-sliced met een andere tenant en geen licentieserver zit tussen jou en de hardware. vGPU is de tegenovergestelde regeling: de hypervisor partitioneert de kaart, schedulet slices tussen gasten, en pind je aan de driver-branch die de host draait. Voor inferentie telt dat dubbel — MPS en CUDA-graphs gedragen zich voorspelbaar, en VRAM is echt van jou in plaats van een quota dat een andere gast's allocatie kan onder druk zetten.

Doorvoer is een batching-probleem

Een enkele aanvraag laat het grootste deel van een moderne GPU idol liggen. Decode is geheugenbandbreedte-gebonden, dus tokens per seconde voor één stream wordt bepaald door VRAM-bandbreedte en beweegt nauwelijks met meer rekenkracht. Concurrency is waar het silicium zich terugverdient. Continue batching in vLLM of TensorRT-LLM duwt de totale doorvoer meerdere keren omhoog vergeleken met naïef serveren, ten koste van VRAM voor de groeiende KV-cache. Dat is de echte sizing-spanning: elke gigabyte die je aan gewichten uitgeeft is een gigabyte onbeschikbaar voor concurrency. Een 70B naar 4-bit kwantiseren is vaak sneller in totaal dan fp16, puur omdat het ruimte laat voor batching.

Wat er mis kan gaan

  • Groot op gewichten alleen. KV-cache groeit lineair met batch en context, dus een 8B-model dat in 16 GB laadt zal OOM-en bij 32k context en batch 16. Bereken de cache vóór je de kaart kiest.
  • Aannemen dat consumentenkaarten schalen. De 4090 heeft geen NVLink en peer-to-peer over PCIe is uitgeschakeld, dus tensor-parallel over twee is traag. Gebruik één grotere kaart, niet twee kleinere.
  • fp8 overal verwachten. fp8 vereist Ada of Hopper. Kwantiseren naar fp8 op oudere silicium valt terug op emulatie en draait langzamer dan het fp16-pad dat je verving.

Tweak de machine

  • Opslag en encryptieZFS with hourly snapshots · € 7
  • Adressering en transitUplink upgrade to 10 Gbps · € 19
  • Al het andereSecond-resolution metrics + alerting · € 5