CrestVPS

vps gpu

Inferenza AI e fine-tuning

Una GPU intera, passata attraverso, su un impegno che fa funzionare la matematica.

Cosa implementeremmo

287 €/mese

410 €30% annuale

Le vGPU time-sliced rendono i benchmark privi di significato e rendono l'inferenza memory-bound imprevedibile. FUSION passa l'intera scheda fisica attraverso PCIe Gen5, quindi il dispositivo che vedi è il dispositivo che hai: memoria completa, clock completi, accesso diretto al driver, nessuno scheduler tra i tuoi kernel e il silicio.

Perché questa configurazione

Inizia su una RTX 4090 per modelli fino a circa trenta miliardi di parametri quantizzati, passa a L40S per quarantotto gigabyte di memoria, o prendi una H100 NVL quando ti serve la bandwidth. Sul ciclo annuale una 4090 si attesta vicino al costo di due mesi di capacità on-demand altrove, ed è ciò che rende le lunghe sessioni di fine-tuning abbordabili del tutto.

Cosa implementeremmo

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
Storage1 TB
ImmagineUbuntu Server 24.04 LTS

Dimensionamento

Pesi più cache KV, poi arrotonda a una scheda reale. I pesi sono parametri per byte per parametro: 8B in fp16 sono 16 GB, 70B in 4-bit circa 40 GB. La cache KV è la parte che la gente dimentica — scala con batch per contesto. Quindi: 8B fp16 su una RTX 4090 (24 GB), 70B quantizzato su una L40S (48 GB), 70B in fp8 con contesto lungo e batching reale su una H100 NVL (94 GB). RTX 4000 Ada è adatta per embedding e modelli vision piccoli.

Passthrough, non vGPU

FUSION passa l'intero dispositivo PCIe alla tua VM tramite IOMMU. La scheda appare in lspci, nvidia-smi la riporta direttamente, e installi il driver e la versione CUDA che il tuo stack richiede. Nulla è time-sliced con un altro tenant e nessun server di licenza si frappone tra te e l'hardware. La vGPU è la disposizione opposta: l'hypervisor partiziona la scheda, programma le slice tra gli ospiti, e ti vincola al branch di driver che l'host esegue. Per l'inferenza questo conta due volte: MPS e CUDA graphs si comportano in modo prevedibile, e la VRAM è davvero tua, piuttosto che una quota che l'allocazione di un altro guest può mettere sotto pressione.

Il throughput è un problema di batching

Una singola richiesta lascia inattiva la maggior parte di una GPU moderna. Il decode è limitato dalla bandwidth di memoria, quindi i token al secondo per un singolo stream sono determinati dalla bandwidth della VRAM e si muovono a malapena con più potenza di calcolo. La concorrenza è dove il silicio ripaga. Il batching continuo in vLLM o TensorRT-LLM spinge il throughput aggregato diverse volte sopra il serving ingenuo, al costo di VRAM per la crescente cache KV. Questa è la vera tensione di dimensionamento: ogni gigabyte che spendi in pesi è un gigabyte non disponibile per la concorrenza. Quantizzare un 70B a 4-bit è spesso più veloce in aggregato di fp16, solo perché lascia spazio per il batching.

Cosa va storto

  • Dimensionare solo sui pesi. La cache KV cresce linearmente con batch e contesto, quindi un modello 8B che carica in 16 GB andrà in OOM a 32k di contesto e batch 16. Calcola la cache prima di scegliere la scheda.
  • Assumere che le schede consumer scalino in parallelo. La 4090 non ha NVLink e il peer-to-peer su PCIe è disabilitato, quindi il tensor parallel su due di esse è lento. Usa una scheda più grande, non due più piccole.
  • Aspettarsi fp8 ovunque. fp8 richiede Ada o Hopper. Quantizzare in fp8 su silicio vecchio ricade nell'emulazione e gira più lento del percorso fp16 che hai sostituito.

Configura la macchina

  • Storage e crittografiaZFS with hourly snapshots · 7 €
  • Indirizzi e transitoUplink upgrade to 10 Gbps · 19 €
  • Tutto il restoSecond-resolution metrics + alerting · 5 €