vps gpu
Inferenza AI e fine-tuning
Una GPU intera, passata attraverso, su un impegno che fa funzionare la matematica.
Cosa implementeremmo
287 €/mese
410 €−30% annuale
Le vGPU time-sliced rendono i benchmark privi di significato e rendono l'inferenza memory-bound imprevedibile. FUSION passa l'intera scheda fisica attraverso PCIe Gen5, quindi il dispositivo che vedi è il dispositivo che hai: memoria completa, clock completi, accesso diretto al driver, nessuno scheduler tra i tuoi kernel e il silicio.
Perché questa configurazione
Inizia su una RTX 4090 per modelli fino a circa trenta miliardi di parametri quantizzati, passa a L40S per quarantotto gigabyte di memoria, o prendi una H100 NVL quando ti serve la bandwidth. Sul ciclo annuale una 4090 si attesta vicino al costo di due mesi di capacità on-demand altrove, ed è ciò che rende le lunghe sessioni di fine-tuning abbordabili del tutto.
Cosa implementeremmo
Dimensionamento
Pesi più cache KV, poi arrotonda a una scheda reale. I pesi sono parametri per byte per parametro: 8B in fp16 sono 16 GB, 70B in 4-bit circa 40 GB. La cache KV è la parte che la gente dimentica — scala con batch per contesto. Quindi: 8B fp16 su una RTX 4090 (24 GB), 70B quantizzato su una L40S (48 GB), 70B in fp8 con contesto lungo e batching reale su una H100 NVL (94 GB). RTX 4000 Ada è adatta per embedding e modelli vision piccoli.
Passthrough, non vGPU
FUSION passa l'intero dispositivo PCIe alla tua VM tramite IOMMU. La scheda appare in lspci, nvidia-smi la riporta direttamente, e installi il driver e la versione CUDA che il tuo stack richiede. Nulla è time-sliced con un altro tenant e nessun server di licenza si frappone tra te e l'hardware. La vGPU è la disposizione opposta: l'hypervisor partiziona la scheda, programma le slice tra gli ospiti, e ti vincola al branch di driver che l'host esegue. Per l'inferenza questo conta due volte: MPS e CUDA graphs si comportano in modo prevedibile, e la VRAM è davvero tua, piuttosto che una quota che l'allocazione di un altro guest può mettere sotto pressione.
Il throughput è un problema di batching
Una singola richiesta lascia inattiva la maggior parte di una GPU moderna. Il decode è limitato dalla bandwidth di memoria, quindi i token al secondo per un singolo stream sono determinati dalla bandwidth della VRAM e si muovono a malapena con più potenza di calcolo. La concorrenza è dove il silicio ripaga. Il batching continuo in vLLM o TensorRT-LLM spinge il throughput aggregato diverse volte sopra il serving ingenuo, al costo di VRAM per la crescente cache KV. Questa è la vera tensione di dimensionamento: ogni gigabyte che spendi in pesi è un gigabyte non disponibile per la concorrenza. Quantizzare un 70B a 4-bit è spesso più veloce in aggregato di fp16, solo perché lascia spazio per il batching.
Cosa va storto
- Dimensionare solo sui pesi. La cache KV cresce linearmente con batch e contesto, quindi un modello 8B che carica in 16 GB andrà in OOM a 32k di contesto e batch 16. Calcola la cache prima di scegliere la scheda.
- Assumere che le schede consumer scalino in parallelo. La 4090 non ha NVLink e il peer-to-peer su PCIe è disabilitato, quindi il tensor parallel su due di esse è lento. Usa una scheda più grande, non due più piccole.
- Aspettarsi fp8 ovunque. fp8 richiede Ada o Hopper. Quantizzare in fp8 su silicio vecchio ricade nell'emulazione e gira più lento del percorso fp16 che hai sostituito.
Configura la macchina
- Storage e crittografia — ZFS with hourly snapshots · 7 €
- Indirizzi e transito — Uplink upgrade to 10 Gbps · 19 €
- Tutto il resto — Second-resolution metrics + alerting · 5 €
Altro
Progettate per lavori specifici
Hosting per server di gioco
Il tick rate è un problema single-thread. Tutto il resto è rumore.
VPS per trading e bassa latenza
Distanza dal matching engine, e niente tra te e il wire.
Endpoint VPN e proxy privati
La tua uscita, in una giurisdizione scelta apposta.
Seedbox e storage bulk
Terabyte che restano economici e una porta che resta aperta.
Nodi worker Kubernetes
Economico per core, denso, e identico ogni volta.
Rivenditori hosting
Il tuo marchio sul pannello, il nostro hardware sotto.