vps gpu
Inférence IA et fine-tuning
Un GPU entier, transféré, sur un engagement qui rend les calculs rentables.
Ce que nous déploierions
287 €/mois
410 €−30% annuel
Les vGPU à tranche de temps rendent les benchmarks dénués de sens et rendent l'inférence liée à la mémoire imprévisible. FUSION transmet la carte physique entière via PCIe Gen5, donc l'appareil que vous voyez est l'appareil que vous avez : mémoire complète, fréquences complètes, accès direct aux pilotes, aucun ordonnanceur entre vos kernels et le silicium.
Pourquoi cette configuration
Commencez sur un RTX 4090 pour des modèles jusqu'à environ trente milliards de paramètres en quantification, passez au L40S pour quarante-huit gigaoctets de mémoire, ou prenez un H100 NVL lorsque vous avez besoin de la bande passante. Sur le cycle annuel, un 4090 se situe près du coût de deux mois de capacité à la demande ailleurs, ce qui rend les longs runs de fine-tuning abordables.
Ce que nous déploierions
Dimensionnement
Poids plus cache KV, puis arrondissez à une carte réelle. Les poids sont les paramètres multipliés par les octets par paramètre : 8B en fp16 fait 16 Go, 70B en 4-bit environ 40 Go. Le cache KV est la partie que les gens oublient — il évolue avec le batch et le contexte. Donc : 8B fp16 sur un RTX 4090 (24 Go), 70B quantifié sur un L40S (48 Go), 70B en fp8 avec un contexte long et un vrai batching sur un H100 NVL (94 Go). Le RTX 4000 Ada convient aux embeddings et aux petits modèles de vision.
Passthrough, pas vGPU
FUSION remet le périphérique PCIe entier à votre VM via IOMMU. La carte apparaît dans lspci, nvidia-smi la rapporte directement, et vous installez le pilote et la version CUDA dont votre pile a besoin. Rien n'est découpé en tranches de temps avec un autre locataire et aucun serveur de licence ne se trouve entre vous et le matériel. vGPU est l'arrangement opposé : l'hyperviseur partitionne la carte, planifie des tranches entre les invités et vous épingle à la branche de pilote que l'hôte exécute. Pour l'inférence, cela compte doublement — MPS et les graphes CUDA se comportent de manière prévisible, et la VRAM est vraiment la vôtre plutôt qu'un quota que l'allocation d'un autre invité peut pressuriser.
Le débit est un problème de batching
Une seule requête laisse la plupart d'un GPU moderne inactif. Le décodage est limité par la bande passante mémoire, donc les tokens par seconde pour un flux sont fixés par la bande passante VRAM et bougent à peine avec plus de calcul. La concurrence est là où le silicium rentabilise. Le batching continu dans vLLM ou TensorRT-LLM pousse le débit agrégé plusieurs fois au-dessus du service naïf, au prix de la VRAM pour le cache KV croissant. C'est la vraie tension de dimensionnement : chaque gigaoctet que vous dépensez en poids est un gigaoctet indisponible pour la concurrence. Quantifier un 70B en 4-bit est souvent plus rapide en agrégat que le fp16, uniquement parce que cela laisse de la place pour le batch.
Ce qui va de travers
- Dimensionner uniquement sur les poids. Le cache KV croît linéairement avec le batch et le contexte, donc un modèle 8B qui charge en 16 Go fera OOM à 32k de contexte et batch 16. Calculez le cache avant de choisir la carte.
- Supposer que les cartes grand public passent à l'échelle. Le 4090 n'a pas de NVLink et le peer-to-peer sur PCIe est désactivé, donc le parallélisme tensoriel sur deux d'entre elles est lent. Utilisez une carte plus grande, pas deux plus petites.
- Attendre fp8 partout. fp8 nécessite Ada ou Hopper. Quantifier en fp8 sur du silicium plus ancien retombe en émulation et fonctionne plus lentement que le chemin fp16 que vous avez remplacé.
Réglez la machine
- Stockage et chiffrement — ZFS with hourly snapshots · 7 €
- Adressage et transit — Uplink upgrade to 10 Gbps · 19 €
- Tout le reste — Métriques et alertes à résolution seconde · 5 €
Plus
Conçu pour des tâches spécifiques
Hébergement de serveurs de jeux
Le tick rate est un problème mono-thread. Tout le reste est du bruit.
VPS de trading et basse latence
Distance au moteur de correspondance, et rien entre vous et la ligne.
Endpoints VPN et proxy privé
Votre propre sortie, dans une juridiction choisie délibérément.
Seedboxes et stockage volumineux
Des téraoctets qui restent bon marché et un port qui reste ouvert.
Nœuds workers Kubernetes
Pas cher par cœur, dense, et identique à chaque fois.
Revendeurs d'hébergement
Votre marque sur le panneau, notre matériel en dessous.