CrestVPS

vps gpu

Inférence IA et fine-tuning

Un GPU entier, transféré, sur un engagement qui rend les calculs rentables.

Ce que nous déploierions

287 €/mois

410 €30% annuel

Les vGPU à tranche de temps rendent les benchmarks dénués de sens et rendent l'inférence liée à la mémoire imprévisible. FUSION transmet la carte physique entière via PCIe Gen5, donc l'appareil que vous voyez est l'appareil que vous avez : mémoire complète, fréquences complètes, accès direct aux pilotes, aucun ordonnanceur entre vos kernels et le silicium.

Pourquoi cette configuration

Commencez sur un RTX 4090 pour des modèles jusqu'à environ trente milliards de paramètres en quantification, passez au L40S pour quarante-huit gigaoctets de mémoire, ou prenez un H100 NVL lorsque vous avez besoin de la bande passante. Sur le cycle annuel, un 4090 se situe près du coût de deux mois de capacité à la demande ailleurs, ce qui rend les longs runs de fine-tuning abordables.

Ce que nous déploierions

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
Stockage1 TB
ImageUbuntu Server 24.04 LTS

Dimensionnement

Poids plus cache KV, puis arrondissez à une carte réelle. Les poids sont les paramètres multipliés par les octets par paramètre : 8B en fp16 fait 16 Go, 70B en 4-bit environ 40 Go. Le cache KV est la partie que les gens oublient — il évolue avec le batch et le contexte. Donc : 8B fp16 sur un RTX 4090 (24 Go), 70B quantifié sur un L40S (48 Go), 70B en fp8 avec un contexte long et un vrai batching sur un H100 NVL (94 Go). Le RTX 4000 Ada convient aux embeddings et aux petits modèles de vision.

Passthrough, pas vGPU

FUSION remet le périphérique PCIe entier à votre VM via IOMMU. La carte apparaît dans lspci, nvidia-smi la rapporte directement, et vous installez le pilote et la version CUDA dont votre pile a besoin. Rien n'est découpé en tranches de temps avec un autre locataire et aucun serveur de licence ne se trouve entre vous et le matériel. vGPU est l'arrangement opposé : l'hyperviseur partitionne la carte, planifie des tranches entre les invités et vous épingle à la branche de pilote que l'hôte exécute. Pour l'inférence, cela compte doublement — MPS et les graphes CUDA se comportent de manière prévisible, et la VRAM est vraiment la vôtre plutôt qu'un quota que l'allocation d'un autre invité peut pressuriser.

Le débit est un problème de batching

Une seule requête laisse la plupart d'un GPU moderne inactif. Le décodage est limité par la bande passante mémoire, donc les tokens par seconde pour un flux sont fixés par la bande passante VRAM et bougent à peine avec plus de calcul. La concurrence est là où le silicium rentabilise. Le batching continu dans vLLM ou TensorRT-LLM pousse le débit agrégé plusieurs fois au-dessus du service naïf, au prix de la VRAM pour le cache KV croissant. C'est la vraie tension de dimensionnement : chaque gigaoctet que vous dépensez en poids est un gigaoctet indisponible pour la concurrence. Quantifier un 70B en 4-bit est souvent plus rapide en agrégat que le fp16, uniquement parce que cela laisse de la place pour le batch.

Ce qui va de travers

  • Dimensionner uniquement sur les poids. Le cache KV croît linéairement avec le batch et le contexte, donc un modèle 8B qui charge en 16 Go fera OOM à 32k de contexte et batch 16. Calculez le cache avant de choisir la carte.
  • Supposer que les cartes grand public passent à l'échelle. Le 4090 n'a pas de NVLink et le peer-to-peer sur PCIe est désactivé, donc le parallélisme tensoriel sur deux d'entre elles est lent. Utilisez une carte plus grande, pas deux plus petites.
  • Attendre fp8 partout. fp8 nécessite Ada ou Hopper. Quantifier en fp8 sur du silicium plus ancien retombe en émulation et fonctionne plus lentement que le chemin fp16 que vous avez remplacé.

Réglez la machine

  • Stockage et chiffrementZFS with hourly snapshots · 7 €
  • Adressage et transitUplink upgrade to 10 Gbps · 19 €
  • Tout le resteMétriques et alertes à résolution seconde · 5 €