CrestVPS

vps gpu

Inferencia de IA y fine-tuning

Una GPU completa, pasada a través, con un compromiso que hace que las matemáticas cuadren.

Lo que implementaríamos

287 €/mes

410 €30% anual

Las vGPUs con tiempo compartido hacen que los benchmarks no tengan sentido y que la inferencia limitada por memoria sea impredecible. FUSION pasa toda la tarjeta física a través de PCIe Gen5, así que el dispositivo que ves es el que tienes: memoria completa, relojes completos, acceso directo al driver, sin scheduler entre tus kernels y el silicio.

Por qué esta configuración

Empieza en una RTX 4090 para modelos de hasta unos treinta mil millones de parámetros cuantizados, pasa a una L40S para cuarenta y ocho gigabytes de memoria, o toma una H100 NVL cuando necesites ancho de banda. En el ciclo anual, una 4090 ronda el coste de dos meses de capacidad on-demand en otros sitios, lo que hace que los trabajos de fine-tuning largos sean asequibles.

Lo que implementaríamos

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
Almacenamiento1 TB
ImagenUbuntu Server 24.04 LTS

Dimensionamiento

Pesos más caché KV, luego redondea a una tarjeta real. Los pesos son parámetros por bytes por parámetro: 8B en fp16 son 16 GB, 70B en 4 bits unos 40 GB. La caché KV es la parte que la gente olvida: escala con el batch y el contexto. Así: 8B fp16 en una RTX 4090 (24 GB), 70B cuantizado en una L40S (48 GB), 70B en fp8 con contexto largo y batching real en una H100 NVL (94 GB). La RTX 4000 Ada es adecuada para embeddings y modelos de visión pequeños.

Passthrough, no vGPU

FUSION entrega todo el dispositivo PCIe a tu VM a través de IOMMU. La tarjeta aparece en lspci, nvidia-smi la reporta directamente, e instalas el driver y la versión de CUDA que tu stack necesite. Nada está dividido en tiempo con otro inquilino y no hay servidor de licencias entre tú y el hardware. vGPU es todo lo contrario: el hipervisor particiona la tarjeta, programa slices entre los invitados y te ata a la rama del driver que ejecuta el host. Para inferencia eso importa dos veces: MPS y los CUDA graphs se comportan de forma predecible, y la VRAM es genuinamente tuya en lugar de una cuota que la asignación de otro invitado puede presionar.

El throughput es un problema de batching

Una sola petición deja la mayor parte de una GPU moderna inactiva. Decode está limitado por el ancho de banda de memoria, así que los tokens por segundo para un solo stream los fija el ancho de banda de la VRAM y apenas se mueven con más cómputo. La concurrencia es donde el silicio se rentabiliza. El batching continuo en vLLM o TensorRT-LLM multiplica el throughput agregado varias veces por encima del servido naive, a costa de VRAM para la caché KV en crecimiento. Esa es la verdadera tensión del dimensionamiento: cada gigabyte que gastas en pesos es un gigabyte no disponible para concurrencia. Cuantizar un 70B a 4 bits suele ser más rápido en agregado que fp16, solo porque deja espacio para hacer batch.

Qué sale mal

  • Dimensionar solo con los pesos. La caché KV crece linealmente con el batch y el contexto, así que un modelo de 8B que ocupa 16 GB hará OOM con contexto 32k y batch 16. Calcula la caché antes de elegir la tarjeta.
  • Asumir que las tarjetas de consumo escalan horizontalmente. La 4090 no tiene NVLink y el peer-to-peer sobre PCIe está deshabilitado, así que el tensor parallel entre dos es lento. Usa una tarjeta más grande, no dos más pequeñas.
  • Esperar fp8 en todas partes. fp8 necesita Ada o Hopper. Cuantizar a fp8 en silicio antiguo cae en emulación y corre más lento que la ruta fp16 que reemplazaste.

Ajusta la máquina

  • Almacenamiento y cifradoZFS with hourly snapshots · 7 €
  • Direccionamiento y tránsitoUplink upgrade to 10 Gbps · 19 €
  • Todo lo demásMétricas de resolución de segundos y alertas · 5 €