vps gpu
Inferencia de IA y fine-tuning
Una GPU completa, pasada a través, con un compromiso que hace que las matemáticas cuadren.
Lo que implementaríamos
287 €/mes
410 €−30% anual
Las vGPUs con tiempo compartido hacen que los benchmarks no tengan sentido y que la inferencia limitada por memoria sea impredecible. FUSION pasa toda la tarjeta física a través de PCIe Gen5, así que el dispositivo que ves es el que tienes: memoria completa, relojes completos, acceso directo al driver, sin scheduler entre tus kernels y el silicio.
Por qué esta configuración
Empieza en una RTX 4090 para modelos de hasta unos treinta mil millones de parámetros cuantizados, pasa a una L40S para cuarenta y ocho gigabytes de memoria, o toma una H100 NVL cuando necesites ancho de banda. En el ciclo anual, una 4090 ronda el coste de dos meses de capacidad on-demand en otros sitios, lo que hace que los trabajos de fine-tuning largos sean asequibles.
Lo que implementaríamos
Dimensionamiento
Pesos más caché KV, luego redondea a una tarjeta real. Los pesos son parámetros por bytes por parámetro: 8B en fp16 son 16 GB, 70B en 4 bits unos 40 GB. La caché KV es la parte que la gente olvida: escala con el batch y el contexto. Así: 8B fp16 en una RTX 4090 (24 GB), 70B cuantizado en una L40S (48 GB), 70B en fp8 con contexto largo y batching real en una H100 NVL (94 GB). La RTX 4000 Ada es adecuada para embeddings y modelos de visión pequeños.
Passthrough, no vGPU
FUSION entrega todo el dispositivo PCIe a tu VM a través de IOMMU. La tarjeta aparece en lspci, nvidia-smi la reporta directamente, e instalas el driver y la versión de CUDA que tu stack necesite. Nada está dividido en tiempo con otro inquilino y no hay servidor de licencias entre tú y el hardware. vGPU es todo lo contrario: el hipervisor particiona la tarjeta, programa slices entre los invitados y te ata a la rama del driver que ejecuta el host. Para inferencia eso importa dos veces: MPS y los CUDA graphs se comportan de forma predecible, y la VRAM es genuinamente tuya en lugar de una cuota que la asignación de otro invitado puede presionar.
El throughput es un problema de batching
Una sola petición deja la mayor parte de una GPU moderna inactiva. Decode está limitado por el ancho de banda de memoria, así que los tokens por segundo para un solo stream los fija el ancho de banda de la VRAM y apenas se mueven con más cómputo. La concurrencia es donde el silicio se rentabiliza. El batching continuo en vLLM o TensorRT-LLM multiplica el throughput agregado varias veces por encima del servido naive, a costa de VRAM para la caché KV en crecimiento. Esa es la verdadera tensión del dimensionamiento: cada gigabyte que gastas en pesos es un gigabyte no disponible para concurrencia. Cuantizar un 70B a 4 bits suele ser más rápido en agregado que fp16, solo porque deja espacio para hacer batch.
Qué sale mal
- Dimensionar solo con los pesos. La caché KV crece linealmente con el batch y el contexto, así que un modelo de 8B que ocupa 16 GB hará OOM con contexto 32k y batch 16. Calcula la caché antes de elegir la tarjeta.
- Asumir que las tarjetas de consumo escalan horizontalmente. La 4090 no tiene NVLink y el peer-to-peer sobre PCIe está deshabilitado, así que el tensor parallel entre dos es lento. Usa una tarjeta más grande, no dos más pequeñas.
- Esperar fp8 en todas partes. fp8 necesita Ada o Hopper. Cuantizar a fp8 en silicio antiguo cae en emulación y corre más lento que la ruta fp16 que reemplazaste.
Ajusta la máquina
- Almacenamiento y cifrado — ZFS with hourly snapshots · 7 €
- Direccionamiento y tránsito — Uplink upgrade to 10 Gbps · 19 €
- Todo lo demás — Métricas de resolución de segundos y alertas · 5 €
Más
Diseñado para trabajos específicos
Alojamiento de servidores de juego
El tick rate es un problema de un solo hilo. Todo lo demás es ruido.
VPS para trading y baja latencia
Distancia al motor de emparejamiento, y nada entre tú y el cable.
Extremos privados de VPN y proxy
Tu propia salida, en una jurisdicción elegida a propósito.
Seedboxes y almacenamiento masivo
Terabytes que siguen siendo baratos y un puerto que permanece abierto.
Nodos worker de Kubernetes
Barato por núcleo, denso e idéntico cada vez.
Hosting resellers
Tu marca en el panel, nuestro hardware debajo.