vps gpu
Inferência e fine-tuning de IA
Uma GPU inteira, passada diretamente, sob um compromisso que faz a matemática funcionar.
O que implantaríamos
€ 287/mês
€ 410−30% anual
vGPUs com time-slicing tornam benchmarks sem sentido e deixam a inferência limitada por memória imprevisível. FUSION passa a placa física inteira via PCIe Gen5, então o dispositivo que você vê é o dispositivo que você tem: memória total, clocks totais, acesso direto ao driver, sem scheduler entre seus kernels e o silício.
Por que essa configuração
Comece em uma RTX 4090 para modelos de até cerca de trinta bilhões de parâmetros quantizados, mude para L40S para quarenta e oito gigabytes de memória, ou pegue um H100 NVL quando precisar de largura de banda. No ciclo anual, uma 4090 custa perto do custo de dois meses de capacidade on-demand em outro lugar, que é o que torna execuções longas de fine-tuning acessíveis afinal.
O que implantaríamos
Dimensionamento
Pesos mais cache KV, depois arredonde para uma placa real. Pesos são parâmetros vezes bytes por parâmetro: 8B em fp16 são 16 GB, 70B em 4-bit cerca de 40 GB. O cache KV é a parte que as pessoas esquecem — ele escala com batch vezes contexto. Então: 8B fp16 em uma RTX 4090 (24 GB), 70B quantizado em uma L40S (48 GB), 70B em fp8 com contexto longo e batching real em um H100 NVL (94 GB). RTX 4000 Ada serve para embeddings e modelos de visão pequenos.
Passthrough, não vGPU
FUSION entrega o dispositivo PCIe inteiro para sua VM via IOMMU. A placa aparece em lspci, nvidia-smi reporta diretamente, e você instala qualquer driver e versão CUDA que sua pilha precisar. Nada é time-sliced com outro inquilino e nenhum servidor de licença fica entre você e o hardware. vGPU é o arranjo oposto: o hipervisor particiona a placa, agendando fatias entre convidados, e o prende ao ramo de driver que o host executa. Para inferência isso importa duas vezes — MPS e gráficos CUDA se comportam previsivelmente, e VRAM é genuinamente sua, não uma cota que a alocação de outro convidado pode pressionar.
Throughput é um problema de batching
Uma única request deixa a maior parte de uma GPU moderna ociosa. Decode é limitado por largura de banda de memória, então tokens por segundo para um stream é definido pela largura de banda VRAM e mal se move com mais computação. Concorrência é onde o silício se paga. Batching contínuo em vLLM ou TensorRT-LLM aumenta o throughput agregado várias vezes sobre serviço ingênuo, ao custo de VRAM para o cache KV crescente. Essa é a tensão real de dimensionamento: cada gigabyte gasto em pesos é um gigabyte indisponível para concorrência. Quantizar um 70B para 4-bit é frequentemente mais rápido no agregado que fp16, puramente porque deixa espaço para batch.
O que dá errado
- Dimensionar apenas pelos pesos. O cache KV cresce linearmente com batch e contexto, então um modelo 8B que carrega em 16 GB vai esgotar em contexto de 32k e batch 16. Calcule o cache antes de escolher a placa.
- Assumir que placas de consumidor escalam horizontalmente. A 4090 não tem NVLink e peer-to-peer via PCIe é desabilitado, então tensor parallel entre duas é lento. Use uma placa maior, não duas menores.
- Esperar fp8 em todo lugar. fp8 precisa de Ada ou Hopper. Quantizar para fp8 em silício antigo cai em emulação e roda mais lento que o caminho fp16 que você substituiu.
Ajuste a máquina
- Armazenamento e criptografia — ZFS com snapshots horários · € 7
- Endereçamento e trânsito — Uplink upgrade to 10 Gbps · € 19
- Tudo mais — Métricas com resolução de segundo e alertas · € 5
Mais
Feito para trabalhos específicos
Hospedagem de servidor de jogos
Tick rate é um problema de thread única. Todo o resto é ruído.
VPS para trading e baixa latência
Distância até o mecanismo de matching, e nada entre você e o wire.
Endpoints privados de VPN e proxy
Sua própria saída, em uma jurisdição que você escolheu de propósito.
Seedboxes e armazenamento em massa
Terabytes que continuam baratos e uma porta que permanece aberta.
Nós workers Kubernetes
Barato por núcleo, denso e idêntico toda vez.
Revendedores de hospedagem
Sua marca no painel, nosso hardware por baixo.