CrestVPS

vps gpu

Inferência e fine-tuning de IA

Uma GPU inteira, passada diretamente, sob um compromisso que faz a matemática funcionar.

O que implantaríamos

€ 287/mês

€ 41030% anual

vGPUs com time-slicing tornam benchmarks sem sentido e deixam a inferência limitada por memória imprevisível. FUSION passa a placa física inteira via PCIe Gen5, então o dispositivo que você vê é o dispositivo que você tem: memória total, clocks totais, acesso direto ao driver, sem scheduler entre seus kernels e o silício.

Por que essa configuração

Comece em uma RTX 4090 para modelos de até cerca de trinta bilhões de parâmetros quantizados, mude para L40S para quarenta e oito gigabytes de memória, ou pegue um H100 NVL quando precisar de largura de banda. No ciclo anual, uma 4090 custa perto do custo de dois meses de capacidade on-demand em outro lugar, que é o que torna execuções longas de fine-tuning acessíveis afinal.

O que implantaríamos

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
Armazenamento1 TB
ImagemUbuntu Server 24.04 LTS

Dimensionamento

Pesos mais cache KV, depois arredonde para uma placa real. Pesos são parâmetros vezes bytes por parâmetro: 8B em fp16 são 16 GB, 70B em 4-bit cerca de 40 GB. O cache KV é a parte que as pessoas esquecem — ele escala com batch vezes contexto. Então: 8B fp16 em uma RTX 4090 (24 GB), 70B quantizado em uma L40S (48 GB), 70B em fp8 com contexto longo e batching real em um H100 NVL (94 GB). RTX 4000 Ada serve para embeddings e modelos de visão pequenos.

Passthrough, não vGPU

FUSION entrega o dispositivo PCIe inteiro para sua VM via IOMMU. A placa aparece em lspci, nvidia-smi reporta diretamente, e você instala qualquer driver e versão CUDA que sua pilha precisar. Nada é time-sliced com outro inquilino e nenhum servidor de licença fica entre você e o hardware. vGPU é o arranjo oposto: o hipervisor particiona a placa, agendando fatias entre convidados, e o prende ao ramo de driver que o host executa. Para inferência isso importa duas vezes — MPS e gráficos CUDA se comportam previsivelmente, e VRAM é genuinamente sua, não uma cota que a alocação de outro convidado pode pressionar.

Throughput é um problema de batching

Uma única request deixa a maior parte de uma GPU moderna ociosa. Decode é limitado por largura de banda de memória, então tokens por segundo para um stream é definido pela largura de banda VRAM e mal se move com mais computação. Concorrência é onde o silício se paga. Batching contínuo em vLLM ou TensorRT-LLM aumenta o throughput agregado várias vezes sobre serviço ingênuo, ao custo de VRAM para o cache KV crescente. Essa é a tensão real de dimensionamento: cada gigabyte gasto em pesos é um gigabyte indisponível para concorrência. Quantizar um 70B para 4-bit é frequentemente mais rápido no agregado que fp16, puramente porque deixa espaço para batch.

O que dá errado

  • Dimensionar apenas pelos pesos. O cache KV cresce linearmente com batch e contexto, então um modelo 8B que carrega em 16 GB vai esgotar em contexto de 32k e batch 16. Calcule o cache antes de escolher a placa.
  • Assumir que placas de consumidor escalam horizontalmente. A 4090 não tem NVLink e peer-to-peer via PCIe é desabilitado, então tensor parallel entre duas é lento. Use uma placa maior, não duas menores.
  • Esperar fp8 em todo lugar. fp8 precisa de Ada ou Hopper. Quantizar para fp8 em silício antigo cai em emulação e roda mais lento que o caminho fp16 que você substituiu.

Ajuste a máquina

  • Armazenamento e criptografiaZFS com snapshots horários · € 7
  • Endereçamento e trânsitoUplink upgrade to 10 Gbps · € 19
  • Tudo maisMétricas com resolução de segundo e alertas · € 5