CrestVPS

gpu vps

AI inference ve ince ayar

Tam bir GPU, passthrough ile ve matematiği çalıştıran bir taahhüt.

Biz ne dağıtırdık

€287/ay

€41030% yıllık

Zaman dilimlenmiş vGPU'lar karşılaştırmayı anlamsız kılar ve bellek sınırlı inference'ı öngörülemez yapar. FUSION, PCIe Gen5 üzerinden tüm fiziksel kartı geçirir; böylece gördüğünüz cihaz, sahip olduğunuz cihazdır: tam bellek, tam saat hızları, doğrudan sürücü erişimi, çekirdekleriniz ile silikon arasında zamanlayıcı yoktur.

Neden bu yapılandırma

Kuantize edilmiş yaklaşık otuz milyar parametreye kadar modeller için RTX 4090 ile başlayın, kırk sekiz gigabayt bellek için L40S'e geçin veya bant genişliğine ihtiyacınız olduğunda H100 NVL alın. Yıllık döngüde bir 4090, başka yerdeki isteğe bağlı kapasitenin iki aylık maliyetine yakın bir yere gelir; bu da uzun ince ayar çalışmalarını uygun fiyatlı yapan şeydir.

Biz ne dağıtırdık

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
Depolama1 TB
İmajUbuntu Server 24.04 LTS

Boyutlandırma

Ağırlıklar artı KV önbelleği, sonra gerçek bir karta yuvarlayın. Ağırlıklar, parametreler çarpı parametre başına bayttır: fp16'da 8B 16 GB, 4-bit'te 70B yaklaşık 40 GB. KV önbelleği insanların unuttuğu kısımdır — toplu işlem çarpı bağlam ile ölçeklenir. Yani: RTX 4090'da (24 GB) fp16 8B, L40S'te (48 GB) kuantize 70B, uzun bağlam ve gerçek toplu işleme ile fp8'de 70B, H100 NVL'de (94 GB). RTX 4000 Ada, gömmeler ve küçük görüntü modelleri için uygundur.

Passthrough, vGPU değil

FUSION, tüm PCIe cihazını IOMMU aracılığıyla VM'inize devreder. Kart lspci'de görünür, nvidia-smi doğrudan raporlar ve yığınınızın ihtiyaç duyduğu sürücüyü ve CUDA sürümünü istediğinizi yüklersiniz. Hiçbir şey başka bir kiracıyla zaman dilimlenmez ve donanım ile sizin aranızda lisans sunucusu yoktur. vGPU tam tersi bir düzenlemedir: hipervizör kartı böler, dilimleri konuklar arasında zamanlar ve sizi ana bilgisayarın çalıştırdığı sürücü dalına sabitler. Inference için bu iki kat önemlidir — MPS ve CUDA grafikleri öngörülebilir davranır ve VRAM, başka bir misafirin ayırmasının baskılayabileceği bir kota değil, gerçekten sizindir.

Verim bir toplu işlem sorunudur

Tek bir istek, modern bir GPU'nun çoğunu boşta bırakır. Kod çözme bellek bant genişliğine bağlıdır, bu nedenle tek bir akış için saniyedeki token sayısı VRAM bant genişliğiyle belirlenir ve hesaplamayla pek değişmez. Eşzamanlılık silikonun getirisini sağladığı yerdir. vLLM veya TensorRT-LLM'de sürekli toplu işleme, saf sunuma göre toplam verimi birkaç kat artırır; bu, büyüyen KV önbelleği için VRAM pahasına olur. Gerçek boyutlandırma gerilimi budur: ağırlıklara harcadığınız her gigabayt, eşzamanlılık için kullanılamaz. Bir 70B'yi 4-bit'e kuantize etmek, yalnızca toplu işlemeye yer bıraktığı için genellikle toplamda fp16'dan daha hızlıdır.

Ne gibi sorunlar çıkar

  • Yalnızca ağırlıklara göre boyutlandırmak. KV önbelleği toplu işlem ve bağlamla doğrusal olarak büyür, bu nedenle 16 GB'ta yüklenen bir 8B model, 32k bağlam ve 16 toplu işlemde OOM alır. Kartı seçmeden önce önbelleği hesaplayın.
  • Tüketici kartlarının ölçeklendiğini varsaymak. 4090'da NVLink yoktur ve PCIe üzerinden peer-to-peer devre dışıdır, bu nedenle ikisi arasında tensör paralelliği yavaştır. İki küçük kart yerine bir büyük kart kullanın.
  • Her yerde fp8 beklemek. fp8, Ada veya Hopper gerektirir. Eski silikonda fp8'e kuantizasyon emülasyona düşer ve değiştirdiğiniz fp16 yolundan daha yavaş çalışır.

Makineyi ayarlayın

  • Depolama ve şifrelemeZFS with hourly snapshots · €7
  • Adresleme ve transitYukarı bağlantı 10 Gbps'ye yükseltildi · €19
  • Diğer her şeySecond-resolution metrics + alerting · €5