gpu vps
AI inference ve ince ayar
Tam bir GPU, passthrough ile ve matematiği çalıştıran bir taahhüt.
Biz ne dağıtırdık
€287/ay
€410−30% yıllık
Zaman dilimlenmiş vGPU'lar karşılaştırmayı anlamsız kılar ve bellek sınırlı inference'ı öngörülemez yapar. FUSION, PCIe Gen5 üzerinden tüm fiziksel kartı geçirir; böylece gördüğünüz cihaz, sahip olduğunuz cihazdır: tam bellek, tam saat hızları, doğrudan sürücü erişimi, çekirdekleriniz ile silikon arasında zamanlayıcı yoktur.
Neden bu yapılandırma
Kuantize edilmiş yaklaşık otuz milyar parametreye kadar modeller için RTX 4090 ile başlayın, kırk sekiz gigabayt bellek için L40S'e geçin veya bant genişliğine ihtiyacınız olduğunda H100 NVL alın. Yıllık döngüde bir 4090, başka yerdeki isteğe bağlı kapasitenin iki aylık maliyetine yakın bir yere gelir; bu da uzun ince ayar çalışmalarını uygun fiyatlı yapan şeydir.
Biz ne dağıtırdık
Boyutlandırma
Ağırlıklar artı KV önbelleği, sonra gerçek bir karta yuvarlayın. Ağırlıklar, parametreler çarpı parametre başına bayttır: fp16'da 8B 16 GB, 4-bit'te 70B yaklaşık 40 GB. KV önbelleği insanların unuttuğu kısımdır — toplu işlem çarpı bağlam ile ölçeklenir. Yani: RTX 4090'da (24 GB) fp16 8B, L40S'te (48 GB) kuantize 70B, uzun bağlam ve gerçek toplu işleme ile fp8'de 70B, H100 NVL'de (94 GB). RTX 4000 Ada, gömmeler ve küçük görüntü modelleri için uygundur.
Passthrough, vGPU değil
FUSION, tüm PCIe cihazını IOMMU aracılığıyla VM'inize devreder. Kart lspci'de görünür, nvidia-smi doğrudan raporlar ve yığınınızın ihtiyaç duyduğu sürücüyü ve CUDA sürümünü istediğinizi yüklersiniz. Hiçbir şey başka bir kiracıyla zaman dilimlenmez ve donanım ile sizin aranızda lisans sunucusu yoktur. vGPU tam tersi bir düzenlemedir: hipervizör kartı böler, dilimleri konuklar arasında zamanlar ve sizi ana bilgisayarın çalıştırdığı sürücü dalına sabitler. Inference için bu iki kat önemlidir — MPS ve CUDA grafikleri öngörülebilir davranır ve VRAM, başka bir misafirin ayırmasının baskılayabileceği bir kota değil, gerçekten sizindir.
Verim bir toplu işlem sorunudur
Tek bir istek, modern bir GPU'nun çoğunu boşta bırakır. Kod çözme bellek bant genişliğine bağlıdır, bu nedenle tek bir akış için saniyedeki token sayısı VRAM bant genişliğiyle belirlenir ve hesaplamayla pek değişmez. Eşzamanlılık silikonun getirisini sağladığı yerdir. vLLM veya TensorRT-LLM'de sürekli toplu işleme, saf sunuma göre toplam verimi birkaç kat artırır; bu, büyüyen KV önbelleği için VRAM pahasına olur. Gerçek boyutlandırma gerilimi budur: ağırlıklara harcadığınız her gigabayt, eşzamanlılık için kullanılamaz. Bir 70B'yi 4-bit'e kuantize etmek, yalnızca toplu işlemeye yer bıraktığı için genellikle toplamda fp16'dan daha hızlıdır.
Ne gibi sorunlar çıkar
- Yalnızca ağırlıklara göre boyutlandırmak. KV önbelleği toplu işlem ve bağlamla doğrusal olarak büyür, bu nedenle 16 GB'ta yüklenen bir 8B model, 32k bağlam ve 16 toplu işlemde OOM alır. Kartı seçmeden önce önbelleği hesaplayın.
- Tüketici kartlarının ölçeklendiğini varsaymak. 4090'da NVLink yoktur ve PCIe üzerinden peer-to-peer devre dışıdır, bu nedenle ikisi arasında tensör paralelliği yavaştır. İki küçük kart yerine bir büyük kart kullanın.
- Her yerde fp8 beklemek. fp8, Ada veya Hopper gerektirir. Eski silikonda fp8'e kuantizasyon emülasyona düşer ve değiştirdiğiniz fp16 yolundan daha yavaş çalışır.
Makineyi ayarlayın
- Depolama ve şifreleme — ZFS with hourly snapshots · €7
- Adresleme ve transit — Yukarı bağlantı 10 Gbps'ye yükseltildi · €19
- Diğer her şey — Second-resolution metrics + alerting · €5
Daha fazla
Belirli işler için üretildi
Oyun sunucusu barındırma
Tick rate tek iş parçacıklı bir sorundur. Gerisi gürültüdür.
Trading ve düşük gecikmeli VPS
Eşleştirme motoruna mesafe ve sizinle kablo arasında hiçbir şey.
Özel VPN ve proxy uç noktaları
Kendi çıkışın, bilerek seçtiğin bir yetki alanında.
Seedbox'lar ve toplu depolama
Ucuz kalan terabaytlar ve açık kalan bir port.
Kubernetes worker node'ları
Çekirdek başına ucuz, yoğun ve her seferinde aynı.
Bayi hosting
Panelde sizin markanız, altta bizim donanımımız.