CrestVPS

gpu vps

استدلال الذكاء الاصطناعي والضبط الدقيق

GPU كاملة، تم تمريرها، على التزام يجعل الحسابات تعمل.

ما سننشره

‏287 €/شهريًا

‏410 €30% سنوي

وحدات vGPU المشطورة الوقت تجعل قياس الأداء بلا معنى وتجعل الاستدلال المرتبط بالذاكرة غير قابل للتنبؤ. FUSION يمرر البطاقة المادية بأكملها عبر PCIe Gen5، لذا فإن الجهاز الذي تراه هو الجهاز الذي تملكه: ذاكرة كاملة، وسرعات كاملة، ووصول مباشر للسائق، دون جدولة بين نواك والسيليكون.

لماذا هذا التكوين

ابدأ على RTX 4090 لنماذج حتى حوالي ثلاثين مليار معلمة مكمّمة، وانتقل إلى L40S للحصول على ثمانية وأربعين جيجابايت من الذاكرة، أو خذ H100 NVL عندما تحتاج إلى النطاق الترددي. في الدورة السنوية، تقترب 4090 من تكلفة شهرين من السعة عند الطلب في مكان آخر، وهذا ما يجعل عمليات الضبط الدقيق الطويلة ميسورة التكلفة على الإطلاق.

ما سننشره

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
التخزين1 TB
الصورةUbuntu Server 24.04 LTS

الحجم

الأوزان بالإضافة إلى ذاكرة التخزين المؤقت KV، ثم قرّب إلى بطاقة حقيقية. الأوزان هي المعلمات مضروبة في بايت لكل معلمة: 8B في fp16 هو 16 جيجابايت، 70B في 4-bit حوالي 40 جيجابايت. ذاكرة التخزين المؤقت KV هي الجزء الذي ينساه الناس — إنها تتوسع مع حجم الدفعة مضروبًا في السياق. لذا: 8B fp16 على RTX 4090 (24 جيجابايت)، 70B مكمّم على L40S (48 جيجابايت)، 70B في fp8 مع سياق طويل وتجميع حقيقي على H100 NVL (94 جيجابايت). RTX 4000 Ada مناسب للتضمينات ونماذج الرؤية الصغيرة.

التمرير، وليس vGPU

يسلم FUSION جهاز PCIe بأكمله إلى جهازك الافتراضي عبر IOMMU. تظهر البطاقة في lspci، وتقارير nvidia-smi مباشرة، وتثبت أي سائق وإصدار CUDA يحتاجه مكدسك. لا شيء مشطور الوقت مع مستأجر آخر ولا خادم ترخيص بينك وبين العتاد. vGPU هو الترتيب المعاكس: الهايبرفايزر يقسم البطاقة، ويجدول الشرائح بين الضيوف، ويقيدك بفرع السائق الذي يعمل عليه المضيف. للاستدلال هذا يهم مرتين — MPS ورسوم CUDA يتصرفان بشكل يمكن التنبؤ به، وذاكرة VRAM ملكك حقًا وليست حصة يمكن أن يضغط عليها تخصيص ضيف آخر.

الإنتاجية هي مشكلة تجميع

طلب واحد يترك معظم GPU حديث خاملاً. فك الترميز مقيد بعرض النطاق الترددي للذاكرة، لذا الرموز في الثانية لدفق واحد يحددها عرض النطاق الترددي لـ VRAM وبالكاد يتحرك مع المزيد من الحوسبة. التزامن هو حيث يكسب السيليكون قيمته. التجميع المستمر في vLLM أو TensorRT-LLM يدفع الإنتاجية الإجمالية عدة مرات فوق الخدمة الساذجة، على حساب VRAM لذاكرة التخزين المؤقت KV المتنامية. هذا هو توتر القياس الحقيقي: كل جيجابايت تنفقه على الأوزان هو جيجابايت غير متاح للتزامن. تكميم 70B إلى 4-bit غالبًا ما يكون أسرع في الإجمالي من fp16، فقط لأنه يترك مجالًا للتجميع.

ما الذي يحدث بشكل خاطئ

  • القياس على الأوزان فقط. ذاكرة التخزين المؤقت KV تنمو خطيًا مع حجم الدفعة والسياق، لذا نموذج 8B يُحمَّل في 16 جيجابايت سينفد ذاكرته عند سياق 32k ودفعة 16. احسب ذاكرة التخزين المؤقت قبل اختيار البطاقة.
  • افتراض أن بطاقات المستهلك تتوسع. 4090 ليس لديها NVLink والنظير إلى النظير عبر PCIe معطل، لذا التوازي الموتر عبر اثنتين منها بطيء. استخدم بطاقة واحدة أكبر، وليس بطاقتين أصغر.
  • توقع fp8 في كل مكان. fp8 يتطلب Ada أو Hopper. التكميم إلى fp8 على السيليكون الأقدم يتراجع إلى المحاكاة ويعمل أبطأ من مسار fp16 الذي استبدلته.

اضبط الجهاز

  • التخزين والتشفيرZFS with hourly snapshots · ‏7 €
  • العنونة والعبورUplink upgrade to 10 Gbps · ‏19 €
  • كل شيء آخرSecond-resolution metrics + alerting · ‏5 €