gpu vps
AI推理和微调
时间分片的vGPU使基准测试失去意义,并使内存受限的推理变得不可预测。FUSION通过PCIe Gen5将整个物理卡透传,因此你看到的设备就是你所拥有的:完整内存、完整时钟、直接驱动访问,内核和硅片之间没有调度器。
为什么这个配置
从RTX 4090开始,适用于约300亿参数及以下模型(量化后),需要48GB显存时选择L40S,或需要带宽时选择H100 NVL。年度周期中,4090的价格接近其他地方按需容量两个月的成本,这使得长期微调运行变得可负担。
我们会部署什么
规模确定
权重加KV缓存,然后向上取整到真实卡。权重是参数乘以每参数字节数:8B fp16为16 GB,70B 4位约为40 GB。KV缓存是常被忽略的部分——它随批次和上下文扩展。因此:8B fp16用RTX 4090(24 GB),70B量化用L40S(48 GB),70B fp8且长上下文和真实批处理用H100 NVL(94 GB)。RTX 4000 Ada适合嵌入和小型视觉模型。
透传而非vGPU
FUSION通过IOMMU将整个PCIe设备传递给您的虚拟机。该卡出现在lspci中,nvidia-smi直接报告,您可安装所需驱动和CUDA版本。不与其他租户时间分片,也没有许可证服务器位于您和硬件之间。vGPU则相反:虚拟机监控程序对卡进行分区,在宿主机上调度分片,并将您固定到宿主机运行的驱动分支。对于推理,这有两个影响——MPS和CUDA图表现可预测,VRAM真正属于您,而不是其他租户分配可能压力的配额。
吞吐量是批处理问题
单个请求让现代GPU大部分空闲。解码受内存带宽限制,因此单流的每秒令牌数由VRAM带宽决定,增加计算量几乎不会提升。并发才是硅片体现价值之处。vLLM或TensorRT-LLM中的连续批处理将整体吞吐量提升数倍于朴素服务,但代价是增长的KV缓存占用VRAM。这是真正的容量规划紧张:您在权重上花费的每GB都用于并发。将70B量化为4位通常在整体上比fp16更快,仅仅是因为它为批处理留出了空间。
常见问题
- 仅根据权重进行容量规划。KV缓存随批次和上下文线性增长,因此加载时占用16 GB的8B模型在32k上下文和批次16时会OOM。选择卡之前先计算缓存。
- 假设消费级卡可扩展。4090没有NVLink,PCIe点对点也禁用,因此在两张卡上进行张量并行会很慢。使用一张更大的卡,而不是两张较小的。
- 期望所有地方都支持fp8。fp8需要Ada或Hopper。在旧硅片上量化为fp8会回退到模拟,运行速度比所取代的fp16路径更慢。
调整配置
- 存储和加密 — ZFS with hourly snapshots · €7
- 地址和传输 — Uplink upgrade to 10 Gbps · €19
- 其他所有选项 — 秒级指标和告警 · €5