gpu vps
AI推論とファインチューニング
タイムスライスされたvGPUはベンチマークを無意味にし、メモリバウンドの推論を予測不能にします。FUSIONはPCIe Gen5を介して物理カード全体をパススルーするため、表示されるデバイスが手元のデバイスです。フルメモリ、フルクロック、直接のドライバーアクセス、カーネルとシリコンの間にスケジューラーはありません。
この構成の理由
最大約300億パラメータの量子化モデルにはRTX 4090から始め、48 GBのメモリが必要ならL40Sへ、帯域幅が必要ならH100 NVLを使用します。年間サイクルでは、4090は他社のオンデマンド容量2か月分のコストに近づき、これが長時間のファインチューニングを手頃にします。
当社がデプロイする構成
サイジング
重みとKVキャッシュを計算し、実際のカードに切り上げます。重みはパラメータ×バイト/パラメータです。8Bのfp16は16 GB、70Bの4ビットは約40 GB。KVキャッシュは忘れがちな部分で、バッチ×コンテキストでスケールします。したがって、8B fp16はRTX 4090(24 GB)、70B量子化はL40S(48 GB)、長いコンテキストと実際のバッチ処理での70B fp8はH100 NVL(94 GB)です。RTX 4000 Adaは埋め込みと小さなビジョンモデルに適しています。
パススルー、vGPUではない
FUSIONはIOMMUを介してPCIeデバイス全体をVMに渡します。カードはlspciに表示され、nvidia-smiが直接報告し、必要なドライバーとCUDAバージョンをインストールできます。他のテナントとタイムスライスされることはなく、ライセンスサーバーがハードウェアとユーザーの間に介在することもありません。vGPUは逆の構成で、ハイパーバイザーがカードをパーティション分割し、ゲスト間でスライスをスケジュールし、ホストが実行するドライバーブランチに固定します。推論ではこれが二重に重要です。MPSとCUDAグラフが予測どおりに動作し、VRAMが他のゲストの割り当てによって圧力を受けるクォータではなく、本当にあなたのものになるからです。
スループットはバッチ処理の問題
単一リクエストは最新GPUの大部分をアイドル状態にします。デコードはメモリ帯域幅に制約されるため、1ストリームのトークン/秒はVRAM帯域幅によって決まり、コンピュートが増えてもほとんど変わりません。コンカレンシーこそがシリコンの価値を引き出します。vLLMまたはTensorRT-LLMでの連続バッチ処理は、単純なサーブに比べて総スループットを数倍押し上げますが、増大するKVキャッシュのVRAMを犠牲にします。これが本当のサイズ設定の緊張です。重みに使うギガバイトごとに、コンカレンシーに使えないギガバイトが生じます。70Bを4ビットに量子化することは、バッチ処理の余地を残すため、多くの場合集計でfp16より高速です。
問題点
- 重みのみでサイズ設定する。KVキャッシュはバッチとコンテキストに比例して増加するため、16 GBでロードされる8Bモデルは32kコンテキストとバッチ16でOOMします。カードを選ぶ前にキャッシュを計算してください。
- コンシューマーカードがスケールアウトすると想定する。4090にはNVLinkがなく、PCIe上のピアツーピアは無効なため、2枚でのテンソル並列は遅いです。小さな2枚ではなく大きな1枚を使用してください。
- どこでもfp8を期待する。fp8にはAdaまたはHopperが必要です。古いシリコンでのfp8量子化はエミュレーションにフォールバックし、置き換えたfp16パスより遅くなります。
マシンを調整
- ストレージと暗号化 — ZFS with hourly snapshots · €7
- アドレスとトランジット — アップリンクを10 Gbpsにアップグレード · €19
- その他 — Second-resolution metrics + alerting · €5