CrestVPS

gpu vps

AI推論とファインチューニング

GPU全体をパススルーし、計算を成立させるコミットメント。

当社がデプロイする構成

€287/月

€41030% 年額

タイムスライスされたvGPUはベンチマークを無意味にし、メモリバウンドの推論を予測不能にします。FUSIONはPCIe Gen5を介して物理カード全体をパススルーするため、表示されるデバイスが手元のデバイスです。フルメモリ、フルクロック、直接のドライバーアクセス、カーネルとシリコンの間にスケジューラーはありません。

この構成の理由

最大約300億パラメータの量子化モデルにはRTX 4090から始め、48 GBのメモリが必要ならL40Sへ、帯域幅が必要ならH100 NVLを使用します。年間サイクルでは、4090は他社のオンデマンド容量2か月分のコストに近づき、これが長時間のファインチューニングを手頃にします。

当社がデプロイする構成

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
ストレージ1 TB
イメージUbuntu Server 24.04 LTS

サイジング

重みとKVキャッシュを計算し、実際のカードに切り上げます。重みはパラメータ×バイト/パラメータです。8Bのfp16は16 GB、70Bの4ビットは約40 GB。KVキャッシュは忘れがちな部分で、バッチ×コンテキストでスケールします。したがって、8B fp16はRTX 4090(24 GB)、70B量子化はL40S(48 GB)、長いコンテキストと実際のバッチ処理での70B fp8はH100 NVL(94 GB)です。RTX 4000 Adaは埋め込みと小さなビジョンモデルに適しています。

パススルー、vGPUではない

FUSIONはIOMMUを介してPCIeデバイス全体をVMに渡します。カードはlspciに表示され、nvidia-smiが直接報告し、必要なドライバーとCUDAバージョンをインストールできます。他のテナントとタイムスライスされることはなく、ライセンスサーバーがハードウェアとユーザーの間に介在することもありません。vGPUは逆の構成で、ハイパーバイザーがカードをパーティション分割し、ゲスト間でスライスをスケジュールし、ホストが実行するドライバーブランチに固定します。推論ではこれが二重に重要です。MPSとCUDAグラフが予測どおりに動作し、VRAMが他のゲストの割り当てによって圧力を受けるクォータではなく、本当にあなたのものになるからです。

スループットはバッチ処理の問題

単一リクエストは最新GPUの大部分をアイドル状態にします。デコードはメモリ帯域幅に制約されるため、1ストリームのトークン/秒はVRAM帯域幅によって決まり、コンピュートが増えてもほとんど変わりません。コンカレンシーこそがシリコンの価値を引き出します。vLLMまたはTensorRT-LLMでの連続バッチ処理は、単純なサーブに比べて総スループットを数倍押し上げますが、増大するKVキャッシュのVRAMを犠牲にします。これが本当のサイズ設定の緊張です。重みに使うギガバイトごとに、コンカレンシーに使えないギガバイトが生じます。70Bを4ビットに量子化することは、バッチ処理の余地を残すため、多くの場合集計でfp16より高速です。

問題点

  • 重みのみでサイズ設定する。KVキャッシュはバッチとコンテキストに比例して増加するため、16 GBでロードされる8Bモデルは32kコンテキストとバッチ16でOOMします。カードを選ぶ前にキャッシュを計算してください。
  • コンシューマーカードがスケールアウトすると想定する。4090にはNVLinkがなく、PCIe上のピアツーピアは無効なため、2枚でのテンソル並列は遅いです。小さな2枚ではなく大きな1枚を使用してください。
  • どこでもfp8を期待する。fp8にはAdaまたはHopperが必要です。古いシリコンでのfp8量子化はエミュレーションにフォールバックし、置き換えたfp16パスより遅くなります。

マシンを調整

  • ストレージと暗号化ZFS with hourly snapshots · €7
  • アドレスとトランジットアップリンクを10 Gbpsにアップグレード · €19
  • その他Second-resolution metrics + alerting · €5