CrestVPS

gpu vps

AI 추론 및 파인튜닝

전체 GPU를 패스스루하여 수학이 성립하는 약정으로.

배포할 구성

€287/월

€41030% 연간

시간 분할 vGPU는 벤치마킹을 무의미하게 만들고 메모리 바운드 추론을 예측 불가능하게 만듭니다. FUSION은 PCIe Gen5를 통해 전체 물리 카드를 패스스루하므로 사용자가 보는 장치는 사용자가 가진 장치입니다: 전체 메모리, 전체 클럭, 직접 드라이버 액세스, 커널과 실리콘 사이에 스케줄러가 없습니다.

이 구성의 이유

최대 약 300억 파라미터까지 양자화된 모델에는 RTX 4090으로 시작하고, 48GB 메모리가 필요하면 L40S로 이동하거나 대역폭이 필요할 때 H100 NVL을 사용하십시오. 연간 주기에서 4090은 다른 곳의 온디맨드 용량 2개월 비용에 가깝게 책정되어 장기 파인튜닝 실행을 가능하게 합니다.

배포할 구성

PlanFUSION G2 · RTX 4090 24 GB
vCPU12 (dedicated)
RAM64 GB
스토리지1 TB
이미지Ubuntu Server 24.04 LTS

사이징

가중치 더하기 KV 캐시, 그런 다음 실제 카드로 반올림. 가중치는 파라미터 곱하기 바이트: 8B fp16은 16GB, 70B 4비트는 약 40GB. KV 캐시는 사람들이 잊는 부분이며 배치 곱하기 컨텍스트로 확장됩니다. 따라서: 8B fp16은 RTX 4090(24GB), 양자화된 70B는 L40S(48GB), 긴 컨텍스트와 실제 배칭이 있는 fp8 70B는 H100 NVL(94GB)입니다. RTX 4000 Ada는 임베딩 및 소형 비전 모델에 적합합니다.

패스스루, vGPU 아님

FUSION은 IOMMU를 통해 전체 PCIe 장치를 VM에 전달합니다. 카드는 lspci에 나타나고 nvidia-smi가 직접 보고하며 스택에 필요한 드라이버와 CUDA 버전을 설치할 수 있습니다. 다른 테넌트와 시간 분할되지 않으며 하드웨어와 사용자 사이에 라이선스 서버가 없습니다. vGPU는 반대입니다: 하이퍼바이저가 카드를 분할하고 게스트 간 스케줄하며 호스트가 실행하는 드라이버 분기에 고정됩니다. 추론의 경우 두 가지 이유로 중요합니다. MPS와 CUDA 그래프가 예측 가능하게 동작하고 VRAM이 다른 게스트의 할당으로 압박받을 수 있는 할당량이 아닌 진정으로 사용자의 것이기 때문입니다.

처리량은 배칭 문제

단일 요청은 최신 GPU의 대부분을 유휴 상태로 둡니다. 디코드는 메모리 대역폭에 바인딩되므로 단일 스트림의 초당 토큰 수는 VRAM 대역폭에 의해 결정되며 계산을 더해도 거의 변하지 않습니다. 동시성이 실리콘의 가치를 실현하는 곳입니다. vLLM 또는 TensorRT-LLM의 연속 배칭은 단순 서빙보다 총 처리량을 몇 배로 끌어올리지만 성장하는 KV 캐시를 위한 VRAM 비용이 듭니다. 이것이 실제 크기 조정의 긴장입니다: 가중치에 사용하는 모든 GB는 동시성에 사용할 수 없게 됩니다. 70B를 4비트로 양자화하는 것은 종종 fp16보다 총체적으로 더 빠릅니다. 배칭할 공간을 남기기 때문입니다.

문제점

  • 가중치만으로 크기 조정. KV 캐시는 배치 및 컨텍스트에 따라 선형적으로 증가하므로 16GB에 로드되는 8B 모델은 32k 컨텍스트와 배치 16에서 OOM이 발생합니다. 카드를 선택하기 전에 캐시를 계산하십시오.
  • 소비자 카드가 확장된다고 가정. 4090에는 NVLink가 없고 PCIe를 통한 P2P가 비활성화되어 두 카드 간 텐서 병렬화는 느립니다. 작은 카드 두 개보다 큰 카드 하나를 사용하십시오.
  • 모든 곳에서 fp8 기대. fp8에는 Ada 또는 Hopper가 필요합니다. 이전 실리콘에서 fp8로 양자화하면 에뮬레이션으로 폴백되어 대체한 fp16 경로보다 느리게 실행됩니다.

머신 튜닝

  • 스토리지 및 암호화ZFS with hourly snapshots · €7
  • 주소 및 트랜짓Uplink upgrade to 10 Gbps · €19
  • 기타Second-resolution metrics + alerting · €5