gpu vps
Инференс и дообучение ИИ
Целый GPU, прокинутый насквозь, при обязательствах, которые делают расчёты рабочими.
Что бы мы развернули
287 €/мес
410 €−30% ежегодно
Разделяемые vGPU делают бенчмарки бессмысленными, а инференс с привязкой к памяти непредсказуемым. FUSION прокидывает всю физическую карту через PCIe Gen5, так что устройство, которое вы видите, — это устройство, которое у вас есть: полная память, полные такты, прямой доступ к драйверу, без планировщика между вашими ядрами и кремнием.
Почему такая конфигурация
Начните на RTX 4090 для моделей до примерно тридцати миллиардов параметров в квантизации, переходите на L40S для 48 гигабайт памяти или берите H100 NVL, когда нужна пропускная способность. На годовом цикле 4090 по цене близка к двум месяцам on-demand-мощностей в другом месте, что и делает долгие дообучения доступными.
Что бы мы развернули
Размер
Веса плюс KV-кэш, затем округлите до реальной карты. Веса — это параметры, умноженные на байты на параметр: 8B в fp16 — 16 ГБ, 70B в 4-бит — около 40 ГБ. KV-кэш — та часть, которую забывают: он растёт с батчем и контекстом. Итак: 8B fp16 на RTX 4090 (24 ГБ), 70B в квантизации на L40S (48 ГБ), 70B в fp8 с длинным контекстом и реальным батчингом на H100 NVL (94 ГБ). RTX 4000 Ada подходит для эмбеддингов и небольших vision-моделей.
Passthrough, а не vGPU
FUSION отдаёт всё PCIe-устройство вашей ВМ через IOMMU. Карта появляется в lspci, nvidia-smi показывает её напрямую, и вы ставите любую версию драйвера и CUDA, которая нужна вашему стеку. Ничто не тайм-слайсится с другим арендатором, и между вами и железом нет лицензионного сервера. vGPU — противоположная схема: гипервизор делит карту, планирует срезы между гостевыми и привязывает вас к ветке драйвера хоста. Для инференса это важно дважды: MPS и CUDA-графы ведут себя предсказуемо, а VRAM действительно ваша, а не квота, на которую давит аллокация другого гостя.
Пропускная способность — это проблема батчинга
Один запрос оставляет большую часть современного GPU простаивающей. Декод ограничен пропускной способностью памяти, так что токены в секунду для одного потока задаются шириной VRAM и почти не зависят от вычислений. Конкурентность — где кремний окупается. Непрерывный батчинг в vLLM или TensorRT-LLM поднимает суммарную пропускную способность в несколько раз по сравнению с наивным сервингом, ценой VRAM под растущий KV-кэш. Это реальное напряжение при выборе размера: каждый гигабайт, потраченный на веса, недоступен для конкурентности. Квантизация 70B до 4-бит часто быстрее в сумме, чем fp16, просто потому, что оставляет место для батчинга.
Что идёт не так
- Расчёт только по весам. KV-кэш растёт линейно с батчем и контекстом, так что модель 8B, загружающаяся в 16 ГБ, вызовет OOM при контексте 32k и батче 16. Вычислите кэш до выбора карты.
- Предположение, что потребительские карты масштабируются. У 4090 нет NVLink, а peer-to-peer через PCIe отключён, так что tensor parallel на двух из них медленный. Используйте одну карту побольше, а не две поменьше.
- Ожидание fp8 везде. fp8 требует Ada или Hopper. Квантизация в fp8 на старом кремнии падает в эмуляцию и работает медленнее, чем fp16-путь, который вы заменили.
Настройте машину
- Хранилище и шифрование — ZFS with hourly snapshots · 7 €
- Адресация и транзит — Uplink upgrade to 10 Gbps · 19 €
- Всё остальное — Second-resolution metrics + alerting · 5 €
Ещё
Для конкретных задач
Хостинг игровых серверов
Tick rate — это проблема одного потока. Всё остальное — шум.
VPS для трейдинга и низкой задержки
Расстояние до матчинг-движка и ничего между вами и проводом.
Приватные VPN и прокси-энdpoints
Собственный выход в юрисдикции, которую вы выбрали осознанно.
Сидбоксы и оптовое хранилище
Терабайты, которые остаются дешёвыми, и порт, который остаётся открытым.
Рабочие узлы Kubernetes
Дёшево за ядро, плотно и каждый раз одинаково.
Реселлеры хостинга
Ваш бренд на панели, наше железо под капотом.