AI‑ассистент начинается просто: большая модель в vLLM, embeddings, reranker и RAG по документам. Потом приходят production‑нагрузки: длинные сессии, рост KV‑cache, очередь запросов, нестабильная задержка и желание докупить GPU.
В докладе разберем, почему этот диагноз часто слишком грубый.
Покажу, как считать память и KV‑cache, как решения inference‑слоя меняют профиль нагрузки, а затем перейдем к нашей реализации в Deckhouse: планировщик инференса заранее считает конфигурацию запуска модели, а GPU control plane исполняет этот план через DRA, MPS/MIG и scheduler extender.