← Назад к базе знаний

vLLM

vLLM обслуживает много одновременных обращений к языковой модели на собственных видеокартах. Это то, что ставят, когда локальные модели переходят из эксперимента в работу.

ЛицензияApache 2.0
ЗаменяетПлатные обращения к моделям при собственной инфраструктуре
Развернуть у себяСложно — требует видеокарт и настройки
Исходный кодgithub.com/vllm-project/vllm

Что это

Движок обслуживания моделей, выросший из университетской разработки. Основная идея — эффективное управление памятью видеокарты, за счёт чего один сервер обслуживает во много раз больше запросов, чем наивная реализация.

Какую задачу закрывает

Между «модель работает у меня на ноутбуке» и «моделью пользуется отдел» лежит инженерная задача: очереди, память, параллельные запросы. vLLM решает именно её.

Кому подходит, а кому нет

  • Подходит: Компаниям, которые уже решили запускать модели у себя и упёрлись в производительность
  • Подходит: Тем, у кого есть видеокарты и человек, умеющий с ними работать
  • Подходит: Сценариям с постоянной нагрузкой, где аренда мощностей дороже владения
  • Не подходит: Экспериментам — избыточно сложно
  • Не подходит: Компаниям без своего железа: аренда видеокарт может оказаться дороже обращений к готовому сервису
Что учесть до внедрения. Экономика собственной инфраструктуры считается не по цене за тысячу обращений, а по стоимости владения: железо, электричество, инженер, простой. При нерегулярной нагрузке готовый сервис почти всегда дешевле. Посчитайте до закупки.

Как проверить за час

  1. Возьмите арендованный сервер с видеокартой на несколько часов
  2. Запустите модель и дайте нагрузку из нескольких параллельных запросов
  3. Замерьте задержку и пропускную способность
  4. Сравните стоимость часа с ценой того же объёма у готового сервиса

Частые вопросы

Чем отличается от Ollama?
Ollama про удобство одного пользователя, vLLM про производительность под нагрузкой. Это разные слои.
Работает ли без видеокарты?
Практически нет. Это движок для ускорителей.
Насколько сложно поддерживать?
Требует инженера, знакомого с драйверами и окружением видеокарт. Это не разовая установка.

vLLM — правильный ответ на вопрос «как перевести локальные модели в работу». Но сначала честно посчитайте, дешевле ли это готового сервиса именно при вашей нагрузке.

Дальше по теме
Материал оказался полезным?