Данные → Решения
Обсудить проект
ДОКУМЕНТАЦИЯ

LLM-Box — приватный ИИ-сервер (Qwen3)

Как развернуть, подключиться по API и использовать модель. Актуально для образа LLM-Box Base (Qwen3-8B) в Yandex Cloud Marketplace.

Что это

LLM-Box — готовый образ виртуальной машины с приватным ИИ-сервером. Внутри собраны:

  • Языковая модель (Qwen3-8B) — веса запечены в образ, работает офлайн;
  • vLLM — движок инференса с OpenAI-совместимым API;
  • Open WebUI — веб-чат в стиле ChatGPT;
  • nginx — обратный прокси на порт 80.

Всё работает в вашем облаке: запросы и данные не покидают периметр.

Быстрый старт

  1. Разверните ВМ из образа LLM-Box Base в Yandex Cloud (Marketplace) на платформе с GPU NVIDIA T4.
  2. Ресурсы: минимум 8 vCPU, 32 ГБ RAM, диск 60 ГБ. Назначьте публичный IP.
  3. В группе безопасности откройте входящие порты 80/TCP (веб-чат и API) и 22/TCP (SSH).
  4. После старта подождите 2–5 минут — модель загружается в память GPU.
Сервисы поднимаются автоматически при первом запуске. Пароль администратора и API-ключ генерируются индивидуально для вашей ВМ.

Доступ и ключ

Веб-чат: откройте http://<публичный IP>/ в браузере. Первый вход создаёт администратора — задайте свой пароль.

API-ключ и адреса показываются в приветствии (MOTD) при входе по SSH:

ssh <логин>@<публичный IP>

=== Приватный LLM-сервер (vLLM + Open WebUI) ===
 Веб-чат:      http://<IP>/
 API (OpenAI): http://<IP>/v1/chat/completions
 API-ключ:     <ваш ключ>

API: примеры

API совместим с OpenAI — используйте адрес http://<IP>/v1 как base_url и ключ из MOTD.

curl

curl http://<IP>/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-8b",
    "messages": [
      {"role": "user", "content": "Привет! Кратко объясни, что такое RAG."}
    ]
  }'

Python (официальный SDK OpenAI)

from openai import OpenAI

client = OpenAI(
    base_url="http://<IP>/v1",
    api_key="<ваш ключ>",
)

resp = client.chat.completions.create(
    model="qwen3-8b",
    messages=[{"role": "user", "content": "Сформулируй письмо клиенту про перенос встречи."}],
)
print(resp.choices[0].message.content)

Стриминг ответа

stream = client.chat.completions.create(
    model="qwen3-8b",
    messages=[{"role": "user", "content": "Напиши краткий план статьи про приватный ИИ."}],
    stream=True,
)
for chunk in stream:
    delta = chunk.choices[0].delta.content or ""
    print(delta, end="", flush=True)
Название модели в запросах — qwen3-8b. Чтобы переключить существующее приложение на приватный сервер, обычно достаточно сменить base_url и ключ.

Модель Qwen3

Qwen3-8B — открытая языковая модель (лицензия Apache 2.0), хорошо работает с русским и английским, поддерживает диалог, суммаризацию, работу с документами и вызов функций (tools). В образе используется 4-битная AWQ-сборка, оптимизированная под одну GPU NVIDIA T4.

ПараметрЗначение
МодельQwen3-8B (AWQ 4-bit)
ЛицензияApache 2.0
Контекстдо 8192 токенов (в базовой конфигурации)
Языкирусский, английский и др.

Доступны и другие модели в линейке LLM-Box: Qwen3-14B/32B, DeepSeek-R1, Qwen2.5-Coder (код), Qwen2.5-VL (изображения), эмбеддинги bge-m3 для RAG. Подбор под задачу — по запросу.

Требования

РесурсМинимум
GPUNVIDIA T4 (16 ГБ)
vCPU8
RAM32 ГБ
Диск60 ГБ SSD
Сетьпубличный IP, открытые порты 80 и 22

Безопасность и офлайн

  • Модель и все компоненты запечены в образ — работает без доступа в интернет.
  • Данные обрабатываются внутри вашей ВМ и не отправляются во внешние сервисы.
  • Пароли и API-ключ генерируются при первом запуске; вход по SSH — только по ключу.
  • Рекомендуем ограничить доступ к портам 80/22 группой безопасности (по вашим IP) и включить HTTPS при публикации наружу.

FAQ

Нужен ли интернет для работы?

Нет. После запуска модель работает офлайн. Интернет нужен только если вы сами захотите обновить образ.

Можно ли поставить свою модель?

Да, в рамках выделенного решения подбираем и разворачиваем модель под вашу задачу и железо.

Кто поставляет серверы?

Программное обеспечение и настройку выполняет ООО «ПАПА ДАТА». Поставку оборудования для выделенных серверов осуществляет компания-партнёр.

Как получить помощь?

Напишите на info@papadata.ru — отвечаем в течение 1–2 рабочих дней.

Запросить внедрение