Как развернуть, подключиться по API и использовать модель. Актуально для образа LLM-Box Base (Qwen3-8B) в Yandex Cloud Marketplace.
LLM-Box — готовый образ виртуальной машины с приватным ИИ-сервером. Внутри собраны:
Всё работает в вашем облаке: запросы и данные не покидают периметр.
80/TCP (веб-чат и API) и 22/TCP (SSH).Веб-чат: откройте http://<публичный IP>/ в браузере. Первый вход создаёт администратора — задайте свой пароль.
API-ключ и адреса показываются в приветствии (MOTD) при входе по SSH:
ssh <логин>@<публичный IP> === Приватный LLM-сервер (vLLM + Open WebUI) === Веб-чат: http://<IP>/ API (OpenAI): http://<IP>/v1/chat/completions API-ключ: <ваш ключ>
API совместим с OpenAI — используйте адрес http://<IP>/v1 как base_url и ключ из MOTD.
curl http://<IP>/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-8b",
"messages": [
{"role": "user", "content": "Привет! Кратко объясни, что такое RAG."}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="http://<IP>/v1",
api_key="<ваш ключ>",
)
resp = client.chat.completions.create(
model="qwen3-8b",
messages=[{"role": "user", "content": "Сформулируй письмо клиенту про перенос встречи."}],
)
print(resp.choices[0].message.content)
stream = client.chat.completions.create(
model="qwen3-8b",
messages=[{"role": "user", "content": "Напиши краткий план статьи про приватный ИИ."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content or ""
print(delta, end="", flush=True)
qwen3-8b. Чтобы переключить существующее приложение на приватный сервер, обычно достаточно сменить base_url и ключ.Qwen3-8B — открытая языковая модель (лицензия Apache 2.0), хорошо работает с русским и английским, поддерживает диалог, суммаризацию, работу с документами и вызов функций (tools). В образе используется 4-битная AWQ-сборка, оптимизированная под одну GPU NVIDIA T4.
| Параметр | Значение |
|---|---|
| Модель | Qwen3-8B (AWQ 4-bit) |
| Лицензия | Apache 2.0 |
| Контекст | до 8192 токенов (в базовой конфигурации) |
| Языки | русский, английский и др. |
Доступны и другие модели в линейке LLM-Box: Qwen3-14B/32B, DeepSeek-R1, Qwen2.5-Coder (код), Qwen2.5-VL (изображения), эмбеддинги bge-m3 для RAG. Подбор под задачу — по запросу.
| Ресурс | Минимум |
|---|---|
| GPU | NVIDIA T4 (16 ГБ) |
| vCPU | 8 |
| RAM | 32 ГБ |
| Диск | 60 ГБ SSD |
| Сеть | публичный IP, открытые порты 80 и 22 |
Нет. После запуска модель работает офлайн. Интернет нужен только если вы сами захотите обновить образ.
Да, в рамках выделенного решения подбираем и разворачиваем модель под вашу задачу и железо.
Программное обеспечение и настройку выполняет ООО «ПАПА ДАТА». Поставку оборудования для выделенных серверов осуществляет компания-партнёр.
Напишите на info@papadata.ru — отвечаем в течение 1–2 рабочих дней.