Услуга

Частные LLM и RAG в закрытом контуре

Развёртываем Qwen3.8-27B, DeepSeek V4 Flash 0731 и другие модели с открытыми весами на вашем оборудовании. Создаём RAG для поиска по документам с цитированием источников и управлением доступом.

  • Локальные LLM и RAG по документам
  • Открытые веса с проверкой лицензии
  • GPU под модель, контекст и нагрузку
  • Интеграция с 1С, CRM и внутренними системами

Что входит

Полный цикл: от подбора модели до промышленной эксплуатации

Подбор и развёртывание LLM

Выбираем модель по качеству на ваших данных, условиям лицензии и ресурсам. Сравниваем компактные модели и крупные MoE; фиксируем конкретный checkpoint и формат весов.

RAG-конвейер

Семантическое чанкование документов, гибридный поиск (dense + BM25), переранжирование cross-encoder'ом и цитирование источников в каждом ответе.

Векторное хранилище

Qdrant или Milvus с мультитенантностью, фильтрацией по метаданным, инкрементальной индексацией и гибридным поиском.

Guardrails и безопасность

Защита от prompt-инъекций, PII-фильтры, ролевой доступ (RBAC), полное журналирование запросов, интеграция с SIEM.

Мониторинг и поддержка

Prometheus, Grafana, DCGM для GPU, RAGAS-метрики faithfulness/context recall, SLA, регулярное обновление моделей.

Интеграция

1С, CRM, Bitrix24, корпоративные мессенджеры, SCADA/MES, MCP-протокол для агентов и внешних сервисов.

Как мы внедряем

  1. 01

    Аудит и постановка задачи

    Описываем целевые метрики качества, границы пилота, требования к данным и composability. Определяем критерии успеха и план масштабирования.

  2. 02

    Прототип на ваших данных

    За 1 - 3 недели собираем работающий контур на реальных данных: загружаем документы, настраиваем retrieval, демонстрируем качество. Без покупки железа.

  3. 03

    Промышленный запуск

    Развёртываем выбранный стек в вашем контуре, интегрируем с источниками, настраиваем guardrails, мониторинг и RAGAS-оценку в CI/CD.

  4. 04

    Сопровождение

    Регулярный контроль метрик, дообучение и смена моделей, обновление векторных индексов, обучение команды, SLA 24/7 по согласованию.

Модели для локального развёртывания

Проверено по официальным источникам 7 сентября 2026 года

МодельНазначениеЛицензия
Qwen3.8-27B 27B · текст и изображения Apache-2.0
DeepSeek V4 Flash 0731 MoE · сложные задачи MIT
GLM-5.3-Flash MoE · мультимодальные агенты MIT
Kimi K2.7 Code Код · работа с инструментами Modified MIT
Gemma 4 12B 12B · мультимодальные задачи Apache-2.0
gpt-oss-120b Рассуждения · открытые веса Apache-2.0
GigaChat 3.1 Lightning 10B-A1.8B · русский язык MIT
YandexGPT 5 Lite 8B 8B · русский язык YandexGPT 5 Lite License

Приватность по умолчанию

Модели и векторные индексы разворачиваются только внутри периметра заказчика. Запросы не уходят во внешние API. Все взаимодействия журналируются и доступны для аудита. Работаем в on-premise, выделенном ДЦ или air-gap.

Ошибки, которых мы не допускаем

Типовые риски внедрения LLM и RAG, которые мы исключаем на этапе архитектуры

Работа без метрик качества

Без RAGAS и eval-набора нельзя оценить, отвечает ли система бизнес-требованиям. Закладываем метрики с первого дня.

Наивный retrieval

Фиксированный чанк без гибридного поиска (dense + BM25) даёт пропуски релевантных документов и ложные ответы.

Игнорирование guardrails

Prompt-инъекции - #1 риск OWASP GenAI Top-10. Без входных и выходных фильтров данные и промпты под угрозой.

Облачная зависимость

Отправка данных во внешний API сводит на нет приватность. Любая модель работает только внутри контура, без исключений.

Отсутствие reranking

Топ-K векторов без cross-encoder переранжирования снижает точность ответа на 25 - 35%. Это критично для ответов с цитатами.

Забыли про мониторинг

Без Prometheus, Grafana и RAGAS нет понимания latency, throughput, ошибок модели и деградации качества.

Модель — часть работающей системы

Инференс и поиск

Используем совместимый с выбранными весами runtime: vLLM, SGLang или llama.cpp. Проверяем tool calling, шаблон диалога, квантование и работу с нужным контекстом. Для RAG добавляем извлечение текста, локальные embeddings, гибридный поиск и переранжирование. Ответ сопровождается ссылками на исходные документы.

Проверка перед запуском

Фиксируем набор вопросов заказчика, правильные ответы, допустимые задержки и число одновременных пользователей. Проверяем разграничение доступа, отсутствие внешних вызовов в закрытом режиме, журналирование и обновление индекса. Наличие открытых весов не означает одинаковые лицензионные условия для всех моделей.

Официальные модели

Готовы развернуть частную LLM?

Опишите задачи, типы документов и требования к приватности - предложим архитектуру и план пилота под ваш контур.