Локальная LLM на серверах компании: развёртывание под ключ

Корпоративный ChatGPT, который не выносит данные наружу

Поднимаем открытую языковую модель на ваших серверах, подключаем к ней документы и системы и выдаём сотрудникам чат и API. Ответы - со ссылкой на источник, доступ - по ролям, данные - внутри периметра.

Что делаем

Публичные чат-боты удобны, но не для договоров и клиентских баз. Мы разворачиваем открытую модель (Llama, Qwen, Mistral и другие open-weight модели, которые работают с русским языком) на ваших серверах и добавляем к ней поиск по вашим документам - RAG. Сотрудник задаёт вопрос, модель находит нужный пункт в регламенте или договоре и отвечает со ссылкой. Модель выбираем под задачу и железо: качество ответов на русском проверяем на ваших реальных вопросах до запуска.

  • Корпоративный ИИ-чат

    Чат для сотрудников по регламентам, договорам и инструкциям. Ответ со ссылкой на документ, без выноса данных к внешнему провайдеру.

  • RAG по вашим документам

    Индексация документов, обновление базы знаний, права доступа: сотрудник видит в ответах только то, что ему положено.

  • API для ваших систем

    Та же модель отвечает CRM, 1С и внутренним сервисам: разбор писем, классификация обращений, черновики документов - внутри периметра.

  • Локальные ИИ-агенты

    Сценарии из направления ИИ-агентов - продажи, поддержка, рутина - но модели и данные остаются на ваших серверах.

Что входит в работу

Стоимость - по задаче, смета за 1–2 дня после брифа. GPU и серверы - отдельной строкой.

  • Выбор модели под задачу, язык и железо - со сравнением на ваших вопросах
  • Развёртывание inference на ваших серверах или в вашем облачном контуре
  • База знаний: загрузка, индексация и обновление документов
  • Чат для сотрудников и API для систем
  • Роли через SSO и журнал запросов
  • Пилот 4–8 недель с критериями приёмки
  • Документация и передача вашей команде

Как работаем

  1. 01

    Требования

    Разбираем, какие данные нельзя выносить: персональные данные, коммерческая тайна, объекты КИИ. Фиксируем требования службы ИБ и сценарий, ради которого нужен ИИ.

  2. 02

    Архитектура контура

    Где живут модели, база знаний и журналы, кто к чему имеет доступ, как контур связан с вашими системами. Схему согласуем с ИБ до закупки железа.

  3. 03

    Пилот внутри периметра

    4–8 недель на реальной задаче: модель, документы, роли. Критерии приёмки - доля верных ответов со ссылкой на источник, скорость, эскалации человеку - фиксируем заранее.

  4. 04

    Дообучение и масштабирование

    Если базовой модели с поиском по документам не хватает - дообучаем на ваших данных. Добавляем пользователей, сценарии и мощности по мере нагрузки.

  5. 05

    Сопровождение

    Мониторинг, обновление моделей и базы знаний, разбор инцидентов. Контур и код остаются у вас.

Вопросы

Какие модели вы используете?

Открытые модели с весами, которые можно поставить на свои серверы: Llama, Qwen, Mistral и другие, хорошо работающие с русским. Выбор делаем по качеству на ваших вопросах и по доступному железу.

Локальная модель будет хуже ChatGPT?

В общих знаниях - иногда да. В вопросах по вашим документам решает поиск по базе знаний и правильные данные: на таких задачах локальная модель с RAG отвечает точно и со ссылкой на источник.

Что измеряем на пилоте?

Долю ответов с верным источником, передачу вопроса человеку, время ответа и оценку пилотной группы. Критерии фиксируем до старта.

Можно начать без своих GPU?

Да: пилот запускаем на доступном железе или арендованном сервере в РФ, а закупку планируем по фактической нагрузке.

Контур работает - дальше поддержка

После запуска берём контур на сопровождение: обновление моделей и базы знаний, мониторинг, инциденты и доработки по договору или SLA.

Поддержка по SLA →

Смета за 1–2 дня

Напишите процесс, который съедает время. Вернём вилку пилота, не презентацию на 40 слайдов.

Презентация ↓ PDF

Или быстрая связь

Локальная LLM на серверах компании: корпоративный ИИ-чат | JimmyNeuron