Локальная LLM на серверах компании: развёртывание под ключ
Корпоративный ChatGPT, который не выносит данные наружу
Поднимаем открытую языковую модель на ваших серверах, подключаем к ней документы и системы и выдаём сотрудникам чат и API. Ответы - со ссылкой на источник, доступ - по ролям, данные - внутри периметра.
Что делаем
Публичные чат-боты удобны, но не для договоров и клиентских баз. Мы разворачиваем открытую модель (Llama, Qwen, Mistral и другие open-weight модели, которые работают с русским языком) на ваших серверах и добавляем к ней поиск по вашим документам - RAG. Сотрудник задаёт вопрос, модель находит нужный пункт в регламенте или договоре и отвечает со ссылкой. Модель выбираем под задачу и железо: качество ответов на русском проверяем на ваших реальных вопросах до запуска.
Корпоративный ИИ-чат
Чат для сотрудников по регламентам, договорам и инструкциям. Ответ со ссылкой на документ, без выноса данных к внешнему провайдеру.
RAG по вашим документам
Индексация документов, обновление базы знаний, права доступа: сотрудник видит в ответах только то, что ему положено.
API для ваших систем
Та же модель отвечает CRM, 1С и внутренним сервисам: разбор писем, классификация обращений, черновики документов - внутри периметра.
Локальные ИИ-агенты
Сценарии из направления ИИ-агентов - продажи, поддержка, рутина - но модели и данные остаются на ваших серверах.
Что входит в работу
Стоимость - по задаче, смета за 1–2 дня после брифа. GPU и серверы - отдельной строкой.
- Выбор модели под задачу, язык и железо - со сравнением на ваших вопросах
- Развёртывание inference на ваших серверах или в вашем облачном контуре
- База знаний: загрузка, индексация и обновление документов
- Чат для сотрудников и API для систем
- Роли через SSO и журнал запросов
- Пилот 4–8 недель с критериями приёмки
- Документация и передача вашей команде
Как работаем
- 01
Требования
Разбираем, какие данные нельзя выносить: персональные данные, коммерческая тайна, объекты КИИ. Фиксируем требования службы ИБ и сценарий, ради которого нужен ИИ.
- 02
Архитектура контура
Где живут модели, база знаний и журналы, кто к чему имеет доступ, как контур связан с вашими системами. Схему согласуем с ИБ до закупки железа.
- 03
Пилот внутри периметра
4–8 недель на реальной задаче: модель, документы, роли. Критерии приёмки - доля верных ответов со ссылкой на источник, скорость, эскалации человеку - фиксируем заранее.
- 04
Дообучение и масштабирование
Если базовой модели с поиском по документам не хватает - дообучаем на ваших данных. Добавляем пользователей, сценарии и мощности по мере нагрузки.
- 05
Сопровождение
Мониторинг, обновление моделей и базы знаний, разбор инцидентов. Контур и код остаются у вас.
Вопросы
Какие модели вы используете?
Открытые модели с весами, которые можно поставить на свои серверы: Llama, Qwen, Mistral и другие, хорошо работающие с русским. Выбор делаем по качеству на ваших вопросах и по доступному железу.
Локальная модель будет хуже ChatGPT?
В общих знаниях - иногда да. В вопросах по вашим документам решает поиск по базе знаний и правильные данные: на таких задачах локальная модель с RAG отвечает точно и со ссылкой на источник.
Что измеряем на пилоте?
Долю ответов с верным источником, передачу вопроса человеку, время ответа и оценку пилотной группы. Критерии фиксируем до старта.
Можно начать без своих GPU?
Да: пилот запускаем на доступном железе или арендованном сервере в РФ, а закупку планируем по фактической нагрузке.
Контур работает - дальше поддержка
После запуска берём контур на сопровождение: обновление моделей и базы знаний, мониторинг, инциденты и доработки по договору или SLA.
Другие направления разработки
- Закрытый контур ИИАрхитектура периметра для моделей и данных: роли, журналы, сегменты сети. Под 152-ФЗ и требования ИБ - до закупки GPU.
- Дообучение моделейFine-tuning открытой LLM на ваших данных: терминология, формат ответов, классификация. Внутри периметра, с проверкой качества.
- GPU и инфраструктураПодбор GPU-серверов под модель и нагрузку, подготовка площадки, оркестрация. Железо под задачу, а не «максимум с витрины».