Локальный ИИ · On-Premise
Локальный ИИ и суверенная нейросеть в закрытом контуре
Развёртывание LLM на вашем GPU-сервере для ИИ: корпоративный ChatGPT, база знаний ИИ и локальный ИИ-агент внутри периметра — под ФЗ-152, КИИ и импортозамещение.
от 500 000 ₽ · пилот 4–8 недель · из чего смета · пилотная программа · все цены
Для кого это решение
Это не «чат для отдела». Это enterprise-инфраструктура ИИ для крупного бизнеса, госсектора и компаний с жёсткими требованиями к данным, КИИ и коммерческой тайне.
EnterpriseКрупный бизнес и корпорации
Нужен свой ИИ-контур: без утечек в OpenAI/Google, без санкционных блокировок и с контролем доступа к внутренним знаниям.
КИИГосучастие и стратегические объекты
Требования КИИ, реестровое ПО и запрет на иностранные сервисы на критичных контурах - закрываем архитектурой on-premise.
РегуляторикаБанки, медицина, промышленность
Персональные данные, коммерческая тайна и отраслевые регламенты. ИИ работает локально - регулятор видит контролируемый контур.
Какие законы учитываем
Проектируем контур сразу под российское регулирование - чтобы решение прошло ИБ, комплаенс и аудит, а не «сломалось» на этапе согласования.
Почему нельзя зарубежные облачные ИИ
Для enterprise это не вопрос «удобства», а вопрос закона, устойчивости бизнеса и контроля над данными.
01 / 04
Утечка конфиденциальных данных
Отправка в зарубежное облако бьёт по ФЗ-152 и ФЗ-98. Промпты могут уходить в обучение внешних моделей. Секреты становятся доступны третьим лицам, а трансграничная передача - на радаре регулятора.
Контуры On-Premise AI
Отдельные URL: периметр и ИБ, GPU/инфраструктура, модели + RAG + SLA. Без размытия «ещё и сайты» на этой ветке.
GPU и инфраструктура
Подбор GPU под модель и нагрузку, питание, охлаждение, оркестрация. Честно про сроки поставки.
Железо / GPUМодели, RAG и SLA
Локальные LLM, корпоративная база знаний, критерии приёмки пилота 4–8 недель и сопровождение.
RAG и пилот
Какое оборудование закупаем
Официальные поставки топовых GPU ограничены - работаем через параллельный импорт и альтернативы. Подбираем стек под задачу: от лёгких моделей до enterprise fine-tuning 70B+.
01 / 03
NVIDIA для enterprise
Для серьёзного файнтьюна и моделей от 70B - H100, A100 или B200 при наличии каналов. Для 8B-32B часто достаточно A10G или RTX 4090 в серверном исполнении с турбинным охлаждением.
Инфраструктура вокруг серверов
Поставить GPU в стойку - только часть работы. Корпоративный ИИ-контур живёт за счёт охлаждения, питания, быстрой связки карт и оркестрации.
01 / 03
Питание и охлаждение
Сервер с 8x H100 легко берёт 10-12 кВт. Часто нужна модернизация серверной или ЦОД. Считаем это на этапе аудита, а не после закупки.
Софт, модели и файнтьюн
Собираем рабочий контур: базовая модель, дообучение под ваши данные, быстрый inference и RAG по внутренним документам - всё внутри периметра.
01 / 03
Базовые LLM
Llama 3 / 3.1 / 4, Mistral / Mixtral, Qwen. Российский контур: Vikhr и адаптированные под русский язык сборки.
К чему готовиться заранее
Честные коммерческие барьеры enterprise-проекта: сроки железа, кадры и регуляторика. Закладываем их в план, чтобы не сорвать запуск.
01 / 03
Сроки и логистика GPU
Карты едут долго, логистика сложная. Запчасти для ремонта тоже нужно планировать заранее.
Как внедряем для enterprise
- 01
Аудит требований и контура
ИБ, комплаенс, КИИ/ПДн, интеграции и целевые сценарии. Фиксируем архитектуру, которую можно защищать перед службами заказчика.
- 02
Проектирование и поставка
GPU, сеть, доступы, мониторинг. Контур собираем под ваш ЦОД / серверную / выделенный сегмент.
- 03
Развёртывание ИИ-ядра
Модели, RAG, политики безопасности, журналирование. Данные не покидают периметр.
- 04
Передача и сопровождение
Обучение вашей ИТ-команды, регламенты эксплуатации, SLA. При необходимости - развитие агентов и сценариев.
Что получает корпорация
Свой контур
ИИ внутри периметра - без зарубежных облаков
Комплаенс
Учёт ФЗ-152, ФЗ-187, ФЗ-98 и требований импортозамещения
Контроль
Доступы, журналы и устойчивость без риска блокировок API
Смета: On-Premise AI
от 500 000 ₽ · пилот 4–8 недельПилот контура (модели + RAG + доступы) считаем отдельно от закупки GPU. Железо и ЦОД — отдельной строкой после аудита нагрузки.
Пилотная программа
Что входит
- Архитектура контура и роли доступа
- Развёртывание open-weight LLM + RAG по вашим документам
- Журналы и запрет утечки в публичные API
- Критерии приёмки и отчёт пилота
Критерии успеха в договоре
- Ответы с опорой на согласованный корпус документов
- Эскалация человеку по правилам
- Данные остаются в периметре
Что измеряем на пилоте
- Доля ответов с корректным источником
- Время ответа и эскалации
- Удовлетворённость пилотной группы
| Пакет | Что входит | Цена | Срок |
|---|---|---|---|
| Архитектура контура | Аудит ИБ/нагрузки, схема периметра, выбор моделей, план пилота и железа | от 150 000 ₽ | 1–2 недели |
| Пилот локального ИИ | Развёртывание LLM, RAG по вашим документам, роли доступа, журналы — без зарубежного облака | от 500 000 ₽ | 4–8 недель |
| Прод + SLA | Кластер, мониторинг, дообучение, сопровождение; GPU — по спецификации | по ТЗ | от 2–4 месяцев+ |
Архитектура контура
Аудит ИБ/нагрузки, схема периметра, выбор моделей, план пилота и железа
от 150 000 ₽
1–2 недели
Пилот локального ИИ
Развёртывание LLM, RAG по вашим документам, роли доступа, журналы — без зарубежного облака
от 500 000 ₽
4–8 недель
Прод + SLA
Кластер, мониторинг, дообучение, сопровождение; GPU — по спецификации
по ТЗ
от 2–4 месяцев+
Из чего складывается смета
- Аудит и архитектура. ИБ, ПДн/КИИ, сценарии, интеграции, требования к latency.
- Софт-контур. Inference (vLLM и др.), RAG, API, роли, аудит действий.
- Модели и дообучение. Open-weight стек, LoRA/QLoRA при необходимости.
- Железо / GPU. Подбор и поставка — отдельная смета после профиля нагрузки.
- Интеграции. CRM/ERP/1С, SSO, корпоративный поиск.
- SLA и передача. Регламенты, обучение ИТ, мониторинг.
От чего растёт цена
- Размер модели и пользователи. 7–8B vs 70B+, число одновременных сессий.
- Объём базы знаний. Документы, частота обновлений, мультиязычность.
- Compliance. ФЗ-152, КИИ, ФСТЭК, реестровое ПО, Astra/РЕД ОС.
- ЦОД и сеть. Питание, охлаждение, InfiniBand/RoCE для кластера.
Что не входит
- Стоимость GPU и серверов (считаем после аудита, параллельный импорт при необходимости)
- Лицензии закрытых облачных LLM (их как раз не используем в контуре)
- Модернизация электропитания ЦОД вне согласованного объёма
- Юридический аудит политики ПДн «под ключ» без ИБ-заказчика
Рамки договора
- Пилот 4–8 недель при типовом кейсе: критерии приёмки фиксируем в договоре.
- Данные пилота не уходят в публичные зарубежные API.
- Смета: софт и железо разведены — без «сюрприза» в конце.
Опишите сценарий (чат / RAG / агент) и ограничения ИБ — предложим контур и вилку.
Частые вопросы
Технологическая инфраструктура
Вопросы по локальному ИИ
Модели и inference на ваших серверах (on-premise / закрытый контур). Данные внутри периметра: промпты и корпоративная база знаний не уходят в зарубежное облако.
ИИ под 152-ФЗ и требования КИИ: персональные данные россиян обрабатываются в контролируемом контуре без трансграничной передачи в публичные LLM. Архитектуру сразу закладываем под комплаенс.
Да: дообучение LLM / файнтюн (LoRA, QLoRA) на ваших данных внутри периметра, плюс RAG. Подбираем GPU-сервер под размер модели.
Да: чат по внутренним документам, роли доступа и агенты в закрытом контуре — суверенный ИИ, не публичный SaaS.
Обсудим контур под вашу корпорацию
Локальный ИИ и локальная нейросеть on-premise: GPU-сервер, закрытый контур, корпоративная база знаний без зарубежных облаков.
















