Локальная нейросеть для бизнеса: когда она нужна, а когда — переплата
Локальная нейросеть — это языковая модель на вашем сервере: документы и переписка не покидают контур, платы за токены нет, а вопросы локализации и трансграничной передачи по 152-ФЗ снимаются сами собой — правда, остальные обязанности оператора персональных данных никуда не деваются. Она нужна в трёх случаях: коммерческая тайна, чувствительные персональные данные (медицина, зарплаты) и большие объёмы, где облачные токены дороже своего железа. В остальных случаях достаточно российского облака — GigaChat или YandexGPT: данные в РФ и заметно дешевле на старте.
Опубликовано 28 июля 2026 · обновлено 21 августа 2026
Три контура работы с данными
| Контур | Что это | Что можно отправлять | Цена |
|---|---|---|---|
| Зарубежные API (ChatGPT, DeepSeek) | чужое облако вне РФ | по умолчанию — тексты без ПД и без тайны; для ПД нужна отдельная процедура | низкая–средняя |
| Российское облако (GigaChat, YandexGPT) | облако с данными в РФ, договор | ПД клиентов — да, при корректном оформлении | средняя, за токены |
| Локальная модель (Qwen, Llama) | ваш сервер, ваш контур | всё, включая тайну и спец. категории ПД | железо + внедрение |
Практическое правило: уровень защиты выбирается по самым чувствительным данным процесса. Если агент видит и типовые вопросы, и зарплатные ведомости — либо весь процесс в контур, либо роутинг: чувствительная ветка локально, остальное в облаке.
Что говорит закон
- 152-ФЗ: базы с персональными данными граждан РФ должны находиться в России (ч. 5 ст. 18) — это про запись, хранение и извлечение, и обязанность действует независимо ни от чего. Отправка тех же данных в зарубежный API — отдельное действие, трансграничная передача (ст. 12): уведомить Роскомнадзор нужно до её начала, а в страны вне перечня государств с адекватной защитой передавать нельзя, пока не истечёт срок на решение регулятора. Отдельного согласия именно на передачу статья не требует — порядок уведомительный, — но законное основание обработки по ст. 6 нужно всегда. «Мы просто спросили у чат-бота» обязанностей оператора при этом не отменяет.
- Штрафы стали серьёзными: с 2025 года за утечку ПД — до десятков миллионов рублей за первый крупный инцидент и оборотные до 3% выручки за повторный. Экономия на контуре перестала быть рациональной.
- Специальные категории (здоровье, биометрия) — режим жёстче: для клиник и HR-данных локальная модель или аттестованный контур — базовая рекомендация, а не паранойя.
- Обучение на ваших данных: публичные версии некоторых сервисов дообучаются на переписке. В корпоративных тарифах отключаемо — проверять до внедрения, а не после утечки.
Какие модели можно развернуть локально
Открытые модели, которые реально работают на русском: Qwen (лидер открытых весов по соотношению качество/размер), Llama, открытые версии DeepSeek, российские открытые модели.
- Средние (7–32B параметров) — уверенно закрывают извлечение данных, классификацию, суммаризацию и ответы по базе знаний (RAG). Для большинства корпоративных задач достаточно.
- Крупные (70B+) — ближе к облачному качеству в свободном рассуждении, но требования к железу кратно выше.
Важная честность: локальная модель среднего размера слабее топовых облачных в «свободном интеллекте». Компенсация — архитектура: узкая задача, хорошая база, жёсткие правила «не знаю» — в таком режиме разница с облаком на практике почти исчезает.
Сколько это стоит
Порядок цифр на июль 2026 года:
| Статья | Порядок затрат |
|---|---|
| Аренда GPU-сервера в РФ | ~30–150 тыс. ₽/мес |
| Свой сервер с GPU | от нескольких сотен тыс. ₽ разово |
| Пилот «база знаний в контуре» (наш) | 300–500 тыс. ₽, 4–6 недель |
| Полный проект с интеграциями | от 300 тыс. ₽ до нескольких млн |
| Плата за токены | 0 ₽ — в этом и смысл на объёмах |
Точка безубыточности против облака — объём: когда счёт за облачные токены устойчиво выходит за десятки тысяч рублей в месяц, своё железо начинает окупаться. Второй драйвер — не экономика, а риски: для тайны и спец. категорий вопрос «дешевле ли» не стоит.
Когда локальная нейросеть НЕ нужна
Честный раздел, который сэкономит вам сотни тысяч:
- Нет ни тайны, ни чувствительных ПД. Маркетинговые тексты, обезличенная аналитика, регламенты — российское облако дешевле, качественнее и без забот о железе.
- Малый объём. Тысячи запросов в месяц не окупят GPU-сервер никогда — облачные токены обойдутся в сотни рублей.
- Некому администрировать. Локальная модель — это сервер, обновления, мониторинг, бэкапы. Без ответственного через полгода это тыква.
- «Хотим локальную, потому что надёжнее». Надёжность решается архитектурой, а не географией сервера. Если данные не секретны — это переплата за ощущение.
Мы предлагаем локальную модель, когда на аудите видим тайну, спец. категории ПД или объёмы, — и отговариваем, когда её хотят «для солидности».
Вопросы и ответы
Для текстов без персональных данных и коммерческой тайны — да. С клиентскими базами, договорами и данными сотрудников сложнее: отправка в зарубежный сервис — это трансграничная передача по ст. 12 152-ФЗ. Прямого запрета нет, и отдельного согласия именно на передачу закон не требует — нужно уведомить Роскомнадзор о намерении до её начала, а до уведомления собрать у получателя сведения о мерах защиты. Законное основание обработки по ст. 6 при этом требуется всегда. В страны вне перечня государств с адекватной защитой (США в их числе) передавать нельзя, пока не истечёт срок на решение регулятора, а основная база с данными граждан РФ в любом случае должна оставаться в России. Практический ответ для клиентских данных — свой контур или российское облако: там трансграничной процедуры просто нет.
Да: данные обрабатываются и хранятся в РФ, с провайдером заключается договор. Для большинства клиентских процессов российское облако — правильный баланс; локальная модель нужна ступенью выше — для тайны и специальных категорий.
Для средних моделей (7–32B) — сервер с GPU на 24–48 ГБ видеопамяти: аренда в российских ДЦ от ~30 тыс. ₽/мес. Крупные модели требуют нескольких GPU; потребность считается от задачи, а не наоборот.
В свободном диалоге «обо всём» — заметно слабее топовых. В узких задачах с базой знаний и правилами (извлечение, классификация, ответы по документам) разница на практике мала: качество делает архитектура, а не размер модели.
Чаще всего не нужно: RAG — поиск по базе с генерацией ответа — дешевле, управляемее и не «вшивает» устаревающие данные в модель. Дообучение оправдано для специфического стиля или терминологии — решается тестом.
Не уверены, какой контур ваш?
На аудите разложим данные по трём уровням чувствительности, посчитаем экономику облака против железа и дадим смету. Форматы от 30 000 ₽.
