Запрос, который мы слышим всё чаще: «Хотим как ChatGPT, но чтобы наши документы никуда не уходили». Желание понятное. Облачные сервисы вроде ChatGPT или Claude удобные, но у них есть два неприятных свойства для бизнеса в России: они отправляют каждый ваш запрос за рубеж и официально здесь не работают. А служба безопасности резонно не хочет, чтобы договоры и переписка утекали в чужое облако.
Выход — держать модель у себя. Это и называется локальным ИИ. Разберём без хайпа про «революцию»: что это, кому правда нужно, а кому хватит облака.
Что такое локальный ИИ простыми словами
Это та же языковая модель, что и в ChatGPT, только запущенная на вашем сервере (или в облаке в РФ), а не на серверах чужой компании за границей. Запрос сотрудника уходит не в интернет, а на машину, которая стоит в вашей стойке или в дата-центре, который вы контролируете. Данные не покидают периметр — в этом весь смысл.
Важный момент, который многих удивляет: сами модели бесплатные. Есть целое семейство открытых моделей — Qwen, русско-оптимизированные T-lite и T-pro, Saiga — которые можно использовать коммерчески без лицензионных отчислений. Платите вы не за «мозги», а за железо, на котором они крутятся, и за внедрение.
Кому это реально нужно
Локальный ИИ — не «всем срочно». Он оправдан там, где есть одна из причин:
- Чувствительные данные. Вы работаете с персональными данными, коммерческой тайной или госсектором, и 152-ФЗ — это проверка с последствиями, а не пожелание.
- Данные не должны уходить наружу в принципе. Ни в чьё чужое облако, даже российское. Договоры, медкарты, исходный код.
- Нужно встроить ИИ в свои системы. Не «открыть чат в браузере», а чтобы 1С, CRM или хелпдеск дёргали модель по API внутри вашего контура.
Если ничего из этого про вас, а нужно просто иногда сочинить текст — честнее взять облачный сервис и не городить инфраструктуру. Мы это говорим прямо, хотя продаём как раз локальные внедрения.
Что он умеет уже сейчас
Не «заменить сотрудника», а снять с него рутину, где не нужен полёт мысли, а нужна аккуратность и скорость:
- Отвечать по вашим документам. Это называется RAG: модель ищет ответ в вашей базе знаний, регламентах и СЭД и отвечает со ссылкой на источник, а не выдумывает.
- Делать саммари длинной переписки, встречи или договора — коротко, по делу.
- Расшифровывать звонки и голосовые — офлайн, не отправляя запись на сторону.
- Разбирать и классифицировать тексты — раскидать обращения по темам, вытащить из письма нужные поля.
Честно про железо и качество
Тут важно не приукрашивать. Чтобы ответы приходили за секунды, нужен сервер с видеокартой (GPU) — это основная статья расходов. Базовой конфигурации с одной современной картой на 24 ГБ хватает для работы с документами и десятка-другого одновременных пользователей.
И про качество. Открытая модель на 7–8 миллиардов параметров — это не GPT-4. На сложном рассуждении или творческом тексте она слабее. Но для задач, ради которых её и берут — поиск по документам, саммари, классификация, — её более чем достаточно. Если нужно ближе к топовому облаку, ставятся модели побольше (32B, 70B), но это уже другое железо и другой бюджет.
Локальный ИИ покупают не за то, что он «умнее» ChatGPT. Его покупают за то, что данные остаются у вас, а модель можно вшить в свои системы. Это про контроль и интеграцию, а не про рекорды в бенчмарках.
Главный плюс, о котором забывают, — API в вашем контуре
Самое ценное не чат в браузере, а то, что локальный ИИ даёт OpenAI-совместимый API. Если у вас уже есть система, которая умеет работать с API OpenAI, её переключают на локальную модель сменой одного адреса и ключа — код переписывать не нужно. Дальше любой ваш сервис может звать ИИ внутри периметра: подсказки в CRM, авто-ответы в хелпдеске, разбор входящих в 1С.
Сколько это стоит
Чтобы не было «всё индивидуально», порядок величин. Можно пойти двумя путями:
- Управляемый сервис (managed) — мы держим сервер с GPU в РФ и отдаём вам готовый ИИ с API. Без закупки железа, помесячно — от 120 000 ₽/мес.
- On-premise лицензия — ставим на ваше оборудование, бессрочно. От 300 000 ₽ разово плюс внедрение. Сервер с видеокартой покупаете вы.
Цены ориентировочные — точная смета зависит от модели, числа пользователей и интеграций. Но «бесплатная» модель не значит бесплатное решение: основной счёт идёт за GPU и за настройку под ваши данные.
Где здесь мы
Мы собираем такие внедрения под ключ: локальный ИИ в вашем контуре — модель, RAG по документам, OpenAI-совместимый API и админка с ключами и лимитами. Разворачиваем on-premise или как управляемый сервис в РФ. Эту же связку мы уже используем внутри своих продуктов — например, локальный AI в WMS-Lite для описаний товаров.
Не уверены, нужен ли вам локальный ИИ или хватит облака — опишите задачу, разберём и честно скажем. Покажем работу на живом стенде.