Все статьи
7 мин чтения

Локальный ИИ: когда облачный ChatGPT компании не подходит

Запрос, который мы слышим всё чаще: «Хотим как ChatGPT, но чтобы наши документы никуда не уходили». Желание понятное. Облачные сервисы вроде ChatGPT или Claude удобные, но у них есть два неприятных свойства для бизнеса в России: они отправляют каждый ваш запрос за рубеж и официально здесь не работают. А служба безопасности резонно не хочет, чтобы договоры и переписка утекали в чужое облако.

Выход — держать модель у себя. Это и называется локальным ИИ. Разберём без хайпа про «революцию»: что это, кому правда нужно, а кому хватит облака.

Что такое локальный ИИ простыми словами

Это та же языковая модель, что и в ChatGPT, только запущенная на вашем сервере (или в облаке в РФ), а не на серверах чужой компании за границей. Запрос сотрудника уходит не в интернет, а на машину, которая стоит в вашей стойке или в дата-центре, который вы контролируете. Данные не покидают периметр — в этом весь смысл.

Важный момент, который многих удивляет: сами модели бесплатные. Есть целое семейство открытых моделей — Qwen, русско-оптимизированные T-lite и T-pro, Saiga — которые можно использовать коммерчески без лицензионных отчислений. Платите вы не за «мозги», а за железо, на котором они крутятся, и за внедрение.

Кому это реально нужно

Локальный ИИ — не «всем срочно». Он оправдан там, где есть одна из причин:

  • Чувствительные данные. Вы работаете с персональными данными, коммерческой тайной или госсектором, и 152-ФЗ — это проверка с последствиями, а не пожелание.
  • Данные не должны уходить наружу в принципе. Ни в чьё чужое облако, даже российское. Договоры, медкарты, исходный код.
  • Нужно встроить ИИ в свои системы. Не «открыть чат в браузере», а чтобы 1С, CRM или хелпдеск дёргали модель по API внутри вашего контура.

Если ничего из этого про вас, а нужно просто иногда сочинить текст — честнее взять облачный сервис и не городить инфраструктуру. Мы это говорим прямо, хотя продаём как раз локальные внедрения.

Что он умеет уже сейчас

Не «заменить сотрудника», а снять с него рутину, где не нужен полёт мысли, а нужна аккуратность и скорость:

  • Отвечать по вашим документам. Это называется RAG: модель ищет ответ в вашей базе знаний, регламентах и СЭД и отвечает со ссылкой на источник, а не выдумывает.
  • Делать саммари длинной переписки, встречи или договора — коротко, по делу.
  • Расшифровывать звонки и голосовые — офлайн, не отправляя запись на сторону.
  • Разбирать и классифицировать тексты — раскидать обращения по темам, вытащить из письма нужные поля.

Честно про железо и качество

Тут важно не приукрашивать. Чтобы ответы приходили за секунды, нужен сервер с видеокартой (GPU) — это основная статья расходов. Базовой конфигурации с одной современной картой на 24 ГБ хватает для работы с документами и десятка-другого одновременных пользователей.

И про качество. Открытая модель на 7–8 миллиардов параметров — это не GPT-4. На сложном рассуждении или творческом тексте она слабее. Но для задач, ради которых её и берут — поиск по документам, саммари, классификация, — её более чем достаточно. Если нужно ближе к топовому облаку, ставятся модели побольше (32B, 70B), но это уже другое железо и другой бюджет.

Локальный ИИ покупают не за то, что он «умнее» ChatGPT. Его покупают за то, что данные остаются у вас, а модель можно вшить в свои системы. Это про контроль и интеграцию, а не про рекорды в бенчмарках.

Главный плюс, о котором забывают, — API в вашем контуре

Самое ценное не чат в браузере, а то, что локальный ИИ даёт OpenAI-совместимый API. Если у вас уже есть система, которая умеет работать с API OpenAI, её переключают на локальную модель сменой одного адреса и ключа — код переписывать не нужно. Дальше любой ваш сервис может звать ИИ внутри периметра: подсказки в CRM, авто-ответы в хелпдеске, разбор входящих в 1С.

Сколько это стоит

Чтобы не было «всё индивидуально», порядок величин. Можно пойти двумя путями:

  • Управляемый сервис (managed) — мы держим сервер с GPU в РФ и отдаём вам готовый ИИ с API. Без закупки железа, помесячно — от 120 000 ₽/мес.
  • On-premise лицензия — ставим на ваше оборудование, бессрочно. От 300 000 ₽ разово плюс внедрение. Сервер с видеокартой покупаете вы.

Цены ориентировочные — точная смета зависит от модели, числа пользователей и интеграций. Но «бесплатная» модель не значит бесплатное решение: основной счёт идёт за GPU и за настройку под ваши данные.

Где здесь мы

Мы собираем такие внедрения под ключ: локальный ИИ в вашем контуре — модель, RAG по документам, OpenAI-совместимый API и админка с ключами и лимитами. Разворачиваем on-premise или как управляемый сервис в РФ. Эту же связку мы уже используем внутри своих продуктов — например, локальный AI в WMS-Lite для описаний товаров.

Не уверены, нужен ли вам локальный ИИ или хватит облака — опишите задачу, разберём и честно скажем. Покажем работу на живом стенде.

Расскажите о задаче — предложим решение

Внедрить готовый продукт или разработать систему с нуля. Ответим в течение рабочего дня.

Пришлём доступ к демо-стенду в течение рабочего дня.

Нажимая кнопку, вы соглашаетесь с политикой обработки персональных данных (152-ФЗ).