← Все проекты

localmodel · закрытый контур · 2026 настроена за 2 дня

Языковая модель в контуре заказчика

Компании нужен был AI в рабочих процессах, но клиентская база и переписка с ней не могли уйти в чужой сервис. Задача решалась не подпиской, а собственным сервером: оборудование стоит у заказчика, модели работают на нём, доступ к ним получают серверы и боты через канал, для которого наружу не открыт ни один порт. Отдельной частью работы был расчёт — сколько такая независимость стоит на самом деле и с какого месяца начинает окупаться.

Роль
Подбор конфигурации, развёртывание, интеграция, расчёт экономики
Срок разработки
два дня
Платформа
Ollama Qwen 3 bge-m3 n8n
Доступ
Оборудование у заказчика, публичного адреса нет
24 месокупаемость железа
×10дешевле облака дальше
22 %порог против YandexGPT
0портов наружу
Языковая модель в контуре заказчика — Железо: что помещается в память и на какой машине

Экраны проекта

01 / 05
Экономика

Своё выгодно ровно до того размера модели, который задаче нужен

Расхожий довод «хватит платить за подписки» не выдерживает счёта: у своего железа есть цена, и её надо разложить на токены. Замеры скорости показали, что ответа «дорого» или «дёшево» не существует — есть лестница, и на ней важно не промахнуться этажом.

Оборудование450 000 ₽
Амортизация24 месяца
Потребление120 Вт
Электричество8 ₽ / кВт·ч
Связь1 000 ₽ / мес
Загрузка30 % расчётных

Отсюда постоянные затраты — 20 441 ₽ в месяц: амортизация железа, свет круглые сутки и канал связи. Эту сумму и делим на число токенов, которые машина успевает произвести за тот же месяц — так получается цена миллиона в таблице ниже.

МодельПамятьСкорость₽ / 1 млнПротив облакаНоль при загрузке
qwen3:8b5 ГБ45 ток/с584дешевле в 1,4×22 %
qwen3:14b-q816 ГБ28 ток/с939дороже в 1,2×35 %
qwen3:32b20 ГБ20 ток/с1 314дороже в 1,6×49 %
qwen2.5:72b47 ГБ10 ток/с2 629дороже в 3,3×99 %
bge-m3 · вектора1,2 ГБ5 000 ток/с5,26дешевле в 1,9×16 %
YandexGPT800 ₽ / 1 млн
GigaChat-Pro500 ₽ / 1 млн
gpt-4o-mini51 ₽ / 1 млн

В таблице сравнение идёт с YandexGPT: у него есть и разговорная модель, и поиск по векторам, поэтому база одна для всех строк. С более дешёвым GigaChat порог выгоды сдвигается с 22 % на 35 %, а с gpt-4o-mini не достигается ни при какой загрузке: чтобы отбить железо по его цене, машине пришлось бы выдавать в пять раз больше токенов, чем она физически успевает.

Колонка памяти задаёт требования к серверу: самая тяжёлая модель занимает 47 ГБ, значит нижняя планка — 64 ГБ, а на 128 ГБ разговорная и векторная держатся одновременно и не выгоняют друг друга. Набор моделей не догма: под другую задачу ставится другой набор, ограничение только одно — память.
Перелом

Первые два года платят за независимость, дальше независимость платит сама

Оборудование не сгорает: оно остаётся у заказчика и стоит денег даже через два года. Поэтому в расчёте гасится не вся цена покупки, а разница между покупкой и тем, за сколько технику можно продать. А когда амортизация заканчивается, от расходов остаются только электричество и связь — и цена ответа падает на порядок.

Сегодня, по полной цене железа939 ₽за миллион токенов — дороже облака в 1,2×
С учётом остаточной стоимости503 ₽гасится потеря стоимости, а не вся покупка
С 25-го месяца77 ₽дешевле облака в 10 раз, объём больше не влияет
Показано на рабочей модели проекта. После окупаемости расход держится около 1 700 ₽ в месяц независимо от того, сколько модель произвела.

Задача

Работать с AI, не отдавая данные наружу

Процессы просились в автоматизацию, но всё, что через них проходит, — это клиентская база, переписка и внутренние документы. Любой облачный сервис означает передачу этих данных третьей стороне: отдельные условия, отдельная ответственность, отдельный риск, который бизнес брать не хотел.

Второй нерешённый вопрос — деньги. Про локальные модели принято говорить, что они бесплатные, но у сервера есть цена, срок службы и счёт за электричество. Прежде чем покупать, надо было понять, во сколько обойдётся ответ и когда вложение вернётся.

Решение

Сервер у заказчика, доступ — без открытых портов

  • Оборудование стоит в помещении заказчика. И хранение, и обработка происходят на его технике: посредников в цепочке нет, наружу ничего не передаётся, договариваться об условиях обработки не с кем.
  • Наружу не открыт ни один порт. Провайдер режет входящие соединения, поэтому канал устроен наоборот: машина сама держит связь с сервером. Побочно это снимает вопрос о том, что кто-то постучится в контур снаружи, — стучаться некуда.
  • Набор моделей собран под задачи проекта. Лёгкая на поток, тяжёлая на сложные тексты, отдельная для поиска по документам. Выбор происходит в самом запросе, переключать ничего не нужно, а состав меняется вместе с задачами.
  • Экономика посчитана до покупки, а не после. Калькулятор считает цену ответа из цены железа, срока амортизации, потребления и загрузки. Заказчик пересчитывает сценарии сам — без обращения к подрядчику.
  • Отключение электричества переживается без человека. Машина включается сама, службы стартуют сами, канал восстанавливается сам. Слабое место нашлось на первом же реальном отключении и закрыто: зависшее соединение теперь освобождает порт за полторы минуты.

Результат

модели доступны серверам и рабочим процессам, при этом наружу не открыт ни один порт
данные и обработка не покидают помещение заказчика, посредников в цепочке нет
цена ответа известна для каждой модели, точка окупаемости посчитана до покупки железа
после отключения электричества система возвращается в работу без участия человека
полная настройка от распаковки до работы в процессах заняла два дня

Откуда цифры: скорость моделей — замеры на оборудовании этой конфигурации, цены облачных сервисов — их прейскуранты на август 2026, себестоимость — из цены оборудования, амортизации, потребления и тарифа. Загрузка взята расчётной.

Другие работы

Контакты

Нужен такой же результат?

Расскажите о задаче — ответ в течение дня: оценка срока, вилка бюджета и честное предупреждение, если она решается дешевле, чем вы рассчитывали.