← Блог

Локальные модели

Локальная нейросеть для компании: что умеет и чего не умеет

Какие задачи локальные нейросети закрывают не хуже облака, где облако сильнее и что реально нужно из железа под конкретную задачу.

Открытый системный блок на столе, рядом видеокарта, отвёртка, свёрнутые кабели и зелёная кружка

Локальная нейросеть — это модель, которая работает на оборудовании компании: на машине в офисе или на арендованном сервере, куда нет доступа ни у одного стороннего сервиса. Такая модель уверенно разбирает текст, извлекает данные из документов, отвечает по внутренней базе и расшифровывает речь. Проигрывает она там, где нужны длинные рассуждения, очень большой контекст и знания о том, что происходило в мире на прошлой неделе.

Почему вопрос возникает

Причин обычно две, и обе не про технологии.

Первая — данные. Договоры, медицинские заключения, записи разговоров с клиентами, зарплатные ведомости. Отправить их в чужой сервис нельзя не потому, что кто-то параноик, а потому что за утечку отвечает компания, а не поставщик модели. Формулировка «данные не покидают контур» либо есть, либо её нет, и промежуточных состояний не бывает.

Вторая — предсказуемость. Облачный тариф меняется, лимиты пересматриваются, модель обновляют — и промпт, который вчера работал, сегодня даёт другой ответ. Для разового эксперимента это не важно. Для процесса, встроенного в работу отдела, это отдельный риск, который никто не закладывал.

Что локальная модель делает не хуже облачной

Есть класс задач, где разрыв между локальной и облачной моделью либо незаметен, либо не влияет на результат.

Разбор текста и извлечение данных

Вытащить из письма номер заказа, сумму и срок. Разложить входящую заявку по полям карточки. Определить тональность обращения и категорию проблемы. Свести накладную к строкам таблицы. Это задачи с чётким ответом, который проверяется автоматически: поле либо заполнено правильно, либо нет. Здесь важнее не «ум» модели, а стабильность формата ответа — и её проще получить на своей модели, которую никто не обновит без предупреждения.

Ответы по своим документам

Регламенты, инструкции, техническая документация, переписка по проектам. Модель отвечает не из памяти, а по найденным фрагментам: сначала поиск по базе, потом ответ по найденному. Качество здесь на 80% определяется тем, как нарезаны и проиндексированы документы, и только на 20% — размером модели. Компании, которые начинают с покупки железа, а не с разбора собственной документации, чаще всего получают дорогой поиск по бардаку.

Расшифровка и синтез речи

Речь — самый выгодный кандидат на переезд внутрь. Записи разговоров и встреч содержат ровно тот тип данных, который не хочется отдавать наружу, а качество открытых моделей распознавания давно перестало быть узким местом.

Рабочий пример — кейс «Синтез речи»: распознавание на Whisper, поиск по смыслу на pgvector, ответ голосом через Qwen3-TTS. Ноль обращений к облачным моделям — это свойство архитектуры, а не настройка, которую можно случайно выключить. Минута речи расшифровывается за 1,3 секунды, синтез идёт примерно втрое быстрее реального времени, а чтобы снять голос для озвучки, хватает 16 секунд образца. Весь контур собран на одной настольной машине.

Где облако выигрывает

Честный список, потому что попытка закрыть локальной моделью всё подряд заканчивается разочарованием.

  • Длинные рассуждения. Задачи, где нужно выстроить цепочку из десяти шагов и не потерять условие на седьмом.
  • Очень большой контекст. Разобрать разом договор на 200 страниц вместе со всеми приложениями.
  • Свежие знания. Локальная модель знает мир на момент своего выпуска и не узнает о нём ничего нового.
  • Ноль инфраструктуры. Облаку не нужен человек, который следит за машиной, обновлениями и резервными копиями.

Нормальная схема — смешанная: чувствительное остаётся внутри, публичное и сложное уходит в облако. Решение принимается по типу данных, а не по идеологии.

Что нужно из железа

Вопрос «какая видеокарта нужна» задают первым, а отвечать на него нужно последним. Порядок обратный: сначала задача, потом требования, потом железо.

Что определяетКак влияет на выбор
Тип задачиРаспознавание речи, извлечение данных из текста и поиск по документам требуют заметно меньше ресурсов, чем генерация длинных рассуждений
Размер моделиМодель должна целиком помещаться в память ускорителя, иначе скорость падает в разы. Объём памяти важнее, чем номер поколения
Число одновременных запросовОдин человек с редкими вопросами и отдел на 30 человек в час пик — это разные машины
Требование к скоростиНочная обработка пачки документов и ответ в чате за две секунды дают разные требования к железу
Режим работыПостоянная нагрузка оправдывает покупку, редкие всплески — аренду выделенного сервера

Из этого следует практический вывод: посчитать нагрузку можно только после того, как процесс описан. Пока непонятно, сколько документов в день и какой ответ считается правильным, любая конфигурация — угадывание.

Сколько стоит и от чего зависит

Своих публичных цен у Dodigi нет, а придумывать стоимость железа под чужую задачу бессмысленно: она меняется быстрее, чем текст статьи. Что можно сказать точно — из чего складывается смета.

  • Разбор процесса. Что на входе, что считается правильным ответом, кто проверяет результат.
  • Данные. Сбор, чистка и разметка документов. Обычно самая недооценённая часть.
  • Сборка контура. Модель, поиск, оркестрация, интеграция с тем, чем люди пользуются каждый день.
  • Железо. Покупка или аренда — вопрос режима нагрузки, а не принципа.
  • Сопровождение. По опубликованным прайсам студий поддержка и развитие начинаются примерно от 2 000 ₽/час — этот пункт есть всегда, даже когда о нём забывают на старте.

На что смотреть

«Данные не уходят наружу» — проверяемое утверждение. Проверяется просто: отключить машине доступ в интернет и посмотреть, что перестало работать. Если контур действительно локальный — не перестанет ничего. Если где-то остался вызов внешнего API за эмбеддингами или проверкой лицензии, это выяснится за минуту.

Пилот без критерия выхода. Самая частая история: демо показали, всем понравилось, дальше проект живёт годами в статусе эксперимента. Критерий должен быть записан до старта: какая доля ответов принимается без правок, на каком объёме, к какому сроку. Без этой строчки пилот не заканчивается — он тихо забывается.

Модель поверх беспорядка. Если документы не структурированы, а процесс существует только в голове одного сотрудника, локальная модель не наведёт порядок. Она добавит к беспорядку ещё один слой, который тоже нужно поддерживать.

Зависимость от исполнителя. Локальный контур физически стоит у заказчика, но это ничего не значит, если доступы, конфигурации и веса моделей знает только подрядчик. Инструкция по перезапуску и восстановлению из копии должна лежать у заказчика с первого дня.

Вопросы и ответы

Можно ли запустить нейросеть локально на обычном ПК? Небольшие модели — да, и для распознавания речи или разбора коротких текстов этого часто достаточно. Ограничение упирается в память ускорителя: модель должна поместиться в неё целиком. Рабочая станция подходит для проверки гипотезы, а для постоянной нагрузки на отдел нужна выделенная машина.

Работает ли нейросеть без интернета полностью? Да, если контур собран правильно. Модель, поиск по документам и синтез речи не требуют сети. Интернет нужен только на этапе установки — скачать веса — и потом для обновлений, которые запускаются вручную.

Нужно ли обучать свою нейросеть для компании? Почти никогда. В большинстве задач достаточно открытой модели плюс поиска по своим документам — этот путь дешевле, быстрее и не ломается при добавлении новых документов. Дообучение имеет смысл, когда нужен специфический формат ответа или узкая терминология, и разговор об этом уместен после того, как базовая схема заработала.

Сколько времени занимает запуск локального контура? Технически поднять модель — вопрос дней. Срок съедает не установка, а всё вокруг: сбор документов, договорённость о том, что считать правильным ответом, интеграция с рабочими инструментами и проверка на реальных данных. Кейс «Синтез речи» собран за одну сессию, но там была одна задача и один пользователь.

Что делать, если локальная модель отвечает хуже облачной? Сначала проверить не модель, а вход: как нарезаны документы, что попадает в поиск, насколько чётко сформулирована задача. В большинстве случаев прирост даёт исправление этих трёх вещей, а не замена модели на более крупную. Если после этого разрыв остаётся — значит, задача из тех, где облако объективно сильнее, и её стоит отдать облаку.


Локальная модель — не замена облаку, а способ убрать чувствительные данные из чужого контура и снять зависимость от чужих тарифов. Начинается всё с одного вопроса: какую задачу нужно закрыть и как будет проверяться результат. Обсудить конкретный случай — через контакты.

Бизнес-инженер | цифровые решения

Читать дальше

Контакты

Похожая задача?

Расскажите, что нужно сделать — ответ в течение дня: оценка срока, вилка бюджета и честное предупреждение, если задача решается дешевле, чем вы рассчитывали.