28 сентября 20266 мин чтения

Сколько стоит локальная нейросеть для компании

Сколько памяти нужно открытым моделям от 8 до 284 млрд параметров, какие у них лицензии и когда свой сервер выгоднее облака. Цены на сентябрь 2026 года.

Финансовый директор просит ИТ-отдел посчитать, во что обойдётся своя нейросеть, и получает разброс от цены игрового компьютера до цены серверной стойки. Разброс честный, потому что всё зависит от задачи, а сузить его помогают три вопроса. Какая модель справится с вашими документами? Сколько памяти ей понадобится, когда с ней одновременно работают десятки сотрудников? И выйдет ли свой сервер дешевле, чем платить облаку за каждый запрос?

Сколько стоит локальная нейросеть

Главная статья расходов — сервер с видеокартой, и его цену определяет память карты. На конец сентября 2026 года крупный российский хостинг сдаёт выделенный сервер с одной картой на 24 ГБ от 56 900 ₽ в месяц, с картой на 96 ГБ — от 125 500 ₽, с картой на 141 ГБ — от 415 800 ₽.

К аренде добавляются разработка, чтобы подключить модель к вашим документам и системам, и поддержка. Какая карта нужна, зависит от размера модели и от того, сколько людей работает с ней одновременно.

Сколько памяти нужно модели

Память уходит на две вещи. Первая — веса модели, то есть числа, в которых записано всё, чему она научилась. При обычной 16-битной точности каждый параметр занимает 2 байта, поэтому модели на 7 млрд параметров нужно около 14 ГБ. Модели часто хранят с меньшей точностью, это называется квантизацией: в 8 битах параметр занимает 1 байт, в 4 битах — полбайта, и та же модель помещается в 7 или 3,5 ГБ.

Вторая — память под разговоры. Пока модель читает вопрос и найденные документы, она держит их в видеопамяти. В расчёте NVIDIA для модели на 7 млрд параметров один разговор длиной 4 096 токенов (так называют кусочки слов) занимает около 2 ГБ. У новых моделей эта часть меньше, но растёт так же, с каждым сотрудником, который пишет одновременно. Поэтому карту подбирают под веса плюс запас на всех, кто будет работать в пиковый час.

Какие открытые модели можно поставить у себя

Модели ниже опубликованы разработчиками вместе с весами и разрешают коммерческое использование. Данные — из их карточек на Hugging Face на конец сентября 2026 года.

МодельПараметров всего / активныхЛицензияВеса на диске
YandexGPT 5 Lite8 млрд / 8 млрдсвоя, от Яндекса4,9 ГБ в 4 битах
GigaChat 3.1 Lightning10 млрд / 1,8 млрдMIT12,3 ГБ в 8 битах
Qwen3.6-35B-A3B35 млрд / 3 млрдApache 2.037,5 ГБ в 8 битах
gpt-oss-120b от OpenAI117 млрд / 5,1 млрдApache 2.0около 65 ГБ
DeepSeek-V4-Flash284 млрд / 13 млрдMITоколо 160 ГБ

У YandexGPT 5 Lite лицензия особая. Коммерческое использование она разрешает, но, когда модель выдаёт больше 10 млн токенов в месяц, нужно в течение 30 дней договориться с Яндексом о дальнейших условиях. В её разделе ограничений упомянуты персональные данные и коммерческая тайна, поэтому, если вы собираетесь работать с такими данными, покажите лицензию юристу до того, как строить на ней систему.

Какой сервер нужен под вашу задачу

Три конфигурации для компании на 100–300 человек, они условные, подставьте свои задачи. Цены аренды взяты у того же хостинга, для двух карт по 141 ГБ — облачный сервер с почасовой оплатой.

ЗадачаМодель для примераПамять под весаСерверАренда в месяц
Помощник по регламентам для одного отделаGigaChat 3.1 Lightningоколо 12 ГБодна карта на 24 ГБот 56 900 ₽
Поиск по договорам для нескольких отделовQwen3.6-35B-A3B или gpt-oss-120b38–65 ГБодна карта на 96 ГБот 125 500 ₽
Сложные рассуждения и ИИ-агенты на крупной моделиDeepSeek-V4-Flashоколо 160 ГБдве карты по 141 ГБоколо 1 млн ₽ в облаке при работе круглые сутки

Самое неочевидное в этих таблицах — разница между двумя числами параметров. Модели с пометкой вроде «35B-A3B» устроены как набор специалистов: на каждое слово включается только малая часть сети. Поэтому Qwen3.6 тратит на каждое слово примерно столько вычислений, сколько модель на 3 млрд параметров, а памяти требует как модель на 35 млрд.

У DeepSeek-V4-Flash активных параметров 13 млрд, но в память нужно уместить все 284 млрд, и одной карты на 141 ГБ для неё уже не хватит. Число активных параметров говорит о скорости, а цену железа определяет общее, и если подбирать карту по первому числу, модель просто не запустится.

Нейросеть внутри вашего контура

Подберём модель и сервер под ваши задачи и развернём их у вас.

Обсудить задачу

Выгоднее ли свой сервер, чем облако

Посчитаем на условной компании, числа подставьте свои. Допустим, 50 сотрудников задают помощнику по 40 вопросов в день, и на каждый вопрос с найденными документами и ответом уходит около 3 000 токенов. За 22 рабочих дня набегает 132 млн токенов в месяц. По тарифам GigaChat API для юрлиц на сентябрь 2026 года это около 8 600 ₽ в месяц на модели Lite и около 66 000 ₽ на модели Pro.

Сервер с одной картой на 24 ГБ стоит от 56 900 ₽ в месяц, и это без разработки и поддержки. Облачная Lite выходит дешевле в шесть с лишним раз, а Pro обходится примерно как аренда.

При таком объёме своя модель деньги не экономит, и выбирают её по другой причине: клиентскую базу, договоры или учёт нельзя отдавать внешнему сервису. Если такого ограничения нет, облачная модель чаще обходится проще, а если есть, считать нужно уже не цену токена, а цену утечки.

Вопросы о железе и моделях

Можно ли запустить нейросеть на обычном компьютере?

Для пробы — да. Младшая открытая модель OpenAI, gpt-oss-20b, по словам разработчиков, работает в 16 ГБ памяти, а YandexGPT 5 Lite в 4-битной версии занимает меньше 5 ГБ. Но для работы отдела нужен сервер с общим доступом, правами и журналом запросов.

Какую модель выбрать для текстов на русском?

Ту, что лучше справится с вашими документами, а не с чужими тестами. Соберите 50–100 настоящих вопросов сотрудников с правильными ответами и прогоните по ним две-три модели разного размера. Результаты, которые публикуют разработчики, получены на их наборах задач, и ваших регламентов там нет.

Сервер лучше купить или арендовать?

Аренда позволяет начать без закупки и сменить конфигурацию, если модель понадобится другая. Покупку имеет смысл считать, когда задача и нагрузка устоялись. В обоих случаях сервер должен быть под управлением компании, чтобы данные не покидали её контур.

Источники
  • NVIDIA Technical Blog, «Mastering LLM Techniques: Inference Optimization», 17.11.2023.
  • Карточки моделей на Hugging Face: yandex/YandexGPT-5-Lite-8B-instruct (и лицензия), ai-sage/GigaChat3.1-10B-A1.8B, Qwen/Qwen3.6-35B-A3B, openai/gpt-oss-120b, deepseek-ai/DeepSeek-V4-Flash — на 28.09.2026.
  • Selectel, выделенные серверы с GPU — selectel.ru/services/gpu, цены на 28.09.2026.
  • Тарифы GigaChat API для юрлиц, обновлено 16.09.2026 — developers.sber.ru.

Обновлено 28 сентября 2026 · Редакция Rule 90

Современные цифровые решения