Финансовый директор просит ИТ-отдел посчитать, во что обойдётся своя нейросеть, и получает разброс от цены игрового компьютера до цены серверной стойки. Разброс честный, потому что всё зависит от задачи, а сузить его помогают три вопроса. Какая модель справится с вашими документами? Сколько памяти ей понадобится, когда с ней одновременно работают десятки сотрудников? И выйдет ли свой сервер дешевле, чем платить облаку за каждый запрос?
Сколько стоит локальная нейросеть
Главная статья расходов — сервер с видеокартой, и его цену определяет память карты. На конец сентября 2026 года крупный российский хостинг сдаёт выделенный сервер с одной картой на 24 ГБ от 56 900 ₽ в месяц, с картой на 96 ГБ — от 125 500 ₽, с картой на 141 ГБ — от 415 800 ₽.
К аренде добавляются разработка, чтобы подключить модель к вашим документам и системам, и поддержка. Какая карта нужна, зависит от размера модели и от того, сколько людей работает с ней одновременно.
Сколько памяти нужно модели
Память уходит на две вещи. Первая — веса модели, то есть числа, в которых записано всё, чему она научилась. При обычной 16-битной точности каждый параметр занимает 2 байта, поэтому модели на 7 млрд параметров нужно около 14 ГБ. Модели часто хранят с меньшей точностью, это называется квантизацией: в 8 битах параметр занимает 1 байт, в 4 битах — полбайта, и та же модель помещается в 7 или 3,5 ГБ.
Вторая — память под разговоры. Пока модель читает вопрос и найденные документы, она держит их в видеопамяти. В расчёте NVIDIA для модели на 7 млрд параметров один разговор длиной 4 096 токенов (так называют кусочки слов) занимает около 2 ГБ. У новых моделей эта часть меньше, но растёт так же, с каждым сотрудником, который пишет одновременно. Поэтому карту подбирают под веса плюс запас на всех, кто будет работать в пиковый час.
Какие открытые модели можно поставить у себя
Модели ниже опубликованы разработчиками вместе с весами и разрешают коммерческое использование. Данные — из их карточек на Hugging Face на конец сентября 2026 года.
| Модель | Параметров всего / активных | Лицензия | Веса на диске |
|---|---|---|---|
| YandexGPT 5 Lite | 8 млрд / 8 млрд | своя, от Яндекса | 4,9 ГБ в 4 битах |
| GigaChat 3.1 Lightning | 10 млрд / 1,8 млрд | MIT | 12,3 ГБ в 8 битах |
| Qwen3.6-35B-A3B | 35 млрд / 3 млрд | Apache 2.0 | 37,5 ГБ в 8 битах |
| gpt-oss-120b от OpenAI | 117 млрд / 5,1 млрд | Apache 2.0 | около 65 ГБ |
| DeepSeek-V4-Flash | 284 млрд / 13 млрд | MIT | около 160 ГБ |
У YandexGPT 5 Lite лицензия особая. Коммерческое использование она разрешает, но, когда модель выдаёт больше 10 млн токенов в месяц, нужно в течение 30 дней договориться с Яндексом о дальнейших условиях. В её разделе ограничений упомянуты персональные данные и коммерческая тайна, поэтому, если вы собираетесь работать с такими данными, покажите лицензию юристу до того, как строить на ней систему.
Какой сервер нужен под вашу задачу
Три конфигурации для компании на 100–300 человек, они условные, подставьте свои задачи. Цены аренды взяты у того же хостинга, для двух карт по 141 ГБ — облачный сервер с почасовой оплатой.
| Задача | Модель для примера | Память под веса | Сервер | Аренда в месяц |
|---|---|---|---|---|
| Помощник по регламентам для одного отдела | GigaChat 3.1 Lightning | около 12 ГБ | одна карта на 24 ГБ | от 56 900 ₽ |
| Поиск по договорам для нескольких отделов | Qwen3.6-35B-A3B или gpt-oss-120b | 38–65 ГБ | одна карта на 96 ГБ | от 125 500 ₽ |
| Сложные рассуждения и ИИ-агенты на крупной модели | DeepSeek-V4-Flash | около 160 ГБ | две карты по 141 ГБ | около 1 млн ₽ в облаке при работе круглые сутки |
Самое неочевидное в этих таблицах — разница между двумя числами параметров. Модели с пометкой вроде «35B-A3B» устроены как набор специалистов: на каждое слово включается только малая часть сети. Поэтому Qwen3.6 тратит на каждое слово примерно столько вычислений, сколько модель на 3 млрд параметров, а памяти требует как модель на 35 млрд.
У DeepSeek-V4-Flash активных параметров 13 млрд, но в память нужно уместить все 284 млрд, и одной карты на 141 ГБ для неё уже не хватит. Число активных параметров говорит о скорости, а цену железа определяет общее, и если подбирать карту по первому числу, модель просто не запустится.
Подберём модель и сервер под ваши задачи и развернём их у вас.
Выгоднее ли свой сервер, чем облако
Посчитаем на условной компании, числа подставьте свои. Допустим, 50 сотрудников задают помощнику по 40 вопросов в день, и на каждый вопрос с найденными документами и ответом уходит около 3 000 токенов. За 22 рабочих дня набегает 132 млн токенов в месяц. По тарифам GigaChat API для юрлиц на сентябрь 2026 года это около 8 600 ₽ в месяц на модели Lite и около 66 000 ₽ на модели Pro.
Сервер с одной картой на 24 ГБ стоит от 56 900 ₽ в месяц, и это без разработки и поддержки. Облачная Lite выходит дешевле в шесть с лишним раз, а Pro обходится примерно как аренда.
При таком объёме своя модель деньги не экономит, и выбирают её по другой причине: клиентскую базу, договоры или учёт нельзя отдавать внешнему сервису. Если такого ограничения нет, облачная модель чаще обходится проще, а если есть, считать нужно уже не цену токена, а цену утечки.
Вопросы о железе и моделях
Можно ли запустить нейросеть на обычном компьютере?
Для пробы — да. Младшая открытая модель OpenAI, gpt-oss-20b, по словам разработчиков, работает в 16 ГБ памяти, а YandexGPT 5 Lite в 4-битной версии занимает меньше 5 ГБ. Но для работы отдела нужен сервер с общим доступом, правами и журналом запросов.
Какую модель выбрать для текстов на русском?
Ту, что лучше справится с вашими документами, а не с чужими тестами. Соберите 50–100 настоящих вопросов сотрудников с правильными ответами и прогоните по ним две-три модели разного размера. Результаты, которые публикуют разработчики, получены на их наборах задач, и ваших регламентов там нет.
Сервер лучше купить или арендовать?
Аренда позволяет начать без закупки и сменить конфигурацию, если модель понадобится другая. Покупку имеет смысл считать, когда задача и нагрузка устоялись. В обоих случаях сервер должен быть под управлением компании, чтобы данные не покидали её контур.
- NVIDIA Technical Blog, «Mastering LLM Techniques: Inference Optimization», 17.11.2023.
- Карточки моделей на Hugging Face: yandex/YandexGPT-5-Lite-8B-instruct (и лицензия), ai-sage/GigaChat3.1-10B-A1.8B, Qwen/Qwen3.6-35B-A3B, openai/gpt-oss-120b, deepseek-ai/DeepSeek-V4-Flash — на 28.09.2026.
- Selectel, выделенные серверы с GPU — selectel.ru/services/gpu, цены на 28.09.2026.
- Тарифы GigaChat API для юрлиц, обновлено 16.09.2026 — developers.sber.ru.
Обновлено 28 сентября 2026 · Редакция Rule 90