Разговор про ИИ в компании почти всегда начинается с вопроса «какое железо покупать». Это неправильный первый вопрос, и он обходится дорого. Ниже — действующая система, реальные счета за три месяца и шесть случаев, когда своё GPU-железо всё-таки нужно.
Разбор документов, поиск по внутренней базе знаний, подготовка ответов, проверка договоров, помощники сотрудников — всё это работает на обычном сервере. Нужны правильно построенная система агентов и обезличивание данных перед обращением к модели.
Вот счёт за нашу действующую систему: девять агентов, восемь пользователей, работает с июля 2026 года.
Если вы не попадаете ни в один из шести случаев из раздела 8, покупка оборудования означает купить мощность, которую нечем загрузить.
Поставщик оборудования зарабатывает на оборудовании, поэтому первый же разговор с интегратором уходит в спецификацию серверов, а не в вопрос «что мы, собственно, автоматизируем».
Частый приём: проектирование «бесплатно» при покупке комплекса. Стоимость проектирования — а это десятки миллионов — просто переносится в цену железа. И архитектор, который считает вам конфигурацию, работает на того, кто эту конфигурацию продаёт.
Обучение и дообучение действительно требуют тяжёлых вычислений. Но в автоматизации процессов никто ничего не обучает: модели дают текст и получают ответ. Это принципиально другой профиль нагрузки.
Логика «наши данные не должны уходить наружу, значит нужна своя модель» пропускает вариант посередине: обезличить данные до обращения к модели, на вашем сервере. Как это устроено — в разделах 3 и 4.
Референсы с презентаций — это платформы на тысячи пользователей с сотнями одновременных запросов. Если у вас сто человек и три десятка процессов, ваша нагрузка отличается не на проценты, а на два порядка.
Модели, которые распознают речь, читают сканы, находят в тексте фамилии и реквизиты, строят индекс для поиска, — маленькие. Они видят ваши данные в исходном виде, поэтому работают внутри периметра или в российском сервисе распознавания, без передачи за рубеж. На своём сервере им хватает обычного процессора.
Модель, которая пишет связный текст и рассуждает, — большая, и ей нужно дорогое железо. Но ей можно отдавать уже обезличенный материал.
Отсюда правило: держите локально маленькое, отдавайте наружу большое — после обезличивания. Вы получаете основную часть защиты за малую часть стоимости.
Обратный порядок встречается чаще, чем хотелось бы: компания покупает комплекс за десятки миллионов, чтобы держать генеративную модель у себя, и при этом отправляет сканы документов в зарубежный облачный сервис распознавания.
Речь и сканы законно распознавать двумя способами: моделями на вашем сервере, как в системе из раздела 4, или российским сервисом по API. Распознавание речи там стоит 0,15–0,65 ₽ за минуту, страница печатного текста около 0,13 ₽, таблицы и рукописный текст 1,2–1,5 ₽ (публичные тарифы Yandex SpeechKit, T-Bank VoiceKit и Yandex Vision, сентябрь 2026). Сырые данные остаются в России, режим их обработки закрепляется договором с сервисом. Зарубежные сервисы распознавания для сырых данных не подходят.
Сложность такого проекта не в железе. Она в том, чтобы система была рабочей, а не демонстрационной: каждое утверждение сопровождается ссылкой на источник, факт из документа отличается от предположения модели, арифметика и сверки делаются обычным кодом, значимые решения подтверждает человек, а журнал нельзя отредактировать задним числом. После такого разбора заметная часть задач вообще не требует ИИ и закрывается обычным кодом — дешевле и надёжнее.
Работает с июля 2026 года на сервере заказчика в России. Девять агентов над почтой, мессенджером, сетевым диском, диктофоном и календарём, восемь пользователей. Один из агентов разбирает договоры контрагентов: стороны, реквизиты, суммы, сроки, опасные условия по корпоративному перечню рисков.
Для масштаба: типовой договор — 10–30 страниц. Речь расшифровывается на процессоре чуть медленнее реального времени: на секунду записи уходит около 1,4 секунды. Страница скана читается за три секунды. За последние 30 дней все пять моделей вместе были заняты около 12 минут в сутки. Второй наш проект у другого заказчика стоит на ещё более скромной машине: 8 ядер, 16 ГБ, тоже без видеокарты.
Обезличивание идёт в пять стадий, каждая ловит то, что пропустила предыдущая: словарь заказчика, строгие форматы (ИНН, счета, телефоны, паспорта, адреса), организационно-правовые формы, искажения после распознавания сканов, машинное выделение имён.
Про зарубежные модели честно. Основная генеративная модель внешняя, выход только через контролируемый мост после обезличивания. Для части лёгких задач мы используем российскую модель. Для разбора документов — нет: по нашему замеру на этой задаче она дала неприемлемый результат примерно в половине случаев. Как только качество подтянется, замена делается на уровне одной точки подключения, а не переписыванием системы.
Видеокарта нужна не агенту, а отдельной задаче внутри него. Один агент обычно состоит из пяти-шести задач, и почти все они идут на процессоре. Ниже — разбор по задачам, замеры взяты с системы из раздела 4.
| Задача | Где выполняется | Замер на действующей системе |
|---|---|---|
| Расшифровка речи | Процессор | На секунду записи уходит 1,4 секунды. За 30 дней 51 запись, 46 минут аудио, 64 минуты работы |
| Разделение говорящих | Процессор | 48 прогонов за 30 дней, 64 минуты работы суммарно |
| Распознавание сканов | Процессор | Страница за 2,7 секунды по медиане, девять страниц из десяти до 8,5 секунды. 846 страниц и 11 минут работы за 30 дней |
| Поиск по внутренней базе | Процессор | 9 001 фрагмент за 30 дней, 1,2 секунды на фрагмент. Самая нагруженная локальная задача: 185 минут за месяц |
| Обезличивание перед отправкой наружу | Процессор | 44 минуты работы за 30 дней на 9 137 вызовов. Всего 28 678 сессий обезличивания с июля |
| Разбор договора, рассуждение по длинному тексту | Внешняя модель после обезличивания | Единственная задача, которая уходит наружу. Требует качества, которого нет у моделей, влезающих на одну-две карты: у них 34 балла сводного индекса против 53 у внешних лидеров |
| Подготовка ответов и текстов | Внешняя модель после обезличивания | Входит в тот же счёт за внешнюю модель: 19,4 $ за последние 30 дней на всю систему из девяти агентов |
| Расшифровка речи при большом потоке | Одна карта рабочего класса или российский сервис по API | Аренда карты 30–60 тыс. ₽ в месяц. Российский API: 0,15–0,65 ₽ за минуту записи. Порог перехода считается делением: сервер на 16 ядер и 32 ГБ стоит около 23 тыс. ₽ и покрывает 37 тыс. минут |
| Массовая однотипная разметка потока документов | Своя карта | Единственный случай, когда карта загружена круглосуточно, а не всплесками. У нас такой задачи нет, поэтому замера нет |
| Генеративная модель внутри контура | Узел с ускорителями | 590 тыс. ₽ в месяц за контур, где модель набирает 34 балла качества, или от 5,4 млн ₽ за контур под модели на 44–45 баллов. Внешняя модель верхнего уровня даёт 53 |
Замеры сняты с журналов действующей системы за 30 дней, сентябрь 2026. Цены аренды и API — открытые прайсы российских провайдеров, сентябрь 2026.
Пять верхних строк — это всё, из чего состоит работа девяти агентов изо дня в день, и все они умещаются в 12 минут процессорного времени в сутки. Наружу уходит только рассуждение, и оно занимает меньше процента времени. Отсюда и ответ: карта покупается не под агента, а под одну конкретную строку этой таблицы, когда она у вас окажется постоянно загруженной.
Рыночные ориентиры осени 2026, аренда с НДС. В таблице только инфраструктура: серверы, аренда и покупка оборудования, плата за обращения к модели.
| Сценарий | Что входит | В месяц |
|---|---|---|
| А. Обычный сервер и внешняя модель | Сервер в российском контуре 15–40 тыс. ₽; 16 ядер и 32 ГБ в крупном российском облаке стоят около 23 тыс. ₽. Плата за обращения к модели по факту: в системе из раздела 4 это 2–3 тыс. ₽ | 20–45 тыс. ₽ |
| Б. Минимальный GPU-контур в аренде | Управляющий узел, узел веб-интерфейса, два узла с ускорителями по 96 ГБ. На них помещаются компактные открытые модели. Лучшая из тех, что входит на одну карту, набирает 34 балла в сводном индексе качества Artificial Analysis против 53 у внешних моделей верхнего уровня (сентябрь 2026) | около 590 тыс. ₽ |
| В. Контур под лучшие открытые модели в аренде | Лучшие открытые модели набирают 44–45 баллов того же индекса. В них от 750 млрд параметров, и в память должны поместиться все. Это узел из восьми старших ускорителей, и то со сжатием модели | от 5,4 млн ₽ |
| Г. Покупка комплекса | От 17–19 млн ₽ за сервер с двумя старшими ускорителями до 75–80 млн ₽ за узел из восьми (открытые прайсы российских интеграторов, сентябрь 2026; серверов с одним таким ускорителем в продаже нет). Поддержка 3,5–7 млн ₽ в год. Сверх сметы поставщика: помещение, питание 8–11 кВт на узел, охлаждение, бесперебойники и люди. Поставка занимает три-пять месяцев | разово, до первого результата |
Между сценариями А и Б разница в инфраструктурных расходах в 13–30 раз, и модель в сценарии Б слабее. На сопоставимом качестве модели сравнивать нужно А и В, там разница больше чем в сто раз. В сценарии Г порядок тот же, что в Б и В, но деньги вложены до того, как получен первый результат.
Своё железо начинает выигрывать, когда плата за обращения к модели превышает стоимость контура. Аренда минимального контура стоит около 7 тысяч долларов в месяц. При цене разбора договора 12–13 центов через внешнюю модель верхнего уровня это 55 тысяч разборов в месяц, две с половиной тысячи в рабочий день.
Это нижняя граница. Свой контур держит открытую модель, и честное сравнение идёт с ценой такой же открытой модели по API. Тот же разбор (10 тыс. токенов на входе, 1,2 тыс. на выходе) стоит там 0,6–0,9 цента, и порог уходит к миллиону разборов в месяц, это 40–50 тысяч в рабочий день.
Себестоимость токена на своей карте ещё и зависит от того, сколько времени она занята: в опубликованном расчёте для одного и того же ускорителя она меняется от 0,31 до 7,6 доллара за миллион токенов между полной и слабой загрузкой (arXiv 2606.11690, июнь 2026). Корпоративная нагрузка идёт всплесками: в нашей системе медиана 57 обращений в сутки при пике 64 в минуту.
Проверьте свой объём по этой логике, прежде чем обсуждать спецификацию. Если у вас сотни тяжёлых операций в день, а не десятки тысяч, — вопрос о GPU закрыт.
Оценка построена на установившемся профиле системы из раздела 4 с середины августа, без разовых прогонов по архиву. Профиль плотный: в систему идёт вся почта, все чаты, диктофон и сетевой диск руководителя. Обычный сотрудник, по нашей оценке, даёт в пять-десять раз меньше, и тогда строку «1 000 пользователей» стоит читать как 5–10 тысяч сотрудников. Отраслевой статистики потребления на сотрудника не опубликовано, поэтому этот коэффициент проверяется пилотом на ваших данных.
| Пользователей | Локальные модели, процессор в сутки | Сервер |
|---|---|---|
| 8 (факт) | 12 минут | 16 ядер |
| 100 | 2,5 часа | тот же |
| 500 | 12 часов | 32–48 ядер или два узла |
| 1 000 | около суток | несколько узлов, российский сервис распознавания или одна видеокарта под предобработку |
Отдельной строкой в бюджет идут разовые прогоны по накопленному архиву при запуске: в этой системе они заняли 11 дней.
До нескольких сотен пользователей вопрос GPU не возникает: с нагрузкой растёт только число процессорных ядер, а это десятки тысяч рублей в месяц.
Первым упирается не генеративная модель, а предобработка: построение индекса для поиска и распознавание речи. Распознавание можно отдать российскому сервису по API или арендовать одну видеокарту за 30–60 тысяч рублей в месяц: на ней речь распознаётся в 10–50 раз быстрее, чем на процессоре. Плата за модель не догоняет аренду GPU-контура и на тысяче пользователей с плотным профилем.
Введите свои цифры. Справа сразу пересчитывается, какой сервер нужен и сколько это стоит в месяц.
Обычная виртуальная машина в российском облаке или в вашем контуре.
Свои GPU под генеративную модель не нужны. Минимальный GPU-контур в аренде стоит 590 тыс. ₽ в месяц, это в 11 раз дороже всего, что посчитано выше, и модель на нём слабее.
Расчёт стоит на замерах действующей системы из раздела 4 и открытых ценах сентября 2026: 2,8 секунды процессора на секунду аудио с разделением говорящих, 3 секунды на страницу скана, тарифы поставщиков модели и российского распознавания по их публичным прайсам. Сервер считается с запасом: загрузка не выше 80 % за 16 часов в сутки. Это порядок величины для разговора о бюджете, точные цифры даёт пилот.
Шесть случаев. Они реальны, и их надо распознать честно.
Обезличивание убирает имена и реквизиты, но сохраняет цены, сроки и формулировки — иначе проверять нечего. Если для вашего класса данных неприемлемо и это, нужен локальный контур. Обычно сюда попадают взаимодействие с государством, сведения об акционерах, государственная тайна.
Порог — в разделе 6. Считается арифметикой, а не ощущением.
Если ИИ-инструменты пишут код и читают ваши репозитории, наружу уходит исходный код — непрерывно и много. Здесь требование локальности возникает чаще всего. Но решение принимается по классу кода, а не для всех репозиториев сразу: локальные модели для кода заметно слабее облачных, и команды разработки идут в облако даже при строгих режимах.
Объекты под 187-ФЗ и работа с гостайной решаются не экономикой.
Производственный контур, который обязан работать без внешних каналов связи. Тогда всё, включая генеративную модель, стоит внутри.
Массовая классификация и разметка потока документов на постоянной основе. Это второй случай с другой стороны: железо загружено круглосуточно, а не пиками.
Даже в случаях 1, 3 и 5 локально должно быть не всё. Чаще правильный ответ — маршрутизация: чувствительный класс данных обрабатывается локально, остальное идёт внешней модели после обезличивания. Так вы платите за GPU под узкую полосу задач, а не под весь объём.
Если ни на один пункт не ответили «да» — свои GPU вам не нужны, и разговор надо начинать с процессов, а не с оборудования.
Если ответа нет — железо будет стоять. Мы регулярно видим купленные мощности, загруженные на единицы процентов, потому что купили раньше, чем определили сценарии.
Арендованный контур разворачивается за дни и позволяет заменить конфигурацию, когда станет понятен реальный профиль нагрузки. За время поставки собственного железа — а это три-пять месяцев — решение уже будет работать и покажет настоящие требования.
Не закупку и не проектирование комплекса, а разбор процессов и сценариев: что автоматизируем, какие данные участвуют и к какому классу относятся, какой ожидается объём операций. На выходе — карта сценариев с разметкой «здесь обычный код, здесь модель, здесь решает человек» и обоснованный ответ на вопрос про железо.
Если окажется, что локальный контур нужен, мы посчитаем его открытой книгой — с закупочными ценами, без своей маржи в оборудовании. Если окажется, что не нужен, мы так и скажем. Нам это выгоднее, чем продать мощность, которая будет простаивать, и потом год объяснять, почему проект не принёс результата.
Калькулятор выше считает по цифрам, которые вы ввели сами. Если объём задан на глаз, итог будет таким же. На консультации проходим по вашим процессам и уточняем объёмы: какие данные участвуют, к какому классу они относятся, сколько операций в день. Оставьте контакт, договоримся о времени.