VRAM-калькулятор для GPU-сервера: как подобрать память без переплаты
Точный размер VRAM для GPU-сервера — это память самой модели (число параметров умножить на байты на параметр с учётом квантования) плюс запас под контекст, batch и служебный оверхед движка inference, обычно ещё 15–20% сверху. Формулу считают вручную за минуту или прогоняют через VRAM-калькулятор — так конфигурацию под локальную нейросеть рядом с базой 1С подбирают без переплаты за карту и без падений из-за нехватки памяти.
карта на 8 гб и накладные, которые перестали распознаваться
ИТ-специалист компании, которая ведёт закупки и склад в 1С:ERP, разворачивает рядом локальную модель распознавания УПД и накладных — чтобы не гонять сканы документов через внешний облачный API и не передавать реквизиты поставщиков на сторону. Карту берёт по названию модели: в описании нейросети написано «7B параметров», у GPU в характеристиках 8 ГБ памяти — вроде подходит впритык. Первые тестовые документы, по одному, распознаются нормально, тесты проходят гладко, и конфигурацию принимают в работу — никто не прогонял через неё пачку документов, потому что тестовый скрипт всегда отправлял файлы по одному.
Но на реальной партии из 35–40 накладных, которые бухгалтерия обычно загружает одним пакетом в начале дня, процесс падает с ошибкой нехватки памяти. Карта тянет модель саму по себе, но не тянет её одновременно с батчем документов и длинным контекстом многостраничного скана — а именно так система и работает в проде, а не в тесте на одном файле.
что теряет бизнес, пока GPU-сервер простаивает
Пока разбираются, почему падает распознавание, бухгалтерия возвращается к ручному вводу — на партию из 40 накладных это плюс 3–4 часа рабочего времени в день у одного сотрудника. Заявку на замену карты согласовывают несколько дней, ещё какое-то время уходит на физическую замену или миграцию на сервер с другой конфигурацией. За полторы-две недели простоя компания тратит на ручной ввод примерно столько же часов, сколько стоила бы сразу правильно подобранная карта — только эти часы уже не вернуть, а сдвинутый график оприходования склада бьёт по срокам следующих поставок и по датам, на которые закупщики обещали товар клиентам.
Есть и обратная ошибка, которая стоит дороже в моменте, но реже замечается: карту берут сразу с большим запасом «чтобы наверняка», переплачивая за объём VRAM, который никогда не используется под конкретную модель и конкретный поток документов. Разница между «впритык» и «с запасом» без расчёта обычно доходит до 2–3 кратного объёма памяти — и, соответственно, до сопоставимой переплаты за аренду.
как на самом деле считается VRAM
Расчёт распадается на четыре слагаемых, и калькулятор просто складывает их автоматически вместо подсчёта на бумаге.
- ✓вес самой модели. Число параметров умножается на размер одного параметра в байтах: FP16 — 2 байта, INT8 — 1 байт, INT4 — 0,5 байта. Модель на 7 млрд параметров в FP16 весит около 14 ГБ, та же модель в INT4 — около 3,5 ГБ.
- ✓память под контекст. Каждый токен входного и выходного текста откладывает в памяти key-value кэш; чем длиннее промпт (скан многостраничной накладной) и чем больше выходной ответ, тем больше добавка.
- ✓batch и параллельные запросы. Если сервер обрабатывает не один документ за раз, а очередь из нескольких — типичная ситуация при загрузке пачки УПД, — память под контекст умножается на размер батча.
- ✓оверхед движка inference. На CUDA-контекст, промежуточные тензоры и служебные буферы фреймворк резервирует ещё примерно 15–20% сверху от суммы выше — именно этот запас чаще всего забывают при расчёте «на глаз».
На примере той же истории с накладными: модель на 7 млрд параметров в INT4 весит около 3,5 ГБ. Один скан многостраничной накладной откладывает в контексте около 0,7 ГБ. При батче в восемь документов, которые бухгалтерия грузит пачкой, память под контекст вырастает до 5,6 ГБ. Сумма — 9,1 ГБ, плюс 20% оверхеда движка — итог около 11 ГБ. Карта на 8 ГБ, которую взяли по паспорту модели без учёта батча, была тесна примерно на 3 ГБ — именно этой разницы и не хватило на реальной партии документов. Квантование в INT4 не бесплатное: округление весов немного снижает точность распознавания на плохо отсканированных или рукописных суммах, поэтому для задач, где ошибка в цифре дороже места на диске — прогноз спроса, финансовые расчёты, — берут INT8 или FP16, а не гонятся за минимальным объёмом карты.
три конфигурации в цифрах
Одна и та же модель ведёт себя по-разному в зависимости от квантования и нагрузки — таблица показывает, сколько VRAM закладывать под типовые задачи компании на 1С.
| задача | модель и квантование | нужная VRAM | подходящая карта |
|---|---|---|---|
| распознавание УПД и накладных, по одному документу | 7B, INT4 | 6–8 ГБ | 8 ГБ |
| распознавание пачками по 5–10 документов | 7B, INT4 | 10–12 ГБ | 12–16 ГБ |
| чат-бот поддержки на данных 1С | 13B, INT8 | 18–22 ГБ | 24 ГБ |
| прогноз спроса и планирование закупок | 13B, FP16 | 30–34 ГБ | 40–48 ГБ |
Разница между первой и последней строкой — в шесть раз по памяти при похожем размере модели. Прогноз спроса намеренно считают без агрессивного квантования: округления в INT4 искажают числовые ряды сильнее, чем текст, а цена ошибки в закупочном плане выше, чем цена лишней карты. Без расчёта компания либо переплачивает за карту «с запасом», либо берёт минимум и получает падения по OOM на первой же реальной пачке документов.
считать вручную рискованно — ошибка в квантовании стоит переплаты
Ручной подсчёт по формуле подводит в одном месте: инженер закладывает память под FP16, а на проде модель на самом деле развёрнута в INT8 или INT4 — разница в 2–4 раза. VRAM-калькулятор убирает эту ошибку: в него вводят число параметров модели, тип квантования, длину контекста и размер батча, а на выходе — конкретное число гигабайт и запас под пиковую нагрузку, а не под среднюю.
четыре пункта, которые проверяют перед заказом карты
- ✓средняя и максимальная длина контекста на реальных документах компании, а не на тестовом файле;
- ✓пиковый размер батча за месяц — тот день, когда бухгалтерия грузит больше всего накладных сразу;
- ✓квантование, в котором модель реально развёрнута в проде, а не то, в котором её тестировали на ноутбуке;
- ✓оверхед 15–20% сверху и округление до ближайшего доступного объёма карты, а не до минимально достаточного.
Отдельно стоит свериться, что базовые системные требования 1С заложены поверх GPU-конфигурации, а не вместо неё — сервер обслуживает и базу, и нейросеть одновременно, и памяти под СУБД это тоже касается. Локальная модель на своём сервере — ещё и способ не выгружать сканы накладных и данные контрагентов во внешний облачный API: требования 152-ФЗ к обработке персональных данных выполнить проще, когда данные не покидают контур компании.
какой сервер держит GPU-нагрузку рядом с 1С
Виртуальный сервер, где ресурсы делятся между арендаторами, для GPU-инференса не годится — карта не пробрасывается частями, нужен физический доступ к устройству. Под задачи из таблицы выше подходит выделенный сервер в аренду с собственной видеокартой, а базу 1С на нём можно развернуть рядом на отдельном разделе диска или вынести на соседний виртуальный сервер для 1С, если поток документов растёт быстрее, чем нагрузка на GPU. Разделение по разным машинам заодно снимает риск, что тяжёлый батч на распознавании просядет по производительности саму базу 1С в рабочие часы — GPU и СУБД конкурируют за оперативную память и диск, если стоят на одном сервере без запаса.
Для компаний на 1С:ERP, где распознавание и прогноз спроса работают поверх боевой базы, конфигурацию рассчитывают сразу под связку — под это есть отдельная линейка сервер под 1С:ERP. Базовая аренда сервера под 1С начинается от 3300 руб/мес, стоимость GPU-конфигурации считается отдельно под карту и объём VRAM из расчёта выше — и здесь как раз пригождается готовый расчёт вместо покупки карты «с запасом на всякий случай». Драйверы CUDA, выделение памяти под модель и синхронизацию с расписанием обработки документов инженеры настраивают на этапе настройки сервера 1С — до того, как первая пачка накладных ляжет в очередь на распознавание.
Когда поток документов вырастает или в компании добавляют вторую модель — например, к распознаванию накладных добавляется чат-бот поддержки, — расчёт VRAM повторяют под новую конфигурацию, а не масштабируют карту наугад. Пересчёт и донастройку сервера обычно закрывает разовая работа сисадмина, а не отдельный проект: сопровождение и настройка 1С у нас стоит от 3800 руб/час, и на пересчёт конфигурации под вторую модель уходит один такой заход, а не неделя простоя, как в истории с восьмигигабайтной картой в начале статьи. Уточнить конфигурацию под конкретную модель можно через заявку на аренду сервера 1С.
❓ Частые вопросы
Чем VRAM-калькулятор лучше подбора карты по названию модели?
Название модели («7B», «13B») показывает только вес весов, а не реальную нагрузку. Калькулятор добавляет память под контекст, размер батча и оверхед движка — те 30–50% объёма, которые «на глаз» обычно забывают и из-за которых карта падает на реальной пачке документов, а не на тесте.
Хватит ли карты на 8 ГБ для распознавания документов в 1С?
Для одиночных документов на модели 7B в INT4 — да, с запасом. При батче в 5–10 накладных одновременно нужно уже 10–12 ГБ: контекст умножается на размер батча, а не складывается один раз. Точную цифру под свой поток документов даёт расчёт по формуле или калькулятор.
Можно ли поставить GPU для нейросети на тот же сервер, где база 1С?
Технически да, если это выделенный сервер и ресурсов хватает на оба процесса с запасом. На практике GPU и СУБД конкурируют за память и диск в пиковые часы, поэтому при растущем потоке документов нейросеть и базу разносят на два сервера — виртуальный под 1С и выделенный под карту.
Почему для прогноза спроса нужна карта мощнее, чем для распознавания накладных?
Прогноз считает числовые ряды, где округления квантования искажают результат сильнее, чем в тексте. Такие задачи держат на INT8 или FP16 вместо INT4, а это в 2–4 раза больше VRAM на ту же модель — отсюда и разница в конфигурации между распознаванием и прогнозированием в таблице.
Сколько стоит развернуть GPU-сервер под нейросеть рядом с 1С?
Базовая аренда сервера под 1С — от 3300 руб/мес, GPU-конфигурация считается отдельно под карту и объём VRAM из расчёта под конкретную модель и поток документов. Настройка и сопровождение сервера — от 3800 руб/час, обычно один заход инженера закрывает и расчёт, и синхронизацию с базой.
Или позвоните: +7 495 133-92-44 — в рабочее время с 9:00 до 19:00
Остались вопросы? Нужна помощь?
Менеджеры компании с радостью ответят на ваши вопросы, произведут расчет стоимости услуг и подготовят индивидуальное коммерческое предложение.
Бесплатная консультация

