Fine-tuning и inference LLM для бизнеса: сколько GPU реально нужно

локальный ИИ

Компания, решившая дообучить (fine-tune) языковую модель под свои внутренние данные или развернуть собственный inference-сервис вместо обращения к внешнему API, почти сразу упирается в один и тот же вопрос: сколько именно видеокарт для этого реально нужно. Ответ сильно зависит от того, идёт ли речь об обучении модели с нуля, дообучении существующей открытой модели, или просто о запуске готовой модели для генерации ответов — это три принципиально разные по требованиям к оборудованию задачи, и их часто путают ещё на этапе планирования бюджета.

Inference и fine-tuning — разная нагрузка на видеопамять

Запуск уже готовой модели для генерации ответов (inference) требует видеопамяти, примерно пропорциональной размеру модели — большая открытая модель в 70 миллиардов параметров в сжатом (квантизованном) виде помещается в память одной-двух современных профессиональных видеокарт. Дообучение той же модели требует уже в разы больше памяти, поскольку помимо весов модели нужно хранить градиенты и промежуточные состояния оптимизатора — именно поэтому конфигурации для fine-tuning почти всегда строятся вокруг конфигураций с несколькими видеокартами GamingPC, а не одной, даже самой мощной.

Практическая логика подбора количества GPU

  • Одна видеокарта. Подходит для inference компактных или средних моделей и для экспериментов с дообучением небольших моделей методом LoRA (когда обучается лишь малая часть параметров, а не вся модель целиком).
  • Две видеокарты. Разумный старт для полноценного fine-tuning моделей среднего размера или комфортного inference нескольких пользователей одновременно без длинных очередей запросов.
  • Четыре видеокарты и больше. Требуется для дообучения крупных моделей целиком, параллельной обработки большого потока запросов от множества сотрудников одновременно, либо работы сразу с несколькими моделями в производственном режиме.

Почему объединение памяти нескольких GPU — не просто сложение чисел

Важный технический нюанс: суммарная видеопамять нескольких видеокарт не всегда используется так же эффективно, как одна карта с тем же общим объёмом — требуется программная поддержка распределённых вычислений (например, через библиотеки для мульти-GPU обучения) и достаточно быстрая связь между картами внутри одного сервера, чтобы обмен данными между ними не становился узким местом. Именно поэтому серверные конфигурации для ИИ-задач проектируются как единое целое, с учётом внутренней топологии соединений между видеокартами, а не собираются как набор случайных отдельных карт.

видеокарты для ИИ

Профессиональные ускорители против игровых флагманов для этой задачи

Топовые игровые видеокарты обеспечивают отличную производительность на гигабайт видеопамяти, но профессиональные ускорители с увеличенным объёмом памяти на карту (48 ГБ и выше) позволяют уместить в одном физическом сервере больше суммарной видеопамяти при меньшем количестве карт — что снижает сложность конфигурации и требования к системе охлаждения и питания одновременно. Для бизнес-задач, где сервер работает непрерывно, а не эпизодически, это часто более практичный выбор, чем максимизация чистой вычислительной мощности на карту.

Реальный сценарий: с чего начинают большинство компаний

Типичный путь малого и среднего бизнеса выглядит так: сначала эксперименты с inference готовых открытых моделей на одной-двух видеокартах, чтобы понять, какие задачи внутри компании реально закрывает локальный ИИ (обработка документов, внутренний чат-бот, анализ обращений клиентов). Только после того как конкретная польза подтверждена на практике, имеет смысл инвестировать в более серьёзную конфигурацию под полноценное дообучение модели под специфику компании — это снижает риск переплаты за мощность, которая в итоге не будет использоваться на полную.

Что помимо GPU часто недооценивают в бюджете

Помимо самих видеокарт, конфигурация для по-настоящему серьёзной ИИ-нагрузки требует достаточного объёма оперативной памяти для подготовки и буферизации данных, быстрых NVMe-накопителей для хранения датасетов и весов моделей, а также процессора с достаточным количеством линий PCIe, чтобы не создавать узкое место при передаче данных между несколькими видеокартами одновременно. Экономия именно на этих сопутствующих компонентах — частая причина, по которой дорогая конфигурация с топовыми видеокартами не показывает ожидаемой производительности на практике.

Вывод

Количество видеокарт, необходимое для локального ИИ, определяется не абстрактным «побольше — лучше», а конкретной задачей: inference, LoRA-дообучение малых моделей или полноценное дообучение крупных моделей требуют принципиально разного объёма видеопамяти и разной внутренней архитектуры сервера. Разумная стратегия — начинать с экспериментов на минимально достаточной конфигурации и масштабироваться по мере подтверждения реальной пользы, а не сразу инвестировать в максимальную мощность «про запас».