Продукты
De Novo
Партнерство
Блог
Контакты
Меню
Продукты
Продукты
Kubernetes as a Service
Частное облако
Хранение данных
De Novo
De Novo
Аттестаты и сертификаты
Аттестаты и сертификаты
Сертификаты De Novo
Операционные процессы и информационная безопасность De Novo подтверждены международной и государственной сертификацией и соответствуют требованиям корпоративного бизнеса
Работа в De Novo
Партнерство
Контакты
Главная Блог компании De Novo Какая облачная карта GPU лучше? Практический опыт Data Science UA
Какая облачная карта GPU лучше? Практический опыт Data Science UA

Какая облачная карта GPU лучше? Практический опыт Data Science UA

2026-09-23

Команда украинской компании Data Science UA получила многократный прирост производительности LLM после перехода с GPU NVIDIA H100 на H200. Чем объясняется такой результат и как в тех же задачах показали себя карты A100?

Недавно мы рассказывали о практическом опыте использования GPU в облаке, которым с нами поделился Константин Черкашин, Solution Architect компании Data Science UA. Один из фактов, упомянутых в интервью, оказался особенно интересным: при работе с LLM-моделью GPT-OSS-120B переход с NVIDIA H100 на H200 обеспечил прирост производительности до 10 раз в отдельных задачах.

На первый взгляд такой результат неочевиден: разница в вычислительной мощности между H100 и H200 сама по себе не объясняет столь существенного ускорения. Поэтому мы обратились к Константину Черкашину за дополнительными пояснениями и попросили его прокомментировать результаты. Помимо NVIDIA H100 и H200, команда также протестировала вариант с двумя картами A100.

Почему NVIDIA H200 оказалась лучше H100 и даже двух A100

Как объяснил Константин Черкашин, основная причина, по которой H100 уступила H200, — нехватка видеопамяти для KV-кэша. Специфика задачи, для которой использовались эти GPU, предполагает практически максимальную загрузку ускорителей: у команды постоянно есть вычислительные задачи. В таких условиях H100 приходилось тратить часть времени на управление кэшем, тогда как больший объем памяти H200 позволял хранить больше данных и эффективнее использовать вычислительный потенциал карты.

С учетом этого команда решила протестировать две A100 в связке. В сумме они имели на 20 ГБ видеопамяти больше, чем одна H200, а по показателю TFLOPS уступали ей всего в 1,6 раза. Поэтому логично было предположить, что производительность снизится не более чем вдвое по сравнению с H200.

Однако на практике она оказалась почти в пять раз ниже, а результат — лишь немного лучше, чем у H100. Причина заключается в архитектурных различиях: A100 заметно уступает H100 и H200 по производительности современных вычислительных блоков. Поэтому даже при достаточном объеме памяти те же операции выполнялись значительно медленнее.

Почему KV-кэш важен для LLM

Во время генерации ответа модель последовательно обрабатывает токены и на каждом следующем шаге учитывает ранее обработанный контекст. Чтобы не выполнять одни и те же вычисления повторно, промежуточные данные сохраняются в KV-кэше, размещенном в видеопамяти GPU. 

Объем KV-кэша растет вместе с длиной контекста и количеством одновременно обрабатываемых запросов, а также зависит от архитектуры и параметров самой модели. Поэтому видеопамять ускорителя используется не только для хранения LLM, но и для данных, необходимых непосредственно во время инференса. При высокой нагрузке доступный объем видеопамяти может становиться одним из факторов, ограничивающих производительность GPU.

Главный вывод состоит в том, что каждая модель имеет свои особенности и требования к вычислительным ресурсам, а итоговая производительность во многом зависит от конкретной задачи. При несколько меньшей нагрузке H100 могла бы показать лучший результат.

Однако для описанного сценария с полной загрузкой GPT-OSS-120B именно H200 оказалась оптимальным вариантом с точки зрения баланса вычислительной мощности и объема видеопамяти. Связка из двух A100 показала результат лишь немного лучше H100, поэтому в таком сценарии она экономически невыгодна: две A100 стоят дороже одной H100.

При этом такой результат не означает, что A100 в целом неэффективны. Благодаря большему совокупному объему памяти они позволяют запускать модели с более высокими требованиями к VRAM и, несмотря на меньшую вычислительную производительность, в отдельных сценариях могут обеспечивать более подходящую конфигурацию. При умеренной нагрузке такая система также может оказаться эффективной для определенных моделей и задач. Аналогично H100 при работе с менее требовательными моделями способна демонстрировать высокую производительность.

© 2008—2026 De Novo (ТОВ «Де Ново»)