Какая облачная карта GPU лучше? Практический опыт Data Science UA
2026-09-23
De Novo Cloud Expert
Команда украинской компании Data Science UA получила многократный прирост производительности LLM после перехода с GPU NVIDIA H100 на H200. Чем объясняется такой результат и как в тех же задачах показали себя карты A100?
Недавно мы рассказывали о практическом опыте использования GPU в облаке, которым с нами поделился Константин Черкашин, Solution Architect компании Data Science UA. Один из фактов, упомянутых в интервью, оказался особенно интересным: при работе с LLM-моделью GPT-OSS-120B переход с NVIDIA H100 на H200 обеспечил прирост производительности до 10 раз в отдельных задачах.
На первый взгляд такой результат неочевиден: разница в вычислительной мощности между H100 и H200 сама по себе не объясняет столь существенного ускорения. Поэтому мы обратились к Константину Черкашину за дополнительными пояснениями и попросили его прокомментировать результаты. Помимо NVIDIA H100 и H200, команда также протестировала вариант с двумя картами A100.
Почему NVIDIA H200 оказалась лучше H100 и даже двух A100
Как объяснил Константин Черкашин, основная причина, по которой H100 уступила H200, — нехватка видеопамяти для KV-кэша. Специфика задачи, для которой использовались эти GPU, предполагает практически максимальную загрузку ускорителей: у команды постоянно есть вычислительные задачи. В таких условиях H100 приходилось тратить часть времени на управление кэшем, тогда как больший объем памяти H200 позволял хранить больше данных и эффективнее использовать вычислительный потенциал карты.
С учетом этого команда решила протестировать две A100 в связке. В сумме они имели на 20 ГБ видеопамяти больше, чем одна H200, а по показателю TFLOPS уступали ей всего в 1,6 раза. Поэтому логично было предположить, что производительность снизится не более чем вдвое по сравнению с H200.
Однако на практике она оказалась почти в пять раз ниже, а результат — лишь немного лучше, чем у H100. Причина заключается в архитектурных различиях: A100 заметно уступает H100 и H200 по производительности современных вычислительных блоков. Поэтому даже при достаточном объеме памяти те же операции выполнялись значительно медленнее.
Почему KV-кэш важен для LLM
Во время генерации ответа модель последовательно обрабатывает токены и на каждом следующем шаге учитывает ранее обработанный контекст. Чтобы не выполнять одни и те же вычисления повторно, промежуточные данные сохраняются в KV-кэше, размещенном в видеопамяти GPU.
Объем KV-кэша растет вместе с длиной контекста и количеством одновременно обрабатываемых запросов, а также зависит от архитектуры и параметров самой модели. Поэтому видеопамять ускорителя используется не только для хранения LLM, но и для данных, необходимых непосредственно во время инференса. При высокой нагрузке доступный объем видеопамяти может становиться одним из факторов, ограничивающих производительность GPU.
Главный вывод состоит в том, что каждая модель имеет свои особенности и требования к вычислительным ресурсам, а итоговая производительность во многом зависит от конкретной задачи. При несколько меньшей нагрузке H100 могла бы показать лучший результат.
Однако для описанного сценария с полной загрузкой GPT-OSS-120B именно H200 оказалась оптимальным вариантом с точки зрения баланса вычислительной мощности и объема видеопамяти. Связка из двух A100 показала результат лишь немного лучше H100, поэтому в таком сценарии она экономически невыгодна: две A100 стоят дороже одной H100.
При этом такой результат не означает, что A100 в целом неэффективны. Благодаря большему совокупному объему памяти они позволяют запускать модели с более высокими требованиями к VRAM и, несмотря на меньшую вычислительную производительность, в отдельных сценариях могут обеспечивать более подходящую конфигурацию. При умеренной нагрузке такая система также может оказаться эффективной для определенных моделей и задач. Аналогично H100 при работе с менее требовательными моделями способна демонстрировать высокую производительность.