DeepSeek V4 се нарежда сред най-ресурсоемките внедрявания на отворен модел за инференции (изводи, заключения) досега, изисквайки оптимална работа на всички ключови компоненти в инфраструктурата: отделяне на най-важното, изпълнение на MoE модели, квантизация, предвиждане на множество токени (multi-token prediction), планиране, заснемане на графики и разпределена инференция. В рамките на по-малко от месец AMD Instinct™ MI355X GPU постигна над 100-кратно увеличение на производителността върху същия хардуер благодарение на последователни подобрения в изчислителните ядра и софтуерния стек (Фигура 1).
Днес MI355X GPU осигурява водеща производителност на GPU при работа с DeepSeek модели и конкурентно предимство по отношение на разходите за генериране на токени.

Фигура 1: Граница на производителността (throughput frontier) на DeepSeek V4 Pro върху MI355X GPU през първите няколко седмици. Източник: InferenceX open-source benchmarks.
Производителност в реални среди
При инференцията в реална среда не е достатъчно да се измерва единствено максималният брой генерирани токени в секунда. Истинският показател за ефективност е способността на системата да поддържа висока пропускателна способност, като същевременно осигурява бърза реакция и плавно потребителско изживяване.
При DeepSeek V4 Pro, оборудваната с ATOM платформа AMD Instinct™ MI355X GPU постига или надминава производителността на B200 и B300 с Dynamo vLLM по отношение на пропускателната способност на GPU в по-голямата част от диапазона на интерактивност (Фигура 2). Представените резултати се основават на заявка за изтегляне (pull request), подадена към InferenceX, който към момента все още не е интегриран в основния проект.

Фигура 2: Производителност на GPU спрямо интерактивност. DeepSeek V4 Pro 1.6T • FP4 • 8K/1K • Неофициален източник: InferenceX, подадена заявка за изтегляне (pull request), все още не е интегриран в основния проект.
Разход на токен и икономическа ефективност на инфраструктурата
Цената на генерирания токен е показателят, при който технологичните решения започват пряко да влияят върху бизнес резултатите. Затова коректната оценка трябва да се базира на прозрачен модел за обща стойност на притежание (TCO), съобразен с изискваното ниво на интерактивност за конкретното приложение.
При DeepSeek R1 0528 (FP4, 8K/1K, с активиран MTP) AMD Instinct™ MI355X GPU, използващ MoRI + SGLang + MTP, постига съпоставима или по-ниска цена за един милион генерирани токени в сравнение с GB300, GB200, B200 и B300, работещи с Dynamo + TRT + MTP, при реални производствени нива на интерактивност и според модела за разходи на хипермащабируеми облачни оператори (Фигура 3).
Подобна тенденция се наблюдава и при DeepSeek V4 Pro (FP4, 8K/1K), където MI355X GPU с ATOM осигурява съпоставима или по-ниска цена за един милион генерирани токени спрямо GB300, GB200, B200 и B300, използващи Dynamo + vLLM, при същите производствени условия и разходен модел (Фигура 4).
Представените резултати се базират на заявка за изтегляне, подадена към InferenceX, който към момента все още не е интегриран в основния проект.

Фигура 3: Цена на един милион изходни токени спрямо интерактивност. DeepSeek R1 0528 • FP4 • 8K/1K • MTP • Модел на собственост и експлоатация за хипермащабируем оператор. Източник: InferenceX open-source benchmarks. По-ниската стойност е по-добра.

Фигура 4: Цена на един милион изходни токени спрямо интерактивност. DeepSeek V4 Pro • FP4 • 8K/1K • Модел на собственост и експлоатация за хипермащабируем оператор
Поглед към бъдещето
Развитието на AMD Instinct™ MI355X GPU ясно демонстрира колко бързо може да се усъвършенства един AI софтуерен стек, когато оптимизацията на изчислителните ядра, интеграцията на водещи рамки и обратната връзка от реални тестови натоварвания работят в пълен синхрон.
vLLM и SGLang остават сред ключовите приоритети в софтуерната стратегия за AMD Instinct GPU. Благодарение на своя отворен код, ATOM предоставя бърза и гъвкава платформа за експериментиране, тестване и оптимизация, което позволява новите подобрения да бъдат валидирани и усъвършенствани преди интегрирането им във vLLM и SGLang.
Първият ден на внедряването е само началото. Истинската стойност се измерва всеки ден след това, в реална производствена среда.
Именно там AMD Instinct™ MI355X GPU показва своето предимство.
