Эти дополнительные 51B параметров Qwen3.8 Flash Next, походу, вообще не обязаны лежать в VRAM.
Это огромная lookup-таблица, но на каждом токене модель читает лишь несколько строк. CPU достаёт их из DDR4 и асинхронно отправляет на GPU. Вся таблица через PCIe не ездит.
По памяти:
51B в BF16 занимают 95 GiB
FP8 занимает 47,5 GiB плюс scales
Q4 занимает 23,7 GiB raw
Даже при консервативных 32 KiB на токен и скорости 60 tok/s получается всего 1,875 MiB/s на GPU. На все четыре карты это 7,5 MiB/s против примерно 12 GB/s у каждого PCIe Gen3 x16.
DeepSeek уже запускали 100B Engram из RAM с потерей throughput всего от 1,9 до 2,8% на H800. На 3090 это ещё надо проверить.
Если Qwen не выпустит готовую реализацию, надо будет этим заняться: FP8 или Q4 таблица в RAM, нормальная работа с TP.
https://github.com/deepseek-ai/Engram