Фарш не провернуть 💝


Гео и язык канала: Весь мир, Русский
Категория: Технологии


Меня зовут Алёша, строю инфраструктуру для AI продуктов, занимаюсь инференсом LLM, храню веса на DVD.
Всё серьёзно, блять! 🦄
Личка: @tarnished_ones
CV: https://cv.alesha.pro/
Читать полезные статьи: https://alesha.pro

Связанные каналы

Гео и язык канала
Весь мир, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Эти дополнительные 51B параметров Qwen3.8 Flash Next, походу, вообще не обязаны лежать в VRAM.

Это огромная lookup-таблица, но на каждом токене модель читает лишь несколько строк. CPU достаёт их из DDR4 и асинхронно отправляет на GPU. Вся таблица через PCIe не ездит.

По памяти:

51B в BF16 занимают 95 GiB
FP8 занимает 47,5 GiB плюс scales
Q4 занимает 23,7 GiB raw

Даже при консервативных 32 KiB на токен и скорости 60 tok/s получается всего 1,875 MiB/s на GPU. На все четыре карты это 7,5 MiB/s против примерно 12 GB/s у каждого PCIe Gen3 x16.

DeepSeek уже запускали 100B Engram из RAM с потерей throughput всего от 1,9 до 2,8% на H800. На 3090 это ещё надо проверить.

Если Qwen не выпустит готовую реализацию, надо будет этим заняться: FP8 или Q4 таблица в RAM, нормальная работа с TP.

https://github.com/deepseek-ai/Engram


Господи какой ор от этого Qwen 3.8 Flash Next. Все стоят на ушах. Безумие реальное. И это круто.

Вынести эти несчастные 51B Ngram таблиц в RAM - это то что нужно будет сделать в первую очередь если этого не будет из коробки.

Ну и unsloth завтра day-0 выложат кванты. Посмотрим посмотрим.


Если Qwen3.8 Flash Next влезет в мои 96GB, я буду бенчить его в день релиза.

Если нет, я буду квантовать его пока не влезет и бенчить в день релиза.


Мамочки родные, чтож они творят то!

https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next


Видео недоступно для предпросмотра
Смотреть в Telegram
Ничего особенного, просто Qwen3.8 27B UD-Q2_K_XL пыжится на Steam Deck со скоростью 4 т/с 🥲

проходите мимо


Я вертел делать эти ваши эвалы моделей. Это ужас и кошмар. Особенно когда нет железа 🤡

545 0 2 10 11

Сервак на Apple M5


Xiaomi показала AI Cube, инженерный прототип мини компьютера на трёх своих чипах: O3, O100 и D100.

У O100 пропускная способность памяти доходит до 1,22 ТБ/с (!!!). У DGX Spark около 260 ГБ/c на секундочку.

На связке чипов одновременно крутят быструю модель на 3 млрд параметров, MiMo, скорость до 330 токенов в секунду, и тяжёлую модель на 120 млрд, с переключением между ними на лету. Всё это при 150 Вт устойчивой мощности, в цельнокованом корпусе из авиационного алюминия с 33874 отверстиями.

Пока только прототип. Ни цены, ни даты релиза нет. Но с такой пропускной способностью памяти под настольным локальным инференсом я КРАЙНЕ ХОЧУ ЕЕ ЗАИМЕТЬ.

652 0 25 12 27

Я забился на 10 баксов что Ox Alpha это новая большая модель от GLM, а не Flash/Turbo версия.

Всё больше источников говорит о том, что это таки GLM-5.3 Flash. Если это будет адекватного размера и будут веса - это всё. Просто всё



610 0 15 1 14

Видео недоступно для предпросмотра
Смотреть в Telegram
Каждый раз при нажатии на Generate генерируется новый город. Выглядит кайф.

https://re-presentation.jp/tool/gencity.html




Некоторые поставили результаты тестирования квантов Qwen3.8--27B под сомнение и оказались частично правы 😭

Как бы тяжело это не было признавать. В чём суть.

Задачи оказались слишком лёгкие. Я не смотрел датасет и понадеялся на индуса с клодом.

60% задач из того датасета решались буквально всеми квантами, там просто элементарщина. Я поныл поныл и решил сделать нормально всё таки и сесть разобраться 😫

Итого. Я вчера потратил 50 баксов чтобы собрать референс с BF16 на сложных задачах, которые BF16 будет решать в 60-80% случаев. Несколько раз регулировал сложность в Reasoning Gym. Теперь вроде датасет зафиксирован и мне нужно немного времени придти в себя и я запущу уже кванты на этих новых задачах. Там уже будет реально видно в какой момент кванты начинают жестко тупеть.


У Vercel, как одного из AI провайдеров в августе по статистике теперь больше токенов улетает в Open Weights модели.

Это переломный момент.

https://vercel.com/ai-gateway/leaderboards/models


Как только ты осознаёшь, что можешь просто заставить оркестратор запустить несколько экземпляров OMP, каждый со своим собственным оркестратором и подагентами, назад пути уже нет...

На этом этапе я чувствую себя так, будто я просто биомасса, одалживающая свои устройства.


Видео недоступно для предпросмотра
Смотреть в Telegram
GLM-5.3 сделал мне визуализацию данных, которые я схоронил, когда делал REAP на половину экспертов из Laguna S 2.1.

Это типа реальные данные. Каждая точка - это профиль продакшн-роутера: 3 205 231 токен через реальный INT4-чекпоинт на 4x3090, все 12к эксперта и видно как один токен выбирает своих 10 экспертов на каждом слое.

Яркие звёзды - это эксперты, которых выбирает роутер, самый горячий получает 6x от равномерной доли. 64 эксперта почти мертвы, ниже 10% от равномерной. Это точная карта, которую я Fable использовал, чтобы решить, какую половину оставить.

REAP если что вышел хернёй, я даже не публиковал, а вот артефакт пригодился


А Я ВАМ ГОВОРИЛ ВСЕМ ЧТО НАДО КАНАЛ ПЕРЕИМЕНОВЫВАТЬ ВОТ ВИДИТЕ

644 0 1 24 32

Deepseek 🐋 добавили Vision в свою Flash модель.

Свершилось, да ладно. Пока только в API.
Видимо чуть оттестят и потом веса прольют.

Лучшие, как всегда 🗣

https://api-docs.deepseek.com/guides/vision/


🚨 СЕКУНДОЧКУ!🚨

На Openrouter появилась новая бесплатная "скрытая" модель - ox-alpha

Довольно крутая и мультимодальная! Принимает картинки и видео!

Самое интересное в том, что я со 100% уверенностью могу сказать что это модель от GLM.

У меня есть пруфы от источников внутри ZAI.

Будет ли это вариант glm-5.3 с мультимодалкой или же какая-то вариация turbo/flash сказать пока не могу, так как не знаю

1k 0 24 7 14

Другалёчки и другалески, залетайте в чятик наш - у нас там хорошо ❤️🐾

https://t.me/fuckup_chat

Показано 20 последних публикаций.