Фарш не провернуть 💝


Kanal geosi va tili: Butun dunyo, Ruscha


Меня зовут Алёша, строю инфраструктуру для AI продуктов, занимаюсь инференсом LLM, храню веса на DVD.
Всё серьёзно, блять! 🦄
Личка: @tarnished_ones
CV: https://cv.alesha.pro/
Читать полезные статьи: https://alesha.pro

Связанные каналы

Kanal geosi va tili
Butun dunyo, Ruscha
Statistika
Postlar filtri


Сервак на Apple M5


Xiaomi показала AI Cube, инженерный прототип мини компьютера на трёх своих чипах: O3, O100 и D100.

У O100 пропускная способность памяти доходит до 1,22 ТБ/с (!!!). У DGX Spark около 260 ГБ/c на секундочку.

На связке чипов одновременно крутят быструю модель на 3 млрд параметров, MiMo, скорость до 330 токенов в секунду, и тяжёлую модель на 120 млрд, с переключением между ними на лету. Всё это при 150 Вт устойчивой мощности, в цельнокованом корпусе из авиационного алюминия с 33874 отверстиями.

Пока только прототип. Ни цены, ни даты релиза нет. Но с такой пропускной способностью памяти под настольным локальным инференсом я КРАЙНЕ ХОЧУ ЕЕ ЗАИМЕТЬ.

528 0 23 12 20

Я забился на 10 баксов что Ox Alpha это новая большая модель от GLM, а не Flash/Turbo версия.

Всё больше источников говорит о том, что это таки GLM-5.3 Flash. Если это будет адекватного размера и будут веса - это всё. Просто всё



559 0 13 1 14

Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Каждый раз при нажатии на Generate генерируется новый город. Выглядит кайф.

https://re-presentation.jp/tool/gencity.html




Некоторые поставили результаты тестирования квантов Qwen3.8--27B под сомнение и оказались частично правы 😭

Как бы тяжело это не было признавать. В чём суть.

Задачи оказались слишком лёгкие. Я не смотрел датасет и понадеялся на индуса с клодом.

60% задач из того датасета решались буквально всеми квантами, там просто элементарщина. Я поныл поныл и решил сделать нормально всё таки и сесть разобраться 😫

Итого. Я вчера потратил 50 баксов чтобы собрать референс с BF16 на сложных задачах, которые BF16 будет решать в 60-80% случаев. Несколько раз регулировал сложность в Reasoning Gym. Теперь вроде датасет зафиксирован и мне нужно немного времени придти в себя и я запущу уже кванты на этих новых задачах. Там уже будет реально видно в какой момент кванты начинают жестко тупеть.


У Vercel, как одного из AI провайдеров в августе по статистике теперь больше токенов улетает в Open Weights модели.

Это переломный момент.

https://vercel.com/ai-gateway/leaderboards/models


Как только ты осознаёшь, что можешь просто заставить оркестратор запустить несколько экземпляров OMP, каждый со своим собственным оркестратором и подагентами, назад пути уже нет...

На этом этапе я чувствую себя так, будто я просто биомасса, одалживающая свои устройства.


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
GLM-5.3 сделал мне визуализацию данных, которые я схоронил, когда делал REAP на половину экспертов из Laguna S 2.1.

Это типа реальные данные. Каждая точка - это профиль продакшн-роутера: 3 205 231 токен через реальный INT4-чекпоинт на 4x3090, все 12к эксперта и видно как один токен выбирает своих 10 экспертов на каждом слое.

Яркие звёзды - это эксперты, которых выбирает роутер, самый горячий получает 6x от равномерной доли. 64 эксперта почти мертвы, ниже 10% от равномерной. Это точная карта, которую я Fable использовал, чтобы решить, какую половину оставить.

REAP если что вышел хернёй, я даже не публиковал, а вот артефакт пригодился


А Я ВАМ ГОВОРИЛ ВСЕМ ЧТО НАДО КАНАЛ ПЕРЕИМЕНОВЫВАТЬ ВОТ ВИДИТЕ

616 0 1 23 32

Deepseek 🐋 добавили Vision в свою Flash модель.

Свершилось, да ладно. Пока только в API.
Видимо чуть оттестят и потом веса прольют.

Лучшие, как всегда 🗣

https://api-docs.deepseek.com/guides/vision/


🚨 СЕКУНДОЧКУ!🚨

На Openrouter появилась новая бесплатная "скрытая" модель - ox-alpha

Довольно крутая и мультимодальная! Принимает картинки и видео!

Самое интересное в том, что я со 100% уверенностью могу сказать что это модель от GLM.

У меня есть пруфы от источников внутри ZAI.

Будет ли это вариант glm-5.3 с мультимодалкой или же какая-то вариация turbo/flash сказать пока не могу, так как не знаю

974 0 24 7 14

Другалёчки и другалески, залетайте в чятик наш - у нас там хорошо ❤️🐾

https://t.me/fuckup_chat


Вы просто вдумайтесь в эти цифры.

783 0 8 10 11

поступает много запросов на бенч Q1 и Q2 квантов UD от unsloth. Делаем?

772 0 1 14 23

Если кому-то нужны сырые трейсы от бенчмарков Qwen3.8 27B, то ловите.
Внутри вообще всё.

- 40 benchmark arms
- 4 800/4 800 сценариев с raw_response
- 10 118 проанализированных model calls
- 18 796 telemetry-записей
- 7 171 полный reasoning trace.
- все логи, launch argv

https://github.com/alesha-pro/qwen38-27b-bench-4x3090/tree/main/quality


После таких приколов от Qwen осталось всю скорость до последней капли выжать и всё...

676 0 3 18 11


873 0 40 43 25

20gb весов Qwen 3.8 27b, вероятно, являются самыми меняющими цивилизацию из опубликованных на данный момент.

714 0 11 41 18
20 ta oxirgi post ko‘rsatilgan.