VLSI HUB


Kanal geosi va tili: Butun dunyo, Ruscha


О Чипмейкерстве и ПЛИСоводстве от реального инженера 🧙‍♂️
Если хотите рассказать мне интересное 👉 @iDoka

Связанные каналы  |  Похожие каналы

Kanal geosi va tili
Butun dunyo, Ruscha
Statistika
Postlar filtri


Марков цепи пропил dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Прикольное, Jane Street опубликовали пазл на реверс асика

https://blog.janestreet.com/can-you-reverse-engineer-an-asic/


Nemotron 3 Ultra [2/2]
(часть 1)

Результаты:
Усреднённо по девяти категориям связка ACE-RTL + Nemotron 3 Ultra выдаёт pass rate 97% против 95% у Kimi K2.6 и 92% у GLM 5.2 при фиксированном агенте (то есть изолированно измеряется вклад самой модели). На категории отладки cid016 сам агентный контур поднимает точность драматически: GLM 5.2 идёт с 44% в одиночку до 94% в агенте, Kimi K2.6 - с 68% до 97%, Nemotron - с 65% до 100%. Вывод для практика очевиден: без итеративной петли с инструментами реалистичные RTL-задачи не берутся, каким бы сильным ни был базовый LLM.

Но главная цифра - не pass rate, а стоимость. Nemotron 3 Ultra достигает лидирующей точности при 7k токенах на итерацию против 9k у GLM 5.2 и 22k у Kimi K2.6 - примерно на 28% и на 71% меньше соответственно. Для агентного RTL это критично: контекст одной итерации отладки распухает мгновенно - туда входят спецификация, сгенерированный RTL, вывод симулятора, сработавшие ассерты и прошлые попытки фикса. При равном compute-бюджете меньший расход токенов означает больше взятых задач и более быстрый оборот итераций. В агентном коде это часто важнее, чем лишний процент на лидерборде.

Отдельно стоит отметить, как модель учили под RTL. Пайплайн синтетических данных из статьи ACE-RTL стартует с отобранных из публичных репозиториев seed-дизайнов, а затем генерирует не только пары «спецификация → эталонный RTL», но и задачи на редактирование и на отладку: в seed инжектируются реалистичные ошибки (неверные переходы конечного автомата, нарушения handshake и таймингов), а спецификация снабжается диагностикой наблюдаемого сбоя. Всё это проходит через фильтр - синтаксические проверки, деконтаминацию относительно бенчмарков и rubric-скоринг через LLM-as-judge на семантическое соответствие. Именно тренировка на edit/debug-задачах, а не только на генерации с чистого листа, объясняет, почему модель хорошо себя ведёт внутри агентной петли.

@vlsihub

1.6k 0 12 12 11

Свежая публикация NVIDIA про Nemotron 3 Ultra читается как ещё один пресс-релиз в жанре «наша модель обошла всех на бенчмарке». Но если убрать маркетинговую обёртку, остаётся вещь поинтереснее: NVIDIA и методично продолжает перформить на тему проектирования микросхем (RTL и верификацию), но в качестве соперников для сравнения выбрала не GPT и не Claude, а два сильнейших китайских open-weight-семейства: GLM и Kimi. Это не случайный выбор бейзлайнов. Это заявка на то, где именно проходит линия конкуренции в EDA-стеке ближайших лет.

Соперники, выбранные для сравнения, намеренно китайские. В мае 2025-го Bureau of Industry and Security ввело лицензирование экспорта EDA-софта в Китай (классификация ECCN 3D991/3E991), мотивируя это риском military end-use; Synopsys, Cadence и Siemens EDA приостановили поставки и поддержку. Уже 2 июля 2025-го ограничения отозвали - в рамках торгового перемирия, размороженного на переговорах в Лондоне и связанного с китайскими редкоземельными металлами. Эпизод продлился меньше шести недель, но показал, насколько EDA стал рычагом в большой геополитике.

Причём рычаг работает в обе стороны. «Большая тройка» контролирует около 70–80% китайского рынка EDA (глобально по TrendForce за 2024-й: Synopsys ~31%, Cadence ~30%, Siemens EDA ~13%), и Китай методично финансирует собственный EDA-стек, чтобы снять зависимость. Но вот в чём тонкость нового витка: инструменты можно поставить под лицензию, а open-weight-модель - нельзя. GLM, KimiAlibaba Qwen3.8-Max из прошлого поста с её автономным chip-design-агентом) свободно скачиваются с HuggingFace. Вишенка в качестве LLM поверх проектирования чипов оказывается тем фронтом, где экспортный контроль в привычном виде просто не применим. Ответ NVIDIA симметричен и показателен: выпустить собственную открытую модель, которая обыгрывает китайские открытые модели на профильном для железа бенчмарке, и захардкодить её в западный EDA-стек.

Nemotron 3 Ultra - это MoE на 550 млрд суммарных параметров при 55 млрд активных, гибрид Mamba-Attention, предобученный на 20 трлн токенов и растянутый до контекста в 1 млн токенов. Гибридная архитектура здесь работает не ради красоты спецификации: Mamba-часть режет стоимость внимания и размер KV-кэша, MoE поднимает точность на активный параметр, и вместе это даёт заявленный выигрыш до 5× по пропускной способности и до 30% по стоимости против сопоставимых open-моделей. Ровно то, что нужно долгоживущему агенту, чей контекст не влезает в заданные ограничения.

Модель тестировали внутри агента ACE-RTL - стандартной для RTL петли «сгенерировал ➡️ прогнал симуляцию/проверки ➡️ проанализировал провал ➡️ уточнил». Агент состоит из трёх кооперирующих компонентов: генератора (пишет и правит RTL), рефлектора (разбирает фидбек симулятора, локализует вероятную первопричину, даёт высокоуровневые указания на фикс) и координатора (ведёт эволюционирующий контекст отладки между итерациями, решая, какую историю и какой фидбек тащить в следующую попытку). Смысл - чтобы агент строил на прошлых провалах, а не наступал на те же грабли по кругу.

@vlsihub


Китайский ИИ «спроектировал чип»

Alibaba выкатила Qwen3.8-Max (2,4T параметров) и главным аттракционом сделала не SWE-бенч, а автономный chip-design. Таргет - GCD/RSA-ускоритель с модульным умножением и возведением в степень: компактный, логически плотный блок. На входе - минимум: описание задачи, stub-воркспейс с пустыми модулями и eval-скрипт. Песочница с настоящим тулчейном (Iverilog → Yosys → OpenROAD), корректность - bit-exact через рандомизированный cocotb на WIDTH 4/6/8/16. Ни golden reference, ни человека в контуре. Пока всё выглядит как нормальный closed-loop, а не как демо на синтетике.

Метрики для пресс-релиза: ~500 turns, 71 eval, улучшайзинг gate count с 8298 до 678, die 106×106 → 46×46 мкм, wirelength 33 369 → 4187 мкм, WNS из −4,46 нс вытянут в +0,66 нс, timing closure на 500 МГц. Минус 81% площади. Красиво - ровно до момента, когда начинаешь читать, от чего считали проценты...

..а считали от 8298 вентилей «первой функционально рабочей версии». Переведём на инженерный: baseline был раздутым черновиком, и добрая половина хвалёного улучшения - это модель, героически побеждающая собственную криворукость на старте. 6288 из 6288 сэкономленных на 22-м turn'е вентилей - это замена аппаратного restoring-делителя по модулю на итеративный shift-subtract. Отличное решение! Которое любой RTL-джун держит в голове как дефолт, а не как откровение на 22-й итерации. То есть «прорыв» - это когда агент наконец перестал синтезировать делитель там, где нужен сдвиговый цикл.

Дальше - про масштаб, о котором маркетинг тактично молчит. WIDTH=16. Настоящий RSA - это 2048/4096 бит; шестнадцатибитный «RSA-ускоритель» - это лабораторка второго курса, а не то, что кто-то тейпаутит. Разводили в Nangate45 - академическом PDK, а не на реальном foundry-ноде, где начинается веселье с DRC, antenna rules, EM/IR-дропом и corner'ами. 46×46 мкм с 4187 мкм трассировки роутится без единого congestion-хотспота - тут и OpenROAD не вспотел. Timing closure на 500 МГц в такой конфигурации - это не достижение, это отсутствие проблемы.

И всё же кидаться помидорами целиком - глупо. Реально ценное здесь - не итоговые 678 вентилей, а то, что агент держал когерентную стратегию сотни turn'ов и продолжал вытаскивать структурные улучшения (module fusion, resource sharing одного субтрактора глобально, FSM-прунинг) на 400-м шаге, а не залипал на косметике после ранних лёгких вентилей. Вот это - сигнал. Петля «edit ➡️ simulate ➡️ synthesize ➡️ P&R ➡️ читаю числа ➡️ рефакторю» с жёсткой верификацией на каждом шаге масштабируется туда, куда single-shot-генерация RTL не масштабируется никогда.

Резюме для тех, кто дочитал: «ИИ проектирует чипы» - маркетинговый буллшит; до полноценного SoC-флоу тут как до Луны. А вот «агент способен держать инженерную стратегию на сотнях итераций закрытого цикла и находить architecture-level, а не syntax-level улучшения» - правда, и это важнее любого заголовка.

PS: Контекст: прошлый 3.7-Max уже крутил 35-часовую автономную оптимизацию Triton-ядра под кастомный чип с 1158 tool-call'ами. Alibaba методично докручивает один и тот же сюжет - long-horizon под железо - от релиза к релизу. Это не случайный выброс, это дорожная карта. Только напомню в скобках: все числа - из собственного launch-репорта, third-party репликации нет, а «лучше всех протестированных моделей» - это их эвал на их постановке. Верить на слово в EDA - примерно как верить в тайминги по datasheet без своего STA.

PPS: о том, о чём в отчёте - ни строчки: это RSA/крипто-блок. Оптимизировали его исключительно под area × correctness. Никто, судя по описанию, не проверял constant-time. А в трейсе прямым текстом: «early-exit для чётных», «MSB субтрактора как компаратор», data-dependent число итераций. Поздравляю - вы получили компактный крипто-датапас с шикарным timing side-channel'ом. На реальном RSA такое «оптимизированное» железо утекает секрет по задержке ещё до того, как доедет до fab. Метрика PPA сошлась, threat model - нет.

@vlsihub


позитивслэк dan repost
Какой?

#meme
@positiveslack


𝗖𝗹𝗮𝘂𝗱𝗲 𝘄𝗶𝘁𝗵 𝘃𝘀. 𝘄𝗶𝘁𝗵𝗼𝘂𝘁 𝗦𝗩𝗔-𝗥𝗔𝗚 𝗳𝗼𝗿 𝗙𝗼𝗿𝗺𝗮𝗹 𝗩𝗲𝗿𝗶𝗳𝗶𝗰𝗮𝘁𝗶𝗼𝗻
- тут народ пытается к Клоду прикрутить RAG для SVA.

❓Пейпер также сгенерён Клодом (Судя по обилию эмодзи)
✅ Автор: Ben Cohen (написал книгу Fast-Tracking SVA through Exposure)
✅ ASCII-art красивый 😍

PS: файлы в первом комменте

@vlsihub


позитивслэк dan repost
Мечтают ли ИИ-агенты об анализе вейвформ?

Мероприятие прошло. Было очень круто 🎧
Спасибо всем кто пришел, и с кем удалось пообщаться!

Если вдруг упустили, то я рассказывал про CLI инструмент для анализа и работы с вейвформами, написанный специально для "рук" LLM-агентов.

https://github.com/kleverhq/wavepeek

Слайды в первом коменте к посту, ну а выступление есть на YouTube

Жажду получить любую обратную связь, особенно отзывы по использованию в реальных задачах. Любая движуха приветствуется, кроме нейрослоп-PR конечно 😎

#llm #tools
@positiveslack


пятничное?
@vlsihub


Verible - проект под патронажем гугл (для парсинга, линтинга, форматирования SystemVerilog). Просто цифры:

▫️4000 коммитов
▫️2500 ишью
▫️более 60ти контрибьюторов
▫️почти 300 форков

...и 5 лет понадобилось, чтобы, вероятно, закрыть мой ишью, открытый в беззаботном 2021м 👉👈🥹

@vlsihub


Мне одному кажется, что цены на FPGA платы на али за последние несколько месяцев сделали 2х в цене? 🤯

@vlsihub


Как похорошел Линкедин в эпоху AI:
если раньше 80% сообщений в личке было от рекрутеров, то теперь каждое первое сообщение от создателя ULTRA LLM ASIC SUPER DRUPER VLSI AI FPGA ONE BUTTON SOLUTION продукта 💡

А что обычно вам присылают на линкедин?

@vlsihub


Как сказал бы один мой знакомый велосипедист: "Сомнительно, но Okay"

Пока что впечатления от "Opus 4.6 with high effort" как от слепого котёнка: пришлось через /btw подсказать что искать надо не на сайтах $CDNS и $SNPS, а на github.

Посмотрим чем закончатся философские рассуждения Клода.

BTW, если кому-то попадались на линкедин или гитхаб best practice по CLAUDE.md для RTL разработки, то поделитесь добром 👀

PS: ставь 🕊 если смог прочесть этот пост через телеграм


Агенты ИИ | AGI_and_RL dan repost
прикольно дизайнить процессоры агентами

Design Conductor: An agent autonomously builds a 1.5 GHz Linux-capable RISC-V CPU
https://arxiv.org/abs/2603.08716
https://www.alphaxiv.org/ru/overview/2603.08716


Марков цепи пропил dan repost
iCTS: Iterative and Hierarchical Clock Tree Synthesis With Skew-Latency-Load Tree [ссылка]

Прикольная статья, в которой китайцы предлагают интересный метод оптимизации тактового дерева.

Если кратко, то синхронная цифровая схема держится на одном допущении: каждый триггер видит фронт тактового сигнала одновременно (иначе данные защёлкнутся раньше, чем вычисление закончилось, и триггер захватит некорректный результат).

Но "одновременно" физически невозможно. Сигнал идёт от одного источника до тысяч триггеров по металлическим проводам с сопротивлением и емкостью, разные триггеры находятся на разном расстоянии, и сигнал приходит в разное время (эта разница называется skew).

Решение - буферы. Они восстанавливают деградировавший фронт и добавляют контролируемую задержку, и если вставить буферы в нужных точках сети, суммарная задержка по всем путям выравнивается и каждый триггер получает фронт в +/- одно и то же время. Собственно, автоматическое построение такого дерева буферов и называется Clock Tree Synthesis.

Звучит как инженерная задача с однозначным решением, но внутри три цели, которые конфликтуют между собой: минимальный skew, минимальная длина проводов и минимальная latency. Получить всё три одновременно - NP-hard.

Стандартный CTS flow разбит на два независимых шага без обратной связи: сначала DME (алгоритм балансировки топологии тактового дерева) фиксирует структуру дерева: где провода соединяются и как ветвятся. Потом отдельный алгоритм (как правило, ван Гинекен) вставляет буферы уже в готовую структуру: обходит дерево снизу вверх, в каждом узле оценивает варианты буферов с учётом ёмкостной нагрузки downstream и выбирает лучший. Топологию изменить уже нельзя, поэтому алгоритм подстраивается под то, что есть.

Чтобы выровнять задержки на коротких ветках, DME добавляет wire elongations - буквально удлиняет провода змейкой, из-за чего растёт ёмкость и мощность. Буферы потом сайзятся под худший случай нагрузки, часто избыточно.

И это бьёт не только по мощности. Буферы занимают площадь кристалла, тактовые провода съедают ресурсы роутинга, рядом с кластерами буферов нужны decap-ячейки. Место, которое могло быть вычислениями, занято инфраструктурой доставки сигнала.

Тактовое дерево переключается каждый такт, независимо от того что делает логика. На высокопроизводительных процессорах это может отъедать до 50% от TDP, то есть если чип греется на 100 Вт, то до 50 Вт уходит только на доставку тактового сигнала, а не на вычисления (пара статей про это - [тык], [тык], [тык])

Исследователи из CUHK и Pengcheng Lab предложили строить топологию и буферизацию одновременно с явным trade-off между skew, latency и wirelength. В классическом DME точка слияния двух поддеревьев единственная, где задержки выравниваются, и никакого выбора нет. iCTS расширяет это до отрезка допустимых точек слияния, где любая точка даёт skew в пределах заданной границы, и на этом отрезке алгоритм выбирает точку, минимизирующую сумму с явными весами для latency и wirelength.

Поверх этого иерархическая кластеризация группирует синки не по геометрической близости, а по ёмкостной нагрузке, потому что физически близкие синки могут нагружать дерево по-разному и ломать балансировку. Результат кластеризации дополнительно оптимизируется отжигом. Буферы оцениваются до вставки, что позволяет отсекать плохие варианты раньше. После буферизации ISCA итеративно перезапускает BST-DME на зафиксированной топологии, каждый раз уточняя оценки задержек, пока skew не достигает целевого значения.

На бенчмарках ISCAS'89, OpenLane, OpenCores и ysyx (от 1248 до 22810 flip-flop) при 28nm результат такой: коммерческий P&R инструмент проигрывает iCTS на 39.5% по skew, 13.0% по latency и 18.5% по capacitance, OpenROAD - на 101.6%, 50.7% и 25.5% соответственно. По clock power коммерческий инструмент потребляет в среднем на 32% больше, OpenROAD - на 81% больше.

Хоть в максимальном бенчмарке всего ~23к триггеров, иерархическая архитектура iCTS должна масштабироваться. Не знаю, применит ли это кто-нибудь в продакшене, но звучит многообещающе




Марков цепи пропил dan repost
Мы, видимо, тихо подошли к моменту, когда у нас стало галлюцинировать железо.

Наткнулся на пост в ныттере от ресерчера в гугле, где говорится о том, что мы выжали кремний до уровня где silent data corruptions уже больше не теоретическая проблема. Google назвал такие ядра "mercurial cores"- они проходят все заводские тесты, исправно служат месяцами, а потом в непредсказуемый момент, при определённой комбинации инструкций, выдают мусор вместо результата.

Проблему подсветили три крупнейших оператора дата-центров:

Meta - одно из первых исследований крупномасштабного воздействия тихих ошибок на реальной инфраструктуре Silent Data Corruptions at Scale

Google - ключевая работа, давшая название таким ядрам Cores that don't count

Alibaba - Understanding Silent Data Corruptions in a Large Production CPU Population

Собственно, а почему это проблема? В статье The Register Питер Хокшильд рассказывает, что подобное ядро повредило процесс шифрования данных, причем таким образом, что расшифровать файлы могло только это же самое дефектное ядро. Плюс сравнительно недавно вышла статья Understanding Silent Data Corruption in LLM Training, где исследователи из университета Торонто провели эксперименты на больных нодах, выведенных из продакшена: при файнтюнинге LLM на дефектных машинах возникали скачки loss-функции, и в одном случае точность модели упала для нуля.

Как от этого защищаться - пока хз. ECC-память не спасает, потому что данные портятся при вычислении, а не при хранении. Контрольные суммы вроде CRC сами используют векторные инструкции, которые одни из самых уязвимых. Нашел только костыли вроде SiliFuzz (ловит дефекты, которые проявляются на конкретных инструкциях), BootRIST (проверяет ядра при загрузке, то есть дефект, который проявляется после нескольких часов прогрева он не поймает) и Farron (зависит от качества тесткейсов и правильности определения температурной границы)

1.9k 0 59 11 37

Дебагинг и Диагностинг

А у вас было когда-нибудь такое что диагностическая фича, которую вы добавили чисто НА ВСЯКИЙ СЛУЧАЙ (потому что
"ну ведь тоже самое можно сделать другим способом, который уже реализован") становилась основной при дебажиньи ASIC чипа?

А всё потому что в реальном мире всё не так просто как в симуляторе - многие вещи неочевидны, например, что работать через вычитку полей данных из карты регистров удобнее, чем ловить эти данные через стриминговый интерфейс снаружи чипа. Даже если для этой вычитки полей данных из карты регистров придётся знатно потанцевать вокруг иной периферии.

Корифеи, расскажите какие у вас были дебажные фичи, которые внезапно "выстрелили" (не в ногу) ❓

@vlsihub


VLSI HUB dan repost
#пятничное
@vlsihub


#пятничное #предложка
@vlsihub


Nvidia (бывшая Mellanox) Innova 2 Flex - еще одна PCI-e карточка (SmartNIC) с современным ПЛИС на борту, представленная на eBay и Али (23т.р.).

Особенности:
▫️Xilinx Kintex UltraScale+ XCKU15P
▫️Куча GTY трансиверов выведенных на OpenCAPI разъем
▫️DDR4 8GB 72-bits
▫️Превосходно разверерсили 😃

@vlsihub

3k 0 29 12 25
20 ta oxirgi post ko‘rsatilgan.