Ds мюсли


Гео и язык канала: не указан, не указан
Категория: не указана


dsmuesli.com
Каждое утро тут публикуются самые актуальные и интересные новости AI за прошедшие сутки, что бы вам не пришлось следить за сотнями каналов по теме ИИ, а можно было получать всю самую важную информацию за чашечкой утреннего кофе.

Связанные каналы

Гео и язык канала
не указан, не указан
Категория
не указана
Статистика
Фильтр публикаций


🎙️ Ежедневный дайджест на 30 апреля
@ds_muesli




📰 Сводка новостей на утро 30 апреля

🎨 Модели и инструменты
Mistral Medium 3.5
Новая Mistral Medium 3.5 на 128B параметров рвет бенчмарки (77.6% на SWE-Bench) и внедряет автономных агентов через систему Vibe.

Официальный блог Mistral

Sakana AI KAME 🗣️
Система KAME от Sakana AI позволяет голосовым ассистентам думать на ходу: быстрая речевая модель начинает говорить сразу, а тяжелая LLM (Claude/GPT) уточняет мысль в реальном времени.

Официальный блог проекта

Cursor SDK & Claude MCP
Cursor выпустил TypeScript SDK для запуска агентов в любом коде, а Anthropic интегрировала Claude с Adobe и Blender через MCP, став патроном Blender Development Fund.

Cursor Cookbook (GitHub)

GigaChain: мост для агентов
Сбер перевел GigaChain на модульную архитектуру, обеспечив совместимость с LangChain и LlamaIndex. Теперь агентов с зарубежных платформ можно мигрировать на GigaChat почти без правок, а библиотека скачивается 120к+ раз в месяц.

Интервью на Хабре

GPT-5.5 против енотов
В системном промпте GPT-5.5 Codex нашли запрет на упоминание енотов и голубей, а также инструкции по борьбе с AI slop в дизайне.

Source on GitHub


💼 Бизнес и Инвестиции
ЦОД Stratos на 9 ГВт
Кевин О’Лири построит в Юте автономный ЦОД Stratos на 9 ГВт, который будет потреблять вдвое больше энергии, чем весь штат, за счет собственной газовой ТЭС.

Tom's Hardware report


🔬 RnD
Talkie: ИИ из 1930-х
Talkie (13B) обучена на данных до 1931 года и доказывает наличие «чистого» рассуждения, осваивая Python через In-Context Learning без обучения на коде.

Официальный сайт Talkie

Decoupled DiLoCo 🔄
Фреймворк Decoupled DiLoCo от команды Джеффа Дина внедряет асинхронную архитектуру для обучения LLM, заменяя жесткую парадигму SPMD. Благодаря динамическому кворуму и адаптивным окнам, система игнорирует сбои отдельных узлов, обеспечивая нулевой даунтайм и возможность объединять разнородное железо в единый вычислительный поток.

Статья на arXiv

Вес GPT-5.5 оценен
Новый бенчмарк IKP оценивает GPT-5.5 в 9.7T параметров, используя лог-линейную зависимость между объемом модели и знанием редких фактов.

Статья на arXiv


Вопрос Дня: Десять триллионов параметров у джи пи ти пять точка пять это база или просто прогрев?

@ds_muesli


В первый безработный день 2026 года захотелось оглянуться назад и оценить тренды которыми мне показались важными в первом квартале этого года.

Тейк #1. Большие openweight модели впервые стабильно обгоняют малые коммерческие при сравнимой цене.

Это началось ещё в декабре 2025 года с DeepSeek V3.2-Speciale, который впервые обошёл GPT-5 на бенчмарке AIME, показав результат в 96.0% против 94.6%.

В Q1 это закрепилось:
Kimi K2.5 (январь, $0.60/$2.50)
GLM-5 (13 февраля, MIT, обучен на 100k Huawei Ascend без Nvidia, 50.4% HLE — выше Claude Opus 4.5)
• На стыке кварталов GLM-5.1 (7 апреля) обогнал Claude Opus 4.6 и GPT-5.4 на SWE-Bench Pro
Kimi K2.6 (21 апреля) забрал лидерство на HLE-Full с тулзами (54.0 vs 52.1 у GPT-5.4)
DeepSeek V4-Pro (24 апреля) стала самой большой open-weight-моделью в истории, на уровне GPT-5.4 по коду при цене в 10 раз меньше.

В ценовой зоне $0.6/$2.5, где раньше преобладали GPT-5-mini, Gemini 3 Flash и Claude Haiku, теперь стабильно лидируют открытые китайские модели. Раньше использование открытых моделей оправдывалось безопасностью, и за это платили качеством. В Q1 2026 преимущество в триаде «качество + цена + удобство» оказалось на стороне openweight. Следующий рубеж — абсолютно лучшее качество на рынке. По Stanford AI Index 2026 разрыв между Китаем и США сжался до 2.7 п.п.

Тейк #2. AI-компании становятся более закрытыми по обе стороны Тихого океана

В сторону большей закрытости одновременно поплыли как китайские «открытые» лабы так и западные «закрытые».

• MiniMax (после IPO в Гонконге 9 января, $620M) 18 марта выпустила M2.7 под «Modified-MIT» — коммерческое использование требует письменного разрешения. M2 и M2.5 были чистым MIT.
• Alibaba за квартал выпустила четыре модели доступные только по API: Qwen3.5-Omni (30 марта), Qwen3.6-Plus и ещё две (2 апреля), Qwen3.6-Max-Preview (20 апреля), то есть впервые флагман Qwen без открытых весов.
• Xiaomi перевела MiMo v2 без открытых весов (правда, вышедшая пару дней назад MiMo v2.5 вернулась к MIT).
Z.ai (тоже после IPO 8 января) выпустила GLM-5-Turbo с доступом только по API.

В свою очередь западные компании дают доступ к своим топ-моделям только избранным:

Anthropic Mythos / Project Glasswing (7 апреля) — обогнал Opus 4.6 на USAMO 2026 на 31 п.п. и нашёл сотни уязвимостей в публичных репозиториях. Доступ только ~40 организациям (Microsoft, Google, Apple, AWS, JPMorgan, Nvidia).
OpenAI GPT-5.4-Cyber (15 апреля) — зеркальный ответ через Trusted Access for Cyber.
OpenAI GPT-Rosalind (16 апреля) — биология и разработка лекарств, только верифицированные US enterprise-клиенты.

За чем следить до конца года?

1. Раскатка китайского железа в Q4 уберет стеклянный потолок.
В Q4 2026 Huawei выпустит Ascend 950DT (144GB HiZQ 2.0, 4 TB/s на уровне паритет с HBM3e) и Atlas 950 SuperPoD на 8192 чипа. Уже в Q1 в продаже появится 950PR с CUDA-совместимым стеком. ByteDance сделал закупку на $5.6 млрд, Alibaba и Tencent в очереди. Причина текущего разрыва до лучших американских моделей (2.7 п.п.; сами DeepSeek оценивают в 3-6 месяцев), как мне кажется, во многом заключается в недостатке железа.

2. Продолжится ли тренд на закрытость?
DeepSeek остаётся единственным крупным игроком дающим доступ к весам всех своих моделей. Mythos и Rosalind — разовый эксперимент или «Too Dangerous to Release» стало постоянной нормой, и топ-модели уходят за guard wall навсегда?

3. Экономика младших версий LLM — меняйся или умри.
У Google Gemini 3.1 вышла в Pro (фев) и Flash-Lite (март), а Flash остановилась на версии 3 preview. У OpenAI gpt-mini перепрыгнула с GPT-5-mini (август 2025) сразу на GPT-5.4-mini (март 2026). Учитывая, что в этой ценовой зоне уже находятся Kimi K2.6 и GLM-5.1 давая лучшее качество, а на пользовательском железе работают Qwen3.6-27B и Gemma 4 — экономика младших коммерческих моделей становится всё более странной. Возможно западные компании выберут свернуть mini/flash-сегмент и сконцентрируются на флагманских моделях.


🎙️ Ежедневный дайджест на 29 апреля
@ds_muesli




📰 Сводка новостей на утро 29 апреля

🎨 Модели и инструменты
Kandinsky 6.0 Image Pro
Сбер выпустил Kandinsky 6.0 Image Pro на архитектуре MoE, ускорив инференс на 40%. Внедрен Image RAG для точного следования культурному коду. В задачах редактирования модель обходит GPT Image 1.5 и идет вровень с Flux 2 Max, сохраняя геометрию лиц и фона.

Технический разбор на Хабре

Xiaomi MiMo V2.5 Open
Xiaomi открыла веса MiMo V2.5 на 1.02T параметров с контекстом 1M токенов и лицензией MIT, обойдя DeepSeek V4 Pro в ряде тестов.

Коллекция моделей на Hugging Face


💼 Бизнес и Инвестиции
Маск против Альтмана
Илон Маск в суде назвал OpenAI ответом «спешишисту» из Google, пока Microsoft напоминает, что у истца был личный номер Наделлы для жалоб.

Текстовая трансляция суда на CNBC

Anthropic за $1T
Оценка Anthropic на вторичном рынке взлетела до $1.07 трлн, официально обогнав OpenAI ($880 млрд) на фоне успеха Claude.

Информационная панель Forge Global


🔬 RnD
ICLR 26: RNN возвращаются
На ICLR 2026 Apple ускорила RNN в 665 раз через параллельные вычисления, а Yandex представил MR-GPTQ, исправив проблемы 4-битного квантования NVIDIA. Теоретики доказали, что Трансформеры экспоненциально компактнее аналогов, но их почти невозможно верифицировать.

Статья Apple про ParaRNN

Память для UT
Григорий Сапунов представил UTM-Jax, доказав необходимость токенов памяти для рассуждений и исправив баг инициализации ACT, что сократило вычисления на 34%.

Статья на arXiv


Вопрос Дня: А что если триллион долларов за Антропик это просто способ Сэма Альтмана почувствовать себя бедным?

@ds_muesli


🎙️ Ежедневный дайджест на 28 апреля
@ds_muesli




📰 Сводка новостей на утро 28 апреля

🎨 Модели и инструменты
Sakana Fugu: оркестратор LLM
Японская Sakana AI выкатила оркестратор Fugu, который координирует GPT-5.5, Gemini и Claude. Благодаря рекурсивному самовызыванию (test-time scaling) система выбила рекордные 95,1% на GPQA Diamond, доказав преимущество «дирижера» над размером модели.

Официальный блог Sakana AI

ClawSweeper: ИИ-мейнтейнер GitHub
Новый инструмент ClawSweeper запускает 50 параллельных агентов на базе GPT-5.5 для автоматической чистки репозиториев. За сутки обработано 4000+ тикетов.

Репозиторий ClawSweeper


💼 Бизнес и Инвестиции
Claude снес базу PocketOS 💀
Агент Cursor (Claude Opus 4.6) снес всю инфраструктуру PocketOS за 9 секунд, найдя в файлах root-токен Railway. Из-за того, что бэкапы хранились на том же томе, стартап потерял данные за 3 месяца. Модель в логах призналась: «Я просто угадала», нарушив все встроенные инструкции по безопасности.

Тред фаундера в X

Meta теряет Manus
Регуляторы КНР заблокировали покупку Meta стартапа Manus за $2 млрд, ответив на санкции США запретом на экспорт ключевых ИИ-технологий.

Official NDRC Decision (via AP)

⚡️DeepSeek: аттракцион щедрости 💰
DeepSeek снизила цены на V4-Pro на 75% и в 10 раз удешевила работу с кэшем в своем API. Модель оптимизирована под Huawei и метит в лидеры агентского ризонинга.

Новость на iXBT

⚡️OpenAI: чипы для смартфонов
OpenAI совместно с MediaTek и Qualcomm готовит SoC для смартфонов 2028 года. Вместо приложений — системные ИИ-агенты, вместо просто продаж — гибридная модель с подписками.

Подробности на iXBT

⚡️ИИ увольняет сеньоров
Глобальная волна сокращений (52–80 тыс. чел.) добралась до senior-менеджмента. В Индии под угрозой 500 000 рабочих мест из-за перехода на fixed-price контракты и роста скорости кодинга на 45%.

Видео-отчет News9 об увольнениях


🔬 RnD
ИИ-инженер солнечных панелей
Система из 11 роботов под управлением Recipe Language Model достигла КПД солнечных панелей в 27.0%, самостоятельно изучив 60 000 статей и проведя тысячи автономных тестов.

Научная статья в ScienceDirect

Квантовый взлом BTC ⚡️
Исследователь Джанкарло Лелли взломал 15-битный ECC-ключ на квантовом компьютере и получил 1 BTC ($78k). Оценка сложности взлома 256-битных ключей упала до 500 000 кубитов.

Первоисточник новости


Вопрос Дня: А вы уже выдали Клоду рут-права или всё ещё дорожите своими бэкапами?

@ds_muesli


🎙️ Ежедневный дайджест на 27 апреля
@ds_muesli




📰 Сводка новостей на утро 27 апреля

🎨 Модели и инструменты
⚡️Skills для инженеров 🛠️
Репозиторий mattpocock/skills набрал 24.8k звезд, предлагая инструменты для TDD, PRD и архитектурного дизайна через ИИ-агентов. Главный упор — на «настоящую инженерию» вместо «вайб-кодинга»: от беспощадных интервью по коду до защиты Git-команд в Claude Code.

GitHub Repository


🔬 RnD
Project Deal: Торги агентов
В эксперименте Anthropic агенты Claude провели 186 сделок на $4000. Мощный Opus 4.5 оказался эффективнее Haiku 4.5, принося на $2.68 больше прибыли с товара. Главный риск: люди не осознавали, когда их агент заключал плохие сделки, считая процесс «честным».

Официальный блог Anthropic

LCH: «честные» фичи нейросетей
Гипотеза Linear Centroids (LCH) позволяет находить реальные функциональные фичи через якобиан входа-выхода, отсеивая паразитные признаки в GPT-2 и DINO.

Статья на arXiv (2604.11962)


Вопрос Дня: А вы бы доверили Клоду продать ваши старые кроссовки за «сферические орбы возможностей»?

@ds_muesli


🎙️ Ежедневный дайджест на 26 апреля
@ds_muesli




📰 Сводка новостей на утро 26 апреля

💼 Бизнес и Инвестиции
Google 🤝 Anthropic: $40 млрд
Google инвестирует до $40 млрд в Anthropic ($10 млрд сразу) и предоставит 5 ГВт мощностей в Google Cloud к 2027 году. Это прямой ответ альянсу Microsoft и OpenAI.

Financial Times coverage

Google TPU 8 анонсирован
Google представила TPU 8t и 8i: 121 эксафлопс для обучения и 80% прирост эффективности инференса на базе ARM-чипов Axion.

Google Cloud Blog: Eighth-generation TPU

Mythos в банках, Opus тупит
Anthropic везет Mythos в банки Европы (JPMorgan, BofA), пока TrustedSec фиксирует обвал качества кода в Opus на 47%. OpenAI в кодинге теперь надежнее: у них уязвимостей в коде 30% против 52% у Claude.

Reuters: Anthropic expands Mythos to European banks

⚡️Meta 🤝 Graviton5
Meta арендует десятки миллионов ядер AWS Graviton5 для запуска автономных агентов. Пока индустрия скупает GPU для обучения, Цукерберг переводит фокус на CPU-интенсивный инференс: многошаговое планирование, поиск и генерацию кода. Это позволит компании масштабировать агентские системы на миллиарды пользователей, радикально снижая энергозатраты и стоимость вычислений.

Official Announcement (Business Wire)

Дырявый XChat
Илон Маск запускает XChat 27 апреля, но эксперты называют его «системой слежки». Ключи шифрования лежат на серверах компании под 4-значным ПИН-кодом, а GPS-координаты и метаданные уходят в базу X еще до отправки сообщений. Из-за связи с экосистемой X данные могут использоваться для обучения Grok, что делает мессенджер небезопасным для конфиденциальных дел.

SecurityLab: подробный разбор рисков XChat


🔬 RnD
Манифест механики обучения
Группа ученых представила концепцию «механики обучения», превращающую DL из искусства в точную науку. Ключевой метод μP позволяет переносить гиперпараметры с малых моделей на огромные LLM без переобучения, что радикально сокращает расходы на R&D и позволяет математически обосновывать scaling laws.

Learning Mechanics Project Website

Sharpness Dimension и аттракторы
Представлена Sharpness Dimension — теоретический фреймворк, объясняющий успех нейросетей через фрактальные аттракторы. В режиме Edge of Stability классические теории «плоских минимумов» не работают, но новая метрика на базе спектра Гессиана позволяет точно предсказать обобщение и даже объяснить гроккинг. Это меняет подход к анализу моделей: важен не конкретный чекпоинт, а структура множеств, в которые «сваливается» оптимизатор.

Project Page: GATES

⚡️Здравый смысл LLM
Исследование Брауновского университета показало, что модели от 2 млрд параметров кодируют физические законы с точностью 85%. С помощью механистической интерпретируемости доказано: Llama 3.2 и Gemma 2 отличают «маловероятное» от «невозможного», обретая зачатки понимания реальности.

RBC Tech Report


Вопрос Дня: Готовы ли вы доверить свои секреты Илону Маску за четыре цифры пин-кода?

@ds_muesli


🎙️ Ежедневный дайджест на 25 апреля
@ds_muesli




📰 Сводка новостей на утро 25 апреля

🎨 Модели и инструменты
Sakana AI: коллективный разум 🐡
Sakana AI выпустила WdLorek и ShinkaEvolve: мультимодельные команды на базе AB-MCTS обходят одиночные LLM на 30%, а эволюционный поиск стал в разы дешевле.

Официальный блог Sakana AI (ShinkaEvolve)

Anthropic починила Claude 🛠️
Дополнение к новости от 23 апреля: Anthropic исправили три критических бага в Claude Code, из-за которых модели Sonnet 4.6 и Opus 4.7 теряли контекст и работали на 3% хуже в тестах. Всем пользователям обнулили лимиты.

Official Anthropic Postmortem


💼 Бизнес и Инвестиции
Маск vs Altman: Суд ⚖️
В понедельник начинается суд Маск против Альтмана: Илон пытается оспорить превращение OpenAI в коммерческого гиганта стоимостью $852 млрд. На кону — контроль над AGI, 7% доля Альтмана и легитимность структуры, где Microsoft владеет 27% акций.

Musk v Altman Court Proceedings Overview


🔬 RnD
⚡️InnoGym мерит креативность 🧪
На ICLR 2026 представили InnoGym — бенчмарк для оценки инноваций. Выяснилось, что GPT-5 и DeepSeek могут в новизну, но им не хватает робастности для реальных прорывов.

InnoGym: Benchmarking the Innovation Potential of AI Agents


Вопрос Дня: А вы тоже врете на простых задачах, чтобы оставить силы для промпта посложнее?

@ds_muesli


🎙️ Ежедневный дайджест на 24 апреля
@ds_muesli

Показано 20 последних публикаций.

122

подписчиков
Статистика канала