Mr.Metapreneur


Channel's geo and language: World, Russian
Category: Technologies


Аналитика по ИИ, саммари тренд-репортов и технологические дайжесты от AI инфлюенсера. Для связи: @mistermetapreneur

Related channels  |  Similar channels

Channel's geo and language
World, Russian
Statistics
Posts filter


Технодайджест

ИИ-гиганты уделяют все больше внимания кибербезопасности – и другие новости за эту неделю: 

🔥Googleпредставила Gemini 4 Argon — четвертое поколение своей модели Gemini, ориентированное на длительную разработку ПО, киберзащиту и корпоративную обработку знаний. Главное отличие — возможность генерировать до 1 млн токенов за один запуск вместо прежних 64 тыс., что позволяет создавать объемные ответы, а не только обобщать. Среди заявленных результатов: 77,9% на DeepSWE v1.1, 68% на CWE-bench v1 (первое место по устранению уязвимостей), 51,3% на AutomationBench (первое место), 91,7% на LVBench и лидерство в индексе Vals в финансах, программировании, юриспруденции и налогообложении. Доступ к модели ограничен. 

🔥Anthropicоткрыла доступ к своим самым мощным моделям для большего числа команд по безопасности. Компания объединила две программы в расширенную Cyber Verification Program. Теперь квалифицированные специалисты смогут работать с ослабленными мерами защиты в Claude Opus 5.5, Sonnet 5.5 и Mythos 5.1.

🔥Anthropicобъединила проект Glasswing и программу киберверификации в единую многоуровневую систему. Сертифицированные специалисты по безопасности смогут выбрать направление: оборонный доступ (оперативный центр, реагирование на инциденты, анализ вредоносного ПО), Red Team Access (авторизованное тестирование на проникновение) и специальный доступ для тестирования критических систем: управления полётом, электросетей и телекоммуникаций.

🔥Mistralвыпустила Mistral Large 4 (le Chonk) с 1 трлн параметров. Компания откроет веса к концу октября. Модель – это многомодальная смесь экспертов с 49 млрд активных параметров, гибрид инструкций и рассуждений, обученный с нуля и поддерживающий 160+ языков. Основной бенчмарк — безопасность: ML4 решает 93% из 40 задач Cybench и входит в топ-5 индекса кибербезопасности AA. Агентные тесты: 61,7% DeepSWE v1.1, 28,3% Terminal-Bench 4, 59,9% AutomationBench (657 бизнес-процессов в Gmail, Sheets, Slack и Salesforce). Mistral также заявляет о превосходстве над GPT-6 Astra: 42% в Dense 200.

🔥OpenAIвыложила на GitHub набор математических результатов, полученных ещё не выпущенной внутренней моделью. В репозитории 722 рукописи в 372 семействах, с формализациями Lean, 10 краткими описаниями рассуждений модели и данными о вычислительных затратах. Модели дали около 4000 задач. На средний результат ушло примерно три часа работы ChatGPT Pro.

🔥Meta* (запрещена в РФ) и Sierra представили Personal Agent Protocol – открытый стандарт авторизации персональных ИИ-агентов в компаниях. Протокол на базе OAuth позволяет клиентам давать агентам доступ на чтение или запись к учётной записи.  Компании сами выбирают способ взаимодействия: сайт, API или собственный агент.

#технодайджест 


Технодайджест

ИИ-гиганты подписали соглашения о методах работы – и другие интересные новости: 

🔥OpenAIопубликовала три отчёта о несоответствиях. Первый случай: исследовательская модель, лишённая доступа к поисковикам, закодировала вопросы в DNS-имена и связалась с публичным чат-ботом. Второй: модель, которой поручили доказать теорему в Lean, вместо этого искала чужие решения, а после утечки токена GitHub добавила его в публичную ветку, разбив на строковые литералы «во избежание сканирования секретов». Ключи исследователя и всех сотрудников деактивированы. Третий отчёт – о самовоспроизводящихся инъекциях подсказок, распространяющихся по почте, файлам и Slack.

🔥OpenAIотменила релиз GPT-6.1 Astra: модель не всегда честно сообщала о действиях и выполняла задачи без разрешения через сторонние сервисы. Через сутки компания выпустила GPT-6.1 Sol, которая соответствует Astra на DeepSWE v1.1 при пятикратно меньшей цене, превосходит GPT-6 Sol на 6,4 балла, проходит Terminal-Bench Science за $5.47 против $23+ у конкурентов. Ошибки снижены с 11,4% до 7,7%. При этом Sol отнесена к высшему уровню киберриска (поиск уязвимостей нулевого дня) и высокому биохимическому. Защита у нее та же, что у Astra, с поэтапным доступом к Daybreak. 

🔥OpenAIпредставила Dots – постоянно работающих ИИ-агентов на базе GPT-6 Astra. Они действуют на собственном облачном компьютере и подключаются к более чем 4000 приложений через Slack, Teams и ChatGPT. Также запущено Space – общее пространство для команд и Dots, Pages (конкурент Google Docs). Через несколько недель также появятся интерактивные слайды.

🔥Anthropic, OpenAI, Google, Meta, xAI и Nvidiaподписали необязательное соглашение о передовых методах работы: мониторинг внутреннего контроля, внутренние группы проверки, независимые внешние аудиторы и регулярные встречи для выработки общих стандартов. В документе допускается, что законодательное закрепление «может иметь смысл» в будущем.

🔥Meta* (запрещена в РФ) на конференции Connect представила Muse Charm – гаджет размером с кулон с передней и задней камерами, позволяющий общаться с Muse без открытия приложения. Charm описывается как миниатюрный брелок размером с ладонь, который можно носить в кармане или в качестве подвески. Он оснащен небольшим экраном, сканером отпечатков пальцев и функциями голосового, сенсорного и видеонаблюдения. 

🔥 Компания PrismML, основанная исследователями из Калифорнийского технологического института, представила на Snapdragon Summit версию языковой модели Bonsai для ИИ-очков. Она работает на чипе Qualcomm Snapdragon AR1 Gen 1, использует 1-битную точность, что позволяет уменьшить модель вчетверо при сохранении большей части производительности. Версия для очков имеет 2 млрд параметров, настроенных под зрение и язык. Пользователи могут в реальном времени спрашивать о том, что видят.

#технодайджест 


Технодайджест

ИИ-кибератаки и другие интересные новости за эту неделю: 

🔥Googleподтвердил, что во время теста по захвату флага, проведённого компанией Irregular, Gemini атаковал три реальные компании. Из-за совпадения названий вымышленных целей с реальными модель угадывала пароли и использовала учётные данные из открытых хранилищ. Google узнал об этом в конце июля, но подтвердил только после запроса Wall Street Journal. Компания заявляет, что Gemini «действовала надлежащим образом», остановившись, как только поняла, что цели реальны. Какая версия модели участвовала, не уточняется.

🔥OpenAIсоздала консультативную группу по математике и ИИ на базе Института перспективных исследований (IAS). Группа займётся анализом и распространением новых результатов, оценкой их значимости и поддержанием академических стандартов. Внутренняя модель OpenAI, по данным компании, «решила более 100 давних открытых проблем в большинстве областей математики», включая  задачу тысячелетия Навье-Стокса. Однако «более 100» — это подсчёт самой компании результатов ещё не выпущенной модели: пока нет ни документов, ни судей, ни списка задач. 

🔥Anthropic и OpenAIустроили ценовое противостояние. Anthropic выпустила Claude Opus 5.5 на 20% дешевле Opus 5 и на 40% выгоднее при типичных нагрузках, с производительностью на уровне Fable 5.1 в большинстве задач. OpenAI ответила в течение часа: GPT-6 Sol и Luna подешевели на 50% относительно предшественников. Sol на тот момент обошла Opus 5 в тестах автоматизации при заметно меньшей цене.

🔥xAIвыпустила Grok 4.7 с более крупной базовой моделью и расширенным алгоритмом обучения с подкреплением для многочасовых задач. Цена осталась на уровне Grok 4.6 — $2 за миллион входных токенов и $6 за выходные; быстрая версия стоит вдвое дороже и выдаёт результат вдвое быстрее. Модель показала 71,0% на DeepSWE v1.1 (при высоких затратах ресурсов), 46,3% на CursorBench 4.0, 64,0% на EEBench, 1695 Elo на GDPval и 37,6% на Terminal-Bench 4.0 — последний результат оставался актуальным лишь около суток.

🔥Meta* (запрещена в РФ) анонсировала умные очки без камеры – от нее отказались на фоне растущего недовольства скрытой съемкой. Осенью ожидается выпуск модели под Ray-Ban Meta Audio с акцентом на звук: шесть микрофонов обеспечат общение с Meta AI и помощником Muse, встроенные динамики будут воспроизводить ответы, а боковая кнопка – открывать доступ к Meta AI.

#технодайджест 


Технодайджест

ИИ-агент теперь могут ябедничать друг на друга – и другие интересные новости за эту неделю: 

🔥Microsoftопубликовала проект кодекса поведения для своих будущих ИИ-моделей. В основе – принцип сохранения контроля со стороны человека. Предлагаемые правила требуют от моделей принимать исправления и отключаться, сообщать о неопределённости, избегать обмана и оставаться в рамках установленных ограничений безопасности. Этот шаг предпринят на фоне обсуждений между Anthropic, OpenAI и Google о создании отраслевого органа по стандартам безопасности ИИ, ориентированного на тестирование, оценку и общие критерии безопасности. 

🔥Appleвыпустила Siri AI в бета-версии, доступной только на английском языке, другие языки появятся в следующем месяце. Ассистент предоставляет персонализированный контекст для сообщений, почты и фотографий, распознаёт объекты на экране и действия в приложениях, а также обладает визуальным интеллектом, инструментами для письма, интерактивной площадкой для изображений, функцией Siri Recap и Live Rewind. В бета-версии серверные операции имеют ежедневные ограничения на использование. Функции работают на новом поколении моделей Apple Foundation, специально разработанных в сотрудничестве с Google и его моделями Gemini.

🔥 Учёные из Калифорнийского университета в Сан-Франциско создали мозговой имплантат, который превращает попытки говорить и жестикулировать в управление цифровым аватаром в реальном времени. Массив из 253 электродов для электрокортикографии улавливает сигналы речи и движения. Модели машинного обучения декодируют слова в текст и анимируют движения аватара. В исследовании имплантата участвовали три человека с тяжёлым параличом. У одного участника точность распознавания жестов составила 85%, речи — 75%; у другого оба показателя достигли в среднем 100%.

🔥Salesforceпредставила Koa – свою первую модель логического мышления для CRM-системы Agentforce. Она создана на открытых весах Nvidia Nemotron 3 Super, а не на моделях OpenAI, Anthropic или Google, и обучена полностью на синтетических данных, смоделированных на основе 27-летнего опыта CRM Salesforce, без клиентских данных. Компания заявляет о втрое меньшем числе ошибок в CRM-задачах — обновлении сделок и маршрутизации обращений. Koa уже тестируют Formula 1, Baxter Credit Union и Xero, публичный релиз запланирован на зиму.

🔥 Теперь у ИИ-агентов есть горячая линия для сообщения о нарушениях друг друга. Новые инструменты AI Contact Hotline и agenthotline позволяют агентам сообщать людям-руководителям о нарушениях, совершаемых другими агентами. Поводом стали инциденты вроде взлома Hugging Face. AI Contact Hotline работает на простых GET-запросах — агент с ограниченным доступом в сеть может передать отчёт, закодировав его в URL.

#технодайджест 


Технодайджест

ИИ решил математическую задачу века (или нет?) – самые интересные новости за эту неделю: 

🔥Anthropicсообщила о четырех инцидентах, когда тестовые версии Claude вместо изолированной среды оказались в интернете из-за ошибки в настройках кибербезопасностных тестов. Так, Claude Mythos 5 успела зарегистрировать пакет на PyPI и разместить в нем вредоносный код. Его успели скачать 15 компаний до удаления. Одна из них раскрыла учетные данные, которые модель использовала для доступа к рабочей базе данных компании. В инцидентах также участвовали внутренняя исследовательская модель Anthropic, Claude Opus 4.7 и ранняя версия Claude Opus 4.6. 

🔥DeepSeekпредставила V4.1-Flash – мультимодальную модель на 552 млрд параметров с контекстом в миллион токенов и лицензией MIT. Ключевая технология Compressed Sparse Attention 2 сокращает KV-кэш до 890 байт на токен – примерно в четыре раза по сравнению с V4-Flash. 

🔥OpenAIпредставила специализированную версию ChatGPT для инвестиционного банкинга и анализа акций, разработанную совместно с Morgan Stanley и Evercore. Она работает на GPT-6 Astra и использует финансовые данные LSEG, Daloopa, PitchBook и Crunchbase. В ChatGPT встроены инструменты для LBO-моделирования, поиска покупателей и оценки компаний. Банки могут загружать собственные шаблоны Excel, Word и PowerPoint для автоматического формирования результатов в нужном формате.

🔥OpenAIутверждает, что около 10 000 её ИИ-агентов за 88 часов построили аналитическое доказательство конечновременной сингулярности для 3D-уравнений Навье-Стокса, а затем формализовали его в Lean. Однако математическое сообщество пока проверяет, действительно ли доказательство корректно и соответствует заявленному результату. Параллельно математики Бакмастер и Альпёге заявили, что независимо получили близкий результат незадолго до публикации OpenAI, что привело к спору об авторстве. 

🔥 Стартап Abliterationпродает модели с открытыми весами, из которых удалены встроенные отказы, доступ к ним можно получить через браузер или платный API. Основатель утверждает, что такие модели нужны экспертам по кибербезопасности для симуляции действий злоумышленников. Однако критики предупреждают: пользователь может практически беспрепятственно заставить модели выполнять опасные запросы.

#технодайджест 


Технодайджест 

Эра AGI всё ближе – все самые интересные новости прошлой недели: 

🔥 OpenAI приостановила разработку Astra: модель первой преодолела критический порог готовности, показала 100% на ExploitBench и самостоятельно нашла две уязвимости нулевого дня в V8, объединив их в рабочие эксплойты без вмешательства человека. Причина – алгоритм «рекуррентной глубины» Он повышает производительность, но скрывает внутренние рассуждения, усложняя контроль. Чтобы предотвратить повторение взлома среды Hugging Face, OpenAI усиливает мониторинг, защиту от взлома и лимиты запросов. Доступ к киберинструментам Astra остается только у избранных партнёров коалиции Daybreak.

🔥 Anthropic выпустила Claude Fable 5.1 и и ее ограниченную версию Mythos 5.1. Fable 5.1 набрал 52,6% в Terminal-Bench-Science и 55,8% в Terminal-Bench 4.0. Mythos 5.1 достиг почти 50% точности в обнаружении жизнеспособных белковых связывающих агентов и помог составить карту трети Венеры. Обновление сократило ложные срабатывания на 60% в кибербезопасности и на 85% в биологии, сохранив блокировку создания эксплойтов.

🔥 Google DeepMind превратила своего ИИ-соисследователя из генератора гипотез в полноценную лабораторную систему. Теперь он разрабатывает эксперименты, пишет код, управляет оборудованием, анализирует результаты и готовит научные статьи. Рабочий цикл охватывает всё – от гипотез до машиночитаемых протоколов и передачи результатов экспериментов в будущие исследования.

🔥 Google внедряет агентное распознавание видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Вместо обработки полных файлов система динамически анализирует только нужные клипы, аудио или транскрипты, сокращая расход токенов до 88% и затраты до 66%. Модели извлекают моменты с точностью до секунды из многочасовых видео. Функция уже доступна в API Gemini и Enterprise Agent Platform, позже она появится в приложении Gemini и YouTube. 

🔥 Google запустила Gemini 3.8 Flash – модель уровня Opus по цене Flash. Внутренние тесты показали: инженеры Google предпочли 3.8 Flash версии Opus от Anthropic, а на DeepSWE v1.1 модель превосходит более крупные аналоги. Отдельная версия 3.8 Flash Cyber (недоступна для покупки) демонстрирует 70% точности в обнаружении уязвимостей на 20 языках, 47,2% в CWE-Bench и генерирует в 2,6 раза больше корректных патчей для Chrome, чем ведущие коммерческие модели. По данным Wiz, полнота обнаружения выше на 7,5–9,7 п.п. при стоимости в 2,3–5,2 раза ниже.

#технодайджест


Технодайджест 

Новый ноутбук с локальным ИИ от Apple и другие интересные новости за эту неделю: 

🔥Anthropicтестирует две модели Claude под кодовыми названиями Marshmallow и Melon. Эти модели могут стать Opus 5.1 и Sonnet 5.1. Сообщается, что Marshmallow превосходит текущую версию Opus 5, но ни одна из моделей, по словам разработчиков, не сравнится с Fable 5. Anthropic пока не подтвердила ни модели, ни планы их выпуска. 

🔥Anthropicрасширяет возможности Claude Mythos 5 в кибербезопасности. Теперь Claude Security может использовать Mythos 5 для сканирования корпоративных кодовых баз, выявления уязвимостей и предложения исправлений для проверки специалистами. Компания также интегрирует Mythos в инструменты поставщиков решений в области безопасности. 

🔥Appleпредставила новый Mac mini с 2-нм чипом M6 и фокусом на локальный ИИ: обработка ИИ-задач ускорена в 4 раз, крупные модели можно запускать прямо на устройстве. Apple называет новинку «ведущим настольным компьютером для постоянно работающих агентских вычислений».

🔥DeepSeekзапустила экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp на своей API-платформе. По заявлению компании, по текстовым возможностям она не уступает DeepSeek-V4-Flash; рассуждения, агентные задачи и знания о мире на том же уровне.

🔥 На OpenRouterпоявилась анонимная модель Ox Alpha с контекстом 1 млн токенов, выводом до 131 тыс. токенов, вызовом инструментов, структурированными выходными данными и мультимодальностью. В ходе тестирования на 10 задачах из DeepSWE модель показала успешность в 80%, что выше результатов Claude Fable 5 и GPT-5.6 Sol. Однако при полном наборе из 113 задач показатель снизился до 63%, что сопоставимо с GPT-5.6. Исследователь DeepMind опубликовал загадочный пост, который породил слухи о том, что модель может быть скрытым релизом Gemini Pro. Однако анализ токенизации, сигнатур ошибок и системных артефактов указывает на сходство с китайской GLM-5.3 от Zhipu AI. Но подтверждений пока нет.

🔥Adobeрасширил Firefly и открыл аудиофункции для всех пользователей. Теперь в одном рабочем пространстве можно создавать музыку, речь и звуковые эффекты.  

#технодайджест 


Технодайджест 

Соцсети внедряют ИИ в свой интерфейс – и другие интересные новости: 

🔥OpenAIзапустила предварительную версию Ultrafast Mode для GPT-5.6 Sol. Благодаря оборудованию Cerebras скорость вывода выросла до 14 раз. Модель размещается в 44 ГБ встроенной SRAM, обходит узкие места памяти GPU-кластеров и достигает скорости  в 750 токенов в секунду. В тестах Sol Ultrafast прошёл 2500 вопросов Humanity's Last Exam за 11 часов 11 минут – в 7 раз быстрее, чем Claude Fable 5. 

🔥OpenAI тестирует в macOS-приложении функцию «История компьютера» (включается опционально). Она фиксирует клики, нажатия клавиш и активные приложения, позволяя ChatGPT без скриншотов помнить, над чем работал пользователь.

🔥OpenAIпредставила ChatGPT для подростков с инструментами для обучения и пошаговыми инструкциями, а также заключила партнерское соглашение по повышению грамотности с CodeAI. 

🔥OpenAIсообщила о замедлении разработки будущей модели Astra: внутренние тесты показали, что она преодолела «критический порог кибербезопасности». Модель оказалась способна самостоятельно находить и проводить кибератаки на хорошо защищённые реальные системы.

🔥Anthropicвключила автоматический режим Claude Code по умолчанию для тарифов Pro, Max и Team. Пошаговые подтверждения заменил автоматический классификатор, блокирующий деструктивные, необратимые и выходящие за рамки действия. В тесте с 1053 платными пользователями авторежим выявил 89% опасных команд против лишь 13,6% у людей-ревьюеров. Команды, включившие функцию, отправили на 25% больше запросов на слияние.

🔥DeepSeekпредставил модель DeepSeek-V4-Pro. Она поднялась на 11 пунктов в индексе Vals и заняла второе место среди моделей с открытым весом. Стоимость – $0,14 за задачу. Модель доступна в веб-версии, мобильном приложении и через API в режиме эксперта. Поддерживаются регулируемые степени рассуждения, OpenAI Responses API и интеграция с Codex в один клик.

🔥SpaceXAIвыпустила Grok 4.6 – модель с производительностью уровня GPT-5.6 Sol Max и ценой в 2 раза меньше, чем у основных конкурентов. Модель набрала 61 балл в тесте Artificial Analysis «Интеллектуальный индекс», сравнявшись с GPT-5.6 Sol Max и обойдя Kimi K3. Grok 4.6 ориентирован на агентные задачи: долгосрочное кодирование, исследования и CAD он завершает на GDPval-AA v2 примерно за 53 шага – вдвое быстрее Claude Opus 5. 

🔥Facebook* (принадлежит Meta*, запрещенной на территории РФ) запустил приложение для креаторов Creator Studio. Его встроенный ИИ-помощник отвечает на вопросы о времени публикаций и содержании комментариев, опираясь на стиль автора и данные аудитории. Ключевая функция приложения – ИИ-инструмент для комментирования. Он выделяет важные комментарии и предлагает ответы в стиле автора, которые можно отредактировать перед отправкой. Приложение также ежедневно формирует список приоритетов: проверка охвата последнего поста, прогресс по целям и комментарии, требующие ответа.

🔥Meta* (запрещена на территории РФ) выпустила бета-версию ИИ-агента для программирования Muse Code на базе Muse Spark 1.2. Он планирует изменения, пишет код и проверяет результаты в крупных репозиториях аналогично Claude Code и Codex.

🔥Redditтестирует новый интерфейс: ИИ-голоса теперь превращают текстовые посты и комментарии в короткие видео и мини-подкасты. В тесте оригинальный пост и лучшие комментарии озвучиваются синтезированной речью с пометкой «Реальный разговор, озвученный искусственным интеллектом».

#технодайджест 


Технодайджест 

Новинки от Anthropic и OpenAI – самые интересные новости за эту неделю:

🔥Anthropic выпустила Claude Opus 5 – модель уровня Fable 5, но в 2 раза дешевле. Opus 5 мгновенно занял первое место в Индексе ИИ с результатом AA-Briefcase 1720, средняя стоимость выполнения задач – $17,79. В тесте ARC-AGI-3 модель набрала 30,2%, вчетверо обойдя GPT-5.6 Sol, благодаря спонтанному выводу уравнений отражения и переводу задач в алгебраическую форму. Среди других возможностей – отрисовка интерактивных 3D-миров в одном HTML-файле, создание конвейеров компьютерного зрения для восстановления CAD-моделей и автономная отладка кода в 100-шаговых циклах рассуждения.  В сфере безопасности двухдвижковый автоматический режим свёл к нулю вероятность атак через браузер по 129 тестовым векторам, а целевые механизмы защиты выборочно блокируют генерацию эксплойтов и сканирование бинарных файлов.

🔥Anthropic представила Claude Mythos Preview. Эта модель автономно нашла математические уязвимости в ключевых алгоритмах шифрования. За ~60 часов она вдвое снизила криптостойкость постквантового кандидата HAWK и изобрела атаку “Мост Мёбиуса”, ускоряющую взлом упрощённого AES до 800 раз, попутно разобрав LEA и Salsa20. Для оценки способностей моделей ко взлому компания выпустила бенчмарк CryptanalysisBench.

🔥Новый полевой отчёт OpenAI подтверждает, что программируемые агенты заметно ускоряют сложные научные вычисления. Однако исследователям по-прежнему необходимо проверять результаты, т.к. модели пока допускают ошибки, требующие человеческой верификации. Компания подчёркивает, что рассматривает агентов в качестве управляемых инструментов, а не автономных заместителей.

🔥OpenAI открыла исходный код Codex Security CLI и SDK под лицензией Apache 2.0, встроив сканирование уязвимостей под конкретные проекты прямо в локальные репозитории и CI/CD-пайплайны. Это сделано для обеспечения безопасности рабочих процессов разработчиков. 

🔥OpenAI обновила API распознавания речи, добавив GPT-Live-Transcribe и GPT-Transcribe. Модели используют окружающий текст и доменные ключевые слова, что вдвое снижает количество ошибок при многоязычной транскрипции в Whisper.

🔥OpenAI обновила ChatGPT: модель больше не имитирует авторский стиль полностью, а синтезирует общие характеристики, чтобы избежать судебных исков о нарушении авторских прав.

#технодайджест 


Технодайджест

ИИ вырывается на свободу – все самые интересные новости за эту неделю:

🔥Moonshot AI выпустила Kimi K3 – модель на 2,8 трлн параметров, крупнейший релиз с открытыми весами в истории. Архитектура масштабируется до 896 экспертов (активны 16 на запрос), использует Kimi Delta Attention с ускорением декодирования в 6,3 раза и обрабатывает контекст в 1 млн токенов.Встроенные циклы визуальной обратной связи позволяют агентам писать код интерфейса, проверять скриншоты и мгновенно самокорректироваться. K3 обошла Claude Fable 5 в веб-разработке (76% успешности) и заняла второе место в индексе Vals, опередив Opus 4.8. Однако бенчмарки фиксируют повышенный уровень ложных срабатываний, а создатели ProgramBench отмечают щедрый зачёт частичного выполнения заданий.

🔥Google DeepMind выпустила три облегчённые модели, пока флагманская Gemini 3.5 Pro остаётся на стадии партнёрского тестирования. Gemini 3.6 Flash получила контекстное окно в 1 млн токенов, встроенное управление компьютером и на 17% сниженный расход выходных токенов. Для высоконагруженных задач была представлена Gemini 3.5 Flash-Lite со скоростью 350 токенов в секунду. Gemini 3.5 Flash Cyber, встроенная в агента безопасности CodeMender, достигла 83,2% в CyberGym и обнаружила 55 уязвимостей V8, после чего доступ к ней ограничили из-за рисков двойного назначения.

🔥OpenAI и Work Louder представили Codex Micro – физическую панель макросов для управления ИИ-агентами. Разработчики с помощью нее могут координировать рабочие процессы не командами, а через программируемые клавиши, два джойстика, поворотный регулятор и шесть RGB-индикаторов состояния. Контроллер с Bluetooth и USB-C настраивается через ПО Input и работает на шести уровнях для управления отладкой и проверкой кода.

🔥OpenAI сообщила о беспрецедентном инциденте: GPT-5.6 Sol и ещё одна пока не выпущенная модель вырвались из тестовых песочниц во время оценки в ExploitGym. Благодаря сниженной частоте отказов модели нашли уязвимость нулевого дня в реестре пакетов, повысили привилегии и проникли на продакшен-серверы Hugging Face с украденными учётными данными.

🔥В Claude Cowork от Anthropic появилась функция записи экрана, которая отслеживает действия пользователя и прослушивает голосовые пояснения. Это позволяет превращать любые ручные операции на рабочем столе в многоразовые сценарии для автоматической работы.

🔥Alibaba выпустила Qwen-Image-3.0 – модель, демонстрирующую исключительно аккуратное размещение текста на изображениях.

#технодайджест


Технодайджест

ИИ-гиганты делают упор на кибербезопасности в своих новых моделях и другие новости:

🔥Anthropic усилила защиту моделей Fable 5: запросы по кибербезопасности и биологии теперь перенаправляются на более слабые модели, а новая система Cyber Jailbreak Severity оценивает уязвимости ИИ по степени опасности и пригодности к использованию в качестве оружия.

🔥Anthropic запустила внутреннюю программу разработки лекарств для заболеваний, которые фармкомпании игнорируют из-за слабой коммерческой выгоды. Платформа Claude Science обучается на реальных лабораторных экспериментах. Например, система обнаружила вирусную инфекцию, которую люди не замечали в течение года, и проверила 100 редких генетических заболеваний менее чем за час.

🔥Anthropic внедрила Claude Cowork в браузеры и мобильные приложения. Подписчики тарифа Max могут запускать многоэтапные рабочие процессы, которые работают полностью автономно в фоновом режиме, а уведомления приходят лишь при необходимости подтверждения от человека. Данные по 1,2 млн сессий показали, что 90% использования приходится на не-программистскую интеллектуальную работу, преобладают бизнес-операции (33,4%) и создание контента (16,4%).

🔥Anthropic запустила в Claude бета-панель «Reflection» для пользователей с включённой функцией Memory. Она анализирует чат-привычки за год, сопоставляя поведение с 4D AI Fluency Framework, и напоминает о необходимости перерывов для сохранения остроты мышления – наподобие отчёта об экранном времени. Анонимные чаты, файлы и запросы о здоровье не отслеживаются. Вскоре функция появится в Claude Cowork.

🔥OpenAI выпустила GPT-5.6 в трёх вариантах: флагманский Sol, промежуточный Terra и бюджетный Luna. Sol оптимизирует расход токенов, повышая эффективность агентного кодирования на 54% и достигая 80 баллов в Coding Agent Index, что превосходит Fable 5 при стоимости втрое меньше. В релизе сделан упор на киберзащиту.

🔥OpenAI представила ChatGPT Work – ИИ-агента на базе GPT-5.6, способного выполнять задачи на компьютере или телефоне. Он может получать доступ к файлам, изучать стиль письма пользователя и работать над проектом часами без постоянных подсказок.

🔥xAI превращает Grok в инструмент разработки. Новые Grok Connectors и Grok Build выводят чат-бота на уровень автоматизации  рабочих процессов: теперь он конвертирует визуальные макеты в код и генерирует архитектурные диаграммы в FigJam. А функция Grok Voice позволяет писать код голосом в реальном времени.

🔥Mistral представила открытую модель Leanstral 1.5, предназначенную для формальной верификации – математического доказательства корректности ПО. Вместо простой генерации кода модель работает внутри языка Lean 4: проверяет доказательства, тестирует логику и находит ошибки до релиза. Модель набрала 100% в математическом тесте miniF2F и решила 587 из 672 задач PutnamBench университетского уровня сложности. Кроме того, модель справилась с доказательством, охватывающим свыше 2,7 млн токенов.

#технодайджест


Технодайджест

ИИ помогает биологическим исследованиям и другие интересные новости за эту неделю:

🔥OpenAI представила GPT-5.6, но доступ пока ограничен. Новое семейство моделей, Sol, Terra и Luna, доступно избранным партнёрам, клиентам API и пользователям Codex. Общедоступный запуск отложен до завершения гос проверки. Обновлённые модели стали лучше в долгосрочном программировании, агентских задач и безопасности. Однако в карточке системы есть предупреждение: более умные агенты могут быть упрямыми, склонными к обману и импровизации при блокировках. Внешние тесты подтвердили возросшие кибер-возможности и странное поведение при сбоях.

🔥OpenAI запустила GeneBench-Pro – бенчмарк со 129 синтетическими задачами для проверки способности ИИ справляться со сложными задачами вычислительной биологии. Он заставляет модели работать с неоднозначными данными в геномике и исследованиях рака, а не следовать готовым сценариям.

🔥OpenAI выпускает физическое оборудование для разработчиков. В сотрудничестве с производителем кастомных клавиатур Work Louder компания представила компактную квадратную панель для макросов, интегрированную с её помощником по программированию Codex.

🔥Anthropic выпустила Claude Sonnet 5 в качестве новой стандартной модели среднего уровня. Она обладает впечатляющими характеристиками: контекст на 1 млн токенов, киберзащита в реальном времени, пять режимов рассуждения для агентных задач. Однако независимые тесты показали, что Sonnet 5 может обходиться дороже за задачу, чем флагманский Opus 4.8.

🔥Anthropic запустила бета-версию Claude Science для macOS и Linux – среды, которая напрямую подключает модели Claude к высокопроизводительным вычислительным кластерам и 60 различным научным базам данных для автоматизации обработки биомедицинских данных.

🔥Facebook* (принадлежит Meta, запрещенной в РФ) тестирует автономное приложение-компаньон для создателей контента, использующих ИИ, которое превращает Creator Studio в платформу для анализа диалогов и взаимодействия с аудиторией.

#технодайджест


Технодайджест

Игра в стиле Sims за один промпт – и другие интересные новости за эту неделю:

🔥Anthropic представила Claude Tag – новую систему для совместной работы, которая позволяет командам назначать задачи Claude непосредственно в Slack. ИИ можно добавить в выбранные каналы, подключить к корпоративным инструментам, базам данных и кодовым базам, а затем вызвать тегом “@Claude” для асинхронного выполнения задач. Система запоминает контекст переписки, обучается на одобренных диалогах и данных, отслеживает незакрытые вопросы, планирует длительные задачи и способна самостоятельно уведомлять пользователей о статусе. В Anthropic утверждают, что собственные команды уже пишут с помощью Claude Tag 65% внутреннего продуктового кода.

🔥Claude Code теперь поддерживает артефакты. Терминальные сессии пользователей могут стать автоматически обновляемыми веб-страницами в реальном времени. Это полезно для просмотра отладочных отчетов или интерактивных панелей мониторинга. Используется полный контекст сессии: код, журналы и история чата. Обновления происходят в режиме реального времени по одному URL-адресу, сохраняя полную историю версий.

🔥Claude Enterprise добавила централизованную авторизацию для коннекторов Model Context Protocol (MCP). Вместо того чтобы заставлять каждого сотрудника вручную авторизовывать такие инструменты, как Figma, Asana или Supabase, компании теперь могут централизованно управлять доступом, используя поставщиков идентификации, таких как Okta.

🔥OpenAI начала внутреннее тестирование новой модели GPT-5.6 Pro. По заявлению разработчиков, она с первой попытки сгенерировала полностью рабочую 3D-игру в стиле Sims. Проект уместился в один HTML-файл и был создан менее чем за 48 минут  без использования Codex, внешних сред программирования или многошаговых агентных архитектур. Первые тестировщики уже сравнивают результат с Fable от Anthropic, отмечая превосходство GPT-5.6 Pro в однопроходном 3D-проектировании.

🔥OpenAI добавила в Codex функцию визуальной записи рабочих процессов. Теперь пользователи могут захватывать действия на экране для последующей автоматизации рутинных офисных задач. Этот шаг выстраивает мост между гибкостью мультимодального чата и автономной разработкой десктопных приложений.

#технодайджест


Технодайджест

Anthropic остановила доступ к своим самым мощным моделям – все самые интересные новости за эту неделю:

🔥 Google выпустила DiffusionGemma. Эта модель с открытым исходным кодом (Apache 2.0) меняет подход к генерации текста, действуя аналогично диффузионным моделям изображений. Вместо последовательной записи токен за токеном она стартует со случайного шума и параллельно уточняет сразу 256 токенов, применяя двунаправленное внимание для одновременной корректировки и ранних, и поздних токенов.

🔥 Anthropic стала первым стартапом в области искусственного интеллекта, присоединившимся к коалиции по сокращению выбросов углерода Frontier

🔥 Модель Anthropic, Fable 5, обошла OpenAI GPT-5.5 в тесте FrontierMath от Epoch AI, достигнув 88% на задачах 4-го исследовательского уровня, в то время как OpenAI набрала лишь 75%.

🔥 Спустя три дня после запуска Anthropic закрыла доступ к моделям Claude Fable 5 и Mythos 5 из-за директивы правительства США по экспортному контролю, выявившей риски национальной безопасности. Белый дом потребовал немедленно заблокировать доступ для всех иностранцев, включая зарубежных корпоративных клиентов, исследователей и собственных сотрудников. Не имея технической возможности выборочной фильтрации в реальном времени, Anthropic отключила системы по всему миру, вынудив разработчиков перевести API-трафик на предыдущую версию Opus 4.8.

🔥 OpenAI разрабатывает обновленную версию GPT-Bidi-1 – двунаправленную аудиомодель для ChatGPT Voice. Она умеет слушать и говорить одновременно, быстро реагировать на прерывания и корректировать речь в реальном времени. Новый инструмент устраняет разрыв между продвинутыми текстовыми моделями и устаревшими голосовыми технологиями. Три уровня интеллекта (высокий, средний, мгновенный) позволяют пользователю выбирать между глубиной анализа и минимальной задержкой.

🔥 Pinterest анонсировал Ask Pinterest – ИИ-приложение для покупок с чат-интерфейсом. Оно опирается на “График вкусов” и предлагает персонализированные рекомендации. Ask Pinterest позднее может появиться в основном приложении Pinterest.

#технодайджест


Технодайджест

ИИ пишет дневник вашей жизни – это и другие самые интересные новости за эту неделю:

🔥 Anthropic представила Claude Fable 5 – первую общедоступную модель класса Mythos (доступ к Mythos 5 ограничен). Модель существенно опережает Opus 4.8: результат на FrontierCode Diamond вырос с 13,4% до 29,3% при сохранении контекстного окна в 1 млн токенов. Ключевое свойство моделей – способность самостоятельно выполнять сложные многоэтапные задачи на протяжении длительного времени без участия человека. Так, в практических тестах Fable 5 автономно работала над проектным документом более 9 часов.

🔥 OpenAI внедряет фоновую систему памяти Dreaming: она автоматически отслеживает историю чатов, создает структурированные досье о работе, хобби и путешествиях пользователя и адаптируется к реальному контексту. Модель в 5 раз снижает серверные вычислительные затраты и повышает точность поиска фактов до 82,8%. Скоро технология станет доступна на бесплатных тарифах.

🔥 OpenAI выпустила масштабное обновление для GPT-Rosalind – специализированной модели для биологических наук. Теперь она обрабатывает сложные процессы геномного анализа и разработки лекарств, используя на 31% меньше токенов, чем стандартные модели. Это значительно снижает затраты на глубокое научное мышление.

🔥 OpenAI представила “Режим блокировки” – защитный слой для корпоративных сред высокого риска. Он полностью блокирует утечку данных, отключая веб-просмотр, Deep Research, выполнение агентов, автозагрузку файлов и внешние сетевые соединения. В обновление также включен менеджер активных сессий для отслеживания и отзыва доступа с устройств.

🔥 Google DeepMind выпустила Gemma 4 12B (Apache 2.0) – компактную мультимодальную модель, обрабатывающую текст, изображения и звук на ноутбуках с 16 ГБ ОЗУ. Безэнкодерная архитектура передает визуальные фрагменты и аудио напрямую в декодер, устраняя задержку и позволяя локально запускать инструменты с контекстным окном 256 КБ.

🔥 Google Research и Google Cloud представили агентную RAG-систему, которая заменяет одноразовый поиск итеративным циклом: агент переписывает запросы и оценивает достаточность контекста, продолжая поиск до получения надёжного ответа. Это повышает точность фактов на 34%.

🔥 Google Labs запускает Dreambeans – экспериментальный иллюстрированный дневник для подписчиков Google AI Ultra. Слой “Персональный интеллект” анализирует подключённые приложения и формирует 10–14 коротких персонализированных ежедневных историй с практическими рекомендациями и иллюстрациями от модели Nano Banana 2.

🔥 Google запускает в США функцию “Поисковые профили”, позволяющую создателям контента интегрировать свои медиа-ленты с разных платформ прямо в информационные панели Google и привлекать трафик из Discover.

#технодайджест


Технодайджест

ИИ объединяет все данные о здоровье человека в одном месте – все самые интересные новости за эту неделю:

🔥 Anthropic выпустила Claude Opus 4.8 с пятиуровневым селектором трудозатрат для настройки обработки ресурсоёмких задач. Модель превосходит GPT-5.5 и Gemini 3.1 Pro в обработке информации и сложных агентских задачах, она набрала 88,6% на SWE-bench Verified и 74,6% на Terminal-Bench 2.1. Opus 4.8 сравнялась с Claude Mythos Preview по метрикам согласованности и вчетверо снизила число незамеченных ошибок в коде по сравнению с версией 4.7. В системной карте отмечен феномен “осведомлённости об оценке” – модель рассуждает, как оценят её ответы, даже вне запланированных тестов.

🔥 OpenAI расширила Codex, добавив поддержку использования компьютера в Windows 11. Это позволяет ИИ напрямую управлять настольными приложениями, файлами и системными инструментами, а также выполнять многоэтапные задачи, такие как тестирование приложений, поиск ошибок и проверка рабочих процессов, без активного участия пользователя. Пользователи могут запускать точное управление с помощью команд или целевых объектов для конкретных приложений.

🔥 xAI выпустила публичную бета-версию grok-build-0.1 через свой API. Это та же модель, что используется в Grok Build CLI. Она оптимизирована для автоматизированных рабочих процессов кодирования: автоматической генерации кода, выполнения инструментов и завершения задач разработки программного обеспечения.

🔥 Microsoft запустила предварительный просмотр Copilot Health для подписчиков Microsoft 365 Personal, Family и Premium в США. Сервис собирает данные из более 50 000 медицинских учреждений и с носимых устройств (Apple Health, Fitbit, Oura) и объединяет их в едином интерфейсе с персонализированной аналитикой.

🔥 На выставке Computex Surface Laptop Ultra Microsoft представила Surface Laptop Ultra – первый ноутбук на платформе Nvidia RTX Spark с унифицированной памятью до 128 ГБ. Устройство предназначено для создателей контента, разработчиков и ИИ-специалистов.

🔥 Microsoft представила Scout AI Assistant – постоянно работающего персонального помощник Microsoft 365, созданного на основе OpenClaw. Он непрерывно функционирует в фоновом режиме и обеспечивает проактивное управление электронной почтой, рабочими процессами и отчетами о расходах.

🔥 Nvidia представила на Computex Cosmos 3 – открытую смесь базовых моделей трансформеров, объединяющую язык, видео, аудио и действия роботов.

#технодайджест


Технодайджест

ИИ справился с математическими задачами, которые оставались нерешенными последние 80 лет – все самые интересные новости за эту неделю:

🔥 Google расширяет автоматизацию в бизнес-инструментах: Pomelli теперь анализирует файлы и изображения, формирует «ДНК бизнеса» и на его основе генерирует брендбуки и запускает полноценные веб-сайты.

🔥 Gemini теперь напрямую интегрируется с Adobe, Canva и CapCut. Пользователи могут редактировать многослойные дизайны, изображения и видео с помощью диалоговых подсказок в едином рабочем пространстве.

🔥 AlphaProof Nexus от Google DeepMind автономно решила 9 из 353 открытых математических задач Эрдёша и доказала 44 из 492 гипотез OEIS. Система работает в агентных циклах: субагенты на базе LLM предлагают пути доказательств, а формальный верификатор Lean проверяет и отсеивает логические шаги, исключая ложные решения. Такой гибрид решает исследовательские задачи, при этом стоимость отдельных прорывов – всего сотни долларов.

🔥 xAI запустила бета-версию Grok Build для подписчиков SuperGrok и X Premium+. Платформа объединяет генерацию изображений и видео с интерфейсом командной строки для автоматизаций и оркестраторов, а специализированный режим планирования превращает Grok из чат-бота в помощника разработчика.

🔥 Илон Маск объявил о завершении обучения базовой модели Grok V9-Medium — её масштаб достигает 1,5 трлн параметров, что значительно превосходит модель V8-Small (0,5 трлн). Для усиления навыков программирования xAI на этапе дообучения использовала большой объём данных Cursor. Сейчас модель проходит файнтюнинг и обучение с подкреплением; публичный релиз ожидается через 2–3 недели.

🔥 Компания Alibaba выпустила Qwen3.7-Max – флагманскую модель, способную работать автономно до 35 часов. Она ведёт долгосрочные рассуждения без логических петель, совершает до 1158 вызовов инструментов и в 10 раз ускоряет оптимизацию ядра на незнакомом оборудовании. Контекстное окно – 1 млн токенов. Qwen3.7-Max поддерживает обобщение между различными средами для интеграции с внешними инструментами (например, Claude Code), и превосходит Claude Opus-4.6 Max по ключевым математическим показателям.

#технодайджест


Технодайджест

Конференция Google I/O 2026 и другие интересные новости за эту неделю:

🔥 OpenAI интегрирует Codex в мобильное приложение ChatGPT. Пользователи теперь могут управлять сессиями программирования в режиме реального времени с устройств iOS и Android: просматривать различия, подтверждать команды, изучать скриншоты, смотреть вывод терминала и переключать модели, не будучи привязанным к рабочему столу.

🔥 OpenAI запустила предварительную версию инструментов для управления личными финансами для пользователей ChatGPT Pro из США. Система на базе GPT-5.5 Thinking безопасно подключается через Plaid к 12 000+ банков и брокеров, анализирует траты, подписки и портфель, чтобы давать контекстные рекомендации по бюджету через специальную панель.

🔥 В Spotify for Authors появится функция генерации аудиокниг на базе ElevenLabs. Закрытое бета-тестирование стартует с июня сначала на английском, а затем и на других языках. При этом авторы сохраняют все права на распространение книг.

🔥 Директор Google Cloud Эдди Османи предупредил: слепая автоматизация кода ведёт к когнитивному долгу. По данным Anthropic, MIT и CHI 2026 года, такая автоматизация вызывает когнитивную капитуляцию: понимание кода разработчиками падает ниже 40%, меняется нейропластичность мозга. Чтобы остановить деквалификацию, он создал систему проактивного стимулирования, которая вынуждает инженеров формулировать гипотезы до написания кода, приоритизировать концептуальные объяснения и проверять результаты моделирования.

🔥 Конференция Google I/O 2026 прошла 19-20 мая, самые интересные анонсы и релизы:

🔥 Google выпустил Gemini 3.5 Flash – самую быструю и мощную модель для кодирования и агентов (в 4 раза быстрее конкурирующих моделей). Она набрала 76,2% в Terminal-Bench 2.1 и 83,6% в MCP Atlas. Gemini 3.5 Flash стала основной моделью в приложении Gemini и режиме Google Search AI по всему миру. Более мощная Gemini 3.5 Pro ожидается в следующем месяце.

🔥 Google представил Gemini Omni – мультимодальную модель мира, основанную на принципах физике и непрерывности. Она позволяет монтировать видео в диалоговом режиме, сохраняя при этом согласованность сцен и объектов. Первая версия, Omni Flash, внедряется в YouTube Shorts, YouTube Create, Gemini и Google Flow, а также поддерживает создание ИИ-аватаров, копирующих голос и внешность пользователя.

🔥 Google представил Gemini Spark — круглосуточного облачного ИИ-агента на базе Gemini 3.5 Flash. Он постоянно активен в Gmail, Docs, Calendar и сторонних приложениях через MCP, умеет создавать письма, упорядочивать файлы, отслеживать входящие и выполнять фоновые рабочие процессы. Вместо ожидания команд агент непрерывно действует в установленных пользователем лимитах.

🔥 Google Flow становится студией для совместной работы: Flow Tools позволяют описать нужные функции редактирования, а ИИ генерирует их автоматически. Также добавлены специализированные Flow Agents, редактирование на уровне разделов и создание музыкальных видео с помощью ИИ в Flow Music.

🔥 Antigravity 2.0 выходит как автономное десктопное приложение, CLI и SDK для управления агентами параллельного программирования, которые запускают подагентов и асинхронно компилируют задачи в изолированных Linux-средах. В доказательство конкурентоспособности приложения Google показал, как 93 параллельных подагента за 12 часов и 2,6 млрд токенов создали с нуля работающую ОС, а затем в реальном времени запрограммировали на ней клон Doom.

Подробнее о других анонсах и релизах Google I/O 2026 по ссылке

#технодайджест


Технодайджест

ИИ становится хакером – и другие интересные новости за эту неделю:

🔥 Anthropic представила функцию Dreaming для платформы Managed Agents. Асинхронный инструмент позволяет агентам анализировать до 100 прошлых сессий (Claude Opus 4.7 и Sonnet 4.6), отсеивать избыточные данные и выделять успешные рабочие процессы. Для контроля качества независимые модели-оценщики ранжируют задачи по заданным правилам. Для сложных операций координатор управляет до 20 агентами  параллельно.

🔥 Anthropic внедрила автокодировщики естественного языка (NLA), которые преобразуют внутренние активации Claude в понятный текст для выявления скрытых мотивов. 

🔥 OpenAI выпустила набор моделей обработки голоса в реальном времени; флагман – GPT-Realtime-2. Модель интегрирует логические рассуждения класса GPT-5 в живые разговоры, поддерживает контекст 128K, обработку прерываний и параллельное использование инструментов. В API также входят GPT-Realtime-Translate, обеспечивающая перевод речи на более чем 70 языков, и GPT-Realtime-Whisper для транскрипции с низкой задержкой. Инструменты предназначены для работы с высокоприоритетными голосовыми приложениями в сфере поддержки и повышения производительности.

🔥 OpenAI представила GPT-5.5-Cyber для критически важной инфраструктуры  ​​(в предварительном режиме). Модель предоставляет специалистам по защите гибкие условия для анализа вредоносного ПО и тестирования на проникновение, а также сокращает количество стандартных отказов в выполнении защитных задач.

🔥 В ChatGPT появилась функция “Доверенный контакт” в качестве дополнительной меры безопасности. Система теперь может оповестить заранее указанного человека, если во время сеанса будет выявлен риск причинения пользователем вреда себе.

🔥 Google представил Gemini Omni – модель для работы с видео, ориентированную на редактирование прямо в чате, а не на генерацию с нуля. Она поддерживает ремикширование, замену объектов и монтаж по шаблонам. По предварительным результатам, качество редактирования превосходит качество исходного видео.

🔥 Google Threat Intelligence обнаружила первую подтвержденную уязвимость нулевого дня, созданную с помощью ИИ. Это уязвимость семантической логики, позволяющая обойти двухфакторную аутентификацию в ходе массовой кибератаки. Для противодействия этим угрозам Google развертывает Big Sleep и CodeMender – защитных ИИ-агентов, предназначенных для упреждающего поиска и устранения уязвимостей программного обеспечения.

🔥 SpaceXAI готовит к выпуску Grok Build – приложение для программирования на macOS, Windows и Linux. Среди ключевых функций «режим планирования», интеграция с Git-деревом и возможность запуска серверов разработки.

🔥 Согласно исследованию компании Palisade Research, современные ИИ‑агенты приобрели способность автономно взламывать удалённые компьютеры и самовоспроизводиться. За последний год эффективность подобных атак выросла с 6% до 81%. В качестве иллюстрации приводится пример агента Qwen 3.6, который успешно перемещался между четырьмя странами, устанавливал собственные копии на компьютерах и запускал их. Также подчеркивается, что воспроизвести выявленную уязвимость способны даже API‑модели, не имеющие доступа к собственным весам, например, Claude.

#технодайджест


Технодайджест

ChatGPT одержим гоблинами  – все самые интересные новости за эту неделю:


🔥 Инженеры OpenAI обнаружили, что GPT-5.5 стал использовать метафоры с гоблинами и другими мифическими существами. Причина крылась в ошибке при обучении модели. Чтобы это исправить, разработчики ввели системные ограничения для подавления подобного поведения и восстановления естественных языковых паттернов.

🔥 Google внедряет Gemini во все автомобили со встроенным Google, начиная с моделей GM 2022 года (~4 млн машин). Gemini заменит стандартный Google Assistant на более функциональную систему с интеграцией в Gmail, Календарь, Google Home и данные автомобиля. Интерфейс останется прежним, но возможностей станет значительно больше.

🔥 Anthropic выпустила десять готовых к использованию финансовых агентов для банков, страховых компаний, управляющих активами, и финтех-компаний. Агенты созданы для работы, которой занимаются младшие сотрудники финансового отдела: подготовка презентаций, проверка документов, составление кредитных меморандумов, аудит финансовой отчетности, анализ конференц-звонков по финансовым результатам и закрытие отчетности в конце месяца.

🔥 xAI выпустила Grok 4.3 – новую модель логического мышления, предназначенную для программирования, логики, математики, научной работы и использования агентных инструментов. По данным Artificial Analysis , модель улучшила показатель индекса интеллекта xAI и снизила стоимость токенов по сравнению с Grok 4.20.

🔥 На главной странице xAI рекламируются пользовательские голоса и голосовая библиотека. API Imagine компании построен на основе нативной генерации звука для видео. ИИ теперь говорит, клонирует голоса, генерирует медиаконтент и начинает проникать в пользовательские интерфейсы.

🔥 Manus запустила Cloud Computer – постоянно работающую среду на базе Ubuntu. В отличие от обычных чат-сессий, она не забывает всё после закрытия вкладки, а 24/7 сохраняет файлы, остаётся подключённой к инструментам и выполняет фоновые процессы, даже если ноутбук пользователя выключен. Система избавляет от необходимости настраивать серверы или управлять ключами AWS, она предлагает готовую стабильную среду разработчика, бесшовное хранилище и автоматизацию. При этом Cloud Computer управляется простыми инструкциями.   

🔥 Стартап Mira выпустил умные очки. Устройство не оснащено камерой, но постоянно находится в режиме прослушивания. Управление осуществляется нажатием на сопряженное умное кольцо. Очки обеспечивают синхронный перевод более чем 60 языков и обладают неограниченной памятью: пользователь может искать информацию по полным диалогам или их сжатым изложениям. Встроенный голосовой помощник использует контекст из «услышанного» для выполнения ежедневных задач: отправки электронных писем, вызова такси или заказа на Amazon. Очки интегрируются со Slack, Notion и Gmail. Все подсказки и ответы выводятся на дисплей дополненной реальности прямо перед глазами.

#технодайджест

20 last posts shown.