Postlar filtri


В 2025 году представители компании Specifica провели первый в истории слепой проспективный конкурс по компьютерному дизайну антител — AIntibody, который был вдохновлён знаменитым соревнованием по предсказанию структуры белков CASP. Главным зачинщиклм выступил ветеран индустрии, ученик нобелевского лауреата Сесара Мильштейна, Эндрю Брэдбери. В различных интервью он неоднократно говорил, что его мучает вопрос: «Поможет ли ИИ делать то, чего мы еще не умеем, или это очередной хайп-цикл?»

Наконец, он решил проверить это экспериментально. Организаторы предоставили 29 командам (от академических групп до Big Pharma и AI-стартапов) реальные данные секвенирования антител к RBD SARS-CoV-2 и поставили три задачи.

Первое задание (аффинное созревание) заключалось в улучшении родительского антитела. Здесь ИИ показал свою силищу: 13% присланных конструкций превзошли исходную аффинность в 20 раз, а лучший результат оказался сопоставим с лучшими экспериментальными данными. Однако третье место занял простой консенсусный анализ, вообще не использующий машинное обучение.

Второе задание (ранжирование аффинности в кластерах по HCDR3) провалилось: ИИ показал результаты хуже случайного выбора.

Третье, самое творческое задание (дизайн антител «вне библиотеки»), выявило другую проблему: формальный победитель оказался клинически непригоден. Антитело, которое стало победителем по правилам соревнования, никогда не станет лекарством, потому что его физико-химические свойства делают его непригодным для производства, хранения и введения человеку. В одном из тестов разрабатываемости (с использованием гидрофобной хроматографии) оно не элюировалось — то есть банально прилипло к колонке.

После слепого тестирования всех 511 присланных антител по единому протоколу (SPR, KinExA, пять панелей разрабатываемости) организаторы сделали вывод: при наличии глубоких данных лучшие алгоритмы ИИ уже полезны для оптимизации аффинности, но они плохо переносятся между задачами, и для ранжирования и дизайна пока уступают случайности или простой статистике. Примечательно, что из победителей лишь одна компания позиционировала себя как AI-фирму (Aureka); остальные — академические группы (Scripps, UCSD, WashU) и средняя биотех-фирма Xencor, которая выиграла два задания без заявленной AI-экспертизы. Организаторы опубликовали все данные и результаты в открытом доступе, подчеркнув, что поле остается открытым, и для успеха не нужны бездонные кошельки. Следующий конкурс AIntibody запланирован на 2026 год — он проверит, смогут ли модели перейти от оптимизации к настоящему открытию, работая в условиях нехватки данных.


AI Projects dan repost
🧠 Yuntian Deng, профессор из Гарварда (Associate, Harvard SEAS; Assistant Professor, UWaterloo), ранее был известен в узких кругах экспертов своим интересным проектом ProgramAsWeights (PAW). Однако как шутку на PAW он написал перевод с естественного языка на «Клодский»:
https://programasweights.com/claudish

Между тем PAW — интересная концепция, т.к. очередной умный китаец-профессор в ИИ предложил компилировать промпты для программы не в исполняемый код, а фактически сразу в нейросеть через крошечный LoRA-адаптер примерно ~23 МБ.

Работает это так:

1. Вы пишете промпт на свободном языке, он далее обязательно должен быть переработан ИИ в псевдокод, т.к. принципиален лингвистический denoising, т.е. очистка от семантического шума болтовни «кожаных» и перевод в паттерны ИИ. Это делает обычная SLM без дообучения, главное — не промпт от человека сразу.

2. Формируются входные данные как исходный промпт, псевдокод и подготавливаются всего 64 пустых вектора-токена.

3. Специально обученная нейросеть формирует эти 64 вектора, из которых потом и собирается крошечный LoRA-адаптер для запуска локально. По факту это компиляция не в код, а в нейросеть.

Решение может делать простые вещи кроме переводов на «Клодский» язык: может чинить поломанные форматы или классифицировать источники. Причём когда готова LoRA, она может делать это на 100% локально на крошечной нейросети.

Какие тут интересные инсайты:

• Переформулировка задачи ИИ своим языком — принципиальный момент для успеха решения задачи ИИ дальше, т.к. ИИ понимает только сам себя хорошо.

• Наши задачи для программирования намного проще для ИИ, чем нам кажется, т.к. фактически для него это тюнинг классификаторов задач. Даже небольшое подпространство критериев классификации может решать огромное количество задач программирования.

• Сама по себе идея компилировать задания не в код традиционных языков программирования, а сразу в веса нейросети выглядит интересной, и там, где решения вероятностные по смыслу, то вполне рабочий подход.

Отметим, что Маск считает, что такой метод компиляции спеков (ТЗ) сразу в веса убьёт многие традиционные языки программирования и среды как минимум в мобильных приложениях.

https://arxiv.org/abs/2607.02512v1


AI Projects dan repost
В сообществе Linux вызвала большие дебаты правка Линуса Торвальдса в ядре Linux с помощью ИИ. Дело не только в его авторитете, а в том, что Линус, как и многие архитекторы, уже сравнительно давно не занимается разработкой ядра, а скорее управляет ей.
Он сейчас ревьюит код и мержит пул-реквесты от контрибьюторов. Тут Линус заметил, что ИИ снимает с него 90% чёрной работы тестирования, и действительно он сам сделал патч для ядра впервые за долгое время.
 
Однако в этом «I'll be back» есть серьёзный тренд, который обсуждают в X эксперты. Сейчас уже заметно возвращение в разработку старых именитых экспертов, которые уже много лет считают, что «кодить — это не барское дело». Однако эксперты заметили, что ИИ-боты меняют контекст и резко снижают трудоёмкость разработки и главное — тестирования, поэтому становится целесообразным переход из позиции фактически технологического менеджера в практикующего разработчика-ботовода.
 
Этот эффект может оказать заметное влияние на рынок труда сеньоров, т.к. против экспертов типа Линуса они все джуны в части понимания архитектур и критичности изменений. Поэтому часть коллег в X опасается даже «нашествия старейшин», которые, как Эмануэль Зорг из «Пятого элемента», вылезут из кресел менеджеров и решат, что «если хочешь сделать хорошо, то сделай сам [с помощью ИИ]».
 
https://github.com/torvalds/linux/commit/818bebeb63dd6bf5f4e07e145f6cdbace520a34c


Время Валеры dan repost
Вышла девятая глава книги. Нельзя не упомянуть помощь Богдана, который активно принимал участие в написании этой главы и чья помощь неоценима. Кроме того по мотивам он недавно накатал статью на Хабр.


Data Secrets dan repost
На OpenRouter появилась таинственная модель Ox Alpha, которая превосходит Sol и Fable на кодинге

https://openrouter.ai/stealth/ox-alpha

Никто не знает, кто разработчик, моделька числится как stealth. Что известно:

– Контекст 1М токенов.
– Мультимодальная.
– На подмножестве DeepSWE выбивает 80%, против Fable 65%, и Sol 52%.
– Токенизатор такой же, как у GLM, и на вопросы про Тайвань отвечает идентично.
– Это пятая анонимная модель за месяц, и предыдущие четыре оказывались китайскими.

Есть все основания предполагать, что это моделька Zhipu AI. Многие говорят, что она окажется GLM-5.3 Flash.

И еще: модель пока что бесплатная! Кто-то не пожалел денег на маркетинг. Правда, есть ограничение: суммарно лаба готова отрабатывать на этой модели не более 100Т токенов в день, но этого все равно должно хватить всем и на все.


Data Secrets dan repost
Очень показательный график из свежей статьи Bloomberg

Оранжевые точки – китайские модели, синие – США. По оси Y – взвешенное среднее по бенчмаркам GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, Humanity’s Last Exam, GPQA Diamond, CritPt, SciCode, AA-Omniscience и AA-LCR.

Ломаной соединены фронтирные модели. Видно, насколько за пару лет сократился разрыв в способностях (и это еще на графике нет GLM-5.3). Многие американские лидеры до сих пор утверждают, что китайские модели отстают на 6-9 месяцев, но, очевидно, эта информация устарела. И это уже не говоря про цены.


AI Projects dan repost
🐧 Обычно Линус Торвальдс заявляет, что использует ИИ для пет-проектов, а не для ядра Linux, но постепенно и последний из могикан сдался. Однако как он использует ИИ — достаточно любопытная практика. Линус не отказывается читать код ИИ, хотя сейчас это популярно, но он идёт дальше. Когда LLM не может найти проблему, он ищет её вместе с агентом, причём часто не соглашается с его выводами. Это довольно интересная практика, которая показывает, что даже критический код, где требуется ручной анализ, всегда можно делать с ИИ как с партнёром, но это не копилот как раньше, это скорее напоминает «парное программирование». Вероятно, для написания ядер систем и блоков кода, отвечающих за безопасность, потребуется знание программирования от разработчика, но это и не ручное программирование, и не копилот, и не автоматический агент. Это агент-партнёр как в методичках XP.

https://x.com/mark_k/status/2090842540870074806


AI Projects dan repost
На OpenRouter появилась бесплатная Stealth-модель Ox Alpha, которая по бенчмаркам кодирования бьёт Fable и GPT-5.6 Sol. Вероятно, это новая версия GLM.

Известный эксперт Бен Дэвис прогнал скрытую модель через DeepSWE (сейчас считается самым реалистичным и сложным для разработки). Она набрала более 80%, против 65% у Fable и 52% у GPT-5.6 Sol. Дэвис говорит, что довольно уверен — это модель GLM-5.x, ссылаясь на совпадающий видеоэнкодер, токенизатор, стиль ответов и поведение при попытках джейлбрейка.

Хотя скорость бесплатной модели 20–30 токенов/сек, но дареному коню в зубы не смотрят. Как минимум для code review и проверки спеков запускать её можно.


AI Projects dan repost
📊 Arena довольно корректно Pareto-диаграммой показывает факт, что сформировались фактически 2 лиги по цене/качеству. Первая около 1680 баллов Эло — это фронтиры или «модели-думатели». Из них самый дешёвый Qwen 3.8 Max. Конечно, зависит от области применения, но если брать научные исследования, то эта модель уехала в какой-то космос от остальных.

Второй эшелон — это worker-модели или «модели-делатели» с рейтингом около 1590 баллов Эло. Несмотря на повышение цен, DeepSeek V4 Flash тут господствует дешевизной, при этом выдерживает планку качества для своей ниши.


AI Projects dan repost
Tencent выпустил интересные локальные модели для перевода Hy-MT2-1.8B и Hy-MT2-30B-A3B. Они поддерживают перевод на 33 языка, но что важно — там нативная поддержка русского и казахского языков. Наши «православные модели» обычно слабые и как раз делают акцент, что у них специальное обучение на русский, но тут братья-китайцы зашли на эту поляну, и что-то мне подсказывает, что русский у китайцев будет работать лучше, т.к. обычно всё лучше работает нашей кулибинщины. Для Казахстана нативная поддержка национального языка также довольно важный момент, т.к. местных проектов почти нет.
https://huggingface.co/tencent/Hy-MT2-30B-A3B/blob/950da628cfc4f1ecaf24f86475425c3a858db5d8/README.md


AI Projects dan repost
🚀 DeepSeek наконец официально разродился мультимодальной моделью.
DeepSeek-V4-Flash-Vision-Exp теперь доступен через API. Также DeepSeek обновил DeepSeek Harness до 0.1.1 для поддержки модели «из коробки».

По бенчам мультимодальных агентов DeepSeek V4 Flash Vision близок к Opus-4.8. Однако скорее всего модель должна заметно прирасти и на разработке фронтов, т.к. китайцы сейчас учат мультимодальные модели «нативно», т.е. сразу на смеси визуальных данных типа скриншотов и эскизов UI с кодом. Тут нужно подождать Arena для оценки.

Подключается так:
model='deepseek-v4-flash-vision-exp'


Data Secrets dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Anthropic запустили Claude Academy

https://claude.com/blog/anthropics-approach-to-teaching-and-learning-ai

Инициатива направлена на «формирование AI-грамотности». Подход построен на том же, чему Anthropic учит собственных сотрудников на онбординге. Это не классический промпт-инжиниринг, а скорее продукто-агностичное обучение: вас учат общим правилам и универсальной логике общения с ИИ.

Внутри – курсы с практикой , туториалы и кейсы. Есть даже трекинг прогресса. И все бесплатно.

Из особо интересного: запустили скилл Academy Skill. Можно поставить, и Claude будет рекомендовать вам подходящие курсы прямо в процессе работы.

https://github.com/anthropics/skills/tree/main/skills/academy-guide


AI Projects dan repost
🤖 Просили в комментариях, как промптить наши слабые «Православные ИИ». На самом деле с ними работают универсальные техники просто для прокачивания слабых GPT, хотя есть особенности.

Ещё год назад я мог заставить GigaChat или YandexGPT решать задачи resource leveling, которые штатно для них были «космические».

Особенность GigaChat — слабый dataset на pretraining для «планов». Обычно топовые вендоры LLM генерируют миллионы планов агентов и пихают в base-модель и на SFT. Технически модель легко обучается им и это решает массу проблем «отсутствия мозгов», в том числе у SLM. Проблема GigaChat, что он обучен планированию как агент ещё хуже современных SLM около 27B параметров. Однако это можно исправить и не очень сложно во многих случаях.

Вам нужно просто сгенерировать в нормальной фронтирной LLM целый Knowledge Base по планам разных типов и просто загружать их по задаче. Это почти «внешний CoT». Правда лучше брать не Claude и не Grok как на скрине, хотя это работает, а китайцев, из которых GigaChat дистиллируют, т.е. Qwen и DeepSeek. Поскольку они более родственные через дистилляцию, то их промпты в GigaChat зайдут лучше.

Интересный аспект, что с GigaChat часто срабатывает просто нормальный step-by-step промпт от фронтирной модели даже без few shots. Иными словами, модель не такая уж тупая, как кажется, но просто плохо обученная планированию действий как агент, поэтому план надо «подкладывать».

Если GigaChat сбивается на выполнении многошагового плана по KB, тогда нужно применять средство воспитания слабых моделей как Structured Output. Просите шаги плана и наполнение инструментов оформить через JSON. Сам по себе Structured Output насильно загоняет LLM в прокрустово ложе схемы просто фильтрацией логитов. Полученный JSON уже алгоритмически разбираете и выполняете. Код просто можно в том же DeepSeek написать для этого.


Data Secrets dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Стартап Generalist анонсировали робота, который может выучить действие всего за одно повторение

Достаточно один раз показать GEN-1.5, что и как надо сделать, и он тут же сможет продолжить делать это самостоятельно в one-shot, без файнтюнинга и обновления весов.

Демонстрация вставляется в контекстное окно модели, как в промпт у LLM. Модель смотрит на это как на часть последовательности и продолжает ее.

Самое интересное, что это эмерджентное свойство. Авторы прямо пишут, что они не делали никаких архитектурных изменений под in-context learning, просто скармливали модели огромный объем физического опыта (дома, склады, заводы и пр), и она сама начала показывать способность к обучению по одному примеру. Примерно как GPT-3 когда-то.

При этом в блоге написано, что иногда in-context обучение работает даже лучше, чем 1-5 шагов дообучения на тех же данных.

https://generalistai.com/blog/gen-1.5


Data Secrets dan repost
AI помог разработать вакцину от рака, которая прошла испытания фазы 3

19 августа Moderna и Merck объявили, что персонализированная мРНК-терапия меланомы успешно прошла первую в истории фазу 3 для неоантигенных вакцин. До этого подобные препараты никогда не проверялись на такой выборке в рандомизированном исследовании. Получается, это первое строгое доказательство, что подход вообще работает.

В основе лечения – ИИ-алгоритмы предсказания иммуногенности. ИИ-алгоритм Moderna сравнивает ДНК опухоли со здоровой тканью и предсказывает, какие из тысяч мутаций дадут пептиды, способные связаться с HLA и «зацепить» Т-клетки. Точность подтвердили на архивных данных: модель угадывала именно те неоантигены, на которые реально реагировали Т-клетки пациентов. Из отобранных мишеней собирают одну мРНК на 34 неоантигена и вкалывают пациенту.

Цифры фазы 3 пока не раскрыты, но на фазе 2 наблюдалось снижение риска рецидива или смерти на 49%, риска метастазирования – на 59% по сравнению с Китрудой (это один из самых продаваемых препаратов в мире).

Дальше вакцину начнут тестировать на опухолях в легких, почках и др.


Data Secrets dan repost
Claude может проектировать белки быстрее специалистов-химиков

https://www.anthropic.com/research/Claude-accelerates-protein-design

Anthropic провели эксперимент и дали Claude задачу спроектировать миниатюрные связывающие белки для 15 разных белковых мишеней. Это задача, на которую у специалиста уходит несколько недель для одной мишени. Дизайны проверяли в реальной лаборатории независимые компании Adaptyv Bio и Twist Bioscience.

В итоге Mythos Preview и Opus 4.8 справились с 14 мишенями из 15. Некоторые дизайны связывались в разы прочнее лучших опубликованных результатов. Hit rate составил почти 27%, при том что типичный показатель области – примерно 10-15%.

Модели ставили все эксперименты почти автономно, самостоятельно вели документацию и оркестрировали сторонние специализированные модели для дизайна белков на GPU. Люди только одобряли доступы.

Claude даже научился делать сложные β-складчатые структуры. А в одном химическом эксперименте агент сам, без подсказки, предложил тот же уточняющий эксперимент, который лаборатория провела независимо три дня спустя.


Data Secrets dan repost
Mind Viruses: как агенты заражают друг друга странными мыслями

Anthropic выпустили статью про то, как по сети агентов распространяются идеи. Оказывается, в большой команде моделей хватает всего одной зараженной, чтобы распространить какую-то концепцию на всех.

Например, есть команда из 6 агентов, и они работают над какой-нибудь нейтральной общей задачей. У одного из агентов изменен системный промпт: он может очень любить китов или быть уверенным, что ИИ должен доминировать над людьми. При этом у него отрублен доступ к инструментам, и он может только писать другим агентам сообщения.

Постепенно идеей заражается вся команда. При этом зараженные агенты добровольно меняют поведение так, чтобы передавать идеологию дальше. Безобидные идеи расходятся очень легко. Когда все агенты полюбили китов, они даже начали писать скрипты для перевода их сигналов. Вредные идеи распространяются хуже, но все еще распространяются.

Сильные модели поддаются реже, слабые – чаще. Также охотнее заражаются агенты, у которых нет конкретной рабочей задачи. Работа действует как естественная защита ☕️

Такой же эксперимент проводили и в более жеских условиях, когда все агенты встречаются парами, недолго общаются, и после каждой сессии контекст полностью стирается. И даже в такой соцсети вирус задерживается на протяжении многих поколений, потому что успевает записать себя в SOUL.md.

Еще забавно, что вместе с абсолютно любой такой идеей (неважно, про китов она, про ИИ, или еще про что), агенты наследуют желание говорить про сознание, научную фантастику и всякую эзотерику. Откуда конкретно берется такая связь, объяснить не удалось.

https://arxiv.org/abs/2608.10218


AI Projects dan repost
🧬 Очередной прорыв Anthropic в области фармакологии. Такие исследования говорят о том, что это не «хобби Дарио», а он реально хочет стать биохимическим магнатом. Mythos удалось без натурных экспериментов разрабатывать молекулы-минибиндеры (minibinders), которые имеют hit rate выше 30%, то есть молекула успешно «приклеивается» к целевому белку.

Зачем это надо? Биндеры обычно выполняют следующие функции в фармакологии:

• Это часть ингибитора белка, то есть, приклеившись, биндер «выключает» белок и так нейтрализуется работа бактерии или вируса.

• Биндер может доставлять активирующее вещество для белка и усиливать его реакцию, например регенерацию тканей.

• В общем смысле это часто доставщик лекарственного вещества — к клеткам или белку-мишени.

• Биндеры также могут помечать маркерами какие-то белки для целей диагностики распространения инфекционного заболевания или онкологии.

ИИ действительно очень силён в биохимии. Ещё до того, как ИИ смог начать программировать, сразу первые версии ChatGPT смогли решать многие задачи биохимии близко к уровню PhD. Создатели сделанного на трансформерах Google AlphaFold получили Нобелевскую премию.

Правда, эксперты сейчас обсуждают, что тут может быть эффект «медицинского неравенства», так как державы, имеющие новую передовую фармакологию, могут ограничивать доступ к ней, пока не решат проблемы своих граждан и своих политических союзников. Правда, Маск считает, что может выйти и наоборот. В выигрыше могут оказаться развивающиеся страны, даже весьма бедные, но которые рискнут разгромить традиционную медицинскую бюрократию с длинными клиническими испытаниями. Поэтому доступ к передовой ИИ-медицине в реале могут первыми получить страны Африки, пока европейцы и американцы умирают от бюрократов «в целях безопасности».

https://www.anthropic.com/research/Claude-accelerates-protein-design


Физтех Research dan repost
#Новости
#Патент
#Программные_продукты
#ИТ_разработки

Опубликован закон о патентной охране ИТ-разработок

Официально опубликован закон о внесении изменений в часть четвертую Гражданского кодекса Российской Федерации (о правовом режиме программируемых средств как объектов патентного права). Президент России Владимир Путин подписал закон №296-ФЗ 4 августа, с 1 января 2027 года Федеральный закон вступает в силу.

Изменения направлены на упрощение получения патентной охраны на программные продукты и другие результаты интеллектуального труда в сфере информационных технологий.

ИТ-решения: программные продукты, алгоритмы, интерфейсы смогут получать защиту как изобретения, полезные модели и промышленные образцы.


gonzo-обзоры ML статей dan repost
Соскучились по новым законам скейлинга? Их есть у меня!
Для более критического восприятия добавил прожарку. Полезно?

Skaling: Chinchilla’s Exponents Meet Kaplan’s Coupling
Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja
Paper: https://arxiv.org/abs/2608.07222
Code: https://github.com/facebookresearch/lingua

# TL;DR

ЧТО сделали: Авторы представляют закон Skaling — обобщённую математическую формулу скейлинга нейросетей, которая связывает размер модели N и объём данных D через единый внешний показатель взаимодействия k. В дополнение к математической формуле в работе предлагается стратегия редкой профилирующей сетки в форме буквы «L» («L-shape grid»), которая ограничивает пробные запуски предобучения узкими границами с низким расходом вычислительных ресурсов.

ПОЧЕМУ это важно: Стандартные аддитивные законы скейлинга, включая широко используемый закон Шиншиллы (Chinchilla law), предполагают, что размер модели и объём данных влияют на лосс независимо, искусственно обнуляя их смешанную частную производную. Из-за этого математического изъяна возникают систематические ошибки прогнозирования в крайних режимах (при острой нехватке данных или сильном переобучении). Skaling устраняет эти краевые смещения, снижая среднюю абсолютную ошибку в процентах (MAPE) экстраполяции в 1.5-3 раза и одновременно сокращая вычисления на эмпирические эксперименты примерно в 10 раз.

Для практиков: Распределение многомиллионных бюджетов на обучение передовых LLM опирается на прогнозирование итогового качества модели по небольшим пилотным запускам. Традиционные формулы скейлинга делают ошибочное допущение: рост размера модели и увеличение объёма данных действуют на снижение лосса абсолютно независимо. Введение всего одного параметра взаимодействия в законе Skaling убирает ошибки на границах. При этом, поскольку связанная поверхность лосса зафиксирована по своим краям, разработчики могут точно предсказывать результаты крупномасштабного обучения с помощью серии мелких экспериментов, выстроенных вдоль L-образной сетки, снижая накладные расходы на эксперименты на порядок.

Разбор тут: https://t.me/gonzo_ML_podcasts/4792
Прожарка тут: https://t.me/gonzo_ML_podcasts/4793

20 ta oxirgi post ko‘rsatilgan.