Фильтр публикаций


Репост из: Kali Novskaya
🌸State of AI Report 2026🌸
#nlp #про_nlp

Вышел State of AI Report 2026, и там оказались сразу две наши работы в категории Research:

🌸AIRS-Bench, наш бенчмарк для агентов, которые делают ML-рисёрч (слайд 36, мой пост про бенчмарк):
🟣 https://arxiv.org/abs/2602.06855

🌸HyperAgents — Recursive Self-improvement агенты, которые переписывают не только то, как решают задачи, но и то, как они себя улучшают (слайд 14, мой пост):
🟣https://arxiv.org/abs/2603.19461

Отчёт с каждым годом все больше, 244 страницы покрывают исследования, индустрию и всеми любимые рубрики safety и politics.

🟣Сам отчёт: https://www.stateof.ai/State-of-AI-Report-2026.pdf


Репост из: Kali Novskaya
🌸Замедление и ускорение 🌸
#не_про_nlp

Поворчу, пока идут разговоры о том, что обучение моделей надо замедлить, а то и вовсе приостановить. Прошла незаметной новость о том, что Alibaba выложили в опен сорс модель, диагностирующую 150 заболеваний по КТ снимкам, в том числе несколько видов рака.
🟣HF Damo Radar https://huggingface.co/Alibaba-DAMO-Academy/RADAR
Модель уже протестировали на 400тыс клинических случаев и в разных больницах — модель оказалась в большинстве случаев точнее радиологов. Вышла публикация в Science

Нет сил, если честно, читать и комментировать все эти новости о том что там где замедлили (читай: где кончились деньги и кому надо нагнать страха перед IPO), но в конечном счёте, все сводится как обычно, к управленческой воле.

Можно использовать и применять ИИ для решения всех важнейших проблем человечества:
🟣 улучшение качества и доступности диагностики
🟣 улучшение стандартов и доступности образования
🟣 лучшее прогнозирование спроса и предложения, моделирование экономических процессов
🟣 ускорение научного прогресса во всех моделирующих науках.

А можно вместо этого стремиться все зарегулировать, убрать конкурентов, довести до аварии, чтобы подсесть на гос бюджет.

Увы, это не технологическая проблема.


Репост из: кипячёный 🥚
#рандом в воскресенье я с поговорила с тремя зведными профессорами из универа Цуриха, nvidia healthcare и универа Вандербилта. все три суперзвезды анализа медицинских снимков с отдельным профилем на кт-мрт мозга. я спросила у всех примерно одно и то же: как вы считаете, в какую сторону поворачивать свой ресеч в 2026 году, чтобы скорее дойти до потребителя и начать приносить деньги в медицинских снимках
.
.
.
и ответ меня поразил сначала, сейчас он меня злит. ответ был такой - просто делай то, что ты любишь в медицинских снимках и делай хорошую науку, а возможности для ресеча и денег найдутся. через пару уточняющих вопросов, оказывается, что они сами не уверены, о существовании тех, "кто за это будет платить?"
.
.
.
ещё через пару уточняющих вопросов, они начинали байку "я вообще не про деньги", включая "моя задача делать инфраструкутуру для таких исследователей, как ты", "с экзита моего open source стартапа я получил 250$", "главное работать так, чтобы радиологи и нейрохирурги хотели с тобой разговаривать. а что они хотят? ну я с ними на самом деле мало пересекаюсь...."
.
.
.
и они прямо были обижены моими шкурными вопросами. сейчас это меня злит, потому что светилы науки которые не отвечали мне в линкедине каждый год с 2020, по факту избалованнее дети. романтики великой теоретической науки в сферическом вакууме. которые будут держать свое место ещё столько десятилетий, сколько реальная настоящая медицина им позволит, даже на пенсии.
.
.
.
конференция которая идет в 20-какой то раз, привлекает 3700 человек, сотни сильных работ по анализу снимков мозга каждый год. конференция, ради которой я в больнице под капельницами делала правки в оверлифе, и нас все равно не взяли - это просто тусовка таких же богатых детей.
.
.
.
а где то в параллельной вселенной есть shadow miccai где собираются все, кому универ не оплачивает. кому не дали визу, у кого война сейчас. сильные группы из новосиба и новгорода, стартапы типо Цельса, Третьего Мнения, которые предсказывают кучу реальных кейсов каждый день и которым есть что сказать полезного. а это только россия, там ещё есть иран, и в казахстане, азия
.
.
и вот на этом shadow miccai они собираются, пьют крафтовое пиво, хлопают друг друга по плечам. и обсуждают, как сэкономить на серваках. как обрабатывать аномалии в пациентах, как разворачиваться быстрее в новых клиниках. кто кого побил на скрытом тесте по сегментации метастаз. обсуждают, как регуляторы посчитали, сколько новых кейсов прединфаркта нашли модельки на опортунистическом скрининге по базам данных. показывают друг другу своих цифровых двойников, и как, ухаживая за ними они сами стали себя лучше чувствовать. и какие успехи сделали их родители.


Репост из: Cultural fit && predict()


А чо по найму?

С лета активно ищу работу, and this is quite a ride!

Первая, самая неочевидная доселе для меня вещь: я честно задолбался адаптировать резюме, а так же каждый раз вспоминать что и где я делал, поэтому я сделал мастер-резюме, по которому генерю резюме под вакансию: тут можно посмотреть веб-версию.

В промпте генерации вакансии прошу выделять додуманное, а не выведенное из мастер резюме, в фигурные скобки. Если вакансия - хороший матч, там оказывается то что я забыл указать, если - плохой, то много нерелевантого мусора, что намекает что может и подаваться не особо надо.

Вторую половину лета был абсолютно мертвый сезон, я пособесился только в Computer Vision в стоматологию и на завод деревообрабатывающую промышленность.

Сейчас ищу в основном пересечение графов знаний и AI-инженерии, и вот в сентябре наконец пошли более релевантные собесы.

Pic related:


Репост из: Valuable AI / Валентин Малых
все давно привыкли к использованию ИИ в медицине, например, для помощи онкологу

но в Британии настоящие, а не мемные британские ученые провели первую операцию на головном мозге человека с помощью ИИ; ИИ подсказывал важные участки, как показано на картинке; для тех, кто переживает - с пациентом все хорошо

интересно, что ведущий хирург и по совместительству первый автор статьи является также Google PhD Fellow; это является подтверждение основного тезиса из вот этой публикации, что ИИ-компании вкладываются в медицину, чтобы показать свою пользу для людей

@valuableai




Репост из: Dmitry Kalupin
Тао в этом рассуждении рассматривает частный случай (чистую математику), но, скорее всего, генерализация возможна для всех областей :)


Репост из: Alexander Shmorgunov
ДВА ГОДА ПОЛЬЗУЕШЬСЯ ЧАТГПТ И КЛОДОМ ДЛЯ РЕШЕНИЯ НАВЬЕ СТОКСА
@
СОСТАВЛЯЕШЬ ЧАСТИЧНОЕ РЕШЕНИЕ
@
ОБ ЭТОМ УЗНАЁТ ЛЕВЫЙ ЧЕЛ И ПОСТИТ В ТВИТТЕР ЧТО АНТРОПИК РЕШИЛ НАВЬЕ СТОКСА
@
ОПЕНАИ РАСЧЕХЛЯЮТ МАШИНУ УБИЙЦУ И РЕШАЮТ НАВЬЕ СТОКСА
@
ТЫ БУГУРТИШЬ ЧТО ОПЕНАИ УКРАЛИ ТВОЁ РЕШЕНИЕ
@
ОПЕНАИ ПРЕДЛАГАЕТ ОПУБЛИКОВАТЬСЯ ПОСЛЕ ТЕБЯ И ОТДАТЬ ТЕБЕ $1 МИЛЛИОН
@
ТЫ ВСЁ ЕЩЁ БУГУРТИШЬ
@
...НАВУКА




Репост из: ...и больше никто его не видел
2024 — середина августа 2026:
Тристан Бактмастер (профессор NYU) и Левент Алпёге (исследователь из Anthropic) вдвоем, на свои личные деньги и без корпоративных контрактов, пилят пет-проджект. Их цель — добить метод Кордобы и Мартинеса-Зороа по взрыву гладкости в гидродинамике до гладкой внешней силы. Месяцами они прогоняют наработки через Claude, GPT-5.6 Sol, Codex и Astra, закидывая черновики прямо в интерфейсы OpenAI.

15 — 22 августа 2026:
Случается главный прорыв. Связка авторов с моделями берет гладкий блоуап для уравнений Буссинеска и 3D Эйлера. Алпёге присылает Бактмастеру кошмарный сгенерированный пруф, и 22 августа его начисто подтверждает верификатор Lean. Вместо хайпового дропа ученые берут паузу на несколько недель, чтобы переписать машинную кашу нормальным математическим языком.

Конец августа — 3 сентября 2026:
Инфа утекает в фонды Долины и Лондона. Из-за того что Алпёге работает в Anthropic, слух моментально мутирует в легенду: «Anthropic в соло закрыла проблему тысячелетия». 3 сентября Бактмастер пишет знакомому математику в OpenAI: объясняет, что это их личный проект с Левентом, просит не устраивать гонку и обещает скоро дропнуть препринт. В OpenAI понимают, по какой лазейке пошли ученые, и предлагают подогнать свои мощности.

3 сентября (вечер):
Теренс Тао, будучи в курсе происходящего и понимая, что OpenAI готовит набег на Навье-Стокса по чужим следам, выпускает тред в Mastodon. Это не абстрактная лекция, а превентивный артобстрел: Тао заранее объявляет гипотетический закрытый брутфорс Навье-Стокса токсичным мусором и загрязнением науки.

4 — 5 сентября 2026:
В сети взрывается вброс Каррана о том, что Claude якобы решил Навье-Стокса и лежит на рецензировании. Пока твиттер бурлит, OpenAI в закрытом контуре бросает команду на амбразуру, сжигает тонны компута и пытается повторить цепочку Бактмастера уже на самом Навье-Стоксе.

6 сентября 2026:
Кульминация триллера. Себастьен Бубек из OpenAI требует срочного созвона (Алпёге туда не зовут) и объявляет Бактмастеру, что их внутренняя модель за пару дней родила 100-страничный пруф на Навье-Стокса. Бубек выкатывает шантаж: выкинуть Алпёге из авторов (потому что Бубека бесит факт его работы в стане заклятого врага — Anthropic) и отдать авторство Тристану вместе с OpenAI, забрав премию Клэя. Когда Бактмастер отказывается и обещает пойти в паблик, Бубек переходит к угрозам сломать карьеру («Why would you ruin your career?») и фразочкам «не хочешь по-хорошему — я не обязан быть милым», после чего безуспешно пытается расколоть авторов через личку Левента.

7 — 8 сентября 2026:
Бактмастер и Алпёге понимают, что их работу прямо сейчас пытаются отжать, срывают график вычитки и жмут красную кнопку. Они экстренно заливают на сайт Куранта препринты по Буссинеску, IPM и сырой невычитанный 3D Эйлер с Lean-кодом, приложив открытый стейтмент с логами звонков и разгромом методов OpenAI. Следом выходит Теренс Тао, подтверждает телефонный разговор с Бактмастером, публично встает на сторону авторов и дает их математике мощную протекцию.


Я в эту вашу экономику не плакать пришёл


Репост из: запрети мне вайбкодить
Kaggriculture 2026 — Kaggle, где теперь выращивают гусей

Шёл 2026 год. На Kaggle люди уже не только обучают модели, но и всерьёз считают, когда выгоднее продать виртуальные яйца.

Суть Kaggriculture довольно простая: ты отправляешь бота, который управляет фермой, а дальше он играет 1 на 1 против ботов других участников.

Одна игра — 30 виртуальных дней, 720 ходов. Нужно выращивать растения, покупать животных, расширять землю, нанимать рабочих и в итоге заработать больше денег, чем соперник.

Самая интересная часть — рынок здесь живой. Цены на пшеницу, молоко, шерсть, яйца и остальные товары постоянно меняются. Если товара становится слишком много — цена падает. Если появляется дефицит — растёт.

Плюс по ходу игры открываются разные магазины, которые создают дополнительный спрос. Например, пиццерия начинает покупать молоко и томаты, а магазин пряжи — шерсть. Поэтому экономика может заметно поменяться прямо во время партии.

Ещё необычно работает сам leaderboard: бот после сабмита продолжает автоматически играть дуэли с другими участниками, и рейтинг меняется в зависимости от побед и поражений.

Призовой — $50k, топ-10 получают по $5k.

Мы сейчас топ 10–15.
Тиммейт - https://t.me/privetagi


Буквально за ночь у меня прогрузилось осозналось это лето, поэтому я таки радостно распишу, а чем же я занимался.

Я с весны проходил две программы параллельно: Nebius AI engineering course + Wikidata ontology course, в сумме которые довольно хорошо описывают мои чаяния и надежды о развитии индустрии. К июню к этому добавился проект на мероприятие по принципам бёрнинг мэна (да да, тоже про AI / LLMs и иже с ними), и жизнь моя превратилась в Джэнгу.

По итогам: сертификат Wikidata engineering course, сертификаты по самым большим курсам от Nebius AI engineering course + много опыта и проект, который не отпускает меня до сих пор.

AI engineering course: Яндекс Nebius как всегда хорош собой, собрал в сжатые сроки максимально ёмкую программу от основ нейросетей до построения AI-agent систем на очень важных и реальных задачах. Сверху — reinforcement learning (обучение через награду за удачные решения, а не через готовые правильные ответы) и деплой, то есть доведение всего этого до состояния работающего сервиса.

Задачи были максимально приближены к продуктовым. Например, мы строили агента-финансового аналитика: он отвечал на количественные и качественные вопросы строго по датасету с финансовыми данными — и отказывался отвечать на всё, что выходило за его пределы. Проходил с напарником ещё с программы 21ого года, полностью доволен, было тяжело, но 100% того стоило.

Wikidata ontology course: курс от волонтёров Wikidata по подготовке редакторов Wikidata, самой большой платформы фактов, к которой всё больше запросов от AI-агентных систем и всё меньше бесплатных человеческих редакторов. Не тексты, как в Википедии, а связи вида «объект — свойство — значение», которые машина читает напрямую. Ценю я её именно за это: за универсальный язык формальной логики, на котором можно описать весь мир.

На курсе разбирали примеры качественно построенных онтологий внутри Wikidata и давали практические навыки редактирования. Но главный урок был не технический. Wikidata никогда не была идеальным хранилищем данных — она всегда была сборищем противоречащих друг другу фактов. И именно поэтому любой мотивированный человек вроде меня может принести туда свою лепту.

На данный момент Wikidata - мой основной ориентир в этом бушующем меняющемся мире. Ещё бы они движок с PHP на Rust поменяли, был бы Рай!


Репост из: Valuable AI / Валентин Малых
Дима Колодезев периодически высказывает на мостиках мысль, что внедрение ИИ приведет к эффекту песочных часов

смысл эффекта в том, что супер-профессионалы получат усиление своих возможностей; неспециалисты получат суррогат способности что-то делать (например, писать статьи); а вот люди посередине не получат ничего, в том смысле, что их способности будут заменяться ИИ и потребность в их труде пропадет

два года назад было сделано исследование, которое показало, что для владельцев малого бизнеса это вполне работает; суть эксперимента, проведенного коллегами из Гарварда, в том, что владельцам бизнеса в Кении был предоставлен доступ к GPT-4 (то есть значительно более слабой модели, чем доступны сейчас), в результате лидеры смогли нарастить выручку на 15%, а отстающие - потеряли 10%

@valuableai


Репост из: Техножрица 👩‍💻👩‍🏫👩‍🔧
А серьезно, почему опус может делать жестб пафосные научные открытия или писать сверхоптимизированный олимпиадный код для решения алгоритмических задач, но не может догадаться использовать .venv окружение, лежащее прямо в папке с проектом и вместо этого засирает системный pip (ls -a в папке он точно делал и видел этот .venv)? Или в другие разы он не мог прикинуть, запустится ли на карте с известным количеством памяти модель с известным количеством параметров в fp32 и все ронял, не понимая в чем дело, пока я не посмотрела в исходники и не постучала ему по голове. А один раз так вообще по неведомой причине решил обрезать до 8000 символов (именно символов, а не токенов!) тексты, которые подавались для классификации другим моделям (хотя было легко увидеть, что они в десять раз длиннее и полезный сигнал по смыслу находился где-то посередине). При этом он никогда в своей писанине и отчетах явно не упоминал эту обрезку, пока я сама её не обнаружила, пытаясь понять, почему результаты такие странные.

И вот как тут заранее угадать, что для него очевидно, а во что надо пальцем тыкать как ребенка малого?


Репост из: Техножрица 👩‍💻👩‍🏫👩‍🔧
Подписчик в комментариях указал на важную проблему популярных алгоритмов оценки внутренней размерности облака точек, за что ему большое спасибо!
Выяснилось, что при большой истинной размерности облака они дают систематически заниженную оценку этой размерности. При чем чем больше настоящая размерность, тем сильнее занижается оценка.

Я решила проверить это и навайбкодила ноутбук, в котором генерируются облака точек, равномерно заполняющие n-мерные шары:

https://colab.research.google.com/drive/1kIRin8sBBNQDFvruXWITU3i5kL7x7Zww?usp=sharing

Краткие результаты:
- При размерности такого шара 10 и количестве точек 2000, три алгоритма оценки размерности (PHD, TwoNN и MLE) дают что-то между 8.5 и 9, то есть занижают незначительно. А вот при размерности 100, PHD уже даёт оценку в 64, а TwoNN и MLE и вовсе около 50, то есть оценка занижена в целых два раза (см. рис. 1).
- Увеличение количества точек в шаре может помочь подтянуть оценку к истинной, но, похоже, что для этого увеличивать их количество нужно экспоненциально с ростом размерности.

Интересные выводы, и вообще даже странно, что раньше я не знала о таком явлении. Или знала, но забыла? 😅 Честно говоря, мозг от вайбкодинга уже совсем потек, так что ничего не могу сказать с уверенностью 😅

В любом случае, надеюсь, что эта инфа будет полезна всем, кто интересуется внутренней размерностью и т.д.

P S В случае любых ошибок в ноутбуке - все претензии к Клоду 😍

#эксперимент #наука


Репост из: Robot Uprising


Репост из: Kali Novskaya
🌸Релизим Muse Glimmer 30B 🌸

Впервые за долгое время, наконец-то релизим большой командой новую открытую LLM от Meta Superintelligence Labs.
Веса под Apache 2.0!

🌸Что это за модель:
— 30B dense модель, дистиллированная версия Muse Spark для локального инференса на 1 GPU
— юз-кейсы: OpenClaw, MCP, и агентные тулзы
— общие способности (ризонинг, знания, кодинг) тоже на высоком уровне для модели такого размера.
— очень быстрый инференс: 233 токена/сек на 5090 благодаря DFlash spec decoding
— по ключевым способностям — агентные воркфлоу, swe bench, ризонинг — лучше Qwen 3.6 и Gemma 4 31B
— есть мультимодальный инпут (картинки и видео)
— больше 100 языков в претрейне
— контекст 131к токенов
— есть perception encoder (1.8B) в дополнение к модели

Пожалуйста, скачивайте, пользуйтесь, — и ждите тех репорт и доки!
На неделе постараемся выпустить инференс у партнёров и доки по деплою на llama.cpp, ExecuTorch, MLX.

🟣Блогпост https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
🟣 Веса https://huggingface.co/meta-models/Muse-Glimmer-30B
🟣Доки: (пока что такие же как у Muse Spark) https://dev.meta.ai/docs/cookbook


Репост из: partially unsupervised
Четыре недели плотно работал над нечетко поставленной задачей на грани агентов и information flow, причем это само это словосочетание для меня было в новинку. Артефакт покажу позже, когда ревьювер номер два напихает в панамку, а пока буду ныть.

Даже будучи адептом AI-assisted программирования со времен беты копайлота и пользователем клодкода с первого паблик релиза, я дошел до желания забиндить YOU FUCKING MORON на хоткей, потому что терпеть этот слоп никаких сил не осталось.

Казалось, что остался какое-то небольшое множество топиков, в которых мое человеческое мнение и профессиональная экспертиза еще чего-то стоят; и совершенно точно новая для меня тема не может в него входить. Ага, щас: все новейшие модели вовсю жонглируют умными словами про semilattice morphisms, но регулярно пропускают совершенно тупые противоречия, заметные и школьнику, если он не начал бухать в пятом классе.

И чтение этого слопа утомляет просто невероятно. В старом добром мире часто можно было читать сложную книгу или статью, страдать от собственной тупости на каждом абзаце, но неумолимо прогрессировать (помню, как использовал Multiple View Geometry in Computer Vision в качестве снотворного на долгих перелетах). Сейчас же каждое непонятное предложение оставляет вопрос "я чего-то не понимаю или агенты опять написали херни?".

Совершенно не понимаю, это моя проблема в моменте (плохо шарю домен => рвусь от слопа) или просто GPT 5.6 / Fable / Opus 5 оверфитнули на average TS enjoyer, выпихнув меня ближе к границе OOD. Решений, кроме симптоматического "почаще трогать траву", тоже пока не вижу.

Показано 20 последних публикаций.