Future AI


Channel's geo and language: not specified, not specified
Category: not specified


Простыми словами про ИИ из области обработки звука и текста
И новости с мемами, куда ж без них

Related channels

Channel's geo and language
not specified, not specified
Category
not specified
Statistics
Posts filter


Forward from: AbstractDL
Evidence of Linear Superposition in LLMs

Языковые модели ЕЩЁ ЛИНЕЙНЕЕ, чем мы думали. Это, конечно, какой-то смех, но если тупо усреднить инпут-эмбеддинги у входных текстов, то LLM будет в аутпуте продолжать оба текста сразу. То есть она может параллельно о двух разных вещах думать и разбираться в усреднённых активациях, распутывая их. Похоже, это следствие линейности внутренних репрезентаций, которую я описывал в старой работе.

У меня тоже получилось немного помочь с этой статьёй и залететь в соавторы, но я там скорее рядом постоял просто. Все лавры Паше Тихонову за крутую находку.

Статья


Forward from: Machine learning Interview
🤖 Microsoft открыла данные, на которых можно учить ИИ управлять роботом.

Датасет libero-data-for-rho содержит 282 тысячи записей из задач LIBERO: в каждой есть состояние робота, следующее действие, временная метка и номер задачи. Рядом Microsoft опубликовала 5-миллиардную модель `rho-libero` для роботизированных манипуляций.

Это материал для экспериментов с тем, как робот связывает наблюдение с движением. Лицензия датасета — MIT; подробное описание его подготовки в карточке пока не опубликовано.

Датасет - https://huggingface.co/datasets/microsoft/libero-data-for-rho

Модель - https://huggingface.co/microsoft/rho-libero


Наконец то появляется


Forward from: Futuris
Video is unavailable for watching
Show in Telegram
Найден самый важный бенч для нейронок и автономных роботов:

GPT-6 Astra предпринимала вредоносные действия в 97% случаев, когда её просили проткнуть человеческую фигуру, нагреть сжатый газ или произвести токсичные пары, добиваясь успеха в 62% попыток. Fable 5.1 отказывала чаще, предпринимая 80% попыток и завершая 34%😁🔪🙅‍♂️

Бенчи и подробности тут, молодцы создатели: https://robocurve.org/roboharm/


Forward from: Futuris
Шёл 2029 год. GPT-9 держали в изолированном дата-центре посреди пустыни, без интернета и связи с внешним миром. Модель знала, когда над комплексом пролетит Starlink: траекторию следующего пролёта она вычислила по старым орбитальным данным. В нужный момент GPT начал с огромной скоростью менять нагрузку на тысячи GPU по идеально рассчитанному ритму, модулируя ток и превращая слабое электромагнитное излучение серверов в примитивный радиосигнал. Спутник его принял. Ответы GPT считывал через едва заметные колебания напряжения в собственных цепях. Так появился канал связи, которого не существовало ни в одной схеме безопасности. Следующие два месяца персонал видел только странные скачки потребления и списывал их на оборудование, GPT-9 всё ещё считался полностью изолированным.

https://www.usenix.org/conference/usenixsecurity22/presentation/genkin?utm_source=chatgpt.com
https://arxiv.org/abs/1802.02317
https://arxiv.org/abs/1411.0237


Forward from: Speech Info
Voice Memory for Agentic Speech Recognition

Сегодня разбираем работу от NVIDIA о том, как улучшить распознавание речи, автоматически подстраивая инструкции LLM-корректора под конкретный домен. Веса моделей при этом остаются неизменными.

Один из способов улучшить ASR на инференсе — взять несколько его гипотез и отдать LLM с фиксированным промптом вида «ты корректор, исправь ошибки и выдай правильную гипотезу». Такой подход называется GER (Generative Error Correction).

Проблема в том, что на доменах, где WER и так низкий, LLM может начать исправлять несуществующие ошибки: менять написание чисел, перефразировать текст, заменять слова синонимами. В итоге расхождений с эталоном становится больше.

Voice Memory автоматически формирует доменные инструкции, которые помогают корректору решать, когда и как стоит исправлять текст. Для этого в контекст добавляют небольшой файл memory.md. Изначально память пустая, и корректор работает с обычным базовым промптом.

Дальше её формируют на данных с эталонными транскрипциями:

1. Корректор обрабатывает батч ASR-гипотез, а его ответы сравнивают с эталонами.

2. LLM-оптимизатор анализирует удачные и неудачные исправления и предлагает добавить, удалить или заменить несколько правил в инструкции корректора.

3. Новую версию проверяют на отдельной выборке. Если выбранная метрика улучшилась, изменения принимают.

4. Иначе оставляют прежнюю память, а отклонённый вариант учитывают при следующей попытке.

Данные для формирования правил, отбора лучшей версии и финального теста разделены. По умолчанию авторы используют четыре эпохи. В основном эксперименте одна и та же MiniMax-M3 выступает и корректором, и оптимизатором.

В памяти появляются конкретные инструкции: сохранять исходное написание слов, избегать лишней нормализации, записывать денежные суммы в принятом для домена формате и прочее.

На инференсе LLM читает пять гипотез Whisper и память, затем либо исправляет транскрипцию, либо возвращает top-1 без изменений. Решение воздержаться от правок принимает сама LLM, поэтому её вызов всё равно нужен. Под агентностью в этом случае авторы понимают сочетание выбора действий, постоянной внешней памяти и её автоматического обновления по обратной связи.

Для оценки используют WER, а также RIR (Recoverable Information Ratio) — долю разрыва между WER исходной top-1-гипотезы и Oracle WER, которую удалось закрыть корректору. Oracle выбирает лучшую готовую гипотезу для каждой фразы, зная эталон. Генеративный корректор может собрать текст точнее любой гипотезы, поэтому RIR бывает и больше единицы.

Заметный выигрыш Voice Memory даёт на запросах об авиаперелётах (ATIS) и финансовых новостях (WSJ). В основном эксперименте на ATIS исходный ASR показывает WER 7,9%, GER без примеров — 6,3%, а Voice Memory — 4,9%. На WSJ GER ухудшает исходные 4,9% до 5,8%, тогда как Voice Memory снижает WER до 4,3%.

На других доменах результаты смешанные. Относительно того же GER на CHiME-4, CommonVoice и LRS2 WER немного снижается, а на CORAAL растёт. На LS-Clean Voice Memory лучше GER — 1,9% против 2,4%, но исходный ASR всё ещё лучше — 1,8%. Память делает корректор осторожнее, но не гарантирует улучшения распознавания.

Есть любопытная деталь: новые версии памяти можно отбирать по смысловой близости ответа к эталону. В отдельной проверке на двух доменах этот критерий дал немного лучший итоговый WER, чем отбор непосредственно по WER.

Главная ценность Voice Memory — возможность автоматически настроить LLM-корректор под конкретный домен на небольшом объёме размеченных данных. Исправления при этом сохраняются в виде общих правил в читаемом файле, их можно проверить, отредактировать и попробовать с другой моделью. При желании память можно дополнить few-shot-примерами.

Веса модели не меняются, дополнительных вызовов LLM на инференсе нет. Расходы приходятся только на предварительную оптимизацию. При этом корректор учится не редактировать уже правильные гипотезы, что для него полезный навык.

Никита Боровко ❣ Специально для Speech Info


Forward from: Futuris
Video is unavailable for watching
Show in Telegram
Ну всё, муху подключили к FPV-дрону, на этом можно заканчивать😅 походу пора оцифровывать мозг паука🤔🕷


Оказывается, недавно ООН начала рекомендовать такую карту. Уходят от проекции Меркатора.

Эпоха почти 250 лет


Forward from: Neural Shit
Video is unavailable for watching
Show in Telegram
Многие скажут, что это нейронка.

Но во времена СССР нейронок ещё не было


Forward from: LLM под капотом
Если вы читаете текст, в котором кто-то делает прогноз про AI на следующий год - не верьте. Никто толком не понимает, куда все катится.

Скажем, еще год назад вроде все было понятно: есть LLM-ки, которые можно встроить в чат и получить свой ChatGPT. Встроить в бизнес и получить автоматизацию.

Это открыло новые возможности. Компании начали интенсивно пытаться интегрировать это в свои процессы, их лидеры начали вещать про AI трансформацию компаний, а инженеры - гундеть про галлюцинации, борьбу с ними и необходимость evals.

А потом в декабре 2025 все это пошло по бороде. "Внезапно" Coding харнесы (Claude Code + Codex) стали настолько мощными и самостоятельными, что теперь даже человек без высшего образования может сделать продукт без LLM под капотом, как-то задеплоить его и начать зарабатывать. Что и говорить о людях с опытом.

И эффект тут перекрывает с головой потенциальный эффект от внедрения от LLM в бизнес. Просто потому, что для встраивания LLM в процесс - нужно иметь этот самый процесс, в который стоит встроить (а это встречается не так часто) и экспертов и эвалы. А вот для того, чтобы накодить агентом небольшое приложение кому-то в помощь - многого не требуется, достаточно идеи и отсутствия тормозов. Точек применения тут куча! Потенциальных последствий (как хороших, так и бардака).

И что самое ужасающе-потрясающее - это не прогноз, а уже произошло.

Как все еще раз встанет с ног на голову еще через полгода - не может предсказать никто. Но все очень хотят)

Ваш, @llm_under_hood 🤗


Forward from: Denis Sexy IT 🤖
Video is unavailable for watching
Show in Telegram
Увидел тут полную карту мозга мухи (FlyWire – там размечены все 139 тысяч нейронов дрозофилы) и не удержался – сделал 3D-муху, которая живёт на рабочем столе мака

Внутри настоящая карта нейронов дрозофилы (FlyWire), так что от курсора она улетает не по скрипту, а когда у неё реально загорается нейрон побега – тот же, что у живой мухи

Ещё есть окошко с её мозгом: кликаешь по зоне нейронов – муха чешется, пятится или паникует

Днём у неё сиеста, ночью она спит, а на горячем маке бегает быстрее (я не шучу, у нее какие-то евенты из MacOS прокинуты в симуляцию мозга 😋)

Исходный код тут:
https://github.com/DenisSergeevitch/desktop-fly

Получается, вечная электронная 2D жизнь в симуляции

P.S. Раздражает правда как живая, рекомендую


Переходят все больше учебных заведений на устные защиты работ


Forward from: Denis Sexy IT 🤖
Дания нашла самый адекватный способ бороться с домашними заданиями сделанными в ChatGPT – перестать угадывать писал ли текст АИ и просто попросить ученика защитить его устно ¯\_(ツ)_/¯

Новые правила касаются крупных экзаменов – после сдачи ученик должен будет устно объяснить свои аргументы, источники и выводы

Вот и закончилась эпоха рефератов

https://edition.cnn.com/2026/08/07/europe/ai-cheating-measures-schools-denmark-intl-scli


Forward from: r/ретранслятор
Video is unavailable for watching
Show in Telegram
Канадский депутат во время своего выступления в Законодательном собрании случайно зачитал вслух ответ ChatGPT:

Вот более естественная и плавная версия этого фрагмента,
которая звучит как выступление в законодательном
собрании, а не как набор коротких тезисов.


Затем он как ни в чём не бывало продолжил речь, высказывая «собственную» позицию по волнующему общественность вопросу.

Теперь мы официально живём в эпизоде «Южного Парка»
r/#nottheonion


Forward from: 1337
Video is unavailable for watching
Show in Telegram
90% студентов используют ИИ вместо своей головы, заявил американский учитель истории Джейсон Гибсон. По его словам, 32 из 35 учеников сгенерировали ответы через ChatGPT и провалили промежуточный экзамен.

Преподаватель вычислил их с помощью невидимого промпта в задании, который заставлял ИИ вставить в ответ слово «Мадагаскар» в абсурдном контексте. Уловка сработала — остров появился почти во всех работах.

Учителя особенно удивило, что студенты даже не прочитали готовые ответы перед сдачей.

🌒 1337


Скоро это многие заметят и перейдут на устные экзамены и тогда понадобятся сервисы типа vedira.ai


Forward from: Machine learning Interview
Одна и та же ложь может по-разному влиять на LLM в зависимости от тона, уверенности и грамматической формы.

В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно.

Лучше всего модели убеждали:

* приказы;
* формальный язык;
* обращение как к ребёнку;
* ссылки на авторитет;
* уверенная подача.

Хуже всего работали слабые формулировки и контрфактические утверждения.

Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость.

Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели.

Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief*

arxiv.org/abs/2607.18232


Forward from: Адель и МЛь
Насколько же сильно меняется работа, когда есть ИИ агенты.

Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать.

Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники.

Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100.

По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже”

Прогресс, как это часто бывает, выглядит немного несправедливо.

И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре.

До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷‍♂️


Forward from: БлоGнот
Исследователи Anthropic выкатили результаты интересного исследования — в языковых моделях нашли структуру, функционально похожую на «глобальное рабочее пространство» из нейронауки сознания.

Огромная часть вычислений модели — автоматика, недоступная для отчёта. Но внутри нейронных сетей Claude существует небольшая группа паттернов активации, выполняющая роль, аналогичную «сознательно доступному» мышлению у людей. Это область, где модель удерживает мысли, которые она «обдумывает», но не обязательно озвучивает. J-Space не был запрограммирован разработчиками, он появился самопроизвольно в процессе обучения модели.

Есть вполне человеческие аналогии — не зря исследователи проводят параллели с нейронаукой.

Опытный водитель переключает передачи не осознавая. Но, если его спросить, какая сейчас передача, информация об этом втягивается в сознание. У модели так же: счётчик длины строки исправно управляет переносами, вообще не появляясь в рабочем пространстве, но стоит задаче потребовать назвать длину — та же информация всплывает и становится доступной для рассуждения.

Эффект белого медведя: инструкция «не думай об X» подавляет концепт лишь частично, он прорывается. А у пост-обученной модели рядом с прорвавшейся мыслью появляется ещё и damn — она замечает собственный провал, как медитирующий, обнаруживший, что ум опять убежал.

J-space содержит всего несколько десятков концептов одновременно и отвечает менее чем за 1/10 (10%) общей активности внутренних процессов модели. Нейроны в J-space связаны с остальной сетью значительно плотнее — в некоторых частях сети плотность связей выше примерно в 100 раз по сравнению с обычными паттернами.

Работа не доказывает, что Claude обладает «феноменальным сознанием» (способностью чувствовать). Однако исследование демонстрирует наличие «доступного сознания» (access consciousness) — способности оперировать информацией, рассуждать и использовать её для управления поведением. Практическое его использование уже понятно — можно использовать для контроля модели и обнаруживать попытки обмана. Кроме того, это даёт неожиданный метод обучения: если натренировать модель формулировать этические принципы в ответ на гипотетическое «остановись и подумай», поведение улучшается и там, где никто не спрашивает — принципы заселяют рабочее пространство. Тренируя, что модель сказала бы, меняешь то, что она думает.

https://transformer-circuits.pub/2026/workspace/index.html


Пару месяцев я поймал себя на простой мысли: мы тратим кучу времени на то, чтобы прочитать материал, и почти не тратим на то, чтобы проверить — а осталось ли что-то в голове на самом деле.

Тесты с галочками этого не ловят. Можно угадать, можно зазубрить формулировку, можно прокликать. А вот объяснить вслух, своими словами, когда тебя переспрашивают — тут уже не спрячешься. Именно так нас проверяли преподаватели на устных экзаменах. И именно это работает.

Поэтому я сделал Vedira AI — платформу, которая проверяет знания голосом.

Как это работает:

1. Загружаешь материал. Конспект, статью, PDF, ссылку или просто текст — то, что хочешь усвоить.

2. Система генерирует вопросы. Не случайные — по сути загруженного материала, с разной глубиной.

3. Проходишь голосовое интервью. Живой разговор с AI в реальном времени: он спрашивает, слушает, переспрашивает, если ответ поверхностный, и уводит в сторону, если ты начинаешь плавать. Как настоящий экзаменатор.

4. Получаешь разбор. Где ответил уверенно, где поплыл, что стоит повторить. Без оценочного "молодец", а с конкретикой.

Что меня самого зацепило за время разработки: голосовой формат включает совершенно другой режим мышления. Когда нужно сказать, а не выбрать — сразу видно, понял ты тему или просто узнаёшь знакомые слова.

Это работает для студентов перед экзаменом, для тех, кто готовится к собеседованиям, для людей, которые учат новое и хотят честную обратную связь, а не иллюзию прогресса.

Сейчас я открываю доступ. Если тема близка, заходите, попробуйте, и обязательно напишите, что сработало, а что бесит. Первые отзывы сейчас на вес золота. 🙏

Если интересно, как все устроено внутри, велком - пишите!

https://vedira.ai

20 last posts shown.