#новости
В середине июля нейрохирург Эдвард Чанг из Калифорнийского университета в Сан-Франциско объявил, что после 10 лет исследований его команде удалось разработать речевой нейропротез. Благодаря протезу парализованный испытуемый смог довольно бодро "говорить": примерно 15 слов в минуту из словаря в 50 слов с точностью 75%.
Статья по результатам их работы тут: https://www.nejm.org/doi/full/10.1056/NEJMoa2027540
Это не первый в мире нейропротез в общем смысле, но точно один из первых, где применили подобную технологию. Новизна этого протеза в том, что он не пытается считывать слова побуквенно, имитируя печать, а распознает их сразу целиком.
В июле 2019 от той же команды вышла статья про то, как им удалось в режиме реального времени распознавать ответы на вопросы в диалоге: https://www.nature.com/articles/s41467-019-10994-4
Для этого исследователи снимали электрокортикограмму (запись импульсов с электродов на поверхности коры мозга) у трех пациентов-эпилептиков, которым эти электроды установили ранее в лечебных целях.
Пациенты слушали вопросы и отвечали вслух, в то время как учёные использовали записи ЭКоГ, чтобы определить, когда и что испытуемые услышали или произнесли. Так как вопросы и ответы были известны, можно было дополнительно использовать априорные вероятности каждого ответа. В итоге точность распознавания услышанного вопроса получилась до 76%, а выданного ответа — до 61%.
Получается, потребовалось два года, чтобы перейти от проверки гипотезы "возможности" на трех испытуемых и небольшом датасете к реальному применению модели, обученной на 22 записанных часах нужной мозговой активности. Сейчас у команды в планах расширить словарный запас и продолжить исследования.
🧙♀️Нейроведьмочки, мотайте на картинки.
🧙♂️Нейрошаманы, для вас описание работы системы :
Сперва определяют вопрос (получают вероятности), сопоставляя аудиозапись с электрокортикограммой при помощи алгоритма Витерби.
Далее опять алгоритмом Витерби получают вероятности ответа и, учитывая априорную вероятность ответа — на каждый вопрос свой набор ответов, — определяют ответ.
При этом берут не все подряд каналы и частоты, а смотрят конкретно на гамма-ритмы (70-150 Гц) с определённых электродов, расположенных у речевого центра. Нужные частоты выделяют набором настроенных по алгоритму Parks-McClellan фильтров с конечной импульсной характеристикой.
Так было в статье 2019 года. В 2021 они собрали достаточно данных, чтобы запилить глубокое обучение. Теперь имеется две модели: для распознавания воображаемой речи и классификации слов. Также используется модель естественного языка и, по старой памяти, алгоритм Витерби, чтобы складывать слова в предложения. Статья написана нейрофизиологами, поэтому особых подробностей про модели и их архитектуру нет, только результаты.
#инвазивный_интерфейс,
#ECoG
#гамма
#речевой_аппарат
В середине июля нейрохирург Эдвард Чанг из Калифорнийского университета в Сан-Франциско объявил, что после 10 лет исследований его команде удалось разработать речевой нейропротез. Благодаря протезу парализованный испытуемый смог довольно бодро "говорить": примерно 15 слов в минуту из словаря в 50 слов с точностью 75%.
Статья по результатам их работы тут: https://www.nejm.org/doi/full/10.1056/NEJMoa2027540
Это не первый в мире нейропротез в общем смысле, но точно один из первых, где применили подобную технологию. Новизна этого протеза в том, что он не пытается считывать слова побуквенно, имитируя печать, а распознает их сразу целиком.
В июле 2019 от той же команды вышла статья про то, как им удалось в режиме реального времени распознавать ответы на вопросы в диалоге: https://www.nature.com/articles/s41467-019-10994-4
Для этого исследователи снимали электрокортикограмму (запись импульсов с электродов на поверхности коры мозга) у трех пациентов-эпилептиков, которым эти электроды установили ранее в лечебных целях.
Пациенты слушали вопросы и отвечали вслух, в то время как учёные использовали записи ЭКоГ, чтобы определить, когда и что испытуемые услышали или произнесли. Так как вопросы и ответы были известны, можно было дополнительно использовать априорные вероятности каждого ответа. В итоге точность распознавания услышанного вопроса получилась до 76%, а выданного ответа — до 61%.
Получается, потребовалось два года, чтобы перейти от проверки гипотезы "возможности" на трех испытуемых и небольшом датасете к реальному применению модели, обученной на 22 записанных часах нужной мозговой активности. Сейчас у команды в планах расширить словарный запас и продолжить исследования.
🧙♀️Нейроведьмочки, мотайте на картинки.
🧙♂️Нейрошаманы, для вас описание работы системы :
Сперва определяют вопрос (получают вероятности), сопоставляя аудиозапись с электрокортикограммой при помощи алгоритма Витерби.
Далее опять алгоритмом Витерби получают вероятности ответа и, учитывая априорную вероятность ответа — на каждый вопрос свой набор ответов, — определяют ответ.
При этом берут не все подряд каналы и частоты, а смотрят конкретно на гамма-ритмы (70-150 Гц) с определённых электродов, расположенных у речевого центра. Нужные частоты выделяют набором настроенных по алгоритму Parks-McClellan фильтров с конечной импульсной характеристикой.
Так было в статье 2019 года. В 2021 они собрали достаточно данных, чтобы запилить глубокое обучение. Теперь имеется две модели: для распознавания воображаемой речи и классификации слов. Также используется модель естественного языка и, по старой памяти, алгоритм Витерби, чтобы складывать слова в предложения. Статья написана нейрофизиологами, поэтому особых подробностей про модели и их архитектуру нет, только результаты.
#инвазивный_интерфейс,
#ECoG
#гамма
#речевой_аппарат