Стартап OneBrain, который на днях выкатил анонс своей первой модели OB-1. Название, возможно, с реверансом в сторону Звездных войн.
Команда заявляет о создании фундаментальной модели для декодирования ЭЭГ-сигналов в текст, речь и изображения с поддержкой межсубъектной обобщаемости без индивидуальной калибровки.
Команда выглядит стандартно для современного deeptech-стартапа. В роли CEO выступает выходцев из продакт-менеджмента Приянка Джайн, за научное ядро в качестве CTO отвечает экс-исследователь из Оксфорда Инго Марквардт, а в научном совете присутствуют вполне реальные исследователи из Маастрихта и Техаса. Инвесторы — в основном топы из сферы коммерческого AI.
Что они декларируют на практике? Авторы предлагают записывать ЭЭГ и через генеративные сети восстанавливать либо картинку, которую человек видит или представляет, либо текстовую последовательность.
При этом заявляется zero-shot подход, когда обученная на одной группе модель сразу работает на новых испытуемых.
Если оценивать проект без маркетинговой шелухи, перед нами классический пример оверхайпа на волне популярности генеративных сетей, где реальная научная ценность пока крайне мала.
Главная проблема здесь в самой природе ЭЭГ. Сигнал с поверхности скальпа проходит через череп и ткани, которые работают как мощный фильтр нижних частот. На выходе получается шум стадиона, записанный через толстую стену. Извлекать из такого сигнала точную семантику тонких зрительных образов или отдельных слов невероятно сложно из-за низкого соотношения сигнал/шум и фатального влияния мышечных артефактов.
Если вчитаться в их собственные результаты по декодированию текста, становится совсем грустно. Авторы честно приводят точность угадывания слов, которая превышает случайный уровень всего на 9–21% для узкого набора токенов.
В задачах нейрокомпьютерных интерфейсов превышение случайного шанса на 10% означает лишь то, что модель зацепилась за грубые частотные паттерны или моторные артефакты. Ни о каком чтении мыслей или декодировании речи тут речи не идет.
С декодированием изображений история тоже известная. Когда вам показывают красивую картинку, якобы восстановленную из ЭЭГ, в подавляющем большинстве случаев работает не биосигнал, а априор генеративной модели вроде Stable Diffusion. Модель считывает из ЭЭГ едва заметный шум, угадывает абстрактный класс или уровень активации и рисует красивое фото из своего датасета. Пользователю кажется, что сеть прочитала его зрительный образ, а на деле она просто сгенерировала случайную собаку.
В итоге мы имеем дело с попыткой прогнать крайне шумный и слабоинформативный биосигнал через тяжелый генератор и выдать красивую галлюцинацию нейросети за декодированный поток сознания.
В отличие от инвазивных интерфейсов на ECoG или sEEG, где в декодировании речи действительно есть некоторый прогресс, неинвазивные ЭЭГ-подходы такого типа пока остаются не более чем красивой демо-версией для инвесторов.
https://www.nubrain.com/
Post #15717
275