Могут ли нейроинтерфейсы «читать» то, что мы читаем?
Исследователи Инго Марквардт, Антилия Альшанат и Приянка Джайн нашли способ обойти главное препятствие в разработке неинвазивных интерфейсов «мозг — компьютер» (BCI) — дефицит масштабных обучающих данных.
Раньше нейросети пытались обучать на «внутреннем монологе» (когда человек проговаривает мысли про себя). Но этот процесс слишком медленный, а сами мысли трудно объективно зафиксировать и синхронизировать во времени.
Авторы работы предложили изящное решение: использовать чтение про себя в качестве источника данных с высокой пропускной способностью.
Главные результаты исследования
Огромный датасет (49 часов ЭЭГ): Ученые протестировали в 393 сессиях — это порядка 240 000 показанных слов. При этом использовалась легкая «сухая» ЭЭГ-гарнитура всего на 19 каналов.
Архитектура в духе CLIP: Сверточный энкодер ЭЭГ сопоставлял короткие окна активности мозга с эмбеддингами (скрытыми состояниями) этих же слов из большой языковой модели (LLM).
Успех с открытым словарем (Open-Vocabulary): Точность декодирования слов (в формате Top-10) оказалась стабильно выше случайного уровня. Модель справилась не только с частыми, но и со словами средней частотности и даже с редкими понятиями.
Отсутствие плато: Качество распознавания слов растет логарифмически-линейно вместе с объемом данных. Это значит, что алгоритм не уперся в пределы точности — чем больше данных ему подается, тем выше результат.
Зрительный vs. Семантический вклад: Исключение затылочных и задне-височных электродов снизило точность распознавания отдельных слов примерно на треть, однако способность отслеживать контекст осталась полностью сохранной.
Главный вывод работы: декодирование текста через неинвазивную ЭЭГ — это фундаментально проблема масштаба данных, а не физический предел или тупик технологий. С ростом объемов ЭЭГ-датасетов реальная реконструкция текста без вживления электродов становится всё ближе.
https://arxiv.org/abs/2608.20186
Post #15992
508