Главная мысль доклада Ильи Семенкова («Чему на самом деле учится модель на данных мозга?») , представленного на летней школе AIRI, заключается в том, что специфическая биологическая и физическая природа нейроданных требует глубинного понимания их контекста, а не слепого применения стандартных моделей машинного обучения.
Лектор акцентирует внимание на практических особенностях обработки данных мозга.
В отличие от обычных датасетов, данные мозга (ЭЭГ, МЭГ) представляют собой многомерные временные ряды, привязанные к физической структуре головы и конкретным сенсорам.
Данные фМРТ и МРТ записываются в виде 3D-объемов из вокселей, при этом более половины занимаемого пространства остаётся пустой неинформативной зоной.
Большинство исследований в сфере применения ИИ к нейроданным критически разделяются на две крайности.
Первая группа работ создается специалистами по нейронаукам, имеющими богатую доменную экспертизу, но ограничения в методах ML.
Вторая группа создается профильными разработчиками и ML-инженерами, которые часто теряют связь с биологической реальностью процессов.
Из-за отсутствия прозрачности нейросетей («черный ящик») врачи не могут доверять им в клинической практике для установки диагнозов.
Игнорирование биологических ограничений неизбежно приводит к искусственно завышенным метрикам и ложным красивым результатам.
В экспериментах по декодированию изображений из мозга с помощью диффузионных моделей ключевую роль играет генеративное смещение (bias) самого ИИ.
Опыт показал, что модель генерации изображения часто получает лишь минимальный импульс из нейроданных, а остальную картинку «дорисовывает» сама.
Попытки уменьшить модель в десятки и сотни раз продемонстрировали схожие результаты декодирования, подтверждая избыточность громоздких систем.
Ключевой вывод доклада: нейроданные — это не просто абстрактные тензоры, и вся сложность работы с ними упирается именно в понимание физики их происхождения.
https://youtu.be/tZkyPgBRiOk?is=2kjl1lmtG6LqBeGC
Post #16092
482