Из рубрики «Для эрудитов»
В области интерфейсов «мозг–компьютер» до сих пор отсутствует единый стандарт оценки производительности онлайн-систем, а наиболее популярная метрика — скорость передачи информации (ITR) — часто рассчитывается по-разному и даже ошибочно, что затрудняет сравнение исследований. Авторы статьи анализируют эти проблемы и предлагают рекомендации и методы их преодоления, опираясь на определение ITR, данное Волпо и соавторами в 1998 году на основе теории информации Шеннона.
Формула Волпо для расчёта ITR действительна лишь при выполнении ряда строгих условий: система должна быть дискретным каналом без памяти и стабильным, все команды должны быть равновероятны, точность классификации — одинаковой для всех символов, а ошибки — равномерно распределены между остальными символами. На практике эти предпосылки часто игнорируются, что приводит к некорректным оценкам ITR, особенно в асинхронных интерфейсах, где пользователь может подолгу не подавать команд и где вероятность «простоя» отличается от вероятности выбора конкретных команд.
Отдельная проблема — оценка параметров формулы при онлайн-тестировании: точность классификации P зависит от числа испытаний, а время T на передачу одного символа — от времени переключения между целями, которое часто не учитывается. Авторы показывают, что ошибка в оценке P и T тем сильнее влияет на ошибку ITR, чем выше точность, число классов и скорость передачи, поэтому при публикации результатов необходимо явно указывать значения N, P и T.
Для корректной оценки P требуется достаточно большое число испытаний: авторы приводят формулу минимального объёма выборки n0 для заданной ширины доверительного интервала и отмечают, что при точности выше 0,5 требуемое число испытаний снижается. Также подчёркивается, что при расчёте ITR нельзя учитывать исправление ошибок, автодополнение слов и другие инструменты, повышающие эффективную пропускную способность, — их следует описывать отдельно.
Авторы формулируют ряд рекомендаций: указывать N, P и T; сообщать число испытаний; не включать коррекцию ошибок в базовую оценку ITR; тестировать систему на случайно генерируемых символах из всех N классов; явно указывать, включается ли время переключения t1 в T; сохранять N постоянным на протяжении всего теста; представлять результаты по каждому испытуемому, а не только по лучшим.
Для снижения неопределённости и артефактов при онлайн-оценке авторы предлагают ориентированную на задачи тестовую платформу, которая была успешно использована на Пекинском конкурсе BCI 2010. Платформа включала три задачи: управление переключателями бытовых приборов, ввод символов (печать) и управление виртуальным автомобилем, что имитирует реальные применения BCI.
В задаче печати испытуемым предъявлялась случайная последовательность символов из 40 возможных (26 букв, 10 цифр и 4 знака препинания), тест длился шесть минут, а система через TCP/IP передавала выбранный символ на сервер платформы. Платформа автоматически фиксировала число испытаний, включала время переключения в T, исключала коррекцию ошибок и позволяла сравнивать разные парадигмы BCI — P300, SSVEP и motion-VEP — по единым правилам.
В соревновании участвовали восемь команд, и результаты показали, что платформа способна служить общим инструментом сравнения онлайн-производительности различных BCI, включая расчёт ITR по формуле Волпо для синхронных систем и оценку по очкам для асинхронных. Авторы подчёркивают, что ITR — лишь одна из многих метрик, и для комплексной оценки BCI необходимо учитывать также эффективность, полезность, стоимость, инвазивность, время обучения и удобство использования.
В заключение авторы призывают сообщество BCI к выработке единых стандартов отчётности о производительности интерфейсов, включая термины, определения, методы и модели сравнения. Такие стандарты, по их мнению, облегчат сопоставление результатов между группами, помогут новичкам и в перспективе могут быть согласованы через общество BCI, семинары и другие мероприятия.
https://pubmed.ncbi.nlm.nih.gov/23448963/
#дляэрудитов
Post #16399
295