Можно ли считать исследование хорошим, если агентная система случайно получила правильный ответ? Обычно бенчмарки говорят «да». Исследователь, мягко говоря, должен немного занервничать.
Авторы
Apodex Discovery предлагают оценивать не отдельный ответ модели, а всю исследовательскую систему: модель, инструменты, память, управляющий код и последовательность действий. То есть не «что она написала в конце», а как именно дошла до результата.
Для этого они собрали среду
TRACES с реальными задачами и отдельной проверкой процесса. Внутри шесть довольно земных вопросов. Правильно ли агент выбирал инструменты? Исправлял ли причину ошибки, а не маскировал симптом? Рассматривал ли другие гипотезы? Не потерял ли ограничения по дороге? На чём держатся его утверждения? И где заканчивается область применимости вывода?
Звучит почти как нормальная методология исследования. Собственно, в этом и интерес.
Сейчас агента часто оценивают по артефакту: получился отчёт, таблица, код, прогноз. Но хороший итог иногда возникает после плохой процедуры. Модель могла подсмотреть ответ, случайно выбрать верную спецификацию, проигнорировать неудобные данные или собрать правдоподобное объяснение уже после результата. И наоборот: аккуратное исследование может не дать быстрого успеха, особенно если окончательная проверка появится через месяцы.
Apodex пытается развести эти вещи. Итог проверяется отдельно, а видимая траектория отдельно. Причём внутренние рассуждения модели аудитору не показывают: он видит действия, источники, вызовы инструментов и исправления. Для прикладных исследований это разумный принцип. Нам нужен не мистический доступ к «мыслям» агента, а воспроизводимый журнал того, что он сделал.
Ограничение тоже серьёзное. Это свежий препринт и собственный бенчмарк авторов, а не готовый стандарт. Их заявления о результатах в биомедицинских задачах ещё предстоит независимо проверить.
Но сам вопрос поставлен правильно. Если агент участвует в исследовании, сохранять только его финальный текст примерно так же странно, как выбросить анкету, код обработки и полевой дневник, оставив одну презентацию. PowerPoint не заменяет методологию. Даже если его сделал агент.
На днях у меня был довольно интересный диалог о том, как сегодня оценивать исследовательские артефакты студентов — эссе, курсовые или дипломные работы. Я озвучил мысль, что итеративный процесс зачастую интереснее выводов, которые по результату получаются. Но это про студентов-человеков, которые уже сегодня используют нейросети. А что делать, когда они массово доберутся до ИИ-харнессов? Как это оценивать — или не нужно оценивать вовсе, а стоит смотреть на что-то другое? Тогда на что? На саму идею и то, как она рождается?