На прошлой неделе мы писали, что Anthropic объявила о первом результате собственной биологической лаборатории: около 950 агентов Claude за 21 час обработали 210 млн токенов, изучили более 200 тысяч обратных транскриптаз и отобрали 20 наиболее интересных систем.
Один агент заметил рядом с уже известным ферментом необычное сочетание повторяющихся участков ДНК и дополнительного гена. Систему назвали ART — array-associated reverse transcriptase. Эксперименты показали, что найденный массив действительно производит короткие РНК, однако функция ART пока неизвестна: называть её новым CRISPR или готовым инструментом редактирования генома рано.
Но почти сразу возник вопрос не о биологии, а об авторстве
Марио Родригес Местре, вычислительный биолог из Копенгагенского университета, заявил, что изучает те же ферменты и связанные с ними структуры около четырёх лет, а конкретную систему его группа обнаружила примерно год назад. Работа ещё не опубликована.
Есть особенно неудобная деталь: в процессе исследования Местре активно пользовался Claude: обсуждал код и загружал черновики диссертации и будущей статьи. Увидев результат Anthropic, он предположил, что модель могла не открыть систему независимо, а каким-то образом повторить предоставленную ей неопубликованную работу.
Доказательств этого сейчас нет. Anthropic утверждает, что Claude анализировал общедоступные данные, включая материал из статьи 2022 года, а пользовательские диалоги не применялись для его обучения и не были доступны биологической команде компании. Сам Местре допускает совпадение.
Тем интереснее сам прецедент. Раньше учёный делился ещё не опубликованной идеей с несколькими коллегами. Теперь между замыслом и публикацией может находиться ИИ-агент, которому отдают гипотезы, отрицательные результаты, код, рукописи и описание следующих экспериментов.
В зависимости от устройства сервиса и его правил такие диалоги могут сохраняться, проверяться или использоваться для улучшения системы. Тогда чужая идея теоретически способна повлиять на другой проект без промышленного шпионажа и даже без осознанного копирования: информация растворяется в инфраструктуре, а модель уже не может восстановить её происхождение и поставить нормальную ссылку.
Здесь и ломается привычная схема научного признания. ИИ нельзя записать в авторы: например, правила Nature требуют, чтобы автор отвечал за работу, а модель этого делать не может. Но кому тогда принадлежит приоритет — владельцу неопубликованной гипотезы, исследователю, запустившему агентов, разработчику модели или тому, кто первым опубликовал результат?
Вероятно, науке понадобятся журналы происхождения результата: версии моделей, промпты, использованные данные, вызовы инструментов и неизменяемые временные метки. Без такой цепочки невозможно отличить независимое переоткрытие от невольного заимствования.
А пока самым надёжным способом сохранить приоритет может оказаться метод столетней давности: не рассказывать машине то, что вы ещё не готовы рассказать миру. Сначала — датированный препринт, закрытый репозиторий или патентная заявка. Потом — разговор с облачным ИИ.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
