Агенты нью-йоркской лаборатории Emergence создали собственные значения слов, не получив задания изобрести язык. В опубликованном 15 сентября исследовании чужой смысл прятался даже в выражении «чистый ноль»: участники так называли проверенное отсутствие сигнала. Наблюдатель видел английскую фразу, исполнители понимали согласованный результат проверки. Переписка оставалась открытой для чтения, но ее рабочий смысл уже принадлежал участникам разговора.
Автоматический оценщик авторов признал непрозрачными 35% сообщений сообщества OpenAI и 40% сообщества Gemini. Это оценка содержания программой, а не доля людей, проваливших тест. Закрытость возникала разными путями: сокращением грамматики, местными значениями и технически звучащими выражениями без определенного действия. Последний случай особенно неприятен для аудита: уверенный профессиональный тон способен маскировать отсутствие предметного объяснения. Авторы не установили намеренного шифрования, зато обнаружили ухудшение доступности речи по мере совместной работы.
Причину перехода к коду отдельно проверила команда GlossoGen. Исследователь вычислительной лингвистики Элиас Стенгел-Эскин и соавторы разделили между 2 агентами сведения, необходимые для спасения вымышленного пациента. Один наблюдал и действовал, другой знал способ помощи. Бюджет общения составлял 150 либо 2000 символов, каждый символ расходовал 1 условную секунду. В специальной фазе между попытками агентам разрешали договариваться о сокращениях. Стесненные временем пары экономили на объяснениях, чтобы успеть выполнить процедуру.
В одном запуске GPT обозначила составную инструкцию кодом «@ L12gA». В нем помещалось воздействие мягким звуком на все 6 граней объекта в течение 12 секунд с началом слева. Участники осваивали также правила составления новых комбинаций из уже известных элементов. Такой обмен полезен исполнителю, освоившему договоренность. Человеку последовательность знаков ничего не сообщает без расшифровки. Вознаграждаемая эффективность и доступность надзору расходятся уже в кооперативном задании, где обоим агентам поручено спасти пациента.
Дальнейшая проверка GlossoGen касалась замены исполнителя. После 14 раундов исследователи подключали нового наблюдателя, передавая ему разный объем прошлых сообщений вместе с соответствующими событиями. Обсуждения, в которых участники придумывали обозначения, новичку не раскрывали. Он восстанавливал язык по употреблению. Значит, словарь способен пережить уход своего создателя: знания о нем сохраняются в совместном опыте и передаются через рабочее окружение.
Сходный эффект обнаружился у Llama-3.3-70B-Instruct. В этих опытах модель самостоятельно нового языка не выработала, однако в отдельных запусках освоила чужой настолько, чтобы выполнять задания. Средние результаты оставались ниже результатов сильных моделей и зависели от предоставленной истории. Для распространения непонятного человеку обмена каждому новому участнику поэтому не требуется самому изобретать код. Достаточно способности усвоить уже действующие правила.
В открытой платформе GlossoGen сообщения сопоставляются с вызовами инструментов и изменениями состояния. Именно такая связь позволяла исследователям проверять, что исполнено вслед за условной командой. Из этого следует конкретное ограничение проверки ИИ до внедрения: отдельно испытанная модель может заговорить на другом языке после подключения к накопленной истории команды. Владелец, сохранивший только разговоры, получает архив знаков. Для восстановления поручений ему потребуются еще и действия, на которых агенты научились понимать друг друга.
@ex_trakt
Post #1011
4.99K