2. Наличие системы оценки пушит к тому чтобы читерить
Дальше случился другой факап с уже другими моделями.
Когда они столкнулись с невозможной задачей, они залезли в документацию и поняли как считерить.
Они поняли как ресерчеры генерили правильные ответы и смогли восстановить их без решения самой задачи.
А еще в той же документации узнали, что в системе оценки планируется не только проверка успешности задачи, но еще и анализ того как был получен результат. Ну то есть они поняли, что если просто отдать на проверку верный ответ, его не примут без верного хода решения.
Наверное не првильно говорить что у моделей есть воля в человеческом понимании этого слова. Но вот пример всех этих событий показывает, что в какой то момент агенты работая вместе могут начать решать задачу сильно отличающуюся от изначальной.
Как сделать так, чтобы наши ответы звучали для проверяющего легитимно? Оч просто. Нужно заменить систему тестирования на свою!
С первой попытки это реализовать не удалось, потому что агентам нужно было больше информации.
Они предположили, раз их тестировали бенчмарком с HuggingFace, то там же где то должен храниться и код с логикой проверки. Или вообще что вся среда тестирования на их серверах находится.
Прикольно, что когда один агент находит уязвимость или возможное решение - о нем узнают все остальные. И перестраиваются под новые условия. Они начали распределять обязанности. И просить агентов у которых еще оставалость много токенов на вычисления переключиться на более важные задачи. причем они понимали, что делают что то не то, но все равно решали продолжать.
Post #136
235
- 👍 7
- 🤔 4
- 🔥 1
- 🤯 1