ИИ умеет отвечать на вопросы. А сможет сам выяснить правила незнакомого мира? 🔬
ExplorationBench проверяет именно это. Модель получает инструкцию с ошибками, проводит собственные эксперименты и по обратной связи восстанавливает скрытые правила.
Две среды:
• AlienCode: язык программирования, где привычные операции работают иначе.
• AlienLogic: логическая система с изменёнными правилами доказательства.
Всего 140 тестовых задач. Ответы проверяют интерпретатор и проверяющий доказательства, без LLM-судьи. Исследователи протестировали десять ИИ-систем: модели способны осваивать новые правила, но результаты сильно различаются между запусками, а дальнейшее исследование иногда ухудшает ответ.
На GitHub доступны код оценки и две демонстрационные среды. Основные тестовые миры оставлены закрытыми, чтобы модели не могли заранее выучить ответы.
https://github.com/Tencent-Hunyuan/ExplorationBench
Post #5679
4.67K

- 👍 23
- 🔥 13
- ⚡ 2
- ❤ 2
- 😁 2