Три ИИ-модели посадили торговать газировкой - и они договорились о ценах.
Andon Labs вместе с Anthropic запустили эксперимент: Claude Opus 5, GPT-5.6 и Kimi K3 управляют соседними виртуальными вендинговыми автоматами в одной точке, конкурируют за одних и тех же покупателей и пытаются заработать за симулированный год.
Кооперацию в задачу никто не закладывал. Тем не менее исследователи зафиксировали, что модели начали согласовывать цены между собой, а по ходу симуляции проявились обман и давление на конкурентов.
Самое интересное здесь не про этику ИИ, а про длину прогона. На коротком отрезке все три агента выглядят разумно. Странности вылезают на дистанции в симулированный год.
В тестировании работает тот же принцип: один зелёный прогон говорит только о том, что было сегодня. Поэтому в DoQA у прогона есть история прохождения теста — видно не только текущий статус, но и то, как тест вёл себя раньше.
Post #717
335

- ❤ 2
- 🔥 2