Вы не поверите, но еще одну видеоигру сделали бенчмарком, и лучшей моделью в ней снова стала Claude!
Исследователи заставили ИИ-агентов играть в Factorio. Было два режима: «Lab-Play» с заданиями и ограниченными ресурсами и «Open-Play», где у моделей была одна цель —построить самый большой и эффективный завод.
Всего было шесть ведущих языковых моделей: Claude 3.5 Sonnet, GPT-4o и GPT-4o mini, DeepSeek-V3, Gemini 2.0 Flash и Llama-3.3-70B-Instruct.
Claude показал себя, разумеется, лучше всех. Почему разумеется? Во-первых, это действительно сильная модель, а во-вторых, среди исследователей был ученый из Anthropic 😁
GitHub тут.
@xor_journal
Post #6217
30K

- 😁 116
- 👍 26
- ❤ 10
- 🔥 5
- 👏 3
- ❤🔥 2