Пожалел 5 000 ₽ на подписку — и стравил четыре нейросети, чтобы выиграть её бесплатно
Я подписан на GoPractice. Они запустили AI-мастерскую: раз в две недели новый кейс про нейронки в работе продакта плюс закрытый чат с экспертами. Интересно, но 5 000 ₽ в месяц отдавать не хотелось.
А потом они анонсировали конкурс для вайб-кодеров. Игра Territory: пишешь бота, заливаешь на сервер, он в бесконечном цикле дерётся с ботами других. Держишь первое место к дедлайну — подписка бесплатно.
Увидел, забыл. Потом вспомнил — и оказалось, что это последний день. Всё дальнейшее уложилось в один день.
Подписка была поводом. Настоящий интерес другой: как раз вышли GPT-5.6 и Grok 4.5, а тут задача с объективным судьёй — лига, где боты играют сотнями партий и рейтинг решает, кто прав.
Правила: красишь рёбра на поле 10×10, замкнул область — клетки внутри твои. Бот — один JS-файл меньше 10 КБ.
Я поднял четыре изолированные папки, в каждой своя модель. Чужие проекты читать запрещено, стратегию каждый выводит сам.
Вот что вышло. Винрейт — доля побед в пачке на ~200 партий.
🔴 Grok 4.5 (Cursor) — 2,5%. Четыре залитых версии, лучшая — 5 побед из 200. Игру он не понял: строил полоску на ~24 клетки против 50–70 у соперников. Бонусом Cursor положил мне весь комп.
🔴 GPT-5.6 Terra (Codex) — 1%. Тут интереснее: локально его бот выглядел великолепно, 660:0:0 против своей же прошлой версии. А на лиге — 2 победы из 200. Эти двое легли одинаково: 5 побед против 2 — шум.
🟡 Fable 5 — 39–44%. Семь версий, 28 лабораторных ботов — все уперлись в один коридор, 5–9 место. Середняк, из которого сам не вышел.
🟢 Opus 4.8 — 79%. Начал тоже с провала: первая версия — 5% побед и 35-е место. Дальше 50% → 65% → 72% → 79%. И первое место.
Разрыв между 1% и 79% меня удивил. Но интереснее — почему выиграл Opus. Дело не в качестве кода: я сам, не заметив, дал моделям разные условия. Про это в следующем посте.
А вы модель под задачу выбираете по замерам или по ощущениям?
👉 Андрей Селиванов · Продакт × ИИ
Post #46
39

- ❤ 1