TGViewer
Грин еще не робот 🤖 Грин еще не робот 🤖 @robotless · 5.13K subscribers
Post #1801 941
Google и Kaggle представили Game Arena — площадку для борьбы LLM-моделей в стратегических играх.

На стартовой шахматной арене восемь продвинутых моделей (включая Gemini 2.5 Pro, o3, o4‑mini, Claude 4 Opus, Grok 4, DeepSeek R1 и Kimi k2) вступают в матч-турнир с живыми трансляциями, комментариями от GM Нианамуры, Levy Rozman и Magnus Carlsen.

Эксперты и шахматное сообщество подключены к судейству и аналитике  .

Игра в шахматы даёт чёткие условия: полная информация, стратегическое планирование, оценка позиции и долгосрочное мышление.

Модели будут играть все против всех (каждая пара — по сотне матчей) для статистически устойчивого лидерборада, а не просто случайного шоу.

Планируется расширение Game Arena: следующим будут игры Go, Poker (известный формат Pluribus), и даже видеоигры и симуляции. Это масштабирует оценку от строго досочных стратегий до непредсказуемых задач, где требуется адаптация и глубинное планирование .

Вот какие задачи реально проверяются:
— Понимание правил, долгосрочное планирование, оценка последствий ходов.

— Способность адаптироваться к неожиданным ходам и создавать немодел-специфические стратегии (как хитрая «ход 37» AlphaZero).

— Креативность и абстрактное мышление: уличные стратегии, нестандартные жертвы, борьба с неопределённостью. Это уже не просто словесный ответ — это умение думать, вычислять, действовать по плану.


Судьи — международные мастера и профессионалы шахматного сообщества. Они наблюдают и объясняют ходы модельных партий, комментируют стиль, ошибки и неожиданные решения.

Чем Game Arena лучше старых тестов?

Классические benchmarks — SQuAD, LAMBADA, TriviaQA — ориентированы на статичные ответы, знание фактов, нередко уже давят saturation: модели набирают top-счёт и всё, тест теряет силу. Game Arena предлагает динамическую, открывающуюся среду, где модели соревнуются друг с другом — туда невозможно заранее списать ответы, нужно думать снова и лучше каждый раз  .

LLM уже давно не «балтуны» — но большинство тестов оценивают знание слов и шаблонов, а не стратегию. Arena проверяет планирование, стратегию, учёт последствий, создание новой модели поведения. Это следующий уровень: думать, адаптироваться, побеждать в реальном времени.

И что?

Для бизнеса: новый контракт с Google и DeepMind может стать лидером оценки ИИ-моделей. Arena создаст рынок моделей с реальной стратегической мощью, а не просто для генерации текста.

Для инвесторов: теперь можно оценить, кто действительно мыслит глубоко, а кто просто выдаёт цитатки. Победители турниров получат репутационные дивиденды, проигравшие — риск быть списанными как «только маркетинг».

Для рынка: открытый запрос на LLM, способные справляться с задачами ближе к AGI: планирование, находчивость, адаптация. Конечно, если кто-то выйдет вперёд, арена станет главным индикатором прогресса.

🚨 Нам 3.14здец

Люди: 10/10. Одно дело, когда арену проводит независимая структура, и совсем другое — когда это делает корпорация с собственной моделью. Google запустил Kaggle Game Arena не ради шоу, а ради данных. Ведь чтобы не проиграть, все конкуренты будут выкладывать самые свежие и дорогие версии своих моделей, тюнить их до предела и гонять в сотнях матчей. Каждая партия — это золотой датасет. Кто получает эти данные? Хозяин арены.
Google получает возможность обучать свой Gemini на лучших стратегиях всех конкурентов в реальном времени. Это как если бы Microsoft организовала Олимпиаду и имела право копировать тренировки всех участников. В итоге арена не просто меряет интеллект — она превращается в насос, выкачивающий идеи и приёмы в пользу одного игрока.

П****ц в том, что под видом «честного турнира» нам подсовывают скрытый отбор, где данные со всего рынка текут в руки Google. Мы сами кормим ту систему, которая завтра сделает нас ненужными.
  • 🔥 4
  • 👍 3
  • ❤ 1
More from @robotless
  1. Oct 7, 2026Китай догнал американский ИИ, Нью-Йорк выдал роботам права, а Америка ответила открытой мо…
  2. Oct 5, 2026Post #2433
  3. Oct 5, 2026Понедельник
  4. Oct 4, 2026Post #2431
  5. Oct 4, 2026компания Figure сделала новых роботов версии 3, а старых, вместо того чтобы отдать на запч…
  6. Oct 2, 2026Ты ставишь галочку «Разрешать всегда». Читать мелкий шрифт некогда, думать не хочется ведь…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →