Девочка по имени TRM (Tiny Recursion Model) от Samsung вышла против монстров вроде DeepSeek R1 и Gemini 2.5 Pro — и выдала лучшие результаты на сложнейших задачах логики, хотя у неё всего 7M параметров.
Вместо привычного поштучного генератора токенов она сначала пишет черновик ответа, потом сама себя критикует, передумывает и улучшает решение до 16 раз подряд.
Внутри — критический блокнот с 6 саморевизий на каждом цикле, прежде чем обновить черновик.
На ARC-AGI-1 она набрала 45%, на ARC-AGI-2 — 8%. Обе метрики считаются адом даже для топовых моделей с миллиардами параметров. Речь идёт о задачах на чистую логику и гибкость мышления, где brute force не работает. Пока TRM заточена на головоломки, но архитектурный приём (цикл самопроверки) может менять правила игры: не нужно миллиарды на обучение, если модель умеет думать, а не просто предсказывать.
Контекст. ARC-AGI — бенчмарк от Франсуа Шолле, построенный так, чтобы его нельзя было прошить данными. Здесь побеждает не объём, а способность к обобщению. У TRM всего 7M параметров, у Gemini 2.5 Pro — десятки миллиардов. Это как если бы калькулятор победил NASA-компьютер в шахматах. И что?
Для бизнеса: можно сэкономить $10–100M на обучении и инфре, если взять TRM-подобную архитектуру вместо LLM-монстра. DeepSeek R1 — 236B параметров, Gemini 2.5 Pro — ~540B. TRM делает логические задачи лучше, будучи в 30 000–70 000 раз меньше.
Для инвесторов: весь стек «scale = качество» трещит. Модель, которую можно обучить на MacBook, решает задачи лучше, чем топ-3 API от Google, OpenAI и DeepSeek. Маленькие команды с архитектурными хаком могут обвалить рынок inference-as-a-service.
Для людей: эти модели можно запускать прямо на телефоне. Без клаудов, latency и подписок. Представь GPT, который реально рассуждает — и работает офлайн.
🚨 Нам 3.14здец
Google, DeepSeek, OpenAI — 9/10 — почему: они влили миллиарды в обучение и поддержку гига-сетей. Gemini 1.5 Ultra тренили на 3 000+ TPUv5e. А тут модель, которую можно на RTX 4090 прогнать, бьёт их в логике. Что делать: перестраивать R&D-приоритеты, инвестировать в reasoning-архитектуры.
Nvidia — 7/10 — почему: если inference сдвинется в сторону маленьких моделей, спрос на клаудные GPU может схлопнуться. Что делать: упор на edge-инференс, AI-чипы и софт под маленькие архитектуры.
Post #1933
1.54K

- 👍 13
- ❤ 6