🔥 «Горький урок» Саттона: почему Search + Learning до сих пор двигают ИИ
В 2019 году Ричард Саттон сформулировал The Bitter Lesson: в долгую побеждают методы, которые становятся сильнее с ростом вычислений, а не за счёт сложных правил, придуманных человеком.
Главные механизмы — Search и Learning.
Search (поиск) — перебирает варианты в реальном времени (деревья, MCTS, A*). Больше вычислений → глубже и шире перебор.
Learning (обучение) — сжимает огромный опыт в параметры модели. Больше вычислений → точнее предсказания.
—
🌳 Search — перебор вариантов
Простой пример — minimax в шахматах.
У нас есть позиция, ходы А и Б. Противник ответит худшим для нас способом.
Дерево:
мой ход → А (3 или 5) / Б (2 или 9)
Для А: min(3,5) = 3
Для Б: min(2,9) = 2
Выбираю А: max(3,2) = 3
Чем больше вычислений — тем глубже дерево.
🎲 В Go дерево огромное — нужен MCTS
AlphaGo Zero: MCTS исследует перспективные ветки, нейросеть (Learning) подсказывает, куда смотреть. Search генерирует партии → Learning учится на них → следующий Search лучше. Через 3 дня AlphaGo Zero победила предыдущую версию 100:0.
—
📌 А что сейчас? Та же идея — главный тренд 2026 года
Эпоха простого наращивания параметров закончилась. Теперь фокус — масштабирование вычислений на этапе вывода (test-time compute). Модели тратят больше ресурсов в момент ответа: перебирают варианты, проверяют себя, исправляют ошибки.
OpenAI (o1, o3, TTT-Discover): производительность растёт с увеличением времени на «размышление». А TTT-Discover — это уже обучение с подкреплением прямо во время решения задачи.
Anthropic (Claude 4, Adaptive Thinking, Claude Code): режим Extended Thinking для сложных задач. Adaptive Thinking — модель сама решает, сколько «думать». А Claude Code в автономном режиме нашёл алгоритм AutoTTS, сокращающий затраты на 70% — алгоритм, который люди, вероятно, не придумали бы сами.
—
💡 Bitter Lesson в 2026 году:
Модель генерирует варианты → система проверяет их → лучшие возвращаются в обучение и следующий поиск.
Этот цикл работает не только во время тренировки, но и во время ответа. ИИ не просто запоминает факты — он учится думать и искать решения в реальном времени.
📄 Оригинальное эссе: http://www.incompleteideas.net/IncIdeas/BitterLesson.html
Post #122
140
- 🔥 21
- ⚡ 17
- ✍ 13
- ❤ 5