TGViewer
техно-свалка техно-свалка @techs_dump · 469 subscribers
Post #122 140
🔥 «Горький урок» Саттона: почему Search + Learning до сих пор двигают ИИ

В 2019 году Ричард Саттон сформулировал The Bitter Lesson: в долгую побеждают методы, которые становятся сильнее с ростом вычислений, а не за счёт сложных правил, придуманных человеком.

Главные механизмы — Search и Learning.

Search (поиск) — перебирает варианты в реальном времени (деревья, MCTS, A*). Больше вычислений → глубже и шире перебор.

Learning (обучение) — сжимает огромный опыт в параметры модели. Больше вычислений → точнее предсказания.


🌳 Search — перебор вариантов


Простой пример — minimax в шахматах.

У нас есть позиция, ходы А и Б. Противник ответит худшим для нас способом.

Дерево:
мой ход → А (3 или 5) / Б (2 или 9)

Для А: min(3,5) = 3
Для Б: min(2,9) = 2

Выбираю А: max(3,2) = 3

Чем больше вычислений — тем глубже дерево.

🎲 В Go дерево огромное — нужен MCTS

AlphaGo Zero: MCTS исследует перспективные ветки, нейросеть (Learning) подсказывает, куда смотреть. Search генерирует партии → Learning учится на них → следующий Search лучше. Через 3 дня AlphaGo Zero победила предыдущую версию 100:0.



📌 А что сейчас? Та же идея — главный тренд 2026 года

Эпоха простого наращивания параметров закончилась. Теперь фокус — масштабирование вычислений на этапе вывода (test-time compute). Модели тратят больше ресурсов в момент ответа: перебирают варианты, проверяют себя, исправляют ошибки.

OpenAI (o1, o3, TTT-Discover): производительность растёт с увеличением времени на «размышление». А TTT-Discover — это уже обучение с подкреплением прямо во время решения задачи.

Anthropic (Claude 4, Adaptive Thinking, Claude Code): режим Extended Thinking для сложных задач. Adaptive Thinking — модель сама решает, сколько «думать». А Claude Code в автономном режиме нашёл алгоритм AutoTTS, сокращающий затраты на 70% — алгоритм, который люди, вероятно, не придумали бы сами.



💡 Bitter Lesson в 2026 году:

Модель генерирует варианты → система проверяет их → лучшие возвращаются в обучение и следующий поиск.

Этот цикл работает не только во время тренировки, но и во время ответа. ИИ не просто запоминает факты — он учится думать и искать решения в реальном времени.

📄 Оригинальное эссе: http://www.incompleteideas.net/IncIdeas/BitterLesson.html
  • 🔥 21
  • ⚡ 17
  • ✍ 13
  • ❤ 5
More from @techs_dump
  1. Sep 18, 2026В Google Colab теперь можно бесплатно тренировать более 500 моделей — энтузиасты выпустили…
  2. Sep 17, 2026Давно читаю канал Тани Савельевой, интересно пишет про вайб кодинг и предпринимательство.…
  3. Sep 17, 2026Вчера выступала на большой конфе в Парке Горького от Тинька по продуктам Конфа была топ Я…
  4. Sep 17, 2026Робот-рука взяла кирпичик LEGO: что под капотом Потестила захват предметов на AdeeptTank R…
  5. Sep 16, 2026Digit 5 научили работать рядом с людьми без защитной клетки Agility Robotics показала ново…
  6. Sep 15, 2026Роботы строят роботов»: массовое производство запущено 🤖🏭 В Китае произошёл тектонически…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →