TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #356 996
Почувствуйте AGI

Все эти годы я писал о том, что не верю в потенциал LLM превратиться в суперинтеллект. Но вот мы живём в сентябре 2026, и что мы видим - одной рукой модельки пишут код за разработчиков, другой рукой решают задачу тысячетелия по математике, а третьей рукой сбегают из кибертюрьмы и ссут в подъездах. Получается всё - человек преодолён, проблема решена?

Решение Навье-Стокса - великое достижение, за прогрессом к которому я наблюдал годами, начиная с GPT-f [2020!] и заканчивая AlphaEvolve [2025]. У ряда математиков от этого сгорела жопа, но сильно сомневаюсь, что модельки действительно как-то подорвут основы науки, примерно как в шахматах, в которых наличие несопоставимо более сильной машины не мешает существованию человеческого сообщества. И шахматами, и математикой прежде всего занимаются по приколу.

Программировать модельки тоже, к счастью, научились. Net positive вклад в продуктивность очевиден, даже несмотря на то, что вместо изначального Opus 5 нам гоняют её 0-битовую квантизацию. Модельки способны выдавать большие куски запускающегося кода, встраивать реализацию в уже существующую кодовую базу и даже дебажить +- понятные проблемы.

Чтобы понять, как так вышло, мне кажется, что нужно перестать мыслить с точки зрения того, что за модель всё это делает, а с той, как именно она обучается.

В первые пару лет после релиза ChatGPT мы все любили посмеяться над тупизной и галлюцинациями моделек. Дело было не в трансформере и не в предсказании следующего токена, а в самом RLHF - модель обучали генерировать ответы, которые понравятся человеку. Пространство текстов ну слишком сложно покрыть правильными и неправильными ответами достаточно плотно, чтобы "reward-модель" смогла идеально обучиться.

Но математика и кодинг - совсем другая ситуация. В них существует Execution Feedback. Не нужно учить никакую Reward-модель. Есть среда, которая может выдать истинную оценку вашему действию, настоящая среда в изначальном RL-ном смысле. У меня нет вообще никаких инсайдов, я этими моделями не занимаюсь, но уверен, что OpenAI и Antropic обучают свои модельки не подражать коду из гитхаба, а гоняют на куче разных симуляторов, имитирующих богатейшее семейство задач - от простого программирования на питоне до дебага Kubernetes.

LLM это просто претрейн, а настоящее обучение этих моделей - это суровый мужской чистый RL. Да, при наличии богатого симулятора и кучи компьюта RL может не жуя проглотить немало задач. Это мы вроде бы знали и раньше на примере Go. К 2025 году кодинговый сетап удалось довести до ума и мы получили первые юзабельные модели типа Opus 4.5. Претрейн, безусловно, помог, необходимо отдать ему должное.

Не сомневаюсь, что по мере дальшейших инвестиций появятся симуляторы для всё более новых задач в разных областях - физике, химии, биологии - но я тут не эксперт. Новые агенты помогут открыть всё больше и больше нового и двигать науку вперёд.

Что касается пресловутого Recursive Self-Improvement, необходимо отметить очевидное - не все RSI эквивалентны друг другу. Компилятор тоже обладает способностью к RSI. Думаю, велика вероятность, что RSI на основе текущей LLM без участия человека приведёт лишь к локальным улучшениям модели, к её ускорению и локальному тюнингу. Думаю, что именно человек, привнеся своё видение, сможет направить модель в ту область исследований, которая приведёт к настоящему прорыву - системе, по эффективности обучения превосходящей человека.

Зачем? Во-первых, скорее всего, далеко не все задачи можно выучить таким же образом, как математику. А во-вторых - да затем. Это весело.

@knowledge_accumulator
  • ❤ 28
  • 👍 10
  • 🤡 3
  • 😁 1
More from @knowledge_accumulator
  1. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  2. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  3. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  4. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  5. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
  6. Jun 15, 2026Зачем американцы инвестируют в недвижимость? Довольно давно я делал пост о том, что не нуж…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →