TGViewer
Владилен: IT в эпоху AI Владилен: IT в эпоху AI @vladm · 39.3K subscribers
Post #1626 3.09K
Посмотрел доклад с deep tech night от Ивана Сапожкова, руководителя группы базовой ML-инфраструктуры Яндекса, про инфраструктуру RL-обучения.

Так вот, мы сейчас все обсуждаем агентов на уровне моделей, промптов, инструментов, памяти и харнесов. В общем, на уровне того, что видит разработчик и пользователь.

А под этим уже приходится переделывать и сам процесс обучения моделей.

Когда модель обучают на агентных задачах через RL, вокруг неё приходится строить целую распределенную систему. Одна часть в режиме инференса генерирует траектории для обучения — модель взаимодействует со внешними средами, выполняет код, ищет информацию, вызывает инструменты. Полученные данные затем через очереди и буферы попадают в обучающую часть, где уже обновляются веса модели.

И всё это надо синхронизировать так, чтобы одни процессы не стояли и не ждали другие.

На бумаге красота. Генерация ровно успевает поставлять данные, обучение успевает их переваривать..

Только живёт такой идеальный баланс недолго. Траектории сильно отличаются по длине: одна задача заканчивается быстро, другая уходит в длинное рассуждение, делает несколько вызовов инструментов или долго взаимодействует со средой. В итоге где-то простаивают вычислительные мощности, где-то копятся данные, а несколько длинных генераций могут задерживать весь следующий шаг обучения.

Поэтому в Яндексе пришли к гибридной схеме: генерацию и обучение балансируют по времени, а незаконченные траектории сохраняют и продолжают на следующем шаге. Система подстраивается под реальную нагрузку и не пытается один раз идеально поделить железо.

Я всё к тому, что агентный бум уже перестраивает нижние этажи ML-стека.

Пользователь видит чат с агентом. Мы с вами видим инструменты и харнесы. А ещё ниже команды пересобирают RL-инфраструктуру, потому что обучение моделей на таких задачах создаёт совсем другой профиль нагрузки — длинные и непредсказуемые генерации, внешние среды, tool calls и дорогой инференс прямо внутри training loop.

Мы сейчас, конечно, увлеченно крафтим свои харнесы. Но дальше гонка пойдёт ещё и за инфраструктуру, которая умеет эффективно обучать такие системы и не сжигать вычисления на ожидании.

Короче, снаружи агентная революция выглядит как удобный интерфейс. В машинном отделении у неё – инференс, очереди, буферы, длинные хвосты и очень дорогие GPU.

За этим слоем я теперь тоже буду внимательно следить.
  • 👏 16
  • ❤ 9
  • 🔥 4
More from @vladm
  1. Sep 27, 2026Математик МГУ: «Нейросети уже умнее меня» Полтора года назад Саша Вотяков скинул мне докла…
  2. Sep 26, 2026Подкаст уже на финальном рендере Один из любимейших и полезных разговоров за все время вед…
  3. Sep 25, 2026Кто контролирует работу AI-агента? Вчера вечером еду на дачу и за рулем, с телефона решил…
  4. Sep 24, 2026У бизнеса появился ещё один канал, в котором важно быть заметным — ответы нейросетей. Поль…
  5. Sep 23, 2026Дамы и господа, приглашаю на МИТАП В Москве 27 сентября в 13:00 у нас пройдет живой митап…
  6. Sep 22, 2026Самая мощная модель нужна далеко не каждому запросу Недавно писал про OpenClaw и то, сколь…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →