TGViewer
Channel Public Channel
Вася Сизов | grok ML

Вася Сизов | grok ML

@grok_ml

Lead DS нескольких команд. Здесь авторские заметки об ML, работе лидом и факапах, которые тоже случаются
Subscribers
62
Photos
62
Videos
1
Links
15
Recent Posts 6 shown
Post #85 33
В предыдущем посте были пять паттернов workflow. Общее у них одно: путь по шагам задан кодом, который вы написали заранее. Теперь про агента, где это не так.

Агент — это цикл с обратной связью. Человек ставит задачу, дальше модель планирует и работает сама: делает шаг, получает ответ от среды и по нему решает, что делать дальше. Средой может быть что угодно, что умеет отвечать: тесты, компилятор, результат поиска.

Отсюда главное условие. Если такой обратной связи нет, агент не понимает, что ошибся, и уверенно идет дальше. Тогда это не автономия, а неуправляемый процесс.

#agent
  • ❤ 2
  • 👍 2
Post #76 32
В прошлом посте была шкала из шести уровней автономии. У неё есть слабое место: граница между агентом и не агентом получается размытой. Она проходит где-то между роутером и стейт-машиной, и каждый проводит её по-своему.

Anthropic в статье «Building effective agents» предлагает деление попроще — на workflow и агентов. Workflow: шаги LLM и инструментов оркестрируются заранее написанным кодом. Агент: модель сама ведёт процесс и решает, какие инструменты вызывать.

В работе я пользуюсь именно этой классификацией. Её проще и быстрее объяснить!

Листайте карточки — там разобран каждый паттерн workflow с примерами. Про агента будет в следующем посте.

#agent
  • ❤ 3
  • 🔥 2
Post #75 82
Что вообще такое «агент»

Агентом сейчас называют что угодно: чат-бота, скрипт с одним промптом, обёртку над API. Спорить о терминах бессмысленно, но есть вопрос, который сразу расставляет всё по местам: сколько решений вы отдали модели, а сколько оставили за кодом.

Harrison Chase из LangChain называет это когнитивной архитектурой — как ваша система думает. То есть поток кода, промптов и вызовов LLM, который превращает запрос пользователя в ответ или действие.

Внутри любой такой системы кто-то принимает три решения:

• что выдать на конкретном шаге
• какой шаг делать следующим
• какие шаги вообще доступны

Дальше всё просто. Считаем, сколько из трёх решений принимает LLM, — и получаем шесть уровней автономии:

1. Код. LLM нет вообще, все решения зашиты.
2. Один вызов LLM. Модель решает только, что выдать. Один шаг.
3. Цепочка. Вызовов несколько, но их порядок задан кодом.
4. Роутер. Модель сама выбирает, какой шаг делать следующим. Циклов нет: каждый шаг проходится максимум один раз.
5. Стейт-машина. То же плюс циклы. Число вызовов заранее неизвестно, но набор доступных шагов всё ещё ограничен кодом.
6. Автономный агент. Модель сама определяет, какие шаги ей доступны: меняет промпты, инструменты, иногда код.

Граница проходит между 4 и 5. До неё поток ведёт человек, после — система сама, потому что появляются циклы, и вы больше не знаете, сколько шагов она сделает.

Отсюда главное: агентность — не флажок, а ползунок. Чем выше уровень, тем меньше предсказуемости, тем дороже отладка и эксплуатация. Ни один уровень не лучше другого — они под разные задачи. И архитектуру стоит перебирать так же спокойно, как вы перебираете промпты.

#agent
  • 🔥 8
  • ❤ 3
Post #74 204
slides.pdf1.2 MB
Сегодня на урбан ml рассказывал о продолжении нашего проекта с агентским рагом.

Мы проверили до этого много гипотез: тестировали десятки вариантов классической архитектуры, пробовали graph rag с temporal (временной) частью, пропускали целые документы через llm, делали свой workflow.

Но индустрия не стоит на месте, развиваются как сами модели, так и их обертки. Сейчас мы считаем агентский раг и гибким, и более перспективным. А с появлением Deep Agents все становится еще проще.

Доклад получился очень интересным и насыщенным, 45 слайдов, десятки вопросов и пару часов обсуждений после!

Код положил сюда, презентация во вложении. До скорых встреч на конференциях и митапах!
  • 👍 9
  • 🔥 8
  • ❤ 7
Post #73 151
Масштаб претрейна LLM

В эру развития больших языковых моделей я часто слышу, как люди говорят: "сделал свою llm для медицины" или "собрал своего агента". Но на самом деле, конечно, никто не обучал свою LLM. Да и большая вероятность, что агента тоже нет (но об этом не здесь).

Сама llm обучается в несколько этапов. Сконцентрируемся на самом первом и самом дорогом - pretrain. В данном случае модель учится предсказывать каждый следующий токен по всем предыдущим.

Для такой задачи размеченные данные не нужны. Просто подаем в модель очень много текстовой информации.
Посмотрим на три популярных технических отчета (T - это триллионы):

DeepSeek-V3 — 14.8T токенов
Kimi K2 — 15.5T токенов
Qwen3 — 36T токенов

Например, в книге "Война и мир" примерно 0.75M токенов, а во всей английской википедии 7B токенов. То есть в данных для обучения Qwen3 48 миллионов книг "Война и мир" и примерно 5100 Википедий.

Нам повезло, отчет DeepSeek-V3 довольно подробный, в нем приведена оценка железа. Учили модель менее 2 месяцев на 2048 H800. В деньгах - примерно 5,6 миллионов долларов — но это стоимость лишь одного успешного прогона, без учёта исследований, неудачных запусков и самого кластера.

Большинство компаний не учат модели с нуля, а файнтюнят. Об этом в следующих постах.

#llm
  • 👍 5
  • ❤ 1
Post #65 128
Оценка железа под LLM

(часть 4 серии про оценку ML-задач в банке)

В предыдущем посте мы разобрали как можно оценить количество подов. Но ошибиться в их количестве не так страшно по сравнению с количеством GPU, которые стоят в десятки раз дороже.

Листайте карточки, в них я показываю, на что нужно обращать внимание.

#процессы
  • 👍 4
  • ❤ 1
Older posts →

About this channel

How can I read @grok_ml without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Вася Сизов | grok ML: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Вася Сизов | grok ML have?
Вася Сизов | grok ML (@grok_ml) has 62 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Вася Сизов | grok ML know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →