TGViewer
Человек 2.0 Человек 2.0 @human20 · 1.38K subscribers
Post #293 414
Human20
Reinforcement Learning

В машинном обучении есть понятие Reinforcement Learning: модель делает действие, получает обратную связь от среды и постепенно учится выбирать лучше. Обучение с подкреплением.

С агентами в работе происходит очень похожая штука. Среда здесь — твоя реальная жизнь.

У меня есть агент Scout на основе GoClaw. Он должен каждый день находить интересные проекты, репозитории, инструменты, свежие агентные штуки.

Но на практике он начал приносить слабую выдачу: старые новости про Karpathy, переходы основателя OpenClaw в OpenAI, громкие твиты без практической пользы. Формально всё про ИИ. По факту — не то.

Параллельно я сам веду канал Human20. Читаю X, GitHub, блоги, вытаскиваю проекты, которые мне правда интересны: agent frameworks, MCP, open-source инструменты, coding agents, financial agents, memory systems, video agents. Всё, что вы тут видите последний месяц.

Я не стал говорить агенту «Скаут плохой, сделай лучше». Я дал ему мой собственный результат месячной работы.

Он прочитал канал за последние недели, вытащил проекты, понял, какие находки я руками выбираю, нашёл людей в X, которые писали про эти проекты рано, и добавил 42 новых Twitter-аккаунта в карту источников Scout.

То есть агент не получил абстрактную инструкцию «ищи полезное».

Поведенческий пример был конкретным: что я сам считаю полезным, какие проекты выбираю, какие источники заметили их раньше остальных, кого теперь надо мониторить.

После этого мы ещё подкрутили фильтры: career news вниз, stale tweets вниз, repo/project/tool signals вверх.

Не магия. Не «один промпт всё сделал». Не «сейчас обучим модель».

Рабочая схема выглядит так: человек делает работу сам, агент наблюдает результат, человек отмечает, что было ценно. Потом агент превращает это в правило, скилл, источник, фильтр или автоматизацию, и следующая итерация начинается с более умной системы. На которую ты снова даёшь фидбэк.

Процесс не бесконечный, первые фидбеки самые ценные, дальше агент, как правило, хорошо работает сам.

Так постепенно агент перестаёт быть чатиком и становится продолжением твоего операционного опыта.

Ты не просто даёшь ему задачи. Ты обучаешь его на том, как сам принимаешь решения.

🧩📣🔥💡🪄

Больше разборов: @human20
Среда: human20.app
  • 💯 3
  • ❤ 1
More from @human20
  1. Oct 2, 2026Gemini 4 Argon: миллион токенов на ответ по стартовой цене Sol Google представила Gemini 4…
  2. Oct 2, 2026POV: вайбкодер, который не даёт полный доступ codex и апрувит каждый запрос агента вручную
  3. Oct 1, 2026DLSS — теперь для фото и видео из своей папки Обычно за DLSS идёшь в настройки игры. В Vis…
  4. Sep 30, 2026«Гермес, ну продолжай» Странная работа — напоминать ИИ-агенту, чтобы он работал. Поручаешь…
  5. Sep 30, 2026​🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨�…
  6. Sep 30, 2026OpenAI сделала нам рабочую лошадку Ещё один релиз OpenAI — и первая реакция: что они там о…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →