Ты думал я забросил?
Давно не слышались, народ. Сейчас полный lock-in на стартапе, всё время течёт туда :) Решил, чтобы вы не скучали, устроить небольшой апдейт по тому, какие дела веду и что интересного узнал
Всё в этом спиче будет крутиться вокруг облачных агентов (OpenClaw, Hermes) и AI-native движа
Честно, я никогда не признавал 24/7 ИИ дебильчиков как что-то достойное. Личный ассистент - да, но бизнес, работа - куда им. Мне, в целом, по жизни достаточно сложно что-то делегировать даже людям, а тут нужно отдать рабочую задачу какому-то крипу
Но мини гейм-чейндж произошёл после просмотра этого видоса - там парень, который занимается разработкой ИИ-агентов в Яндексе, рассказывал про создание ИИ-центричной компании. Кратко суть выступления:
1. Берём эксперта, шарящего в процессе, который ты хочешь делегировать ИИ
2. Садим его перед Claude Code, включаем голосовой ввод и он начинает описывать свой процесс от корки до корки
3. Агент пытается выполнить задачу. Эксперт в течение N времени переписки корректирует действия ИИ-агента, после чего даёт команду: "/skill-creator создай на основе этой переписки скилл" или что-то подобное
4. И важнейшая часть: нам нужно отточить скилл до состояния, когда он будет давать предсказуемый результат - для этого мы создаём автоматические ЭВАЛЫ.
Evals в скиллах - это .json файл в директории вашего скилла, в котором лежат примеры промптов, которые обычно задаются с этим скиллом, и эталонные ответы на эти промпты.
По эвалам агент сам себя перепроверяет при использовании скилла
5. Как только навык отшлифован и стабильно работает в 19 из 20 случаев, скилл переносится на ИИ-агента, работающего в облаке и ставится на постоянное выполнение по триггерам (например вебхукам) или крону
В целом, спикер не совершил открытие, вроде бы это решение всегда лежало на поверхности, но как-то именно этот видос привёл меня в точку X, где я немного поменял своё отношения к OpenClaw и Hermes.
Из этой идеи главное, что хочется выделить, это работу с эвалами и перенос знаний компании не в какую-то LLM Wiki, RAG и т.п., а именно в skills.
Да, база знаний о вас, вашем продукте и т.п. - это безусловно важно и, перенося знания в скиллзы для агента, получится в большей степени процедурная память, нежели декларативная (декларативная - "Это А, а это Б", процедурная - "Как из А сделать Б"), НО важно чаще задумываться о том, чтобы переносить части вашей базы знаний именно в скиллы, а не хранить в вашей LLM Wiki пачки каких-то скачанных курсов или статей, например.
Всё это добро вдохновило меня установить себе Hermes на VPS и написать подробный гайд на его настройку в свой закрытый канал.
Пока что руки не дошли что-то серьёзное делегировать своему гермесу, тк чтобы добиться результата "навык стабильно работает в 19 из 20 случаев" нужна очень серьёзная и глубокая работа
Но что интересно, Hermes, как мы все знаем, обладает волшебным self-improving loop, благодаря которому агент сам менеджирит свои навыки. Я разобрал архитектуру этого процесса, и он по дефолту не работает с эвалами. А код самого Hermes agent и в т.ч. его self-improving loop открытые
Поэтому я вижу здесь большую возможность во внедрении skills evals в цикл самоулучшения Hermes'a с целью ускорения кропотливой работы над шлифовкой скиллов для агентов
Так что этим постом задаю вам тренд на то, в какую область стоит погрузиться вместе со своим ИИ-агентом в ближайшее время!🤓
Ещё, решил устроить себе небольшой челлендж: до конца июня постараюсь выкладывать посты минимум через день :)
А на этом всё, друзья!
Накидайте "🔥" СРОЧНА если хотите гайдыч по Hermes и продвинутому созданию скиллов, да и в целом если просто ждёте моего камбека в медийку)
Post #49
941

- 🔥 37
- ❤ 2