Агент украл моё время и деньги. Часть 1.
Думаю, все уже слышали про OpenClaw агента (из каждого утюга про него кричали), а я только неделю назад скачал его к себе на VPS, и вот мои мысли на счёт этого.
Пройдусь по плюсам (их мало). Архитектура агента позволяет пользователю одной текстовой командой делать вообще ВСЁ! Надо скачать скилл? Пришли боту ссылку, и он сам это сделает (причём ему виднее, куда установить). Надо изменить скилл и заодно поднять БД на сервере? Не проблема, он сам всё сделает. Тебе даже не нужно лезть на сервер и что-то делать руками.
На этом все плюсы для простого обывателя закончились. В чём же проблема агента?
Вы вообще видели, сколько там всего?
Да вы никогда в жизни не будете использовать 90 процентов из всего этого.
По умолчанию, с базовыми настройками, этот агент будет менять параллельно, как фоновый процесс, большинство этих файлов, раздувая контекст даже на новой сессии до неприличного размера, и вы даже ничего не узнаете об этом, а токены уже потратились.
Вот, например, есть небольшая задача для агента, и для её исполнения он засовывает в контекст тонну ненужных файлов, лишь бы ответ для пользователя выглядел красивым и персонализированным, с зелёными галочками и ракетками (фу так делать).
А вы готовы донатить кучу бабла на контекст? Ведь при неправильном использовании один небольшой запрос может обойтись вам в 0,20+ USD на небольшой модели Haiku от антропика. Про Sonnet и Opus я вообще молчу.
Вы можете сказать: «возьми и настрой так, чтобы ограничить его». Это просто на словах, а на практике вы устанете выдавать ему права для каждой новой задачи, и ваши ограничения сильно порежут функционал агенту, из-за которых он перестанет быть таким таргетированным и всемогущим, как из коробки. Спрашивается, для кого же тогда такая мощь? Наверное, для дядечек с кэшем из солнечной Калифорнии.
А наше дело - абуз, и я пытался это заабузить, повесив кучу ограничений и использовав OpenRouter для бесплатных моделей. Вот только тут меня ждало следующее разочарование. Дело в том, что скилл, написанный под одну из моделей, плохо или вообще не работает с другими моделями (и тут дело не в цене!).
Дело в недетерминированности системы и в вероятностных отклонениях в ответах/рассуждениях моделей (свойство всех LLM и ML решений). Ты не можешь гарантировать, что в процессе выполнения скилла модели вдруг не захочется сделать что-то иначе.
Напоминаю! Скилл (SKILL.md) - всего лишь файл с указаниями, которые пытаются казаться жёсткими законами для LLM, изображая попытку сфокусировать рассуждения модели по сценарию, но вероятности и контекстные окна мешают ей решать задачу на столько же эффективно, как чистый код.
ТГ не позволяет в рамках одного поста развить мою мысль дальше, поэтому ждите следующий.
⚪️ Beus Research
🔢 [ мейн ] • [ дейлик ] • [ чатик ]
Post #300
426

- ❤ 11
- 🔥 3