Вчера писал, что GigaChat плохо подходит как сердце агента. По пути c подачи @evilfreelancer я обнаружил, что лучше запускать Гигачат через LiteLLM с флагом
supports_function_calling: trueС этим флагом вызов тулов становится адекватным, хотя бы на 1-2 шага. GigaChat Pro модель даже смогла найти филиал барбершопа.
После этого я прогнал тот же барбершоп-кейс на разных моделях в OpenClaw.
Агенту надо понять кривой запрос, найти нужный филиал, открыть запись, разобраться с мастерами и вытащить слоты. Обычно это заканчивается браузером, формой онлайн-записи YCLIENTS.
🧪 Что получилось
GigaChat-2-Pro и GigaChat-2-Max провалились именно на вызове инструментов.В простых тестах, вроде «вызови
web_search» функция вызывается. Но в реальном OpenClaw, где с самого старта около 60 000 символов системного промпта и 22 инструмента, модель начинает вести себя случайным образом.GigaChat Max в чистом прогоне получил 22 инструмента и не вызвал вообще ни одного. И это при том, что за 5 минут до Pro модель наконец начала вызывать тулы. На уточняющие сообщения тоже отвечал текстом: «перехожу к выполнению», «использую навык», «среди доступных навыков нет подходящего». Но действий не было.
Особенно смешно, что Гигачат Pro на практике реально выглядит лучше чем Max. У Паши Злого скоро выйдет пост с бенчмарком PAC1 — это тест точности вызова инструментов. На его прогоне GigaChat-2-Pro набрал 37,2%, Max — 32,6%. Для сравнения: GLM, MiniMax, Kimi и Qwen держатся примерно в районе 72–74%.
🤖 А что другие модели
🚩 YandexGPT Pro оказалась самой бодрой из суверенных: агент сразу пошёл в инструменты и даже попробовал поискать в памяти. Это хороший знак. Но задачу всё равно не решил: нашёл адрес и часы работы филиала, а до мастера и слотов не дошёл. Плюс маленький контекст быстро привёл к схлопыванию истории, и продолжение сломалось. Тут главный минус — окно в 32 000 токенов.
✅ Kimi K2.6 задачу решила. Не идеально: понадобился пинок, было много лишних действий, но модель читала скилл, искала, ходила в браузер, дошла до YCLIENTS и вернула Михаила, цены и слоты.
✅ DeepSeek V4 Pro тоже решил после пинка. Первый проход упёрся в лимит 900 секунд, зато модель уже была в нужном месте. После пинка сразу выдала результат. По текущим ценам DeepSeek этот прогон стоил около 28 центов. В Гигачат такой же был бы 5 000 руб.
🚀 А теперь про суверенных агентов
Проблем у нас сейчас две:
1. Модели Сбербанка не хотят вызывать тулы на сложных кейсах. В условиях: вызови
web_search всё красиво, а в случае если: вот тебе 30 000 символов про семью Даши и Саши, вот тебе тулы включая генерацию картинок, найди барбершоп — всё ломается.
2. Модели Яндекса более активные, но дают преступно низкий размер контекстного окна. Да, можно постараться и контролировать контекст, но 32 тыс токенов по меркам 2026 года уже очень мало. Иной договор занимает больше токенов.
Пока остается только ждать выхода новых моделей. Надеюсь, что добавят Кими, мощности для запуска есть, модель открытая, надо только указать, что это Кими, а не Гигачат.
🤔 На мой взгляд, суверенный ИИ должен быть не вывеской, а инфраструктурой, на которой можно строить продукты. Круто не когда модель своя, а когда ты внедрил ИИ в сложный процесс.
Пока всё грустно. Суверенный ИИ стоит дорого, ощущение, что его даже не тестировали на чем-то сложнее
get_weather и требует при этом корпоративного бюджета.Поделитесь, вот если бы в России была доступна модель уровня Кими или Дипсик, за адекватные деньги — вы бы пробовали делать агентов на ней?
----
Поляков считает — AI, код и кейсы
