TGViewer
Поляков считает: AI, код и кейсы Поляков считает: AI, код и кейсы @countwithsasha · 6.97K subscribers
Post #636 3.33K
Поляков считает: AI, код и кейсы GigaChat как сердце агента: подключить получилось, пользоваться нет На прошлой неделе я писал, что Алиса пока больше похожа на воркфлоу: сценарий есть, а нормальной работы с нечеткими задачами нет. Я уже тогда захотел чекнуть Гигачат, тормозил гемор с ротацией…
Барбершоп-тест: отечественным ИИ-моделям нужно следующее поколение. Жду

Вчера писал, что GigaChat плохо подходит как сердце агента. По пути c подачи @evilfreelancer я обнаружил, что лучше запускать Гигачат через LiteLLM с флагом supports_function_calling: true
С этим флагом вызов тулов становится адекватным, хотя бы на 1-2 шага. GigaChat Pro модель даже смогла найти филиал барбершопа.

После этого я прогнал тот же барбершоп-кейс на разных моделях в OpenClaw.
Агенту надо понять кривой запрос, найти нужный филиал, открыть запись, разобраться с мастерами и вытащить слоты. Обычно это заканчивается браузером, формой онлайн-записи YCLIENTS.

🧪 Что получилось

GigaChat-2-Pro и GigaChat-2-Max провалились именно на вызове инструментов.

В простых тестах, вроде «вызови web_search» функция вызывается. Но в реальном OpenClaw, где с самого старта около 60 000 символов системного промпта и 22 инструмента, модель начинает вести себя случайным образом.

GigaChat Max в чистом прогоне получил 22 инструмента и не вызвал вообще ни одного. И это при том, что за 5 минут до Pro модель наконец начала вызывать тулы. На уточняющие сообщения тоже отвечал текстом: «перехожу к выполнению», «использую навык», «среди доступных навыков нет подходящего». Но действий не было.

Особенно смешно, что Гигачат Pro на практике реально выглядит лучше чем Max. У Паши Злого скоро выйдет пост с бенчмарком PAC1 — это тест точности вызова инструментов. На его прогоне GigaChat-2-Pro набрал 37,2%, Max — 32,6%. Для сравнения: GLM, MiniMax, Kimi и Qwen держатся примерно в районе 72–74%.

🤖 А что другие модели

🚩 YandexGPT Pro оказалась самой бодрой из суверенных: агент сразу пошёл в инструменты и даже попробовал поискать в памяти. Это хороший знак. Но задачу всё равно не решил: нашёл адрес и часы работы филиала, а до мастера и слотов не дошёл. Плюс маленький контекст быстро привёл к схлопыванию истории, и продолжение сломалось. Тут главный минус — окно в 32 000 токенов.

✅ Kimi K2.6 задачу решила. Не идеально: понадобился пинок, было много лишних действий, но модель читала скилл, искала, ходила в браузер, дошла до YCLIENTS и вернула Михаила, цены и слоты.

✅ DeepSeek V4 Pro тоже решил после пинка. Первый проход упёрся в лимит 900 секунд, зато модель уже была в нужном месте. После пинка сразу выдала результат. По текущим ценам DeepSeek этот прогон стоил около 28 центов. В Гигачат такой же был бы 5 000 руб.

🚀 А теперь про суверенных агентов

Проблем у нас сейчас две:

1. Модели Сбербанка не хотят вызывать тулы на сложных кейсах. В условиях: вызови web_search всё красиво,
а в случае если: вот тебе 30 000 символов про семью Даши и Саши, вот тебе тулы включая генерацию картинок, найди барбершоп — всё ломается.

2. Модели Яндекса более активные, но дают преступно низкий размер контекстного окна. Да, можно постараться и контролировать контекст, но 32 тыс токенов по меркам 2026 года уже очень мало. Иной договор занимает больше токенов.

Пока остается только ждать выхода новых моделей. Надеюсь, что добавят Кими, мощности для запуска есть, модель открытая, надо только указать, что это Кими, а не Гигачат.

🤔 На мой взгляд, суверенный ИИ должен быть не вывеской, а инфраструктурой, на которой можно строить продукты. Круто не когда модель своя, а когда ты внедрил ИИ в сложный процесс.


Пока всё грустно. Суверенный ИИ стоит дорого, ощущение, что его даже не тестировали на чем-то сложнее get_weather и требует при этом корпоративного бюджета.

Поделитесь, вот если бы в России была доступна модель уровня Кими или Дипсик, за адекватные деньги — вы бы пробовали делать агентов на ней?

----

Поляков считает — AI, код и кейсы
  • 👍 27
  • 🔥 9
  • ❤ 2
  • 😢 1
More from @countwithsasha
  1. Oct 4, 2026Собрал статистику по банам Claude из комментариев в канале Пост с разбором телеметрии, кот…
  2. Oct 2, 2026Возвращаю рубрику сохраняемых постов: сразу большой обзор Так вышло, что рубрика с самыми…
  3. Oct 1, 2026Anthropic снова раздаёт баны: обсуждаем что делать Сегодня утром оживился чат моего канала…
  4. Sep 30, 2026А как вы проверяете свои знания в мире нейронок? Не смотря на то, что плотно сижу в ИИ-чат…
  5. Sep 30, 2026Вы только посмотрите, что сделал наш самый популярный участник чатов про ИИ собрал. Будете…
  6. Sep 29, 2026OpenAI Dev Day 2026 — что показали Так как ребята из OpenAI уже выложили все релиз ноты се…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →