TGViewer
Trashchenkov Trashchenkov @gigatrash · 769 subscribers
Post #246 701
🧠 GigaChat 3.5 Reasoning
У GigaChat появилась первая модель с полноценным рассуждением — GigaChat 3.5 Reasoning.

Как её делали?
Сначала был SFT: модель обучили на готовых примерах решений, в том числе для агентных сценариев. Это сформировало стартовый набор способов решения для последующего RL.

Дальше из одного SFT-чекпоинта независимо обучили шесть специализированных моделей через online RL: математика и естественные науки, код, агент для кода, универсальный агент, диалог и следование инструкциям.

При online RL модель сама генерирует несколько решений задачи, получает награды за их качество и учится на собственных свежих попытках. Так постепенно закрепляются полезные стратегии: перепроверить результат, вернуться после ошибки, попробовать другой путь. В GigaChat для этого использовали CISPO — алгоритм из работы про MiniMax-M1.

Для каждого эксперта настроили свою схему награды: математические ответы сверяли с эталоном, код запускали, патчи проверяли тестами, в агентных сценариях смотрели на конечное состояние среды, а диалог оценивали через LLM-судью.

Агентов учили отдельно. Code Agent работал с реальными репозиториями через
mini-SWE-agent: читал файлы, запускал команды, правил код и смотрел на результат. General Agent учился вызывать инструменты, работать с памятью и поиском и проходить многошаговые диалоги.

После RL шесть специализированных моделей свели в одну через on-policy distillation: итоговая модель сама генерировала решение, а соответствующий эксперт давал ей обучающий сигнал на каждом токене.

По метрикам прирост заметный относительно GigaChat 3.5 Instant. Например:
— SWE-bench Verified: 42,6 → 64,7;
— Terminal-Bench 2: 13,48 → 30,3;
— Natural Plan: 64 → 80,19.

На задачах AIME 2025/2026, HMMT и IMOAnswerBench новая модель в среднем использовала на 37% меньше токенов рассуждения, чем DeepSeek V4 Flash Preview.

📖 Подробная статья про обучение
⚖️ Веса на Hugging Face и GitVerse — лицензия MIT
🧪 Попробовать в вебе — режим «Рассуждение»
huggingface.co GRPO Trainer · Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 🔥 14
  • 👍 6
  • 👏 3
  • 😁 3
  • 👾 1
More from @gigatrash
  1. Oct 5, 2026🎬 Эксперимент: шортсы про ИИ, которые делает агент Последние пару месяцев я веду эксперим…
  2. Sep 23, 2026⚡ Jev — модель для быстрых решений В последние дни разработчики активно обсуждают Jev от T…
  3. Sep 22, 2026сам сделяль😂 Агенты - это новый пролетариат😆
  4. Sep 7, 2026🔗 LangChain перешёл на новый MCP Еще в конце июля вышла спецификация MCP 2026-07-28, в ко…
  5. Sep 1, 2026🪄 Оркестр магических тварей: приручаем ИИ-агента Модель мы уже выбрали. Но сама по себе я…
  6. Aug 28, 2026🔗 LangChain продолжают тему автоматизации разработки эвалов В июле я уже писал про их ски…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →