TGViewer
техно-свалка техно-свалка @techs_dump · 467 subscribers
Post #145 100

Forwarded from Trashchenkov

🧠 GigaChat 3.5 Reasoning
У GigaChat появилась первая модель с полноценным рассуждением — GigaChat 3.5 Reasoning.

Как её делали?
Сначала был SFT: модель обучили на готовых примерах решений, в том числе для агентных сценариев. Это сформировало стартовый набор способов решения для последующего RL.

Дальше из одного SFT-чекпоинта независимо обучили шесть специализированных моделей через online RL: математика и естественные науки, код, агент для кода, универсальный агент, диалог и следование инструкциям.

При online RL модель сама генерирует несколько решений задачи, получает награды за их качество и учится на собственных свежих попытках. Так постепенно закрепляются полезные стратегии: перепроверить результат, вернуться после ошибки, попробовать другой путь. В GigaChat для этого использовали CISPO — алгоритм из работы про MiniMax-M1.

Для каждого эксперта настроили свою схему награды: математические ответы сверяли с эталоном, код запускали, патчи проверяли тестами, в агентных сценариях смотрели на конечное состояние среды, а диалог оценивали через LLM-судью.

Агентов учили отдельно. Code Agent работал с реальными репозиториями через
mini-SWE-agent: читал файлы, запускал команды, правил код и смотрел на результат. General Agent учился вызывать инструменты, работать с памятью и поиском и проходить многошаговые диалоги.

После RL шесть специализированных моделей свели в одну через on-policy distillation: итоговая модель сама генерировала решение, а соответствующий эксперт давал ей обучающий сигнал на каждом токене.

По метрикам прирост заметный относительно GigaChat 3.5 Instant. Например:
SWE-bench Verified: 42,6 → 64,7;
Terminal-Bench 2: 13,48 → 30,3;
Natural Plan: 64 → 80,19.

На задачах AIME 2025/2026, HMMT и IMOAnswerBench новая модель в среднем использовала на 37% меньше токенов рассуждения, чем DeepSeek V4 Flash Preview.

📖 Подробная статья про обучение
⚖️ Веса на Hugging Face и GitVerse — лицензия MIT
🧪 Попробовать в вебе — режим «Рассуждение»
huggingface.co GRPO Trainer · Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • ❤‍🔥 6
  • ⚡ 5
  • 🏆 4
  • 👎 1
More from @techs_dump
  1. Sep 18, 2026В Google Colab теперь можно бесплатно тренировать более 500 моделей — энтузиасты выпустили…
  2. Sep 17, 2026Давно читаю канал Тани Савельевой, интересно пишет про вайб кодинг и предпринимательство.…
  3. Sep 17, 2026Вчера выступала на большой конфе в Парке Горького от Тинька по продуктам Конфа была топ Я…
  4. Sep 17, 2026Робот-рука взяла кирпичик LEGO: что под капотом Потестила захват предметов на AdeeptTank R…
  5. Sep 16, 2026Digit 5 научили работать рядом с людьми без защитной клетки Agility Robotics показала ново…
  6. Sep 15, 2026Роботы строят роботов»: массовое производство запущено 🤖🏭 В Китае произошёл тектонически…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →