TGViewer
ml phys ml phys @mlphys · 2.89K subscribers
Post #313 1.48K

Forwarded from Data Secrets

Интернет взрывает новая модель Reflection 70В: она выбивает на бенчмарках результаты, превосходящие Claude 3.5 Sonnet и GPT-4o

Название Reflection выбрано в честь метода Reflection-Tuning: это когда модель итеративно обучается на синтетических структурированных данных, чтобы научиться рассуждать и самокорректироваться. Плюсом добавлен отдельный этап планирования для улучшения CoT. В качестве инициализации брали Llama 3.1 70B.

На практике модель прямо в ответах оборачивает все рассуждения в тег <reasoning>, а возможные ошибки в тег <reflection>. Затем она обнаруженные ошибки исправляет, и итоговый ответ выдает в теге <output>.

Результаты на бенчмарках: 89,9% MMLU, 79,7% MATH, 90,1% IFEval, 99.2% GSM8K. Говорят, что тот самый синтетический датасет и техрепорт будет на следующей неделе. А еще на следующей неделе обещают Reflection на 405В 😨

Сама модель уже доступна на HuggingFace.
  • ❤ 9
  • 👍 1
More from @mlphys
  1. Sep 20, 2026Дайте астре почилить хотя бы в воскресенье
  2. Sep 16, 2026https://mimo.xiaomi.com/rl/ Риал тайм дашборд трейнинга новой модели сиаоми
  3. Sep 10, 2026Изи
  4. Sep 8, 2026Очередной benchmark забенчмаксили , причем всего с 14 до 28 процентов, почему все так хайп…
  5. Sep 3, 2026Agi is here?
  6. Sep 1, 2026Post #343
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →