Он впервые занял первое место в Vals Index - рейтинге, который оценивает модели на реальных профессиональных задачах, — с результатом 68,9%.
По количеству выполненных юридических задач он в 7 раз превосходит Claude Sonnet 5.5.
Terminal-Bench вырос с 19% до 57,6%.
22 теста, в 20 из них — топ-5.
Токенов использует всего четверть от конкурента, а времени тратит вдвое меньше.
Меньше думает, больше делает.
Вывод до 1 млн токенов.
Сам исследователь Google DeepMind лично признал:
«RSI уже здесь! Наша модель официально переросла меня. Мне больше нечему её учить. Пора идти за мечтой и становиться бариста :) ☕️»
Пока выдают исследователям по кибербезу, остальным раскатят позже.


