Харнесс решает всё больше
Пару недель назад OpenAI выкатила GPT-6 Astra и пафосно объявила "эру AGI". Один из аргументов был такой: новая модель набирает 99,9% на ARC-AGI-3. Это, если что, специальный тест, где ИИшку закидывают в незнакомые мини-игры без инструкции (ни цели, ни правил, ни даже что каждая кнопка делает). И смотрят, как она будет методом ИИ-тыка разбираться и во всё это дело играть.
Авторы теста прогнали Astra и в стандартной обвязке, общей для разных провайдеров, и с Provider Adapter от OpenAI. При одинаковом максимальном уровне reasoning результат вырос с 62,7% до 98,6%. А на high - с 54,8% до 99,9%».
Откуда такая разница? Каждый ход в игре - это отдельный запрос к модели. В стандартной обвязке между ходами выживают только заметки, которые модель сама себе написала. Представьте себе шахматиста, которому после каждого хода отшибает память, и остаются только записи в блокноте. А обвязка от OpenAI позволяла сохранять между запросами скрытое состояние reasoning и использовать compaction длинного контекста - то есть гораздо лучше переносить уже проделанную работу между ходами. Если более научно, то такую обвязку называют harness (буквально "упряжка", как у лошади).
И вот моя любимая строчка из их таблицы: в харнессе модель с ВЫКЛЮЧЕННЫМ режимом рассуждений набрала 96,7%. То есть, вообще не думая, она на 30+ процентов обошла саму себя, думающую на максимум, но в стандартной "упряжке".
И ещё один пример поближе. Алиса AI на днях начала сама выбирать модель под запрос: на всякое простое отвечает быстрая модель, а на запрос вроде "Какие вычеты положены за лечение и курсы ребёнка" включается тяжёлый режим "Эксперт". Сейчас около 80% всех запросов обрабатывает собственная Alice AI LLM. Для режима “Эксперт” Яндекс тестирует разные модели - как свои, так и общедоступные с открытыми весами, которые запускаются на инфраструктуре Яндекса. А поверх них работает собственный харнесс Алисы.
Зачем всё это? CEO Алисы Валерий Стромов прямо сказал Forbes: как инженеру, ему важны качество и скорость, а как руководителю бизнеса - стоимость. Поэтому, гонять самую мощную модель на каждый чих - это как сажать партнёра McKinsey выравнивать иконки в презе. Там же приводят вот такую цифру: несколько десятков инженеров на оптимизации за полгода сэкономили Яндексу ~9 млрд рублей. Это эффект от толковой оптимизации инференса и вычислительной инфраструктуры.
В одном из прошлых постов про ИИ-модели я писал про MoE - это когда роутер внутри модели под каждое слово выбирает нужную подсеть-эксперта. Тут сейчас похожий принцип, только этажом выше. Роутер выбирает не "эксперта", а целую модель под запрос. Моделей всего 3-5 штук, потому что роутер работает примерно как регистратура в поликлинике, и отправить к терапевту или хирургу ему изи, а вот выбрать нужного из 20 узких спецов по жалобе "что-то бок болит" - уже нет.
Почему харнесс имеет настолько ключевое значение, когда все модели уже подтянулись на более-менее сопоставимый уровень умности - хорошо видно по бытовому запросу а-ля "подбери робот-пылесос дешевле 40 тысяч, чтобы убирал и ковры, и шерсть кота". Внутри модели ответа нет и быть не может, потому что цены и другие нюансы меняются каждую неделю. Значит, надо сходить в поиск, вытащить характеристики, сверить с отзывами и отсеять всё дороже лимита.
И вот это "нашёл → проверил → пошёл дальше" во многом определяется харнессом.
Так что, вопрос "какая ИИшка умнее?" на самом деле потихоньку устаревает, а вот тонкие настройки вокруг неё играют всё более важную роль.
Дизраптор
Post #3879
10K
- 👍 76
- ❤ 38
- 🔥 8
- 🤔 6
- 💯 4
- 🙊 4
- 🍾 1