TGViewer
ТрансформаторX ТрансформаторX @transformerxx · 2.66K subscribers
Post #2078 823
Харнесс решает всё больше

Пару недель назад OpenAI выкатила GPT-6 Astra и пафосно объявила "эру AGI". Один из аргументов был такой: новая модель набирает 99,9% на ARC-AGI-3. Это, если что, специальный тест, где ИИшку закидывают в незнакомые мини-игры без инструкции (ни цели, ни правил, ни даже что каждая кнопка делает). И смотрят, как она будет методом ИИ-тыка разбираться и во всё это дело играть.

Авторы теста прогнали Astra и в стандартной обвязке, общей для разных провайдеров, и с Provider Adapter от OpenAI. При одинаковом максимальном уровне reasoning результат вырос с 62,7% до 98,6%. А на high - с 54,8% до 99,9%». 

Откуда такая разница? Каждый ход в игре - это отдельный запрос к модели. В стандартной обвязке между ходами выживают только заметки, которые модель сама себе написала. Представьте себе шахматиста, которому после каждого хода отшибает память, и остаются только записи в блокноте. А обвязка от OpenAI позволяла сохранять между запросами скрытое состояние reasoning и использовать compaction длинного контекста - то есть гораздо лучше переносить уже проделанную работу между ходами. Если более научно, то такую обвязку называют harness (буквально "упряжка", как у лошади).

И вот моя любимая строчка из их таблицы: в харнессе модель с ВЫКЛЮЧЕННЫМ режимом рассуждений набрала 96,7%. То есть, вообще не думая, она на 30+ процентов обошла саму себя, думающую на максимум, но в стандартной "упряжке".

И ещё один пример поближе. Алиса AI на днях начала сама выбирать модель под запрос: на всякое простое отвечает быстрая модель, а на запрос вроде "Какие вычеты положены за лечение и курсы ребёнка" включается тяжёлый режим "Эксперт". Сейчас около 80% всех запросов обрабатывает собственная Alice AI LLM. Для режима “Эксперт” Яндекс тестирует разные модели - как свои, так и общедоступные с открытыми весами, которые запускаются на инфраструктуре Яндекса. А поверх них работает собственный харнесс Алисы. 

Зачем всё это? CEO Алисы Валерий Стромов прямо сказал Forbes: как инженеру, ему важны качество и скорость, а как руководителю бизнеса - стоимость. Поэтому, гонять самую мощную модель на каждый чих - это как сажать партнёра McKinsey выравнивать иконки в презе. Там же приводят вот такую цифру: несколько десятков инженеров на оптимизации за полгода сэкономили Яндексу ~9 млрд рублей. Это эффект от толковой оптимизации инференса и вычислительной инфраструктуры. 

В одном из прошлых постов про ИИ-модели я писал про MoE - это когда роутер внутри модели под каждое слово выбирает нужную подсеть-эксперта. Тут сейчас похожий принцип, только этажом выше. Роутер выбирает не "эксперта", а целую модель под запрос. Моделей всего 3-5 штук, потому что роутер работает примерно как регистратура в поликлинике, и отправить к терапевту или хирургу ему изи, а вот выбрать нужного из 20 узких спецов по жалобе "что-то бок болит" - уже нет.

Почему харнесс имеет настолько ключевое значение, когда все модели уже подтянулись на более-менее сопоставимый уровень умности - хорошо видно по бытовому запросу а-ля "подбери робот-пылесос дешевле 40 тысяч, чтобы убирал и ковры, и шерсть кота". Внутри модели ответа нет и быть не может, потому что цены и другие нюансы меняются каждую неделю. Значит, надо сходить в поиск, вытащить характеристики, сверить с отзывами и отсеять всё дороже лимита.

И вот это "нашёл → проверил → пошёл дальше" во многом определяется харнессом.

Так что, вопрос "какая ИИшка умнее?" на самом деле потихоньку устаревает, а вот тонкие настройки вокруг неё играют всё более важную роль.
  • 🤯 18
  • 👍 10
  • 🔥 4
  • 💯 4
  • 🤓 2
  • 👎 1
More from @transformerxx
  1. Sep 21, 2026Налоговая увидела новость про муху:
  2. Sep 21, 2026Post #2093
  3. Sep 21, 2026▫️ Как оперативно реагировать на изменения в экономике и бизнесе? В мире, где каждое решен…
  4. Sep 21, 2026Если новость выходит слишком быстро - это не человек Помните взлом Hugging Face роем ИИ-аг…
  5. Sep 21, 2026Post #2090
  6. Sep 20, 2026Если вы считаете, что вами никто не манипулирует — значит, вы уже в руках профессионалов �…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →