Воркшоп закончился уже неделю назад (хотя его по-прежнему можно посмотреть в записи), а вот время на канал появляется только сейчас.
И начну, пожалуй, продолжением темы, которую мы затронули вскользь на воркшопе - харнесса.
HARNESS (очень грубо на русский это можно перевести как "обвязка") - это всё, что окружает модель: инструменты, плагины, скиллы, память, интерфейс. Всё, что определяет, что модель видит и что умеет делать.
Если уж очень сильно упрощать и представлять модель в виде автомобильного двигателя, то харнесс - это весь остальной автомобиль.
Все вокруг сейчас меряются моделями, каждая новость - про то, что у кого-то вышла новая версия, обогнала остальных в бенчмарках. Я, конечно, сам слежу за этим с не меньшим азартом, но одна вещь в этих сравнениях постоянно упускается: результат, который показывают бенчмарки, принято приписывать одной модели, но всё, что делается в реальных задачах, модель выполняет совсем не единолично.
Как раз пару недель назад DeepSeek выложили свой харнесс в открытый доступ и заодно показали, сколько результата на самом деле живёт в обвязке.
Рекордные 87.9% для модели были получены внутри родной, настроенной специально под неё среды.
Но стоило независимым тестерам запустить эту же модель в другой среде, на которой принято проводить подобные бенчмарки - куда-то испарилась целая треть ее мощи.
А в свежем исследовании с вполне говорящим названием «Хватит сравнивать агентов, не раскрывая харнесс» вообще пришли к выводу, что смена обвязки вносит в качество ответов даже больше, чем смена самой модели.
Так что в следующий раз, ругаясь на глупую LLM, которая не может сделать то, что вы просите, стоит подумать - может быть, дело совсем не в ней?)
Post #102
228