TGViewer
DEKSDEN notes DEKSDEN notes @deksden_notes · 3.09K subscribers
Post #828 1.29K
⚪️ Бенчмаксинг или плохие бенчмарки?

Тут чел хейтит минимаксов за плохую модель и за бенчмаксинг, при этом основывает свое мнение на другом бенчмарке (deepSWE), где у минимаксов все плохо.

▶️ Помимо очевидной странной логики критиковать бенчмаксинг на данных другого бенчмарка, странно смотреть просто на цифры, и не говорить сути.

▶️ Хороший повод сказать про бенчмарки. По мне - ориентация на бенчмарки возможна только в том случае, если ты достаточно ясно понимаешь ЧТО и КАК измеряет бенчмарк

Иначе мы приходим к ситуации "Петька, приборы! Восемь! Что - восемь? А что - приборы?"

Если такого понимания нету, то цифры любого бенчмарка будут для вас "попугаями" разной степени условности. Конечно, удав в попугаях - длиннее!

▶️ А если про эту конкретную метрику - то deepSWE достаточно нашумевший бенчмарк. Заявляется что измеряет агентность и длительность работы. Использует свою упряжку.

▶️ Суть бенчмарка в том, что по мотивам известных open source репо агенту даются некие "большие" задачи чтобы посмотреть работу модели на задачах уровня репозитория, посмотреть как будет изучен репо и как будет сделана работа.

В бенче агенту выдается репо, дается задача, отключен интернет, модель работает в некоем harness с неким промптом от этой упряжки.

Дальше агент работает, что то делает.

Далее работает верификатор - смотрит все ли сделано, тесты, поведение.

▶️ Что меня смущает:
• бенчмарк измеряет в своей упряжке - очевидно что модели тренированы на разыне упряжки
• упряжка в бенче весьма убога
• даем задачи уровня полного ai SDLC, при этом флоу которым мы это обеспечиваем почти отсутсвует
• фактически мы измеряем насколько модель может скомпенсировать убогую упряжку и убогое флоу за счет собственных подходов к работе
• мутно описаны критерии приемки, а мы знаем что если нету цикла обратной связи - модели оч тяжело всделать все норм; впрочем, это тоже претензия к флоу

▶️ На мой взгляд, этот бенч - это параолимпиада для моделей, где проверяется как они ползают с отрезанными руками/ногами и слегка выколотыми глазами.

Ну - получается что морально волевые качества измеряем.

Как это соотносится с реальной отдачей модели от работы - отдельный вопрос!

(ц) простите, накипело!)

@deksden_notes
  • 🔥 10
  • 😁 5
  • 👍 4
  • ❤ 3
  • 💯 2
More from @deksden_notes
  1. Oct 1, 2026Anthropic снова раздаёт баны: обсуждаем что делать Сегодня утром оживился чат моего канала…
  2. Sep 30, 2026⚪️ DeepSeek Harness for Desktop официально представили Вот и анонс: 🔗 Почитать: https://x…
  3. Sep 30, 2026⚪️ Gemini Gemini Gemini Gemini Гугол разродился анонсом Gemini 4 argon. Неожиданно, да?) �…
  4. Sep 30, 2026Уже влезли в долги, чтобы наскрести на подписку ChatGPT за 500$? Пока убеждаете друзей зан…
  5. Sep 30, 2026⚪️ DevDay 2026 - впечатления Наверное, надо написать мои впечатления по итогам заглавной п…
  6. Sep 29, 2026⚪️ Codex Reset (Banked) Кто не заметил на презентации DevDay или не смотрел - напомню, что…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →