TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.01K subscribers
Post #818 268

Forwarded from max.sh

Небольшой анекдот-история, чтобы задать правильный ритм на неделю.

Наблюдал я как-то следующую ситуацию. Была у компании умная модель. И ее через кастомизированные харнессы (system prompts + тулы + конеткст) адаптировали к разным прикладным доменам.

Одна из задач была помочь оптмизировать работу фиансовых консультантов. Техническая команда быстро собрала агентскую обвязку и добавила разных профильных тулов. Среди прочих были и более классические: bash с файловой системой и web_search

Чтобы померить качество своего агента, команда взяля набор открытых публичных бенчмарков, которые пересекались с реальными приложениями хотя бы на уровне инструментов.

Сделали прогоны. На каждый бенчмарк по 5 попыток решить задачу - все честно и с стат значимостью. Бэйзлайны других агентов/моделей гонять не стали – взяли открытые цифры. Получалась SOTA! На каждом бенчмарке! Где-то 15%, где-то и все 30%. Кто следит за лабами, тот знает всю эту кухню бенчмаксинга.

Большие цифры никогоа не смущали. Был проделан быстрый human expert анализ траекторий агентов на небольшом подмножестве сэмплов из каждого бенчмарка. Все клеилось. Агент просто хорош.

Стали готовить презентации, рисовать те самые заветные bar charts, показывая в каком далеком космосе новый агент.

Но все-таки бывалых инженеров что-то засмущало. Проделали еще один инженерный анализ. Выяснилось, что один из инструментов, web_search, так мощно работал, что когда агент решал его использовать, то в выдаче регулярно оказывались ссылки на...исходники бенчмарков! либо на гитхаб репозиторий, либо на hugging face, либо куда-то еще. Бенчи то опенсоурсные и все ответы лежат в открытом доступе!

Обнаружить такое было и правда не тривиально (без некоторых проверок на уровне эвала), потому что модель по-умному читерила. Скачивала бенч, а потом якобы проверяла корректность решения используя все валидные инструменты. То есть траектории были достаточно реалистичны.

Презентации свернули. Продакты краснели от негодования. Молодые рисерчеры краснели еще сильнее. Бывалые соколы оправдывали свое призвание бывалых.

Баги устранили, определенные веб домены были добавлены в исключения, агенту в системном пропмтпе запретели лазить по некоторым сайтам, а в рубрики валидаторов добавили проверку на рассуждения. Эксперимент был перезапущен.

Цифры стали скромнее. SOTA испарилась. Но на некоторых бенчах результаты все равно радовали глаз.

Проверйте результаты, вставляйте все возможные проверки, чтобы отловить читерство.
  • 🤣 2
More from @vibecodingartem
  1. Sep 22, 2026Сегодня ожидаем релиз Claude Opus 5.5 (а с ним, надеюсь, и сброс лимитов) #anthropic@rvnik…
  2. Sep 22, 2026Xiaomi выпустила MiMo V2.6 Pro и Flash с открытыми весами Pro — топ-1 в Artificial Analysi…
  3. Sep 22, 2026МиМо - одна из любимиц пользователей ОпенРоутера. В корпоративном сегменте РФ про нее забы…
  4. Sep 21, 2026🐹 Хомка за полторы недели: семейный ассистент, который помнит всё и не путает, кому что П…
  5. Sep 21, 2026Post #991
  6. Sep 21, 2026"Воскресная Астра". Есть такое выражение - "воскресный папа". Папа приходит на 1 день, вок…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →