Мозги модели или её окружение?
Чуваки разобрали 41 способ, которым AI-агенты эпично проваливаются, и раскидали каждый фейл по источнику проблемы — модель, обвязка, юзер, инструменты, память или среда. Суть в том, что баг чётко показывает, где рыть и что чинить.
И знаете что? Большинство падений случается не внутри самой модели, а на стыке модели и окружающей инфраструктуры. Прикол в том, что эта схема ещё и подходит для автоматического распознавания таких косяков.
Обкатали на четырёх топовых моделях: лучший ИИ-арбитр выдал коэффициент согласия Коэна 0,76 против ручной разметки. То есть классифицировать ошибки можно на автопилоте прямо в проде. Инженеры обвязки в этом сезоне реально вышли в топ, но внятного фреймворка, чтобы отличить глюк модели от глюка обвязки, до сих пор не существовало. Эта работа такой язык даёт. Статья
👉 Логово Верстальщика
Post #4453
707
