Разбираемся по основным тезисам, на что стоит обращать внимание при чтении анонсов выхода очередной фронтир-модели и приложенных к ним бенчмарков.
• Подгонометрия. Например, ось Y начинается не с нуля — и столбик 83% выглядит раз в пять выше столбика 81%. Показывают те бенчмарки, где получилось хорошо, молчат про остальные.
• Могут измерять бесполезное. Модель взяла топ в Humanity's Last Exam звучит внушительно, но это вопросы по биологии и математике. Если вы пишете код, точный ареал обитания серой цапли вас, наверное, не очень волнует.
• Ответы всё чаще утекают в датасет обучения. Известный набор задач публикуют и обсуждают, он попадает в датасеты, модель их зубрит. Экзамен формально сдан, а знания не усвоены. К слову, именно из-за этого OpenAI отказалась от SWE-bench Verified. 😉
• Бенчмарк вполне может быть ангажирован! Когда та же OpenAI показывала результаты во FrontierMath, выяснилось не сразу, что его создание финансировала сама OpenAI.
• Benchmaxxing. Все знают, по чему их будут оценивать, и оптимизируют модель ровно под это. Мышцы отрастают под 89 задач из Terminal-Bench, а за их пределами модель превращается в тыкву.
Что с этим делать? Самый показательный бенчмарк — самодельный, то есть тот, который вы собрали под свои задачи и никому не показали. Его не подкрутят, он не утечёт в датасеты, под него не будут оптимизироваться.
К слову о необычных методах измерения качества работы ИИ: у нас есть статья на Хабре, где мы измеряем качество генерации картинок по промпту "сделай SVG котика, который кодит". 🙃
А у вас есть какие-нибудь кастомные бенчмарки? Поделитесь в чате — обещаем, что не украдём, когда займёмся обучением KodikGPT. 🤝
