Пока все мечтают, как умные говорящие ИИ-головы заменят аналитиков, трейдеров, обрабов и вообще всех подряд, на практике все произошло куда прозаичнее. Ребята из General Reasoning дали восьми популярным моделям по €115 000, исторические данные по сезону АПЛ 2023/24, коэффициенты буков и задачу заработать на ставках с учетом всех рисков. Спойлер: ни одна не вышла в плюс.
Лучше всех отработал Claude — он в среднем показал всего минус 11% от банка. Одна из моделей OpenAI тоже показала себя относительно неплохо — около 13% минуса. А вот творение Илона Маска — Grok — отличилось в обратную сторону: в среднем по тестам он либо тупо сливал весь банк и уходил в ноль, либо разваливался по ходу симуляции.
При этом целью самого теста не было просто угадать победителя матча. Модели должны были вести себя как живой лудик на дистанции — выбирать исходы, распределять банк и менять решения по ходу сезона.
То есть задача была максимально близка к тому, под каким соусом все любят продавать ИИ-аналитику, и именно там все пошло не по плану. Говорят, ломается там, где тоньше всего, если понимаете, о чем мы.
И, кстати, часть данных того сезона, со слов ученых, могла быть известна ИИ-сервисам заранее, но даже с учетом этого они все равно показали минусовой результат.
🫡 Восстание Skynet отменяется, товарищи.
🕐🕑🕒🕓🕔🕕🕖| #аналитика
