Про Grok 3, клоунаду от Илона Маска и то, почему всё таки модель заслуживает внимания.
В конце февраля Илон выкатил новую модель. Конечно же "лучшую в мире". Но по факту, в момент релиза объективных данных почти не было.
xAI у себя в блоге показали несколько бенчмарков где Grok 3 всех опережает. Сказали, что это бета-версия, что модель всё ещё тренируется. И поэтому доступа к API пока не будет. Это важно, потому что независимые бенчмарки делают свои замеры не вручную, а как раз через API.
То есть, Илон говорит, что Grok-3 "пугающе умён" и превосходит любые существующие модели. Но проверить это можно либо самим пообщавшись с моделью, либо на бенчмарках в посте.
А бенчмарки в посте читерские (см картинку внизу). Видите там справа область посветлее? Это прирост результата, когда модели дали сильно больше ресурсов (test-time compute), чтобы отловить более стабильные ответы. Это нечестное сравнение.
Думаю вы знаете, что современные нейронки выдают слегка разные ответы на один и тот же вопрос. Иногда лучше, иногда хуже. Так вот большинство бенчмарков это игнорируют и оценивают только pass@1, то есть первый ответ на каждый вопрос.
Это проще и больше похоже на то как все привыкли ими пользоваться—мы ожидаем хороший ответ с первого раза.
А все результаты Грока показаны с cons@64. То есть, на каждый вопрос он делал 64 попытки и выбирал ответ, который появлялся чаще всего. И xAI сравнивают результат Грока с приростом с результатами у конкурентов на pass@1.
Короче, с одной стороны заявление, что это некстген модель. А с другой дешёвенькие манипуляции. В целом, все лабы используют хитрости. Просто не так нагло. Например, выбирают только удобные для себя бенчмарки или просто не добавляют в сравнение модели с лучшими результатами.
А что говорят опытные юзеры после общения с моделю? Консенсус такой:
Модель огромная по размеру, но при этом прорывов она не принесла. Она все еще галлюцинирует и стремится выдавать излишне длинные ответы.
По способностям, Грок-3 где-то на уровне сильнейших моделей OpenAI и чуточку лучше DeepSeek и моделей от Google. Это на момент релиза—спустя два месяца уже вышла Gemini 2.5 и новые GPT.
Не впечатляет? А все таки мне дальше есть про что рассказать.
Модель интересная тем как Илон и xAI за поразительно короткое время ворвались на рынок и стали одним из основных игроков.
Post #57
496
- 🔥 7