Протестировал llama 4 в реальных задачах: на бенчмарках Лев Толстой, а на деле текст - отстой
Спустя несколько дней после релиза новых моделей Llama, компанию Цукенберга начали обвинять в том, что бенчмарки накручены (раз, два). При этом сама компания усердно это отрицала.
Мне стало очень интересно, как оно на самом деле, и я практически 2 недели тестировал новые модели для своих задач. На прошлой неделе я писал про то, как экономить на LLM, там же рассказал про Openrouter, в котором, очень кстати, новые модели Llama 4: Maveric и Scout доступны бесплатно. Учитывая их миллионный контекст, я решил использовать эти модели для тех же задач, для которых сейчас использую Gemini.
И, честно говоря, модели меня очень разочаровали. По качеству ответов в моих личных сценариях они часто не оправдывали ожиданий. Более того, Llama 4 проигрывает не только Gemini PRO 2.5, которая была единственной моделью на llm arena. По моим ощущениям, модель работает хуже, чем оба DeepSeek (R1/V3), Qwen 2.5, gpt 4o, Gemini Flash 2.0 и многие другие. То есть модель, которая новее, инновационнее и имеет больше параметров, работает хуже, чем более старые или легковесные конкуренты.
В чем проявилось это "хуже" в моих задачах и что это за задачи, которые я решал с помощью моделей?
Начнем с задач:
- брейнсторминг
- написание ТЗ
- суммаризация текстов
- написание промптов к другим моделям
- поиск багов в коде
Что мне не понравилось:
1. Модель очень склонна торопиться. В задачах, где я выполняю какой-то пошаговый процесс, например, генерацию ТЗ, я предпочитаю идти по шагам. И если Gemini, с которой я обычно работаю, задает мне уточняющие вопросы, то Llama, во-первых, давала меньше детализации, отвечала короче и все время торопилась перейти к следующему этапу. Ощущалось это как работа с каким-то ленивым работником, который пытается сделать тяп-ляп и пойти дальше.
2. Непонимание финальной цели задачи, над которой работаем. Например, с той же генерацией ТЗ. Я делал ТЗ на создание лендинга. В первоначальном промпте прописал, что мне нужно создать ТЗ, по которому я дальше буду кодить. И если Gemini после просьбы о последней правке радовался и спрашивал, есть ли еще пожелания по правкам, то Llama, даже не убедившись в том, доволен я или нет, говорила, что теперь будет сама писать код. Вроде как и хочется похвалить за инициативность, но моя первоначальная задача была другая.
3. Требуется большее количество перегенераций, чтобы получить качественный ответ. С таким я не сталкивался, наверное, со времен GPT 3. Я даю модели вполне понятный промпт - получаю некачественный ответ. Ради эксперимента жал кнопку "перегенерировать", хороший ответ получался с 3-4 раза. Отправлял такой же промпт в Gemini Flash 2.0 - модель дает качественный ответ с первого раза, DeepSeek V3 - ответ с первого раза.
4. Странная работа с контекстом. Я генерировал несколько промптов для создания картинок. Обычно делаю это в одном чате и промпты для 4-5 картинок получаюстя нормально. В случае с Llama - модель в последующих картинках пыталась вставить элементы предыдущих.
В целом, модель ощущается как некий откат на 1 - 1.5 года назад, и если тогда это ощущалось нормально, то на фоне современных моделей это выглядит как даунгрейд.
Post #256
455
- 👍 4