Удивительно, как быстро прошли 2 недели (с момента прошлого сообщения)!
С тех пор я закончил анализ, который начал в январе. И, пока я все анализировал – оно уже потеряло свою актуальность частично 🙂
Напомню: для школы мы решили выяснить – какая AI модель лучше подходит для задач менеджера. Дополнительные вопросы, на которые мы сможем ответить – а какую модель лучше использовать для отдельной задачи, какая дешевле, а что использовать когда нет доступа к лучшим инструментам (спойлер – использовать китайские)?
В чем потеряло актуальность? Замеры мы проводили в январе, в феврале анализировали. За это время вышли новые модели, старые закрылись и больше недоступны. Это скорее намекает, что нужен постоянный бенчмарк, которые обновляется, не унываем.
Первые результаты мы уже выпустили – сделали обзор моделей, которые доступны для менеджеров в России (VPN, конечно же, у вас стоит, раз уж вы читаете это сообщение). Но, попутно мы обнаружили, что китайские модели очень неплохо справляются с задачами! Поэтому, в этом смысле, статья может быть интересна всем. Опубликована на хабре
Что вы узнаете:
• насколько хороши модели Яндекса? Самая лучшая модель alice.yandex.ru, местами хуже китайских
• можно ли обойтись DeepSeek или z.ai (зайка)?
• насколько эффективно, с точки зрения стоимости, использовать выбранные модели для задач менеджера?
• Claude намного пессимистичнее, чем Gemini (критичнее или реалистичнее – выбирайте для себя сами подходящее описание)
Отдельно хочу поблагодарить тех, кто потратил время на то, чтобы оценить ответы LLM! Вы позволили внести корректировку в модель анализа!
Мы готовим публичный бенчмарк со всеми моделями + обновляем его по последним изменениям. Скоро анонсируем
Post #83
537