Помните мой позавчерашний эксперимент с Claude AI, который отвечал на вопрос про процент автомобилей. Я решил задать аналогичный вопрос chatGPT, а именно 4o-mini. Так вот, рано нам ещё доверять математические задачи LLM, потому что gpt представило сразу два варианта, и оба неправильные.
Claude ai же с Sonnet 3.7 под капотом посчитало всё верно.
В принципе это подтверждается и рейтингом vellum LLM Leaderboard. В рейтинге MATH 500 Sonnet 3.7 значительно превосходит 4o-mini
Post #49
528
Код продакта | Александр Иосса Сегодня открыл использование нейронок с новой стороны. Во-первых, узнал, что o в названии модели означает омниканальность. И можно скармливать в одном запросе сразу и картинку, и сам запрос. Ранее я пользовался разными нейронками для разных целей. Одной для…


- 👍 3
- 🔥 3
- 🤔 2