⚖️ Не все ИИ одинаково полезны: тестируем 7 LLM и считаем деньги
Недавно, внутри AiMono, провели мини-бенчмарк — составили свой тест на качество работы языковых моделей (LLM) и сравнили их по соотношению «цена / качество».
🧪 Всего протестировали 7 моделей. Вот наш топ с оценкой (из 18 баллов) и стоимостью за 1 млн токенов (input + output):
1️⃣ GPT-4o — 14/18, 977 руб
2️⃣ DeepSeek-V3 — 13/18, здесь тарификация зависит от времени..поэтому были взяты средние значения, итого 80 руб (!)
3️⃣ GPT-4.1 — 13/18, 782 руб
4️⃣ o3-mini — 8/18, 1 212 руб
5️⃣ YandexGPT PRO — 7/18, 1200 руб
6️⃣ GigaChat Max — 6/18, 1950 руб
7️⃣ Llama 3.3 70B Instruct — 3/18 , 1200 руб
Выводы:
- DeepSeek-V3 — победитель по цене/качеству;
- Самая дорогая модель заняла предпоследнее место по баллам;
- Reasoning модели (типа o3) не для всех задач работают лучше чем классические (плюс еще и дольше времени запрос обрабатывается);
- Российские модели дороже и уступают по качеству моделям США и Китая ~ в 2 раза
__
А какие языковые модели вы используете в своих проектах? Поделитесь в комментариях ⬇️
Post #430
635
- 🔥 8
- 👍 6
- 👏 4
- 👌 1