TGViewer
AI и разработка | Кейсы, грабли и ИИ... AI и разработка | Кейсы, грабли и ИИ... @ai_in_dev · 177 subscribers
Post #79 183

Forwarded from Алексей Цыкарев | ИТ, ИИ и бизнес

Вчера Open AI выкатили новые «дешевые» и умные модельки gpt-5.4-mini и gpt-5.4-nano и все вокруг пишут, как же круто, какие же они дешевые, а я решил сделать быстрый замер на реальной нашей задаче. Вот результаты

Контекст
Есть задача в одной из внутренних систем - метчить кандидатов на запросы при помощи LLM. Сейчас там используется моделька gpt-5-mini с low effort

Методика эксперимента
При тех же самых входных данных и промптах - меняем модельки и effort для них и смотрим на результаты

Замеры
На скриншоте

Итоги
1) Конкретно в нашей ситуации чуть лучший результат по качеству результата выдает gpt-5.4-mini с medium effort. Но по цене получается в ±3.5 раз дороже
2) gpt-5.4-mini с low effort выдает результат стабильно хуже, чем gpt-5-mini (незначительно, но хуже). Стоимость при этом примерно в 2 раза дороже
3) gpt-5.4-nano стабильно выдает в нашей задаче худшие результаты
4) Все модельки gpt-5.4 работают в 3+ раза быстрей
More from @ai_in_dev
  1. Sep 25, 2026Код пишется быстрее, а релизы нет. Два взгляда на одну проблему За последние дни на Хабре…
  2. Sep 23, 2026Если AI способен написать функцию, значит ли это, что он способен вести разработку? Benchm…
  3. Sep 16, 2026Cloudflare начал различать AI-ботов Вчера, 15 сентября, Cloudflare добавил настройки для A…
  4. Sep 15, 2026AI-агенты пишут код, собирают приложения и… взламывают системы 🙃 Агенты уже не просто пом…
  5. Sep 11, 2026Тесты зелёные, а мержить нельзя. Новый бенчмарк вскрыл проблему Мы привыкли оценивать код,…
  6. Sep 8, 2026«Модельная усталость»: гонка, которую уже не выиграть Первая неделя сентября войдет в исто…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →