TGViewer
QA-Логия QA-Логия @qa_logia · 7.89K subscribers
Post #5340 199
Тянуть ли топовую модель на рутину? Прогнал четыре штуки через пять одинаковых задач и сверил результаты

На Хабре всю неделю кипели: мол, нужен ли кодеру самый умный движок или на бытовухе прокатит бюджетный. Триста комментов — и ни единого замера, где всем выдали бы одно и то же.

Автор не стал спорить, а взял и сделал. Пять рутинных тасок, четыре модели из одного семейства, по два прогона на каждую, сверху — скрытые тесты. На выходе сорок запусков.

И вот сюрприз: самая дорогая оказалась самой шустрой — 341 секунда против 395 у самой дешёвой. Всё потому, что ей хватает меньшего числа ходов и вдвое меньшего объёма текста.

Четыре задачи из пяти затащили все, 32 прогона из 32. А на пятой младшенькая налепила баг и отчиталась двумя галочками кряду, причём вторая перечёркивает первую.

Читать далее

👉 QA-логия
More from @qa_logia
  1. Sep 25, 2026ExploDrive: как я превратил запись экрана в отчет исследовательской тестовой сессии Нейрон…
  2. Sep 24, 2026Сайт на ИИ-агентах: 25 находок аудита из 111 — мусор, ещё 4 — чистая выдумка Сайт у меня к…
  3. Sep 23, 2026Сказ про аккаунт OpenAI: паровозик, который так и не доехал Хабровчанин делится: трёхлетни…
  4. Sep 21, 2026Агент дописал «готово»? Это ещё не значит, что результат годный Запуск закрыт, формат корр…
  5. Sep 20, 2026Один Gmail — и тысячи адресов для сервиса: что мы случайно откопали в админке Точка в адре…
  6. Sep 20, 2026🤣 Типичный ИИ 💥 xCode Journal
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →