TGViewer
ITипичные аспекты Артёма ITипичные аспекты Артёма @virrius_tech · 717 subscribers
Post #66 582
А дальше был бенчмарк на всех моделях, до которых я смог дотянуться.
Тестировалось четыре кейса из числа тулов фреймворка:
- ReasoningTool, где было много ограничений на длину строк и списков
- WebSearchTool - прост
- CreateReportTool - сгенерить объёмный вывод
- NextStepToolSelector - по динамически составляемой схеме сделать корректный инпуту выбор function_name_choice

Так много GPTшек тут ибо на прогонах обнаружил, что разные версии очень неравномерно по выдаваемому результату себя ведут.
gpt-4o>>gpt-5-mini>gpt-5>>gpt-4.1

Upd: глянул приложенную версию бенча, там всё даже слишком хорошо, почти все задачи закрылись с первых попыток. Так было далеко не на всех итерациях и некоторые модельки включая gpt-5 любили забывать кавычки внутри кавычек и уходить в самоповторы все пять раз.

Тем не менее, если хитрый вайбкодинг бенча меня нигде не попутал, сама по себе возможность получения такового прогона говорит о качестве современных моделек на задачах генерёжки JSON форматированного текста
  • 🔥 5
  • 👌 2
  • 💯 1
More from @virrius_tech
  1. Sep 14, 2026Смотришь на ворох новостей из последних трендов про AGI алармизм, веселые похождения роя а…
  2. Aug 20, 2026Сумрачное творение тевтонского гения. Теперь и в опенсорсе Последние недели воплощал собой…
  3. Aug 15, 2026document post
  4. Aug 15, 2026Post #93
  5. Aug 12, 2026Подписка за 200 окупилась чуть более чем полностью
  6. Aug 8, 2026document post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →