TGViewer
very vibe coding very vibe coding @veryvibecoding · 120 subscribers
Post #1204 32

Forwarded from Сиолошная

Маленькое обновление по свежему бенчмарку ProgramBench (писал о нем неделю назад тут). Авторы соизволили прогнать GPT 5.5 на high/xhigh (максимальная длина рассуждений и время работы). И Opus 4.7 до кучи тоже. Процитирую авторов: «GPT 5.5 xhigh значительно превосходит Claude Opus 4.7 xhigh по всем параметрам» 😏

Во-первых, появилась первая полностью решённая задача (из 200). Оба запуска GPT-5.5 решили её, при этом на двух разных языках, Python и C.

Во-вторых, если брать не полностью решённые задачи, а те, где проходит 95% тестов (то есть выполнена почти вся функциональность), то разрыв ещё больше: GPT-5.5 xhigh может написать с нуля 13.5% программ, GPT 5.5 high 5%, Opus 4.7 xhigh 4.5%. Я не ожидал такой разницы.

На второй картинке график доли задач, в которых проходит заданный процент тестов. Видно, как фронтир GPT-5.5 xhigh гораздо правее и выше, чем других моделей — то есть в целом модель закрывает сильно больше фичей в задачах.

К сожалению, авторы так и не прогнали модели в Codex / Claude Code, не говоря уже про какой-то минимальный цикл работы до конца (аналог `/goal`), и я всё ещё ожидаю, что это повысит качество ещё больше.

Что это значит для нас? Ждём к концу года агентов, которые будут выплёвывать по 100к строк кода на ваш промпт, и даже работать будет (на 95% 😂)
More from @veryvibecoding
  1. Sep 29, 2026Новости OpenAI - прямо печаль какая-то, а не новости.
  2. Sep 29, 2026Интересно, что тарифы на ИИ все больше начинают напоминать тарифы на электроэнергию. У z.a…
  3. Sep 29, 2026Unsloth выпустил квантизацию Laya, которая работает на 4гб памяти. Буду тестировать. Laya…
  4. Sep 29, 2026Начинается OpenAI Dev Dey. Главный релиз - Astra 6.1, видимо, отложен. Жди доработок Codex…
  5. Sep 28, 2026Вернул подписку на GLM от Z.ai. Приятный бонус - у них агент AutoClaw - на основе pi и Ope…
  6. Sep 28, 2026Последние впечатления от chatGPT и воспоминания о том, как Claude вместо внешних моделей г…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →