TGViewer
Сергей Булаев AI 🤖 Сергей Булаев AI 🤖 @sergiobulaev · 12.6K subscribers
Post #1598 5.72K
Ребята дали четырём передовым моделям (Fable vs новые GPT) немного поработать: собрать симуляцию полёта NASA HL-20 — шесть степеней свободы, аэродинамика из 170 таблиц продувок — плюс четыре задачи от уравнений состояния до релятивистской динамики. Сверка относитльно независимого эталона.

Claude выиграл - доля правильно произведенных расчётов - 89% против 73% у худшего GPT-5.6. Промах в конечной точке траектории: 0.4 метра у Fable, 19, 400 и примерно 500 у остальных. Цена победы $9.60 за прогон; GPT-5.6-Sol взял 81,5% за $1.74.

Все провалы похожи: модель проверяет сама себя. Sol перепутал две похожие скорости из условия задачи и точно подогнал расчёт под неверную — все его проверки сошлись, потому что сверяли ответ с его же ошибкой, а не с условием.

Terra молча сократила время симуляции с 5 до 3 секунд и себя проверяла на том же укороченном отрезке — накопивгшуюся ошибку никто не увидел. Fable нарочно пытался ломать собственные формулы, чтобы убедиться, что его тесты работают. Похоже поэтому и выиграл.

Второй эксперимент: та же модель в их харнессе Dyad с принудительной верификацией набрала 0.899, в стоковом coding-агенте — 0.533 и ноль на релятивистской задаче. Формула авторов: модель — переменная, харнесс — множитель. Авторы исселодвания продают харнесс Dyad, так что мотив формулы очевиден.

Тут я с ними не согласен

Следить за рынком харнессов для меня сейчас — трата времени: универсальные агенты обмениваются фичами с лагом в недели, кто-то новый временами начинает побеждать, остальные догоняют. Кто сегодня лучший? Знаю, многие пытаются сделать свои варианты. Вместо того что бы работать.

Когда появятся новые герои — мы этого не пропустим. Так было сначала с Cursor, потом с Claude Code и наконец то в тулсете закрепился и Codex (мы пользуемся обоими - всмысле обоими одновременно).

Dyad в этот раз выиграл зашитой проверкой, которую агент физически не может пропустить. Это вправильный кейс.

Мы умеем такое с клодом: у Claude Code есть хуки — скрипты, которые блокируют действие агента, если проверка не прошла. Плюс гит-хуки, которые не дают закоммитить сломанный файл. Работает.

Модели меняем постоянно. Проверки, которые агент не может обойти, собираем каждый день.

Сергей Булаев AI 🤖 - об AI и не только
More from @sergiobulaev
  1. Sep 22, 2026Агент прочитал вашу почту и взял билет подороже Мы даём агентам доступ к почте, чтобы они…
  2. Sep 15, 2026Второй год учусь получать лиды для своих клиентов через LinkedIn. За это время сложилась с…
  3. Sep 14, 2026Claude Fable разгадал шифр, который не поддавался 370 лет В 1653 году шотландский роялист…
  4. Sep 9, 2026С окказией немного занимался нашим опенсорсным проектом, который мы достаточно активно исп…
  5. Sep 9, 2026Во Флориде внезапно для самого себя увлёкся стендовой стрельбой. На самом деле Макс меня в…
  6. Sep 8, 2026Несколько свежих примеров того, что сейчас делают Астрой Человек скормил модели обычную фо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →