TGViewer
Нейроканал Нейроканал @neuro_channel · 11.7K subscribers
Post #2852 2.12K
Дэн Луу проверил, помогает ли агенту указание, как тестировать. Задача одна: Zstd на Rust, Codex на Sol medium и xhigh. Промпт без инструкций по тестам сравнили с 25 добавками: TDD, фаззинг, property-based тесты, мутационное тестирование, формальные методы вроде Lean 4 и TLA+, просьба «не делай ошибок», плюс четыре готовых skill'а. По 80 прогонов на каждое условие и уровень, оценка по скрытым тестам, на картинке цена против доли безошибочных прогонов.

Ничего не выигрывает заметно, а промпт без инструкций выше среднего. TDD хуже среднего. Skill Hegel поднял стоимость на 26–41% без прироста качества. Skill из сборника ECC с 250 тысячами звёзд выглядел прилично за счёт прогонов, где агент его не открывал или открывал поздно. Лучший результат дал skill автора из пяти пунктов, и тот выполнялся не полностью.

Агенты умеют находить рискованные места в коде, но тестируют их плохо, название техники этого не меняет. По опыту автора работает другое: самому задать структуру тестов и возвращаться к агенту с правками.

@neuro_channel
  • 👍 8
More from @neuro_channel
  1. Sep 20, 2026Tencent выложила WeVisDoc, модели на 2 и 4 млрд параметров, которые превращают снимок стра…
  2. Sep 19, 2026StepFun выпустила Step 5 Preview, и Artificial Analysis уже её замерили: 44 балла в индекс…
  3. Sep 19, 2026На следующей неделе ожидается сразу несколько крупных релизов. Расскажу про самые интересн…
  4. Sep 18, 2026Qwen выложила Qwen3.8-Omni-Flash: на вход текст, картинки, звук и видео, контекст 1M токен…
  5. Sep 18, 2026PrismML выпустила Ternary Bonsai 2 27B: тернарное сжатие теперь сделано поверх Qwen3.8 27B…
  6. Sep 17, 2026Стелс-модель Union Alpha раскрылась: это Pareto 26.9 от компании The Unbiased Company. Вче…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →