TGViewer
контекст rot контекст rot @contextrot · 287 subscribers
Post #877 417
Последние пару дней вижу коупинг: LLM просят представить как очередной способ получать информацию.

Поинт такой: были книги, потом Google, теперь появился более умный справочник с автокомплитом. А вот настоящая разработка — архитектура, ограничения, бюджеты, трейдофы... это вам не на литкоде массивы мёрджить.

Я, конечно, такое мнение не разделяю. LLM-агент может получить задачу, читать документацию и код, пользоваться терминалом, принимать промежуточные решения и сам проверять результат. Справочники так не умеют.

Обладает ли ллм субъектностью? Можно спорить, но тяжело агента назвать «просто инструментом».

С литкодом и олимпиадным программированием уже всё понятно. На финале ICPC 2025 модель OpenAI решила 12 задач из 12, Gemini — 10. Лучшая команда людей (СПбГУ) — 11. Люди проиграли.

Гораздо хайповее — соревнования по тому самому СИСТЕМ ДИЗАЙНУ.

В SysDesign-Bench модели получают требования с ограничениями и должны сами выбрать архитектуру и трейдофы, заметить, что задача невыполнима, или задать уточняющий вопрос. Проверка детерминированная, без LLM-судьи. Итоги июля: claude-fable-5 — 92%, grok-4.5 — 88%, gpt-5.6-sol — 81%. Ключевые архитектурные решения все модели принимают в 96–100% случаев. Сыпятся на другом: любят переусложнять и не всегда спрашивают, когда данных не хватает. Никого не напоминает?))

Похоже ли это на «автодополнение текста»?

В R2ABench моделям дают требования реальных проектов и просят построить архитектуру с нуля. Тут результаты пока хуже: схемы получаются синтаксически корректные и читаемые, но связи между компонентами модели восстанавливают плохо (Edge F1 не выше 0.18) и часто выдумывают лишние. Правда, тестировали там GPT-5 и Sonnet 4.6, то есть прошлое поколение. А больше четверти пропущенных связей, по разбору самих авторов, из требований вообще не выводится.

Итого: выбирать архитектурные решения модели уже умеют, свободно проектировать систему — пока нет. Надолго ли? По данным METR, длина задач, которые агенты доводят до конца, с 2024 года удваивается примерно каждые 3 месяца. Да, меряют на кодинге, но динамику вы поняли.

Если чья-то интеллектуальная работа стоит дорого... чтож...😜 В 27 году подобные бенчи так же будут оценивать и ОПТИМИЗИРОВАТЬ следующим поколением моделей.

Всё будет хорошо!

P.S я не думаю что кикнут ребят которые высоко сидят в айти пирамиде, конеш. В след постах отпишу к чему я
  • 🤡 2
More from @contextrot
  1. Oct 7, 2026photo post
  2. Oct 7, 2026Я думаю, что математики наиболее глубоко чувствуют и осознают, насколько ИИ революционная…
  3. Oct 7, 2026Сегодня, кстати ресет был С июля месяца это первый ресет когда у меня оставалось количеств…
  4. Oct 7, 2026Последнее время частенько вижу посты где Клод сносит винду через неверный синтаксис поверш…
  5. Oct 7, 2026photo post
  6. Oct 7, 2026наконец-то🙏 не хочу злорадствовать, безусловно, когда компаниям плохо и сотрудникам плохо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →