Последние пару дней вижу коупинг: LLM просят представить как очередной способ получать информацию.
Поинт такой: были книги, потом Google, теперь появился более умный справочник с автокомплитом. А вот настоящая разработка — архитектура, ограничения, бюджеты, трейдофы... это вам не на литкоде массивы мёрджить.
Я, конечно, такое мнение не разделяю. LLM-агент может получить задачу, читать документацию и код, пользоваться терминалом, принимать промежуточные решения и сам проверять результат. Справочники так не умеют.
Обладает ли ллм субъектностью? Можно спорить, но тяжело агента назвать «просто инструментом».
С литкодом и олимпиадным программированием уже всё понятно. На финале ICPC 2025 модель OpenAI решила 12 задач из 12, Gemini — 10. Лучшая команда людей (СПбГУ) — 11. Люди проиграли.
Гораздо хайповее — соревнования по тому самому СИСТЕМ ДИЗАЙНУ.
В SysDesign-Bench модели получают требования с ограничениями и должны сами выбрать архитектуру и трейдофы, заметить, что задача невыполнима, или задать уточняющий вопрос. Проверка детерминированная, без LLM-судьи. Итоги июля: claude-fable-5 — 92%, grok-4.5 — 88%, gpt-5.6-sol — 81%. Ключевые архитектурные решения все модели принимают в 96–100% случаев. Сыпятся на другом: любят переусложнять и не всегда спрашивают, когда данных не хватает. Никого не напоминает?))
Похоже ли это на «автодополнение текста»?
В R2ABench моделям дают требования реальных проектов и просят построить архитектуру с нуля. Тут результаты пока хуже: схемы получаются синтаксически корректные и читаемые, но связи между компонентами модели восстанавливают плохо (Edge F1 не выше 0.18) и часто выдумывают лишние. Правда, тестировали там GPT-5 и Sonnet 4.6, то есть прошлое поколение. А больше четверти пропущенных связей, по разбору самих авторов, из требований вообще не выводится.
Итого: выбирать архитектурные решения модели уже умеют, свободно проектировать систему — пока нет. Надолго ли? По данным METR, длина задач, которые агенты доводят до конца, с 2024 года удваивается примерно каждые 3 месяца. Да, меряют на кодинге, но динамику вы поняли.
Если чья-то интеллектуальная работа стоит дорого... чтож...😜 В 27 году подобные бенчи так же будут оценивать и ОПТИМИЗИРОВАТЬ следующим поколением моделей.
Всё будет хорошо!
P.S я не думаю что кикнут ребят которые высоко сидят в айти пирамиде, конеш. В след постах отпишу к чему я
Post #877
417
- 🤡 2