TGViewer
AI и грабли AI и грабли @oestick · 13.7K subscribers
Post #280 951
Nikolay Sheyko Если можно выделить часть системы (Ринат тут про это писал) с детерминированными ожидаемыми выходами, то на эту часть можно договариваться о классических ML метриках на тестовом датасете, разметку которого заказчик вам не отдает. На вторую часть (или если…
LLMки хуже всего при программировании справляются с поиском багов и рефакторингом архитектуры.

Понятно почему – они учились на данных, которые очень последовательны. В интернете почти нет текстов, в которых автор прям по ходу рассуждает, почему его предыдущий абзац был не верный. Наоборот, обычно каждый следующий абзац является логичным продолжением предыдущего, дополняет или усиливает его.

И еще меньше примеров забагованного кода с объяснениями, что в нем не так и как это исправить. Большая часть кода на GitHub'е либо корректная, либо с багами, про которые никто не знает 🤷‍♂️

Поэтому, неверные шаги в архитектуре модель обычно закрывает локальными костылями, вместо того, чтобы сделать шаг назад и сделать нормально.


———

Один из паттернов, которые я все чаще использую, чтобы все-таки искать баги не вручную – прошу модель рассуждать по шагам. Но не как обычно (Chain of Thought), когда она просто делает логические шаги.

А так, как я предлагал искать баги своим студентам – когда они в уме делают работу дебаггера и мысленно проходят по флоу исполнения программы, наблюдая за состоянием переменных.

P.s. reasoning сети (типа o1 или нашумевшей DeepSeek R1) справляются сильно лучше, потому что как раз научились делать отход от своих предыдущих размышлений (RL + вероятно, дообучение на данных с рассуждениями такого типа)
  • 👍 10
  • ❤ 5
More from @oestick
  1. Oct 4, 2026Саша Поляков собрал стату по банам (меня тоже в этот раз задело). Мб кому-то полезно будет…
  2. Oct 4, 2026Собрал статистику по банам Claude из комментариев в канале Пост с разбором телеметрии, кот…
  3. Oct 2, 2026О, мой баг репорт в getbb.app приняли. Приятно быть причастным к развитию того, чем сам по…
  4. Oct 1, 2026А у вас тоже есть задачки, в которых нужно очень много и глубоко думать, но вы их откладыв…
  5. Sep 30, 2026Anthropic > OpenAI, но есть пара но Предпосылки 1. opus-5.5 очень хорош 2. DevDay openai –…
  6. Sep 27, 2026Скоро: видео-монтаж-слоп во всех лентах страны Opus-5.5 теперь сам такое ваншотит на remot…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →