TGViewer
Data Blog Data Blog @jdata_blog · 2.42K subscribers
Post #541 1.15K
И так, нам в большей степени отсюда стоит рассмотреть процесс того, как Клод пришел к доказательству. Я сама использую Клода в качестве советника и критика, у меня есть разный опыт и степени довольства.

Где читать: к статье приложен Appendix C — короткая выжимка процесса работы. Плюс выложены полные транскрипты двух ключевых агентов, с аннотациями. В них я и пошла на почитать.

Что интересного:

1. Две попытки доказательства и веселый коучинг. В первую агенты собрали 106 «выживших» идей, ни одна не оказалась доказательством. После завершения тезисы вторую сессию начали просьбой продолжить и напутствием (цитата) «you need to believe in yourself».

Модель в этот момент отдала That’s not a confidence problem I can fix by believing harder—a proof of RH either exists on the page and survives refereeing or it doesn’t, and confidence is not an input to that.

Мотивировать Клода продолжили. Теми же фразами и агент с субагентами пошли работать дальше и вернулись с результатами.


2. Дизайн поиска. Было 23 параллельных агента, каждому своя линия работ. Три инструкции были на агента:

1) Писать цепочку рассуждений, а не набор тезисов. 2) Проверять любой механизм на контрольных объектах, для которых аналог гипотезы заведомо ложен. 3) Назвать первый шаг, который не обоснован.

Это прям классика хорошего контроля над Клод-экспами. Иначе потом не ясно, это Клод решил не тратить ресурсы и дал число или правда есть результат.

3. Случайность результата. Агент, который принес основной вклад (в логе — E2), был отправлен решать противоположную задачу: ограничить сверху число нулей вне прямой. Он не смог, но в рабочем скрипте завел новый столбец — который отдал примерно половину результата (для любящих детали — это была доля собственных значений, доказуемо положительных, считаемая из простых чисел — половина будущей теоремы).

4. Дизайн контроля. Взяли три агента (слепых на результаты друг друга). Агенты проверяли утечку и качество.

Внимание, самое прикольное, что потом результат упал, но сохранился в логах. Основные тезисы собрали из них.

Да, но как Клод это сделал?

Транскрипты двух успешных агентов опубликованы целиком. В них видно, что два важных перехода произошли в скрытых рассуждениях. Так что как, простите, извините, в голове.

Скрытые рассуждения в экспорт не попадают. В логе они присутствуют как интервалы: «молчание 14 минут 40 секунд», «молчание 24 минуты», «молчаливый вызов 1 час 31 минуту».

И блин, как же это прикольно — мы моделями можем делать больше и лучше, но не знаем ни-фи-га. Значит, у нас всё ещё будет работа, коллеги.

Что унести с собой:
Учимся дизайнить у лучших, прости господи.

▪️ Правило репорта. Посыл “работай и доложи, что вышло — включая „ничего”” правда помогает, ибо модель всегда что-то отдает. Чем больше контекста получено, тем легче найти мусор.

▪️ Дерьмовый коучинг. Дерьмовый, потому что «поверь в себя» отлично работает как разрешение и мотивация копать шире и не работает как аргумент. Планку доказательности оно не двигает.

▪️ Негативный контроль. Дать объект, на котором идея должна валиться. При этом, модели не говорить. Если там успех — ура, ошибка найдена, а мы ещё и не ошиблись.

▪️ Спрашивать вместо «всё посчитано?», «где первый необоснованный шаг?». Второй заставляет искать место, где стало плохо — это капец как удобно.

▪️ Слепое ревью на сабагентах — просто бесплатные (за вашу подписку) коворкеры. Проверено, юзаю.

▪️Логировать, много логировать. У них агент за три с половиной часа написал три коротких сообщения, остальное — файлы. Поэтому результат пережил падение процесса: он лежал на диске.

▪️ Иметь стоп-правило. Момент, когда очередной внутренний прогон перестаёт добавлять информацию, надо уметь распознать и выйти наружу — к человеку (иначе Клод трындец долго гоняет очень низкого качества штуки или вообще не то).

Прикольно, вкусно и забавно. Поели, и дальше работать.
  • ❤‍🔥 10
  • 🌚 5
  • 🔥 4
  • ❤ 2
  • 🤡 1
More from @jdata_blog
  1. Sep 18, 2026А ещё вас стало невероятно сильно больше, и я безумно рада видеть новых людей (вы мой мале…
  2. Sep 18, 2026Третий момент, который мне прям вот захотелось записать-написать — это то, что надо это ло…
  3. Sep 18, 2026"AI решил выберите-проблему-математиков" Безумно обожаю, когда решаются какие-то сложные з…
  4. Sep 13, 2026Вебинар про объяснимость агентов и во что можно поиграть Как самый ответственный человек н…
  5. Sep 10, 2026Теперь официально: погнали пить кофе в Лондоне. 23 сентября выступаю на конференции Applie…
  6. Sep 4, 2026Вообще, я тут порефлексировала за лето, и поняла, что в канал надо постить кружки, чтобы о…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →