Брутализм в архитектуре сознания
Исследования шорткатов по инвестициям и психотерапии, через байесовское мышление и когнитивные искажения, с легким заходом в биотех и AI.
Иногда инвестирую, иногда билдю. Культивирую свободу.
Post #61
2.35K
Конвергенция парадоксов
Месяц полировал свой макро-плагин для клод кода и в какой-то момент задал себе простой вопрос. А как вообще понять что он стал лучше? Как говорил "тренер" мужчины меряются умом. Поищем же способ мерить качество агентов.
В прошлом выпуске я рассказывал про метрики точности прогнозов (Brier-скор, hit-rate, информационный коэффициент, не расходитесь, больше про статистику мы не будем). Но есть метрика которой почти никто не пользуется: согласие между независимыми аналитиками. Возьми парочку, дай им одни и те же данные, замерь разброс.
Возвращаясь к моему плагинчику для клод кода, он классифицирует темы рынка (ФРС, AI, тарифы, гео/нефть), пишет ежедневные срезы по 100+ индикаторам, глубоко, кропотливо, но не рокет-саенс. Я запустил несколько независимых агентов на одной картинке рынка. И совпала 1 тема из 5. На тарифах разрыв в 2 корзины: один сказал "наблюдение", другой "высокий уровень".
Каждый из низ ссылается на цитаты из книг, и научных пейперов, у каждого есть обоснование, каждого я проверил верификатором, ну и сам в образовательных целях поглядел по диагонали. Все совпадает, вопрос нарратива и интерпритации фактов, в каких-то темах люфт шире, где-то уже.
Запустил несколько фреймворков где агенты день и ночь опимизируют промты. Что-то добавили, что-то поменяли. Тестирую снова. И вот тут стало интересно. Худший разрыв ужался. То что фреймворк уверенно видит, все агенты называют одинаково. То что видит с неоднозначностью, у каждого свой оттенок. Парадоксы сходятся, классификации нет.
И тут до меня дошло. Дракенмиллер и Далио на одной и той же картинке регулярно дают разные ярлыки для режима. Один говорит "поздний цикл расширения", другой "стагфляционный хвост". На одних данных, с десятилетиями опыта и миллиардами под управлением. Это даже не считается разногласием.
То есть ~30% разногласий это не баг моего фреймворка. Это структурный пол макро-суждениях вообще. Не убирается ни данными, ни опытом, иначе бы легенды сходились в выводах.
Это меняет вопрос которым я мерю качество. Не "идеален ли плагин?" (ох знал бы раньше, столько денег сэкономил бы на психотерапетве), а "насколько два независимых аналитика разойдутся на одних данных?" Если разброс падает до уровня где даже легенды макро расходятся, дальше работать с данными почти бесполезно.
И это, кстати, не только про макро. Это про жизнь , про бизнес. Почему ваш стартап принесёт нашему фонду миллионы? Честный ответ: с какой-то вероятностью принесёт, с какой-то нет, никто на этой стадии не знает на каком из 51 индустриального пузыря с 1928 года вы сидите. Но это не тот ответ который все ждут. Все хотят: вот наш рынок, вот наш ров, вот почему мы не такие как все.
Но где граница между верой, уверенностью, глупостью и самоуверенностью? Большинство индустрий устроены так что честность стоит денег, а нарратив приносит деньги прямо сейчас. Это тест Кабояши Мару, который должен пройти каждый инвестор. Когда ты слышишь мистера Спока в голове, который говорит - "Джим вероятность того, что мы выживем в этой п(р)осадке 13%", а Джим отвечает - "Все будет нормально!"
Live longer and prosper 🖖
Месяц полировал свой макро-плагин для клод кода и в какой-то момент задал себе простой вопрос. А как вообще понять что он стал лучше? Как говорил "тренер" мужчины меряются умом. Поищем же способ мерить качество агентов.
В прошлом выпуске я рассказывал про метрики точности прогнозов (Brier-скор, hit-rate, информационный коэффициент, не расходитесь, больше про статистику мы не будем). Но есть метрика которой почти никто не пользуется: согласие между независимыми аналитиками. Возьми парочку, дай им одни и те же данные, замерь разброс.
Возвращаясь к моему плагинчику для клод кода, он классифицирует темы рынка (ФРС, AI, тарифы, гео/нефть), пишет ежедневные срезы по 100+ индикаторам, глубоко, кропотливо, но не рокет-саенс. Я запустил несколько независимых агентов на одной картинке рынка. И совпала 1 тема из 5. На тарифах разрыв в 2 корзины: один сказал "наблюдение", другой "высокий уровень".
Каждый из низ ссылается на цитаты из книг, и научных пейперов, у каждого есть обоснование, каждого я проверил верификатором, ну и сам в образовательных целях поглядел по диагонали. Все совпадает, вопрос нарратива и интерпритации фактов, в каких-то темах люфт шире, где-то уже.
Запустил несколько фреймворков где агенты день и ночь опимизируют промты. Что-то добавили, что-то поменяли. Тестирую снова. И вот тут стало интересно. Худший разрыв ужался. То что фреймворк уверенно видит, все агенты называют одинаково. То что видит с неоднозначностью, у каждого свой оттенок. Парадоксы сходятся, классификации нет.
И тут до меня дошло. Дракенмиллер и Далио на одной и той же картинке регулярно дают разные ярлыки для режима. Один говорит "поздний цикл расширения", другой "стагфляционный хвост". На одних данных, с десятилетиями опыта и миллиардами под управлением. Это даже не считается разногласием.
То есть ~30% разногласий это не баг моего фреймворка. Это структурный пол макро-суждениях вообще. Не убирается ни данными, ни опытом, иначе бы легенды сходились в выводах.
Это меняет вопрос которым я мерю качество. Не "идеален ли плагин?" (ох знал бы раньше, столько денег сэкономил бы на психотерапетве), а "насколько два независимых аналитика разойдутся на одних данных?" Если разброс падает до уровня где даже легенды макро расходятся, дальше работать с данными почти бесполезно.
И это, кстати, не только про макро. Это про жизнь , про бизнес. Почему ваш стартап принесёт нашему фонду миллионы? Честный ответ: с какой-то вероятностью принесёт, с какой-то нет, никто на этой стадии не знает на каком из 51 индустриального пузыря с 1928 года вы сидите. Но это не тот ответ который все ждут. Все хотят: вот наш рынок, вот наш ров, вот почему мы не такие как все.
Но где граница между верой, уверенностью, глупостью и самоуверенностью? Большинство индустрий устроены так что честность стоит денег, а нарратив приносит деньги прямо сейчас. Это тест Кабояши Мару, который должен пройти каждый инвестор. Когда ты слышишь мистера Спока в голове, который говорит - "Джим вероятность того, что мы выживем в этой п(р)осадке 13%", а Джим отвечает - "Все будет нормально!"
Live longer and prosper 🖖
- ❤ 31
- 🔥 13


