TGViewer
Рид. Сознание и Инвестиции. Рид. Сознание и Инвестиции. @eugene_rid · 2.36K subscribers
Post #52 3.37K
Юридический экспереримент с AI: полевой отчёт

Последние две недели я решаю одну задачу, и параллельно делаю эксперимент: два AI-агента в клод-коде, один ресёрчер юрист, второй кросс-чекер юрист. Задача - проверить набор налоговых утверждений, который мне прислали кожанные юристы подрядчики. Я подчеркиваю, проверить набор конкретных, верифицируемых, утверждений с правильным ответом. Не философия, не мнения, а факты и цифры: ставка такая-то, закон такой-то, дата такая-то.

Результат: 12 утверждений, два агента (Opus 4.6), веб-поиск, перекрёстная проверка. Чистый "ок, можно использовать" четыре из двенадцати. Ещё несколько "correct but narrow", то есть формально не врёт, но недоговаривает так, что на практике принимаешь неправильное решение. Остальные — от устаревших данных до прямых ошибок.

Ошибки распадаются на два класса.
Первый устаревшие факты. Агент уверенно цитирует закон, который уже отменили.
Второй класс, неправильная интерпретация. German 70% - это не штраф, а стандартная формула налогообложения. NL Box 3 - ставка 6%, не 7.78% и тд.
Агент прочитал источник, но понял его через свою модель мира, а не через контекст документа. (Сейчас, кстати, построение модели мира агентов - это отдельная гонка)

Но к чему я это все. Мы делаем ровно то же самое, когда читаем новости через призму своих убеждений. И вот что меня по-настоящему зацепило: кросс-чекер, второй агент, чья единственная работа ловить ошибки первого, подтверждал неправильные ответы. Это anchoring bias в чистом виде, когда проверяющий видит уверенный ответ, он ищет подтверждение, а не опровержение. Знакомо не так ли?

Напомню: это задача, где есть правильный ответ. Не "порассуждай о смысле жизни", а "какая ставка налога в Нидерландах по Box 3". И даже здесь две трети ответов нельзя использовать без ручной проверки, или десятка повторных прогнов.

А теперь экстраполируем это на всё на темы, где правильного ответа нет в лоб - стратегия, инвестиции, медицина. Или петли обратной связи так далеко, что нам будет сложно проверить это сразу, или даже за пару месяцев.

Но вот что забавно - это ведь не только про AI. Люди производят тот же слоп, просто на другом уровне. Целая нью-эйдж индустрия построена на том же баге: берёшь красивую мысль, она резонирует с тем что хочешь услышать, проверять неприятно или муторно - и вот ты уже живёшь в модели мира, которая ни разу не столкнулась с реальностью.
"Вселенная изобильна, просто разреши себе принять" - звучит как prompt injection для лимбической системы. Тёплый тон, уверенный слог, который обходит критическое мышление именно потому, что не хочется его проверять. Но так приятно откинуть всю эту сложность и недвойственность мира, все эти противоречия, и просто растворится в одном простом утверждении о мире. Теперь наконец все понятно. Пошел пить свой лавандовый раф.
Разница между AI-слопом и human-слопом только в скорости производства. Механизм один: генерация без проверки реальностью.

Вывод в том, что проверка реальностью - это не "спроси второй раз". Настоящая верификация — это выстроенная методология, другие источники, другой угол атаки, также как с людьми, чеклисты, фреймворки, kpi, аудит, и циклы обратной связи. Я делал стартапы, даже если собрать много умных людей в один проект, показать им направление, и сказать - а теперь придумайте продукт и заработайте мне много денег - без выстроенного процесса, и чего-то еще почти магического и неуловимого - они обречены плодить слоп, я знаю, я пробовал. Поэтому я люблю науку, а шаманов уважаю: репликация эксперимента другой командой, другим методом. Хотя, конечно, свадьба души и рассудка - это отдельная песня.
  • ❤ 62
  • 👍 15
  • 🔥 10
  • ❤‍🔥 3
More from @eugene_rid
  1. Sep 24, 2026Ребята, 23-25 октября я делаю ai-инвест-коворкнинг для своих-своих в Швейцарии (40 мин от…
  2. Sep 15, 2026Ситуация с уравнением Навье Стокса
  3. Sep 15, 2026Это прекрасно))))
  4. Sep 12, 2026Как я провел Август Начнем с истории, в 1961-м Марвин Минский описал задачу, которая никуд…
  5. Sep 2, 2026Никаких глубокий рассуждений сегодня, просто если вы вдруг не знали, то начали снимать "Со…
  6. Aug 21, 2026Обратите внимание на новый вид фишинга, в коментариях к постам часто пишут что-то соотвест…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →