Несистематизированные заметки о международных отношениях, технологическом развитии цифрового общества и ускользающей в нём "правде".
#disinformation #AI #post_truth
Автор: @yy_kv
https://www.researchgate.net/profile/Yury-Kolotaev
Post #573
89
🕰 Замедление и кроличьи норы 🕳
2026 претендует на то, чтобы стать годом, когда страшилки про автономный ИИ все-таки воплотятся в сети. С весны мы уже успели стать свидетелями нескольких случаев переноса релизов передовых моделей из соображений безопасности, а потом ещё и взломов различных платформ. Вся хронология событий тут.
📰 Сначала речь будто шла скорее о маркетинговой стратегии, но последние пару дней главы ИИ-компаний массово начали говорить о необходимости притормозить развитие моделей. Раньше такие заявления скорее свидетельствовали о догоняющем положении стороны. Другое дело, что сейчас уже мало кто даст пойти по такому пути. На повестке конкуренция США и КНР, а президент Трамп слишком много (даже по своим меркам) дал хвалебных комментариев об американском ИИ.
И на этом фоне особенно бросается в глаза то, на каком уровне понимания технологии находится на самом деле отрасль. В год, когда из всех рупоров кричат заветное слово «ИИ-агенты», специалисты по работе с цифровыми инструментами делают шаг назад и говорят, что на самом деле они пока не разобрались даже с тем, что делать с эффектом кроличьей норы при работе с LLM.
🔍 Если кратко, то речь про то, как пользователь, вне зависимости от его уровня экспертизы, затягивает себя в водоворот самоподтверждения. Согласие, заигрывание и вовлечение – вот те компоненты языковых моделей, которые превращают работу с моделями либо в процесс подтверждения мнения, либо в изощренную процедуру пользовательского сопротивления. Больше всего последствий от этого у уязвимых групп населения.
Интересно, что исследователь Хенк ван Эсс говорит, что во всем виновато обучение с подкреплением на основе человеческого опыта. Разработчики системно заложили, что правильно то, что соответствует нашему представлению о правильности и удовлетворяет наши потребности (объективные и субъективные). Нередко такое представление уже зашито в задаваемые запросы.
❔Вот и вопрос, можем ли мы в процессе работы с LLM быть уверенными, что уже не свалились в нору, и когда нужно остановиться. В исследовании выше выводы сделаны на основе скорее нетипичных примеров из области бытовой конспирологии. Но тем больше настораживает возможность того, что найденные закономерности более универсальны.
Получается, часть выводов о работе LLM мы можем узнать только эмпирически на самих себе. Вне таких наблюдений ИИ – тот же черный ящик. В коде не содержится ничего, что могло бы нам лучше рассказать о галлюцинациях и ошибках, которые мы воспроизводим сами. Вот и выходит, что если сначала все хотели снять с LLM фильтры и ограничители, чтобы общаться более естественно, то теперь, столкнувшись с этой "естественностью", повестка сменилась в сторону замедления и внутренних фильтров для защиты пользователей. А всего-то навсего мы сами себя в зеркало увидели (об этом см. тут).
2026 претендует на то, чтобы стать годом, когда страшилки про автономный ИИ все-таки воплотятся в сети. С весны мы уже успели стать свидетелями нескольких случаев переноса релизов передовых моделей из соображений безопасности, а потом ещё и взломов различных платформ. Вся хронология событий тут.
📰 Сначала речь будто шла скорее о маркетинговой стратегии, но последние пару дней главы ИИ-компаний массово начали говорить о необходимости притормозить развитие моделей. Раньше такие заявления скорее свидетельствовали о догоняющем положении стороны. Другое дело, что сейчас уже мало кто даст пойти по такому пути. На повестке конкуренция США и КНР, а президент Трамп слишком много (даже по своим меркам) дал хвалебных комментариев об американском ИИ.
И на этом фоне особенно бросается в глаза то, на каком уровне понимания технологии находится на самом деле отрасль. В год, когда из всех рупоров кричат заветное слово «ИИ-агенты», специалисты по работе с цифровыми инструментами делают шаг назад и говорят, что на самом деле они пока не разобрались даже с тем, что делать с эффектом кроличьей норы при работе с LLM.
🔍 Если кратко, то речь про то, как пользователь, вне зависимости от его уровня экспертизы, затягивает себя в водоворот самоподтверждения. Согласие, заигрывание и вовлечение – вот те компоненты языковых моделей, которые превращают работу с моделями либо в процесс подтверждения мнения, либо в изощренную процедуру пользовательского сопротивления. Больше всего последствий от этого у уязвимых групп населения.
Интересно, что исследователь Хенк ван Эсс говорит, что во всем виновато обучение с подкреплением на основе человеческого опыта. Разработчики системно заложили, что правильно то, что соответствует нашему представлению о правильности и удовлетворяет наши потребности (объективные и субъективные). Нередко такое представление уже зашито в задаваемые запросы.
❔Вот и вопрос, можем ли мы в процессе работы с LLM быть уверенными, что уже не свалились в нору, и когда нужно остановиться. В исследовании выше выводы сделаны на основе скорее нетипичных примеров из области бытовой конспирологии. Но тем больше настораживает возможность того, что найденные закономерности более универсальны.
Получается, часть выводов о работе LLM мы можем узнать только эмпирически на самих себе. Вне таких наблюдений ИИ – тот же черный ящик. В коде не содержится ничего, что могло бы нам лучше рассказать о галлюцинациях и ошибках, которые мы воспроизводим сами. Вот и выходит, что если сначала все хотели снять с LLM фильтры и ограничители, чтобы общаться более естественно, то теперь, столкнувшись с этой "естественностью", повестка сменилась в сторону замедления и внутренних фильтров для защиты пользователей. А всего-то навсего мы сами себя в зеркало увидели (об этом см. тут).
- ❤ 4
- 👍 3
- 👏 3








