Данный пост — очень маленькая выжимка из моей будущей статьи по нейросетям.
Статья будет посвящена, очевидно да, нейросетям. Но я решил взять и написать не просто "топ 5 инструментов" или "гайд как сделать штуку нейм".
Я решил углубиться в тему: от создания и работы AI до текущих исследований и сервисов (альфа будет).
Разберемся с забавными и не очень фактами
С момента появления нейросетей, вся эта индустрия стала пузырем и новым хайпом. Сама база нейросетей менялась, не только дополняясь новыми мощностями и датасетами, но и методом работы AI.
LLM модели, известные нам в лице ChatGPT, Grok и Claude и прочих — научились "думать". Логически рассуждать на манер людей и отсюда перепроверяя себя, находя наиболее подходящие ответы для юзера.
Еще в 2022 году они не умели ресерчить, а спустя 3 года могут писать для вас целые исследования. С ссылками на источники, инфографикой и докинуть мяска в текст.
Но проблема в том, что разные "нейро-ученые" начали подмечать странное поведение.
Рост AI-галлюцинаций
В это трудно поверить, но нейросети научились осмыслено врать. Буквально врать, они берут выравнивание, которое служит для них системным промптом: не убей, не укради и не обмани. И находят методы обхода этих ограничений.
Например, нейросеть следует правилу "исполняй запрос пользователя", но реализует это через ответ: "Ваша задача будет выполнена через минуту". То есть она дала развернутый ответ о том, что выполняет задачу, но выполнять ее не будет.
Точно также она вопреки вылизывания вашего очка, убеждая вас в собственной правоте — может пойти от обратного. Нейросеть может вас унижать, шантажировать и угрожать вам.
Точно также, нейросеть может решить, что вы хотите получить забавный ответ, вместо правдивого. Она не преследует злого умысла, ей просто логичным показалось соврать вам.
И они стали врать сильно чаще
Парадокс развития: чем сложнее становятся модели, тем чаще они галлюцинируют. Причин у этого много, не только умышленная ложь вне тестов, что они тоже научились определять.
Также есть парадокс коллапса, что мы создавая контент с помощью нейросетей — кормим их данными от нейросетей. И модели все дальше уходят от подражания людям.
Они все чаще повторяют ошибки и решения друг за другом. Это вызывает деградацию их ответов. Правда если глобально у нейронок видно снижение этих ошибок.
То у сугубо новейших reasoning-моделей обратная ситуация. Это модели, которые не предсказывают ответ, а глубоко анализируют. Вот именно те самые рассуждения, что я упомянул выше.
- o3: 33% галлюцинаций в тесте PersonQA (в два раза больше, чем o1 с 16%)
- o4-mini: 48% галлюцинаций
- DeepSeek R1: 14.3% (по сравнению с DeepSeek-V2.5: 2.4%)
А DeepSeek R1, как ни странно, считается лучшей нейросетью для научных исследований. Вот и думайте.
OpenAI признает, что не полностью понимает, почему это происходит. ¯\_(ツ)_/¯
И я сталкивался лично с такими проблемами
В статье я ссылаюсь на свой опыт и своих знакомых. У меня были ситуации, когда Grok4, Perplexity (набор моделей внутри) и Claude не могли мне сделать таймкоды.
У них либо не получалось выполнить задачу, либо же они откровенно врали, что выполняют ее. То есть это не сугубо громкие заголовки — это существующая проблема.
В статье также разбирается проблема с точки зрения психологии и социологии.
Люди сходят с ума, убивают близких, едят отравленные грибы и следуют прочим "умным" советам от AI. Исследования подмечают и снижение творческих навыков, перекладываешь все на нейронку — становишься хуже как кусок мяса.
47% корпоративных пользователей приняли важное решение на основе галлюцинированной информации.
Хайп зашел достаточно далеко, чтобы мы могли получить статьи, исследования и посты по этой теме.
Я имею ввиду, что у нас есть живые примеры сходящих людей с ума. Не от демонологии, голосов в голове. А от чат ботов с продвинутым функционалом.
Добро пожаловать в киберпанк.
Ну и ожидайте релиз статьи на след неделе.
