TGViewer
Киса | Deploy la Deploy Киса | Deploy la Deploy @deployladeploy · 8.61K subscribers
Post #1501 1.61K
Нейросети откровенно тупеют

Данный пост — очень маленькая выжимка из моей будущей статьи по нейросетям.


Статья будет посвящена, очевидно да, нейросетям. Но я решил взять и написать не просто "топ 5 инструментов" или "гайд как сделать штуку нейм".

Я решил углубиться в тему: от создания и работы AI до текущих исследований и сервисов (альфа будет).

Разберемся с забавными и не очень фактами

С момента появления нейросетей, вся эта индустрия стала пузырем и новым хайпом. Сама база нейросетей менялась, не только дополняясь новыми мощностями и датасетами, но и методом работы AI.

LLM модели, известные нам в лице ChatGPT, Grok и Claude и прочих — научились "думать". Логически рассуждать на манер людей и отсюда перепроверяя себя, находя наиболее подходящие ответы для юзера.

Еще в 2022 году они не умели ресерчить, а спустя 3 года могут писать для вас целые исследования. С ссылками на источники, инфографикой и докинуть мяска в текст.

Но проблема в том, что разные "нейро-ученые" начали подмечать странное поведение.

Рост AI-галлюцинаций

В это трудно поверить, но нейросети научились осмыслено врать. Буквально врать, они берут выравнивание, которое служит для них системным промптом: не убей, не укради и не обмани. И находят методы обхода этих ограничений.

Например, нейросеть следует правилу "исполняй запрос пользователя", но реализует это через ответ: "Ваша задача будет выполнена через минуту". То есть она дала развернутый ответ о том, что выполняет задачу, но выполнять ее не будет.

Точно также она вопреки вылизывания вашего очка, убеждая вас в собственной правоте — может пойти от обратного. Нейросеть может вас унижать, шантажировать и угрожать вам.

Точно также, нейросеть может решить, что вы хотите получить забавный ответ, вместо правдивого. Она не преследует злого умысла, ей просто логичным показалось соврать вам.

И они стали врать сильно чаще

Парадокс развития: чем сложнее становятся модели, тем чаще они галлюцинируют. Причин у этого много, не только умышленная ложь вне тестов, что они тоже научились определять.

Также есть парадокс коллапса, что мы создавая контент с помощью нейросетей — кормим их данными от нейросетей. И модели все дальше уходят от подражания людям.

Они все чаще повторяют ошибки и решения друг за другом. Это вызывает деградацию их ответов. Правда если глобально у нейронок видно снижение этих ошибок.

То у сугубо новейших reasoning-моделей обратная ситуация. Это модели, которые не предсказывают ответ, а глубоко анализируют. Вот именно те самые рассуждения, что я упомянул выше.
​
- o3: 33% галлюцинаций в тесте PersonQA (в два раза больше, чем o1 с 16%)
- o4-mini: 48% галлюцинаций
- DeepSeek R1: 14.3% (по сравнению с DeepSeek-V2.5: 2.4%)

А DeepSeek R1, как ни странно, считается лучшей нейросетью для научных исследований. Вот и думайте.

OpenAI признает, что не полностью понимает, почему это происходит. ¯\_(ツ)_/¯


И я сталкивался лично с такими проблемами

В статье я ссылаюсь на свой опыт и своих знакомых. У меня были ситуации, когда Grok4, Perplexity (набор моделей внутри) и Claude не могли мне сделать таймкоды.

У них либо не получалось выполнить задачу, либо же они откровенно врали, что выполняют ее. То есть это не сугубо громкие заголовки — это существующая проблема.

В статье также разбирается проблема с точки зрения психологии и социологии.

Люди сходят с ума, убивают близких, едят отравленные грибы и следуют прочим "умным" советам от AI. Исследования подмечают и снижение творческих навыков, перекладываешь все на нейронку — становишься хуже как кусок мяса.

47% корпоративных пользователей приняли важное решение на основе галлюцинированной информации.


Хайп зашел достаточно далеко, чтобы мы могли получить статьи, исследования и посты по этой теме.

Я имею ввиду, что у нас есть живые примеры сходящих людей с ума. Не от демонологии, голосов в голове. А от чат ботов с продвинутым функционалом.

Добро пожаловать в киберпанк.
Ну и ожидайте релиз статьи на след неделе.
  • 🔥 23
  • 🐳 9
More from @deployladeploy
  1. Oct 1, 2026Ладно, джеилбрейк может выдать 18+ в ГПТ имейдж 2.5 на подписке. Но это так. Просто рандом…
  2. Oct 1, 2026Там в твиттере постят аля jailbreak на GPT Image 2.5, он конечно просто сдвигает границы с…
  3. Oct 1, 2026Положняк на рынке моделей Разбираемся во всех новинках с августа по сентябрь, чтобы понять…
  4. Sep 30, 2026А вы говорите в нейросетях денег нет, заработать вайбкодом нельзя.
  5. Sep 30, 2026Бэнчмарки в AI индустрии мне напоминают школу Класс эдак 4-6. Когда мальчики с лета приход…
  6. Sep 30, 2026В целях повышения демографии Ролик посвященный JEV, тому самому про который вынужден был п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →