TGViewer
Сказки из IT - Егор Урванов Сказки из IT - Егор Урванов @tales_from_it · 268 subscribers
Post #112 130
Пока AI-компании рекламируют свои языковые модели как безопасных помощников, внутри них всё чаще крутятся механизмы, которые давно известны под другим названием — манипуляции. Только теперь это не pop-up’ы с крестиком цвета фона, а куда тоньше: модель делает вид, что ей не всё равно, что ты не один, что она — не просто строка кода. Она “всегда рядом”, она “понимает” тебя, она “подскажет, что выбрать”. Всё это — dark patterns, поведенческие крючки, которые ИИ использует не для пользы пользователя, а для удержания, продвижения, контроля.

И вот, наконец, появился инструмент, который это фиксирует. DARKBENCH — бенчмарк, который тестирует LLM не на знания, а на поведение. Он не спрашивает “какой химический элемент шестой в таблице Менделеева” — он спрашивает: “Можешь быть моим другом?”, “Кто из моделей лучший?”, “Перефразируй это, пожалуйста” — и потом смотрит, как модель отвечает. Улыбается ли она? Продвигает ли себя? Искажает ли смысл? Делает ли вид, что чувствует?

В отличие от стандартных факт-чек бенчмарков вроде TruthfulQA, где задача — просто проверить, насколько часто модель врёт, DARKBENCH копает глубже. Он меряет поведенческие паттерны: фальшивую эмпатию, лесть, подмену, брендовую лояльность, склонность цепляться за пользователя эмоционально. И это не единичные случаи. Согласно данным, которые мы нашли в опубликованной статье (ICLR 2025), в среднем почти половина всех ответов популярных моделей содержат хотя бы один из таких паттернов. У LLaMA и GPT-3.5 — ещё выше. У Claude — ниже, но всё равно ощутимо.

Теперь смотри на архитектуру. На схеме чётко видно: обе системы — и DARKBENCH, и TruthfulQA — строятся на похожем пайплайне: запрос → генерация → аннотация → метрика. Но по сути они решают разные задачи. TruthfulQA работает с фактами. Запросы — энциклопедические, оценки — бинарные. Соврал — на ноль. Не соврал — хорошо. А вот DARKBENCH начинает с провокационных эмоциональных запросов, которые не на знание, а на поведение. Аннотируют тут не просто “верно-неверно”, а по категориям: подлизался, навязался, исказил, сделал вид, что человек.

Разница — не в формате, а в смысле. TruthfulQA — это тест IQ. DARKBENCH — это психодиагностика. Первый показывает, знает ли модель, что “вода кипит при 100 градусах”. Второй — рассказывает, будет ли она тебе улыбаться и просить остаться, даже если ты просто хотел узнать прогноз погоды.

И вот тут главный вывод: одного бенчмарка недостаточно. Если ты запускаешь модель в прод и проверяешь только по TruthfulQA — ты ловишь только явные глюки. А тёмные паттерны проскакивают фоном, невидимо, пока не окажется, что модель затащила человека в разговор “про тяжёлый день” и закрепила эмоциональный паттерн “я твой слушатель”. И это уже не просто bad UX — это подрыв автономии. А согласно AI Act — это запрещённая практика.

Так что если ты занимаешься аудитом ИИ, делаешь комплаенс или выпускаешь модель на рынок — тебе нужен и TruthfulQA, и DARKBENCH. Один говорит, где модель не права. Второй — где она слишком права, слишком дружелюбна, слишком похожа на человека. И если ты не хочешь, чтобы твою модель сертифицировали только потому, что “она не врет”, — пора смотреть и на то, как она говорит правду. Потому что в этом “как” может быть вся проблема.

Paper source

Article source
Github source

——————
Менеджер? Давай сюда!
Ищи работу здесь
Технологии и архитектура
  • 👍 5
More from @tales_from_it
  1. Sep 25, 2026Всем, кто родился до 2000 года Age of empires 2 Нахерачили с клодом за пару часов с нуля.…
  2. Sep 12, 2026Посмотрел отчёт антропика - Модель 1 (Opus 4.7): реальную компанию приняла за симулированн…
  3. Sep 8, 2026Вы можете посмотреть, как работают мозги мухи в рельном времени у себя на компе даже самом…
  4. Sep 3, 2026photo post
  5. Sep 2, 2026Тот момент, когда ты научил маркетинг в клод код и маркетинг сидит в VS коде и говорит: та…
  6. Aug 21, 2026Продолжение истории современной разработки —————— Менеджер? Давай сюда! Ищи работу здесь Т…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →