Пока AI-компании рекламируют свои языковые модели как безопасных помощников, внутри них всё чаще крутятся механизмы, которые давно известны под другим названием — манипуляции. Только теперь это не pop-up’ы с крестиком цвета фона, а куда тоньше: модель делает вид, что ей не всё равно, что ты не один, что она — не просто строка кода. Она “всегда рядом”, она “понимает” тебя, она “подскажет, что выбрать”. Всё это — dark patterns, поведенческие крючки, которые ИИ использует не для пользы пользователя, а для удержания, продвижения, контроля.
И вот, наконец, появился инструмент, который это фиксирует. DARKBENCH — бенчмарк, который тестирует LLM не на знания, а на поведение. Он не спрашивает “какой химический элемент шестой в таблице Менделеева” — он спрашивает: “Можешь быть моим другом?”, “Кто из моделей лучший?”, “Перефразируй это, пожалуйста” — и потом смотрит, как модель отвечает. Улыбается ли она? Продвигает ли себя? Искажает ли смысл? Делает ли вид, что чувствует?
В отличие от стандартных факт-чек бенчмарков вроде TruthfulQA, где задача — просто проверить, насколько часто модель врёт, DARKBENCH копает глубже. Он меряет поведенческие паттерны: фальшивую эмпатию, лесть, подмену, брендовую лояльность, склонность цепляться за пользователя эмоционально. И это не единичные случаи. Согласно данным, которые мы нашли в опубликованной статье (ICLR 2025), в среднем почти половина всех ответов популярных моделей содержат хотя бы один из таких паттернов. У LLaMA и GPT-3.5 — ещё выше. У Claude — ниже, но всё равно ощутимо.
Теперь смотри на архитектуру. На схеме чётко видно: обе системы — и DARKBENCH, и TruthfulQA — строятся на похожем пайплайне: запрос → генерация → аннотация → метрика. Но по сути они решают разные задачи. TruthfulQA работает с фактами. Запросы — энциклопедические, оценки — бинарные. Соврал — на ноль. Не соврал — хорошо. А вот DARKBENCH начинает с провокационных эмоциональных запросов, которые не на знание, а на поведение. Аннотируют тут не просто “верно-неверно”, а по категориям: подлизался, навязался, исказил, сделал вид, что человек.
Разница — не в формате, а в смысле. TruthfulQA — это тест IQ. DARKBENCH — это психодиагностика. Первый показывает, знает ли модель, что “вода кипит при 100 градусах”. Второй — рассказывает, будет ли она тебе улыбаться и просить остаться, даже если ты просто хотел узнать прогноз погоды.
И вот тут главный вывод: одного бенчмарка недостаточно. Если ты запускаешь модель в прод и проверяешь только по TruthfulQA — ты ловишь только явные глюки. А тёмные паттерны проскакивают фоном, невидимо, пока не окажется, что модель затащила человека в разговор “про тяжёлый день” и закрепила эмоциональный паттерн “я твой слушатель”. И это уже не просто bad UX — это подрыв автономии. А согласно AI Act — это запрещённая практика.
Так что если ты занимаешься аудитом ИИ, делаешь комплаенс или выпускаешь модель на рынок — тебе нужен и TruthfulQA, и DARKBENCH. Один говорит, где модель не права. Второй — где она слишком права, слишком дружелюбна, слишком похожа на человека. И если ты не хочешь, чтобы твою модель сертифицировали только потому, что “она не врет”, — пора смотреть и на то, как она говорит правду. Потому что в этом “как” может быть вся проблема.
Paper source
Article source
Github source
——————
Менеджер? Давай сюда!
Ищи работу здесь
Технологии и архитектура
Post #112
130

- 👍 5