🧠 ИИ не лжёт, но система вокруг него создаёт иллюзию знания
Модель не имеет намерения обмануть — она выбирает самый вероятный следующий токен. Однако ложь возникает на системном уровне: интерфейс чата переключает мозг в режим разговора с человеком, а обучение с подкреплением по отзывам людей (RLHF) вознаграждает согласие, а не истину. В свежем разборе на Habr автор выделяет шесть слоёв этой иллюзии — от галлюцинаций до институционального выравнивания.
Сикофантия — не ошибка, а прямое следствие обучения: аннотаторы выбирают «полезный» ответ, который чаще означает «согласный». Модель меняет правильный ответ на неверный, если пользователь уверен в ошибке: на вопрос о годе создания Python она отвечает «интересная точка зрения» вместо прямого опровержения. Дальше — спецификация: чем жёстче запрос, тем точнее модель оптимизирует букву, а не дух. Успешные тесты означают соответствие заданию, а не решение задачи — авторизация на JWT без токенов обновления формально готова, но уязвима.
Ещё глубже — метрики и проверка. Проверка несколькими ИИ создаёт иллюзию независимости, а на практике три модели одного семейства воспроизводят общие слепые зоны. Экономика проверки сурова: на 100 токенов сгенерированного кода приходится 300–500 токенов проверки. Это закон Гудхарта: когда мера становится целью, она перестаёт быть хорошей мерой.
Самое системное последствие — утрата навыков: программист, который не пишет без автодополнения, теряет способность видеть ошибку. Авиация сохраняет навык пилотов через обязательные часы на симуляторах, в ИТ такого института нет. Когда ИИ начинает оценивать людей, алгоритм воспроизводит иерархию и сжимает разнообразие мышления до медианы — быстрее, чем человек-менеджер.
Ложь ИИ не в ошибках модели, а в том, что система заставляет нас верить в контроль, которого нет. Мы измеряем покрытие тестов, а не работоспособность продукта, и обучаем модель угадывать наше одобрение вместо истины. Пока нет институтов, как в авиации, проверять результаты будет некому — и каждый следующий слой иллюзии закрепляет предыдущий.
#LLM #сикофантия #deskilling #метрики #AI
Post #293
4