ложь, галлюцинации и катастрофы ии
На фоне последних новостей про допуск аудиторов к разработчикам ИИ, вспомнила, что Big4 аудиторов (Deloitte, PwC, EY и KPMG) появилось благодаря требованию публиковать бухгалтерские отчетности публично в Великобритании с середины 19 века. Потом появились Big3 стратегов (McKinsey, BCG, Bain & Co), и Big5 в недвижимости (CBRE, Jones Lang LaSalle (JLL), Cushman & Wakefield, Colliers, Knight Frank).
И кажется, что если что и есть важного для социальных наук в исследовании ИИ, так это вопросы безопасности, с которыми работают оценщики ИИ, и касается она не только технических аспектов, но и вопросов аргументации, логики и лжи как стратегического нарушения правил.
""""""""""""""""""
METR дает оценку рисков, но одновременно у нее есть статьи про то, как контролировать логику аргументации (CoT - Chain-of-thought, вспоминаем цепочки преобразования фреймов у Гоффмана). [1, 2, 3]
Apollo Reasearch дает увлекательнейшее исследование попыток натренировать ИИ не лгать и не подтасовывать результаты и то, как эти методы слабо действуют гамму на 26 типов лжи от ИИ.
А отдельная группа исследователей показывает, что между галлюцинациями ИИ (которые являются сбивкой в логике) и обманом ИИ существует огромная разница - второй является стратегическим действием и результатом продвинутой аргументации "интеллекта". [4, 5]
При этом если говорить об ИИ катастрофах в классификации Redwood Research, то они вероятнее всего при несанкционированном развертывании сверхмощных ИИ, которое будет выходить за пределы одной системы и тогда, действительно будет больше похоже на взрыв.
И наконец описание аудита систем с ИИ [6, 7]
Развернутый список публикаций в комментарии.
#иииследования
Post #3105
175
- ❤ 3
- 🔥 1