Мы слишком полагаемся на способность ИИ говорить «нет»
Современные ИИ-модели учат отказывать на опасные запросы, но отказ работает вероятностно: его можно обойти, а иногда модель отклоняет безобидные вопросы. По мере развития ИИ такие сбои могут привести к катастрофам, а сами отказы — дать компаниям и государствам инструмент цензуры. Исследователи пока не до конца понимают, какие внутренние процессы заставляют модель сказать «нет». При этом модели всё чаще используют в критически важных сферах, где полагаться на безупречность этих механизмов рискованно.
👉 Читать полностью
Post #8015
3