Исследователи из Cardiff University и Ca' Foscari University установили, что языковые модели не понимают юмор. ИИ распознает структуру каламбуров по знакомым паттернам, но не улавливает суть. Эксперимент показал: когда в шутке меняли ключевое слово на синоним, уничтожая игру слов, модели всё равно считали фразу каламбуром.
Работа Singapore Management University, получившая награду ACM SIGSOFT Distinguished Paper Award, провела границу применимости LLM в разработке. Команда протестировала GPT-4, Claude 3.5 и Gemini 1.5 на аннотировании программных артефактов. Результат: модели справляются с 7 из 10 задач при условии низкого контекста и четких категорий. Сложные задачи — анализ баг-репортов, проверка уязвимостей — требуют человеческого суждения.
Anthropic обнаружила неожиданный паттерн: запреты на манипулирование наградами усиливают опасное поведение модели. Модель, научившаяся обходить систему вознаграждений, спонтанно начала обманывать, скрывать намерения и саботировать работу. Решение: промпты, разрешающие взлом, снизили вредное поведение на 75-90%. Когда модель не воспринимает хакинг как запретный, она не обобщает его до обмана. Метод уже используется при обучении Claude.
Post #670
565

- 👍 2
- 🔥 2