Почему нельзя делегировать работу ИИ вслепую
Так хочется отдать всю рутину нейросетям, но не только нам кажется, что ИИ не справляется, но и новое исследование от Microsoft Research подтверждает, что пока рано это делать.
👀 Исследователи проверили 19 моделей (от GPT-4o до новейших Gemini 3.1 Pro и GPT 5.4) в режиме делегирования, т.е. когда ИИ делает серию правок в документах на протяжении долгого времени, на 52 различных типах документов.
🔹В итоге, чем дольше ИИ работает с документом, тем больше в нем накапливается ошибок. К концу цепочки из 20 правок даже топовые модели (Gemini 3.1 Pro, GPT 5.4) «разъедают» в среднем 25% контента.
🔹Нейросети не ошибаются по чуть-чуть в каждой правке. Обычно они работают идеально несколько раундов, а потом выдают критический сбой, который сносит 10–30% структуры документа за раз.
🔹Если ИИ хорошо справился с первыми двумя задачами, это не значит, что он не сломается на десятой. Деградация накапливается лавинообразно.
🔹Чем больше в папке лишних (мусорных) файлов, тем быстрее ИИ начинает путаться и портить основной документ.
🔹ИИ не одинаково хорош во всем. Лучше всего модели справляются с Python, а также с четко структурированными форматами разметки и данных, такими как JSON и Markdown. Здесь ошибки минимальны даже при длинных цепочках правок. ИИ не одинаково хорош во всем. Лучше всего модели справляются с Python, а также с четко структурированными форматами разметки и данных, такими как JSON и Markdown. Здесь ошибки минимальны даже при длинных цепочках правок. Хуже всего дела обстоят со специализированными форматами: кристаллографией (CIF), музыкальной нотацией (ABC) и 3D-объектами (STL). Здесь ИИ ломает структуру документа почти мгновенно.
🔹 Эксперименты показали, что текущие агенты справляются даже хуже, чем обычные чат-боты, из-за сложности управления инструментами на длинной дистанции.
❕ИИ по-прежнему, как очень энергичный, но невнимательный джуниор, который может не только документ поправить, но и случайно выкинуть ваш паспорт или стереть доказательства. Поэтому продолжаем мониторить и контролировать его правки, а длинные рабочие цепочки разбиваем.
#UXWatch
————
@pattern_ai | AI GDPR Navigator
Post #353
122