TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10115 24.5K
📌Модели при длительной работе с документами в среднем теряют около четверти их содержимого

Команда Microsoft Research опубликовала препринт, в который демонстрирует, что современные LLM при долгом редактировании документов вносят редкие, но серьёзные искажения.

Для проведения эксперимента был создан бенчмарк DELEGATE-52 из 310 рабочих сценариев в 52 областях, от программирования и кристаллографии до нотной записи и генеалогии.

Методика тестирования основана на принципе обратимости: модель получает задание изменить документ, а затем - обратную инструкцию, которая должна вернуть его к исходному виду. Чем сильнее итоговый файл отличается от оригинала, тем больше накопленных ошибок.

В эксперименте прогнали 19 моделей, включая GPT-5.4, Claude 4.6 и Gemini 3.1 Pro на документах в 3–5 тысяч токенов и контекстом до 12 тысяч токенов.

По результатам эксперимента, после 20 последовательных правок эти 3 модели в среднем повреждают около 25% содержимого документа, а среднее значение по всей выборке составило около 50% потерь.

Лучший результат показала Gemini 3.1 Pro: она признана готовой к делегированию (≥98% сохранения исходного содержания) только в 11 из 52 областей.

Единственная область, где большинство моделей справляется почти без потерь, — программирование на Python: 17 из 19 моделей сохраняют код практически без искажений.


Хуже всего модели работают с тестом и редкими форматами: рецептами, художественной прозой, нотами и финансовыми отчетами.

Дополнительные тесты показали, что подключение агентских инструментов поиска, выполнения кода, прямой правки файлов - в базовой реализации не улучшает результат, а в среднем добавляет около 6% потерь.

Авторы заметили, что объём документа, длина взаимодействия и наличие посторонних файлов в контексте также ухудшают качество, причём эти эффекты, накапливаются и со временем усиливают друг друга.


По наблюдениям, потери распределены неравномерно: чаще всего модель работает почти безупречно, но раз в несколько шагов допускает резкий сбой и теряет 10–30% содержимого за одну итерацию. Такое поведение объясняет около 80% всех зафиксированных потерь.

Слабые модели чаще удаляют фрагменты целиком, топовые - искажают то, что остаётся в документе.


📌Лицензирование: MIT License


🟡Arxiv
🟡Датасет
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #DELEGATE52 #Microsoft
  • 🤔 54
  • 👍 37
  • 😇 29
  • ❤ 14
  • 👏 13
  • 👀 11
  • 🤣 3
  • 🔥 1
More from @ai_machinelearning_big_data
  1. Oct 7, 2026⚡ Anthropic представила Claude Haiku 5.5 Claude Haiku 5.5 - самая быстрая и доступная моде…
  2. Oct 7, 2026🌟 MIT CSAIL опубликовала модель разметки анатомии на рентгеновских снимках MIT вместе с к…
  3. Oct 7, 2026GPU, токены и деньги: как балансировать на ИИ-арене? 15 октября на ежегодной конференции O…
  4. Oct 7, 2026🌟 VeriHarness: обвязка для проверки работы агентов той же моделью Google AI Research и Ке…
  5. Oct 7, 2026⚡️ Google выпустила Nano Banana 2.1 Модель построена на базе Gemini 3.6 Flash и предназнач…
  6. Oct 7, 2026✔️ TikTok добавил ИИ-ассистента для покупок и оплату в один клик Платформа расширила комме…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →