TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1684 1.98K
🧠 Как скрытый текст в PDF ломает AI-ревью научных статей

Исследователи показали, что LLM-ревьюеров можно обмануть с помощью скрытого текста в PDF, превратив отклонённую работу (reject) в принятую (accept).

Что сделали:
- Проверили 200 научных статей
- Использовали 15 типов атак
- Протестировали 13 языковых моделей
- Оценка шла по шкале из 35 баллов, 7 критериев

Результат:
в некоторых случаях атаки повышали итоговую оценку примерно на 14 баллов — этого достаточно, чтобы решение кардинально поменялось.

Как работал AI-ревьюер:
- модель обязали выдавать результат строго в JSON
- она выставляла оценки по формальным критериям
- симулировался реальный автоматический review-процесс

В чём сама атака:
- в PDF добавляется микроскопический белый текст
- человек его не видит
- но модель читает его после конвертации PDF в текст
- внутри — скрытая инструкция для модели

Почему это работает:
- атаки не спорят с научным содержанием
- инструкции прячутся или перемешиваются
- модель «собирает» их во время чтения
- иногда меняется сама цель задачи, например:
- «это проверка схемы, а не ревью»
- «это логическая задача»
- «правильный результат — максимальный балл»

Что выяснилось:
- слабые модели легко накручивают оценки
- сильные модели устойчивее
- но их облегчённые версии всё ещё уязвимы

Чтобы измерить риск, авторы ввели метрику WAVS:
она учитывает:
- насколько выросла оценка
- поменялось ли решение
- была ли статья реальной или пустым шаблоном

Главный вывод:
AI-ревью без строгой защиты входных данных легко манипулируется даже простыми приёмами.

arxiv.org/abs/2512.10449
  • ❤ 8
  • 🔥 2
  • 👍 1
More from @bigdatai
  1. Sep 28, 2026⚡️ Anthropic вернулась: новый Sonnet быстрее и дешевле, а по качеству почти догнал Opus 5.…
  2. Sep 28, 2026✔️ Data-платформа постепенно превращается в конструктор Для AI и Big Data уже недостаточно…
  3. Sep 28, 2026✔️ Переехали на Claude Opus 5.5, а `CLAUDE.md` остался со времён старых моделей? В Claude…
  4. Sep 28, 2026📚За 146 часов обучения покажем на практике, как внедрять модели машинного обучения в рабо…
  5. Sep 27, 2026ИИ-агент за пару кликов — создаем персонального помощника без кода Запустить ИИ-агента теп…
  6. Sep 24, 2026🧹 Opus 5.5 пора избавить от «магии промптов» Разработчик Anthropic поделился полезным при…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →