TGViewer
MedData Lab MedData Lab @meddatalab · 391 subscribers
Post #104 210
Когда данные слишком красивые

В конце августа 2011 года трое молодых исследователей из Tilburg University пришли к руководству университета с довольно тяжёлым подозрением.

Они сомневались в данных своего научного руководителя — Дидерика Штаппела.

На тот момент Штаппел был одним из самых известных социальных психологов Нидерландов. Профессор, декан факультета социальных и поведенческих наук Tilburg University, автор множества публикаций, в том числе в Science и Journal of Personality and Social Psychology.

Но с его данными было что-то не так. Они были слишком хорошими.
Эффекты — выраженными.
Результаты — удивительно согласованными.
Данные — подозрительно чистыми.

А когда коллеги пытались разобраться, как именно они были получены, возникала ещё одна проблема: доступа к исходным материалам практически не было.

Университет начал расследование.
И дальше масштаб оказался гораздо больше, чем можно было представить.

Комиссии Tilburg University, University of Groningen и University of Amsterdam в итоге установили мошенничество в 55 публикациях Штаппела. Ещё в 11 работах были обнаружены признаки возможной фальсификации. Фальсифицированные данные попали и в 10 докторских диссертаций его студентов — сами аспиранты при этом не были признаны причастными к мошенничеству.

Позднее число отозванных публикаций Штаппела достигло 58.

Как всё это могло продолжаться столько лет?
Во многом потому, что Штаппел фактически контролировал этап сбора данных самостоятельно. Коллегам он передавал уже готовые наборы для анализа. Исходные анкеты, первичные записи и сам процесс сбора данных они часто не видели.
А дальше система работала вполне привычно: статья поступала в журнал, рецензенты оценивали дизайн, статистику, логику выводов, текст.
Но исходных данных у них не было.

И это, пожалуй, одна из самых интересных частей этой истории.

Мы привыкли воспринимать рецензирование как серьёзный фильтр качества исследования. И оно действительно таким фильтром является. Но peer review не означает, что кто-то независимо проверил, существовали ли все эти пациенты, анкеты или измерения и совпадают ли опубликованные цифры с исходными файлами.
Если исходные данные сфабрикованы достаточно убедительно, обнаружить это по одной статье может быть очень сложно.

Дело Штаппела стало одним из самых громких эпизодов кризиса воспроизводимости в психологии и усилило разговор о том, что исследовательский процесс должен быть прозрачнее: хранение и доступность данных, предрегистрация, репликации, возможность независимо проверить анализ.

Есть у этой истории и почти гротескный эпилог.

После разоблачения Штаппел написал книгу о собственном падении — Ontsporing. А затем исследователи заметили, что в одной из глав он использовал фразы из произведений Реймонда Карвера и Джеймса Джойса без кавычек. Источники при этом были указаны отдельно в приложении.

История получилась почти слишком символичной.

И, пожалуй, именно поэтому эта история так хорошо запомнилась научному сообществу: насторожили исследователей не выбросы и не хаос в данных, а наоборот — их почти неправдоподобная аккуратность.
  • 🔥 4
  • 🙈 4
  • ❤ 3
  • 👍 3
  • 🤩 1
  • 🤓 1
More from @meddatalab
  1. Sep 21, 2026Вернёмся к голосовалке из прошлого поста. Напомню условие: исследование сравнивало два мет…
  2. Sep 16, 2026Я снова студент 😏 Теперь — магистратуры ВШЭ. Так что посты могут иногда выходить чуть реж…
  3. Sep 10, 2026Post #106
  4. Sep 10, 2026p = 0,2. Значит, эффекта нет? Наверняка вы встречали в статьях что-то вроде: «Статистическ…
  5. Aug 31, 2026Почему не каждую переменную нужно включать в модель: конфаундер vs коллайдер Когда мы стро…
  6. Aug 29, 2026MedData Lab pinned «31 августа начинаем третий поток курса по анализу данных в R До старта…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →