11 миллиардов компаниям-призракам: расследование, которое началось с двух баз
Международная премия Sigma Awards назвала лучшие дата-расследования года. Один из победителей — «Призраки казны» мексиканской команды Quinto Elemento Lab. Разбираю метод, потому что он ровно про то, что меня драйвит в дата-журналистике.
🐱 Что они сделали
Взяли две открытые базы: госконтракты страны за 20 лет и официальный список фирм-однодневок от налоговой. И скрестили их между собой. На пересечении — компании-призраки, которые не имели ни ресурсов, ни сотрудников, но получали бюджетные деньги.
🐱 Что нашли
За четыре президентских срока фантомам ушло 11,5 млрд песо (около 660 млн долларов) — примерно 1,5 млн песо госсредств каждый день на протяжении 20 лет. Почти половина всей суммы — всего у десяти компаний.
🐱 Почему это красивый метод
По отдельности обе базы публичны и выглядят безобидно: вот контракты, вот список сомнительных фирм. Всё интересное — в пересечении. Сопоставить сотни тысяч записей вручную нереально, поэтому мексиканцы связали базы с помощью кода на языке R.
🐱 А что нам с этого
С российскими реестрами тоже так можно. Помните мой разбор рыбозавода из Ногинска, «заработавшего» четверть ВВП, или фантомной компании «Банкнота», которая обошла по прибыли «Газпром»? Тот же принцип: берёшь официальные данные, ищешь аномалию, идёшь проверять.
Мексиканцы сделали это в большем масштабе и на автоматизации — и это ровно тот навык, который мне сейчас супер интересен: скрещивать большие базы с помощью кода и нейронок. Подробнее про методику этого расследования можно прочитать здесь.
Post #79
97