Как мы находим дубликаты мемов.
В октябре я писал, насколько нетривиально находить дубликаты картинок: алгоритмы поиска похожих картинок триггерятся на мемы, в которых была использована одна и та же "основа".
И тут мы подумали, а что если доставать текст с картинки и сравнивать уже их? В итоге, даже если кто-то обрезал мем или наложил свою вотермарку, текст (а.к.а. контент) останется тем же. Тут-то мы их и схватим!
Попробовав кучу open source решений, мы остановились на платном гугловском OCR - он еще и язык определяет, что очень полезно будет для будущей трансформации в МЕЖДУНАРОДНЫЙ ПРОЕКТ.
@ffmemesbot
Post #82
463
NEWS @ Fast Food Memes / ffmemes Выяснилось, что алгоритмы поиска "похожих" изображений для мемов не всегда круто работают: обычно мемы имеют схожую основу, но разные тексты на фото. Я нашел 300 мемов-дублей (1%), у которых метрика схожести была очень высокой, и убрал их.