В России появился первый специализированный датасет поддельных документов, предназначенный для обучения антифрод-моделей.
Его представила российская компания Smart Engines, выпустив открытый набор данных MIDV-DM объёмом 8 тысяч изображений. Датасет создан на базе MIDV-2020 и включает наиболее распространённые методы фальсификации удостоверений личности, что делает его инструментом для разработки и тестирования систем выявления мошенничества.
В набор собраны ключевые типы подделок: замена текстовых полей и фотографий, скрытие отдельных данных, компоновка фрагментов разных документов, а также внедрение посторонних визуальных элементов вроде голограмм и эмблем. MIDV-DM призван помочь разработчикам по всему миру улучшать точность антифрод-алгоритмов и обучать ИИ работе со сложными формами подделок.
По данным МВД, в 2024 году число уголовных дел о подделке документов выросло на 34%, достигнув почти 3,9 тыс. случаев. Гендиректор Smart Engines Владимир Арлазаров отметил, что новый датасет содержит продвинутые варианты фальсификаций, позволяющие ИИ выявлять не только изменения текста, но и структурные несоответствия документа.
Smart Engines планирует использовать MIDV-DM для дальнейшего развития собственной антифрод-платформы «Шерлок 2о мультимодальной ИИ-модели, которая проверяет документы по 600 параметрам, включая анализ изображений в разных спектрах, чтение данных чипов и штрих-кодов. Система ориентирована на высокоточную идентификацию подлинности удостоверений.
питупи цинус
Post #2729
651