Всем привет!
Если вы хотели найти набор данных (data set) для тестирования инструментов по поиску секретов или для обучения модели, то CredData – Credentials Data – от Samsung может вам подойти!
Набор данных состоит из 19,459,282 строк кода, которые были «извлечены» из 11,408 файлов, находящихся в 297 репозиториях.
Данные также разделены по языкам:
Golang, YAML, Python, Markdown, PHP и т.д. Для некоторой части данных реализована разметка.
С использованием этого набора команда Samsung, в том числе, сделала сравнительный анализ таких open-source решений, как:
detect-secrets, gitleaks, truffleHog и не только.Кстати, в сравнении участвовал и собственная разработка Samsung – CredSweeper, с которым можно ознакомиться тут.
Результаты сравнения, больше информации о CredData можно найти в GitHub-репозитории проекта.