Инструмент, написанный на Python и разработанный для чистки списков URL-адресов, используемых в задачах краулинга или тестирования на проникновение. Он помогает удалять из списков неинтересные, дублирующиеся или бесполезные ссылки.
Утилита не совершает никаких HTTP запросов, она лишь удаляет заданные ей URL:
⏺️инкрементные URL (/page/1/ и /page/2/);
⏺️записи в блоге и аналогичный контент, написанный человеком (/posts/a-brief-history-of-time);
⏺️URL-адреса с одинаковым путем, но различающимися значениями параметров (/page.php?id=1, /page.php?id=2);
⏺️изображения, css и другие файлы.
Рекомендуемый способ установки:
pipx install uro.👩💻 Использование
Самый простой способ включить uro в свой рабочий процесс — передать ему данные через стандартный ввод и вывести их на терминал:
cat urls.txt | uro
Чтение URL-адресов из файла и запись отфильтрованных адресов в другой файл:
uro -i input.txt -o output.txt
Удаление всех расширений, кроме предоставленных. Страницы без расширений (/books/1), по-прежнему будут включены. Чтобы удалить и их, используйте --filter hasext:
uro -w php asp html
Удаление определенных расширений:
uro -b jpg png js pdf
Также инструмент поддерживает следующие фильтры:
- hasparams: только URL с параметрами запроса;
- noparams: только URL без параметров запроса;
- hasext: только URL, которые имеют расширения;
- noext: только URL без расширений;
- keepcontent: оставляет написанные человеком контент;
- keepslash: оставляет завершающую косую черту в URL;
- vuln: только вывод URL с уязвимыми параметрами (например id).
