Што прави алатката
creepyCrawler почнува од URL и собира линкови преку HTML, robots.txt и sitemap. Може да издвојува јавни email адреси, социјални линкови, поддомени, документи, коментари и tracking ознаки. За JavaScript страници има изборна Playwright околина. Резултатите помагаат да се разбере структурата на еден сајт.
Примена во независно истражување
Користете го за попис на јавно објавени документи и за проверка кои надворешни сервиси или профили ги поврзува организација. Ограничете ги бројот на страници и доменскиот опсег за наодите да останат прегледни.
Пример за примена
Истражувачка организација прави попис на јавни прилози на институционален сајт; новинар бара документи што се поврзани од стари страници.
Како да започнете
- Подгответе Python или Docker околина.
- Задајте почетна јавна страница и мал лимит за обработка.
- Прегледајте ги извлечените документи и зачувајте го нивниот извор.
Ограничувања и толкување
Crawling создава сообраќај до сајтот и може да биде ограничен. Tracking ID или заеднички хостинг не докажува заедничка сопственост.