parsero

Analyseur de fichiers robots.txt. Lit et teste les entrées robots.txt pour trouver des chemins interdits pouvant contenir du contenu sensible : révèle des panneaux d'admin cachés, des répertoires privés, et des ressources restreintes. robots.txt file analyzer. Reads and tests robots.txt entries to find disallowed paths that might contain sensitive content — reveals hidden admin panels, private directories, and restricted resources.

↗ https://github.com/behindthefirewalls/Parsero

Overview

Parsero reads a website’s robots.txt file and tests all Disallow entries to determine if they’re accessible. Web developers often put sensitive paths in robots.txt (intending to hide them from crawlers) — Parsero finds these and checks which ones return accessible content.

Basic Usage

Parse robots.txt and check disallowed paths

parsero http://target.com

With Bing search integration (find additional hidden paths)

parsero -u http://target.com -sb

Save results

parsero http://target.com -o results.txt

Use Tor for anonymity

parsero http://target.com -t

Options

Basic robots.txt check

parsero -u http://target.com

Bing search for additional content

parsero -u http://target.com -sb

Check with specific HTTP code filter

parsero -u http://target.com -r 200

Output file

parsero -u http://target.com -o output.txt

Verbose

parsero -u http://target.com -v

What Parsero Finds

# Typical robots.txt entries:
# User-agent: *
# Disallow: /admin/
# Disallow: /backup/
# Disallow: /private/
# Disallow: /.git/
# Disallow: /config.php
# Disallow: /wp-admin/
# Disallow: /phpmyadmin/

# Parsero tests each Disallow entry:
# [200] http://target.com/admin/ → ACCESSIBLE (finding!)
# [403] http://target.com/backup/ → Forbidden
# [404] http://target.com/private/ → Not Found

Manual Approach

View robots.txt directly

curl http://target.com/robots.txt
# Test specific paths
curl -I http://target.com/admin/
curl -I http://target.com/.git/

Look for high-value paths:

grep -i "admin\|backup\|config\|private\|secret\|api" robots.txt

Tips

  • robots.txt is meant to guide crawlers, not enforce access control — paths are often accessible
  • Always check robots.txt early in web application testing
  • Common high-value entries: /admin/, /backup/, /.git/, /api/, /internal/
  • Even 403 responses confirm the path exists — useful for enumeration
  • Combine with dirb/gobuster using the robots.txt disallow list as a starting wordlist
Help / Man page
parsero [options]

-u URL      Target URL
-sb         Search Bing for additional paths
-o FILE     Output file
-r CODE     Filter by HTTP response code
-t          Use Tor
-v          Verbose

Vue d’ensemble

Parsero lit le fichier robots.txt d’un site web et teste toutes les entrées Disallow pour déterminer si elles sont accessibles. Les développeurs web mettent souvent des chemins sensibles dans robots.txt (avec l’intention de les cacher aux crawlers) : Parsero les trouve et vérifie lesquels retournent du contenu accessible.

Utilisation de base

# Analyser robots.txt et vérifier les chemins interdits
parsero http://target.com

# Avec intégration de recherche Bing (trouver des chemins cachés supplémentaires)
parsero -u http://target.com -sb

# Sauvegarder les résultats
parsero http://target.com -o results.txt

# Utiliser Tor pour l'anonymat
parsero http://target.com -t

Options

# Vérification basique de robots.txt
parsero -u http://target.com

# Recherche Bing pour du contenu supplémentaire
parsero -u http://target.com -sb

# Vérifier avec un filtre de code HTTP spécifique
parsero -u http://target.com -r 200

# Fichier de sortie
parsero -u http://target.com -o output.txt

# Verbeux
parsero -u http://target.com -v

Ce que Parsero trouve

# Entrées robots.txt typiques :
# User-agent: *
# Disallow: /admin/
# Disallow: /backup/
# Disallow: /private/
# Disallow: /.git/
# Disallow: /config.php
# Disallow: /wp-admin/
# Disallow: /phpmyadmin/

# Parsero teste chaque entrée Disallow :
# [200] http://target.com/admin/ -> ACCESSIBLE (finding !)
# [403] http://target.com/backup/ -> Forbidden
# [404] http://target.com/private/ -> Not Found

Approche manuelle

# Voir robots.txt directement
curl http://target.com/robots.txt

# Tester des chemins spécifiques
curl -I http://target.com/admin/
curl -I http://target.com/.git/

Rechercher les chemins à forte valeur :

grep -i "admin\|backup\|config\|private\|secret\|api" robots.txt

Conseils

  • robots.txt est censé guider les crawlers, pas appliquer un contrôle d’accès : les chemins sont souvent accessibles
  • Toujours vérifier robots.txt dès le début des tests d’applications web
  • Entrées à forte valeur courantes : /admin/, /backup/, /.git/, /api/, /internal/
  • Même les réponses 403 confirment que le chemin existe : utile pour l’énumération
  • Combiner avec dirb/gobuster en utilisant la liste Disallow de robots.txt comme wordlist de départ
Aide / Page de manuel
parsero [options]

-u URL      Target URL
-sb         Search Bing for additional paths
-o FILE     Output file
-r CODE     Filter by HTTP response code
-t          Use Tor
-v          Verbose