# API de Scraping de Sitemap OpenScraper

*Page HTML : https://openscraper.ai/fr/sitemap-scraper-api · Index pour agents : https://openscraper.ai/llms.txt*

> Crawlez le ou les sitemaps d'un site et récupérez toutes ses URLs en JSON structuré — avec lastmod, priorité et fréquence de mise à jour incluses. Dès 0,01 $ par 1000 URLs, plus 0,002 $ par sitemap crawlé.

## Ce qu'elle fait

Un fichier `sitemap.xml` liste toutes les URLs qu'un site souhaite voir indexées par les moteurs de recherche — le moyen le plus rapide de découvrir l'inventaire complet des pages d'un site sans suivre les liens un par un. Notre API de scraping de sitemap trouve tous les sitemaps publiés par un site (via `robots.txt` et les index de sitemaps) et renvoie chaque URL qu'il contient, avec `lastmod`, `priority` et `changefreq`.

Donnez-lui un domaine et le crawler s'occupe du reste : il localise le sitemap racine (ou l'index de sitemaps), suit chaque sitemap imbriqué qu'il référence, et renvoie toutes les URLs en JSON structuré — prêt pour un audit SEO, une migration de contenu, une veille concurrentielle, ou pour alimenter votre propre scraper.

Vous savez déjà quel sitemap vous intéresse ? Donnez son URL (`https://example.com/sitemap-fr.xml`) plutôt que le domaine et seul ce document est crawlé — pas de `robots.txt`, aucun autre sitemap du site.

- Dès 0,01 $ par 1000 URLs + 0,002 $ par sitemap crawlé
- Données JSON structurées
- Sitemaps imbriqués gérés
- Contournement via IP résidentielles
- Compatible avec tous les sites, dans le monde entier

Les sites qui bloquent les IPs de datacenter peuvent être crawlés via notre pool d'IPs résidentielles sur demande, et il n'y a aucun plafond d'URLs par run.

## Champs renvoyés

`url`, `sitemap_url`, `site`, `lastmod`, `priority`, `changefreq`, `position`, `entry_type`, `search_string`, `scraped_at`.

`lastmod`, `priority`, `changefreq` et `position` sont toujours présents, et valent `null` quand le sitemap ne les déclare pas.

## Tarifs

| Produit | Prix sans abonnement | Prix avec abonnement |
| --- | --- | --- |
| URLs | 0,01 $ / 1 000 URLs | 0,0085 $ / 1 000 URLs |
| Sitemaps | 0,002 $ / sitemap crawlé | 0,0017 $ / sitemap crawlé |

Un run est facturé sur les deux : chaque sitemap téléchargé par le crawl, et chaque URL renvoyée.

IPs résidentielles (pour les sites qui bloquent les IPs de datacenter) : 4× les deux tarifs, activable par run.

Plans et règles des crédits : <https://openscraper.ai/fr/pricing.md>.

## L'utiliser depuis l'API

Le crawl renvoie beaucoup de lignes : exécutez-le en asynchrone et faites du polling (ou récupérez tout le jeu de résultats via `GET /runs/:id/export.json`).

```bash
curl -X POST https://api.openscraper.ai/runs \
  -H "Authorization: Bearer sk_live_xxx" \
  -H "Content-Type: application/json" \
  -d '{
    "module": "sitemap_matrix",
    "params": {
      "url": "https://www.mercedes-benz.com/",
      "max_results": 50000,
      "crawl_timeout": 60,
      "concurrency": 15,
      "use_residential": false
    }
  }'
```

| Module | Rôle | Paramètres clés |
| --- | --- | --- |
| `sitemap_matrix` | Découvre et crawle le(s) sitemap(s) d'un site | `url` (domaine racine), `max_results` (sans plafond), `crawl_timeout`, `concurrency`, `use_residential` |

Référence complète des paramètres et des réponses : <https://openscraper.ai/fr/docs.md>.
