Web Scraping & Crawling

Extraction de donnees web : crawlers, RSS, Apify, indexation.

58 skills

# Skill Source Description Maj
1 firecrawl-agent firecrawl/cli Extraire automatiquement des données structurées depuis des sites web complexes multi-pages. 605 7h
2 firecrawl-crawl firecrawl/cli Extraire en masse le contenu de multiples pages d'un site web via crawl. 605 7h
3 firecrawl-download firecrawl/cli Télécharger un site entier en fichiers locaux organisés via map et scrape. 605 7h
4 firecrawl-interact firecrawl/cli Interagir avec des pages web en session navigateur live via prompts ou code. 605 7h
5 firecrawl-map firecrawl/cli Cartographier toutes les URLs d'un site web avec filtrage par recherche. 605 7h
6 firecrawl-scrape firecrawl/cli Extraire le contenu de pages web en markdown optimisé pour les LLMs. 605 7h
7 firecrawl-search firecrawl/cli Rechercher sur le web et récupérer le contenu complet des pages résultantes. 605 7h
8 firecrawl-monitor firecrawl/cli Surveiller des pages web et recevoir des alertes automatiques lors de changements détectés. 605 7h
9 firecrawl-research-index firecrawl/cli Rechercher et retrouver des articles scientifiques pertinents via requête textuelle ou identifiant. 605 7h
10 firecrawl firecrawl/cli Rechercher, scraper et interagir avec le web en retournant du markdown propre. 605 7h
11 browser-use browser-use/browser-use Contrôler un navigateur Chrome via CDP pour automatiser des tâches web. 111 268 14h
12 x-twitter-scraper github/awesome-copilot Intégrer l'API Xquik pour scraper, monitorer et automatiser des tâches X/Twitter. 38 295 1j
13 local-descriptions brave/brave-search-skills Récupérer des descriptions IA de lieux d'intérêt via l'API Brave Search. 169 14j
14 news-search brave/brave-search-skills Rechercher des actualités récentes via l'API Brave avec filtres temporels et géographiques. 169 14j
15 videos-search brave/brave-search-skills Rechercher des vidéos sur le web via l'API Brave Search. 169 14j
16 web-search brave/brave-search-skills Effectuer des recherches web structurées via l'API Brave Search avec filtres avancés. 169 14j
17 local-place-search brave/brave-search-skills Rechercher des lieux et points d'intérêt à proximité via coordonnées ou texte libre. 169 14j
18 wayback-cdx-wildcard-pagination divinevideo/divine-mobile Paginer l'API CDX Wayback Machine avec des requêtes wildcard via showResumeKey. 263 19j
19 wayback-indirect-asset-recovery divinevideo/divine-mobile Récupérer des assets introuvables via l'extraction indirecte depuis Wayback Machine. 263 19j
20 wayback-machine-raw-content-id-modifier divinevideo/divine-mobile Récupérer le contenu brut d'archives Wayback Machine via le modificateur id_. 263 19j
21 browser-automation elophanto/elophanto Automatiser la navigation web, les formulaires et l'extraction de données via 47 outils. 113 21j
22 apify-sdk-integration apify/agent-skills Intégrer des Actors Apify dans une application via SDK JS, Python ou REST API. 2 361 23j
23 browser browserbase/skills Automatiser les interactions navigateur en local ou via Browserbase avec une CLI dédiée. 3 699 1mo
24 apify-actor-development apify/agent-skills Développer et déployer des Actors serverless sur la plateforme Apify. 2 361 2mo
25 apify-ultimate-scraper apify/agent-skills Extraire des données web depuis plus de 100 sources via l'API Apify. 2 361 2mo
26 google-maps-scraper gosom/google-maps-scraper Extraire des données de Google Maps via Docker avec configuration automatique. 5 630 2mo
27 deep-research-agent shobcoder/shob Mener une recherche autonome multi-sources pour produire des rapports structurés et vérifiés. 582 2mo
28 web-scraper shobcoder/shob Extraire et structurer automatiquement des données depuis n'importe quel site web. 582 2mo
29 fetch browserbase/skills Récupérer le contenu, les en-têtes et métadonnées d'une page web sans navigateur. 3 699 2mo
30 search browserbase/skills Rechercher sur le web et retourner des résultats structurés via l'API Browserbase. 3 699 2mo
31 deep-research shobcoder/shob Conduire une recherche approfondie multi-sources pour produire un rapport structuré et vérifié. 582 2mo
32 literature-search-arxiv mkurman/zorai Rechercher, télécharger et extraire des métadonnées de publications arXiv. 320 2mo
33 literature-search-biorxiv mkurman/zorai Rechercher des prépublications bioRxiv et medRxiv par date, catégorie ou DOI. 320 2mo
34 literature-search-europepmc mkurman/zorai Rechercher et télécharger des articles scientifiques en libre accès depuis Europe PMC. 320 2mo
35 pubchem-database mkurman/zorai Interroger la base PubChem pour obtenir données chimiques, propriétés et interactions biologiques. 320 2mo
36 aeon-last30 bankrbot/skills Cartographier les narratifs dominants et dissidents d'un sujet sur 30 jours. 1 188 3mo
37 paper-lookup mkurman/zorai Rechercher des articles scientifiques dans 10 bases de données académiques via leurs APIs. 320 3mo
38 parallel-web mkurman/zorai Effectuer des recherches web rapides ou approfondies et sauvegarder les résultats. 320 3mo
39 research-lookup mkurman/zorai Effectuer des recherches multi-sources avec citations académiques classées par qualité. 320 3mo
40 wayback-api-archive-recovery divinevideo/divine-mobile Récupérer des données archivées d'APIs défuntes via la Wayback Machine. 263 3mo
41 wayback-cdx-cloud-ip-workaround divinevideo/divine-mobile Contourner le blocage IP cloud de l'API Wayback CDX via GCS comme intermédiaire. 263 3mo
42 wayback-cdx-wildcard-pagination divinevideo/divine-mobile Paginer l'API CDX Wayback Machine avec des requêtes wildcard via showResumeKey. 263 3mo
43 wayback-indirect-asset-recovery divinevideo/divine-mobile Récupérer des assets introuvables via l'extraction indirecte depuis Wayback Machine. 263 3mo
44 wayback-machine-raw-content-id-modifier divinevideo/divine-mobile Récupérer le contenu brut d'archives Wayback Machine via le modificateur id_. 263 3mo
45 tavily mkurman/zorai Effectuer des recherches web, extractions et crawls via l'API REST Tavily. 320 3mo
46 perplexity-search mkurman/zorai Effectuer des recherches web en temps réel avec citations via les modèles Perplexity. 320 3mo
47 mapbox-location-grounding mapbox/mapbox-agent-skills Ancrer les réponses géolocalisées dans des données Mapbox en temps réel. 73 4mo
48 tavily-dynamic-search tavily-ai/skills Filtrer et extraire des résultats web sans polluer la fenêtre de contexte. 462 4mo
49 bx brave/brave-search-skills Rechercher sur le web via Brave Search CLI avec extraction de contenu optimisée pour les agents IA. 169 4mo
50 bx-search brave/brave-search-skills Effectuer des recherches web optimisées via CLI pour alimenter des agents IA en contexte. 169 4mo

À propos de cette sélection

L'outillage de scraping web a longtemps ressemblé à un chantier artisanal : un script Playwright bricolé, un cron qui tombe en silence, des sélecteurs CSS qui rendent l'âme dès qu'un front-end se restructure. Les agents IA changent la donne. Ils ont besoin d'accéder au web de façon fiable, autonome et reproductible, et c'est précisément ce que couvrent les skills web scraping & crawling rassemblés ici. De quoi piloter un navigateur headless pour extraire des données structurées depuis des pages dynamiques, ou brancher un agent sur un moteur de recherche comme Tavily et Brave sans écrire une ligne de parsing. Ces skills s'adressent aux développeurs Python ou TypeScript qui alimentent des pipelines de données, construisent des agents de veille ou enrichissent des datasets pour du fine-tuning. L'écosystème couvre déjà une bonne partie des cas d'usage courants.