Pipelines de données

Orchestration et transformation de donnees : Airflow, dbt, Astronomer, ETL et ELT.

232 skills

# Skill Source Description Δ
1 airflow-dag-patterns wshobson/agents Orchestrer des pipelines de données Apache Airflow avec patterns, opérateurs et déploiement. 39 177 17
2 data-quality-frameworks wshobson/agents Implémenter des frameworks de qualité de données avec Great Expectations, dbt et contrats. 39 177 17
3 dbt-transformation-patterns wshobson/agents Structurer et optimiser des pipelines de transformation dbt en couches analytiques. 39 177 17
4 spark-optimization wshobson/agents Optimiser les jobs Apache Spark avec partitionnement, mémoire et gestion des shuffles. 39 177 17
5 risk-metrics-calculation wshobson/agents Calculer la VaR, CVaR et métriques de risque pour la gestion de portefeuille. 39 177 17
6 recsys-pipeline-architect wshobson/agents Concevoir et scaffolder des pipelines de recommandation en six étapes pour tout système top-K. 39 177 17
7 arize-dataset github/awesome-copilot Gérer et exporter des datasets versionnés dans l'espace Arize via CLI. 38 295 15
8 power-bi-dax-optimization github/awesome-copilot Analyser et optimiser des formules DAX Power BI pour de meilleures performances. 38 295 15
9 power-bi-model-design-review github/awesome-copilot Auditer et optimiser la conception d'un modèle de données Power BI. 38 295 15
10 bigquery-pipeline-audit github/awesome-copilot Auditer un pipeline BigQuery pour coûts, sécurité et fiabilité en production. 38 295 15
11 snowflake-semanticview github/awesome-copilot Créer, valider et déployer des vues sémantiques Snowflake avec synonymes et commentaires. 38 295 15
12 powerbi-modeling github/awesome-copilot Concevoir et optimiser des modèles sémantiques Power BI selon les bonnes pratiques Microsoft. 38 295 15
13 mini-context-graph github/awesome-copilot Construire et interroger un graphe de connaissances persistant combinant wiki, entités et sources brutes. 38 295 15
14 upload-parity-experiments harbor-framework/harbor Publier des résultats d'expériences de parité Harbor sur Hugging Face via Git sparse checkout. 4 678 14
15 instrument-data-to-allotrope anthropics/knowledge-work-plugins Convertir des fichiers instruments au format standardisé Allotrope Simple Model pour LIMS. 23 698 5
16 nextflow-development anthropics/knowledge-work-plugins Déployer et exécuter des pipelines bioinformatiques nf-core sur données locales ou publiques. 23 698 5
17 single-cell-rna-qc anthropics/knowledge-work-plugins Automatiser le contrôle qualité de données single-cell RNA-seq selon les bonnes pratiques scverse. 23 698 5
18 analyze anthropics/knowledge-work-plugins Analyser des données et répondre à toute question métrique, de la simple requête au rapport formel. 23 698 5
19 create-viz anthropics/knowledge-work-plugins Générer des visualisations de données professionnelles avec Python selon les meilleures pratiques. 23 698 5
20 explore-data anthropics/knowledge-work-plugins Profiler un dataset pour révéler sa structure, qualité et patterns clés. 23 698 5
21 validate-data anthropics/knowledge-work-plugins Valider une analyse de données pour détecter erreurs, biais et incohérences avant partage. 23 698 5
22 start anthropics/knowledge-work-plugins Orienter un chercheur en biologie vers les outils et workflows disponibles du plugin bio-recherche. 23 698 5
23 cuopt-routing-api-python nvidia/skills Résoudre des problèmes de routage VRP/TSP/PDP avec l'API Python cuOpt. 3 114 4
24 deepstream-dev nvidia/skills Développer des pipelines DeepStream SDK avec les bonnes pratiques et règles d'architecture NVIDIA. 3 114 4
25 dali-dynamic-mode nvidia/skills Exécuter des pipelines de données DALI en mode impératif Python sans graphe statique. 3 114 4
26 aiq-research nvidia/skills Interroger un serveur NVIDIA AI-Q Blueprint pour effectuer des recherches approfondies. 3 114 4
27 omniverse-cad-to-simready nvidia/skills Convertir un asset CAD en package SimReady via un pipeline bout-en-bout orchestré. 3 114 4
28 earth2studio-data-fetch nvidia/skills Télécharger des données météo/climat via les APIs Earth2Studio avec vérification lexicale. 3 114 4
29 accelerated-computing-cudf nvidia/skills Accélérer des DataFrames pandas sur GPU avec cuDF et dask-cuDF. 3 114 4
30 vss-query-analytics nvidia/skills Interroger les incidents, métriques et alertes Elasticsearch via le serveur VA-MCP en lecture seule. 3 114 4
31 vss-search-archive nvidia/skills Rechercher et ingérer des vidéos archivées ou flux RTSP par langage naturel via VSS. 3 114 4
32 cupynumeric-hdf5 nvidia/skills Lire et écrire des tableaux cuPyNumeric en fichiers HDF5 en parallèle. 3 114 4
33 cupynumeric-parallel-data-load nvidia/skills Charger en parallèle des données multi-fichiers fragmentées dans un tableau cupynumeric distribué. 3 114 4
34 nemotron-retrieval-recipes nvidia/skills Orchestrer les recettes Nemotron d'embedding et de reranking pour optimiser la récupération d'information. 3 114 4
35 dicom-metadata-extract nvidia/skills Extraire les métadonnées d'un fichier DICOM et détecter la présence de PHI. 3 114 4
36 dicom-series-preflight nvidia/skills Analyser les en-têtes d'une série DICOM et émettre un verdict de conformité JSON. 3 114 4
37 dicom-series-to-volume nvidia/skills Convertir une série DICOM CT en volume NIfTI HU avec affine et résumé JSON. 3 114 4
38 physical-ai-video-data-augmentation nvidia/skills Orchestrer un workflow VDA complet sur OSMO, du preflight au téléchargement des sorties. 3 114 4
39 physical-ai-defect-image-generation nvidia/skills Orchestrer des pipelines de génération, augmentation et labeling d'images de défauts pour l'inspection optique automatisée. 3 114 4
40 data-designer nvidia/skills Construire des datasets synthétiques personnalisés via une interface interactive ou automatique. 3 114 4
41 tao-analyze-gaps-visual-changenet nvidia/skills Identifier les échantillons les plus faibles d'un modèle VCN TAO pour cibler l'augmentation. 3 114 4
42 tao-convert-dataset-format nvidia/skills Convertir des datasets DAFT entre formats supportés via la CLI tao-daft. 3 114 4
43 tao-generate-video-reasoning-annotations nvidia/skills Générer des datasets d'entraînement vidéo avec raisonnement CoT et paires QA annotées. 3 114 4
44 tao-route-visual-changenet-samples nvidia/skills Router les labels de gaps VCN vers les modules k-NN Mining et AnomalyGen de façon auditable. 3 114 4
45 tao-validate-dataset-format nvidia/skills Valider un dataset DAFT avec tao-daft validate et interpréter les résultats. 3 114 4
46 jetson-generate-kb nvidia/skills Générer une base de connaissances markdown décrivant la structure BSP et sources d'une cible Jetson. 3 114 4
47 cuopt-multi-objective-exploration nvidia/skills Tracer une frontière de Pareto multi-objectifs via des solves cuOpt successifs. 3 114 4
48 amc-run-video-calibration nvidia/skills Calibrer des vidéos MP4 pré-enregistrées via l'API REST AMC sans scripts CLI. 3 114 4
49 earth2studio-create-datasource nvidia/skills Implémenter de bout en bout un wrapper de source de données pour Earth2Studio. 3 114 4
50 i4h-catheter-navigation-digital-twin nvidia/skills Construire un jumeau numérique vasculaire à partir d'un volume CT segmenté. 3 114 4

À propos de cette sélection

L'orchestration de données a longtemps reposé sur des scripts fragiles qu'on ne touchait plus par peur de tout casser. Des acteurs comme Astronomer et dbt Labs ont depuis industrialisé la discipline : DAGs versionnés, transformations testables, lignage de bout en bout. Les skills pipelines de données rassemblés ici couvrent des cas concrets, auditer un pipeline BigQuery pour détecter des dérives de coût ou de fraîcheur, modéliser un dataset pour l'exposer proprement à une couche BI sans multiplier les joins à la main. L'outillage disponible est solide, majoritairement Python, et couvre le spectre du prototypage local au déploiement en production supervisé. Ça parle autant aux data engineers qu'aux ML engineers qui branchent des flux en amont de leurs modèles.