Pipelines de données

Orchestration et transformation de donnees : Airflow, dbt, Astronomer, ETL et ELT.

161 skills

# Skill Source Description Maj
1 tao-convert-dataset-format nvidia/skills Convertir des datasets DAFT entre formats supportés via la CLI tao-daft. 3 114 1j
2 tao-generate-video-reasoning-annotations nvidia/skills Générer des datasets d'entraînement vidéo avec raisonnement CoT et paires QA annotées. 3 114 1j
3 tao-validate-dataset-format nvidia/skills Valider un dataset DAFT avec tao-daft validate et interpréter les résultats. 3 114 1j
4 upgrading-dbt-core dbt-labs/dbt-agent-skills Migrer un projet dbt-core v1 vers la version 1.12 en appliquant automatiquement les correctifs adaptés. 689 2j
5 omni-to-databricks-metric-view exploreomni/omni-agent-skills Convertir un topic Omni en Databricks Metric View via CLI et YAML. 32 6j
6 cuopt-routing-api-python nvidia/skills Résoudre des problèmes de routage VRP/TSP/PDP avec l'API Python cuOpt. 3 114 13j
7 omniverse-cad-to-simready nvidia/skills Convertir un asset CAD en package SimReady via un pipeline bout-en-bout orchestré. 3 114 14j
8 redis-clustering redis/agent-skills Concevoir des clés Redis Cluster et router les lectures pour éviter erreurs CROSSSLOT et surcharge. 125 15j
9 cuopt-multi-objective-exploration nvidia/skills Tracer une frontière de Pareto multi-objectifs via des solves cuOpt successifs. 3 114 19j
10 montecarlo-subgroup-prediction divinevideo/divine-mobile Modéliser des sous-groupes de projet avec des simulations Monte Carlo précises et différenciées. 263 19j
11 mini-context-graph github/awesome-copilot Construire et interroger un graphe de connaissances persistant combinant wiki, entités et sources brutes. 38 295 20j
12 airflow-state-store astronomer/agents Gérer l'état des tâches Airflow 3.3 avec des stores clé/valeur crash-safe. 428 22j
13 cupynumeric-parallel-data-load nvidia/skills Charger en parallèle des données multi-fichiers fragmentées dans un tableau cupynumeric distribué. 3 114 26j
14 i4h-catheter-navigation-digital-twin nvidia/skills Construire un jumeau numérique vasculaire à partir d'un volume CT segmenté. 3 114 1mo
15 i4h-workflow-dataset-convert nvidia/skills Convertir un enregistrement HDF5 agentic en dataset LeRobot prêt à l'entraînement. 3 114 1mo
16 i4h-workflow-dataset-mimic nvidia/skills Augmenter un dataset HDF5 en répliquant des trajectoires avec bruit d'action et d'état. 3 114 1mo
17 nemotron-retrieval-recipes nvidia/skills Orchestrer les recettes Nemotron d'embedding et de reranking pour optimiser la récupération d'information. 3 114 1mo
18 authoring-language-sdk-tasks astronomer/agents Implémenter des tâches Airflow en langages non-Python via des stubs et coordinateurs natifs. 428 1mo
19 configuring-airflow-language-sdks astronomer/agents Configurer Airflow pour router les tâches SDK natifs vers le bon coordinateur. 428 1mo
20 deepstream-dev nvidia/skills Développer des pipelines DeepStream SDK avec les bonnes pratiques et règles d'architecture NVIDIA. 3 114 1mo
21 amc-run-video-calibration nvidia/skills Calibrer des vidéos MP4 pré-enregistrées via l'API REST AMC sans scripts CLI. 3 114 1mo
22 migrating-dagster-to-airflow astronomer/agents Migrer un projet Dagster vers Airflow 3 sur Astro Runtime, domaine par domaine. 428 1mo
23 aiq-research nvidia/skills Interroger un serveur NVIDIA AI-Q Blueprint pour effectuer des recherches approfondies. 3 114 1mo
24 airflow astronomer/agents Gérer, diagnostiquer et opérer des workflows Airflow via des commandes CLI dédiées. 428 1mo
25 metrics-chart axiomhq/skills Transformer une réponse de requête métriques en graphique temporel multi-séries. 15 1mo
26 earth2studio-create-datasource nvidia/skills Implémenter de bout en bout un wrapper de source de données pour Earth2Studio. 3 114 1mo
27 airflow-hitl astronomer/agents Intégrer des points de validation humaine dans un DAG Airflow via des opérateurs déférables. 428 1mo
28 analyzing-data astronomer/agents Interroger un entrepôt de données pour répondre à des questions métier. 428 1mo
29 authoring-dags astronomer/agents Créer et valider des DAGs Airflow via le CLI af en suivant les bonnes pratiques. 428 1mo
30 cosmos-dbt-core astronomer/agents Intégrer dbt Core dans Airflow via Cosmos avec la configuration optimale. 428 1mo
31 cosmos-dbt-fusion astronomer/agents Intégrer dbt Fusion avec Cosmos dans Airflow en suivant une checklist d'implémentation structurée. 428 1mo
32 dag-factory astronomer/agents Générer des DAGs Apache Airflow déclarativement depuis des fichiers YAML avec dag-factory. 428 1mo
33 debugging-dags astronomer/agents Diagnostiquer et résoudre les échecs de DAGs Airflow avec des actions correctives ciblées. 428 1mo
34 migrating-ai-sdk-to-common-ai astronomer/agents Migrer un projet Airflow de airflow-ai-sdk vers apache-airflow-providers-common-ai. 428 1mo
35 tao-analyze-gaps-visual-changenet nvidia/skills Identifier les échantillons les plus faibles d'un modèle VCN TAO pour cibler l'augmentation. 3 114 2mo
36 tao-route-visual-changenet-samples nvidia/skills Router les labels de gaps VCN vers les modules k-NN Mining et AnomalyGen de façon auditable. 3 114 2mo
37 using-dbt-for-analytics-engineering dbt-labs/dbt-agent-skills Construire, modifier et tester des modèles dbt avec rigueur et bonnes pratiques. 689 2mo
38 dali-dynamic-mode nvidia/skills Exécuter des pipelines de données DALI en mode impératif Python sans graphe statique. 3 114 2mo
39 blueprint astronomer/agents Composer des DAGs Airflow en YAML via des templates Python réutilisables et validés. 428 2mo
40 data-designer nvidia/skills Construire des datasets synthétiques personnalisés via une interface interactive ou automatique. 3 114 2mo
41 ucsc-conservation-and-tfbs mkurman/zorai Récupérer les scores de conservation évolutive et sites TFBS via UCSC. 320 2mo
42 unibind-database mkurman/zorai Interroger la base de données UniBind pour explorer les interactions TF–ADN multi-espèces. 320 2mo
43 uniprot-database mkurman/zorai Interroger la base UniProt pour découvrir, récupérer et cartographier des données protéiques. 320 2mo
44 chembl-database mkurman/zorai Interroger la base ChEMBL pour récupérer données moléculaires, cibles et bioactivités. 320 2mo
45 clinical-trials-database mkurman/zorai Interroger la base ClinicalTrials.gov pour rechercher et filtrer des essais cliniques mondiaux. 320 2mo
46 clinvar-database mkurman/zorai Interroger la base ClinVar pour obtenir classifications cliniques et données de variants génomiques. 320 2mo
47 dbsnp-database mkurman/zorai Interroger la base dbSNP pour mapper, résoudre et récupérer des variants génomiques. 320 2mo
48 embl-ebi-ols mkurman/zorai Interroger et explorer des ontologies biologiques via l'API EBI OLS. 320 2mo
49 encode-ccres-database mkurman/zorai Interroger la base ENCODE pour identifier des éléments régulateurs non-codants via l'API SCREEN. 320 2mo
50 ensembl-database mkurman/zorai Interroger l'API Ensembl pour mapper, résoudre et récupérer des données génomiques. 320 2mo

À propos de cette sélection

L'orchestration de données a longtemps reposé sur des scripts fragiles qu'on ne touchait plus par peur de tout casser. Des acteurs comme Astronomer et dbt Labs ont depuis industrialisé la discipline : DAGs versionnés, transformations testables, lignage de bout en bout. Les skills pipelines de données rassemblés ici couvrent des cas concrets, auditer un pipeline BigQuery pour détecter des dérives de coût ou de fraîcheur, modéliser un dataset pour l'exposer proprement à une couche BI sans multiplier les joins à la main. L'outillage disponible est solide, majoritairement Python, et couvre le spectre du prototypage local au déploiement en production supervisé. Ça parle autant aux data engineers qu'aux ML engineers qui branchent des flux en amont de leurs modèles.