Pipelines de données
Orchestration et transformation de donnees : Airflow, dbt, Astronomer, ETL et ELT.
| # | Skill | Source | Description | Maj | |
|---|---|---|---|---|---|
| 1 | tao-convert-dataset-format | nvidia/skills | Convertir des datasets DAFT entre formats supportés via la CLI tao-daft. | 3 114 | 1j |
| 2 | tao-generate-video-reasoning-annotations | nvidia/skills | Générer des datasets d'entraînement vidéo avec raisonnement CoT et paires QA annotées. | 3 114 | 1j |
| 3 | tao-validate-dataset-format | nvidia/skills | Valider un dataset DAFT avec tao-daft validate et interpréter les résultats. | 3 114 | 1j |
| 4 | upgrading-dbt-core | dbt-labs/dbt-agent-skills | Migrer un projet dbt-core v1 vers la version 1.12 en appliquant automatiquement les correctifs adaptés. | 689 | 2j |
| 5 | omni-model-builder | exploreomni/omni-agent-skills | Créer et modifier un modèle sémantique Omni via l'API YAML en branches sécurisées. | 32 | 6j |
| 6 | omni-query | exploreomni/omni-agent-skills | Interroger la couche sémantique Omni via CLI pour extraire des données structurées. | 32 | 6j |
| 7 | omni-to-databricks-metric-view | exploreomni/omni-agent-skills | Convertir un topic Omni en Databricks Metric View via CLI et YAML. | 32 | 6j |
| 8 | cuopt-routing-api-python | nvidia/skills | Résoudre des problèmes de routage VRP/TSP/PDP avec l'API Python cuOpt. | 3 114 | 13j |
| 9 | omniverse-cad-to-simready | nvidia/skills | Convertir un asset CAD en package SimReady via un pipeline bout-en-bout orchestré. | 3 114 | 14j |
| 10 | amc-run-rtsp-calibration | nvidia/skills | Calibrer des flux caméras RTSP en direct via des clips enregistrés et le microservice AMC. | 3 114 | 14j |
| 11 | redis-clustering | redis/agent-skills | Concevoir des clés Redis Cluster et router les lectures pour éviter erreurs CROSSSLOT et surcharge. | 125 | 15j |
| 12 | cuopt-multi-objective-exploration | nvidia/skills | Tracer une frontière de Pareto multi-objectifs via des solves cuOpt successifs. | 3 114 | 19j |
| 13 | clickhouse-aggregatingmergetree-state-merge | divinevideo/divine-mobile | Interroger correctement les colonnes ClickHouse AggregatingMergeTree avec les fonctions Merge. | 263 | 19j |
| 14 | clickhouse-nip33-addressable-dedup | divinevideo/divine-mobile | Dédupliquer les événements Nostr NIP-33 dans ClickHouse via LIMIT 1 BY. | 263 | 19j |
| 15 | montecarlo-subgroup-prediction | divinevideo/divine-mobile | Modéliser des sous-groupes de projet avec des simulations Monte Carlo précises et différenciées. | 263 | 19j |
| 16 | wayback-api-archive-recovery | divinevideo/divine-mobile | Récupérer des données archivées d'APIs défuntes via la Wayback Machine. | 263 | 19j |
| 17 | mini-context-graph | github/awesome-copilot | Construire et interroger un graphe de connaissances persistant combinant wiki, entités et sources brutes. | 38 295 | 20j |
| 18 | rp-execute-import | wix/skills | Exécuter un pipeline de migration et capturer les résultats d'importation vers Wix. | 27 | 20j |
| 19 | rp-source-csv | wix/skills | Gérer l'adaptation de fichiers CSV comme source de données pour pipelines de migration. | 27 | 20j |
| 20 | airflow-state-store | astronomer/agents | Gérer l'état des tâches Airflow 3.3 avec des stores clé/valeur crash-safe. | 428 | 22j |
| 21 | cupynumeric-parallel-data-load | nvidia/skills | Charger en parallèle des données multi-fichiers fragmentées dans un tableau cupynumeric distribué. | 3 114 | 26j |
| 22 | i4h-catheter-navigation-digital-twin | nvidia/skills | Construire un jumeau numérique vasculaire à partir d'un volume CT segmenté. | 3 114 | 1mo |
| 23 | i4h-lerobot-viz | nvidia/skills | Lancer le visualiseur HTML interactif d'un dataset LeRobot converti dans le navigateur. | 3 114 | 1mo |
| 24 | i4h-workflow-dataset-convert | nvidia/skills | Convertir un enregistrement HDF5 agentic en dataset LeRobot prêt à l'entraînement. | 3 114 | 1mo |
| 25 | i4h-workflow-dataset-mimic | nvidia/skills | Augmenter un dataset HDF5 en répliquant des trajectoires avec bruit d'action et d'état. | 3 114 | 1mo |
| 26 | i4h-workflow-dataset-replay | nvidia/skills | Rejouer un épisode HDF5 enregistré dans Isaac Sim pour vérification visuelle. | 3 114 | 1mo |
| 27 | i4h-workflow-dataset-teleop | nvidia/skills | Enregistrer des épisodes de télé-opération robotique en démos HDF5 via clavier, bras leader ou VR. | 3 114 | 1mo |
| 28 | nemotron-retrieval-recipes | nvidia/skills | Orchestrer les recettes Nemotron d'embedding et de reranking pour optimiser la récupération d'information. | 3 114 | 1mo |
| 29 | authoring-java-sdk-tasks | astronomer/agents | Implémenter des tâches Java pour DAGs Airflow via annotations ou interfaces JVM. | 428 | 1mo |
| 30 | authoring-language-sdk-tasks | astronomer/agents | Implémenter des tâches Airflow en langages non-Python via des stubs et coordinateurs natifs. | 428 | 1mo |
| 31 | configuring-airflow-language-sdks | astronomer/agents | Configurer Airflow pour router les tâches SDK natifs vers le bon coordinateur. | 428 | 1mo |
| 32 | building-dbt-semantic-layer | dbt-labs/dbt-agent-skills | Créer et modifier des composants dbt Semantic Layer : modèles, entités, dimensions et métriques. | 689 | 1mo |
| 33 | deepstream-dev | nvidia/skills | Développer des pipelines DeepStream SDK avec les bonnes pratiques et règles d'architecture NVIDIA. | 3 114 | 1mo |
| 34 | amc-run-video-calibration | nvidia/skills | Calibrer des vidéos MP4 pré-enregistrées via l'API REST AMC sans scripts CLI. | 3 114 | 1mo |
| 35 | migrating-dagster-to-airflow | astronomer/agents | Migrer un projet Dagster vers Airflow 3 sur Astro Runtime, domaine par domaine. | 428 | 1mo |
| 36 | authoring-go-sdk-tasks | astronomer/agents | Implémenter des tâches Go dans Airflow via le SDK natif avec injection de dépendances. | 428 | 1mo |
| 37 | aiq-research | nvidia/skills | Interroger un serveur NVIDIA AI-Q Blueprint pour effectuer des recherches approfondies. | 3 114 | 1mo |
| 38 | using-dbt-state | dbt-labs/dbt-agent-skills | Optimiser les builds dbt en réutilisant automatiquement les modèles inchangés via un serveur d'état. | 689 | 1mo |
| 39 | airflow | astronomer/agents | Gérer, diagnostiquer et opérer des workflows Airflow via des commandes CLI dédiées. | 428 | 1mo |
| 40 | metrics-chart | axiomhq/skills | Transformer une réponse de requête métriques en graphique temporel multi-séries. | 15 | 1mo |
| 41 | earth2studio-create-datasource | nvidia/skills | Implémenter de bout en bout un wrapper de source de données pour Earth2Studio. | 3 114 | 1mo |
| 42 | airflow-hitl | astronomer/agents | Intégrer des points de validation humaine dans un DAG Airflow via des opérateurs déférables. | 428 | 1mo |
| 43 | analyzing-data | astronomer/agents | Interroger un entrepôt de données pour répondre à des questions métier. | 428 | 1mo |
| 44 | authoring-dags | astronomer/agents | Créer et valider des DAGs Airflow via le CLI af en suivant les bonnes pratiques. | 428 | 1mo |
| 45 | cosmos-dbt-core | astronomer/agents | Intégrer dbt Core dans Airflow via Cosmos avec la configuration optimale. | 428 | 1mo |
| 46 | cosmos-dbt-fusion | astronomer/agents | Intégrer dbt Fusion avec Cosmos dans Airflow en suivant une checklist d'implémentation structurée. | 428 | 1mo |
| 47 | dag-factory | astronomer/agents | Générer des DAGs Apache Airflow déclarativement depuis des fichiers YAML avec dag-factory. | 428 | 1mo |
| 48 | debugging-dags | astronomer/agents | Diagnostiquer et résoudre les échecs de DAGs Airflow avec des actions correctives ciblées. | 428 | 1mo |
| 49 | migrating-ai-sdk-to-common-ai | astronomer/agents | Migrer un projet Airflow de airflow-ai-sdk vers apache-airflow-providers-common-ai. | 428 | 1mo |
| 50 | omni-to-snowflake-semantic-view | exploreomni/omni-agent-skills | Convertir un topic Omni en définition YAML Snowflake Semantic View via API. | 32 | 1mo |
À propos de cette sélection
L'orchestration de données a longtemps reposé sur des scripts fragiles qu'on ne touchait plus par peur de tout casser. Des acteurs comme Astronomer et dbt Labs ont depuis industrialisé la discipline : DAGs versionnés, transformations testables, lignage de bout en bout. Les skills pipelines de données rassemblés ici couvrent des cas concrets, auditer un pipeline BigQuery pour détecter des dérives de coût ou de fraîcheur, modéliser un dataset pour l'exposer proprement à une couche BI sans multiplier les joins à la main. L'outillage disponible est solide, majoritairement Python, et couvre le spectre du prototypage local au déploiement en production supervisé. Ça parle autant aux data engineers qu'aux ML engineers qui branchent des flux en amont de leurs modèles.