Data & IA
Skills pour LLM, bases vectorielles, training de modeles et scraping web.
| # | Skill | Source | Description | Δ | |
|---|---|---|---|---|---|
| 1 | browser-use | browser-use/browser-use | Contrôler un navigateur Chrome via CDP pour automatiser des tâches web. | 111 268 | 404 |
| 2 | open-source | browser-use/browser-use | Automatiser la navigation web en Python avec des agents IA configurables. | 111 268 | 404 |
| 3 | airflow-dag-patterns | wshobson/agents | Orchestrer des pipelines de données Apache Airflow avec patterns, opérateurs et déploiement. | 39 177 | 17 |
| 4 | data-quality-frameworks | wshobson/agents | Implémenter des frameworks de qualité de données avec Great Expectations, dbt et contrats. | 39 177 | 17 |
| 5 | spark-optimization | wshobson/agents | Optimiser les jobs Apache Spark avec partitionnement, mémoire et gestion des shuffles. | 39 177 | 17 |
| 6 | hybrid-search-implementation | wshobson/agents | Combiner recherche vectorielle et par mots-clés pour améliorer le rappel RAG. | 39 177 | 17 |
| 7 | langchain-architecture | wshobson/agents | Construire des agents IA sophistiqués avec LangChain, LangGraph et gestion d'état. | 39 177 | 17 |
| 8 | llm-evaluation | wshobson/agents | Évaluer les performances des LLM via métriques automatisées, jugement humain et A/B testing. | 39 177 | 17 |
| 9 | similarity-search-patterns | wshobson/agents | Implémenter une recherche vectorielle sémantique efficace et scalable en production. | 39 177 | 17 |
| 10 | vector-index-tuning | wshobson/agents | Optimiser les index vectoriels HNSW pour maximiser rappel, vitesse et mémoire. | 39 177 | 17 |
| 11 | ml-pipeline-workflow | wshobson/agents | Orchestrer un pipeline MLOps complet de l'ingestion des données au déploiement en production. | 39 177 | 17 |
| 12 | backtesting-frameworks | wshobson/agents | Construire des systèmes de backtesting robustes pour évaluer fiablement des stratégies de trading. | 39 177 | 17 |
| 13 | risk-metrics-calculation | wshobson/agents | Calculer la VaR, CVaR et métriques de risque pour la gestion de portefeuille. | 39 177 | 17 |
| 14 | spark-environment-setup | wshobson/agents | Configurer et déboguer un environnement ML sur DGX Spark avec CUDA 13. | 39 177 | 17 |
| 15 | spark-memory-thermal-ops | wshobson/agents | Gérer la mémoire unifiée et les thermiques du DGX Spark GB10 efficacement. | 39 177 | 17 |
| 16 | spark-training-gotchas | wshobson/agents | Diagnostiquer et corriger les dix pannes récurrentes d'entraînement sur DGX Spark GB10. | 39 177 | 17 |
| 17 | grpo-rlvr-training | wshobson/agents | Configurer et lancer un entraînement GRPO/RLVR avec récompenses vérifiables. | 39 177 | 17 |
| 18 | lora-qlora-recipes | wshobson/agents | Configurer des adaptateurs LoRA et QLoRA optimaux pour le fine-tuning SFT supervisé. | 39 177 | 17 |
| 19 | preference-optimization | wshobson/agents | Sélectionner et configurer la méthode optimale d'alignement par préférences (DPO, ORPO, KTO, SimPO). | 39 177 | 17 |
| 20 | quantized-export | wshobson/agents | Exporter un checkpoint promu au bon format quantifié selon la cible matérielle. | 39 177 | 17 |
| 21 | vision-sft | wshobson/agents | Configurer et affiner un modèle vision-langage avec LoRA/QLoRA de façon optimale. | 39 177 | 17 |
| 22 | arize-annotation | github/awesome-copilot | Créer et gérer des configs d'annotation pour labelliser des spans IA via Arize. | 38 295 | 15 |
| 23 | arize-experiment | github/awesome-copilot | Gérer et exporter des expériences d'évaluation de modèles IA via Arize. | 38 295 | 15 |
| 24 | arize-instrumentation | github/awesome-copilot | Instrumenter une application avec le tracing Arize AX via une analyse guidée. | 38 295 | 15 |
| 25 | phoenix-evals | github/awesome-copilot | Construire et valider des évaluateurs LLM pour applications IA en production. | 38 295 | 15 |
| 26 | phoenix-tracing | github/awesome-copilot | Instrumenter des applications LLM avec Phoenix via le tracing OpenInference. | 38 295 | 15 |
| 27 | bigquery-pipeline-audit | github/awesome-copilot | Auditer un pipeline BigQuery pour coûts, sécurité et fiabilité en production. | 38 295 | 15 |
| 28 | mini-context-graph | github/awesome-copilot | Construire et interroger un graphe de connaissances persistant combinant wiki, entités et sources brutes. | 38 295 | 15 |
| 29 | agentic-eval | github/awesome-copilot | Implémenter des boucles d'évaluation itératives pour affiner et améliorer les sorties d'agents IA. | 38 295 | 15 |
| 30 | datanalysis-credit-risk | github/awesome-copilot | Nettoyer et sélectionner des variables pour modélisation de risque crédit. | 38 295 | 15 |
| 31 | eval-driven-dev | github/awesome-copilot | Construire un pipeline d'évaluation automatisé end-to-end pour applications Python utilisant un LLM. | 38 295 | 15 |
| 32 | pinecone-rag | github/awesome-copilot | Construire un pipeline RAG ou une mémoire d'agent persistante avec Pinecone. | 38 295 | 15 |
| 33 | upload-parity-experiments | harbor-framework/harbor | Publier des résultats d'expériences de parité Harbor sur Hugging Face via Git sparse checkout. | 4 678 | 14 |
| 34 | cognee | topoteretes/cognee | Gérer des graphes de connaissances avec Cognee via ingestion, enrichissement et recherche. | 30 290 | 12 |
| 35 | aoti-debug | pytorch/pytorch | Diagnostiquer et corriger les erreurs courantes d'AOTInductor avec méthode. | 102 612 | 11 |
| 36 | pt2-bug-basher | pytorch/pytorch | Déboguer les erreurs de compilation PyTorch 2 via Dynamo, Inductor et AOTAutograd. | 102 612 | 11 |
| 37 | accessing-mlflow | nvidia/model-optimizer | Interroger et comparer des runs MLflow via langage naturel et MCP. | 3 494 | 6 |
| 38 | deployment | nvidia/model-optimizer | Déployer un checkpoint de modèle comme endpoint d'inférence compatible OpenAI. | 3 494 | 6 |
| 39 | eagle3-new-model | nvidia/model-optimizer | Configurer un pipeline EAGLE3 en 4 tâches pour un nouveau modèle HF. | 3 494 | 6 |
| 40 | compare-results | nvidia/model-optimizer | Comparer baseline et candidat quantisé pour évaluer la dégradation de précision. | 3 494 | 6 |
| 41 | day0-release | nvidia/model-optimizer | Orchestrer le cycle complet de release d'un checkpoint quantisé jusqu'à la recommandation de publication. | 3 494 | 6 |
| 42 | eagle3-review-logs | nvidia/model-optimizer | Analyser les logs d'un pipeline EAGLE3 et produire un rapport de diagnostic structuré. | 3 494 | 6 |
| 43 | eagle3-triage | nvidia/model-optimizer | Diagnostiquer et corriger les échecs du pipeline offline EAGLE3 en quatre étapes. | 3 494 | 6 |
| 44 | eagle3-validate | nvidia/model-optimizer | Valider un pipeline EAGLE3 et produire un rapport de qualité complet. | 3 494 | 6 |
| 45 | evaluation | nvidia/model-optimizer | Configurer, lancer et superviser des évaluations de modèles via NeMo Evaluator Launcher. | 3 494 | 6 |
| 46 | launching-evals | nvidia/model-optimizer | Lancer, surveiller et analyser des évaluations de modèles IA via NeMo Evaluator. | 3 494 | 6 |
| 47 | ptq | nvidia/model-optimizer | Quantifier un modèle pré-entraîné en checkpoint optimisé via ModelOpt PTQ. | 3 494 | 6 |
| 48 | quant-recipe-search | nvidia/model-optimizer | Orchestrer une recherche itérative de recettes de quantisation optimales pour modèles IA. | 3 494 | 6 |
| 49 | nextflow-development | anthropics/knowledge-work-plugins | Déployer et exécuter des pipelines bioinformatiques nf-core sur données locales ou publiques. | 23 698 | 5 |
| 50 | single-cell-rna-qc | anthropics/knowledge-work-plugins | Automatiser le contrôle qualité de données single-cell RNA-seq selon les bonnes pratiques scverse. | 23 698 | 5 |
À propos de cette sélection
L'outillage autour de l'IA générative a mûri vite, mais de façon inégale. Les abstractions haut niveau prolifèrent pendant que le bas niveau (embeddings, kernels GPU, pipelines de fine-tuning) reste souvent sous-documenté et morcelé. Les skills data & IA réunis ici couvrent précisément cette zone. Un ingénieur ML qui veut déboguer un kernel Metal ou optimiser un graphe PyTorch trouvera des ressources issues directement des équipes PyTorch. Un dev backend qui bascule vers du RAG trouvera de quoi brancher Qdrant, construire ses pipelines de vecteurs et interroger des modèles via l'API Claude d'Anthropic. Python domine largement le corpus, ce qui reflète l'état réel de l'écosystème. Les profils data engineers habitués à Astronomer ont aussi leur place, avec des skills couvrant l'orchestration de workflows au plus près de la prod.