Monitoring & Observabilité

Logs, traces et metriques : OpenTelemetry, Sentry, Application Insights, Grafana.

163 skills

# Skill Source Description Maj
1 agent-skills datadog-labs/agent-skills Gérer la surveillance, les logs et les traces Datadog via un agent IA. 158 14h
2 dd-aws-integration datadog-labs/agent-skills Configurer l'intégration AWS Datadog via Terraform avec délégation de rôle IAM. 158 14h
3 dd-gcp-integration datadog-labs/agent-skills Configurer l'intégration Datadog GCP via Terraform avec un compte de service. 158 14h
4 dd-oci-integration datadog-labs/agent-skills Configurer l'intégration Datadog OCI dans une tenancy via Terraform. 158 14h
5 dd-instrument-rum datadog-labs/agent-skills Instrumenter automatiquement une application browser avec le SDK RUM Datadog. 158 14h
6 agent-observability-experiment-bootstrap datadog-labs/agent-skills Générer un artefact d'expérience reproductible pour évaluer des tâches LLM avec métriques et provenance. 158 5j
7 agent-observability-eval-bootstrap datadog-labs/agent-skills Analyser des traces LLM de production pour générer et publier une suite d'évaluateurs Datadog. 158 5j
8 agent-observability-eval-pipeline datadog-labs/agent-skills Orchestrer un pipeline d'évaluation en six phases pour analyser et améliorer des agents IA instrumentés. 158 5j
9 azure-diagnostics microsoft/azure-skills Diagnostiquer et résoudre les incidents Azure sur App Service, AKS, Functions et Messaging. 1 418 7j
10 jetson-video-benchmark nvidia/skills Mesurer le débit de codec vidéo en FPS et mégapixels/seconde sur Jetson. 3 114 9j
11 agent-observability-auto-experiment datadog-labs/agent-skills Automatiser une boucle d'amélioration itérative locale de code via évaluations et commits git. 158 9j
12 dd-account-setup datadog-labs/agent-skills Configurer et valider un compte Datadog avec clé API via OAuth ou création automatique. 158 14j
13 trigger-cost-savings triggerdotdev/skills Analyser les runs Trigger.dev pour identifier et réduire les coûts inutiles. 30 14j
14 redis-observability redis/agent-skills Surveiller, diagnostiquer et alerter sur les métriques clés d'une instance Redis. 125 15j
15 clickhouse-system-log-disk-exhaustion divinevideo/divine-mobile Diagnostiquer et résoudre l'épuisement disque des logs système ClickHouse. 263 19j
16 firebase-crashlytics firebase/agent-skills Intégrer et configurer Crashlytics pour collecter des données de crash Android ou iOS. 424 20j
17 otel-instrumentation dash0hq/agent-skills Implémenter une télémétrie OpenTelemetry de qualité, efficace et sécurisée. 87 20j
18 rp-telemetry wix/skills Capturer la télémétrie d'exécution pour améliorer les skills et outils de migration Wix. 27 20j
19 agent-observability-replay-trace datadog-labs/agent-skills Rejouer une trace de production en local et itérer jusqu'à corriger l'output indésirable. 158 21j
20 doca-telemetry-exporter nvidia/skills Configurer, émettre et déboguer la télémétrie structurée via DOCA Telemetry Exporter. 3 114 21j
21 nemo-relay-plugin-observability nvidia/skills Configurer et orchestrer les plugins d'observabilité pour capturer et exporter les événements d'un agent IA. 3 114 27j
22 azure-cost microsoft/azure-skills Interroger, prévoir et optimiser les coûts Azure pour réduire les dépenses cloud. 1 418 29j
23 azure-kusto microsoft/azure-skills Interroger et analyser des données massives dans Azure Data Explorer via KQL. 1 418 29j
24 onboarding-summary datadog-labs/agent-skills Générer un rapport de validation APM complet après instrumentation Kubernetes réussie. 158 29j
25 verify-ssi datadog-labs/agent-skills Vérifier qu'APM SSI instrumente correctement les pods Kubernetes et remonte la télémétrie. 158 29j
26 dd-pup datadog-labs/agent-skills Interagir avec l'API Datadog via CLI pour logs, monitors, traces et incidents. 158 29j
27 doca-bench nvidia/skills Mesurer les performances des bibliothèques DOCA sur un dispositif réel avec doca_bench. 3 114 1mo
28 doca-pcc-counters nvidia/skills Lire les compteurs diagnostiques PCC firmware/HW d'un device ConnectX via debugfs. 3 114 1mo
29 doca-telemetry nvidia/skills Lire les compteurs matériels DOCA depuis un périphérique via les bibliothèques par domaine. 3 114 1mo
30 otel-ottl dash0hq/agent-skills Transformer, filtrer et manipuler des données de télémétrie OpenTelemetry via OTTL. 87 1mo
31 otel-semantic-conventions dash0hq/agent-skills Valider et placer correctement les attributs de télémétrie selon OpenTelemetry Semantic Conventions. 87 1mo
32 otel-collector dash0hq/agent-skills Configurer et déployer l'OpenTelemetry Collector pour collecter et exporter la télémétrie. 87 1mo
33 doca-collectx-deployment nvidia/skills Déployer et opérer un collecteur de télémétrie CollectX sur hôte ou BlueField. 3 114 1mo
34 doca-dpa-hl-tracer nvidia/skills Capturer et analyser les traces d'exécution haute-level du processeur DPA avec un overhead maîtrisé. 3 114 1mo
35 doca-flow-perf nvidia/skills Mesurer les performances d'insertion de règles DOCA Flow avec docaflowperf. 3 114 1mo
36 doca-telemetry-utils nvidia/skills Diagnostiquer et traduire les compteurs de télémétrie DOCA via l'utilitaire CLI hôte. 3 114 1mo
37 clickstack-otel-collector clickhouse/agent-skills Configurer un collecteur OpenTelemetry pour ingérer des données dans ClickHouse Cloud. 519 1mo
38 query-metrics axiomhq/skills Interroger et explorer des métriques OpenTelemetry stockées dans Axiom MetricsDB. 15 1mo
39 alert-investigation launchdarkly/agent-skills Diagnostiquer automatiquement une alerte déclenchée et recommander des actions correctives ciblées. 25 1mo
40 create-graph launchdarkly/agent-skills Créer, prévisualiser et organiser des graphiques dans des dashboards d'observabilité LaunchDarkly. 25 1mo
41 investigate launchdarkly/agent-skills Mener une investigation multi-produits pour identifier la cause racine d'un incident. 25 1mo
42 ci-metrics pytorch/pytorch Interroger les métriques CI et infrastructure de PyTorch via Grafana et ClickHouse. 102 612 1mo
43 troubleshooting-astro-deployments astronomer/agents Diagnostiquer et résoudre les problèmes de déploiements Astronomer en production via l'Astro CLI. 428 1mo
44 status oceanbase/powermem Afficher le statut de connexion et l'état de santé du plugin PowerMem. 897 1mo
45 aws-cloudwatch-investigation github/awesome-copilot Investiguer des incidents AWS production via CloudWatch Logs, Metrics et Alarms. 38 295 1mo
46 dd-browser-sdk datadog-labs/agent-skills Mettre à niveau le SDK navigateur Datadog de la version 6 à 7. 158 2mo
47 upgrade-browser-sdk-v7 datadog-labs/agent-skills Migrer le SDK Browser Datadog de la version 6 à la version 7. 158 2mo
48 upgrade-browser-sdk-v5 datadog-labs/agent-skills Migrer le SDK Datadog Browser de la version 4 à la version 5 pas à pas. 158 2mo
49 upgrade-browser-sdk-v6 datadog-labs/agent-skills Migrer le SDK Datadog Browser de la version 5 à la version 6 pas à pas. 158 2mo
50 datadog-app datadog-labs/agent-skills Développer des Datadog Apps avec React, TypeScript et publication sur site Datadog. 158 2mo

À propos de cette sélection

L'observabilité est souvent le dernier chantier qu'on branche et le premier qu'on regrette d'avoir bâclé. Quand un agent commence à enchaîner des appels LLM en production, savoir exactement où la latence explose ou quel span a silencieusement échoué transforme radicalement le débogage. Les skills monitoring & observabilité rassemblés ici couvrent des cas concrets : instrumenter un pipeline d'inférence pour en extraire des traces exploitables, ou auditer la consommation réelle d'un assistant Copilot avant que la facture surprenne tout le monde. L'outillage disponible est déjà dense, avec des contributions notables de Datadog Labs et Dash0 couvrant OpenTelemetry, les métriques système sous Linux et le troubleshooting de performance sur des stacks variées. Le profil qui atterrit ici : un SRE ou un ML engineer qui veut enfin piloter avec des données concrètes sous les yeux.