View a markdown version of this page

Référence Ray Metrics - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Référence Ray Metrics

Le module complémentaire SageMaker HyperPod Observability collecte les métriques exportées par Ray. Nous n'ajoutons, ne renommons ni ne supprimons les métriques Ray, de sorte que les noms et les étiquettes des métriques correspondent à Ray open source.

Les sections suivantes répertorient les groupes de mesures couverts par chaque tableau de bord provisionné. Pour les noms, les définitions et les types de métriques individuels, consultez les métriques du système Ray dans la documentation Ray.

Métriques de Ray Core

Le tableau de bord Ray Core couvre l'état de Ray au niveau du système et le matériel sur lequel le cluster s'exécute, dans les groupes suivants :

  • Tâches, acteurs et groupes de placement

  • Ressources du cluster et magasin d'objets

  • Matériel et système d'exploitation du nœud

  • Per-component utilisation

  • État de l'autoscaler

Métriques de Ray Data

Le tableau de bord Ray Data couvre le débit des ensembles de données, le cycle de vie des tâches, les itérations et la pression de la mémoire, dans les groupes suivants :

  • Lignes, octets et blocs

  • Nombre de tâches et cycle de vie

  • Autres compteurs d'opérateurs

  • Itération

  • Stockage d'objets et budget mémoire

  • Utilisation du cluster et budgets

Métriques de Ray Train

Le tableau de bord Ray Train couvre le déroulement de la formation et l'état des travailleurs, les points de contrôle et le matériel des nœuds, dans les groupes suivants :

  • État de fonctionnement et état de travailleur

  • Points de contrôle et rapports

  • Matériel et système d'exploitation du nœud

Statistiques de Ray Serve

Le tableau de bord Ray Serve couvre le taux de requêtes, la latence, les erreurs et l'état de santé des répliques, dans les groupes suivants :

  • Demandes et latence

  • Erreurs et mise en file d'attente

  • État de santé des répliques et des contrôleurs

  • Matériel du nœud et état du cluster

Étiquettes pour les requêtes

Les métriques arrivent dans Amazon Managed Service pour Prometheus, vous pouvez donc les interroger en dehors de Grafana. Le collecteur ajoute cluster_namecluster_id, etnamespace. Ray ajouteray_io_cluster, qui identifie le cluster Ray et constitue l'étiquette sur laquelle les tableaux de bord pivotent.

Pour plus d'informations sur la visualisation de ces mesures, consultezTableaux de bord Ray Grafana.