Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Référence Ray Metrics
Le module complémentaire SageMaker HyperPod Observability collecte les métriques exportées par Ray. Nous n'ajoutons, ne renommons ni ne supprimons les métriques Ray, de sorte que les noms et les étiquettes des métriques correspondent à Ray open source.
Les sections suivantes répertorient les groupes de mesures couverts par chaque tableau de bord provisionné. Pour les noms, les définitions et les types de métriques individuels, consultez les métriques du système Ray
Métriques de Ray Core
Le tableau de bord Ray Core couvre l'état de Ray au niveau du système et le matériel sur lequel le cluster s'exécute, dans les groupes suivants :
Tâches, acteurs et groupes de placement
Ressources du cluster et magasin d'objets
Matériel et système d'exploitation du nœud
Per-component utilisation
État de l'autoscaler
Métriques de Ray Data
Le tableau de bord Ray Data couvre le débit des ensembles de données, le cycle de vie des tâches, les itérations et la pression de la mémoire, dans les groupes suivants :
Lignes, octets et blocs
Nombre de tâches et cycle de vie
Autres compteurs d'opérateurs
Itération
Stockage d'objets et budget mémoire
Utilisation du cluster et budgets
Métriques de Ray Train
Le tableau de bord Ray Train couvre le déroulement de la formation et l'état des travailleurs, les points de contrôle et le matériel des nœuds, dans les groupes suivants :
État de fonctionnement et état de travailleur
Points de contrôle et rapports
Matériel et système d'exploitation du nœud
Statistiques de Ray Serve
Le tableau de bord Ray Serve couvre le taux de requêtes, la latence, les erreurs et l'état de santé des répliques, dans les groupes suivants :
Demandes et latence
Erreurs et mise en file d'attente
État de santé des répliques et des contrôleurs
Matériel du nœud et état du cluster
Étiquettes pour les requêtes
Les métriques arrivent dans Amazon Managed Service pour Prometheus, vous pouvez donc les interroger en dehors de Grafana. Le collecteur ajoute cluster_namecluster_id, etnamespace. Ray ajouteray_io_cluster, qui identifie le cluster Ray et constitue l'étiquette sur laquelle les tableaux de bord pivotent.
Pour plus d'informations sur la visualisation de ces mesures, consultezTableaux de bord Ray Grafana.