View a markdown version of this page

Ray sur les HyperPod FAQs - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Ray sur les HyperPod FAQs

Est-ce que ça HyperPod modifie Ray ou pas KubeRay ?

HyperPod exécute le Ray open source en amont et KubeRay sans modification. Votre code Ray, les API Ray, les ressourcesRayCluster, RayJobRayCronJob, et RayService personnalisées se comportent de la même manière qu'en open source. HyperPod ajoute des fonctionnalités autour de Ray, telles qu'une expérience Studio gérée, un accès sécurisé au tableau de bord, l'observabilité et la résilience.

Puis-je conserver mon KubeRay installation existante ?

Vous pouvez conserver l' KubeRay opérateur que vous utilisez déjà. HyperPod les fonctionnalités s'installent parallèlement et les manifestes que vous appliquez déjà continuent de fonctionner. Si votre cluster n'a pas encore d' KubeRay opérateur, installez-le comme décrit dansInstallation KubeRay sur HyperPod Amazon EKS.

Ai-je besoin de SageMaker Studio ?

Amazon SageMaker Studio n'est requis que pour l'expérience gérée, dans laquelle les data scientists créent et gèrent des clusters Ray sans aucune connaissance de Kubernetes. Sur une plate-forme Ray existante, vous utilisez kubectl Helm et la bibliothèque de boîtes à outils, et rien ne nécessite Studio. Pour de plus amples informations, veuillez consulter Prise en main.

Puis-je utiliser mes propres Prometheus et Grafana ?

Tu peux garder tes propres Prometheus et Grafana. Le module complémentaire HyperPod Observability est une option qui arrive configurée, mais vous pouvez extraire les métriques Ray avec votre propre stack. Pour de plus amples informations, veuillez consulter Configuration de la collecte de métriques Ray.

Comment fonctionne le quota avec un cluster Ray à longue durée de vie ?

HyperPod La gouvernance des tâches tient compte des quotas au RayCluster niveau, de sorte qu'un cluster à longue durée de vie conserve toute sa capacité déclarée tant qu'il fonctionne. Dimensionnez un cluster persistant en fonction de la capacité que vous souhaitez réserver et utilisez-le RayJob pour les tâches qui acquièrent et libèrent de la capacité par tâche. Pour de plus amples informations, veuillez consulter Mise en file d'attente avec gouvernance des tâches.

Qu'arrive-t-il à ma tâche Ray lorsqu'un nœud GPU tombe en panne ?

HyperPod détecte le défaut par le biais de contrôles de santé et redémarre ou remplace le nœud, et KubeRay replanifie les modules Ray concernés. Votre tâche reprend depuis son dernier point de contrôle, alors écrivez des points de contrôle pour récupérer le travail en cours. Pour de plus amples informations, veuillez consulter Restauration automatique des nœuds avec Ray.

Quelles bibliothèques Ray sont prises en charge ?

HyperPod prend en charge les bibliothèques Ray open source, notamment Ray Core, Ray Train, Ray Data et Ray Serve, car elle exécute Ray sans modification. Correspond spec.rayVersion à la version Ray de l'image de votre conteneur. Pour les API de la bibliothèque, consultez la documentation Ray sur le site Web de Ray.

Puis-je adopter une capacité sans les autres ?

Chaque HyperPod fonctionnalité s'installe indépendamment sous la forme d'un module complémentaire ou d'un package Python. Vous pouvez donc en adopter une et arrêter. Une équipe disposant de sa propre plateforme Ray peut ajouter de l'observabilité ou un accès authentifié au tableau de bord sans modifier le reste. Pour la liste complète et les dépendances, consultezPrise en main.