View a markdown version of this page

Inférence accélérée - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Inférence accélérée

Ray Serve est la bibliothèque open source de service de modèles pour Ray. Vous déployez un modèle en tant qu'application Serve, et Ray Serve gère le routage des demandes, le traitement par lots et la mise à l'échelle des répliques. Sur HyperPod, Ray Serve s'exécute KubeRay via une RayService ressource, de sorte que votre code Serve et votre graphique de déploiement restent inchangés.

Exigences

Ray Serve activé ne HyperPod nécessite que l' KubeRay opérateur. KubeRay réconcilie la RayService ressource, crée le cluster Ray qui la sauvegarde et gère les applications Serve qui s'y trouvent. Pour de plus amples informations, veuillez consulter Installation KubeRay sur HyperPod Amazon EKS.

Vous n'installez pas d'opérateur d'inférence distinct pour diffuser des modèles avec Ray Serve. Le chemin de JumpStart déploiement utilise également la toolkit-for-ray-on-sagemaker-ai bibliothèque avec laquelle vous effectuez l'installationpip.

Actions possibles

  • Déployez un modèle à partir de votre propre code en tant que tel RayService et accédez-y via HTTP.

  • Déployez un JumpStart modèle dans un déploiement Ray Serve.

  • Réduisez le délai d'obtention du premier jeton pour les charges de travail à contexte long et à tours multiples grâce à un cache KV hiérarchisé géré et à un routage prenant en compte les préfixes.

  • Faites évoluer les répliques de serveurs au sein du cluster et augmentez la capacité du cluster grâce à la gestion de Karpenter.

Pour l'API Ray Serve et les concepts de déploiement, voir Ray Serve : Scalable and Programmable Serving dans la documentation Ray.