J'ai activé la gestion de la mise à l'échelle ou les métriques de redimensionnement sont respectées, mais mon cluster EMR ne se met pas à l’échelle.
Résolution
Les seuils définis dans les métriques Amazon CloudWatch pour la mise à l'échelle ne sont pas respectés
La mise à l'échelle automatique dépend des métriques d'Amazon CloudWatch. Si les seuils de métriques correspondants ne sont pas respectés pour l’augmentation ou la réduction verticale, la mise à l'échelle n'a pas lieu.
Consultez les métriques Amazon EMR dans Amazon CloudWatch pour vérifier que les métriques définies dans vos règles de mise à l’échelle, telles que ContainerPendingRatio et YARNMemoryAvailablePercentage, sont renseignées.
Les métriques Amazon EMR peuvent ne pas être renseignées comme prévu dans CloudWatch pour l'une des raisons suivantes :
Vous utilisez des applications qui ne sont pas basées sur YARN
Les applications telles que Presto qui ne sont pas basées sur YARN utilisent des méthodes de mise à l'échelle basées sur des métriques générées par YARN. Les clusters ne se mettent pas à l’échelle, même si le taux d'utilisation des requêtes Presto est élevé. Si vous utilisez des applications qui ne sont pas basées sur YARN, utilisez la mise à l'échelle manuelle. Par exemple, vous pouvez configurer l'API de redimensionnement Amazon EMR pour utiliser des métriques Presto personnalisées.
Les groupes d'instances principaux ou de tâches se trouvent dans un état suspendu ou arrêté
Les groupes d'instances principaux ou de tâches à l’état suspendu ou arrêté sont bloqués lorsqu'ils sont redimensionnés ou mis à l’échelle. Pour plus d'informations, consultez la section État suspendu.
Les reconfigurations peuvent entraîner le passage des groupes d'instances à l’état arrêté. Pour plus d'informations, consultez la section Résoudre les problèmes de reconfiguration des groupes d'instances.
Certains problèmes liés à l'application HDFS dans Amazon EMR entraînent des problèmes lors de la mise à l'échelle des nœuds principaux
Si les deux conditions suivantes sont remplies, il est recommandé de maintenir les nœuds principaux fixes :
- Vous stockez des données dans des compartiments Amazon Simple Storage Service (Amazon S3).
- L'utilisation du système de fichiers distribué Hadoop (HDFS) est minimale.
Remarque : il est recommandé de mettre à l’échelle des nœuds de tâches uniquement pour éviter les problèmes liés au HDFS.
La mise à l'échelle des nœuds principaux prend plus de temps que celle des nœuds de tâches. Cela est dû au fait que les nœuds principaux disposent d'un service supplémentaire (Datanode) utilisé pour stocker les données HDFS. La mise hors service des données HDFS prend du temps. Si votre cas d'utilisation nécessite la mise à l'échelle du nœud principal et que la mise à l'échelle est bloquée, il se peut qu'un problème soit survenu avec la mise hors service du HDFS.
Pour résoudre les problèmes liés à une mise à l’échelle bloquée en raison de la mise hors service du HDFS, effectuez les actions suivantes :
- Vérifiez l'état des services HDFS (Namenode et Datanode).
- Exécutez la commande hdfs dfsadmin -report pour vérifier s'il existe des blocs manquants, endommagés ou sous-répliqués.
- Vérifiez si certains nœuds principaux ne sont pas sains en raison de problèmes de disque, de mémoire ou de processeur.
- Vérifiez si vous définissez le facteur de réplication HDFS sur une valeur élevée, telle que 3 ou 2. Si vous essayez de réduire le nœud principal à 1 alors que le facteur de réplication est défini sur 3 ou 2, l'opération de mise à l’échelle est bloquée. En effet, Amazon EMR doit conserver le nombre minimum de réplicas.
La capacité demandée n'est pas disponible dans Amazon EMR
Si la capacité Amazon Elastic Compute Cloud (Amazon EC2) demandée n'est pas disponible dans Amazon EMR, la mise à l'échelle échoue après le délai imparti. Si la mise à l’échelle est bloquée pendant plus de 2 à 3 heures et que vous recevez des erreurs de capacité insuffisante lors des événements AWS CloudTrail, effectuez un redimensionnement manuel.
Informations connexes
Utilisation de la mise à l'échelle automatique avec une politique personnalisée pour les groupes d'instances dans Amazon EMR.
Redimensionner manuellement un cluster Amazon EMR en cours d'exécution
Utilisation de la mise à l'échelle gérée dans Amazon EMR
Les 9 meilleurs conseils pour optimiser les performances de PrestoDB sur Amazon EMR