Passer au contenu

Pourquoi mon cluster EMR ne se met pas à l'échelle alors que la gestion de la mise à l'échelle est activée ou que les paramètres de redimensionnement sont respectés ?

Lecture de 5 minute(s)
0

J'ai activé la gestion de la mise à l'échelle ou les métriques de redimensionnement sont respectées, mais mon cluster EMR ne se met pas à l’échelle.

Résolution

Les seuils définis dans les métriques Amazon CloudWatch pour la mise à l'échelle ne sont pas respectés

La mise à l'échelle automatique dépend des métriques d'Amazon CloudWatch. Si les seuils de métriques correspondants ne sont pas respectés pour l’augmentation ou la réduction verticale, la mise à l'échelle n'a pas lieu.

Consultez les métriques Amazon EMR dans Amazon CloudWatch pour vérifier que les métriques définies dans vos règles de mise à l’échelle, telles que ContainerPendingRatio et YARNMemoryAvailablePercentage, sont renseignées.

Les métriques Amazon EMR peuvent ne pas être renseignées comme prévu dans CloudWatch pour l'une des raisons suivantes :

  • Le fichier /etc/hadoop/conf/hadoop-metrics2.properties n'existe pas ou il est endommagé. Par exemple, une action d'amorçage personnalisée a peut-être remplacé le fichier.
  • Des problèmes peuvent survenir avec les composants liés aux métriques tels que Hadoop ou YARN. Consultez les journaux d'application correspondants pour vérifier l’existence éventuelle d’erreurs.
  • Le démon MetricsCollector n'est peut-être pas en cours d'exécution. Pour une mise à l'échelle gérée, exécutez la commande suivante sur le nœud primaire pour vérifier si le démon MetricsCollector est en cours d'exécution :
    sudo systemctl status MetricsCollector

Vous utilisez des applications qui ne sont pas basées sur YARN

Les applications telles que Presto qui ne sont pas basées sur YARN utilisent des méthodes de mise à l'échelle basées sur des métriques générées par YARN. Les clusters ne se mettent pas à l’échelle, même si le taux d'utilisation des requêtes Presto est élevé. Si vous utilisez des applications qui ne sont pas basées sur YARN, utilisez la mise à l'échelle manuelle. Par exemple, vous pouvez configurer l'API de redimensionnement Amazon EMR pour utiliser des métriques Presto personnalisées.

Les groupes d'instances principaux ou de tâches se trouvent dans un état suspendu ou arrêté

Les groupes d'instances principaux ou de tâches à l’état suspendu ou arrêté sont bloqués lorsqu'ils sont redimensionnés ou mis à l’échelle. Pour plus d'informations, consultez la section État suspendu.

Les reconfigurations peuvent entraîner le passage des groupes d'instances à l’état arrêté. Pour plus d'informations, consultez la section Résoudre les problèmes de reconfiguration des groupes d'instances.

Certains problèmes liés à l'application HDFS dans Amazon EMR entraînent des problèmes lors de la mise à l'échelle des nœuds principaux

Si les deux conditions suivantes sont remplies, il est recommandé de maintenir les nœuds principaux fixes :

  • Vous stockez des données dans des compartiments Amazon Simple Storage Service (Amazon S3).
  • L'utilisation du système de fichiers distribué Hadoop (HDFS) est minimale.

Remarque : il est recommandé de mettre à l’échelle des nœuds de tâches uniquement pour éviter les problèmes liés au HDFS.

La mise à l'échelle des nœuds principaux prend plus de temps que celle des nœuds de tâches. Cela est dû au fait que les nœuds principaux disposent d'un service supplémentaire (Datanode) utilisé pour stocker les données HDFS. La mise hors service des données HDFS prend du temps. Si votre cas d'utilisation nécessite la mise à l'échelle du nœud principal et que la mise à l'échelle est bloquée, il se peut qu'un problème soit survenu avec la mise hors service du HDFS.

Pour résoudre les problèmes liés à une mise à l’échelle bloquée en raison de la mise hors service du HDFS, effectuez les actions suivantes :

  • Vérifiez l'état des services HDFS (Namenode et Datanode).
  • Exécutez la commande hdfs dfsadmin -report pour vérifier s'il existe des blocs manquants, endommagés ou sous-répliqués.
  • Vérifiez si certains nœuds principaux ne sont pas sains en raison de problèmes de disque, de mémoire ou de processeur.
  • Vérifiez si vous définissez le facteur de réplication HDFS sur une valeur élevée, telle que 3 ou 2. Si vous essayez de réduire le nœud principal à 1 alors que le facteur de réplication est défini sur 3 ou 2, l'opération de mise à l’échelle est bloquée. En effet, Amazon EMR doit conserver le nombre minimum de réplicas.

La capacité demandée n'est pas disponible dans Amazon EMR

Si la capacité Amazon Elastic Compute Cloud (Amazon EC2) demandée n'est pas disponible dans Amazon EMR, la mise à l'échelle échoue après le délai imparti. Si la mise à l’échelle est bloquée pendant plus de 2 à 3 heures et que vous recevez des erreurs de capacité insuffisante lors des événements AWS CloudTrail, effectuez un redimensionnement manuel.

Informations connexes

Utilisation de la mise à l'échelle automatique avec une politique personnalisée pour les groupes d'instances dans Amazon EMR.

Redimensionner manuellement un cluster Amazon EMR en cours d'exécution

Utilisation de la mise à l'échelle gérée dans Amazon EMR

Les 9 meilleurs conseils pour optimiser les performances de PrestoDB sur Amazon EMR

AWS OFFICIELA mis à jour il y a 7 mois