Limites
Lightning Engine : la version d'image
3.0n'est pas compatible avec Lightning Engine.Metastores avec Hive 4.2 : la version d'image
3.0n'est pas compatible avec BigQuery Metastore, BigLake Metastore ni Dataproc Metastore avec Hive 4.2 (les requêtes Hive directes utilisant ces metastores ne sont pas compatibles).Delta Lake avec Hive : Delta Lake
4.x, inclus dans la version3.0de l'image Managed Service for Apache Spark, n'est pas compatible avec Hive (les requêtes sur les tables Delta Lake 4.2 ne peuvent pas être exécutées sur Hive).Iceberg avec Hive : la version d'image Managed Service pour Apache Spark
3.0inclut Hive 4.2, qui est compatible avec Iceberg via le catalogue Iceberg REST.Clusters GPU : toutes les versions d'image
3.0, à l'exception de3.0-ml-ubuntu, activentcgroups V2. Étant donné que YARN n'est pas compatible avec la découverte de GPU lorsquecgroups V2est activé, vous devez utiliser l'image3.0-ml-ubuntulorsque vous créez des clusters avec des GPU.Hudi : la version
3.0de l'image n'est pas compatible avec Apache Hudi.
Remarques :
La version
3.0est une image légère qui ne contient que les composants de base, ce qui réduit l'exposition aux failles et expositions courantes (CVE, Common Vulnerabilities and Exposures). Pour répondre à des exigences de conformité de sécurité plus élevées, utilisez la version d'image2.3ou ultérieure lorsque vous créez un cluster Managed Service pour Apache Spark.Si vous choisissez d'installer des composants facultatifs lorsque vous créez un cluster Managed Service pour Apache Spark avec l'image
3.0, ils seront téléchargés et installés lors de la création du cluster. Cela peut augmenter le temps de démarrage du cluster. Pour éviter ce délai, vous pouvez créer une image personnalisée avec les composants facultatifs préinstallés. Pour ce faire, exécutezgenerate_custom_image.pyavec l'indicateur--optional-components.Les composants facultatifs suivants sont compatibles avec les images 3.0 :
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Notebook Apache Zeppelin
- Apache ZooKeeper
- Delta Lake
- Docker
- Notebook JupyterLab
- Trino
yarn.nodemanager.recovery.enabledet les journaux d'audit HDFS sont activés par défaut dans les images 3.0.Pixi est installé dans le cadre de l'installation de Python et est utilisé pour installer des packages Python au lieu de Conda.
Le calculateur de ressources par défaut pour YARN est passé de DefaultResourceCalculator à DominantResourceCalculator, qui utilise le concept de ressource dominante pour déterminer l'allocation de ressources, telles que la mémoire et le processeur. Cette modification a un impact sur l'autoscaler, qui effectue le scaling en fonction de l'utilisation des ressources dominantes du cluster.
À partir de la version d'image
3.0, lorsque vous créez un cluster sans spécifier de type de machine pour un nœud de cluster, Managed Service for Apache Spark spécifie le nœud avec une liste classée de types de machines de VM flexibles, par exemple une liste classée de types de machines des séries N4, N2 et E2, avec une liste optimisée pour la disponibilité des ressources.