Limites
Metastores avec Hive 4.2 : la version d'image
3.0n'est pas compatible avec BigQuery Metastore, BigLake Metastore ni Dataproc Metastore avec Hive 4.2 (les requêtes Hive directes utilisant ces metastores ne sont pas compatibles).Delta Lake avec Hive : Delta Lake
4.x, inclus dans la version d'image3.0de Managed Service pour Apache Spark, n'est pas compatible avec Hive (les requêtes sur les tables Delta Lake 4.2 ne peuvent pas être exécutées sur Hive).Iceberg avec Hive : la version d'image
3.0de Managed Service pour Apache Spark inclut Hive 4.2, qui est compatible avec Iceberg via le catalogue REST Iceberg.Clusters GPU : toutes les versions d'image
3.0, à l'exception de3.0-ml-ubuntu, activentcgroups V2. Comme YARN n'est pas compatible avec la détection de GPU lorsquecgroups V2est activé, vous devez utiliser l'image3.0-ml-ubuntulorsque vous créez des clusters avec des GPU.
Remarques :
La version
3.0est une image légère qui ne contient que les composants principaux, ce qui réduit l'exposition aux failles et expositions courantes (CVE, Common Vulnerabilities and Exposures). Pour des exigences de conformité en matière de sécurité plus élevées, utilisez la version d'image2.3ou une version ultérieure lorsque vous créez un cluster Managed Service pour Apache Spark.Si vous choisissez d'installer des composants facultatifs lorsque vous créez un cluster Managed Service pour Apache Spark avec l'image
3.0, ils seront téléchargés et installés lors de la création du cluster. Cela peut augmenter le temps de démarrage du cluster. Pour éviter ce délai, vous pouvez créer une image personnalisée avec les composants facultatifs préinstallés. Pour ce faire, exécutezgenerate_custom_image.pyavec l'option--optional-components.Les composants facultatifs suivants sont compatibles avec les images 3.0 :
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Notebook Apache Zeppelin
- Apache ZooKeeper
- Delta Lake
- Docker
- Notebook JupyterLab
- Trino
yarn.nodemanager.recovery.enabledet la journalisation d'audit HDFS sont activés par défaut dans les images 3.0.Pixi est installé dans le cadre de l'installation de Python et est utilisé pour installer des packages Python au lieu de Conda.
Le calculateur de ressources par défaut pour YARN est passé de DefaultResourceCalculator à DominantResourceCalculator, qui utilise le concept de ressource dominante pour déterminer l'allocation des ressources, telles que l'allocation de mémoire et de processeur. Cette modification a un impact sur Autoscaler, qui effectue un scaling en fonction de l'utilisation des ressources dominantes du cluster.
À partir de la version d'image
3.0, lorsque vous créez un cluster sans spécifier de type de machine pour un nœud de cluster, Managed Service pour Apache Spark spécifie le nœud avec une liste classée de types de machines VM flexibles, par exemple une liste classée de types de machines des séries N4, N2 et E2, la liste étant optimisée pour la disponibilité des ressources.