Versions d'image 3.0.x

Composant 3.0.2-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/09/04
3.0.1-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/08/19
3.0.0-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/07/15
3.0.0-RC2-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/05/03
3.0.0-RC1-debian12/
-ubuntu24/
-rocky9
2025/09/08
**Apache Flink**
composant facultatif
2.2.0 2.2.0 2.2.0
**Apache Hadoop**
installé
3.5.0 3.5.0 3.5.0 3.5.0 3.4.1
**Apache Hive**
installé
4.2.0 4.2.0 4.2.0 4.2.0 4.1.0
Apache Hive WebHCat
composant facultatif
4.2.0 4.2.0 4.2.0
Apache Iceberg
composant facultatif
1.11.0 1.11.0 1.11.0
Apache Hudi
composant facultatif
1.2.0
**Apache Kafka**
action d'initialisation
3.9.2 3.9.2 3.9.2
**Apache Pig**
composant facultatif
0.18.0 0.18.0 0.18.0 0.18.0-SNAPSHOT
Apache Ranger
composant facultatif
2.8.0 2.8.0
Apache Spark
installé
4.1.2 4.1.2 4.1.2 4.1.1 4.0.0
**Apache Solr**
composant facultatif
9.10.1 9.10.1 9.10.1 9.7.0
Apache Tez
installé
0.10.5 0.10.5 0.10.5 0.10.5 0.10.5
Notebook Apache Zeppelin
composant facultatif
0.12.0 0.12.0 0.12.0
Apache ZooKeeper
composant facultatif
3.9.5 3.9.5 3.9.5 3.9.3
Connecteur BigQuery
installé
0.44.1-Preview 0.44.1-Preview 0.44.1-Preview 0.44.1-Preview
Connecteur Cloud Storage
installé
4.0.4 3.1.13 3.1.13 3.1.13 3.1.6
**Conscrypt**
installé
2.6 2.6 2.6 2.6
**Delta Lake**
composant facultatif
4.2.0 4.2.0
Docker
composant facultatif
28.1 28.1 28.1
Java
installé
21 21 21 21 17
Notebook JupyterLab
composant facultatif
4.5.7 4.5.7 4.5.7
Python
installé
Pixi 0.76.0 avec Python 3.12 Pixi 0.67.1 avec Python 3.12 Pixi 0.67.1 avec Python 3.12 Pixi 0.67.1 avec Python 3.11 micromamba 2.0.5 avec Python 3.11
R
installé
R 4.5 R 4.5 R 4.5 R 4.5 R 4.3
Scala
installé
2.13.17 2.13.17 2.13.17 2.13.17 2.13.14
Trino
composant facultatif
480 480 480

Limites

  • Metastores avec Hive 4.2 : la version d'image 3.0 n'est pas compatible avec BigQuery Metastore, BigLake Metastore ni Dataproc Metastore avec Hive 4.2 (les requêtes Hive directes utilisant ces metastores ne sont pas compatibles).

  • Delta Lake avec Hive : Delta Lake 4.x, inclus dans la version d'image 3.0 de Managed Service pour Apache Spark, n'est pas compatible avec Hive (les requêtes sur les tables Delta Lake 4.2 ne peuvent pas être exécutées sur Hive).

  • Iceberg avec Hive : la version d'image 3.0 de Managed Service pour Apache Spark inclut Hive 4.2, qui est compatible avec Iceberg via le catalogue REST Iceberg.

  • Clusters GPU : toutes les versions d'image 3.0, à l'exception de 3.0-ml-ubuntu, activent cgroups V2. Comme YARN n'est pas compatible avec la détection de GPU lorsque cgroups V2 est activé, vous devez utiliser l'image 3.0-ml-ubuntu lorsque vous créez des clusters avec des GPU.

Remarques :

  • La version 3.0 est une image légère qui ne contient que les composants principaux, ce qui réduit l'exposition aux failles et expositions courantes (CVE, Common Vulnerabilities and Exposures). Pour des exigences de conformité en matière de sécurité plus élevées, utilisez la version d'image 2.3 ou une version ultérieure lorsque vous créez un cluster Managed Service pour Apache Spark.

  • Si vous choisissez d'installer des composants facultatifs lorsque vous créez un cluster Managed Service pour Apache Spark avec l'image 3.0, ils seront téléchargés et installés lors de la création du cluster. Cela peut augmenter le temps de démarrage du cluster. Pour éviter ce délai, vous pouvez créer une image personnalisée avec les composants facultatifs préinstallés. Pour ce faire, exécutez generate_custom_image.py avec l'option --optional-components.

  • Les composants facultatifs suivants sont compatibles avec les images 3.0 :

    • Apache Flink
    • Apache Hive WebHCat
    • Apache Iceberg
    • Apache Pig
    • Apache Ranger
    • Apache Solr
    • Notebook Apache Zeppelin
    • Apache ZooKeeper
    • Delta Lake
    • Docker
    • Notebook JupyterLab
    • Trino
  • yarn.nodemanager.recovery.enabled et la journalisation d'audit HDFS sont activés par défaut dans les images 3.0.

  • Pixi est installé dans le cadre de l'installation de Python et est utilisé pour installer des packages Python au lieu de Conda.

  • Le calculateur de ressources par défaut pour YARN est passé de DefaultResourceCalculator à DominantResourceCalculator, qui utilise le concept de ressource dominante pour déterminer l'allocation des ressources, telles que l'allocation de mémoire et de processeur. Cette modification a un impact sur Autoscaler, qui effectue un scaling en fonction de l'utilisation des ressources dominantes du cluster.

  • À partir de la version d'image 3.0, lorsque vous créez un cluster sans spécifier de type de machine pour un nœud de cluster, Managed Service pour Apache Spark spécifie le nœud avec une liste classée de types de machines VM flexibles, par exemple une liste classée de types de machines des séries N4, N2 et E2, la liste étant optimisée pour la disponibilité des ressources.