Versiones de imágenes de la versión 3.0.x

Componente 3.0.0-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/07/15
3.0.0-RC2-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/05/03
3.0.0-RC1-debian12/
-ubuntu24/
-rocky9
2025/09/08


**Apache Flink**
componente opcional
2.2.0 2.2.0
**Apache Hadoop**
instalado
3.5.0 3.5.0 3.4.1
**Apache Hive**
instalado
4.2.0 4.2.0 4.1.0
Apache Hive WebHCat
componente opcional
4.2.0 4.2.0
**Apache Iceberg**
componente opcional
1.11.0
Acción de inicialización de
Apache Kafka
3.9.2 3.9.2
**Apache Pig**
componente opcional
0.18.0 0.18.0-SNAPSHOT
**Apache Ranger**
componente opcional
2.8.0
Apache Spark
instalado
4.1.2 4.1.1 4.0.0
**Apache Solr**
componente opcional
9.10.1 9.10.1 9.7.0
Apache Tez
instalado
0.10.5 0.10.5 0.10.5
Componente opcional de
Notebook de Apache Zeppelin
0.12.0 0.12.0
Componente opcional de
Apache Zookeeper
3.9.5 3.9.5 3.9.3
**Conector de BigQuery**
instalado
0.44.1-Preview 0.44.1-Preview
**Conector de Cloud Storage**
instalado
3.1.13 3.1.13 3.1.6
**Conscrypt**
instalado
2.6 2.6 2.6
**Delta Lake**
componente opcional
4.2.0
**Docker**
componente opcional
28.1 28.1
Java
instalado
21 21 17
Componente opcional de
Notebook de JupyterLab
4.5.7 4.5.7
**Python**
instalado
Pixi 0.67.1 con Python 3.12 Pixi 0.67.1 con Python 3.11 micromamba 2.0.5 con Python 3.11
R
instalado
R 4.5 R 4.5 R 4.3
Scala
instalado
2.13.17 2.13.17 2.13.14
Trino
componente opcional
480 480

Limitaciones

  • Lightning Engine: La versión con imágenes 3.0 no es compatible con Lightning Engine.

  • Metastores con Hive 4.2: La versión de imagen 3.0 no es compatible con BigQuery Metastore, BigLake Metastore ni Dataproc Metastore con Hive 4.2 (no se admiten las consultas directas de Hive con estos metastores).

  • Delta Lake con Hive: Delta Lake 4.x, que se incluye en la versión de imagen 3.0 de Managed Service para Apache Spark, no es compatible con Hive (las consultas en tablas de Delta Lake 4.2 no se pueden ejecutar en Hive).

  • Iceberg con Hive: La versión de imagen 3.0 de Managed Service para Apache Spark incluye Hive 4.2, que admite Iceberg a través del catálogo REST de Iceberg.

  • Clústeres de GPU: Todas las versiones de imagen 3.0, excepto 3.0-ml-ubuntu, habilitan cgroups V2. Como YARN no admite el descubrimiento de GPU cuando cgroups V2 está habilitado, debes usar la imagen 3.0-ml-ubuntu cuando crees clústeres con GPU.

  • Hudi: La versión de imagen 3.0 no es compatible con Apache Hudi.

Notas:

  • La versión 3.0 es una imagen ligera que contiene solo componentes principales, lo que reduce la exposición a vulnerabilidades y exposiciones comunes (CVE). Para requisitos de cumplimiento de seguridad más altos, usa la versión de imagen 2.3 o posterior cuando crees un clúster de Managed Service para Apache Spark.

  • Si eliges instalar componentes opcionales cuando creas un clúster de Managed Service para Apache Spark con la imagen 3.0, se descargarán y se instalarán durante la creación del clúster. Esto podría aumentar el tiempo de inicio del clúster. Para evitar esta demora, puedes crear una imagen personalizada con los componentes opcionales preinstalados. Para ello, ejecuta generate_custom_image.py con la marca --optional-components.

  • Se admiten los siguientes componentes opcionales en las imágenes 3.0:

    • Apache Flink
    • Apache Hive WebHCat
    • Apache Iceberg
    • Apache Pig
    • Apache Ranger
    • Apache Solr
    • Notebook de Apache Zeppelin
    • Apache Zookeeper
    • Delta Lake
    • Docker
    • Notebook de JupyterLab
    • Trino
  • yarn.nodemanager.recovery.enabled y el Registro de auditoría de HDFS están habilitados de forma predeterminada en las imágenes 3.0.

  • Pixi se instala como parte de la instalación de Python y se usa para instalar paquetes de Python en lugar de Conda.

  • La calculadora de recursos predeterminada para YARN cambió de DefaultResourceCalculator a DominantResourceCalculator, que usa el concepto de recurso dominante para determinar la asignación de recursos, como la asignación de memoria y CPU. Este cambio afecta al escalador automático, que se ajusta según el uso de recursos dominantes del clúster.

  • A partir de la versión de imagen 3.0, cuando creas un clúster sin especificar un tipo de máquina para un nodo de clúster, Managed Service para Apache Spark especifica el nodo con una lista clasificada de tipos de máquinas de VM flexibles, como una lista clasificada de tipos de máquinas de las series N4, N2 y E2, con la lista optimizada para la disponibilidad de recursos.