Limitaciones
Lightning Engine: La versión con imágenes
3.0no es compatible con Lightning Engine.Metastores con Hive 4.2: La versión de imagen
3.0no es compatible con BigQuery Metastore, BigLake Metastore ni Dataproc Metastore con Hive 4.2 (no se admiten las consultas directas de Hive con estos metastores).Delta Lake con Hive: Delta Lake
4.x, que se incluye en la versión de imagen3.0de Managed Service para Apache Spark, no es compatible con Hive (las consultas en tablas de Delta Lake 4.2 no se pueden ejecutar en Hive).Iceberg con Hive: La versión de imagen
3.0de Managed Service para Apache Spark incluye Hive 4.2, que admite Iceberg a través del catálogo REST de Iceberg.Clústeres de GPU: Todas las versiones de imagen
3.0, excepto3.0-ml-ubuntu, habilitancgroups V2. Como YARN no admite el descubrimiento de GPU cuandocgroups V2está habilitado, debes usar la imagen3.0-ml-ubuntucuando crees clústeres con GPU.Hudi: La versión de imagen
3.0no es compatible con Apache Hudi.
Notas:
La versión
3.0es una imagen ligera que contiene solo componentes principales, lo que reduce la exposición a vulnerabilidades y exposiciones comunes (CVE). Para requisitos de cumplimiento de seguridad más altos, usa la versión de imagen2.3o posterior cuando crees un clúster de Managed Service para Apache Spark.Si eliges instalar componentes opcionales cuando creas un clúster de Managed Service para Apache Spark con la imagen
3.0, se descargarán y se instalarán durante la creación del clúster. Esto podría aumentar el tiempo de inicio del clúster. Para evitar esta demora, puedes crear una imagen personalizada con los componentes opcionales preinstalados. Para ello, ejecutagenerate_custom_image.pycon la marca--optional-components.Se admiten los siguientes componentes opcionales en las imágenes 3.0:
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Notebook de Apache Zeppelin
- Apache Zookeeper
- Delta Lake
- Docker
- Notebook de JupyterLab
- Trino
yarn.nodemanager.recovery.enabledy el Registro de auditoría de HDFS están habilitados de forma predeterminada en las imágenes 3.0.Pixi se instala como parte de la instalación de Python y se usa para instalar paquetes de Python en lugar de Conda.
La calculadora de recursos predeterminada para YARN cambió de DefaultResourceCalculator a DominantResourceCalculator, que usa el concepto de recurso dominante para determinar la asignación de recursos, como la asignación de memoria y CPU. Este cambio afecta al escalador automático, que se ajusta según el uso de recursos dominantes del clúster.
A partir de la versión de imagen
3.0, cuando creas un clúster sin especificar un tipo de máquina para un nodo de clúster, Managed Service para Apache Spark especifica el nodo con una lista clasificada de tipos de máquinas de VM flexibles, como una lista clasificada de tipos de máquinas de las series N4, N2 y E2, con la lista optimizada para la disponibilidad de recursos.