Limitazioni
Lightning Engine: la versione dell'immagine
3.0non supporta Lightning Engine.Metastore con Hive 4.2: la versione dell'immagine
3.0non supporta BigQuery Metastore, BigLake Metastore o Dataproc Metastore con Hive 4.2 (le query Hive dirette che utilizzano questi metastore non sono supportate).Delta Lake con Hive: Delta Lake
4.x, incluso nella versione dell'immagine3.0di Managed Service for Apache Spark, non supporta Hive (le query sulle tabelle Delta Lake 4.2 non possono essere eseguite su Hive).Iceberg con Hive: la versione dell'immagine
3.0di Managed Service for Apache Spark include Hive 4.2, che supporta Iceberg tramite il catalogo REST di Iceberg.Cluster GPU: tutte le versioni dell'immagine
3.0, ad eccezione di3.0-ml-ubuntu, abilitanocgroups V2. Poiché YARN non supporta il rilevamento della GPU quandocgroups V2è abilitato, devi utilizzare l'immagine3.0-ml-ubuntuquando crei cluster con GPU.Hudi: la versione dell'immagine
3.0non supporta Apache Hudi.
Note:
La versione
3.0è un'immagine leggera che contiene solo i componenti principali, riducendo l'esposizione a vulnerabilità ed esposizioni comuni (CVE). Per requisiti di conformità alla sicurezza più elevati, utilizza la versione dell'immagine2.3o successive quando crei un cluster Managed Service for Apache Spark.Se scegli di installare componenti facoltativi quando crei un cluster Managed Service for Apache Spark con
3.0immagine, questi verranno scaricati e installati durante la creazione del cluster. Ciò potrebbe aumentare il tempo di avvio del cluster. Per evitare questo ritardo, puoi creare un 'immagine personalizzata con i componenti facoltativi preinstallati. Per farlo, eseguigenerate_custom_image.pycon il--optional-componentsflag.Nelle immagini 3.0 sono supportati i seguenti componenti facoltativi:
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Apache Zeppelin Notebook
- Apache Zookeeper
- Delta Lake
- Docker
- JupyterLab Notebook
- Trino
yarn.nodemanager.recovery.enablede l'audit logging HDFS sono abilitati per impostazione predefinita nelle immagini 3.0.Pixi viene installato come parte dell'installazione di Python e viene utilizzato per installare i pacchetti Python anziché Conda.
Il calcolatore di risorse predefinito per YARN è stato modificato da DefaultResourceCalculator a DominantResourceCalculator, che utilizza il concetto di risorsa dominante per determinare l'allocazione delle risorse, ad esempio l'allocazione di memoria e CPU. Questa modifica influisce su Autoscaler, che esegue la scalabilità in base all'utilizzo della risorsa dominante del cluster.
A partire dalla versione dell'immagine
3.0, quando crei un cluster senza specificare un tipo di macchina per un nodo del cluster, Managed Service for Apache Spark specifica il nodo con un elenco classificato di tipi di macchine VM flessibili, ad esempio un elenco classificato di tipi di macchine delle serie N4, N2 ed E2, con l'elenco ottimizzato per la disponibilità delle risorse.