Beschränkungen
Metastores mit Hive 4.2:Die Image-Version
3.0unterstützt weder BigQuery Metastore noch BigLake Metastore oder Dataproc Metastore mit Hive 4.2 (direkte Hive-Abfragen mit diesen Metastores werden nicht unterstützt).Delta Lake mit Hive:Delta Lake
4.x, das in der Managed Service for Apache Spark-Image-Version3.0enthalten ist, unterstützt Hive nicht (Abfragen für Delta Lake 4.2-Tabellen können nicht in Hive ausgeführt werden).Iceberg mit Hive:Die Managed Service for Apache Spark-Image-Version
3.0enthält Hive 4.2, das Iceberg über den Iceberg REST-Katalog unterstützt.GPU-Cluster: In allen
3.0Image-Versionen außer3.0-ml-ubuntuistcgroups V2aktiviert. Da YARN die GPU-Erkennung nicht unterstützt, wenncgroups V2aktiviert ist, müssen Sie das Image3.0-ml-ubuntuverwenden, wenn Sie Cluster mit GPUs erstellen.
Hinweise:
Version
3.0ist ein schlankes Image, das nur Kernkomponenten enthält. Dadurch wird das Risiko von häufig vorkommenden Sicherheitslücken (Common Vulnerabilities and Exposures, CVEs) verringert. Wenn Sie höhere Sicherheitsanforderungen erfüllen müssen, verwenden Sie beim Erstellen eines Managed Service for Apache Spark-Clusters die Image-Version2.3oder höher.Wenn Sie beim Erstellen eines Managed Service for Apache Spark-Clusters mit dem Image
3.0optionale Komponenten installieren, werden diese während der Clustererstellung heruntergeladen und installiert. Dadurch kann sich die Startzeit des Clusters verlängern. Um diese Verzögerung zu vermeiden, können Sie ein benutzerdefiniertes Image mit den vorinstallierten optionalen Komponenten erstellen. Dazu führen Siegenerate_custom_image.pymit dem--optional-componentsFlag aus.Die folgenden optionalen Komponenten werden in 3.0-Images unterstützt:
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Apache Zeppelin-Notebook
- Apache ZooKeeper
- Delta Lake
- Docker
- JupyterLab-Notebook
- Trino
yarn.nodemanager.recovery.enabledund HDFS Audit Logging sind in 3.0-Images standardmäßig aktiviert.Pixi wird im Rahmen der Python Installation installiert und zum Installieren von Python-Paketen anstelle von Conda verwendet.
Der Standardressourcenrechner für YARN wurde von DefaultResourceCalculator in DominantResourceCalculatorgeändert, der das Konzept der dominanten Ressource verwendet, um die Ressourcenzuweisung zu bestimmen, z. B. die Speicher- und CPU-Zuweisung. Diese Änderung wirkt sich auf die automatische Skalierung aus, die auf der dominanten Ressourcennutzung des Clusters basiert.
Ab der Image-Version
3.0gibt Managed Service for Apache Spark, wenn Sie einen Cluster erstellen, ohne einen Maschinentyp für einen Clusterknoten anzugeben, den Knoten mit einer Rangliste flexibler VM-Maschinentypen an, z. B. eine Rangliste von Maschinentypen der Serien N4, N2 und E2. Die Liste ist für die Ressourcenverfügbarkeit optimiert.