Batasan
Lightning Engine: Versi image
3.0tidak mendukung Lightning Engine.Metastore dengan Hive 4.2: Versi image
3.0tidak mendukung BigQuery Metastore, BigLake Metastore, atau Dataproc Metastore dengan Hive 4.2 (kueri Hive langsung menggunakan metastore ini tidak didukung).Delta Lake dengan Hive: Delta Lake
4.x, yang disertakan dalam versi image Managed Service untuk Apache Spark3.0, tidak mendukung Hive (kueri pada tabel Delta Lake 4.2 tidak dapat dijalankan di Hive).Iceberg dengan Hive: Versi image Managed Service untuk Apache Spark
3.0menyertakan Hive 4.2, yang mendukung Iceberg melalui katalog REST Iceberg.Cluster GPU: Semua versi image
3.0, kecuali3.0-ml-ubuntu, mengaktifkancgroups V2. Karena YARN tidak mendukung penemuan GPU saatcgroups V2diaktifkan, Anda harus menggunakan image3.0-ml-ubuntusaat membuat cluster dengan GPU.Hudi: Versi image
3.0tidak mendukung Apache Hudi.
Catatan:
Versi
3.0adalah image ringan yang hanya berisi komponen inti, sehingga mengurangi eksposur terhadap Common Vulnerabilities and Exposures (CVE). Untuk persyaratan kepatuhan keamanan yang lebih tinggi, gunakan versi image2.3atau yang lebih baru, saat membuat cluster Managed Service untuk Apache Spark.Jika Anda memilih untuk menginstal komponen opsional saat membuat cluster Managed Service untuk Apache Spark dengan image
3.0, komponen tersebut akan di download dan diinstal selama pembuatan cluster. Hal ini dapat meningkatkan waktu startup cluster. Untuk menghindari penundaan ini, Anda dapat membuat image kustom dengan komponen opsional yang sudah diinstal sebelumnya. Hal ini dapat dilakukan dengan menjalankangenerate_custom_image.pydengan tanda--optional-components.Komponen opsional berikut didukung dalam image 3.0:
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Notebook Apache Zeppelin
- Apache Zookeeper
- Delta Lake
- Docker
- Notebook JupyterLab
- Trino
yarn.nodemanager.recovery.enableddan HDFS Audit Logging diaktifkan secara default dalam image 3.0.Pixi diinstal sebagai bagian dari penginstalan Python dan digunakan untuk menginstal paket Python, bukan Conda.
Kalkulator resource default untuk YARN telah diubah dari DefaultResourceCalculator menjadi DominantResourceCalculator, yang menggunakan konsep resource dominan untuk menentukan alokasi resource, seperti alokasi Memori dan CPU. Perubahan ini memengaruhi Autoscaler, yang melakukan penskalaan berdasarkan penggunaan resource dominan cluster.
Mulai versi image
3.0, saat Anda membuat cluster tanpa menentukan jenis mesin untuk node cluster, Managed Service untuk Apache Spark akan menentukan node dengan daftar jenis mesin VM fleksibel yang diberi peringkat, seperti daftar jenis mesin seri N4, N2, dan E2 yang diberi peringkat, dengan daftar yang dioptimalkan untuk ketersediaan resource.