Limitações
Lightning Engine:a versão de imagem
3.0não oferece suporte ao Lightning Engine.Metastores com o Hive 4.2:a versão de imagem
3.0não oferece suporte ao BigQuery Metastore, ao BigLake Metastore ou ao Dataproc Metastore com o Hive 4.2 (consultas diretas do Hive usando esses metastores não são aceitas).Delta Lake com o Hive:o Delta Lake
4.x, incluído na versão de imagem3.0do Serviço Gerenciado para Apache Spark, não oferece suporte ao Hive (consultas em tabelas do Delta Lake 4.2 não podem ser executadas no Hive).Iceberg com o Hive:a versão de imagem
3.0do Serviço Gerenciado para Apache Spark inclui o Hive 4.2, que oferece suporte ao Iceberg pelo catálogo REST do Iceberg.Clusters de GPU: todas as versões de imagem
3.0, exceto3.0-ml-ubuntu, ativamcgroups V2. Como o YARN não oferece suporte à descoberta de GPU quandocgroups V2está ativado, use a imagem3.0-ml-ubuntuao criar clusters com GPUs.Hudi:a versão de imagem
3.0não oferece suporte ao Apache Hudi.
Observações:
A versão
3.0é uma imagem leve que contém apenas componentes principais, reduzindo a exposição a vulnerabilidades e exposições comuns (CVEs). Para requisitos de conformidade de segurança mais altos, use a versão de imagem2.3ou mais recente ao criar um cluster do Serviço Gerenciado para Apache Spark.Se você optar por instalar componentes opcionais ao criar um cluster do Serviço Gerenciado para Apache Spark com a imagem
3.0, eles serão baixados e instalados durante a criação do cluster. Isso pode aumentar o tempo de inicialização do cluster. Para evitar esse atraso, crie uma imagem personalizada com os componentes opcionais pré-instalados. Isso é feito executandogenerate_custom_image.pycom a--optional-componentsflag.Os seguintes componentes opcionais são compatíveis com imagens 3.0:
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Notebook Apache Zeppelin
- Apache Zookeeper
- Delta Lake
- Docker
- Notebook JupyterLab
- Trino
yarn.nodemanager.recovery.enablede o registro de auditoria do HDFS são ativados por padrão em imagens 3.0.Pixi é instalado como parte da instalação do Python e é usado para instalar pacotes do Python em vez do Conda.
A calculadora de recursos padrão para YARN foi alterada de DefaultResourceCalculator para DominantResourceCalculator, que usa o conceito de recurso dominante para determinar a alocação de recursos, como memória e CPU. Essa mudança afeta o escalonador automático, que é escalonado com base no uso de recursos dominantes do cluster.
A partir da versão de imagem
3.0, ao criar um cluster sem especificar um tipo de máquina para um nó de cluster, o Serviço Gerenciado para Apache Spark especifica o nó com uma lista classificada de tipos de máquinas de VM flexíveis, como uma lista classificada de tipos de máquinas das séries N4, N2 e E2, com a lista otimizada para disponibilidade de recursos.