"Managed Service for Apache Spark" is the new name for the product formerly known as "Dataproc on Compute Engine" (cluster deployment) and "Google Cloud Serverless for Apache Spark" (serverless deployment).
Google は AI 技術を使用して、コンテンツをご希望の言語に翻訳しています。AI 翻訳には誤りが含まれる場合があります。
Managed Service for Apache Spark は、Apache Hadoop および Hadoop 分散ファイル システム(HDFS)と統合されています。Managed Service for Apache Spark クラスタおよびジョブのコンピューティングとデータ ストレージを選択する際は、次の点に注意する必要があります。
HDFS と Cloud Storage: Managed Service for Apache Spark はストレージに Hadoop 分散ファイル システム(HDFS)を使用します。また、Managed Service for Apache Spark は HDFS 互換の Cloud Storage コネクタを自動的にインストールするため、HDFS と並行して Cloud Storage も使用できます。クラスタに対してデータの移動を行うには、HDFS や Cloud Storage へのアップロードとダウンロードを使用します。
VM ディスク:
デフォルトでは、ローカル SSD がない場合、HDFS データと中間シャッフル データは永続ディスクの VM ブートディスクに保存されます。