このチュートリアルでは、大規模言語モデル(LLM)用の高性能な JAX ベースのトレーニング スタックである MaxText を使用して、単一の v6e-8 Tensor Processing Unit(TPU)仮想 machine(VM)インスタンスで教師ありファインチューニング(SFT)を実行する手順について説明します。 Google Cloud
目標
- Cloud TPU VM インスタンスを設定する。
- MaxText とその依存関係をインストールする。
- Hugging Face モデルを MaxText 形式に変換する。
- TPU で SFT トレーニング ワークロードを実行する。
- サービングのために、ファインチューニングしたモデルを Hugging Face 形式に戻す。
費用
このドキュメントでは、課金対象である次のコンポーネントを使用します。 Google Cloud
料金計算ツールを使うと、予想使用量に基づいて費用の見積もりを生成できます。
このドキュメントに記載されているタスクの完了後、作成したリソースを削除すると、それ以上の請求は発生しません。詳細については、 クリーンアップをご覧ください。
始める前に
このチュートリアルを使用するには、Hugging Face アクセス トークンが必要です。Hugging Faceで無料アカウントに登録できます 。アカウントを作成したら、アクセス トークンを生成します。
- [Welcome to Hugging Face] ページで、 アカウントのアバターをクリックし、[**Access tokens**] を選択します。
- [Access tokens] ページで、[Create new token] をクリックします。
- [Read] トークンタイプを選択し、トークンの名前を入力します。
- アクセス トークンが表示されます。トークンを安全な場所に保存します。
- Hugging Face ウェブサイトで、トレーニングするモデルのライセンス
契約に同意します。このチュートリアルでは、モデル
gemma3-4bを使用します。
このチュートリアルを完了するために必要な権限を取得するには、プロジェクトに対する次の IAM ロールを付与するよう管理者に依頼してください。
- TPU 管理者 (
roles/tpu.admin) - サービス アカウント ユーザー (
roles/iam.serviceAccountUser) - Compute 編集者 (
roles/compute.editor)
ロールの付与については、プロジェクト、フォルダ、組織へのアクセス権の管理をご覧ください。
環境を設定する
次のスクリプトを実行して、環境変数を設定します。
次のように置き換えます。
- YOUR_PROJECT_ID: 実際の Google Cloud プロジェクト ID
- ZONE_NAME: 使用するゾーン
- RESERVATION_NAME: 容量予約
- TPU_MACHINE_NAME: Cloud TPU VM インスタンスの名前
次のコマンドを実行して、 Google Cloud で認証します。
gcloud auth login
Cloud TPU VM を作成する
容量予約にバインドされた 8 個の v6e TPU チップを使用して、Cloud TPU VM インスタンスを作成します。
VM インスタンスが作成されたら、SSH を使用して接続します。
TPU VM インスタンス内で次の手順を完了します。
MaxText をインストールする
TPU VM インスタンス内のシステム パッケージを更新します。
MaxText に必要な Python 3.12 とその仮想環境パッケージをインストールします。
uv を使用して、Python パッケージのインストールを高速化します。
maxtext_venv という名前の仮想環境を作成して有効にします。
MaxText と、トレーニング後のタスクに必要な依存関係をインストールします。
次のコマンドを実行して、残りの必要な依存関係をインストールします。
モデルを MaxText 形式に変換する
モデルを MaxText 形式でトレーニングするには、Hugging Face 形式から MaxText 形式に変換する必要があります。
Hugging Face アクセス トークン、使用するモデルの名前、MaxText 形式でモデルを保存するディレクトリなど、環境変数を指定します。
YOUR_HF_TOKEN は、以前に作成した Hugging Face アクセス トークン に置き換えます。
モデルを Hugging Face 形式から MaxText 形式に変換するには、次のスクリプトを実行します。この変換には約 5 分かかります。
トレーニング ワークロードを開始する
変換プロセスが完了したら、SFT ワークロードを開始できます。
SFT ワークロードのトレーニング パラメータを構成します。
トレーニング ジョブを開始します。
v6e-8VM インスタンスでは約 10 分かかります。
トレーニング済みモデルを Hugging Face 形式に戻す
トレーニング ワークロードが完了したら、モデルを Hugging Face 形式に戻します。
エクスポートとトレーニング済みパラメータのパスを設定します。
Hugging Face 形式への変換を実行します。
変換が完了すると、/dev/shm/gemma3-4b/hf-trained に保存されているチューニング済みモデルを使用できるようになります。VM が再起動すると /dev/shm フォルダの内容にアクセスできなくなるため、チューニング済みモデルを永続ストレージに移動するか、Hugging Face Hub にアップロードする必要があります。
クリーンアップ
追加の料金が発生しないように、このチュートリアルで作成したリソースを削除します。
TPU VM インスタンスを削除する
Cloud TPU VM インスタンスを終了し、削除します。
次のステップ
- Cloud TPU の詳細については、 Cloud TPU の概要をご覧ください。
v6e-8TPU のアーキテクチャと構成の詳細については、 TPU v6e をご覧ください。