BigQuery 可解釋 AI 總覽

本文說明 BigQuery ML 如何支援可解釋的 AI (有時稱為 XAI)。

可解釋 AI 可定義資料列中各項特徵對預測結果的影響程度,協助您瞭解預測機器學習模型為分類和迴歸工作產生的結果。這項資訊通常稱為「功能歸因」。有了這項資訊,您就能確認模型的行為是否符合預期、找出模型偏誤,以及探索改善模型和訓練資料的方式。

局部與全域可解釋性

可解釋性分為兩種:局部可解釋性和全域可解釋性。這分別稱為「本機特徵重要性」和「全域特徵重要性」

  • 局部可解釋性會傳回每個已說明範例的特徵歸因值。這些值說明特定特徵對預測的影響程度,相較於基準預測。
  • 全域可解釋性會傳回特徵對模型的整體影響,通常是透過彙整整個資料集的特徵歸因來取得。絕對值越大,表示該特徵對模型預測結果的影響越大。

BigQuery ML 中的可解釋 AI 產品

BigQuery ML 中的可解釋 AI 支援各種機器學習模型,包括時間序列和非時間序列模型。每個模型都採用不同的可解釋性方法。

模型類別 模型類型 可解釋性方法 方法基本說明 本機說明函式 全域說明函式
受監護裝置 線性與邏輯迴歸 Shapley 值 線性模型的 Shapley 值等於 model weight * feature value,其中特徵值經過標準化,模型權重則以標準化特徵值訓練。 ML.EXPLAIN_PREDICT1 ML.GLOBAL_EXPLAIN2
標準差P 值 標準差和 p 值可用於針對模型權重進行顯著性測試。 不適用 ML.ADVANCED_WEIGHTS4
提升樹

隨機森林
Tree SHAP Tree SHAP 是一種演算法,可計算決策樹狀結構模型的確切 SHAP 值 ML.EXPLAIN_PREDICT1 ML.GLOBAL_EXPLAIN2
特徵貢獻概略值 估算特徵貢獻值。與 Tree SHAP 相比,這項功能更快速簡單。 ML.EXPLAIN_PREDICT1 ML.GLOBAL_EXPLAIN2
以吉尼指數為準的特徵重要性 全域特徵重要性分數,表示在訓練期間建構提升樹狀結構或隨機森林模型時,各項特徵的實用性或價值。 不適用 ML.FEATURE_IMPORTANCE
AutoML Tables 取樣 Shapley 取樣 Shapley 值會為每項特徵指派模型結果的功勞,並考量特徵的不同排列組合。這個方法會提供確切 Shapley 值的近似取樣。 不適用 ML.GLOBAL_EXPLAIN2
時間序列模型 ARIMA_PLUS 時間序列分解 如果時間序列中存在多個元件,系統會將時間序列分解為這些元件。這些成分包括趨勢、季節性、節慶、階段性變化,以及尖峰和低谷。詳情請參閱 ARIMA_PLUS 建模管道 ML.EXPLAIN_FORECAST3 不適用
ARIMA_PLUS_XREG 時間序列分解

Shapley 值
將時間序列分解為多個元件,包括趨勢、季節性、節慶、步階變化、尖峰和低谷 (類似於 ARIMA_PLUS)。系統會根據 Shapley 值計算每個外部迴歸量的歸因,該值等於 model weight * feature value ML.EXPLAIN_FORECAST3 不適用

1ML_EXPLAIN_PREDICTML.PREDICT 的擴充版本。

2ML.GLOBAL_EXPLAIN 會傳回全域可解釋性,方法是計算評估資料集中所有資料列的每個特徵所獲得的平均絕對歸因。

3ML.EXPLAIN_FORECASTML.FORECAST 的擴充版本。

4ML.ADVANCED_WEIGHTSML.WEIGHTS 的擴充版本。

後續步驟