BigQuery 可解釋 AI 總覽
本文說明 BigQuery ML 如何支援可解釋的 AI (有時稱為 XAI)。
可解釋 AI 可定義資料列中各項特徵對預測結果的影響程度,協助您瞭解預測機器學習模型為分類和迴歸工作產生的結果。這項資訊通常稱為「功能歸因」。有了這項資訊,您就能確認模型的行為是否符合預期、找出模型偏誤,以及探索改善模型和訓練資料的方式。
局部與全域可解釋性
可解釋性分為兩種:局部可解釋性和全域可解釋性。這分別稱為「本機特徵重要性」和「全域特徵重要性」。
- 局部可解釋性會傳回每個已說明範例的特徵歸因值。這些值說明特定特徵對預測的影響程度,相較於基準預測。
- 全域可解釋性會傳回特徵對模型的整體影響,通常是透過彙整整個資料集的特徵歸因來取得。絕對值越大,表示該特徵對模型預測結果的影響越大。
BigQuery ML 中的可解釋 AI 產品
BigQuery ML 中的可解釋 AI 支援各種機器學習模型,包括時間序列和非時間序列模型。每個模型都採用不同的可解釋性方法。
| 模型類別 | 模型類型 | 可解釋性方法 | 方法基本說明 | 本機說明函式 | 全域說明函式 |
|---|---|---|---|---|---|
| 受監護裝置 | 線性與邏輯迴歸 | Shapley 值 | 線性模型的 Shapley 值等於 model weight * feature
value,其中特徵值經過標準化,模型權重則以標準化特徵值訓練。 |
ML.EXPLAIN_PREDICT1 |
ML.GLOBAL_EXPLAIN2 |
| 標準差和 P 值 | 標準差和 p 值可用於針對模型權重進行顯著性測試。 | 不適用 | ML.ADVANCED_WEIGHTS4 |
||
| 提升樹 隨機森林 |
Tree SHAP | Tree SHAP 是一種演算法,可計算決策樹狀結構模型的確切 SHAP 值。 | ML.EXPLAIN_PREDICT1 |
ML.GLOBAL_EXPLAIN2 |
|
| 特徵貢獻概略值 | 估算特徵貢獻值。與 Tree SHAP 相比,這項功能更快速簡單。 | ML.EXPLAIN_PREDICT1 |
ML.GLOBAL_EXPLAIN2 |
||
| 以吉尼指數為準的特徵重要性 | 全域特徵重要性分數,表示在訓練期間建構提升樹狀結構或隨機森林模型時,各項特徵的實用性或價值。 | 不適用 | ML.FEATURE_IMPORTANCE |
||
| AutoML Tables | 取樣 Shapley | 取樣 Shapley 值會為每項特徵指派模型結果的功勞,並考量特徵的不同排列組合。這個方法會提供確切 Shapley 值的近似取樣。 | 不適用 | ML.GLOBAL_EXPLAIN2 |
|
| 時間序列模型 | ARIMA_PLUS | 時間序列分解 | 如果時間序列中存在多個元件,系統會將時間序列分解為這些元件。這些成分包括趨勢、季節性、節慶、階段性變化,以及尖峰和低谷。詳情請參閱 ARIMA_PLUS 建模管道。 | ML.EXPLAIN_FORECAST3 |
不適用 |
| ARIMA_PLUS_XREG | 時間序列分解 和 Shapley 值 |
將時間序列分解為多個元件,包括趨勢、季節性、節慶、步階變化、尖峰和低谷 (類似於 ARIMA_PLUS)。系統會根據 Shapley 值計算每個外部迴歸量的歸因,該值等於 model weight * feature value。 |
ML.EXPLAIN_FORECAST3 |
不適用 |
1ML_EXPLAIN_PREDICT 是 ML.PREDICT 的擴充版本。
2ML.GLOBAL_EXPLAIN 會傳回全域可解釋性,方法是計算評估資料集中所有資料列的每個特徵所獲得的平均絕對歸因。
3ML.EXPLAIN_FORECAST 是 ML.FORECAST 的擴充版本。
4ML.ADVANCED_WEIGHTS 是 ML.WEIGHTS 的擴充版本。
後續步驟
- 如要進一步瞭解支援可解釋性的模型適用的 SQL 陳述式和函式,請參閱「機器學習模型端對端使用者歷程」。