位置:首页 > Python > Python中评估Scikit-learn模型不同子集公平性的方法

Python中评估Scikit-learn模型不同子集公平性的方法

时间:2026-08-15  |  作者:夜鞌不睡  |  阅读:0

要按群体维度稳妥地评估性能差异,用 Fairlearn 的 MetricFrame 通常是更可靠的做法。关键有几步别省:明确传入 sensitive_features,把敏感特征列的类型先统一好,避免直接用 classification_report 时出现漏组问题;如果还要接入 sklearn 的流程,那就用 make_group_metric 把 scorer 包一层,这样适配起来会顺畅得多。

如何在Python中评估Scikit-learn模型在不同子集上的公平性?

fairlearn 分组计算性能差异

直接调用 fairlearn.metrics.MetricFrame 是最稳的路子。它能自动按敏感属性切分数据,比如 racegender,或工业场景里的 batch_id

这样可以对每组单独算指标,不用手动拆数组,也不容易漏掉 groupby 边界条件。

常见错误是把敏感列当普通特征传进模型评估函数。MetricFrame 要求显式传入 sensitive_features 参数,否则会报 ValueError: sensitive_features must be 1D,或者静默忽略分组逻辑。

  • metrics 字典里键名必须是函数名,如 "accuracy";值必须是可调用对象,如 accuracy_score,不是字符串 "accuracy_score"
  • 敏感列类型要一致:训练时用 int 编码的 batch_id,测试时也得是 int,混用 str 会导致某组 support=0,后续除零或 nan
  • 输出是 MetricFrame 对象,查各组精度差直接用 .difference(method="between_groups"),别自己取 max-min,它默认处理了缺失组和 NaN

避免 classification_report 漏掉稀有子组

原生 classification_report 只统计 y_truey_pred 共同出现的类。如果某班组在测试集里只出现 2 次,且预测全错,报告里可能压根不显示该组 recall。

这时看起来像是模型“没偏见”,其实可能只是该子组被隐藏了。

正确做法是先用 np.unique 扫一遍所有敏感值,强制喂给 MetricFramesensitive_features;或者用 fairlearn.metrics.group_summary 配合 include_overall=False,确保每个子组都强制出结果。

  • 工业场景中,原料批次 batch_087 可能在训练集为 0 样本,测试集突然出现 5 条——这时 sensitive_features 必须包含该值,否则 MetricFrame 会跳过它
  • 若用 output_dict=Trueclassification_report,记得检查返回字典里是否有该组 key;没有就说明该组未参与统计,得回溯数据分布

在 pipeline 中嵌入公平性 scorer 会报错?

GridSearchCVcross_val_score 这类工具,没法直接把 MetricFrame 当成 scorer 来用。

原因很简单:MetricFrame 的签名是 (y_true, y_pred, sensitive_features),但 sklearn 的 scorer 机制只接受两个参数。要是硬塞进去,基本就会当场报错:TypeError: got an unexpected keyword argument 'sensitive_features'

真正能用的,是 fairlearn.metrics.make_group_metric 包装后的函数。例如:

from fairlearn.metrics import make_group_metric, demographic_parity_difference
dp_diff_scorer = make_group_metric(
demographic_parity_difference,
metric_kwargs={"sensitive_features": groups_test}
)
  • make_group_metric 返回的是标准 sklearn scorer,可直接传给 scoring=dp_diff_scorer
  • metric_kwargs 必须在定义 scorer 时固化,不能留到 fit 阶段动态传,否则 cv 折叠间 groups_test 长度不一致会崩
  • 注意:这类 scorer 返回的是差异值,越小越好,所以 greater_is_better=False 得显式设,否则 GridSearchCV 会反向优化

为什么 demographic_parity_differenceequalized_odds_difference 结果差很多

前者看“预测为正例的比例”在各组是否接近,即 P(=1|A=a) ≈ P(=1|A=b)

后者看“真实为正例时预测为正例的比例”是否一致,即 P(=1|y=1,A=a) ≈ P(=1|y=1,A=b)

工业产率预测里,若模型对稀有原料批次整体压低预测概率,demographic_parity_difference 就会飙升;但若它对这批原料的达标样本仍保持高召回,则 equalized_odds_difference 可能正常。

两者不互斥,得一起看。

  • 二分类任务中,equalized_odds_difference 要求你明确传 y_truey_pred,且 y_true 必须含正例,否则分母为 0 返回 nan
  • 多类问题别硬套这两个函数,它们只支持二分类,用错会静默返回 0 或报 ValueError: y_true contains more than two classes
  • 实际部署前,至少比对三组指标:accuracyrecall 差异、demographic_parity_difference;只盯一个,容易误判“公平”

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多