Python中评估Scikit-learn模型不同子集公平性的方法
时间:2026-08-15 | 作者:夜鞌不睡 | 阅读:0要按群体维度稳妥地评估性能差异,用 Fairlearn 的 MetricFrame 通常是更可靠的做法。关键有几步别省:明确传入 sensitive_features,把敏感特征列的类型先统一好,避免直接用 classification_report 时出现漏组问题;如果还要接入 sklearn 的流程,那就用 make_group_metric 把 scorer 包一层,这样适配起来会顺畅得多。
用 fairlearn 分组计算性能差异
直接调用 fairlearn.metrics.MetricFrame 是最稳的路子。它能自动按敏感属性切分数据,比如 race、gender,或工业场景里的 batch_id。
这样可以对每组单独算指标,不用手动拆数组,也不容易漏掉 groupby 边界条件。
常见错误是把敏感列当普通特征传进模型评估函数。MetricFrame 要求显式传入 sensitive_features 参数,否则会报 ValueError: sensitive_features must be 1D,或者静默忽略分组逻辑。
metrics字典里键名必须是函数名,如"accuracy";值必须是可调用对象,如accuracy_score,不是字符串"accuracy_score"- 敏感列类型要一致:训练时用
int编码的batch_id,测试时也得是int,混用str会导致某组 support=0,后续除零或 nan - 输出是
MetricFrame对象,查各组精度差直接用.difference(method="between_groups"),别自己取 max-min,它默认处理了缺失组和 NaN
避免 classification_report 漏掉稀有子组
原生 classification_report 只统计 y_true 和 y_pred 共同出现的类。如果某班组在测试集里只出现 2 次,且预测全错,报告里可能压根不显示该组 recall。
这时看起来像是模型“没偏见”,其实可能只是该子组被隐藏了。
正确做法是先用 np.unique 扫一遍所有敏感值,强制喂给 MetricFrame 的 sensitive_features;或者用 fairlearn.metrics.group_summary 配合 include_overall=False,确保每个子组都强制出结果。
- 工业场景中,原料批次
batch_087可能在训练集为 0 样本,测试集突然出现 5 条——这时sensitive_features必须包含该值,否则MetricFrame会跳过它 - 若用
output_dict=True接classification_report,记得检查返回字典里是否有该组 key;没有就说明该组未参与统计,得回溯数据分布
在 pipeline 中嵌入公平性 scorer 会报错?
GridSearchCV 和 cross_val_score 这类工具,没法直接把 MetricFrame 当成 scorer 来用。
原因很简单:MetricFrame 的签名是 (y_true, y_pred, sensitive_features),但 sklearn 的 scorer 机制只接受两个参数。要是硬塞进去,基本就会当场报错:TypeError: got an unexpected keyword argument 'sensitive_features'。
真正能用的,是 fairlearn.metrics.make_group_metric 包装后的函数。例如:
from fairlearn.metrics import make_group_metric, demographic_parity_difference
dp_diff_scorer = make_group_metric(
demographic_parity_difference,
metric_kwargs={"sensitive_features": groups_test}
)
make_group_metric返回的是标准 sklearn scorer,可直接传给scoring=dp_diff_scorermetric_kwargs必须在定义 scorer 时固化,不能留到 fit 阶段动态传,否则 cv 折叠间groups_test长度不一致会崩- 注意:这类 scorer 返回的是差异值,越小越好,所以
greater_is_better=False得显式设,否则GridSearchCV会反向优化
为什么 demographic_parity_difference 和 equalized_odds_difference 结果差很多
前者看“预测为正例的比例”在各组是否接近,即 P(=1|A=a) ≈ P(=1|A=b)。
后者看“真实为正例时预测为正例的比例”是否一致,即 P(=1|y=1,A=a) ≈ P(=1|y=1,A=b)。
工业产率预测里,若模型对稀有原料批次整体压低预测概率,demographic_parity_difference 就会飙升;但若它对这批原料的达标样本仍保持高召回,则 equalized_odds_difference 可能正常。
两者不互斥,得一起看。
- 二分类任务中,
equalized_odds_difference要求你明确传y_true和y_pred,且y_true必须含正例,否则分母为 0 返回 nan - 多类问题别硬套这两个函数,它们只支持二分类,用错会静默返回 0 或报
ValueError: y_true contains more than two classes - 实际部署前,至少比对三组指标:
accuracy、recall差异、demographic_parity_difference;只盯一个,容易误判“公平”
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多精选合集
更多大家都在玩
大家都在看
更多-
- 2026年9月17日小鸡庄园答案
- 时间:2026-09-16
-
- 蚂蚁庄园今日答案2026年9月17日
- 时间:2026-09-16
-
- 蚂蚁庄园小课堂今日最新答案2026年9月17日
- 时间:2026-09-16
-
- 蚂蚁庄园小鸡答题今日答案2026年9月17日
- 时间:2026-09-16
-
- 褪黑素主要由人体哪个器官分泌 蚂蚁庄园今日答案9.17
- 时间:2026-09-16
-
- 蚂蚁庄园今天答题答案2026年9月17日
- 时间:2026-09-16
-
- 蚂蚁庄园答题今日答案2026年9月17日
- 时间:2026-09-16
-
- 研学旅游指导师的核心服务对象是 蚂蚁新村今日答案2026.9.16
- 时间:2026-09-16
