中文Python的Pandas的 分层抽样

中文Python 0 5

中文版Pandas

设 分层样本 = 表格.分层抽样(CSV数据, "产品类别", 每层数量=2, 随机种子=42)
打印("每个产品类别抽取两行:", 分层样本)

原版Pandas

分层样本 = (
CSV数据.groupby("产品类别", group_keys=False)
.apply(lambda x: x.sample(n=min(2, len(x)), random_state=42), include_groups=False)
.reset_index(drop=True)
)
print("每个产品类别抽取两行:", 分层样本)

打印信息

每个产品类别抽取两行:               订单编号       销售日期  产品名称  销售数量  ...  月份  销售数量文本 产品类别分类 产品类别编码
0  ORD202607270075 2026-05-27   投影仪     9  ...   5       9   办公设备      0
1  ORD202607270054 2026-06-28   打印机     5  ...   6       5   办公设备      0
2  ORD202607270098 2026-04-29  无线耳机     2  ...   4       2   电子产品      1
3  ORD202607270035 2026-05-27  智能手机     5  ...   5       5   电子产品      1
4  ORD202607270021 2026-06-02   显示器     3  ...   6       3   电脑配件      2
5  ORD202607270043 2026-05-25  无线鼠标     8  ...   5       8   电脑配件      2
6  ORD202607270071 2026-06-15   摄像头     9  ...   6       9   网络设备      3
7  ORD202607270084 2026-05-31   路由器     9  ...   5       9   网络设备      3


也许您对下面的内容还感兴趣: