中文版Pandas
设 分层样本 = 表格.分层抽样(CSV数据, "产品类别", 每层数量=2, 随机种子=42)
打印("每个产品类别抽取两行:", 分层样本)原版Pandas
分层样本 = (
CSV数据.groupby("产品类别", group_keys=False)
.apply(lambda x: x.sample(n=min(2, len(x)), random_state=42), include_groups=False)
.reset_index(drop=True)
)
print("每个产品类别抽取两行:", 分层样本)打印信息
每个产品类别抽取两行: 订单编号 销售日期 产品名称 销售数量 ... 月份 销售数量文本 产品类别分类 产品类别编码 0 ORD202607270075 2026-05-27 投影仪 9 ... 5 9 办公设备 0 1 ORD202607270054 2026-06-28 打印机 5 ... 6 5 办公设备 0 2 ORD202607270098 2026-04-29 无线耳机 2 ... 4 2 电子产品 1 3 ORD202607270035 2026-05-27 智能手机 5 ... 5 5 电子产品 1 4 ORD202607270021 2026-06-02 显示器 3 ... 6 3 电脑配件 2 5 ORD202607270043 2026-05-25 无线鼠标 8 ... 5 8 电脑配件 2 6 ORD202607270071 2026-06-15 摄像头 9 ... 6 9 网络设备 3 7 ORD202607270084 2026-05-31 路由器 9 ... 5 9 网络设备 3