Python 处理大数据内存不够怎么办?
① 分块读取:pandas.read_csv(chunksize=10000) 迭代处理,或 Dask dataframe 并行分块;② dtype 优化:指定 category/float32/int32 降内存(read_csv dtype 参数,category 可省 50%+);③ 只读需要的列:usecols 参数;④ 采样:nrows 参数预览;⑤ 数据外存:sqlite/parquet(列式压缩)/hdf5;⑥ 并行:多进程分片(modin/polars);⑦ 流式处理:避免全量进内存,逐行/逐块聚合;⑧ 内存监测:tracemalloc、resource。polars:内存高效、并行、惰性执行,大数据场景替代 pandas 的现代选择。
一起交流
分享经验,让问题更进一步
讨论,从你的观点开始
还没有回复,欢迎补充经验或分享不同的思路。