RSS
菜单

Python 处理大数据内存不够怎么办?

① 分块读取:pandas.read_csv(chunksize=10000) 迭代处理,或 Dask dataframe 并行分块;② dtype 优化:指定 category/float32/int32 降内存(read_csv dtype 参数,category 可省 50%+);③ 只读需要的列:usecols 参数;④ 采样:nrows 参数预览;⑤ 数据外存:sqlite/parquet(列式压缩)/hdf5;⑥ 并行:多进程分片(modin/polars);⑦ 流式处理:避免全量进内存,逐行/逐块聚合;⑧ 内存监测:tracemalloc、resource。polars:内存高效、并行、惰性执行,大数据场景替代 pandas 的现代选择。

下载推广海报

圈内讨论推广海报

《Python 处理大数据内存不够怎么办?》完整推广海报
一起交流

全部回复 0

分享经验,让问题更进一步

讨论,从你的观点开始

还没有回复,欢迎补充经验或分享不同的思路。