Python 大文件怎么高效读取?
核心:避免一次读入内存,逐块/逐行处理。① 按行:for line in open('big.txt', encoding='utf-8')(迭代器逐行,内存 O(1));② 按块:while chunk := f.read(1024*1024): 处理 chunk(二进制大文件);③ 大 CSV:pandas.read_csv(..., chunksize=10000) 或 csv.reader 迭代;④ 并行:多进程分块读(seek 偏移分段);⑤ 需要随机访问大文件用 mmap。注意:read()/readlines() 会全部加载;strip/编码处理;处理完及时关闭(with)。
一起交流
分享经验,让问题更进一步
讨论,从你的观点开始
还没有回复,欢迎补充经验或分享不同的思路。