Python 文件读取的不同方法比对

zhousishuo

2017-10-17

关注关注

Python 读文件的方式多种多样，但是当需要读取一个大文件的时候，不同的读取方式会有不一样的效果。

场景

逐行读取一个 2.9G 的大文件

CPU i7 6820HQ
RAM 32G

方法

对每一行的读取进行一次分割字符串操作
以下方法都使用 with…as 方法打开文件。

with 语句适用于对资源进行访问的场合，确保不管使用过程中是否发生异常都会执行必要的“清理”操作，释放资源，比如文件使用后自动关闭、线程中锁的自动获取和释放等。

方法一最通用的读文件方式

1
2
3

with open(file, 'r') as fh:
for line in fh.readlines():
line.split("|")

运行结果：耗时 15.4346568584 秒
系统监视器中显示内存从 4.8G 一下子飙到了 8.4G， fh.readlines() 将读取的所有行数据存到内存，这种方法适合小文件。

方法二

with open(file, 'r') as fh:
line = fh.readline()
while line:
line.split("|")

运行结果：耗时 22.3531990051 秒
内存几乎没有变化，因为内存中只存取一行的数据，但是时间明显比上一次的长，对于进一步处理数据来说效率不高。

方法三

1
2
3

with open(file) as fh:
for line in fh:
line.split("|")

运行结果：耗时 13.9956979752 秒
内存几乎没有变化，速度也比方法二快。
for line in fh 将文件对象 fh 视为可迭代的，它自动使用缓冲的 IO 和内存管理，因此您不必担心大文件。这是很 pythonic 的方式！

方法四 fileinput 模块

1 2	for line in fileinput.input(file): line.split("\|")

运行结果：耗时 26.1103110313 秒
内存增加了 200-300 MB，速度是以上最慢的。

总结

以上方法仅供参考，公认的大文件读取方法还是三最好。但是具体情况还是要根据机器的性能、处理数据的复杂度。

line python

zhousishuo

0 关注 0 粉丝 0 动态

关注关注

了解这些操作，Python中99%的文件操作都将变得游刃有余！

处理文件是我们几乎每天都躲不开的任务之一。Python中含有几个用于执行文件操作的内置模块，例如读取文件，移动文件，获取文件属性等。本文总结了许多值得了解的函数，这些函数可用于进行一些Python中最常见的文件操作，可以极大地提高我们处理文件的效率。读取或

dflyzx 2020-09-17

shell while 双循环对比查找共有字段

#查找两个文件中的共有字段while read linedo while read line2 do if [[ $line -eq $line2 ]] then echo $line2 fi done < aaa.txtdone < bbb.

higheels 2020-07-20

Python-闭包

ret 指向函数内部定义的函数 test_in，原来的 number 还用原来传入的值。以上的应用，外层相当于定义一个二元一次方程，内层传一个横坐标，返回纵坐标。line 之后再用 line，函数没有被销毁。

Ericbig 2020-07-19

数据处理：oltp和olap

数据处理大致可以分成两大类：联机事务处理OLTP、联机分析处理OLAP。OLTP是传统的关系型数据库的主要应用，主要是基本的、日常的事务处理，例如银行交易。OLAP是数据仓库系统的主要应用，支持复杂的分析操作，侧重决策支持，并且提供直观易懂的查询结果。OL

yinyang00 2020-05-15

启动django报错

Traceback : File "F:\Python27\lib\logging\handlers.py", line 77, in emit self.doRollover(). 日志文件的问题，停止pycharm，删除日志文件，再

lijiuchangxin 2020-05-14

python读取大词向量文件

我们在工作中经常遇到需要将词向量文件读取到内存，但是正常情况下，我们的单词个数都是数十万个，单词的向量都是几百维，所以导致文件比较大，动辄几个G，在读取文件的时候经常会比较慢，有没有什么办法能够加快读取文件的速度呢，接下来，本人将从如下几种方法，进行速度的

yogoma 2020-05-09

Python Basic - 练习-提示用户输入长度跟宽度，然后输出字符“0”描述出一个正方形

[ python-script]# cat square.py. #!#date : 2020.04.19. #author : feihuang. line=int(input("line number:")). column=i

jacktangj 2020-04-19

Shell脚本批量修改文件编码为UTF-8

iconv -f gbk -t utf8 $line > a. b文件中存放着需要修改的文件路径。可多个文件路径，每行一条路径

Yyqingmofeige 2020-03-26

python 逐行读取文件的几种方法

下面四种Python逐行读取文件内容的方法，分析了各种方法的优缺点及应用场景，以下代码在python3中测试通过， python2中运行部分代码已注释，稍加修改即可。line = f.readline() # 调用文件的 readline()方法。#

idning 2020-02-14

python with (as)语句

with语句适用于对资源进行访问的场合，确保不管使用过程中是否发生异常都会执行必要的“清理”操作，释放资源，比如文件使用后自动关闭、线程中锁的自动获取和释放等。line = f.readline() # 调用文件的 readline

宿舍 2020-01-31

kafka 配置文件参数详解

最为核心的三个配置 broker.id、log.dir、zookeeper.connect 。##每一个broker在集群中的唯一标示，要求是正数。在改变IP地址，不改变broker.id的话不会影响consumers. ##kafka数据的存放地址，多个

luenxin 2020-01-22

python--读取excel通过django框架入库mysql(完整代码)

sheets = xls.sheet_names() # 所有sheet，列表。text = item[1] # excel第二列

水痕 2020-01-18

python逐行读取文件内容的三种方法

f = open # 返回一个文件对象。line = f.readline() # 调用文件的 readline()方法。print line, # 后面跟 ‘,‘ 将忽略换行

chouliqingke 2020-01-08

linux中按行读取指定行

#head -n $line $file #取前三行。#tail -n 1 $file #取最后一行。#2条命令用管道合在一起。head -n $line $file | tail -n 1. 读取函数能被3整除的行，并输入到一个文件中。count=$

secondid 2019-12-18

Mac gyp: No Xcode or CLT version detected!

Software Update found the following new or updated software:. Title: Command Line Tools for Xcode, Version: 11.3, Size: 224878K,

XCodeRush 2019-12-17

PHP Warning: PHP Startup: in Unknown on line 0

apache+php的配置；依旧不行.......

wangdoudou0 2013-06-03

Python3并发写文件与Python对比

使用python2在进行并发写的时候，发现文件会乱掉，就是某一行中间会插入其他行的内容。但是在使用python3进行并发写的时候，无论是多进程，还是多线程，都没有出现这个问题，难道是python3的特性吗？用python3反复运行，均通过测试没有异常。

ryuhfxz 2019-11-20

更新 Ubuntu 12.04 内核至 3.8.0

完成后重启电脑，通过命令 “uname -r” 来查看内核是否成功更新。接下来就是清理旧内核文件，在终端输入 “dpkg –get-selections | grep linux”，然后通过命令 “sudo apt-get remove xxxx” 将3.

qonsnow 2014-03-07

line-clamp无法生效的解决方案

参考链接MDN -webkit-line-clamp作者描述？在去掉white-space属性后添加查到得CSS样式，就能得到上述效果，网上给的答案大概是这个意思....不过本着学习态度，自己还是尝试调试了一下在将 overflow 属性注释掉的情况，我发

coulder 2019-11-17

Twitter的分布式自增ID算法Snowflake

Twitter-Snowflake算法产生的背景相当简单，为了满足Twitter每秒上万条消息的请求，每条消息都必须分配一条唯一的id，这些id还需要一些大致的顺序，并且在分布式系统中不同机器产生的id必须不同。把时间戳，工作机器id，序列号组合在一起。除

wangxiaohua 2015-05-09

安科网

Python 文件读取的不同方法比对

zhousishuo

场景

方法

方法一最通用的读文件方式

方法二

方法三

方法四 fileinput 模块

总结

zhousishuo

相关推荐

了解这些操作，Python中99%的文件操作都将变得游刃有余！

shell while 双循环对比查找共有字段

Python-闭包

数据处理：oltp和olap

启动django报错

python读取大词向量文件

Python Basic - 练习-提示用户输入长度跟宽度，然后输出字符“0”描述出一个正方形

Shell脚本批量修改文件编码为UTF-8

python 逐行读取文件的几种方法

python with (as)语句

kafka 配置文件参数详解

python--读取excel通过django框架入库mysql(完整代码)

python逐行读取文件内容的三种方法

linux中按行读取指定行

Mac gyp: No Xcode or CLT version detected!

PHP Warning: PHP Startup: in Unknown on line 0

Python3并发写文件与Python对比

更新 Ubuntu 12.04 内核至 3.8.0

line-clamp无法生效的解决方案

Twitter的分布式自增ID算法Snowflake

zhousishuo

Python 文件读取的不同方法比对

场景

方法

方法一 最通用的读文件方式

方法二

方法三

方法四 fileinput 模块

总结

相关推荐

方法一最通用的读文件方式