Python pandas 数据框的str列内置的方法详解

roamer

2018-08-21

关注关注

在使用pandas框架的DataFrame的过程中，如果需要处理一些字符串的特性，例如判断某列是否包含一些关键字，某列的字符长度是否小于3等等这种需求，如果掌握str列内置的方法，处理起来会方便很多。

下面我们来详细了解一下，Series类的str自带的方法有哪些。

1、cat() 拼接字符串

例子：

>>> Series(['a', 'b', 'c']).str.cat(['A', 'B', 'C'], sep=',')

0 a,A

1 b,B

2 c,C

dtype: object

>>> Series(['a', 'b', 'c']).str.cat(sep=',')

'a,b,c'

>>> Series(['a', 'b']).str.cat([['x', 'y'], ['1', '2']], sep=',')

0 a,x,1

1 b,y,2

dtype: object

2、split() 切分字符串

>>> import numpy,pandas;

>>> s = pandas.Series(['a_b_c', 'c_d_e', numpy.nan, 'f_g_h'])

>>> s.str.split('_')

0 [a, b, c]

1 [c, d, e]

2 NaN

3 [f, g, h]

dtype: object

>>> s.str.split('_', -1)

0 [a, b, c]

1 [c, d, e]

2 NaN

3 [f, g, h]

dtype: object

>>> s.str.split('_', 0)

0 [a, b, c]

1 [c, d, e]

2 NaN

3 [f, g, h]

dtype: object

>>> s.str.split('_', 1)

0 [a, b_c]

1 [c, d_e]

2 NaN

3 [f, g_h]

dtype: object

>>> s.str.split('_', 2)

0 [a, b, c]

1 [c, d, e]

2 NaN

3 [f, g, h]

dtype: object

>>> s.str.split('_', 3)

0 [a, b, c]

1 [c, d, e]

2 NaN

3 [f, g, h]

dtype: object

3、get() 获取指定位置的字符串

>>> s.str.get(0)

0 a

1 c

2 NaN

3 f

dtype: object

>>> s.str.get(1)

0 _

1 _

2 NaN

3 _

dtype: object

>>> s.str.get(2)

0 b

1 d

2 NaN

3 g

dtype: object

4、join() 对每个字符都用给点的字符串拼接起来，不常用

>>> s.str.join("!")

0 a!_!b!_!c

1 c!_!d!_!e

2 NaN

3 f!_!g!_!h

dtype: object

>>> s.str.join("?")

0 a?_?b?_?c

1 c?_?d?_?e

2 NaN

3 f?_?g?_?h

dtype: object

>>> s.str.join(".")

0 a._.b._.c

1 c._.d._.e

2 NaN

3 f._.g._.h

dtype: object

5、contains() 是否包含表达式

>>> s.str.contains('d')

0 False

1 True

2 NaN

3 False

dtype: object

6、replace() 替换

>>> s.str.replace("_", ".")

0 a.b.c

1 c.d.e

2 NaN

3 f.g.h

dtype: object

7、repeat() 重复

>>> s.str.repeat(3)

0 a_b_ca_b_ca_b_c

1 c_d_ec_d_ec_d_e

2 NaN

3 f_g_hf_g_hf_g_h

dtype: object

8、pad() 左右补齐

>>> s.str.pad(10, fillchar="?")

0 ?????a_b_c

1 ?????c_d_e

2 NaN

3 ?????f_g_h

dtype: object

>>>

>>> s.str.pad(10, side="right", fillchar="?")

0 a_b_c?????

1 c_d_e?????

2 NaN

3 f_g_h?????

dtype: object

9、center() 中间补齐，看例子

>>> s.str.center(10, fillchar="?")

0 ??a_b_c???

1 ??c_d_e???

2 NaN

3 ??f_g_h???

dtype: object

10、ljust() 右边补齐，看例子

>>> s.str.ljust(10, fillchar="?")

0 a_b_c?????

1 c_d_e?????

2 NaN

3 f_g_h?????

dtype: object

11、rjust() 左边补齐，看例子

>>> s.str.rjust(10, fillchar="?")

0 ?????a_b_c

1 ?????c_d_e

2 NaN

3 ?????f_g_h

dtype: object

12、zfill() 左边补0

>>> s.str.zfill(10)

0 00000a_b_c

1 00000c_d_e

2 NaN

3 00000f_g_h

dtype: object

13、wrap() 在指定的位置加回车符号

>>> s.str.wrap(3)

0 a_b_c

1 c_d_e

2 NaN

3 f_g_h

dtype: object

14、slice() 按给点的开始结束位置切割字符串

>>> s.str.slice(1,3)

0 _b

1 _d

2 NaN

3 _g

dtype: object

15、slice_replace() 使用给定的字符串，替换指定的位置的字符

>>> s.str.slice_replace(1, 3, "?")

0 a?_c

1 c?_e

2 NaN

3 f?_h

dtype: object

>>> s.str.slice_replace(1, 3, "??")

0 a??_c

1 c??_e

2 NaN

3 f??_h

dtype: object

16、count() 计算给定单词出现的次数

>>> s.str.count("a")

0 1

1 0

2 NaN

3 0

dtype: float64

17、startswith() 判断是否以给定的字符串开头

>>> s.str.startswith("a");

0 True

1 False

2 NaN

3 False

dtype: object

18、endswith() 判断是否以给定的字符串结束

>>> s.str.endswith("e");

0 False

1 True

2 NaN

3 False

dtype: object

19、findall() 查找所有符合正则表达式的字符，以数组形式返回

>>> s.str.findall("[a-z]");

0 [a, b, c]

1 [c, d, e]

2 NaN

3 [f, g, h]

dtype: object

20、match() 检测是否全部匹配给点的字符串或者表达式

>>> s

0 a_b_c

1 c_d_e

2 NaN

3 f_g_h

dtype: object

>>> s.str.match("[d-z]");

0 False

1 False

2 NaN

3 True

dtype: object

21、extract() 抽取匹配的字符串出来，注意要加上括号，把你需要抽取的东西标注上

>>> s.str.extract("([d-z])");

0 NaN

1 d

2 NaN

3 f

dtype: object

22、len() 计算字符串的长度

>>> s.str.len()

0 5

1 5

2 NaN

3 5

dtype: float64

23、strip() 去除前后的空白字符

>>> idx = pandas.Series([' jack', 'jill ', ' jesse ', 'frank'])

>>> idx.str.strip()

0 jack

1 jill

2 jesse

3 frank

dtype: object

24、rstrip() 去除后面的空白字符

25、lstrip() 去除前面的空白字符

26、partition() 把字符串数组切割称为DataFrame，注意切割只是切割称为三部分，分隔符前，分隔符，分隔符后

27、rpartition() 从右切起

>>> s.str.partition('_')

0 1 2

0 a _ b_c

1 c _ d_e

2 NaN NaN NaN

3 f _ g_h

>>> s.str.rpartition('_')

0 1 2

0 a_b _ c

1 c_d _ e

2 NaN NaN NaN

3 f_g _ h

28、lower() 全部小写

29、upper() 全部大写

30、find() 从左边开始，查找给定字符串的所在位置

>>> s.str.find('d')

0 -1

1 2

2 NaN

3 -1

dtype: float64

31、rfind() 从右边开始，查找给定字符串的所在位置

32、index() 查找给定字符串的位置，注意，如果不存在这个字符串，那么会报错！

33、rindex() 从右边开始查找，给定字符串的位置

>>> s.str.index('_')

0 1

1 1

2 NaN

3 1

dtype: float64

34、capitalize() 首字符大写

>>> s.str.capitalize()

0 A_b_c

1 C_d_e

2 NaN

3 F_g_h

dtype: object

35、swapcase() 大小写互换

>>> s.str.swapcase()

0 A_B_C

1 C_D_E

2 NaN

3 F_G_H

dtype: object

36、normalize() 序列化数据，数据分析很少用到，咱们就不研究了

37、isalnum() 是否全部是数字和字母组成

>>> s.str.isalnum()

0 False

1 False

2 NaN

3 False

dtype: object

38、isalpha() 是否全部是字母

>>> s.str.isalpha()

0 False

1 False

2 NaN

3 False

dtype: object

39、isdigit() 是否全部都是数字

>>> s.str.isdigit()

0 False

1 False

2 NaN

3 False

dtype: object

40、isspace() 是否空格

>>> s.str.isspace()

0 False

1 False

2 NaN

3 False

dtype: object

41、islower() 是否全部小写

42、isupper() 是否全部大写

>>> s.str.islower()

0 True

1 True

2 NaN

3 True

dtype: object

>>> s.str.isupper()

0 False

1 False

2 NaN

3 False

dtype: object

43、istitle() 是否只有首字母为大写，其他字母为小写

>>> s.str.istitle()

0 False

1 False

2 NaN

3 False

dtype: object

44、isnumeric() 是否是数字

45、isdecimal() 是否全是数字

Python pandas 数据框的str列内置的方法详解

pandas

roamer

0 关注 0 粉丝 0 动态

关注关注

教你几招，Pandas轻松处理超大规模数据

处理大规模数据集时常是棘手的事情，尤其在内存无法完全加载数据的情况下。在资源受限的情况下，可以使用 Python Pandas 提供的一些功能，降低加载数据集的内存占用。可用技术包括压缩、索引和数据分块。在上述过程中需要解决一些问题，其中之一就是数据量过大

三石 2020-10-30

秒懂！图解四个实用的Pandas函数！

在用Python进行机器学习或者日常的数据处理中，Pandas是最常用的Python库之一，熟练掌握pandas是每一个数据科学家的必备技能，本文将用代码+图片详解Pandas中的四个实用函数!面对这样的需求我们可以选择自己写一个函数完成，但是使用pand

roamer 2020-10-29

Python 中利用Pandas处理复杂的Excel数据

关于Excel数据处理，很多同学可能使用过Pyhton的pandas模块，用它可以轻松地读取和转换Excel数据。但是实际中Excel表格结构可能比较杂乱，数据会分散不同的工作表中，而且在表格中分布很乱，这种情况下啊直接使用pandas就会非常吃力。本文虫

三石 2020-10-29

不常见的Pandas小窍门：我打赌一定有你不知道的

作为一名数据分析师或数据科学家，不了解Python中的Pandas库是无论如何说不过去的，它已经成为Python中用来整理、清理数据的标准工具了。然而，关于Pandas，你确定自己完全掌握了嘛?本文将分享一些少见但有用的Pandas技巧，它们能提升工作效率

wangquannuaa 2020-10-15

在pandas中利用hdf5高效存储数据

1 简介HDF5是用于存储大规模数值数据的较为理想的存储格式。在Python中操纵HDF5文件的方式主要有两种，一是利用pandas中内建的一系列HDF5文件操作相关的方法来将pandas中的数据结构保存在HDF5文件中，二是利用h5py模块来完成从Pyt

wangquannuaa 2020-09-29

别找了，这是Pandas最详细教程了

Python 是开源的，它很棒，但是也无法避免开源的一些固有问题：很多包都在做同样的事情。如果你是 Python 新手，那么你很难知道某个特定任务的最佳包是哪个，你需要有经验的人告诉你。有一个用于数据科学的包绝对是必需的，它就是 pandas。pandas

jzlixiao 2020-09-15

Pandas这样来设置，做数据分析舒适百倍

在日常使用pandas的过程中，由于我们所分析的数据表规模、格式上的差异，使得同样的函数或方法作用在不同数据上的效果存在差异。而pandas有着自己的一套「参数设置系统」，可以帮助我们在遇到不同的数据时灵活调节从而达到最好的效果，本文就将介绍pandas中

wangquannuaa 2020-08-30

高效的10个Pandas函数，你都用过了吗？

andas是python中最主要的数据分析库之一，它提供了非常多的函数、方法，可以高效地处理并分析数据。让pandas如此受欢迎的原因是它简洁、灵活、功能强大的语法。这篇文章将会配合实例，讲解20个重要的pandas函数。其中有一些很常用，相信你可能用到过

三石 2020-08-23

10 个加速Python数据分析的简单的小技巧

一些小的技巧在编程领域可能会非常有用，在数据科学领域同样如此。数据科学爱好者 Parul Pandey 在近日发表了一篇博文，分享了在数据科学中非常实用的 10 个小技巧。有时候，一点小小的黑客行为可以节省时间，挽救生命。一个小小的快捷方式或附加组件有时

逍遥友 2020-08-21

Pandas

可以使用中括号取单个索引，或者中括号里一个列表取多个索引。使得两个Series进行相加。可以使用pd.isnull()，pd.notnull()，或s.isnull(),notnull()函数检测缺失数据。DataFrame由按一定顺序排列的多列数据组成。

jzlixiao 2020-08-18

Pandas闪回咒！如何在Python中重写SQL查询？

一些程序员只熟悉SQL中的数据操作，却不熟悉Python中的数据操作，因此在完成项目时，我们不得不频繁地在SQL和Python之间进行切换，导致了工作效率低下和生产能力下降。本文就教你一种方法，使用Pandas在Python中轻松重现SQL结果。我们将使用

wangquannuaa 2020-08-17

高效的10个Pandas函数，你都用过吗？

Pandas是python中比较主要的数据分析库之一，它提供了非常多的函数、方法，可以高效地处理并分析数据。让pandas如此受欢迎的原因是它简洁、灵活、功能强大的语法。这篇文章将会配合实例，讲解10个重要的pandas函数。其中有一些很常用，相信你可能用

QianYanDai 2020-08-16

pandas 一维台账数据与二维表格数据的转换

从源数据转化使用数据透式表的话，最终的样式不方便筛选，存在合并单元格。实际想转化为中间的样式。table = pd.pivot_table(df, values=‘销售额‘, index=[‘地区‘, ‘时间‘],关于 stack 和 unstack 也可

jzlixiao 2020-07-29

用于ETL的Python数据转换工具

前几天，我去Reddit询问是否应该将Python用于ETL相关的转换，并且压倒性的回答是"是"。但是，尽管我的Redditor同事热心支持使用Python，但他们建议研究Pandas以外的库-出于对大型数据集Pandas性能的担忧。经

xirongxudlut 2020-07-20

pandas 的DataFrame.apply()

pandas的apply函数是自动根据function遍历每一个数据，然后返回一个数据结构为Series的结果

mmmjyjy 2020-07-16

【Pandas】基本功能

结合自己的经验，我觉得Pandas的本质是类似于Matlab、Eviews之类的数据分析软件。只是其他的被人做成了有UI界面的软件。从Pandas的结构来看，最核心的两个类。其他功能是围绕这两个类进行了功能上的扩展。为了保持学习的趣味性，我觉得按照实际使用

QianYanDai 2020-07-05

【pandas】概述

Pandas是python中运用很广泛的统计分析库，用于各种金融、工业、等等统计分析，适用于各种时间序列和面板数据等。而对应于Pandas库，最主要的两个类分别是Series和DataFrame。Pandas是numpy的一种扩展，因此很多高级的数据计算方

QianYanDai 2020-07-05

数据分析三剑客之Pandas时间序列

datetime模块，主要掌握：datetime.date(), datetime.datetime(), datetime.timedelta()，日期解析方法：parser.parse. print(parse(‘2000-1-1‘),‘\n‘,par

june0 2020-07-04

初探pandas——索引和查询数据

通过索引值或索引标签获取数据。通过index查看索引值。ser[[‘a‘,‘b‘,‘c‘]]: a 0. 如果对两个序列进行运算，索引就会将元素对齐进行运算。# 查询第1，2，3行。student[[‘name‘,‘age‘]]. 如果查询多个列，必

QianYanDai 2020-07-04

安科网

Python pandas 数据框的str列内置的方法详解

roamer

roamer

相关推荐

教你几招，Pandas轻松处理超大规模数据

秒懂！图解四个实用的Pandas函数！

Python 中利用Pandas处理复杂的Excel数据

不常见的Pandas小窍门：我打赌一定有你不知道的

在pandas中利用hdf5高效存储数据

别找了，这是Pandas最详细教程了

Pandas这样来设置，做数据分析舒适百倍

高效的10个Pandas函数，你都用过了吗？

10 个加速Python数据分析的简单的小技巧

Pandas

Pandas闪回咒！如何在Python中重写SQL查询？

高效的10个Pandas函数，你都用过吗？

推荐5个实用的Pandas技巧

pandas 一维台账数据与二维表格数据的转换

用于ETL的Python数据转换工具

pandas 的DataFrame.apply()

【Pandas】基本功能

【pandas】概述

数据分析三剑客之Pandas时间序列

初探pandas——索引和查询数据

roamer