pandas数据处理基础之筛选指定行或者指定列的数据

nqmysb

2018-05-03

关注关注

pandas主要的两个数据结构是：series（相当于一行或一列数据机构）和DataFrame（相当于多行多列的一个表格数据机构）。

本文为了方便理解会与excel或者sql操作行或列来进行联想类比

1.重新索引：reindex和ix

上一篇中介绍过数据读取后默认的行索引是0,1，2,3...这样的顺序号。列索引相当于字段名(即第一行数据)，这里重新索引意思就是可以将默认的索引重新修改成自己想要的样子。

1.1 Series

比方说：data=Series([4,5,6],index=['a','b','c'])，行索引为a,b,c。

我们用data.reindex(['a','c','d','e'])修改索引后则输出：

pandas数据处理基础之筛选指定行或者指定列的数据

可以理解成我们用reindex设了索引后，根据索引去原来data里面匹配对应的值，没匹配上的就是NaN。

1.2 DataFrame

（1）行索引修改：DataFrame行索引同Series

（2）列索引修改：列索引用reindex(columns=['m1','m2','m3']),用参数columns来指定对列索引进行修改。修改逻辑类似行索引，也是相当于用新列索引去匹配原来的数据，没匹配上的置NaN

例：

pandas数据处理基础之筛选指定行或者指定列的数据

（3）同时对行和列索引进行修改可以用

pandas数据处理基础之筛选指定行或者指定列的数据

2.丢弃指定轴上的列（通俗的说法就是删除行或者列）:drop

通过索引进行选择删除哪一行或者哪一列

data.drop(['a','c']) 相当于delete table a where xid='a' or xid='c'

data.drop('m1',axis=1)相当于delete table a where yid='m1'

3.选取和过滤（通俗的说就是sql中按照条件筛选查询）

python中因为有行列索引，在做数据的筛选会比较方便

3.1 Series

（1）按照行索引进行选择如

pandas数据处理基础之筛选指定行或者指定列的数据

obj['b']相当于select * from tb where xid='b'obj['b','a','c']相当于select * from tb where xid in ('a','b','c')，且结果按照b ,a ,c 的顺序排列后进行展示，这是与sql的区别obj[0:1]和obj['a':'b']的区别如下：

#前者是不包含末端，后者是包含了末端

pandas数据处理基础之筛选指定行或者指定列的数据

（2）按照值的大小进行筛选obj[obj>-0.6]相当于在obj数据中找出值比-0.6大的记录进行展示

pandas数据处理基础之筛选指定行或者指定列的数据

3.2 DataFrame

（1）选择单行用ix或者xs：

如筛选索引为b的那条行记录用以下三种方式

pandas数据处理基础之筛选指定行或者指定列的数据

（2）选择多行:

筛选索引为a,b的两条行记录的方式

pandas数据处理基础之筛选指定行或者指定列的数据

#以上不能直接写成data[['a','b']]

data[0:2]表示从第一行到第二行的记录。第一行默认从0开始数，不包含末端的2。

（3）选择单列

筛选m1列的所有行记录数据

pandas数据处理基础之筛选指定行或者指定列的数据

（4）选择多列

筛选m1,m3两个列，所有行记录的数据

pandas数据处理基础之筛选指定行或者指定列的数据

ix[:,['m1','m2']]前面的：表示所有的行都筛选进来。

（5）根据值的大小条件筛选行或者列

如筛选出某一列值大于4的所有记录相当于select * from tb where 列名>4

pandas数据处理基础之筛选指定行或者指定列的数据

（6）如果筛选某列值大于4的所有记录，且只需展示部分列的情况时

pandas数据处理基础之筛选指定行或者指定列的数据

行用条件进行筛选，列用[0,2]筛选第一列和第三列的数据

总结

pandas 数据处理大数据 dataframe data

nqmysb

0 关注 0 粉丝 0 动态

关注关注

教你几招，Pandas轻松处理超大规模数据

处理大规模数据集时常是棘手的事情，尤其在内存无法完全加载数据的情况下。在资源受限的情况下，可以使用 Python Pandas 提供的一些功能，降低加载数据集的内存占用。可用技术包括压缩、索引和数据分块。在上述过程中需要解决一些问题，其中之一就是数据量过大

三石 2020-10-30

Python 中利用Pandas处理复杂的Excel数据

关于Excel数据处理，很多同学可能使用过Pyhton的pandas模块，用它可以轻松地读取和转换Excel数据。但是实际中Excel表格结构可能比较杂乱，数据会分散不同的工作表中，而且在表格中分布很乱，这种情况下啊直接使用pandas就会非常吃力。本文虫

三石 2020-10-29

秒懂！图解四个实用的Pandas函数！

在用Python进行机器学习或者日常的数据处理中，Pandas是最常用的Python库之一，熟练掌握pandas是每一个数据科学家的必备技能，本文将用代码+图片详解Pandas中的四个实用函数!面对这样的需求我们可以选择自己写一个函数完成，但是使用pand

roamer 2020-10-29

高效的10个Pandas函数，你都用过了吗？

andas是python中最主要的数据分析库之一，它提供了非常多的函数、方法，可以高效地处理并分析数据。让pandas如此受欢迎的原因是它简洁、灵活、功能强大的语法。这篇文章将会配合实例，讲解20个重要的pandas函数。其中有一些很常用，相信你可能用到过

三石 2020-08-23

高效的10个Pandas函数，你都用过吗？

Pandas是python中比较主要的数据分析库之一，它提供了非常多的函数、方法，可以高效地处理并分析数据。让pandas如此受欢迎的原因是它简洁、灵活、功能强大的语法。这篇文章将会配合实例，讲解10个重要的pandas函数。其中有一些很常用，相信你可能用

QianYanDai 2020-08-16

pandas 的DataFrame.apply()

pandas的apply函数是自动根据function遍历每一个数据，然后返回一个数据结构为Series的结果

mmmjyjy 2020-07-16

【Pandas】基本功能

结合自己的经验，我觉得Pandas的本质是类似于Matlab、Eviews之类的数据分析软件。只是其他的被人做成了有UI界面的软件。从Pandas的结构来看，最核心的两个类。其他功能是围绕这两个类进行了功能上的扩展。为了保持学习的趣味性，我觉得按照实际使用

QianYanDai 2020-07-05

【pandas】概述

Pandas是python中运用很广泛的统计分析库，用于各种金融、工业、等等统计分析，适用于各种时间序列和面板数据等。而对应于Pandas库，最主要的两个类分别是Series和DataFrame。Pandas是numpy的一种扩展，因此很多高级的数据计算方

QianYanDai 2020-07-05

使用PYODBC将数据从Pandas的DataFrame写入SQL Server

总公司的某数据以文件形式存放在FTP服务器上，现将其移植到我本地的SQL服务器。#由于informix生成的unl文件为cp936编码，pandas 读取时会对有些汉字报错，所以转为utf-8. #对_tmp.txt 文件读取时，要注意纯数字的格式转换,

jiahaohappy 2020-06-21

pandas基础操作（一）

Pandas基于两种数据类型： series 与 dataframe. DataFrame：是一个二维的表结构。df[[‘code‘]] # 选取一列，生成一个DataFrame. df[1:3] #第1行到第2行。loc，在知道列名字的情况下，df

QianYanDai 2020-06-16

pandas用法总结

with codecs.open as f: for line in f: line_split = line.strip().split items.append

zhangxiaojiakele 2020-05-25

使用pandas库对csv文件进行筛选和保存

多数大佬都是直接pandas官网甩我脸上，然后举一个入门级的例子。这个函数里面需要写入csv文件的路径，如果是把csv文件保存到了python的工程文件夹下，则只需要./文件名即可，然后encoding=‘utf-8‘是使用utf-8方式编码，有时候需要换

jzlixiao 2020-05-15

pandas对角线值修改

df = pd.DataFrame(np.arange(16).reshape((4, 4)), index=[‘a‘, ‘b‘, ‘c‘, ‘d‘], columns=[‘i‘, ‘j‘, ‘k‘, ‘f‘]). array([[ 0, 1, 2,

jiahaohappy 2020-05-12

pandas学习

Python中的pandas模块进行数据分析。在pandas中有两类非常重要的数据结构，即序列Series和数据框DataFrame。Series类似于numpy中的一维数组，除了通吃一维数组可用的函数或方法，而且其可通过索引标签的方式获取数据，还具有索引

zhangxiaojiakele 2020-05-11

Pandas详解

Pandas是一个强大的分析结构化数据的工具集；它的使用基础是Numpy；用于数据挖掘和数据分析，同时也提供数据清洗功能。Pandas有三大数据结构，Series、DataFrame以及Panel。仅由一组数据也可产生简单的Series对象。DataFra

jzlixiao 2020-05-08

pandas -- numpy++

Series是一种类似于一维数组的对象,由一组数据以及一组与之对应的索引组成。 index: 索引序列,必须是唯一的,且与数据的长度相同. 如果没有传入索引参数,则默认会自动创建一个从0~N的整数索引

jzlixiao 2020-05-09

别找了，这是Pandas最详细教程了

Python 是开源的，它很棒，但是也无法避免开源的一些固有问题：很多包都在做同样的事情。如果你是 Python 新手，那么你很难知道某个特定任务的最佳包是哪个，你需要有经验的人告诉你。有一个用于数据科学的包绝对是必需的，它就是 pandas。pandas

jzlixiao 2020-09-15

不常见的Pandas小窍门：我打赌一定有你不知道的

作为一名数据分析师或数据科学家，不了解Python中的Pandas库是无论如何说不过去的，它已经成为Python中用来整理、清理数据的标准工具了。然而，关于Pandas，你确定自己完全掌握了嘛?本文将分享一些少见但有用的Pandas技巧，它们能提升工作效率

wangquannuaa 2020-10-15

在pandas中利用hdf5高效存储数据

1 简介HDF5是用于存储大规模数值数据的较为理想的存储格式。在Python中操纵HDF5文件的方式主要有两种，一是利用pandas中内建的一系列HDF5文件操作相关的方法来将pandas中的数据结构保存在HDF5文件中，二是利用h5py模块来完成从Pyt

wangquannuaa 2020-09-29

安科网

pandas数据处理基础之筛选指定行或者指定列的数据

nqmysb

nqmysb

相关推荐

教你几招，Pandas轻松处理超大规模数据

Python 中利用Pandas处理复杂的Excel数据

秒懂！图解四个实用的Pandas函数！

高效的10个Pandas函数，你都用过了吗？

高效的10个Pandas函数，你都用过吗？

pandas 的DataFrame.apply()

【Pandas】基本功能

【pandas】概述

使用PYODBC将数据从Pandas的DataFrame写入SQL Server

pandas基础操作（一）

pandas用法总结

使用pandas库对csv文件进行筛选和保存

pandas对角线值修改

pandas学习

Pandas详解

pandas -- numpy++

别找了，这是Pandas最详细教程了

推荐5个实用的Pandas技巧

不常见的Pandas小窍门：我打赌一定有你不知道的

在pandas中利用hdf5高效存储数据

nqmysb