Python数据结构大结局：DataFrame

时间 2021-01-20

标签数据结构 app ide spa 3d code orm blog 索引 token 栏目 Python 繁體版

原文原文链接

前一篇文章提到了序列,能够理解为Excel里没有列名的一列数据,那么Excel里的由行列组成的表数据是如何对应到Python中的呢？就是今天要说的数据框：DataFrame。
数据结构

它是由一组数据和一对索引（行索引和列索引）组成的二维数据结构，能够当作Excel里的表格，与Series不一样的是，DataFrame能够有多行/列数据。app

1．建

首先要导入pandas模块，简写为pd。ide

In [1]:import pandas as pd

从列表中建立DataFrame

# 从列表中建立
list1 = [2,5,8,10]
df_l = pd.DataFrame(list1)
df_l

结果：
spa

image3d

这里传入的是一个单一的列表，获得的是带有行列索引的一列数据，行索引用index表示，就是这里最前面竖着的那一列[0,1,2,3]，至关于Excel里的第一列，列索引用columns表示，至关于Excel里的第一行，因为没有指定索引，所以都是默认从0开始递增的索引，这里横排第一行就是列索引，除去行列索引，中间的区域为values：值区域。code

imageorm

从字典中建立

# 从字典中建立
dict1 = {"name":["Tony","Nancy","Judy","Cindy"],
        "age":[16,17,18,15],
        "sex":["male","female","female","female"]}
df_d = pd.DataFrame(dict1)
df_d

结果：blog

image索引

从字典中建立DataFrame，每一个键就默认为columns。token

从嵌套列表中建立

嵌套列表顾名思义，就是列表中还有列表，这种方式也能够建立数据框，同字典不一样的是，字典建立的数据框键值对是一列一列的，嵌套列表建立的数据框是一行一行的。

# 嵌套列表建立
list2 = [["Jane",15,101],["David",18,103],["Peter",16,102]]
df1 = pd.DataFrame(list2)
df1

结果：

image

以上建立数据框都没有指定索引，下面咱们来指定行列索引，columns指定列索引，index指定行索引。

# 指定行列索引
list2 = [["Jane",15,101],["David",18,103],["Peter",16,102]]
df1 = pd.DataFrame(list2,index = [1,2,3],columns = ["name","age","num"])
df1

结果：

image

2.查

查是指对数据框行/列数据的访问

2.1 选择行

Excel里没有专门的选择行的方法，就是直接用鼠标选择。在Pandas里要选择一行或几行数据，能够用loc或iloc方法，区别在于，loc方法传入的是行所在索引的名称，而iloc方法传入的是行的绝对位置。

选择一行

选择df1数据框的第二行，能够用df1.loc[2]，这里的2是第二行对应的行索引的名称。

# 访问df1第二行
df1.loc[2]

结果：

image

若用iloc方法，则这样写df1.iloc[1]，别忘了一直说的索引是从0开始递增，因此第二行的绝对位置是1，iloc[1]表示取第二行的值。

df1.iloc[1]

结果同loc是同样的

选择几行

要选择几行，能够用iloc选择绝对位置并切片的方法。

# 选择前2行
df1.iloc[:2]

结果：

image

若选择的不是连续的几行，就不用切片，iloc方法传入选择行的绝对位置，loc传入索引名称，并用列表括起来。

# 选择第一行和第三行
df1.iloc[[0,2]]
df1.loc[[1,3]]

结果：

image.png

2.2 选择列

在Excel里选择列也是鼠标直接操做，除非是进行条件筛选，这个就是后话了，pandas里选择列的方式很简单，直接按列名选择便可，在数据框后面用中括号加上要选择的列名，或者数据框后面.列名，两者任选。

数据框[列名]
数据框.列名

选择一列

df.列名等价于 Df[列名]

# 选择name列
df1["name"]
df1.name

结果：

image.png

注意到这样选择列获得的是序列而非数据框，若是想要获得数据框，要再加中括号。

image.png

选择几列

同行选择同样，选择几列的时候，要用中括号括起来。

# 选择1、3列
df1[["name","num"]]

结果：

image.png

2.2 行列同时选择定位

Loc定位

df.loc[行索引，列索引]能够定位一个数据.

# loc定位
df1.loc[[1,3],["name","age"]]

结果：

image.png

[1,3]是行索引，是一个列表值，表示获取一、3行标签所在的行，[“name”,”age”]是列索引，表示获取name,age列索引所在的列。

还能够用切片获取所有的行

# 获取name num列的所有行
df1.loc[:,["name","num"]]

结果：

image.png

左边的冒号表示获取所有的行，右边的列表值表示获取name列和num列。

同理获取所有列

# 获取2\3行所有列
df1.loc[[2,3],:]

结果：

image.png

：号不只能够用来表示所有的行/列，还能够用在行/列中，进行切片。

# 获取1~3行所有列
df1.loc[1:3,:]

结果：

image.png

iloc定位

按照元素的绝对位置定位，行列索引都是从0开始。对比loc方法，loc里的1,3是行索引的名称，而iloc里的0,2是一、3这两个行索引所处的位置，一样地，name和age列的位置是0,1.

# loc定位
df1.loc[[1,3],["name","age"]]
# iloc
df1.iloc[[0,2],[0,1]] # iloc方法

image.png

iloc也能够切片。

# 获取name num列的所有行
df1.loc[:,["name","num"]]
df1.iloc[:,[0,2]] #iloc方法

结果：

image.png

# 获取2\3行所有列
df1.loc[[2,3],:]
df1.iloc[[1,2],:] #iloc方法

结果：

image.png

# 获取1~3行所有列
df1.loc[1:3,:]
df1.iloc[0:3,:] # iloc方法

结果：

image.png

Iloc切片是左闭右开的，也就是右区间时不包含的，0:3的意思是取第1行至第四行的值，不包括第四行，那实际上就只取到了第三行。Iloc切片的规则同Series切片是同样的。

3.增

3.1 插入行

同序列同样，若是想要在DataFrame里增长行记录，作法是创建一个新的DataFrame，而后将两个DataFrame纵向合并起来，一样用到append方法，

# 追加行
df2 = pd.DataFrame({"name":["Jane"],"age":[16],"sex":["female"]})
df_d.append(df2,ignore_index = True)

结果：

image.png

除了append方法能够进行表的纵向合并以达到插入行记录的目的外，还有concat方法。Concat是基于pandas的方法，用列表框起来，表示将两个数据框纵向拼接。这里咱们能够看到索引仍是原来数据框的索引，能够重置索引，设置ignore_index = True,就新生成一个索引了，append里也能够用。

pd.concat([df_d,df2],ignore_index = True)

结果是同样的：

image.png

3.2 插入列

直接对新增的列赋值，新增的列在数据框末尾。新增score列，用列表赋值，这里df1[“score”]不能替换成df1.score。

# 插入列
df1["score"] = [85,58,99]
df1

结果：

image.png

Insert方法，能够指定新增列的位置。

df1.insert(1,"score2",[77,78,79])
df1

结果：

image.png

insert方法的第一个参数是要插入列的位置，1表示将新列插入在第二列，第二个参数是列名，这里是score2，第三个参数是值。

3.删

3.1 删除行

Drop方法，index指定行，index = 1的意思是删除行索引名称为1的这一行。

# 删除行
df1.drop(index = 1)

结果：

image.png

还能够不写index，写axis = 0，表示按行删除。

df1.drop(1,axis = 0)

结果是同样的

3.2 删除列

对应删除行的操做，能够传入columns指定列

# 删除列
df1.drop(columns = "num")

结果：

image.png

也能够不传入columns，但要传入axis = 1参数。

df1.drop("num",axis = 1)

4.改

数据框修改实际上就是数据框中数值的替换，用replace方法，replace(A,B)，表示把A替换成B。选中age列，将age列中15的值替换为25，输出df1，并设置inplace = True参数，表示当即更新。

# 一对一替换
df1["age"].replace(15,25,inplace = True)
df1

结果：

image.png

上个例子是将1个值替换成另外一个值，那若是是要把18和16替换成26呢？把16和18用列表框起来，用26去替换他们。

# 多对一替换
df1["age"].replace([18,16],26,inplace = True)
df1

结果：

image.png

再好比要将num列的101，102,103分别对应替换成1001,1002和1003呢？这时字典就派上用场了。

# 多对多替换
df1["num"].replace({101:1001,102:1002,103:1003},inplace = True)
df1

结果：

image.png今天的内容就这些，后面将进入实战部分，are u ready？