内容正文:
专题10 编程处理数据
2023
知识要点1 利用pandas模块处理数据
pandas提供了Series和DataFrame两种数据结构。(导入:import pandas as pd)
1.Series(一维):包含一个数组的数据和一个与数据关联的索引,索引值默认是从0递增的整数。
①创建Series对象:使用列表、字典等创建Series对象。Series的索引可以指定。
s0 = pd.Series([166,178,180],index=["甲","乙","丙"]) #列表创建
s1 = pd.Series([166,178,180]) #列表创建
s2 = pd.Series({"甲":166,"乙":178,"丙":180}) #字典创建
print(s0)
知识要点1 利用pandas模块处理数据
②通过索引查找对象中的值,或修改对象中的值。
s1 = pd.Series([166,178,180]); print(s1[0]) #结果: 166
s1[0]=168 ; print(s1[0]) #结果: 168
③通过切片获取或修改部分值(仍为Series类型)
print(s1[0:2]) s1[0:2]=[‘a’,’b’]
print(s1[0:2])
④通过循环访问Series对象中所有索引或值
知识要点1 利用pandas模块处理数据
2.DataFrame(二维):由一个索引列和若干个数据列组成,每个数据列可以是不同的类型。
①创建DataFrame对象
☆字典创建DataFrame对象时,键作为列名,值作为列数据
data1 = {"姓名":["张三","李四","王五"],"性别":["男","女","男"],"身高":[178,163,180]}
df1 = pd.DataFrame(data1,columns=["姓名","性别","身高"],index=["一","二","三"])
☆列表创建时每一个小列表对应一行数据
data2 = [[1,2,3],[4,5,6],[7,8,9]]
df2 = pd.DataFrame(data2,columns=["a","b","c"],index=["e","f","g"])
columns
index
values
知识要点1 利用pandas模块处理数据
☆读取二维数据文件创建DataFrame对象
pd.read_excel(filename) 从Excel文件导入数据
pd.read_csv(filename) 从csv文件导入数据
df.to_excel(filename) 导出数据到Excel文件
df.to_csv(filename) 导出数据到csv文件
知识要点1 利用pandas模块处理数据
②查看DataFrame对象的相关属性。
知识要点1 利用pandas模块处理数据
③通过列名或字典记法检索、通过赋值修改DataFrame对象中的列数据。
知识要点1 利用pandas模块处理数据
④通过切片或布尔表达式的方式访问行数据
⑤通过at[]方法访问单个数据
print(df1[1:3]) print(df1[df1['身高']>175])
print(df1.at["一",'性别'])
知识要点1 利用pandas模块处理数据
⑥行、列的编辑
#添加一行数据
df1_add=df1.append({“姓名”:‘赵六’,‘性别’:‘女’,‘身高’:‘168’},ignore_index=True)
print(df1_add)
df1_delr=df1_add.drop(1) #删除一行数据
print(df1_delr)
df1_delc=df1_add.drop(“身高”,axis=1) #删除一列数据
print(df1_delc)
del df1[”身高”] #永久删除“身高”列数据
重点提示:append() 、