pandas处理.csv表格的入门教程
-
安装和导入Pandas库:
- 使用
pip install pandas命令安装Pandas库。 - 在Python脚本中导入Pandas库:
import pandas as pd
- 使用
-
读取CSV文件:
- 使用
pd.read_csv()函数读取CSV文件并创建一个DataFrame对象。 - 例如:
df = pd.read_csv('file.csv'),其中’file.csv’是你的CSV文件路径。
- 使用
-
查看数据:
- 使用
df.head()方法查看DataFrame的前几行,默认显示前5行。 - 使用
df.tail()方法查看DataFrame的后几行,默认显示后5行。 - 使用
df.shape属性查看DataFrame的行数和列数。 - 使用
df.columns属性查看DataFrame的列名。 - 使用
df.info()方法查看DataFrame的基本信息,包括列名、非空值数量和数据类型等。
- 使用
-
数据清洗:
- 处理缺失值:
- 使用
df.isnull()方法检测缺失值。 - 使用
df.dropna()方法删除包含缺失值的行或列。 - 使用
df.fillna(value)方法填充缺失值,其中value可以是具体的值或使用统计方法进行填充。
- 使用
- 处理重复值:
- 使用
df.duplicated()方法检测重复值。 - 使用
df.drop_duplicates()方法删除重复值。
- 使用
- 数据类型转换:
- 使用
df.astype()方法将列的数据类型转换为指定的类型。 - 例如:
df['column'] = df['column'].astype(int)将特定列转换为整数类型。
- 使用
- 数据筛选:
- 使用布尔索引进行数据筛选,例如:
df[df['column'] > 10]将筛选出满足条件的行。
- 使用布尔索引进行数据筛选,例如:
- 处理缺失值:
-
数据统计和描述:
- 使用
df.describe()方法生成关于DataFrame中数值列的统计信息,包括均值、标准差、最小值、最大值等。 - 使用
df.mean()方法计算每列的平均值。 - 使用
df.corr()方法计算每列之间的相关系数。 - 使用
df.groupby()方法进行分组统计。
- 使用
-
数据操作:
- 添加列:
- 使用
df['new_column'] = values添加新的列,其中values是一个与DataFrame行数相同的列表或数组。
- 使用
- 删除列:
- 使用
df.drop('column', axis=1)删除指定的列,其中axis=1表示按列删除。
- 使用
- 修改列名:
- 使用
df.rename(columns={'old_name': 'new_name'})方法修改列名。
- 使用
- 添加列:
-
数据导出:
- 使用
df.to_csv('new_file.csv', index=False)将DataFrame保存为新的CSV文件,其中index=False表示不保存行索引。
- 使用
-
高级操作:
- 使用条件语句和逻辑运算符对数据进行筛选和过滤。
- 使用
df.apply()方法对DataFrame的行或列应用自定义函数。 - 使用
df.merge()方法将多个DataFrame进行合并。 - 使用
df.pivot_table()方法进行数据透视表的创建和操作。 - 使用
df.plot()方法进行简单的数据可视化。 - 当涉及到高级操作时,以下是一些示例用法:
-
使用条件语句和逻辑运算符对数据进行筛选和过滤:
# 筛选出满足条件的行 filtered_data = df[df['column'] > 10]# 使用多个条件进行筛选 filtered_data = df[(df['column1'] > 10) & (df['column2'] == 'value')] -
使用
df.apply()方法对DataFrame的行或列应用自定义函数:# 对某一列应用自定义函数 def custom_function(value):# 自定义逻辑处理return processed_valuedf['new_column'] = df['column'].apply(custom_function) -
使用
df.merge()方法将多个DataFrame进行合并:# 合并两个DataFrame,根据共同的列进行合并 merged_df = pd.merge(df1, df2, on='common_column')# 指定不同的列名进行合并 merged_df = pd.merge(df1, df2, left_on='column1', right_on='column2') -
使用
df.pivot_table()方法进行数据透视表的创建和操作:# 创建数据透视表 pivot_table = df.pivot_table(values='value_column', index='index_column', columns='column_to_group', aggfunc='mean')# 添加更多的聚合函数 pivot_table = df.pivot_table(values=['value1', 'value2'], index='index_column', columns='column_to_group', aggfunc=['mean', 'sum']) -
使用
df.plot()方法进行简单的数据可视化:# 绘制折线图 df.plot(x='x_column', y='y_column', kind='line')# 绘制柱状图 df.plot(x='x_column', y='y_column', kind='bar')# 绘制箱线图 df.plot(y='y_column', kind='box')