ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

pandas处理.csv表格的入门教程

2026/8/8 9:57:17 拓冰建站 浏览量
pandas处理.csv表格的入门教程
  1. 安装和导入Pandas库:

    • 使用pip install pandas命令安装Pandas库。
    • 在Python脚本中导入Pandas库:import pandas as pd
  2. 读取CSV文件:

    • 使用pd.read_csv()函数读取CSV文件并创建一个DataFrame对象。
    • 例如:df = pd.read_csv('file.csv'),其中’file.csv’是你的CSV文件路径。
  3. 查看数据:

    • 使用df.head()方法查看DataFrame的前几行,默认显示前5行。
    • 使用df.tail()方法查看DataFrame的后几行,默认显示后5行。
    • 使用df.shape属性查看DataFrame的行数和列数。
    • 使用df.columns属性查看DataFrame的列名。
    • 使用df.info()方法查看DataFrame的基本信息,包括列名、非空值数量和数据类型等。
  4. 数据清洗:

    • 处理缺失值:
      • 使用df.isnull()方法检测缺失值。
      • 使用df.dropna()方法删除包含缺失值的行或列。
      • 使用df.fillna(value)方法填充缺失值,其中value可以是具体的值或使用统计方法进行填充。
    • 处理重复值:
      • 使用df.duplicated()方法检测重复值。
      • 使用df.drop_duplicates()方法删除重复值。
    • 数据类型转换:
      • 使用df.astype()方法将列的数据类型转换为指定的类型。
      • 例如:df['column'] = df['column'].astype(int)将特定列转换为整数类型。
    • 数据筛选:
      • 使用布尔索引进行数据筛选,例如:df[df['column'] > 10]将筛选出满足条件的行。
  5. 数据统计和描述:

    • 使用df.describe()方法生成关于DataFrame中数值列的统计信息,包括均值、标准差、最小值、最大值等。
    • 使用df.mean()方法计算每列的平均值。
    • 使用df.corr()方法计算每列之间的相关系数。
    • 使用df.groupby()方法进行分组统计。
  6. 数据操作:

    • 添加列:
      • 使用df['new_column'] = values添加新的列,其中values是一个与DataFrame行数相同的列表或数组。
    • 删除列:
      • 使用df.drop('column', axis=1)删除指定的列,其中axis=1表示按列删除。
    • 修改列名:
      • 使用df.rename(columns={'old_name': 'new_name'})方法修改列名。
  7. 数据导出:

    • 使用df.to_csv('new_file.csv', index=False)将DataFrame保存为新的CSV文件,其中index=False表示不保存行索引。
  8. 高级操作:

    • 使用条件语句和逻辑运算符对数据进行筛选和过滤。
    • 使用df.apply()方法对DataFrame的行或列应用自定义函数。
    • 使用df.merge()方法将多个DataFrame进行合并。
    • 使用df.pivot_table()方法进行数据透视表的创建和操作。
    • 使用df.plot()方法进行简单的数据可视化。
    • 当涉及到高级操作时,以下是一些示例用法:
  9. 使用条件语句和逻辑运算符对数据进行筛选和过滤:

    # 筛选出满足条件的行
    filtered_data = df[df['column'] > 10]# 使用多个条件进行筛选
    filtered_data = df[(df['column1'] > 10) & (df['column2'] == 'value')]
    
  10. 使用df.apply()方法对DataFrame的行或列应用自定义函数:

    # 对某一列应用自定义函数
    def custom_function(value):# 自定义逻辑处理return processed_valuedf['new_column'] = df['column'].apply(custom_function)
    
  11. 使用df.merge()方法将多个DataFrame进行合并:

    # 合并两个DataFrame,根据共同的列进行合并
    merged_df = pd.merge(df1, df2, on='common_column')# 指定不同的列名进行合并
    merged_df = pd.merge(df1, df2, left_on='column1', right_on='column2')
    
  12. 使用df.pivot_table()方法进行数据透视表的创建和操作:

    # 创建数据透视表
    pivot_table = df.pivot_table(values='value_column', index='index_column', columns='column_to_group', aggfunc='mean')# 添加更多的聚合函数
    pivot_table = df.pivot_table(values=['value1', 'value2'], index='index_column', columns='column_to_group', aggfunc=['mean', 'sum'])
    
  13. 使用df.plot()方法进行简单的数据可视化:

    # 绘制折线图
    df.plot(x='x_column', y='y_column', kind='line')# 绘制柱状图
    df.plot(x='x_column', y='y_column', kind='bar')# 绘制箱线图
    df.plot(y='y_column', kind='box')