博客导语
如果说 Numpy 负责数值计算,那么 Pandas 负责结构化数据分析。Pandas 是数据分析必备工具,两大核心数据结构:Series、DataFrame。本文手把手讲解数据结构、数据读取、缺失值处理、重复值处理、异常值基础清洗,是数据分析入门第一站。
一、Pandas安装与导入
pip install pandas
import pandas as pd
二、两大核心数据结构
1. Series:一维带索引数组
类似于「带索引的列表」,单列数据。
s = pd.Series([10,20,30,40], index=["a","b","c","d"])
print(s)
print(s["a"])
2. DataFrame:二维表格(核心)
类似于 Excel 表格,多行多列、行索引+列索引,数据分析主力结构。
data = {
"name":["张三","李四","王五"],
"age":[18,20,22],
"score":[88,90,79]
}
df = pd.DataFrame(data)
print(df)
三、常用数据查看方法
df.head() # 前5行
df.tail() # 后5行
df.info() # 数据整体信息、缺失值统计
df.describe() # 数值列统计指标
df.columns # 所有列名
df.shape # 表格形状
四、基础数据清洗(企业必备)
1. 缺失值处理
df.isnull() # 判断缺失值
df.isnull().sum() # 统计每列缺失数量
df.dropna() # 删除缺失值行
df.fillna(0) # 缺失值填充0
df.fillna(df.mean())# 均值填充
2. 重复值处理
df.duplicated() # 判断重复行
df.drop_duplicates() # 删除重复行
3. 列操作
# 新增列
df["gender"] = ["男","女","男"]
# 删除列
df.drop("score",axis=1,inplace=True)
# 修改列名
df.rename(columns={"name":"用户名"},inplace=True)
五、本篇总结
Pandas 数据分析流程第一步:构建 DataFrame、查看数据、清洗脏数据。缺失值、重复值清洗是所有数据分析、AI建模的前置必备步骤。




