欢迎光临
我们一直在努力

Pandas核心入门:Series、DataFrame数据结构、零基础数据清洗

博客导语

如果说 Numpy 负责数值计算,那么 Pandas 负责结构化数据分析。Pandas 是数据分析必备工具,两大核心数据结构:Series、DataFrame。本文手把手讲解数据结构、数据读取、缺失值处理、重复值处理、异常值基础清洗,是数据分析入门第一站。


一、Pandas安装与导入

pip install pandas

import pandas as pd


二、两大核心数据结构

1. Series:一维带索引数组

类似于「带索引的列表」,单列数据。

s = pd.Series([10,20,30,40], index=["a","b","c","d"])
print(s)
print(s["a"])

2. DataFrame:二维表格(核心)

类似于 Excel 表格,多行多列、行索引+列索引,数据分析主力结构。

data = {
"name":["张三","李四","王五"],
"age":[18,20,22],
"score":[88,90,79]
}
df = pd.DataFrame(data)
print(df)


三、常用数据查看方法

df.head() # 前5行
df.tail() # 后5行
df.info() # 数据整体信息、缺失值统计
df.describe() # 数值列统计指标
df.columns # 所有列名
df.shape # 表格形状


四、基础数据清洗(企业必备)

1. 缺失值处理

df.isnull() # 判断缺失值
df.isnull().sum() # 统计每列缺失数量

df.dropna() # 删除缺失值行
df.fillna(0) # 缺失值填充0
df.fillna(df.mean())# 均值填充

2. 重复值处理

df.duplicated() # 判断重复行
df.drop_duplicates() # 删除重复行

3. 列操作

# 新增列
df["gender"] = ["男","女","男"]
# 删除列
df.drop("score",axis=1,inplace=True)
# 修改列名
df.rename(columns={"name":"用户名"},inplace=True)


五、本篇总结

Pandas 数据分析流程第一步:构建 DataFrame、查看数据、清洗脏数据。缺失值、重复值清洗是所有数据分析、AI建模的前置必备步骤。

赞(0)
未经允许不得转载:171主机测评 » Pandas核心入门:Series、DataFrame数据结构、零基础数据清洗
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址