在前序内容里,我们已经完成 Linux 系统环境搭建、数据库 SQL 知识、NumPy 数值计算与 Matplotlib 可视化工具的学习,已经具备了数据存储、底层数值运算、图表呈现的基础能力。而在真实的数据处理与统计分析项目中,绝大多数业务数据都是表格化的结构化格式,Pandas 正是 Python 生态中专门针对表格数据设计的第三方工具库,是数据分析全流程的核心枢纽。
本篇作为系列第四篇,将围绕 Pandas 完整知识框架展开讲解,全程不展示代码,仅拆解概念逻辑、功能分类、业务使用场景,适配 Word 规范排版要求,帮大家掌握结构化数据从读取、清洗、改造到分组统计的全链路能力。
一、Pandas 基础概述
1.1 工具定位与应用场景
Pandas 是 Python 的第三方专业数据分析库,贯穿数据项目完整工作流,核心覆盖五大环节:
数据加载:从各类文件、数据库中读取原始表格数据;
数据预处理:完成缺失值、重复值、异常值清洗,规整数据格式;
数据统计分析:实现聚合计算、分组对比、指标提取;
结果导出:把处理完成的数据保存为通用格式文件;
数据可视化:对接 Matplotlib 实现表格数据的图表绘制。
1.2 两大核心数据对象
Pandas 所有操作都围绕两个基础数据结构展开:
1.2.1 Series 一维序列对象
Series 是一维带索引的数组结构,可以把 DataFrame 中的单行或单列数据看作一个独立的 Series 对象。
创建方式:支持通过普通数组、Python 列表、字典等形式生成,可自定义行索引标签;
核心属性:包含索引、数值两大核心属性,索引和数值一一对应。
1.2.2 DataFrame 二维表格对象
DataFrame 是最常用的二维表格结构,逻辑等同于 Excel 工作表,拥有行索引、列名双维度标识,是日常业务数据的主要载体。
创建方式:支持通过嵌套列表、字典、Series 组合等形式生成,可自定义行索引与列名称;
核心属性:包含行索引、列名、数据内容、表格形状、元素总数,还支持实现行列结构的转置;
典型应用场景:学生各科成绩表、业务销售记录表这类多字段、多记录的结构化数据。
二、Pandas 支持的数据类型
Pandas 兼容丰富的数据类型,既包含 Python 原生数据类型,也针对数据分析拓展了专用类型:
字符串类型:用于存储文本类分类、描述信息;
日期时间类型:适配时序数据,支持日期解析、时间偏移计算;
时间间隔类型:用于记录两个时间点之间的时长差;
分类类型:针对固定枚举类标签优化存储,节省内存并方便分组统计;
其余数值、布尔等类型:和 Python 原生数据体系保持一致。
三、Pandas 全流程基本操作
3.1 数据读写操作
支持主流数据格式的读取与导出,打通数据上下游:
读取来源:支持 CSV 类文本表格、SQL 数据库数据表、JSON 格式文件等多种数据源;
导出方向:可以将处理完成的表格数据,反向保存为 CSV、Excel、JSON 等通用格式文件,方便交付复用。
3.2 索引相关操作
索引是 Pandas 数据筛选、对齐的核心依据,支持灵活调整:
设置专属索引:指定某一列或自定义序列作为表格的行索引;
重置索引:撤销自定义索引,恢复默认连续数字索引;
排序操作:既可以按索引排序,也可以按指定列的数值大小完成全表排序。
3.3 数据筛选与运算
3.3.1 数据筛选方式
直接列筛选:通过列名快速提取单列或多列目标数据;
逻辑表达式筛选:结合与、或、非这类逻辑运算符,按多条件精准筛选符合要求的数据行。
3.3.2 统计与数值运算
常规统计运算:支持求和、最值、平均值、方差、标准差等全套统计指标计算;
元素级运算:支持单列批量赋值、多列按规则运算,也可以调用自定义函数对列数据做批量改造;
新增列:通过已有列运算生成新字段,拓展表格的分析维度。
3.4 数据增删与内容修改
3.4.1 维度增减改造
新增内容:可以追加新列,也可以在表格末尾新增数据行;
删除内容:可删除指定列、删除指定行,还能剔除完全重复的数据行,Series 对象还支持去除重复值的专属操作。
3.4.2 内容替换修改
支持全局或按筛选范围完成数值替换,把旧值批量更新为新值,适配异常值修正、枚举值规整这类场景。
3.5 数据查看与缺失处理
局部预览:可以查看表格前若干行、末尾若干行,快速摸清数据整体样貌;
缺失值处理:两大主流方案,一是直接剔除存在缺失的行 / 列,二是用均值、中位数、固定常数等方式填充空缺内容,适配不同业务容错要求。
3.6 数据合并与分组分析
3.6.1 多表合并
两种常用合并逻辑:
拼接合并:把结构一致的多张表格沿行方向堆叠,扩充数据量;
关联合并:依据共同关键字段,像数据库多表连接一样把多张表的字段融合拼接。
3.6.2 分组统计
这是数据分析高频操作,分为三层能力:
基础分组:按照指定字段把数据划分为多个组别;
分组聚合:对每个分组单独执行求和、均值等统计计算;
分组筛选:依据分组统计结果,过滤保留符合条件的分组数据。
四、逻辑图
