Python 数据分析三剑客之 Pandas(五):统计计算与统计描述

💡 原文中文,约12900字,阅读约需31分钟。
📝

内容提要

本文介绍了Pandas库中的统计计算与描述功能,包括求和、最小值、最大值、平均值等方法的使用。通过示例展示了如何在Series和DataFrame中应用这些统计方法,以及如何使用describe()方法快速获取数据的综合统计结果。

🔎

延伸解读

axis 参数:控制计算方向

在 DataFrame 中,axis 参数决定统计计算的方向。axis=0 或 'index' 表示沿行方向计算,即对每一列求统计值;axis=1 或 'columns' 表示沿列方向计算,即对每一行求统计值。例如,obj.sum() 默认 axis=0,返回每列的和;obj.sum(axis=1) 返回每行的和。正确理解 axis 是使用 Pandas 统计方法的基础。

skipna 参数:缺失值处理策略

skipna 参数控制计算时是否排除缺失值(NA/null),默认为 True,即自动忽略缺失值。当 skipna=False 时,只要数据中存在缺失值,结果就为 NaN。例如,在 DataFrame 中,obj.min(axis='columns', skipna=False) 对于包含 NaN 的行返回 NaN。这提醒我们,在数据清洗不彻底时,需谨慎设置 skipna,以免统计结果失真。

describe():快速数据概览

describe() 方法能一次性输出计数、均值、标准差、最小最大值及四分位数等统计量,是探索性数据分析的利器。对于数值型 Series,它返回上述数值统计;对于分类或时间戳类型,则返回计数、唯一值、众数等。通过 include 和 exclude 参数,可以灵活选择包含或排除特定数据类型,例如 include='all' 会显示所有列的描述统计。

idxmin 与 idxmax:定位极值索引

idxmin() 和 idxmax() 分别返回最小值、最大值对应的索引,而非数值本身。在 Series 中,返回单个索引标签;在 DataFrame 中,默认按列返回每列极值所在的行索引。这两个方法在需要定位具体数据点时非常有用,例如找出销售额最低的日期。注意,它们与 argmin/argmax 不同,后者返回整数位置,且仅适用于 Series。

❓

Q&A

Pandas库中如何计算数据的和?

可以使用sum()方法来计算Series或DataFrame中指定轴的和。

如何在Pandas中获取数据的最小值和最大值?

可以使用min()和max()方法分别获取Series或DataFrame中指定轴的最小值和最大值。

Pandas的describe()方法有什么用?

describe()方法用于快速获取数据的综合统计结果,包括计数、均值、标准差、最大最小值和四分位数等。

如何在Pandas中计算平均值?

可以使用mean()方法来计算Series或DataFrame中指定轴的平均值。

Pandas中如何获取最小值和最大值的索引?

可以使用idxmin()和idxmax()方法分别获取Series或DataFrame中最小值和最大值的索引。

Pandas中有哪些常用的统计方法?

常用的统计方法包括count、sum、mean、min、max、median、var、std等。

🏷️

标签

➡️

继续阅读