Python怎样计算数据分布的偏度和峰度?

python中,使用scipy.stats模块的skew()和kurtosis()函数可计算数据分布的偏度和峰度。1. 偏度衡量数据分布的非对称性,正值表示右偏,负值表示左偏,接近0表示对称;2. 峰度描述分布的尖峭程度和尾部厚度,正值表示比正态分布更尖峭(肥尾),负值表示更平坦(瘦尾)。两个函数均接受bias参数控制是否使用无偏估计,kurtosis()还接受fisher参数决定是否计算超额峰度(默认为true,即减去3)。此外,可通过直方图和q-q图可视化数据分布的偏度与峰度,帮助更直观理解数据形状。

Python怎样计算数据分布的偏度和峰度?

在Python中,计算数据分布的偏度和峰度通常会用到scipy.stats模块,它提供了非常方便的函数来快速获取这些统计量,帮助我们理解数据形状。

Python怎样计算数据分布的偏度和峰度?

解决方案

要计算一个数据集的偏度和峰度,最直接的方法是使用scipy.stats库中的skew()kurtosis()函数。这两个函数使用起来非常直观,你只需要将你的数据(通常是一个NumPy数组或列表)作为参数传递进去。

偏度(Skewness)衡量的是数据分布的非对称性。如果偏度为正,说明数据的尾部在右侧更长,右偏;如果为负,则尾部在左侧更长,左偏;接近0则表示分布大致对称。

立即学习“Python免费学习笔记(深入)”;

Python怎样计算数据分布的偏度和峰度?

峰度(Kurtosis)则描述了数据分布的“尖峭”程度和尾部的厚度。高峰度(正峰度)意味着数据集中在中心,尾部较厚(极端值更多);低峰度(负峰度)则表示数据分布相对平坦,尾部较轻。

下面是一个简单的例子,展示如何使用这两个函数:

Python怎样计算数据分布的偏度和峰度?

import numpy as npfrom scipy.stats import skew, kurtosis# 假设我们有一些模拟数据# 一个正偏态的例子 (比如收入分布)data_skewed_positive = np.array([1, 2, 2, 3, 3, 3, 4, 4, 5, 10, 15])# 一个大致对称的例子 (比如身高分布)data_symmetric = np.array([60, 65, 70, 75, 80, 85, 90, 95, 100])# 一个高斯分布(正态分布)的例子np.random.seed(42) # 为了结果可复现data_normal = np.random.normal(loc=0, scale=1, size=1000)# 一个尾部较厚的例子 (比如金融市场极端波动)data_heavy_tail = np.concatenate([np.random.normal(0, 1, 900), np.random.normal(0, 5, 100)])# 计算偏度skewness_positive = skew(data_skewed_positive)skewness_symmetric = skew(data_symmetric)skewness_normal = skew(data_normal)print(f"正偏态数据的偏度: {skewness_positive:.4f}")print(f"对称数据的偏度: {skewness_symmetric:.4f}")print(f"正态分布数据的偏度: {skewness_normal:.4f}")print("-" * 30)# 计算峰度# 默认情况下,scipy的kurtosis函数计算的是“超额峰度”(excess kurtosis),# 即与正态分布(峰度为3)相比的峰度值。所以正态分布的超额峰度接近0。kurtosis_positive = kurtosis(data_skewed_positive)kurtosis_symmetric = kurtosis(data_symmetric)kurtosis_normal = kurtosis(data_normal)kurtosis_heavy_tail = kurtosis(data_heavy_tail)print(f"正偏态数据的峰度: {kurtosis_positive:.4f}")print(f"对称数据的峰度: {kurtosis_symmetric:.4f}")print(f"正态分布数据的峰度 (超额峰度): {kurtosis_normal:.4f}")print(f"重尾分布数据的峰度 (超额峰度): {kurtosis_heavy_tail:.4f}")

这段代码直接展示了如何调用skew()kurtosis()。值得注意的是,kurtosis()默认计算的是超额峰度(excess kurtosis),这意味着它减去了正态分布的峰度值3。所以,一个完美的正态分布的超额峰度会接近0。如果你想要计算原始的峰度值(Pearson’s kurtosis),你需要将fisher参数设置为False。同样,bias参数可以控制是否使用偏差校正。

为什么我们需要关心数据的偏度和峰度?

理解数据的偏度和峰度,远不止是计算两个数字那么简单。这就像是给数据拍X光片,看看它内部的骨架是不是匀称,有没有什么异常的凸起或者凹陷。在数据分析和建模中,这两个统计量提供了关于数据分布形状的关键洞察,它们的重要性体现在多个方面。

首先,很多统计模型,尤其是那些基于参数假设的模型,比如线性回归或者某些假设检验,都常常默认数据服从正态分布。正态分布的一个显著特征就是它的偏度为0,超额峰度也为0。如果我们的数据存在显著的偏度或峰度,那么直接套用这些模型可能会导致错误的结论。比如,如果数据严重偏斜,模型可能无法准确捕捉到数据中的真实关系,预测的置信区间也可能变得不可靠。

其次,偏度和峰度在风险管理和金融领域有着特别的应用。想象一下,你正在分析股票收益率。如果收益率分布是右偏的,意味着虽然平均收益可能不错,但更频繁的小幅亏损可能比大幅盈利常见。而如果分布是左偏的,则可能意味着偶尔会有较大的亏损。至于峰度,高峰度(肥尾)则意味着极端事件(无论是极高的收益还是极大的亏损)发生的概率比正态分布预测的要高。这对于评估投资风险、设定风险限额至关重要。一个“瘦高”的分布可能意味着大部分时间波动不大,但一旦波动起来,就是“惊天动地”的大事件。

再者,它们能帮助我们更好地选择数据转换方法。当数据严重偏斜时,我们可能需要进行对数变换、平方根变换等操作来使其更接近对称分布,从而满足某些模型的假设。了解数据的偏度,能指导我们选择合适的变换方式。

总之,偏度和峰度不仅仅是抽象的统计数字,它们是数据背后故事的线索。它们能揭示数据是集中还是分散,是均衡还是倾斜,这对于我们理解数据特征、选择合适的分析方法以及做出更明智的决策都至关重要。忽视它们,就像是盲人摸象,可能只触及到数据的一部分而错失了整体的真相。

不同计算方法对偏度和峰度结果的影响?

在Python中使用scipy.stats计算偏度和峰度时,你可能会注意到函数签名里有一些参数,比如biasfisher。这些参数的设置,实际上会影响计算结果,因为它们对应着统计学中不同的计算定义或者说“校正”方式。理解这些差异,对于确保你得到的是你真正想要的统计量,并且能与其他工具或文献中的结果进行比较,非常关键。

1. bias参数:有偏估计与无偏估计

bias=True (默认值): 这表示计算结果是“有偏估计”。在计算偏度和峰度时,分母使用的是样本大小 n。这种计算方式在样本量非常大时,与总体参数的偏差可以忽略不计。但对于小样本,它可能会系统性地低估或高估真实的总体偏度/峰度。bias=False: 这表示计算结果是“无偏估计”。分母会进行校正,例如,对于偏度,分母可能是 n * (n-1) * (n-2) 的某种形式;对于峰度,会使用更复杂的校正因子。无偏估计在理论上对于任何样本量都能提供对总体参数的更准确估计。

通常,如果你在处理样本数据并希望估计总体的偏度或峰度,那么设置bias=False是更稳健的选择。但如果你只是想描述当前样本的偏度/峰度,或者样本量足够大,那么bias=True的默认设置也无妨。

import numpy as npfrom scipy.stats import skew, kurtosisdata = np.array([1, 2, 3, 4, 5, 6, 7, 8, 9, 10]) # 小样本数据# 偏度skew_biased = skew(data, bias=True)skew_unbiased = skew(data, bias=False)print(f"偏度 (有偏): {skew_biased:.4f}")print(f"偏度 (无偏): {skew_unbiased:.4f}")# 峰度kurt_biased = kurtosis(data, bias=True)kurt_unbiased = kurtosis(data, bias=False)print(f"峰度 (有偏): {kurt_biased:.4f}")print(f"峰度 (无偏): {kurt_unbiased:.4f}")

你会发现,对于小样本,有偏和无偏的结果确实存在差异。

2. fisher参数:超额峰度与皮尔逊峰度

fisher=True (默认值): 这表示计算的是“超额峰度”(excess kurtosis),也称为Fisher峰度。这是最常用的峰度定义,它减去了正态分布的峰度值3。因此,一个完美的正态分布的超额峰度为0。正值表示比正态分布更尖峭、尾部更厚,负值表示更平坦、尾部更轻。fisher=False: 这表示计算的是“皮尔逊峰度”(Pearson kurtosis),也称为原始峰度。它不减去3。在这种定义下,正态分布的峰度值为3。

在数据分析中,我们通常更关心数据分布与正态分布的偏离程度,所以超额峰度(fisher=True)是更常见的选择,因为它直接告诉我们数据比正态分布“更胖”还是“更瘦”。如果你在阅读的某些文献或工具中使用的是原始峰度定义,那么将fisher设置为False可以帮助你保持一致性。

import numpy as npfrom scipy.stats import kurtosisdata_normal = np.random.normal(loc=0, scale=1, size=1000)# 峰度kurt_fisher = kurtosis(data_normal, fisher=True)kurt_pearson = kurtosis(data_normal, fisher=False)print(f"正态分布的超额峰度 (Fisher): {kurt_fisher:.4f}")print(f"正态分布的原始峰度 (Pearson): {kurt_pearson:.4f}")

可以看到,对于正态分布,Fisher峰度接近0,而Pearson峰度接近3。

选择正确的参数设置,取决于你的具体分析目的、样本大小以及你希望将结果与哪种标准进行比较。在不确定时,通常使用默认值(bias=True, fisher=True)来描述样本的超额偏度和超额峰度,但如果你需要更严谨的统计推断或与特定理论值比较,了解并调整这些参数是很有必要的。

如何可视化数据分布的偏度和峰度?

仅仅依靠数值来判断数据的偏度和峰度,有时会显得有点抽象。最好的方式是结合可视化手段,让数据分布的形状一目了然。Python的matplotlibseaborn库在这方面提供了强大的支持,能帮助我们直观地理解偏度和峰度所代表的含义。

1. 直方图 (Histogram)

直方图是最基本也是最有效的可视化工具之一,它能直接展示数据的分布形态。通过观察直方图,我们可以大致判断出数据的对称性(偏度)和尾部的厚度(峰度)。

偏度: 如果直方图的“尾巴”向右边拖得很长,那就是右偏(正偏度);如果向左边拖得很长,就是左偏(负偏度)。如果两边大致对称,那么偏度接近0。峰度: 如果直方图在中间部分非常高且窄,两边尾巴很长,可能就是高峰度(肥尾)。如果分布比较平坦,没有明显的尖峰,尾巴也比较短,可能就是低峰度(瘦尾)。

import matplotlib.pyplot as pltimport seaborn as snsimport numpy as np# 模拟不同偏度和峰度的数据np.random.seed(42)data_right_skewed = np.random.exponential(scale=2, size=1000) # 右偏data_left_skewed = 10 - np.random.exponential(scale=2, size=1000) # 左偏data_normal = np.random.normal(loc=0, scale=1, size=1000) # 正态,中等峰度data_leptokurtic = np.concatenate([np.random.normal(0, 1, 900), np.random.normal(0, 5, 100)]) # 高峰度(肥尾)data_platykurtic = np.random.uniform(low=-3, high=3, size=1000) # 低峰度(瘦尾,比正态平坦)plt.figure(figsize=(15, 10))plt.subplot(2, 3, 1)sns.histplot(data_right_skewed, kde=True, bins=30)plt.title(f'Right Skewed (Skew: {skew(data_right_skewed):.2f})')plt.subplot(2, 3, 2)sns.histplot(data_left_skewed, kde=True, bins=30)plt.title(f'Left Skewed (Skew: {skew(data_left_skewed):.2f})')plt.subplot(2, 3, 3)sns.histplot(data_normal, kde=True, bins=30)plt.title(f'Normal (Skew: {skew(data_normal):.2f}, Kurt: {kurtosis(data_normal):.2f})')plt.subplot(2, 3, 4)sns.histplot(data_leptokurtic, kde=True, bins=30)plt.title(f'Leptokurtic (Kurt: {kurtosis(data_leptokurtic):.2f})')plt.subplot(2, 3, 5)sns.histplot(data_platykurtic, kde=True, bins=30)plt.title(f'Platykurtic (Kurt: {kurtosis(data_platykurtic):.2f})')plt.tight_layout()plt.show()

在直方图中叠加核密度估计(KDE)曲线(kde=True)可以更好地平滑地展示分布的形状。

2. Q-Q 图 (Quantile-Quantile Plot)

Q-Q图是用来比较数据分布与理论分布(通常是正态分布)之间一致性的强大工具。如果数据服从理论分布,那么Q-Q图上的点会大致落在一条直线上。偏度和峰度会在Q-Q图上留下独特的“指纹”。

偏度: 如果数据是右偏的,Q-Q图上的点会先低于直线,然后高于直线,形成一个“S”形或向下弯曲的趋势。左偏则相反,会形成向上弯曲的趋势。峰度: 如果数据是高峰度(肥尾),Q-Q图上的点在两端会偏离直线,形成一个“S”形,但中间部分可能仍然贴近直线。如果是低峰度(瘦尾),两端会比直线更平坦。

import statsmodels.api as sm# 再次使用之前的数据plt.figure(figsize=(15, 5))plt.subplot(1, 3, 1)sm.qqplot(data_right_skewed, line='s', ax=plt.gca()) # line='s' 表示标准化线plt.title('Q-Q Plot for Right Skewed Data')plt.subplot(1, 3, 2)sm.qqplot(data_leptokurtic, line='s', ax=plt.gca())plt.title('Q-Q Plot for Leptokurtic Data')plt.subplot(1, 3, 3)sm.qqplot(data_platykurtic, line='s', ax=plt.gca())plt.title('Q-Q Plot for Platykurtic Data')plt.tight_layout()plt.show()

通过这些可视化方法,我们能够将抽象的偏度和峰度数值与实际的数据分布形状联系起来,从而对数据有更深入、更直观的理解。这对于数据探索、异常值检测以及后续的模型选择和验证都非常有帮助。毕竟,看图说话,往往比单纯的数字更有说服力。

以上就是Python怎样计算数据分布的偏度和峰度?的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1366074.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年12月14日 04:58:10
下一篇 2025年12月14日 04:58:20

相关推荐

  • CSS mask属性无法获取图片:为什么我的图片不见了?

    CSS mask属性无法获取图片 在使用CSS mask属性时,可能会遇到无法获取指定照片的情况。这个问题通常表现为: 网络面板中没有请求图片:尽管CSS代码中指定了图片地址,但网络面板中却找不到图片的请求记录。 问题原因: 此问题的可能原因是浏览器的兼容性问题。某些较旧版本的浏览器可能不支持CSS…

    2025年12月24日
    900
  • Uniapp 中如何不拉伸不裁剪地展示图片?

    灵活展示图片:如何不拉伸不裁剪 在界面设计中,常常需要以原尺寸展示用户上传的图片。本文将介绍一种在 uniapp 框架中实现该功能的简单方法。 对于不同尺寸的图片,可以采用以下处理方式: 极端宽高比:撑满屏幕宽度或高度,再等比缩放居中。非极端宽高比:居中显示,若能撑满则撑满。 然而,如果需要不拉伸不…

    2025年12月24日
    400
  • 如何让小说网站控制台显示乱码,同时网页内容正常显示?

    如何在不影响用户界面的情况下实现控制台乱码? 当在小说网站上下载小说时,大家可能会遇到一个问题:网站上的文本在网页内正常显示,但是在控制台中却是乱码。如何实现此类操作,从而在不影响用户界面(UI)的情况下保持控制台乱码呢? 答案在于使用自定义字体。网站可以通过在服务器端配置自定义字体,并通过在客户端…

    2025年12月24日
    800
  • 如何在地图上轻松创建气泡信息框?

    地图上气泡信息框的巧妙生成 地图上气泡信息框是一种常用的交互功能,它简便易用,能够为用户提供额外信息。本文将探讨如何借助地图库的功能轻松创建这一功能。 利用地图库的原生功能 大多数地图库,如高德地图,都提供了现成的信息窗体和右键菜单功能。这些功能可以通过以下途径实现: 高德地图 JS API 参考文…

    2025年12月24日
    400
  • 如何使用 scroll-behavior 属性实现元素scrollLeft变化时的平滑动画?

    如何实现元素scrollleft变化时的平滑动画效果? 在许多网页应用中,滚动容器的水平滚动条(scrollleft)需要频繁使用。为了让滚动动作更加自然,你希望给scrollleft的变化添加动画效果。 解决方案:scroll-behavior 属性 要实现scrollleft变化时的平滑动画效果…

    2025年12月24日
    000
  • 如何为滚动元素添加平滑过渡,使滚动条滑动时更自然流畅?

    给滚动元素平滑过渡 如何在滚动条属性(scrollleft)发生改变时为元素添加平滑的过渡效果? 解决方案:scroll-behavior 属性 为滚动容器设置 scroll-behavior 属性可以实现平滑滚动。 html 代码: click the button to slide right!…

    2025年12月24日
    500
  • 为什么设置 `overflow: hidden` 会导致 `inline-block` 元素错位?

    overflow 导致 inline-block 元素错位解析 当多个 inline-block 元素并列排列时,可能会出现错位显示的问题。这通常是由于其中一个元素设置了 overflow 属性引起的。 问题现象 在不设置 overflow 属性时,元素按预期显示在同一水平线上: 不设置 overf…

    2025年12月24日 好文分享
    400
  • 网页使用本地字体:为什么 CSS 代码中明明指定了“荆南麦圆体”,页面却仍然显示“微软雅黑”?

    网页中使用本地字体 本文将解答如何将本地安装字体应用到网页中,避免使用 src 属性直接引入字体文件。 问题: 想要在网页上使用已安装的“荆南麦圆体”字体,但 css 代码中将其置于第一位的“font-family”属性,页面仍显示“微软雅黑”字体。 立即学习“前端免费学习笔记(深入)”; 答案: …

    2025年12月24日
    000
  • 如何选择元素个数不固定的指定类名子元素?

    灵活选择元素个数不固定的指定类名子元素 在网页布局中,有时需要选择特定类名的子元素,但这些元素的数量并不固定。例如,下面这段 html 代码中,activebar 和 item 元素的数量均不固定: *n *n 如果需要选择第一个 item元素,可以使用 css 选择器 :nth-child()。该…

    2025年12月24日
    200
  • 使用 SVG 如何实现自定义宽度、间距和半径的虚线边框?

    使用 svg 实现自定义虚线边框 如何实现一个具有自定义宽度、间距和半径的虚线边框是一个常见的前端开发问题。传统的解决方案通常涉及使用 border-image 引入切片图片,但是这种方法存在引入外部资源、性能低下的缺点。 为了避免上述问题,可以使用 svg(可缩放矢量图形)来创建纯代码实现。一种方…

    2025年12月24日
    100
  • 如何解决本地图片在使用 mask JS 库时出现的跨域错误?

    如何跨越localhost使用本地图片? 问题: 在本地使用mask js库时,引入本地图片会报跨域错误。 解决方案: 要解决此问题,需要使用本地服务器启动文件,以http或https协议访问图片,而不是使用file://协议。例如: python -m http.server 8000 然后,可以…

    2025年12月24日
    200
  • 如何让“元素跟随文本高度,而不是撑高父容器?

    如何让 元素跟随文本高度,而不是撑高父容器 在页面布局中,经常遇到父容器高度被子元素撑开的问题。在图例所示的案例中,父容器被较高的图片撑开,而文本的高度没有被考虑。本问答将提供纯css解决方案,让图片跟随文本高度,确保父容器的高度不会被图片影响。 解决方法 为了解决这个问题,需要将图片从文档流中脱离…

    2025年12月24日
    000
  • 为什么我的特定 DIV 在 Edge 浏览器中无法显示?

    特定 DIV 无法显示:用户代理样式表的困扰 当你在 Edge 浏览器中打开项目中的某个 div 时,却发现它无法正常显示,仔细检查样式后,发现是由用户代理样式表中的 display none 引起的。但你疑问的是,为什么会出现这样的样式表,而且只针对特定的 div? 背后的原因 用户代理样式表是由…

    2025年12月24日
    200
  • inline-block元素错位了,是为什么?

    inline-block元素错位背后的原因 inline-block元素是一种特殊类型的块级元素,它可以与其他元素行内排列。但是,在某些情况下,inline-block元素可能会出现错位显示的问题。 错位的原因 当inline-block元素设置了overflow:hidden属性时,它会影响元素的…

    2025年12月24日
    000
  • 为什么 CSS mask 属性未请求指定图片?

    解决 css mask 属性未请求图片的问题 在使用 css mask 属性时,指定了图片地址,但网络面板显示未请求获取该图片,这可能是由于浏览器兼容性问题造成的。 问题 如下代码所示: 立即学习“前端免费学习笔记(深入)”; icon [data-icon=”cloud”] { –icon-cl…

    2025年12月24日
    200
  • 为什么使用 inline-block 元素时会错位?

    inline-block 元素错位成因剖析 在使用 inline-block 元素时,可能会遇到它们错位显示的问题。如代码 demo 所示,当设置了 overflow 属性时,a 标签就会错位下沉,而未设置时却不会。 问题根源: overflow:hidden 属性影响了 inline-block …

    2025年12月24日
    000
  • 如何利用 CSS 选中激活标签并影响相邻元素的样式?

    如何利用 css 选中激活标签并影响相邻元素? 为了实现激活标签影响相邻元素的样式需求,可以通过 :has 选择器来实现。以下是如何具体操作: 对于激活标签相邻后的元素,可以在 css 中使用以下代码进行设置: li:has(+li.active) { border-radius: 0 0 10px…

    2025年12月24日
    100
  • 为什么我的 CSS 元素放大效果无法正常生效?

    css 设置元素放大效果的疑问解答 原提问者在尝试给元素添加 10em 字体大小和过渡效果后,未能在进入页面时看到放大效果。探究发现,原提问者将 CSS 代码直接写在页面中,导致放大效果无法触发。 解决办法如下: 将 CSS 样式写在一个单独的文件中,并使用 标签引入该样式文件。这个操作与原提问者观…

    2025年12月24日
    000
  • 如何模拟Windows 10 设置界面中的鼠标悬浮放大效果?

    win10设置界面的鼠标移动显示周边的样式(探照灯效果)的实现方式 在windows设置界面的鼠标悬浮效果中,光标周围会显示一个放大区域。在前端开发中,可以通过多种方式实现类似的效果。 使用css 使用css的transform和box-shadow属性。通过将transform: scale(1.…

    2025年12月24日
    200
  • 为什么我的 em 和 transition 设置后元素没有放大?

    元素设置 em 和 transition 后不放大 一个 youtube 视频中展示了设置 em 和 transition 的元素在页面加载后会放大,但同样的代码在提问者电脑上没有达到预期效果。 可能原因: 问题在于 css 代码的位置。在视频中,css 被放置在单独的文件中并通过 link 标签引…

    2025年12月24日
    100

发表回复

登录后才能评论
关注微信