在尝试理解正态分布图的y值时,我使用以下代码:
%reset -f
import numpy as np
from scipy.stats import norm
import matplotlib.pyplot as plt
data = [10,10,20,40,50,60,70,80,90,100]
# Fit a normal distribution to the data:
mu, std = norm.fit(data)
# Plot the histogram.
plt.hist(data, bins=10, density=True, alpha=0.6, color='g')
# Plot the PDF.
xmin, xmax = plt.xlim()
x = np.linspace(xmin, xmax, 100)
p = norm.pdf(x, mu, std)
plt.plot(x, p, 'k', linewidth=2)
title = "Fit results: mu = %.2f, std = %.2f" % (mu, std)
plt.title(title)
plt.show()要生成此图,请执行以下操作:

数据是一组人的年龄,以年数表示:[10,10,20,40,50,60,70,80,90,100]
如何解释生成的pdf图的y值?例如,播放大约等于0.027的条形应该如何解释?
我已经阅读了各种帖子,例如:
https://stats.stackexchange.com/questions/332984/interpreting-a-pdf-plot
但是找不到详细解释曲线图y轴值的信息。
0.027是年龄在0到大约20之间的概率吗?
发布于 2021-04-01 00:17:11
两个年龄x_0和x_1之间的pdf曲线下的面积表示从X采样的点属于区间x_0,x_1的概率P(x_0 <= X <= x_1),其中X是拟合在数据集上的(正态)随机变量。
对于直方图,每个条形表示一个区间,条形的高度等于属于该区间的样本数,归一化后直方图的仓位的总面积等于1。与pdf曲线类似,仓位的面积给出了随机样本属于由仓位定义的区间的概率的估计。
如果正态分布确实是对随机变量建模的一个很好的选择,那么当你向数据集添加点时,人们会期望直方图和拟合的pdf变得越来越近(对于选定的仓位数)。
https://stackoverflow.com/questions/66888784
复制相似问题