描述性统计

描述性统计

所属分类:描述性分析

这个方法是做什么的

把一批数值变量的基本面一次摆清楚:样本量与缺失、集中趋势(均值、中位数)、离散程度(标准差、四分位距、变异系数)、分布形态(偏度、峰度)、百分位数,以及按 1.5 倍四分位距规则识别出的离群观测。

它不做任何假设检验,所以没有「显著 / 不显著」的结论。报告里出现的正态性检验只是分布体检,用来提示你该报均值还是中位数。

什么时候用它

  • 拿到数据的第一步:看清楚每个变量长什么样、缺了多少、有没有离谱的取值
  • 论文里的样本特征表
  • 在决定后续用参数还是非参数方法之前的摸底

什么时候不要用它

  • 需要分组对比(男 vs 女、各门店):用「分类汇总」,或者直接做相应的差异检验。
  • 变量是分类或等级:用「频数分析」或「列联(交叉)分析」。对分类编码算均值没有意义——「性别均值 1.47」不是一个有含义的数。
  • 想弄清缺失是怎么产生的:本模块只报缺失比例,不做缺失机制的分析。

容易误读的地方

  • 均值的 95% 置信区间不是「95% 的个体落在这个范围内」。 它描述的是总体均值的不确定性,样本越大它越窄——样本到十万时它可能只有零点几个单位宽,而个体取值照样散得很开。要描述「个体大致落在哪个范围」,看第四张卡的 P2.5~P97.5,那个区间不随样本量收窄。这两个区间被混用,是描述统计里最常见的错误。
  • 置信区间也不是「真值有 95% 的概率落在里面」。 严格的说法是:这套计算程序在反复抽样中,有 95% 的时候产生的区间会罩住真正的总体均值。对手上这一个具体区间而言,它要么罩住了、要么没罩住,不存在概率。口头沟通可以松一点,写进论文时不要写成前一种表述。
  • 偏态数据报「均值±标准差」会误导。 月收入这类右偏变量,少数高收入者会把均值拉到远高于大多数人的水平,此时均值代表不了「典型的人」,应该报中位数与四分位距。第四张卡的形态判定会直接告诉你哪些变量显著偏态。
  • 落在 1.5 倍四分位距栅栏外的点不等于「错误数据」。 那只是画箱线图的一条约定俗成的规则;右偏分布里天然就会有一批点落在栅栏外。删不删要看它是不是录入错误、或者根本不属于你的研究总体,不能因为被标出来就删——随手删掉等于人为把分布削成正态,后面所有分析都跟着失真。

数据要求

  • 数据表至少 3 行。
  • 本方法允许所选变量含缺失值——缺失本身就是分析对象的一部分,不会因为「完整记录不够」被拦下。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

报告里有什么

  1. 输出结果一:样本量与缺失概览
  2. 输出结果二:描述统计三线表
  3. 输出结果三:分布可视化(直方图与箱线图)
  4. 输出结果四:分布形态指标
  5. 输出结果五:结论与解读

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程