频数分析

所属分类:描述性分析

这个方法是做什么的

把一个或几个变量的取值逐一点清楚:每个选项出现多少次、占有效样本的百分之几、累计到多少,并给每个占比配一个 Wilson 95% 置信区间。多个变量一次放进来,输出是并排的几段三线表,各自独立计数——它不看变量之间的关系,只回答“这一列是怎么分布的”。

它不设原假设、不做拟合优度检验,所以表里的百分比是样本里的实际比例,不带“显著”二字;占比的置信区间刻画的是“用样本比例估计总体比例”的抽样不确定性,不是任何检验的结果。卡④ 本该放效应量的位置换成了集中度指标:众数占比、HHI、Shannon 熵与归一化熵、辛普森多样性、Berger-Parker 指数,再按归一化熵分四档判定分布有多不均匀。

需要准备什么数据

  • 放入需要分析的变量:至少 1 个

数据要求

  • 数据表至少 5 行。
  • 单列缺失率不超过 80%。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

什么时候用它

  • 问卷单选题的选项分布,以及学历、地区、渠道这类定类或定序变量的构成
  • 抽样调查要报告类别占比及其抽样误差(用卡② 的 Wilson 区间)
  • 建模前检查分类目标变量是否严重不均衡,小类别还剩几个人
  • 数据清洗时排查异常取值:把某一列的全部取值摊开,错别字、多余空格、混进来的编码会直接显形

最适合定类与定序变量。连续型定量变量若取值几乎两两不同,频数表会退化成一份原始数据清单,此时应先在“数据标签”或“公式”里分箱。类别数超过 50 时表格与图形都会失去可读性,建议先归并小类。缺失值按变量逐列剔除,因此不同变量的有效 N 可以不同,百分比一律以各变量自身的有效 N 为分母。

什么时候不要用它

  • 变量是定量连续的,你要的是均值、标准差与分位数:用「描述性统计」;只想先看整张表每一列长什么样,用「数据概览」。
  • 想知道分布是否显著偏离均匀或某个理论比例:本模块只描述、不检验,用「卡方拟合优度检验」。
  • 要看两个分类变量之间的关系:一个行变量对多个列变量批量扫描用「列联(交叉)分析」;只做一对且要逐格的期望频数证据,用「卡方检验」。
  • 要按组拆开看定量变量的均值:用「分类汇总」。
  • 是多选题(一个人可以选多个选项,答案分散在多列):本模块按行逐一计数,处理不了这种结构,用「多选分析」;多选题与单选题交叉用「交叉分析【多选&单选】」。
  • 想知道某个类别少到会不会影响后续建模:本模块只报占比,用「样本均衡诊断」。

容易误读的地方

  • 累计百分比是按选项标签排序累加的,对定序变量往往排错。 排序规则是标签本身的字符顺序,不是频数、更不是等级语义。示例里“满意度等级”被排成 一般 / 不满意 / 满意 / 非常不满意 / 非常满意,于是“累计到满意 = 70.00%”只是前三行相加,读不出“七成人的满意度在满意及以下”这层意思。无序的定类变量(地区、渠道)这一列直接忽略即可;定序变量要用累计百分比,得先在“数据标签”里把选项改成能按顺序排列的写法(如 1-非常不满意 …… 5-非常满意)。
  • 占比的置信区间不能拿来做类别之间的两两比较。 它回答的是“这一类在总体中占多少”,不是“这一类和那一类是否不同”。而且同一个变量各类别的占比来自同一批人、加起来必须等于 100%,彼此天然负相关,把两个区间摆在一起看重不重叠并不构成检验。示例里“非常不满意”只有 1 人,区间宽到 [0.12%, 3.68%]——这提示的是该类别样本太少、估计不稳,而不是它显著小于别的类别。要检验请用「卡方拟合优度检验」。
  • 百分比的分母是各变量自己的有效 N,不是总样本量。 缺失按列剔除,三个变量可以有三个不同的分母。缺失率高的变量,它的类别占比只代表“回答了这道题的人”的构成,不能外推到全体样本——把 20% 拒答者的那道题当成全样本的构成比,是问卷报告里最常见的错误。写报告时必须同时给频数与百分比,并说明分母口径。
  • 跨变量比较集中度只能看归一化熵。 HHI 与 Shannon 熵都随类别数 k 变化:k 类完全均匀时 HHI 恰好等于 1/k,所以一个分得很细但相当集中的变量,原始 HHI 照样可能低于一个只有三类的均匀变量。归一化熵已经除以 ln k,示例里 4 类的“学历层次”是 0.9999、5 类的“满意度等级”是 0.7653,这两个数才可以直接比。另外那四档阈值是经验参考而非统计检验,论文里不能写成“经检验分布高度集中”。
  • 把连续变量拖进来,得到的“分布接近均匀”是同义反复。 本模块不做任何分箱,按取值逐一计数:150 行数据里若某个收入变量有 148 个互不相同的取值,输出就是近 150 行、几乎每行频数都是 1、占比 0.67%,归一化熵随之逼近 1,判定栏于是写“分布接近均匀”。这句话的全部含义只是“几乎每个值都只出现了一次”,不含任何关于收入分布的信息。
  • “众数占比 43.33%”不等于“多数人选了它”。 众数只是出现次数最多的那一类,占比完全可以远低于一半——示例中过半的人并没有选“满意”。同理,“分布接近均匀”是对整体形状的描述,不意味着任意两类在总体中的占比相等。

报告里有什么

  1. 输出结果一:样本量与前提检验
  2. 输出结果二:频数-百分比三线表
  3. 输出结果三:频数分布可视化
  4. 输出结果四:集中度指标(众数占比 / HHI / 熵)
  5. 输出结果五:结论与解读
freq_analysis
图1
freq_analysis
图2
freq_analysis
图3
上图可视化展示各选项的分布情况,便于快速比较。

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程