Hotelling T²多元控制图

所属分类:质量控制

这个方法是做什么的

把多个相关的质量特性合成一个数来监控。每一行是同一件产品或同一时点的一组多元观测,模块算出它到多元中心的马氏距离平方 T²ᵢ=(xᵢ−x̄)′S⁻¹(xᵢ−x̄),把这一列 T² 画成控制图。马氏距离已经按协方差结构标准化,因此它不仅看每个变量偏了多少,还看变量之间的相关关系有没有被破坏——这是分别作若干张单变量控制图做不到的事。控制限用相位 I 的 Beta 型:T² 的数学上界是 (m−1)²/m,UCL 取该上界乘以 Beta(p/2,(m−p−1)/2) 的 1−α 分位数(α=0.0027);T² 恒非负,故 LCL=0。

因为“把 p 维压成一个数”既是优点也是代价,报告在两端各做了一层功课。前端(卡①)验证“该不该用 T²”:各变量的 Shapiro-Wilk 边缘正态、Mardia 多元偏度与峰度检验、Bartlett 球形度检验(变量彼此独立时 T² 没有信息增益)、相关矩阵的 VIF 与条件数(严重共线会让 S⁻¹ 不稳)、以及 m/p 比和 m≥p+2 的可行性条件。后端(卡④)把报警的 T² 拆回各质量特性:给每个失控观测逐变量的 z 值、z² 占 Σz² 的贡献比、单变量 p 与 Bonferroni 校正 p,用来定位责任变量。本图不给 Nelson 或西部电气判异准则表。

需要准备什么数据

  • 放入[定量]质量特性列:至少 2 个,定量变量(数值)

数据要求

  • 数据表至少 20 行。
  • 单列缺失率不超过 10%。
  • 不接受取值全都一样的列(零方差列没有可分析的变异)。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

什么时候用它

  • 同一件产品有若干个彼此相关的质量特性(长宽高、多个成分含量、多路传感器读数)
  • 分别作单变量图时误报率会累积:p 张 3σ 图并用,整体误报率明显高于单张图的 0.27%
  • 怀疑问题出在“变量之间的配合关系”上,而不是某个变量单独越界
  • 需要对一批历史数据做回顾性筛查,找出应当剔除的异常观测再建立基准

前提:至少 2 个定量质量特性,且它们之间确有相关性;每行是同一时点的一组完整观测(任一变量缺失即整行剔除,因为 T² 必须在完整的 p 维向量上计算);观测数 m 必须满足 m≥p+2,否则相位 I 的 Beta 控制限无法确定;各列不得为常数、变量间不得完全共线(协方差矩阵会奇异)。数据要求把行数下限定在 20,少于 20 行会被前置校验拦下,实践中还应保证 m 远大于 p,卡①会给出 m/p 比。

什么时候不要用它

  • 只有一个质量特性:直接用「单值-移动极差(I-MR)控制图」,或有子组时用「X-bar/R 控制图」「X-bar/S 控制图」。
  • 各变量之间几乎不相关(卡①的 Bartlett 球形度检验不显著):T² 相对分别作图没有信息增益,反而更难解释,拆开用「单值-移动极差(I-MR)控制图」逐个监控。
  • 变量太多或存在严重共线:S⁻¹ 数值不稳会放大个别观测的 T²,先用「主成分分析(PCA)」降到少数几个互不相关的主成分,或先用「VIF共线性诊断」找出并剔除冗余变量。
  • 要比较的是几个组之间的多元均值差异,而不是一条序列的稳定性:用「多变量方差分析」。
  • 只想看变量之间相关有多强:用「Pearson相关性分析」,不必绕道控制图。
  • 数据是计数或比率:T² 的控制限由多元正态假设导出,计数请用「c 图」「u 图」「P 图」或「np 图」。

容易误读的地方

  • 平均 T² 是个代数恒等式,永远等于 p(m−1)/m,拿它诊断等于什么都没说。 相位 I 下 Σᵢ T²ᵢ ≡ p(m−1) 与数据无关,所以演示数据的平均 T²=2.950 换成任何一份数据都是这个值。卡①与卡④都为此加了说明,并改用中位数(受控理论值 2.380,实测 1.881)和离散度(受控理论 SD 2.308,实测 3.587,比值 1.554)来刻画离群格局。看到平均 T² 不高就以为过程正常,是被一个恒等式骗了。
  • 同一个恒等式还意味着各点的 T² 彼此不独立。 总和固定,任一点变大必然伴随其余点变小。卡②那张逐点明细表的表注说明,逐点 p 值由边缘 Beta 分布算得、忽略了这种负相关,因此 Holm 校正后的 p 偏保守、只作参考性判据(Holm 校正 p 那一列也在卡②,不在卡④)。别把校正后的 p 当成精确的多重检验结论。
  • T² 报警时不知道是谁的问题,必须看分解表;而分解表本身也有边界。 卡④的贡献比按 zⱼ² 占 Σzⱼ² 计算,表注明说 Σzⱼ² 只有在变量彼此不相关时才等于 T²,存在相关时二者不等,该表给的是各变量偏离的相对量级而非 T² 的精确可加分解。演示数据第 18 号观测由长度主导(z=3.846,贡献 79.6%),第 42 号由厚度主导(z=3.312,贡献 96.4%),两者都能直接定位到工序。
  • 单变量全部正常、T² 却越限,这才是 T² 真正在报的东西。 卡②的结论文案与卡④表注都点明了这一情形:它说明异常出在变量之间的相关结构上——比如长和宽本该同增同减,某一件却一个变大一个变小,每个都在各自的 3σ 内,配合关系却坏了。这时贡献比会显得平均、没有明显责任变量,报告建议进一步做 MYT 条件分解,该分解产品目前不提供,需要另行计算或从工艺角度排查配合关系。
  • 本报告给的是相位 I 的控制限,直接拿去做在线监控是用错了口径。 相位 I 是回顾性的:绘制的正是用来估计 x̄ 与 S 的同一批观测,所以控制限用 Beta 型。对新观测做实时监控应改用相位 II 的 F 型控制限,本模块不产出。卡⑤给的标准流程是迭代:剔除已查明原因的失控观测 → 重估 x̄ 与 S → 重算控制限,直到剩余观测全部受控,这组参数才可用于后续监控。
  • 多元正态被拒绝时,UCL 的名义误报率就不再是 0.27%。 演示数据 Mardia 多元偏度 A=40.886(p<0.001)、多元峰度 B=5.011(p<0.001)都拒绝了多元正态,卡①的结论文案随即说明控制限的实际误报率会偏离名义值。要注意边缘正态只是必要条件:演示数据里 3 个变量有 2 个通过了 Shapiro-Wilk,联合分布照样被 Mardia 拒绝——只看逐变量正态性检验会得出过于乐观的结论。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:控制限与判异检验(主结果)
  3. 输出结果三:Hotelling T² 控制图可视化
  4. 输出结果四:效应量与事后分析
  5. 输出结果五:结论与解读
Hotelling T² 多元控制图
图1 Hotelling T² 多元控制图
折线为各观测 T²,红色虚线为 UCL,黑色实线为中心线 CL,蓝色虚线为 LCL(=0),红点为失控观测。可用切换器在折线图/柱状图/数据表之间切换。

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程