响应面分析(RSM)
这个方法是做什么的
用一批定量试验因子与一个定量响应拟合二阶模型(截距 + 一次项 + 两两交互项 + 平方项),再在这张曲面上找最优工艺条件。模型在编码尺度上拟合:中心值取实测的 (最大+最小)/2、半步长取 (最大−最小)/2,各因子编码范围恰为 [−1,1],因此各项系数可以直接比大小;报告里的驻点与最优设置都已经还原回原始单位,可以直接对照工艺参数使用。
第二张卡的方差分析把回归拆成序贯平方和(一次项 → 交互项 → 二次项,回答“加交互项、加平方项值不值得”),并把残差拆成失拟与纯误差。第四张卡给 R²、调整 R²、预测 R²(由 PRESS 留一交叉验证算得)、Cohen f²、Adequate Precision 信噪比,以及驻点分析(由二次项矩阵的特征值判极大值、极小值还是鞍点)和试验区域内的盒约束最优设置。第一张卡逐条检验前提:样本量大于参数个数、各因子至少 3 个水平、有无重复点、模型矩阵是否满秩、VIF、最大杠杆、残差正态与同方差。
需要准备什么数据
- 放入[定量]试验因子:至少 2 个,定量变量(数值)
- 放入[定量]响应变量:1 个,定量变量(数值)
数据要求
- 数据表至少 7 行。
- 单列缺失率不超过 20%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 「中心复合设计(CCD)」或「Box-Behnken设计」排的方案做完了,要建模并求最优条件
- 因子全是定量的,且怀疑响应存在弯曲——有一个最优点,而不是越大越好
- 想知道两个因子的最优取值是否相互依赖,这由交互项回答
- 需要论文里那套标准报表:模型 F 检验、失拟检验、R² 系列、最优工艺条件
前提是有效试验点数必须大于二阶模型的参数个数 p = 1+2k+k(k−1)/2——2 因子需超过 6 个点、3 因子超过 10 个、4 因子超过 15 个;每个因子至少要有 3 个不同水平,只有 2 个水平时平方项与常数项完全共线、曲率不可估计;失拟检验还额外要求有重复试验点,通常由中心点重复提供。
什么时候不要用它
- 因子是定类的(催化剂品种):编码值没有连续含义,平方项无意义。用「多因素方差分析」,只想排主次用「极差分析」。
- 试验还没做:本模块只分析数据,方案请先用「中心复合设计(CCD)」「Box-Behnken设计」或「全因子设计」生成。
- 每个因子只做了 2 个水平:曲率不可估计。补做中心点或轴点后重来;只关心线性效应就用「线性回归 (最小二乘法)」。
- 因子多、试验点少,二阶模型撑不起来:先用「均匀设计」或「正交设计」筛掉不重要的因子,或用「逐步回归」只保留少数二阶项。
- 响应是二分类或计数:二阶最小二乘不适用,用「逻辑回归」或「计数数据回归」。
容易误读的地方
- 驻点的性质与你选的优化方向没有关系,两者对不上时最优点必然被推到边界。 同一份演示数据实测:优化方向选“最大化”时,区域最优就是驻点(反应温度 78.7362、反应时间 73.0332);把控件切成“最小化”,驻点那一行仍写着“极大值(maximum)”——它是曲面自身的性质,不随控件变——而区域最优跑到 55.8600 / 38.7900,两个因子都落在实测范围的下界上,说明栏写着“落在试验范围边界上,提示朝该方向扩展试验范围可能更优”。看到边界解,正确反应是扩大试验范围重做一轮,而不是把边界点当成最优工艺。
- 最优点落在因子范围内,不代表预测响应也在合理范围内。 同一次“最小化”实测:最优点预测响应 74.2507,而说明栏并排印着实测响应范围 [77.4820, 89.8790]——预测值比做过的每一次试验都低。因子没有外推,响应却外推了;报告把实测范围印在旁边就是让你做这个对照。验证试验对不上,多半是从这里开始的。
- 失拟检验“未做”不等于模型充分。 第一张卡那一行实测有两种结果:演示数据是“满足,可做失拟检验”(相异组合 9 个、重复观测 17 次),而换成无重复点的设计就变成“不满足——完全没有重复试验点,纯误差不可估计,失拟检验无法开展,本报告不对模型是否失拟作任何断言”。后一种情况下第二张卡的方差分析表里根本没有失拟与纯误差这两行,别把“没有报警”读成“通过了检验”。
- 前提检验里“模型矩阵满秩”那一行必须先看。 实测把产品自己生成的 U11(11³) 均匀设计喂进来,这一行判“秩亏——存在与截距或彼此完全共线的项,其系数不可识别”;同一张表里 VIF 那行印出的是 −34360773006161.28 这种明显不可信的数。秩亏时下面的系数表、驻点与最优点全都不能用,要先减少模型项或换一个设计,而不是照抄结论。
- R² 高只说明这批点拟合得好,证明不了曲面的形状是对的。 演示数据实测 R²=0.9871、调整 R²=0.9838、预测 R²=0.9786,表注给的判据是后两者之差小于 0.2 即视为吻合、无过拟合迹象。但“二阶够不够”由失拟检验回答,“最优点可不可信”由驻点位置加验证试验回答。卡⑤ 说得很直白:二阶响应面只是真实曲面在试验区域内的局部近似,包括最优条件在内的一切结论都只在本次因子范围内成立。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:二阶模型方差分析与系数估计
- 输出结果三:响应曲面与模型诊断可视化
- 输出结果四:效应量与事后分析(响应曲面的驻点与区域最优)
- 输出结果五:结论与学术表述
第一图为响应等高面:颜色表示预测响应大小,横纵轴为因子「反应温度(℃)」「反应时间(min)」(原始单位);第二图按 |t| 降序排列各模型项的标准化效应,红色虚线为 α=0.05 的 t 临界值 t(0.975, 20)=2.086,越过该线的项即达到显著;第三图为残差对预测值的诊断散点。