全因子设计
这个方法是做什么的
不读数据表,只按两个控件生成试验方案:因子数 k(2–6)与每因子水平数 L(2–5)。它把所有因子的全部水平组合枚举一遍,共 N = L^k 次试验,输出一张可以直接打印去排产的安排表。它的价值在于无别名:所有组合都真的做到,因此从主效应一直到 k 阶交互,全部效应都能无混杂地独立估计,不需要任何“高阶交互可忽略”的假定。
报告共五张卡:设计参数与自由度预算、设计矩阵(含一列“建议实施顺序”的随机排列)、设计空间投影与水平频次图、代数评价指标、实施步骤与后续分析路径。第四张卡给出正交性(主效应列两两相关 max|r|)、分辨率、D-效率、G-效率、模型项 VIF,以及一张“可估计效应与自由度分配”表,把 N−1 个自由度按 C(k,m)(L−1)^m 逐阶摊开。注意这些全是设计矩阵的代数性质,表注写得很明确:设计尚未实施、没有观测响应,因而不存在 p 值、效应量与置信区间。
什么时候用它
- 因子不多(2~4 个),而交互作用必须给出定量估计,不能靠假定绕过
- 后续准备做含交互项的方差分析,需要一张完全没有别名的安排表
- 因子是定类的(催化剂品种、供应商、机台),谈不上“曲率”,只能逐组合枚举
- 想给别的设计找一个参照系:其它设计模块的“相对 D-效率”都以同因子数的 3^k 全因子为基准
前提是试验次数你付得起。N = L^k 是指数增长,实测:k=2、L=2 需 4 次;k=3、L=2 需 8 次;k=4、L=2 需 16 次;k=6、L=2 需 64 次。水平一加到 3,k=3 就要 27 次、k=4 要 81 次;k=5、L=4 已经是 1024 次,参数上限 k=6、L=5 对应 15625 次。本模块本身不含重复试验,每个组合各做一次;要拿到纯误差估计,须自行对组合重复测量。
什么时候不要用它
- 因子多于 4 个,而你只想排出谁重要:用「正交设计」,它以部分实施换次数。
- 因子多、水平也多,预算只够十几次试验:用「均匀设计」。
- 因子是定量的,目标是找最优工艺点而不是检验效应:全因子只在你选的那几档上取值,最优点只能从这几档里挑。用「中心复合设计(CCD)」或「Box-Behnken设计」排点,取得响应后用「响应面分析(RSM)」在连续区域内寻优。
- 所有因子同时取极端的那些角点在工艺上危险或做不出来:用「Box-Behnken设计」,它天然不含 (±1,…,±1) 角点。
- 试验已经做完、手上是响应数据:本模块只生成方案。快速排因素主次用「极差分析」,要 F 与 p 用「多因素方差分析」。
容易误读的地方
- 两个控件都会把次数推上去,但代价不对称,动手前先把两条路都按 N=L^k 算一遍。 因子每加 1 个,次数乘 L 倍;水平每加 1 档,次数乘 ((L+1)/L)^k 倍。L 小的时候后者凶得多:实测 k=6 时 L=2 只要 64 次,L=5 就是 15625 次(参数上限)。可 L 已经很大时又反过来——L=5、k=6 时砍掉一个因子是除以 5,砍掉一档水平只除以约 3.8。凭感觉砍很容易砍错方向。
- 第四张卡的 D-效率不能跨水平数比较,因为 L 变了它就换了模型。 实测 k=3、L=2 时 D-效率 1.0000,k=3、L=3 只有 0.4421。这不是设计变差了:卡① 表注写明,L=2 时平方项恒为常数、无法估计弯曲,报告按“主效应 + 两因子交互”模型评价(p=7);L≥3 才切到含平方项的二阶模型(p=10)。同一列数字底下是两个不同的模型,比大小没有意义。
- “全部效应都可估计”不等于你估得动,无重复全因子的误差自由度是 0。 卡④ 把 N−1 全部分配给各阶效应:k=3、L=2 时 7 个自由度分给 3 个主效应、3 个二阶交互、1 个三阶交互,一个不剩;k=3、L=3 时 26 个自由度里,光三阶交互一项就吃掉 8 个。报告的结论文案写明纯误差自由度 0(无重复试验),因此无法做失拟检验。要得到 p 值,要么对组合重复测量,要么把高阶交互并入误差项——后者是一个假定,不是免费的。
- “建议实施顺序”那一列不是装饰。 表注说明它是对全部试验的一个随机排列(同参数下可复现)。按试验号从上往下做,等于让“第几天做的”与因子水平同步变化,时间趋势、原料批次漂移就与因子效应混杂在一起;而这种混杂在事后的方差分析里看不出来,没有任何检验能把它揪出来。
- 编码 −1/+1 只是位置标记,水平跨度是你定的,它直接决定结论。 卡⑤ 第 1 步写明:跨度过窄会被噪声淹没,过宽则可能超出线性/二阶可近似的范围。报告里的正交性、D-效率、自由度分配全部只是矩阵的代数性质,对你把 −1 定成 60℃ 还是 20℃ 一无所知,也不会因此给出任何警告。
- 不要把设计评价当成分析结论。 卡④ 的判定列写的是“严格正交”“全分辨(无混杂)”“D-效率达到理论上界 1”这类话,读起来很像好消息,但它们对合法参数几乎总是通过——表注专门解释过,列出它们是为了给出可核验的实测数字,而不是制造悬念。哪个因子真的有影响,要等试验做完、把响应数据交给分析模块之后才有答案。