方差分析和回归分析都是数理统计中经常使用的数据处理方法[1, 2]。前者得到的是自变量(因素)对总量Y是否具有显著影响的整体判断,无法对它们之间存在的显著性关系做出具体的回答;后者不仅能得到在不独立的情况下自变量与因变量之间的更加精确的回归函数关系式[3],还能通过R2检验、F检验和t检验来验证回归模型的拟合度及自变量与因变量之间的显著关系,非常适合连续性变量数据的处理。回归正交试验设计[4, 5]即正交试验设计与回归分析的有机结合。它结合了正交试验法的“正交性”特点(即均衡分散性与整齐可比性原理)和回归分析法中的最小二乘法原理,弥补了正交试验法只能在已定水平而不能在一定试验范围内得到最优方案和回归分析法只能对试验数据进行被动处理与分析的缺点。以较少的试验次数建立起一个精度高、统计性质好的函数表达式,从而定量地描述各因素对优化指标的影响,并可根据自变量在预测范围内的变化来预测因变量和利用微分学求偏导[6]、规划求解[7, 8]、Levenberg-Marquardt算法[9]等方法实现试验条件的最优化。被广泛应用于医药、化工、环保、食品、农林业、冶金和航空等领域[10, 11, 12, 13, 14, 15, 16, 17]。
实际工作中,色谱工作者大多都具备使用回归正交试验设计建立回归模型的能力,但如何用其实现色谱分离条件的最优化成为难题。其原因是用于评价色谱分离质量的指标(或称函数)由衡量某两个峰分离情况的多个基本指标构成[18],即是一个综合性优化指标。目前还没有能够实现综合性优化指标最优化的方法。从达世禄等[19]的色谱学著作中获知气相、液相(反相、正相、手性等)色谱的分离条件与分离效果之间存在相关关系,且这些因素都属于连续性变量。因此,建立了回归正交评价指标智能筛选法(regression evaluation index intelligent filter method,REIFM)来解决回归模型中综合性优化指标的最优化问题。
为评价色谱分离质量和度量分离程度,卢佩章等[20]提出了串行色谱响应函数(HCRF),将出峰数目、最难分离物质对和分析时间3个不同因素串联起来综合评价分离效果,克服了常用色谱响应函数(CRF、COF等)的局限性,是谱图分离质量的直观评价。
回归正交试验设计常用的数学模型为一次和二次回归模型[21]。其试验结果(因变量)y与m个试验因素(自变量)x1,x2,…,xm之间的一次回归数学模型为:
因回归模型是关于因变量与自变量回归关系的一个函数,色谱优化指标是由多个基本指标组成的另一个函数,故利用色谱优化指标建立的回归模型采用常规求解方法难以实现最优化。若要实现试验结果的最优化,必须先在预测区间内对回归模型求解,再对色谱优化指标中的基本指标分别进行筛选优化,最终获得最优方案。故通过编程软件设计了针对综合性优化指标(以HCRF为例)的智能筛选程序(见图1),其基本原理为:首先,选择合适的自变量预测区间,利用回归模型求出所有解,并建立一个包含所有解的矩阵 Z ;其次,将矩阵 Z 分割为3个分别关于出峰数目n、最难分离物质对分离度Rmin和最后流出组分保留时间T的新矩阵 Z1、 Z2和 Z3;然后,利用筛选条件1(n)、2(R)和3(T)分别对3个新矩阵进行筛选得到初选结果,再利用筛选条件4(梯度时间,tG,min)对初筛结果进一步筛选得到终选结果;最后,通过HPLC实验验证,n、Rmin、T和信噪比(S/N)等信息,筛选出出峰完全、分离度好、灵敏度高且分析时间短的最佳色谱条件。
色谱分离条件的优化目的即是要在保证分离度和灵敏度的前提下实现快速分析[22],可见最优的色谱分离条件必须同时考虑出峰数目、分离度、灵敏度和分析时间4个因素。
出峰数目即所有待测目标化合物的总个数(如:测定16种多环芳烃,n=16)。而分离度通常选择R=1.5作为相邻两峰完全分离的标准[23],当R=1.0时基本达到分离,分离效果98.0% ; R=1.5时达到全分离(基线分离),分离效果99.7% ; R=2.0时实现充分完全分离,分离效果99.9% 。同时为缩短分析时间可将分离度控制在1.5<Rmin<2.0。
分析时间的选择原则是在保证待测组分完全分离且所有组分都流出色谱柱的前提下,分析时间越短越好。一般情况下,不同项目的分析时间可以通过前期实验摸索或查阅相关文献做参考,而复杂样品为取得较好的分离效果就需要采用梯度洗脱或程序升温进行分离。此时,可以通过计算梯度时间或组分保留时间来选择恰当的分析时间。通常高效液相色谱法分析一个复杂样品的时间为15~30 min[24],而气相色谱法由于气体迁移速率高,分析速度快,一般几分钟可完成一个分析周期[19]。
梯度时间的计算公式如下[25, 26]:
组分保留时间计算公式如下[19]:
对于灵敏度,在分析测试方法研究中主要使用信噪比、检出限或定量限来评价。其中信噪比是其评价的核心指标,因为检出限和定量限通常用信噪比为2~3和10的量来定义[27]。因此,在其他指标都达到分析要求的情况下,应尽量选择灵敏度较高的色谱分离条件作为最佳色谱条件,即回归模型的最优解。
Agilent 1100高效液相色谱仪(美国Agilent); Agilent Pursuit 5 PAH (250 mm×4.6 mm)液相色谱柱(美国Agilent); SPSS 19.0软件(美国IBM); MATLAB R2012a软件(美国MathWorks);农残级乙腈(韩国DUKSAN);超纯水(美国Millipore); EPA 610 PAH Mix(100~2 000 mg/L)(美国SUPELCO)。
回归正交试验影响因素及因素水平编码 以梯度初始浓度x1、梯度初始斜率x2、梯度初始时间x3为考察因素,每个因素设计2个水平(见表1)。
将因素xj的各水平进行线性变换即[21]:
回归正交试验表头设计 试验除了考察x1、x2、x3的主效应外,还考察x1与x2、x1与x3、x2与x3的二级交互作用。由各项自由度之和为6,选用L8(27)来进行实验设计:首先,将主效应x1、x2、x3分别安排在第1、2和4列(即z1、z2、z3安排在第1、2和4列上);其次,将交互作用x1x2、x1x3、x2x3(即z1z2、z1z3和z2z3)分别安排在第3、5和6列上;然后,将剩下的一个空列7作为误差列;最后,每号试验的方案由z1、z2、z3对应的水平确定。
试验确定以梯度初始浓度x1为40% ~80%和梯度初始时间x3为0~40 min作为预测范围,包含的所有解个数为 1 681 个(见图2);筛选条件1为n=16;筛选条件2为1.5≤Rmin≤2.0;期望分析时间T为15~25 min,即筛选条件3为15≤T≤25 min;筛选条件4为tG≤T(tG由公式(6)计算)。最优解智能筛选程序根据上述原理及条件,利用MATLAB软件编写而成。
将16种多环芳烃混合标准溶液准确配制成100 μ g/L(以蒽为例)的标准溶液,流速1.5 mL/min、柱温30 ℃、紫外波长254 nm,取15.00 μ L注入高效液相色谱仪,按试验安排进行实验。
回归正交试验设计方案与实验结果见表3,利用SPSS软件对实验结果进行回归分析。
采用“Enter”法引入6个自变量,建立了2个回归模型即模型1(z1z3,z3,z1)和模型2(z2z3,z1z2,z2)。从表4可以看出,回归模型1和2的相关系数R分别为0.996和0.999,判定系数R2分别为0.993和0.998。R2接近1说明回归直线的拟合度高且两个回归模型的拟合优度较好。
由方差分析结果(见表5)可知,模型1的F值为177.488,Sig.=0.000(<0.001),表明模型1回归极显著且回归效果好;模型2的F值为86.036,Sig.=0.082(>0.05),表明回归效果较差。
由t检验结果(见表6)可知,模型1的Sig.=0.000(<0.001),表明该模型具有显著回归意义;模型2的Sig.>0.01,且存在3个不具回归意义的自变量(z2、z1z2和z2z3),表明该模型回归意义不显著;由容差和VIF值可知各自变量之间的共线性弱。
结合上述检验结果,选取拟合度高、显著性明显的模型1建立一次回归数学模型:
根据编码公式z1=(x1-60)/10和z3=(x3-7.5)/2.5,将上述回归方程进行回代并整理得:
对筛选结果的HPLC实验验证结果见表7。可以看出:通过智能筛选程序排除了99%以上的干扰,筛选出14个满足要求的优化方案,筛选程序的筛选能力强、筛选速度快;筛选结果与实测结果间的相对偏差较小,回归模型的预测精度高、预测效果理想。充分考虑目标化合物的出峰数目、分离度、灵敏度和分析时间4个参数后,选择了满足筛选条件且灵敏度高的6号方案作为最佳色谱条件,即梯度初始浓度x1为49%和梯度初始时间x3为10.0 min(见图3)。
REIFM也有其局限性,即在分离难分离组分时,可能得不到优化结果,或者优化结果的分离时间很长。但从对多环芳烃的优化结果来看:16种多环芳烃中的所有难分离组分(如:苯并[a]蒽和 屈 艹 、苯并[k]荧蒽和苝、茚并[1,2,3-cd]芘和二苯并[a,h]蒽等)均达到全分离(Rmin=1.86),且分析时间短(T=23.015 min)、灵敏度高(S/Nmin=64.7),优化效果理想。
本文提出的回归正交评价指标智能筛选法为系统全面优化色谱条件的寻优方法,适用于所有采用综合性优化指标并能建立回归模型的色谱条件优化。通过该法对多环芳烃出峰数目、分离度、灵敏度和分析时间的综合优化,取得了满意的分离效果。
梯度时间的计算公式如下[25, 26]: ...