随着现代分析化学分析手段的仪器化和分析对象的复杂化, 得到的仪器分析信号日益复杂, 且其中包含的有用信息也日益丰富, 对此类仪器分析信号进行解析以提取出最大量的有用信息就成为化学计量学研究的重要目标[1]。根据分析信号的数据类型, 通常可分作标量类型数据、矢量类型数据、矩阵类型数据以及张量类型数据。显然, 维数越高的数据类型其所蕴含的信息量越丰富, 进而可以用于解析的分析化学体系的复杂性也越高。依据分析体系复杂性及分析要求的不同, 文献[1]将复杂的多组分分析体系形象地划分为白、灰以及黑3类。其中, 灰色分析体系的基本特征为:已知待测物存在于待分析的样本中, 但是否存在别的未知干扰是不明确的, 分析的目的是在未知干扰存在的情况下, 直接对待测物进行定量分析。此类分析体系是分析化学工作者遇到的频率最高的一类体系。
对于灰色分析体系的多元校正方法, 一般分为矢量校正方法和矩阵校正方法。由于在没有较强的先决条件的情况下, 矢量校正方法只能给出可能解, 因此具有一定的局限性。矩阵校正方法中比较著名的有秩消失因子分析法(RAFA)[2]、残差双线性分解法(RBL)[3]和约束背景双线性分解法[4, 5]。在通常状况下, 这些方法都可以对待测组分进行快速准确的定量, 给出具有物理意义的唯一解。但文献[1]指出上述矩阵校正方法存在两大缺陷:1.若无法做到对于某一矩阵的秩的正确估计, 则上述矩阵校正方法可能无法得到准确的唯一解; 2.对于色谱过程所产生的数据, 若组分保留时间的重现性较差, 则也可能给上述方法的运用带来困难。
作为一种常用的仪器分析方法, 色谱方法在现代分析化学中占有重要地位。但在实际色谱样品中常含有结构、性质相似的组分, 如同系物、同分异构体、化合物及其衍生物等, 这些物质在流动相和固定相中的保留行为差异不大, 往往导致色谱峰的重叠。另外, 在复杂多组分体系中, 常含有未知杂质的干扰, 而现代分析化学的主要任务之一就是对复杂多组分体系进行定性定量分析。但要实现理想的色谱分离过程, 即使在采用计算机方法模拟及优化色谱分离过程的情况下[6], 通常仍是一项费时费力的工作。因此, 发展针对色谱灰色分析体系的多元校正方法尤为重要。另一方面, 色谱条件难于控制, 可能使组分保留时间的重现性较差[7]。文献[5]虽采用遗传算法(GA)优化的约束背景双线性分解算法(CBBL)研究了HPLC灰色分析体系的多元校正问题, 但并未涉及组分保留时间重现性不佳时该方法的适用性问题。另外, 近年来关于多元校正与分辨方法的文献报道[8-13]中也未见对此问题的探讨。
综上所述, 本文拟对CBBL方法予以发展, 使其能够适用于组分保留时间重现性不佳的HPLC灰色分析体系的多元校正问题。
该算法的详细过程见文献[4], 在此仅给出其概略。所谓二维数据的“双线性”[4]是指纯组分所得数据矩阵的秩为1, 即该数据矩阵X可表示为两个矢量(在本文中, 所有矢量如无特别说明均为列矢量)的乘积形式。
式(1) 中, t表示液相色谱的色谱流出曲线, pt表示HPLC-二极管阵列检测器(DAD)所记录的该组分的标准光谱。
灰色分析体系的数学模型可表示为:
式(2) 中, Y为体系的总响应矩阵, R为体系的背景干扰矩阵(在计算过程中进行了非负约束), Xi为待测组分i的单位浓度响应矩阵, ci为待测组分浓度, E为量测随机误差矩阵, uj和vjt分别表示R矩阵主成分分析后所得的得分向量和载荷向量。n表示待测组分数, m表示背景干扰矩阵R的秩, 即背景干扰中的未知的纯组分数。m由Y的秩减去待测组分数n求得。从式(2) 可见, 当且仅当待测组分矩阵中各组分的浓度均被正确估计时, 背景干扰矩阵才能用m个主因子完全分解, 此时所估算的随机误差才能与量测误差相当。因此, 由式(1) 和式(2) 所定义的多组分灰色分析体系的多元校正问题就可转化为一个优化问题, 即当估计的随机误差矩阵在统计特征上最接近量测误差矩阵时, 估算所得的各组分浓度ci即可视为待测物的真实浓度的合理估计值。
虽然通常情形下很难准确估计量测误差的统计特征, 但通常假定量测误差服从零均值等方差的正态分布仍可认为是合理的。为了对量测误差的方差给出合理的估计, 本文通过小波变换方法对HPLC-DAD数据进行滤噪处理, 使其随机误差的方差趋近于零。因此, 本文的优化过程采用了下述目标函数:
其中。式(3) 中, E/表示估算的误差矩阵, ekj/表示E/中的元素, ci/表示待测组分i浓度的估计值。k, j表示数据矩阵的行数和列数。
为了提高优化效率, CBBL方法引入了约束条件, 对待测组分的浓度搜索范围进行限制。其约束条件为[5]:
式(4) 中, ,ykj/指Y中最大的元素, xikj/为Xi中的对应元素。
本文采用数值遗传算法[6]优化CBBL方法。组成遗传算法中的“染色体”的“基因”包括各个组分的初始浓度ci以及各组分的初始保留时间ti。引入组分保留时间作为优化参量的目的在于使CBBL方法对于保留时间重现性差的HPLC灰色分析体系也有理想的校正效果。因此, 对于发生保留时间飘移的色谱体系, 引入各组分保留时间ti的实质是使得式(2) 中的Y、Xi、R以及E各项均成为保留时间ti的函数。其含义指:对于一个待测的HPLC二维数据灰色分析体系, 如果相关组分(包括待测组分与干扰组分)的保留时间发生飘移(相对于标准物体系), 那么相对于以标准物组分所采集的上述响应矩阵, 待测体系的上述响应矩阵无疑都至少在保留时间轴上的数据会发生平移, 还由于误差矩阵E的随机特征, 故总响应矩阵Y也必然发生变化。即不仅各组分的浓度, 而且各组分的保留时间ti也成为影响Y的因素。选择遗传算法的适当参数, 可以实现CBBL在上述条件下的全局优化。
另外, 为了克服文献[1]所指出的上述矩阵校正方法的第一大缺陷, 本研究工作中采用了特征值比的方法[14]准确确定了相关矩阵的秩。
本文利用指数修正的高斯色谱峰模型(EMG)[6]模拟了HPLC单峰, 通过EMG模型模拟的色谱峰能够与实际色谱峰的拖尾和不对称性很好地匹配。式(5) 为指数修正的高斯方程:
其中, , 代表积分上限, A为色谱峰的峰面积, tg(g代表高斯色谱峰模型)为色谱峰的保留时间, σg为色谱峰高斯分布的标准偏差, 主要影响峰的拖尾程度, σg参数值越大, 色谱峰的拖尾越严重。τ是呈指数衰减的时间常数, τ/σg主要衡量峰的不对称性, 比值越接近1, 峰的对称性就越好。V表示模拟色谱曲线信号强度, t表示色谱曲线横坐标(即保留时间), x表示高斯函数中的指数项。
在HPLC-DAD系统所产生的二维数据的另一个维度上应是组分的光谱信息, 其模拟表达式如下:
式(6) 中, λ代表波长, S代表模拟光谱信号强度, 其余参数均为非负经验常数, 通过调节各个常数的大小, 可以改变函数S(λ)的取值, 从而实现不同组分的光谱的模拟。结合式(1)、(5) 以及(6), 可模拟出符合“双线性”特征的二维数据。
Waters e2695型HPLC仪、Waters 2998二极管阵列检测器、Empower色谱工作站(Waters科技(上海)有限公司, 美国)。
体系1:对苯二酚(上海迈坤化工有限公司)、间苯二酚(天津化学试剂公司)、苯酚(天津Kermel化学试剂研发中心)、4-硝基苯酚(上海国药集团化学试剂有限公司)和甲醇(洛阳市化学试剂厂)均为分析纯。用甲醇-蒸馏水体积比为58 : 42的色谱级溶液分别配制3种不同浓度的对苯二酚、间苯二酚、苯酚、4-硝基苯酚的纯组分溶液及混合溶液, 其中一种作为标准溶液样品A, 另外两种不同浓度的溶液为样品B和样品C。对苯二酚、苯酚、4-硝基苯酚3种组分为待测组分, 间苯二酚为干扰背景组分。
体系2:对苯二酚、间苯二酚、邻苯二酚、苯酚、3-硝基苯酚(上海国药集团化学试剂有限公司)、4-硝基苯酚、甲醇均为分析纯。配制甲醇-水体积比为61 : 39的色谱级溶液, 用此溶液分别配制3种不同浓度的对苯二酚、间苯二酚、邻苯二酚、苯酚、4-硝基苯酚、3-硝基苯酚的纯组分溶液及混合溶液, 其中一种作为标准溶液样品A, 另外两种不同浓度的溶液为样品B和样品C。其中, 对苯二酚、邻苯二酚、苯酚、3-硝基苯酚、4-硝基苯酚5种组分为待测组分, 间苯二酚为干扰背景组分。
体系1的色谱柱为Gemini C18(250 mm×4.6 mm, 10 μm)柱。流动相:甲醇-水(体积比为58 : 42)。流速:1.0 mL/min。柱温:35 ℃。检测波长:200~400 nm。进样量:50 μL。进样次数:每个样品进样3次。
体系2的色谱柱为Gemini C18(250 mm×4.6 mm, 10 μm)柱。流动相:甲醇-水(体积比为61 : 39)。流速:1.2 mL/min。柱温:35 ℃。检测波长:200~400 nm。进样量:50 μL。进样次数:每个样品进样3次。
为了验证方法的有效性, 首先考察方法对模拟体系的适用性。为此, 本文模拟了四组分色谱体系。模拟所得单组分以及四组分三维标准谱图见图 1。混合物的总响应矩阵通过各组分模拟响应矩阵相加构成。为更逼真地模拟实际色谱体系, 在待测模拟谱图中加入了服从正态分布的零均值等方差的随机误差。对应于标准谱图的混合物样品标识为A。为模拟出浓度及保留时间均发生变化的待测混合物体系, 将每种模拟组分的浓度与所对应模拟峰的面积设定为特定比例, 同时使各组分的保留时间产生随机偏移, 保留时间的约束范围为(ti±0.5) min, 依据以上原则, 模拟出待测混合样本体系B与C。
在混合体系的a、b、c、d 4种纯组分中, b为背景干扰组分, a、c、d为待测组分。在进行CBBL方法的GA优化校正之前, 首先采用小波变换方法抑制B与C混合体系三维色谱数据中的随机误差。表 1与表 2为优化校正的结果。结果表明, 即使在模拟组分的浓度与保留时间均发生较大变化的情形下, 所建议的校正方法仍可得到较理想的结果。待测组分与干扰组分的浓度与保留时间均得到了较为准确地估计(相对误差绝对值小于3%)。
为了与本文所建议的方法进行比较, 经典CBBL方法的校正结果也于表 3中给出。由于各响应矩阵的保留时间的高度重现性, 经典的CBBL方法对于标准混合溶液的校正结果几乎是理想的。而对于待测混合体系, 由于响应矩阵的保留时间发生了飘移, 校正结果的准确度与表 1相比显著变差。这一结果验证了文献[1]对于经典矩阵校正方法局限性的结论。另外, 经典CBBL方法不涉及组分保留时间的校正, 也不要求计算干扰组分(甚至干扰组分的定性信息可能也是未知的)的浓度。
在对模拟数据取得成功的基础上, 本文拟将所建议的方法推广到实验体系, 分别以四组分体系(体系1) 与六组分体系(体系2) 作为考察对象。
对于该体系, 同样采集视为标准的各个纯组分以及混合体系的三维色谱图, 该系列记为A, 所得谱图见图 2。同样配制待分析混合体系B与C, B、C与A含有相同的组成, 但各个组分的浓度不同, 保留时间也发生了随机飘移。经过对待测混合体系B与C的三维谱图采用小波变换滤除随机误差之后, GA优化的CBBL方法校正后的混合体系B与C的各组分浓度及保留时间分别见表 4和表 5。结果表明, 在实验体系1中, 即使在相关组分的浓度与保留时间均发生较大变化的情形下, 所建议的校正方法仍可得到较理想的结果。在体系1中, 待测组分与干扰组分的浓度与保留时间均得到了较为准确地估计(相对误差绝对值小于5%)。
对于体系1, 为了与本文所建议的方法进行比较, 经典CBBL方法的校正结果也于表 6中给出。对比表 4与表 6可知, 经典CBBL方法对于保留时间发生较大飘移的实验体系, 其校正结果显著变差。
另外, 本文也考察了RAFA和RBL两种经典矩阵校正方法对于体系1的校正结果(见表 7和表 8)。结果表明, 经典的RAFA与RBL方法也只能对保留时间重现性较好的体系(A溶液)给出准确度较高的校正结果。与此类经典方法相比, 本文所建议的方法也具有优势。
本部分对体系2也采用上述优化策略进行了多元校正研究。图 3为体系2的混合体系的标准三维色谱图(标记为样品A)。待测试样品分别标记为B与C。其多元校正的结果见表 9和表 10。结果表明, 在实验体系2中, 即使在相关组分的浓度与保留时间均发生较大变化的情形下, 所建议的校正方法也可得到较理想的结果。在体系2中, 待测组分与干扰组分的浓度与保留时间均得到了较为准确地估计(相对误差绝对值小于10%)。
表 11为体系2经典CBBL方法的校正结果。对于体系2, 对比表 9与表 11的结果表明, 经典CBBL方法对于保留时间发生较大飘移的实验体系, 其校正结果显著变差。
RAFA和RBL校正方法的校正结果分别在表 12和表 13中给出。结果同样表明经典的RAFA与RBL方法只能对保留时间重现性较好的体系(A溶液)给出准确度较高的校正结果。与此类经典方法相比, 本文所建议的方法对于体系2的多元校正也具有优势。
本文力图改善约束背景双线性分解算法对二维双线性HPLC灰色分析体系的校正适用性, 以使其在组分保留时间的重现性低的情况下, 仍可以同时对待测组分的浓度和保留时间进行准确定量校正。本文通过模拟数据及两组实验数据验证了所建议方法的有效性。因此, 本文所建议的方法有效提高了HPLC方法灰色分析体系的CBBL校正方法的准确性, 对于改善矩阵校正方法在色谱灰色分析体系的适用性具有重要启发意义。