复杂样品分析一直是分析化学研究领域的重点与难点。近年来, 越来越多的研究者选择利用化学计量学手段来解决复杂体系的定性、定量分析问题,如实际分析体系的信息提取[1]、复杂色谱信号的解析[2, 3]等。为解决联用仪器信号的分析问题, 国内外诸多学者已建立了多种化学计量学算法, 如基于化学因子分析(CFA)的一系列算法[1, 4, 5]以及结合二维数据和交替最小二乘法的多元曲线分辨(MCR-ALS)算法[6, 7]。此外, 基于卷积和去卷积的小波变换(WT)也已广泛应用于重叠色谱信号的解析[8, 9]。这些方法可以从多组分重叠信号中提取隐藏的组分信息, 为复杂重叠信号的高通量分析提供新途径。但是, 在有未知干扰存在的情况下, 这些算法往往无法得到正确的解析结果。为解决这一问题, 直接三线性分解(DTD)、平行因子分析(PARAFAC)和交替三线性分解(ATLD)等方法相继出现[10-13]。这些算法具有“二阶优势”, 能够在未知干扰存在的情况下提取重叠信号中的有用信息。
免疫算法(immune algorithm, IA)可用于重叠信号的解析[14-16]。最初采用IA解析气相色谱-质谱(GC-MS)信号时, 需要提供所有组分的质谱信息, 不适于未知体系的解析。为了解决缺乏标准品的问题, 本课题组提出了自适应免疫算法(AIA)[17]。AIA无需提供标准品信息, 而是采用独立成分分析(ICA),直接从测量数据中提取被测物的质谱信息。但是, 某些情况下, 重叠信号不满足独立性要求, 导致AIA得到的质谱数值出现负值, 色谱图出现扭曲, 因此又对ICA进行了一系列的改进, 提出了平均场-独立成分分析(mean field ICA, MF-ICA)[18]、基于化学知识的后旋转策略[19]以及窗口独立成分分析(window ICA, WICA)[20]。尽管这些方法都已成功应用于复杂GC-MS信号的解析, 但是依旧难以实现复杂体系的高通量分析, 因此本课题组建立了非负免疫算法(NNIA)。该算法利用非负校正对IA计算中重叠组分带来的干扰进行补偿, 实现了混合信号中某一组分信息的提取[21]。将NNIA与目标转换因子分析(TTFA)和迭代目标转换因子分析(ITTFA)结合, 可以实现重叠信号中某些特定组分信号的识别与解析[22, 23]。
针对复杂GC-MS信号的解析, 由于样品中包含的组分数较多、信号过于复杂, 上述方法的应用往往受到一定限制。在实际分析中需利用标准样品确定目标组分的洗脱区域, 以简化计算过程, 因而很难实现真正意义上的高通量分析[24]。为解决这一问题, 本文提出了一种重叠GC-MS信号的高通量解析方法。该方法通过建立包含所有可能待测组分的标准质谱库, 利用移动窗口目标转换因子分析(MWTTFA)对标准质谱库中的组分逐一进行测试, 确定目标物质的质谱信息及其色谱保留时间, 进而利用NNIA算法解析得到的色谱信息。
PolarisQ 2000气相色谱-质谱仪(美国ThermoFisher Scientific公司)。17种和42种农药混合标准品溶于丙酮溶液(10 mg/L), 由中国进出口商品检验检疫研究所提供,其详细信息分别见表S1和表S2(详见http://www.chrom-China.com/UserFiles/File/1606046-SI.pdf)。
色谱柱:CP-Sil8CB (30 m×0.32 mm, 0.25 μm, 美国VARIAN公司); 进样口温度:250 ℃; 进样方式:不分流进样。17种农药混合标准品的升温程序:60 ℃保持2 min, 以80 ℃/min升至260 ℃, 保持6 min; 分析时间:10 min; 42种农药混合标准品的升温程序:60 ℃保持1 min, 以100 ℃/min升至300 ℃, 保持4 min; 分析时间:8 min。载气:氦气(纯度>99.999%); 流速:1 mL/min; 进样量:1 μL。离子源:电子轰击(EI)源; 离子源温度:200 ℃; 传输线温度:280 ℃; 电压:70 eV。
17种和42种农药混合标准品的总离子色谱图见图 1。其中扫描范围为m/z 60~520, 采样时间间隔约0.47 s, 数据矩阵大小分别为461×1 010和461×630。由图 1可知,混合标准品的色谱图中多处出现色谱峰重叠现象, 并存在杂质干扰。因此, 需要对此类信号进行解析, 以实现高通量分析。
本文所建立的方法分为两个步骤, 首先按照色谱的流出方向, 利用MWTTFA逐步移动固定大小的窗口从而进行目标检验, 以确定某一组分是否存在以及存在的保留时间区域[25, 26], 同时得到组分的质谱信息, 然后利用NNIA解析得到组分的色谱图。TTFA利用主成分分析和对目标因子的最小二乘法变换, 得到转换后的目标因子。如果目标因子在转换过程中保持不变(在一定的误差阈值内相等), 则表明该目标因子存在于数据矩阵中。TTFA计算得到的质谱数据与其输入质谱数据(质谱库中的质谱)间的匹配度作为判断该组分是否存在的标准。根据文献方法[27]进行匹配度计算, 以千分数表示匹配程度的大小。由于计算得到的质谱数据(转换质谱)更加接近测量值, 因此本文采用MWTTFA的计算结果作为NNIA的输入。
具体过程为:(1)样品测试, 得到GC-MS测试数据。(2)根据测试结果确定可能存在的所有组分(本实验为可能存在的300种常见农药)并收集其标准质谱数据。所有质谱图均为标准化质谱图, 最大相对丰度为100。(3)利用MWTTFA判断GC-MS测试数据中存在的组分信息, 同时计算得到“转换质谱”。当匹配度大于700‰时, 认为该组分存在。(4)利用被检测为“存在”组分的转换质谱进行NNIA计算, 从重叠信号中解析出色谱图。计算中只采用该组分存在的“窗口”区间的GC-MS数据, 以提高计算的准确性。
采用300种农药的标准质谱数据对17种农药混合标准品的GC-MS数据进行MWTTFA计算, 得到300条匹配率曲线。毒死蜱(chlorpyrifos)、倍硫磷(fenthion)和对硫磷(parathion)3种农药组分的匹配率曲线见图 2。图中的水平实线为匹配度700‰的标度线。由图 2可知, 3种农药组分在6.28~6.38、6.34~6.46和6.38~6.47 min保留时间区域内的匹配度大于700‰。可以确定GC-MS信号中存在这3种组分的质谱信息。而对于大部分农药组分, 匹配率曲线中没有高于700‰的区间, 说明GC-MS信号中不存在这些组分的质谱信息, 即测试样品中不存在这些农药组分。
如图 3所示, 磷胺(phosphamidon)及其同分异构体的匹配率曲线中有2个匹配率大于700‰的区间。由于同分异构体的存在, 导致二者质谱信息相似性过高, 匹配率曲线十分相似, 匹配率大于700‰的区间(5.68~5.80和5.89~6.02 min)也基本相同。对于标准质谱相似或相同的情况, TTFA不能区分其差异, 一般需结合其他色谱参数进行进一步分析, 如保留指数等。
对300种农药的匹配率曲线进行检索, 发现17种农药标准品的匹配率曲线中均存在匹配率大于700‰的区间, 说明该GC-MS信号中含有17种农药的信息, 证明了MWTTFA计算结果的可靠性。该方法计算简单, 可在几秒内完成300种组分的检测, 实现复杂信号的高通量分析。
通过MWTTFA计算得到每种组分的转换质谱。对某些农药组分的质谱进行测试并与数据库中的标准质谱图进行比较, 考察了转换质谱的正确性。倍硫磷和对硫磷的标准质谱图、计算得到的转换质谱图及实验得到的质谱图见图 4。可以看出, 实验得到的质谱图与计算得到的转换质谱图更为相似, 而与质谱库中质谱图存在较大差异。这可能是由于仪器和检测条件的不同, 直接采用标准质谱数据进行计算可能会产生较大误差。转换质谱是基于测量数据得到的, 因此与测量数据中的质谱信息更加相符。在后续的NNIA计算中均采用转换质谱数据, 以得到更加精确的计算结果。
在NNIA中输入2.2节得到的转换质谱, 以进行色谱曲线的解析, 得到每个组分的色谱图。17种农药混合标准品的解析结果见图 5。从各组分的色谱曲线可以看出, 其色谱峰窄、峰形对称且不包含背景信息。色谱峰较窄是因为采用了快速的升温梯度且流速较快。同时, 在总离子流色谱图中重叠严重的组分信息也得到了较好的解析。磷胺的色谱曲线中仍出现了其同分异构体的色谱峰, 这是因为二者的保留时间较为接近, 出现在同一“窗口”所致。可通过对窗口位置的调整或保留指数等进行色谱峰的确认。本文所建立的方法可以较好地从混合GC-MS信号中提取所有组分的质谱和色谱信息, 实现对组分的快速定性鉴定和定量信息提取。
为进一步检验本文方法用于高通量分析的可行性, 采用更快的升温程序对42种农药混合标准品进行了分析, 其总离子流色谱图及解析曲线见图 6。由于升温速度加快, 42种农药中大部分组分的色谱曲线出现了重叠, 但仍能得到很好的解析结果。除由于质谱信息相似(或相同)导致产生双峰外, 其余每个组分均得到了单一的色谱曲线, 实现了8 min内42种农药的快速分析。本文为复杂体系的快速分析建立了一种有效方法, 但本文只对标准样品进行了解析, 对于更复杂的实际样品, 可能需要对算法进一步改进。
本研究建立了一种高通量解析算法用于多组分农药混合样品重叠GC-MS信号快速分析的方法。结合标准质谱库, 利用MWTTFA逐一检测目标组分是否存在, 并得到组分的存在区间及转换质谱, 然后利用NNIA得到单一目标组分的色谱信息。MWTTFA可以正确识别重叠信号中的组分信息, 且转换质谱图与实验得到的质谱图更加接近。通过快速升温程序对17种和42种农药混合标准品的信号进行分析, 实现了短时间内多组分农药混合标准品的快速分析。本方法为多组分体系的高通量快速分析提供了一种有效途径。