近年来, 放火火灾案件数量居高不下, 严重威胁公共安全, 给人民群众生命财产安全带来极大危害。放火案件中常用的助燃剂有煤油、柴油、汽油和油漆稀料等。在调查火灾时, 能从火场中提取到的痕迹物证中检测出助燃剂往往成为认定放火火灾的重要依据, 而GC-MS分析则是最常用的助燃剂检测手段[1]。尽管不同的助燃剂在成分上有所区别, 但其燃烧产物极其丰富, 且特征产物呈现多维度, 增加了从中获取有用信息的难度, 即陷入“维数灾难”的问题。因此, 探索一种对火场助燃剂进行准确、有效判定的分析方法尤为重要。国内外诸多学者[2-11]对火场助燃剂的分类辨识进行过研究, 常利用GC-MS的分析手段, 并结合化学计量学中关于数据处理的模式识别方法, 这些研究大多集中在对助燃剂原样以及燃烧的烟尘产物的分类识别两个方面。
王荣辉等[2, 3]采用主成分分析(principal component analysis, PCA)对从50个90#和93#汽油样本中得到的特征数据进行降维处理, 再结合Fisher判别对这两种汽油进行分类。Sandercock等[4]应用PCA和线性判别分析将未蒸发与蒸发的燃料进行了很好的分类。Doble等[5]利用PCA和人工神经网络对高甲烷值汽油和常规汽油进行分类。Monfreda等[6]利用SPME(solid-phase microextraction)-GC-MS结合PCA和判别分析对不同品牌的汽油样本进行分类。Tan等[7]利用PCA与软独立建模分类法(soft independent modeling of class analogy, SIMCA)选取5大类共51种助燃剂进行分类。刘颖荣等[8]采用PCA与SIMCA法对汽油单体烃结果进行模式识别研究。而对于燃烧的烟尘产物的模式识别方面, 支有冉等[9, 10]采用PCA降维和高级模式识别方法(hierarchical cluster analysis, HCA)将汽油、柴油、聚苯乙烯、ABS(acrylonitrile-butadiene-styrene copolymer)4种石化燃料的燃烧烟尘进行归类, 同时利用人工神经网络预测了烟尘来源。李飞等[11]利用PCA与SIMCA对93#和97#两种汽油的燃烧烟尘建立了类模型。
PCA法与模式识别不光应用于助燃剂原样及燃烧烟尘的识别判定, 也广泛应用于药材、食品的GC-MS分析中[12-14], 但目前还未见将模式识别应用于助燃剂残留物分析的文献报道。相比较燃烧产生的烟尘, 燃烧残留物因其受干扰的影响因素较少从而更能反映火场的实际情况, 成为更为重要的一种检材形式。另一方面, 利用PCA法对数据进行降维处理可能会使原始数据中的部分信息丢失, 给模式识别的判定带来一定的干扰, 故PCA法与模式识别联用后结果的准确性仍有待检验。目前, 针对火场助燃剂燃烧残留物的鉴定中仍缺乏一种准确、客观、科学的模式识别方法对送检样本进行准确的判定。本文利用GC-MS的分析手段, 运用模式识别方法, 对比研究了Fisher判别法以及PCA/Fisher判别联用两种分析方法在助燃剂残留物GC-MS分析中的应用, 旨在为燃烧残留物GC-MS测试数据提供更为科学准确的分析方法。
在应用统计方法解决模式识别问题时, 为了解决“维数灾难”的问题, 压缩特征空间的维数非常必要。下面两种方法是本文用到的统计分析方法。
PCA法的主要目的是希望用较少的变量去解释原来数据中的大部分变量, 将相关性很高的变量通过线性组合转化成彼此相互独立或不相关的变量。通常是选出比原始变量个数少、能解释大部分原始数据的几个新变量, 即所谓主成分, 并能够解释原始变量的综合性指标, 其本质是一种降维方法。
基本步骤如下:(1) 对原始数据X进行标准化处理后得到; (2) 计算的相关系数矩阵R, 求矩阵R特征值以及对应特征向量L, 主成分F表示为F=LX; (3) 将矩阵R中特征值大于1所对应的特征向量予以保留, 该数量便是主成分个数m。
Fisher判别与PCA法一样, 实际上涉及维数压缩的问题, 其基本思想是投影, 即将不易分类的数据通过投影到某个方向上, 使得投影的类与类之间得以分离的一种判别方法, 即Fisher判别本身可同时实现分类以及判别的功能。
本文使用Fisher判别的基本步骤如下:(1) 从原始数据X中抽取出第i个样本的数据, 构成列向量xiT; (2) 借助方差分析的思想构造2个特征向量t1、t2, 得到对应的Fisher判别式y1、y2, y1=t1xiT、y2=t2xiT, 其中特征向量t1、t2确定的原则是使得各总体之间离差平方和SSG最大, 且每个总体内部离差平方和SSE最小; (3) 将xiT代入y1、y2, 计算出2个判别式上的得分; (4) 将第一判别式得分作为X轴, 第二判别式得分作为Y轴, 计算送检样本坐标(X0, Y0)与各已知样本总体中心(Xj, Yj)两点间的距离。本文采用欧氏距离表示两点间距离, 即; (5) 送检样本到某总体中心距离Lj最小, 即认为送检样本属于该类。
HP 6890GC/5973MSD气相色谱-质谱联用分析仪、HP-5MS色谱柱(30 m×0.250 mm×0.25 μ m)购自美国Agilent Technologies, 正己烷(色谱纯)购自天津福晨化学试剂厂。
助燃剂:0#柴油、93#汽油、95#汽油、97#汽油、煤油(购自廊坊中石化加油站)、硝基油漆稀料、聚氨酯(polyurethane, PU)油漆稀料(购自天津寿元商贸有限公司)。载体:棉制毛巾(购自北京京东世纪信息技术有限公司)、木材条(购自廊坊东户屯佳林装饰材料经营部)、橡胶板(购自上海曙美五金橡胶经营部)。
分流比为10:1; He气流速为1.2 mL/min; 柱前压为9.9×105 Pa。升温程序设定为:柱温在50 ℃保持2 min, 后以10 ℃/min的速率升至150 ℃并保持2 min, 最后以6 ℃/min的速率升至260 ℃并保持10 min, 全程时长42.33 min。
EI(电喷雾电离)源; 接口温度为280 ℃; 离子源温度为230 ℃; 四极杆温度为150 ℃; 电子能量为70 eV; 扫描范围为m/z 50~550, 扫描间隔为0.01 min。
助燃剂与萃取剂按照1:10(v/v)的比例混合即可制备助燃剂原样的样本。助燃剂于不同载体燃烧残留物制备流程如下:将助燃剂和燃烧物(7种典型助燃剂各20 mL、裁剪成10 cm×10 cm的棉制毛巾、锯切成10 cm×3 cm×5 cm的木材条、裁剪成10 cm×9 cm×5 cm的橡胶板)置于一个封闭的燃烧实验室内, 助燃剂倒入200 mL坩埚内, 用点火器引燃作为空载条件, 助燃剂均匀洒在载体上, 用点火器引燃助燃剂作为载体条件。记下点火至完全自然熄灭的时长t, 计算0.85t, 在相同条件下于0.85t时以窒息的方式将助燃剂及载体熄灭。重复以上实验步骤, 最终得到35个已知燃烧残留物训练样本。采用GB/T 18294.5-2010推荐的方法, 利用色谱纯正己烷对燃烧残留物浸泡提取, 过滤除去杂质, 然后在空气中自然挥发浓缩至0.5 mL左右, 将最终得到的样本进行GC-MS分析。
对某起火灾的送检样本进行鉴定, 该样本提取自起火部位附近的燃烧残留物, 采用2.3节相同方法处理残留物, 对萃取浓缩后的样本进行GC-MS分析, 图 1给出了GC-MS分析后的总离子流色谱图, 各特征组分检出峰的保留时间、检出组分见表 1。根据GB/T 18294.5-2010的判定规则, 认定送检样本中含有汽油成分。
从已知样本以及某火场送检样本的GC-MS谱图中选择32种特征组分, 以二甲苯作为内标物, 积分求得特征组分的相对峰面积[15], 得到36×32的数据矩阵, 矩阵部分数据见表 2。
利用MATLAB R2012a[16]对数据矩阵进行主成分分析, 表 3列出了结果中特征值大于1所对应的前4个主成分得分。
取权重较大的前3个主成分做三维点图(见图 2), 方便对分类结果进行直观判断。从图 2可以看出, 运用PCA与Fisher判别联用技术, 36个样本基本分为5类, 3种汽油的分类并没有明显区分, 几乎合并到了一类, 而其他几类中的5个样本分布也较为离散。由此可见该方法对数据的预处理效果一般。
为找出送检样本所属的类别, 下面利用MATLAB R2012a[16]对表 3中的主成分分析结果进行Fisher判别分析, 选取权重较大的前两个Fisher判别式:y1=t1xiT, y2=t2xiT。其中t1=(3.828, -2.959, -2.983, -2.370, 3.092, 1.206, 0.282); t2=(-2.579, -0.790, -0.687, -0.878, -1.142, 5.615, 0.598)。
将35个训练样本以及送检样本构成的列向量xiT代入Fisher判别式y1、y2, 用判别式得分作散点图(见图 3)。35个训练样本被大致划分为4类, 分类效果较差, 因为3组汽油没有区分开, 0#柴油和煤油的区分不够明显, PU稀料和硝基稀料自成一类。
计算送检样本到各类中心的距离。由表 4可知, 送检样本到硝基稀料类的中心距离最近, 故判定送检样本中检出硝基稀料成分。但本文2.4节对样本进行GC-MS分析鉴定时却检出汽油成分, 说明PCA与Fisher判别联用, 其结果的准确性并不理想。分析其原因, 可能是运用PCA进行降维造成原始数据中的部分信息丢失, 给后面的判定分析带来干扰。为了避免PCA在降维处理过程对后续模式识别带来的干扰, 下面将直接采用Fisher法对样本进行判别分析。
利用MATLAB R2012a[16]对原始数据矩阵进行判别分析。选取权重较大的前两个Fisher判别式:y3=t3xiT, y4=t4xiT。其中t3=(0.000 35, 0.001 55, 0.006 69, -0.011 49, 0.017 96, 0.008 27, -0.000 41, 0.001 88, -0.011 05, -0.016 85, -0.000 86, 0.001 49, 0.040 42, -0.008 64, -0.002 63, -0.002 26, 0.000 49, -0.002 67, 0.001 88, 0.015 43, -0.070 92, -0.007 24, 0.187 55, -0.629 42, 0.004 25, 0.238 74, 0.424 11, -0.379 89, -0.109 69, 0.295 76, -0.281 67, 0.023 80);t4=(-0.000 11, -0.000 50, -0.001 70, 0.002 91, -0.004 56, -0.002 11, 0.000 07, -0.000 50, 0.002 93, 0.003 76, 0.000 24, -0.000 01, -0.009 71, 0.002 51, 0.002 25, -0.001 87, -0.000 13, -0.007 00, -0.000 56, 0.003 21, 0.062 39, -0.000 02, -0.161 32, 0.136 43, 0.005 02, 0.085 24, 0.115 96, -0.220 60, -0.314 90, 0.007 52, 0.763 01, -0.447 70)。
将35个训练样本以及送检样本构成的列向量xiT代入Fisher判别式y3、y4, 用计算出的得分作散点图(见图 4), 可以清晰地看到35个训练样本被准确划分到7类助燃剂中, 除93#汽油和95#汽油区分不够明显外, 其余样本均得到有效分类, 而且同一类的5个样本均堆叠至一点, 表明分类效果良好。计算送检样本到各类中心的距离, 由表 5可知, 送检样本到93#汽油类的中心距离最近, 判定送检样本属于93#汽油总体, 故认定送检样本中含有93#汽油燃烧残留物, 进一步验证了2.4节中对未知样本的鉴定结果。
通过对7种常见助燃剂在不同载体上的燃烧残留物样本及未知送检样本进行GC-MS分析测试, 运用Fisher判别及PCA/Fisher联用两种判别方法对GC-MS数据进行分析处理。PCA/Fisher判别联用的结果表明送检样本中含有硝基油漆稀料成分, 而仅使用Fisher判别的结果表明送检样本中含有93#汽油。比较两种分析方法, 发现Fisher判别可实现对7种助燃剂燃烧残留物的有效分类, 同时对于未知样本的判别更为准确, 而PCA因为降维处理丢失了部分原始数据的信息, 对后续的判别分析造成了一定的干扰。论文的研究结果为火灾物证鉴定工作提供了新的数据分析手段, 具有一定的通用性。
但本文建立的判别方法需要同时建立火场常见助燃剂燃烧残留物的GC-MS谱图库作为训练样本, 且判别结果的准确性依赖于训练样本的质量与数量。因此, 该方法在实际鉴定工作的效果仍有待进一步的检验。