色谱  2014, Vol. 32 Issue (9): 1019-1024   PDF (1802 KB)    
扩展功能
加入收藏夹
复制引文信息
加入引用管理器
Email Alert
RSS
本文作者相关文章
欧林军
曹建
一种变压器油色谱峰识别算法的设计
欧林军1, 曹建1,2     
1. 中南大学物理与电子学院, 湖南 长沙 410083;
2. 北京华电云通电力技术有限公司, 北京 100071
摘要:在变压器油色谱峰识别领域,传统的一阶导数法需要斜率阈值来实现色谱峰识别,因此自动化程度低及容易失真。针对这些缺点,本文在一阶导数法的基础上进行了改进,将迭代移动平均及归一化分析技术应用到色谱峰识别中,通过对信号曲线及方波曲线多次迭代移动平均确定最优的归一化识峰参数,结合色谱峰的绝对保留时间及识峰窗口实现对色谱峰的准确识别。实验结果表明:该算法可以准确识别色谱峰,对噪声、色谱峰的峰宽及峰形变化不敏感,具有很强的自适应性,满足变压器油中气体在线监测装置的现场使用要求。
关键词色谱峰识别     迭代移动平均法     归一化识峰参数     变压器油    
A peak recognition algorithm designed for chromatographic peaks of transformer oil
OU Linjun1, CAO Jian1,2     
1. School of Physics and Electronics, Central South University, Changsha 410083, China;
2. Beijing Huadian Yuntong Power Technical Co., Ltd., Beijing 100071, China
Abstract: In the field of the chromatographic peak identification of the transformer oil, the traditional first-order derivative requires slope threshold to achieve peak identification. In terms of its shortcomings of low automation and easy distortion, the first-order derivative method was improved by applying the moving average iterative method and the normalized analysis techniques to identify the peaks. Accurate identification of the chromatographic peaks was realized through using multiple iterations of the moving average of signal curves and square wave curves to determine the optimal value of the normalized peak identification parameters, combined with the absolute peak retention times and peak window. The experimental results show that this algorithm can accurately identify the peaks and is not sensitive to the noise, the chromatographic peak width or the peak shape changes. It has strong adaptability to meet the on-site requirements of online monitoring devices of dissolved gases in transformer oil.
Key words: chromatographic peak identification     moving average iterative method     normalized peak identification parameters     transformer oil    

变压器作为电力系统的关键性设备,其可靠性是电网安全运行的关键所在,在线油中气体分析技术(DGA)是在线监测技术中的重要组成部分[1, 2]。变压器运行现场环境恶劣,因此色谱峰识别算法的可靠性至关重要。目前运用较多的油色谱峰识别算法有时间窗法[3, 4]、曲线拟合法[5]、模式匹配法[6]、导数法[7]等。时间窗口法需要结合样气成分保留时间进行识别分析;曲线拟合法对复杂的色谱峰存在过度拟合的情况;模式匹配法需要结合定标样气的模板函数,在色谱峰形发生较大改变时容易出现成分误判或识别不到相关峰位。因此DGA技术的实现亟待一种稳定、可靠、高效的色谱峰识别算法。

文献[8]利用移动标识算法进行色谱峰识别,通过对色谱信号曲线数字滤波、曲线移动分组预处理及根据分组内的序列号进行谱峰识别。该算法是目前离线色谱工作站中普遍采用的谱峰识别算法,但其存在以下不足:1)色谱峰起点和终点数组的最少个数由采样频率决定,然而色谱峰的峰形会随着时间的增长而发生改变,因此根据采样频率快慢决定色谱峰的起点和终点数组最小个数具有不确定性,容易引入假峰;2)移动数据预处理是根据一个小区间内的信号值变化趋势得出峰识别的序列号,区间内突变的数据会导致起点或终点数组不连续,造成色谱峰识别的失败。

针对以上不足,本文对文献[8]的色谱峰识别算法进行了改进。在一阶导数法基础上,对色谱峰斜率曲线进行归一化处理得到方波曲线,并统计方波曲线中大于1及小于1的区间。根据最优平滑窗口确定色谱峰的最小半峰宽,滤除方波曲线中小于最小半峰宽的噪声峰,结合色谱峰的绝对保留时间及识峰窗口便可以区分色谱峰与噪声峰。

1 原理
1.1 谱峰识别的原理

根据色谱学的塔板理论,样气组分经过色谱柱流出的信号曲线可以用高斯函数进行建模,模型如式(1)所示。

式(1)中的f(t)为流出信号曲线;A为色谱峰的面积; σ 为色谱峰的峰宽度;t为信号曲线的流出时间;tR为样气组分的保留时间。

对式(1)进行求导,可以得到色谱峰变化趋势,如式(2)所示。

令色谱峰的保留时间tR=0,峰宽为500,峰面积为 1000,得到色谱峰信号曲线f(t)及信号曲线的一阶导数f′(t)如图1所示。

图1 色谱信号及色谱信号的一阶导数 Fig.1 Chromatographic signal and its first-order derivative

图1中的一阶导数体现了色谱峰的变化率。一阶导数为正表示色谱峰处于上升状态;一阶导数为负表示色谱峰处于下降状态;一阶导数由正到负标志色谱峰峰顶的到来。在峰顶位置,一阶导数为零。一阶导数又常称为斜率,下文将一阶导数曲线统称为斜率曲线。

虽然样气的峰形可以近似用式(1)来表示,但如何通过不设置斜率曲线阈值而有效区分色谱峰与噪声峰是需要解决的问题。本文通过最优平滑窗口确定归一化识峰参数最小半峰宽,将小于最小半峰宽的峰定义为噪声峰。结合色谱峰的绝对保留时间及识峰窗口将色谱峰与噪声峰有效区分,具体步骤如下:

1)噪声滤除。在最优平滑窗口下对色谱信号曲线进行高斯白噪声滤除,得到相对平滑的信号曲线,并对信号曲线一阶求导得到斜率曲线。为了防止斜率曲线中的突变点对识峰造成影响,对斜率曲线以同样的方式进行平滑处理。

2)斜率曲线归一化。将斜率大于0的值设置为1,小于0的值设置为-1,值为0的保持不变,归一化后得到方波曲线,以下简称方波。

3)统计方波周期。统计方波中连续大于0的值及连续小于0的值的个数,简称方波的周期,并统计出正负方波周期及其起点和终点。

4)方波周期的选取。不失一般性,以色谱峰数目的4倍作为选取的方波周期的数目,假设色谱峰的数目为n,则选取方波周期的数目为4n。对方波周期进行由大到小的排序,如果方波周期的数目大于4n,取前4n个方波周期作为疑似色谱峰方波周期;如果方波周期的数目小于4n,则将所有的方波周期作为疑似色谱峰的方波周期。

5)根据色谱峰的方波周期及其起点求出疑似色谱峰的特征点,即色谱峰的起点、顶点和终点,色谱峰的顶点位置也称为相对保留时间。

6)根据色谱峰的绝对保留时间及识峰窗口,逐一匹配疑似色谱峰,落于识峰窗口的峰判定为色谱峰。

色谱信号曲线中噪声峰的方波周期一般小于色谱峰的方波周期。通过方波周期方法可以滤除大部分的噪声峰,剩下的即为色谱峰和周期较大的噪声峰,需要进一步识别处理。在识峰窗口内匹配色谱峰的绝对保留时间和疑似色谱峰的相对保留时间,就能区分噪声峰与色谱峰。在同一图谱信号曲线中涵盖色谱峰、噪声峰,通过归一化处理得到最小半峰宽,并将方波周期较小的噪声峰滤除,其中包括位于色谱峰识峰窗口之内的噪声峰。该方法中最小半峰宽随噪声峰的方波周期变化而改变,从而大幅降低了引入假峰的概率,因此具有很强的抗干扰能力。

1.2 最优平滑窗口的确定

在对色谱峰识别之前,需要对色谱信号曲线进行滤波处理。目前常用的降噪方法有:移动平均算法[9]、数字滤波[10]、中值滤波[11, 12]、小波变换[13, 14]。移动平均算法、中值滤波算法应用广泛,目前Matlab软件已有成熟函数供使用,但其需要设置合适的过滤“窗口”。该“窗口”的确定成为降噪技术的重要研究课题。经过试验研究对比,迭代移动平均算法对斜率曲线的平滑较为有效,而且易于实现,故本文采用迭代移动平均算法。

移动平均算法的“窗口”过小容易影响噪声滤除效率,从而影响谱峰识别中方波周期的有效计算;“窗口”过大容易造成数据无法预测,从而造成最终测定色谱峰的特征点误差增大。故本文采用多次迭代移动平均算法,统计各种平滑窗口下所能识别到的色谱峰的数目,取峰数目最多的平滑窗口作为最优的平滑窗口,具体步骤如下:

1)采用迭代移动平均算法对色谱信号曲线噪声进行快速平滑处理。这里需要确定平滑窗口宽度W和迭代次数Num。本色谱的硬件采样周期为50 ms,设置平滑窗口的初始值为0.5 s,即采样点数为10,迭代次数Num为6。

平滑后的色谱信号曲线的各个数据值s(i)由式(3)~(5)求出。

其中(1≤i≤W)。

其中(WiN-W)。

其中(N-W+1≤iN)。 式中的y为色谱信号曲线的原始数据,N为信号的长度,W为平滑窗口的宽度。

2)求取方波周期数组及方波起点数组。对平滑后的信号曲线进行一阶求导得到斜率曲线,这里采用两点一阶差分的求导方法。为了减小数据抖动对方波周期求取的影响,采用式(3)~(5)对斜率曲线进行平滑处理。对平滑处理后的斜率曲线进行归一化处理得到方波曲线。对方波曲线进行如下的处理,得到疑似色谱峰的方波周期数组及正负方波的起点和终点数组:

①统计方波曲线中正方波的起点数组xz及其周期数组zd;统计负方波的起点数组xf及其周期数组fd;正负方波的起点数组x及其周期数组d

②对正负方波周期数组d进行从大到小排序,统计出方波的周期个数为pk_num,并与设定的最小半峰宽数目pk_min(本文设定为40)进行比较,如果pk_num小于pk_min,则将pk_num赋值为pk_min,并取得周期数组d的第pk_min个方波周期作为识峰的最小半峰宽pk_mw

③统计正方波周期数组zd中大于pk_mw的正方波的起点数组mxz及其周期数组mdz,同样的方法取得负方波周期数组fd中大于pk_mw的负方波的起点数组mxf及其周期数组mdf

3)根据正负方波周期数组mdzmdf及其起点数组mxzmxf的位置关系,求出疑似色谱峰的起点、顶点及终点。色谱峰对应着一个连续的正负方波,通过这一原则对步骤2)处理后得到的方波进行处理,将不连续的正负方波认为是噪声峰并将其滤除。这里要注意的是大部分色谱峰存在连体峰的情况,需要将连体峰进行合并为一个疑似色谱峰,具体步骤如下:

①计算第i个负方波终点为mxfend=mxf(i)+mdf(i),则下一个可能存在负方波起点的位置为af=mxfend ∶ 1 ∶ mxfend+0.5*pk_mw,第i+1个负方波的起点位置bf=mxf(i+1),比较af区间内是否存在索引号为i′af(i′)值与bf区间索引号为i″的bf(i″)值相等,如果存在则分别对第i个及i+1个负方波的周期及起点进行如下的调整:

通过式(6)~(8)的计算将连体峰的负方波修正为一个连续区间,避免由于基线的波动造成色谱峰特征点识别出现误差。

②采用以上的步骤对正方波进行同样的操作,并通过以下的方法判断正负方波是否有效:计算第i个正方波终点为mxzend=mxz(i)+mdz(i),则该正方波可能存在与其对应负方波的位置az=mxzend ∶ 1 ∶ mxzend+0.5*pk_mw,负方波的起点位置bz=mxf,比较az区间内是否存在一个索引号为jaz(j)值与bz区间内索引号为kbz(k)值相等。如果存在则认为该正方波存在一个与之对应的负方波,即存在一个疑似色谱峰,该疑似色谱峰的起点、顶点及终点由下式求得:

4)疑似色谱峰的峰高求取。对疑似色谱峰的起点和终点之间进行一次线性插值,得到其基线,峰高则通过峰顶点与基线的差值求取。

其中K为基线的斜率,由式(13)计算得到。

5)将小于最小峰高pk_mh (该值由最小检测限及传感器的灵敏度共同定出)的峰进行排除,统计剩余峰的数目为pk_rmnum

6)修改步骤1的平滑窗口W值,本文设定的 迭代步长step为19个采样点。重复步骤1到5,共寻峰6次,统计各个窗口下计算得出的峰数目pk_rmnum,并将峰数目最大的窗口设为最优平滑窗口。

1.3 算法流程图

根据算法的原理,构建的算法流程图如下:

2 实验部分
2.1 实验方法

为了验证上述识峰算法的准确性和可靠性,采用以下方法:一是使用Matlab软件拟合得到混有高斯白噪声的重叠谱峰信号,验证上述算法对重叠谱峰信号的识别能力;二是利用北京华电云通电力技术有限公司的MT6000在线监测装置采集得到现场谱峰信号,验证上述算法对于低浓度油样谱峰的识别能力。

2.2 实验条件

测定样品的色谱条件为:HY-5色谱柱(6 m×1 mm×0.25 μ m),系统采用单支色谱柱,故色谱峰存在重叠现象;色谱检测器:采用费加罗公司生产的半导体气敏检测器;色谱进样条件:色谱柱前端压力为150 Pa,色谱柱的温度控制为60 ℃,空气作为载气,流速为14 mL/min。色谱信号采集硬件条件:采集器的A/D范围为-2.5~2.5 V,采集精度为16位,采集速率为20次/s。

3 结果与讨论

采用Matlab软件拟合得到6个混有高斯白噪声的谱峰,其分离度如表1所示。从左到右分别模拟变压器油中氢气(H2)、一氧化碳(CO)、甲烷(CH4)、乙烯(C2H4)、乙炔(C2H2)、乙烷(C2H6) 6种气体的色谱峰,如图2所示。

图2 高斯拟合带有白噪声的重叠色谱峰 Fig.2 Overlapping chromatographic peaks with white noise by Gaussian fitting

由表1得知采用Matlab软件拟合的色谱峰属于不完全分离色谱峰。采用本文方法,通过设置不同平滑窗口对谱峰信号曲线进行寻峰,共寻峰6次,其识别到的色谱峰数目如表2所示。

表1 相邻模拟色谱峰的分离度 Table 1 Resolutions of the adjacent model chromatographic peaks

表2 不同平滑窗口对应的识别到的色谱峰数目 Table 2 Numbers of the identified chromatographic peaks under different sliding windows

通过表2可以看出,随着平滑窗口的增加,识别到的疑似色谱峰的数目出现先增后减的现象,当平滑窗口为29时,识别到的色谱峰数目最多,故设置29为最优平滑窗口。在最优平滑窗口下得到色谱信号曲线及方波曲线如图3所示,每个色谱峰对应着两个连续的正负方波。但通过图3的方波曲线还可看出,除了色谱峰对应连续的正负方波外,基线上还存在周期大小不一的噪声峰,这可以通过设定色谱峰的绝对保留时间及识峰窗口加以识别。结合北京华电云通电力技术有限公司在线监测设备1年多的使用经验,识峰窗口设置为800较为合理,如图4所示。谱峰识别的结果如图5所示。

图3 (a)采用迭代移动平均法处理后的色谱信号和(b)斜率 曲线归一化得到的方波曲线 Fig.3 (a) Noise processing chromatographic signal through the moving average iterative method and (b) corresponding square wave curve through the normalization of the slope curve

图4 通过识峰窗口识别色谱峰 Fig.4 Identification of chromatographic peaks through peak window

图5 重叠色谱峰的识别结果 Fig.5 Identification results of overlapping chromatographic peaks

图6显示的是现场采集得到的一个油样图谱数据识别结果。其中C2H4、C2H2、C2H6浓度均很小(0.3 mg/kg),通过图6可以看出,虽然C2H4、C2H2、C2H6的幅值很低,但通过最优平滑窗口下的斜率曲线归一化方法还是可以将低浓度组分准确识别出来。

图6 微弱色谱峰的识别结果 Fig.6 Identification results of small chromatographic peaks
4 结论

由于谱峰识别采用了斜率曲线归一化方法,使得该算法可以准确识别色谱峰,对噪声、色谱峰的峰宽及峰形变化不敏感,避免了常用算法的缺陷。

用于噪声峰滤除的最小半峰宽是由最优平滑窗口下归一化方法得出,可以针对基线中噪声峰的半峰宽周期的大小而自动调整,从而滤除基线中周期较小的噪声峰避免引入假峰。传统方法采用设定固定斜率阈值方法,降低了识峰算法的自适应性。所以本文算法具有非常好的抗干扰性和抗失真性。

谱峰识别算法中结合了色谱峰的绝对保留时间和识峰窗口对疑似色谱峰加以识别,大大降低了引入假峰的概率。绝对保留时间是由色谱柱的固定相与流动相共同决定,是一个固定值。识峰窗口是针对色谱峰相对保留时间的变化设定的,若识峰窗口取值过大,则色谱峰识别的敏感性降低,容易引入假 峰;若识峰窗口过小,则色谱峰识别的敏感性增加,容易找不到色谱峰。

应用了该识峰算法的在线变压器油色谱检测装置已经在江苏吴江、车坊、锦丰等变电站投入运行,现场运行效果良好。

参考文献
[1]Zou S Y, Tong X Y, Tong L S, et al. Automation of Electric Power Systems (邹思轶, 童晓阳, 佟来生, 等. 电力系统自动化), 2003, 27(5): 61
[2]Li H L, Zhou F J, Tan K X, et al. Automation of Electric Power Systems (李红雷, 周方洁, 谈克雄, 等. 电力系统自动化), 2005, 29(18): 62
[3]Liu Z, Zou H F, Ye M L, et al. Chinese Journal of Chromatography (刘震, 邹汉法, 叶明亮, 等. 色谱), 1999, 17(2): 147
[4]Wang C J, Cui Y Y. Analytical Instrumentation (王崇杰, 崔玉影. 分析仪器), 1997(4): 28
[5]Hu Y G, Zhang X X, Zhao Z Y, et al. Journal of Chongqing University (胡耀垓, 张晓星, 赵正予, 等. 重庆大学学报), 2012, 35(5): 76
[6]Wei H, Lin L, Zhang Y, et al. Chinese Journal of Chromatography (魏航, 林励, 张元, 等. 色谱), 2013, 31(2): 127
[7]Liu M M, Xia B L, Yang J. Chinese Journal of Chromatography (刘明明, 夏炳乐, 杨俊. 色谱), 2009, 27(3): 351
[8]Luo W D, Tang L X, Zhang Y, et al. Chinese Journal of Chromatography (罗伟栋, 汤璐茜, 张云, 等. 色谱), 2011, 29(12): 1216
[9]Li X R, Li Y Q, Zhang S. Journal of North China Electric Power University (李星蓉, 李永倩, 张硕. 华北电力大学学报), 2009, 36(4): 73
[10]Wu Y X, Li J M, Mi S H, et al. Computer Engineering and Applications (武优西, 李建满, 米少华, 等. 计算机工程与应用), 2012, 48(2): 145
[11]Yang F F, Zhu D S, Wang Z W, et al. Computer Engineering and Applications (杨芳芳, 朱东升, 王志巍, 等. 计算机工程与应用), 2013, 49(13): 160
[12]Liu G H, Guo W M. Computer Engineering and Applications (刘国宏, 郭文明. 计算机工程与应用), 2010, 46(10): 187
[13]Cai T, Wang X P, Du S Y, et al. Chinese Journal of Analytical Chemistry (蔡涛, 王先培, 杜双育, 等. 分析化学), 2011, 39(6): 911
[14]Li C P, Han J Q, Huang Q B, et al. Spectroscopy and Spectral Analysis (李翠萍, 韩九强, 黄启斌, 等. 光谱学与光谱分析), 2011, 31(11): 3050