质谱是蛋白质组学研究的重要工具[1, 2, 3]。在基于鸟枪法的蛋白质组学研究中,蛋白质样品首先通过蛋白酶的作用酶解为肽段,然后通过液相色谱-串联质谱联用(LC-MS/MS)进行分析。从串联质谱中得到的谱图通常使用数据库检索软件与肽段序列进行匹配。目前常用的数据库检索软件包括SEQUEST[4]、Mascot[5]、OMSSA[6]和X! Tandem[7],有课题组通过对各种数据集的检索对这些软件的效果进行了评估[8, 9, 10]。
虽然不同的数据库检索算法都有各自的特征,但大多都具有一致的核心思路,即通过理论酶解数据库中的所有蛋白质产生理论谱图,然后选择所有母离子质荷比和实际谱图的质荷比在一定偏差范围内的理论谱图进行匹配。在这种策略中,较大的检索空间会增加随机匹配的风险。在检索过程中,对于一个给定的蛋白质数据库有4种参数会对检索空间产生影响:母离子质量偏差容忍度;酶切特异性;最大漏切位点数和可变修饰的设定[9]。目前高分辨质谱如线性离子阱-傅里叶变换回旋共振质谱仪(LTQ-FT)或线性离子阱-轨道阱质谱仪(LTQ-Orbitrap)已广泛应用于蛋白质组学的研究,因此质量偏差容忍度可以作为控制检索空间的重要参数用于提高鉴定的准确度[11]。有研究发现,对于高精度质谱产生的数据,先用较宽松的母离子质量容忍度进行检索,再把质量偏差作为后期筛选肽段匹配的条件,可提高肽段的鉴定数目[8, 12]。可见选择适当的检索空间对于提高肽段鉴定的灵敏度和选择性具有重要意义。
可变修饰的设定同样对检索空间具有重要影响,但同质量偏差容忍度相比,目前并没有得到广泛的关注。因为对于肽段翻译后修饰的鉴定,如磷酸化、乙酰化、甲基化和糖基化的鉴定,在检索过程中设定可变修饰是不可避免的。而对某个氨基酸残基设定可变修饰则意味着数据库中所有的该氨基酸残基都是可以被修饰的,这明显和实际情况不符。例如,蛋白质磷酸化和去磷酸化的过程是由蛋白激酶和磷酸酶调控的,其作用位点是特定的底物[13, 14]。因此,只有符合特定序列的氨基酸残基才可能是潜在的磷酸化位点。如图1所示,丝氨酸、苏氨酸和酪氨酸相邻的氨基酸残基分布同整个数据库中的氨基酸残基分布非常接近,但是对于已经被鉴定为磷酸化位点的丝氨酸、苏氨酸和酪氨酸相邻的氨基酸残基,其分布与上述两种具有明显差异,比如脯氨酸的比例明显提高。这说明把所有的丝氨酸、苏氨酸和酪氨酸都作为潜在的磷酸化位点,认为这些残基都具有被磷酸化的可能,并不是理想的检索方法。
因此,如果我们可以把蛋白质数据库中某种修饰对应的所有氨基酸残基分为两类:一类是潜在的修饰位点,可以被修饰;另一类不是潜在的修饰位点,不能被修饰。我们可以创建一个位点信息注释的数据库,只允许在潜在的位点上发生可变修饰。同普通的数据库相比,仅在潜在位点设定可变修饰可以大大降低检索空间,从而提高鉴定的准确度。这种思路已经在N-连接糖肽的鉴定中得到了应用[15]。对于经过糖苷酶处理后去糖基化的肽段,N-糖基化位点的识别是通过设定可变修饰天冬酰胺转化为天冬氨酸实现的。由于脱酰胺作用通常发生在符合N-X-S/T(X代表除了脯氨酸以外的任意氨基酸)特征序列中的天冬酰胺上,因此这一部分天冬酰胺可以作为潜在的N-糖基化位点构建位点注释的蛋白质数据库。但对于其他种类的翻译后修饰,尚缺乏特征序列用于潜在位点的判断。
为了解决这一问题,我们尝试从已鉴定到的磷酸化位点数据库中提取特征序列来构建磷酸化位点注释的数据库。这个数据库中只有作为潜在磷酸化位点的丝氨酸、苏氨酸和酪氨酸可以被修饰。我们使用不同的数据集作为分析对象,对位点注释的数据库检索策略进行了考察,证明了使用位点注释的数据库可以提高磷酸化肽段鉴定的灵敏度。
液相色谱系统Acquity UPLC(美国Waters公司); Finnigan液相色谱泵(美国ThermoFisher公司);线性离子阱质谱LTQ(美国ThermoFisher公司);线性离子阱-轨道阱质谱仪LTQ-Orbitrap XL(美国ThermoFisher公司); Milli-Q超纯水系统(美国Millipore公司); C18 AQ反相色谱填料(5 μ m,12 nm)(日本DAISO Chemical公司); 75 μ m内径的石英毛细管(美国Polymicro Technologies公司); 50 μ m和200 μ m内径的石英毛细管(河北永年光纤厂)。
实验所用的小鼠购自大连医科大学。所使用的化学试剂二硫苏糖醇(1,4-dithiothreitol,DTT)、碘代乙酰胺(iodoacetamide,IAA)、三氟乙酸(trifluoroacetic acid,TFA)、三乙基碳酸氢铵(triethylammonium bicarbonate,TEAB)、乙二胺四乙酸(ethylenediaminetetraacetic acid,EDTA)、乙二醇双(2-氨基乙基醚)四乙酸(ethylenebis(oxyethylenenitrilo)tetraacetic acid,EGTA)、4-羟乙基哌嗪乙磺酸(HEPES)、苯甲基磺酰氟(phenylmethanesulfonylfluoride,PMSF)、蛋白酶抑制剂(protease inhibitor cocktail)、甲醛(CH2O)、氘代甲醛(CD2O)、氰基硼氢化钠(NaBH3CN)购自美国Sigma公司。聚二醇单辛基苯基醚(Triton X-100)购自美国Bio Basic公司。色谱纯乙腈(ACN)购自德国Merck公司。细胞培养稳定同位素标记(stable isotope labeling by amino acids in cell culture,SILAC)标记试剂购自美国Pierce公司。实验用去离子水经过Milli-Q水处理系统纯化,其他试剂均为分析纯。
样品1: HeLa细胞培养采用RPMI 1640培养基并加入10%(v/v)新生牛血清、100单位/mL青霉素和链霉素,在37 ℃、5% CO2培养箱中培养。收集细胞后用PBS(pH 7.4)洗涤并加入裂解液超声裂解。裂解液的组成为1%(v/v)Triton X-100、65 mmol/L DTT、1 mmol/L PMSF、2%(v/v)蛋白酶抑制剂、50 mmol/L HEPES(pH 7.5)。在25000 g条件下离心1 h。溴化氢活化的琼脂糖微球用1 mmol/L HCl洗涤后,加入0.5 mL HeLa蛋白质裂解液,在4 ℃条件下振荡过夜,进行蛋白质的固载反应。微球上未反应的活性固载位点用1 mol/L 的甘氨酸封闭液于25 ℃反应3 h进行封闭。再加入20 mmol/L 的DTT,37 ℃反应2 h,然后加入40 mmol/L 的IAA,25 ℃避光反应1 h。肽段通过加入200 μ g胰蛋白酶在37 ℃条件下酶解18 h从微球上释放,并用200 μ L NH4HCO3和200 μ L乙腈洗涤微球。上清液用5%(v/v)TFA酸化后用Ti4+-固定金属离子亲和色谱(IMAC)材料进行富集,处理步骤按照Ye等[16]开发的方法进行。
样品2:来源于成年雌性C57小鼠的鼠肝组织样品来自大连医科大学。样品预处理步骤参见我们之前的工作[17, 18]。首先对样品进行裂解,裂解液的组成为8 mol/L 尿素、1% (v/v)Triton X-100、65 mmol/L DTT、1 mmol/L EDTA、0.5 mmol/L EGTA、1 mmol/L PMSF、100 μ L蛋白酶抑制剂、磷酸酶抑制剂(1 mmol/L NaF、1 mmol/L Na3VO4、1 mmol/L 甘油磷酸钠和10 mmol/L 焦磷酸钠)和40 mmol/L Tris-HCl,最终的pH为7.4。蛋白质溶液加入DTT在37 ℃反应2 h进行还原,然后加入IAA在室温下避光反应40 min。反应结束后加入100 mmol/L TEAB进行稀释并按照酶和蛋白质的质量比1 ∶ 25的比例加入胰蛋白酶,在37 ℃反应过夜。酶解液置于-80 ℃中保存。磷酸肽的富集过程和样品1相同。
样品1通过一维纳升级反相液相色谱-串联质谱(1D RP-LC-MS/MS)系统进行分析。毛细管分离柱(75 μ m i. d.)的一端拉成小于3 μ m的尖端,然后填入C18 AQ填料。流动相A为0.1%(v/v)甲酸水溶液,流动相B为0.1%(v/v)甲酸乙腈溶液。首先将样品复溶于5 μ L 0.1%(v/v)甲酸溶液中,然后手动上样至C18分离柱。流动相分流后的流速为200 nL/min,反相分离梯度为130 min(5%~25%的流动相B持续120 min,25% ~35%的流动相B持续10 min)。LTQ质谱采用正离子模式,离子传输加热毛细管温度为200 ℃,电喷雾电压为1.8 kV,归一化碰撞能量为35% ,采用数据依赖模式进行质谱扫描,在每个一级谱图中根据信号强度选取前6个离子进行二级谱的碎裂。详细的实验步骤可以参见Han等[19]的工作。
样品2的预处理采用的在线标记和多维分离系统,按照文献[18]描述的方法构建。将鼠肝组织蛋白质酶解液中富集的磷酸肽样品上样至两相柱的反相部分,然后分别使用重标试剂(0.8%(v/v)CD2O和0.1 mol/L NaBH3CN溶于50 mmol/L NaAc溶液中,pH 5.7)和轻标试剂(0.8%(v/v)CH2O和0.1 mol/L NaBH3CN溶于50 mmol/L NaAc溶液中,pH 5.7)进行标记。在流速5 μ L/min 下标记30 min后用0.1% FA/H2O溶液平衡系统,将保留在反相柱上的磷酸肽样品洗脱至强阳离子交换(SCX)整体柱部分,进行强阳离子交换-反相(SCX-RP)二维液相色谱分离。采用12个盐梯度(0、20、30、50、60、70、80、90、100、140、180和500 mmol/L)进行分级,每个组分都进行145 min反向梯度分离后进入质谱。纳升级反相液相色谱-串联质谱联用系统是由四元梯度泵、自动进样器和LTQ-Orbitrap系统组成。毛细管分离柱的制作与样品1相同,流动相A为0.1%(v/v)甲酸水溶液,流动相B为0.1%(v/v)甲酸乙腈溶液。流动相分流后的流速为200 nL/min,反相分离梯度设置如下:0~3%的流动相B持续2 min,3%~25%的流动相B持续90 min,25%~80%的流动相B持续8 min,80%的流动相B持续10 min,80%~100%的流动相B持续5 min,最后100%的流动相B持续30 min。LTQ-Orbitrap质谱采用数据依赖模式进行质谱扫描,在每个一级谱图中根据信号强度选取前10个离子用碰撞诱导解离(CID)模式进行二级谱的碎裂。动态排除设置为:重复次数,2次;重复时间,30 s;动态排除时间,60 s。
所有的原始谱图文件(raw格式)都通过TPP软件(v4.6,http://tools.proteomecenter.org/software.php)转化为mgf格式进行数据库检索,其中母离子的相对分子质量范围是600~4200 ,每张谱图最少谱峰数为5,谱峰强度门槛值为0.01。人源蛋白质数据库HUMAN.fasta和小鼠蛋白质数据库MOUSE.fasta都从网站ftp://ftp.uniprot.org/pub/databases/uniprot/current_release/knowledgebase/proteomes/下载。位点注释的数据库按照2.1节描述的方法进行构建。我们通过正反数据库检索的方法计算肽段鉴定结果的假阳性率[20],具体的计算方法是FDR=FP/TP,其中FDR代表假阳性率,FP代表反库中鉴定的肽段数,TP代表正库中鉴定的肽段数。
通常蛋白质数据库中的序列由23种大写字母构成,其中3个字母“B”“Z”“X”具有特殊的含义。B代表天冬酰胺(符号为Asn或N)或天冬氨酸(符号为Asp或D)两种氨基酸残基;“Z”代表谷氨酰胺(符号Gln或Q)或谷氨酸(符号Glu或E)两种氨基酸残基;“X”代表任意氨基酸。另外还有3个大写字母“J”“O”“U”在数据库中很少出现,其中“J”不代表任何氨基酸;“O”和“U”分别代表吡咯赖氨酸和硒代半胱氨酸,在自然界中都很稀少。因此我们可以通过设定固定修饰改变“J”“O”“U”的相对分子质量,并用它们代替任何其他的氨基酸。为了使数据库检索软件识别这几种氨基酸,我们需要改写软件的配置文件。对于Mascot软件氨基酸信息保存在config\unimod.xml文件中,在此文件中加入相应的氨基酸信息就可以使Mascot软件识别“J”“O”“U”3种氨基酸。只需要分别设定-26.0520 Da、-136.1000 Da和 12.1097 Da的固定修饰,我们就可以使“J”“O”“U”分别具有和“S”“T”“Y”完全相同的相对分子质量并在数据库检索中代替这些氨基酸。
本文使用Mascot 2.3.0软件(Matrix Science)进行数据库的检索。对于样品1和样品2的两个数据集以下的检索参数是相同的:胰蛋白酶全酶切;最大漏切位点数为2;碎片离子质量偏差容忍度为0.8 Da。使用普通数据库的检索需设定一个固定修饰,即半胱氨酸碘代酰胺烷基化(+57.0215 Da);使用位点注释的数据库还需要额外的3个固定修饰,即J→S、O→T和U→Y来保证替代的氨基酸残基具有和原氨基酸完全相同的相对分子质量。样品1的母离子质量偏差容忍度为1 Da,样品2的母离子质量偏差容忍度为10×10-6(10 ppm)。样品1共设4个可变修饰,包括甲硫氨酸氧化(+15.9949 Da),丝氨酸、苏氨酸和酪氨酸磷酸化(+79.9663 Da);样品2除了这4个可变修饰外还增加4个同位素标记的可变修饰,包括赖氨酸和肽段N端的轻标(28.0313 Da)和重标(32.0564 Da)二甲基标记[21]。Mascot的软件检索结果以Dat格式导出,所有的Dat结果文件再用ArMone软件转化为ppl格式用于后续分析[22, 23]。
为了构建磷酸化位点注释的数据库,必须了解在生物学样品中哪些位点容易发生磷酸化修饰。虽然目前已经有一些软件工具用于磷酸化位点的预测[24, 25],但预测一个蛋白质数据库中的所有磷酸化位点仍然难以实现。另一种方法是从已有的磷酸化蛋白质组学研究数据中收集已知的磷酸化位点。由于磷酸化是研究最深入的翻译后修饰之一[26],磷酸化鉴定的数据来源非常丰富,因此这种方法比较容易实现。目前常用的磷酸化位点数据库包括Phospho.ELM[27] (http://phospho.elm.eu.org),PhosphoSitePlus[28] (http://www.phosphosite.org)和PHOSIDA[29] (http://www.phosida.de/)。从表1可以看出这3个数据库包含了大量的磷酸化位点数据。磷酸化位点的信息可以从以上数据库中提取,但在不同的数据库中由于蛋白质序列或者名称可能存在差异,因此把得到的这些位点信息统一到一个蛋白质数据库中存在困难。众所周知,磷酸化是由激酶调控的,且激酶的底物一般包含特定的序列,因此我们可以从数据库中只提取磷酸化位点周围的一小段氨基酸残基序列,而忽略此位点来源的蛋白质信息,仅用这一小段序列在新的蛋白质数据库中匹配潜在的磷酸化位点。我们从上述数据库中提取磷酸化位点左、右各6个氨基酸残基、总共13个残基长度的氨基酸序列用于磷酸化位点的匹配,最终从人源磷酸化位点数据库中得到了 186823 个非冗余的序列,从小鼠磷酸化位点数据库中得到了 83912 个非冗余的序列。这些序列被用于与待注释的蛋白质数据库中的所有蛋白质序列进行匹配,如果在蛋白质序列中发现了目标序列则其中心的丝氨酸、苏氨酸或酪氨酸将被注释为可被磷酸化修饰的候选位点。这种方法不仅保证了已被识别的磷酸化位点都包含在注释的数据库中,原先没有被鉴定到但是符合相同序列特征的位点也在新数据库中得到了注释。
在数据库检索中我们要保证只有候选位点可以被设定为可变修饰,而其他的丝氨酸、苏氨酸和酪氨酸则不发生可变修饰。因此在位点注释的数据库中,只有候选位点的丝氨酸、苏氨酸和酪氨酸仍然使用“S”“T”“Y”作为符号,而其他的则分别用“J”“O”“U”代替。在这种情况下数据库检索软件可以区分两种类型的氨基酸残基,并且可变修饰只发生在候选的磷酸化位点上。最终在人源蛋白质数据库中共有 368815 个丝氨酸、162424 个苏氨酸和 120369 个酪氨酸得到了注释并保留了“S”“T”“Y”的符号,其他的都被“J”“O”“U”代替,3种氨基酸残基加起来共有11.33%的磷酸化位点得到了保留(见表2);在小鼠蛋白质数据库中共有 151146 个丝氨酸、45862 个苏氨酸和 22083 个酪氨酸得到了注释并保留了“S”“T”“Y”的符号,总共5.37%的磷酸化位点得到了保留。同普通的蛋白质数据库相比,由于大部分的丝氨酸、苏氨酸和酪氨酸残基都不再能被磷酸化修饰,我们可以预计检索空间得到了大幅度的降低。
常见的数据库检索策略中,首先是将选择母离子与实际谱图的母离子质量偏差在一定范围内的所有候选肽段进行匹配。因此我们计算了一系列相对分子质量的候选肽段数目来估算磷酸化蛋白质组学研究中的检索空间。候选肽段分别来源于普通数据库和位点注释的数据库,计算机酶解蛋白质产生肽段的参数与常用的数据库检索策略中的参数设置相似。母离子质量偏差容忍度取10 ppm或者1 Da,分别对应质谱的高质量精度模式和低质量精度模式。酶切特异性为胰蛋白酶全酶切,酶切位点是赖氨酸或精氨酸且相邻残基不是脯氨酸,最多允许两个漏切位点。总共设定4个可变修饰,包括甲硫氨酸氧化,丝氨酸、苏氨酸和酪氨酸磷酸化。如图2所示,随着相对分子质量的增加,从两种数据库得到的候选肽段数目都有增加的趋势。在母离子质量偏差容忍度10 ppm的条件下,在低相对分子质量端检索空间的差距不太明显,而在高相对分子质量端保持1~2个数量级的差距;在母离子质量偏差容忍度1 Da的条件下,从两种数据库得到的候选肽段数目基本维持1个数量级的差距,这显示了使用位点注释的数据库确实使检索空间得到了降低。这是由于只保留了11.33%的可被磷酸化修饰的丝氨酸、苏氨酸和酪氨酸残基造成的。在测试中只添加了4种可变修饰,如果添加其他的可变修饰,例如同位素标记相关的可变修饰,位点注释的数据库降低检索空间的作用将更加明显。
我们首先使用位点注释的数据库对样品1得到的数据进行检索。样品1是HeLa细胞的酶解液,通过LTQ进行分析。这个数据集代表了低质量精度的数据集,并且用较大的母离子质量偏差容忍度(1 Da)进行检索。同样的数据也通过普通数据库进行检索作为对比。最终在假阳性率小于1.0%的条件下,分别利用普通数据库和位点注释的数据库鉴定到了782和933条肽段。并且共有769条肽段同时被两种方法鉴定,占普通数据库鉴定数目的98.3% ,使用位点注释的数据库使肽段的鉴定数目提高了19.4%(图3a)。同时我们还发现在使用普通数据库的鉴定结果中,97.4%(706/725)的磷酸化位点都包含在位点注释的数据库中,这说明对于此数据集位点注释的数据库基本保证了原数据库的完整性。可见,使用位点注释的数据库在保证鉴定可靠性的同时明显提升了磷酸肽鉴定的灵敏度。
我们用小鼠的磷酸化位点注释数据库对样品2得到的数据进行了分析。样品2是鼠肝组织的酶解液,并且进行了二甲基标记,最后用LTQ-Orbitrap进行了分析。由于使用的是高精度的质谱仪器,因此在数据库检索中母离子质量偏差容忍度设定为10 ppm。其他的数据库检索参数同上,而可变修饰增加了同位素标记引入的修饰。最终共有8个可变修饰,包括4个同位素标记修饰,分别是赖氨酸残基和肽段N端增加相对分子质量 28.0313 和 32.056407。同样是在假阳性率小于1.0%的条件下,分别利用普通数据库和位点注释的数据库鉴定到 12442 和 13467 条肽段,使用位点注释的数据库使肽段的鉴定数目增加了8.2% 。其中 12238 条肽段在两种方法中都得到鉴定,占普通数据库鉴定数目的98.4%(见图3b)。在使用普通数据库得到的鉴定结果中,有97.3%(2868/2948)的磷酸化位点都包含在位点注释的数据库中。虽然位点注释的数据库中没有包含的位点将不能得到鉴定,但是结果显示这一部分缺少的位点没有造成很大的影响。鉴定结果说明,同低质量精度的数据相比,在高质量精度条件下由可变修饰数目的增加带来的检索空间增大对结果的影响有限。虽然鉴定结果的提升没有样品1中明显,但位点注释的数据库同样取得了较好的结果。这说明位点注释的数据库适用于包含多种可变修饰的定量实验的结果分析。
以上结果说明,在较为宽松的母离子质量偏差容忍度(1 Da)条件下,使用普通的数据库进行磷酸化翻译后修饰的检索会极大地损失鉴定的灵敏度。这是由于在较大的检索空间中随机匹配的概率变得更大,必须设定较高的打分值门槛才能保证结果的可靠性。在较为严格的母离子质量偏差容忍度(10 ppm)条件下,如果设定过多的可变修饰也会使检索空间增加并对鉴定结果造成影响。如果使用适当的检索空间,随机匹配的概率将会降低,鉴定的灵敏度会因此得到提高。从以上实验结果中我们可以得出,位点注释的数据库非常适用于低分辨率的质谱数据检索,同时对于高精度质谱数据仍有一定的提升作用。
本文建立了一种位点注释的蛋白质数据库用于蛋白质组学中磷酸化位点的分析。使用此数据库进行检索,可以使可变修饰只设定于候选位点的氨基酸残基而不是所有对应的氨基酸残基。虽然与原始数据库相比只有一小部分的候选位点得到了保留,但是从我们的结果可以看出,对于普通的磷酸化蛋白质组学数据集位点注释的数据库包含的信息已经非常充分。虽然候选位点的信息来源于公共数据库中已发现的磷酸化位点,但在数据库的构建中符合序列特征的其他位点也都被添加进来。因此,通过位点注释的数据库同样可以发现新的磷酸化位点。通过对特定相对分子质量下候选肽段数目的考察发现,同普通的蛋白质数据库相比,使用位点注释的数据库进行检索明显使检索空间得到了降低。我们分别用低精度质谱和高精度质谱得到的数据对位点注释的数据库进行了考察,证明使用位点注释的数据库起到了提高磷酸化肽段鉴定灵敏度的作用。
由于在数据库检索中检索空间的大小对鉴定结果有着重要的影响,因此,建立针对翻译后修饰鉴定的数据库具有重要的意义。这种构建特异性的数据库的方法不局限于磷酸化位点的分析,对于其他翻译后修饰的鉴定同样适用。因此,基于位点注释的数据库的检索策略是一种非常具有潜力的方法,在未来的蛋白质翻译后修饰研究中将得到更加广泛的应用。