蛋白质翻译后修饰几乎参与了全部的细胞生命活动过程,在细胞生理平衡调节中起着重要作用,例如改变蛋白质的三维立体结构从而调节酶的活性、迅速关闭或开启信号通路等[1]。随着蛋白质组学技术的发展,人们对于蛋白质的研究手段也越来越多,蛋白质组研究的应用范围也越来越广。基于质谱的蛋白质组学方法不仅能鉴定蛋白质的种类,还能对蛋白质及其翻译后修饰进行相对和绝对定量[2]。生物质谱技术逐渐应用于临床诊断,其高精度、高通量等优点使其成为精准医疗研究的核心技术之一[3]。
高精度的质谱数据需要用专业的分析软件来处理,以完成对蛋白质及其翻译后修饰的鉴定和定量分析。目前在蛋白质组学研究领域,Mascot和MaxQuant是两种比较常用的蛋白质组数据库搜索分析软件。前者主要用于蛋白质的鉴定分析[4],可将鉴定到的肽段及其翻译后修饰清晰细致地呈现出来;后者为德国慕尼黑马普生化研究所Matthias Mann实验室开发的集蛋白质数据库搜索、蛋白质定量等为一体的生物信息学分析软件,在蛋白质组学领域应用广泛,支持稳定同位素标记细胞培养技术(SILAC)、串联质谱标签(TMT)等多种标记定量和非标记定量方法[5, 6]。其中SILAC技术可以通过质量的差异区分加药处理前后的多肽,但对于临床样本这类无法进行代谢标记的样本分析具有局限性[7]。TMT标记属于体外化学标记,样本来源不受限制,但在进行定量分析时,其产生的报告离子容易受到其他杂离子的干扰,从而影响其定量的准确性。此外,该定量标记试剂昂贵,实验操作复杂,这些均在一定程度上限制了该方法的普遍应用。丙酰化法是在进行体内或体外标记的基础上使肽段的赖氨酸丙酰化,进而增加酶切后肽段长度,更利于质谱分析,其局限性在于无法进行丙酰化分析[8]。而无标记定量则通过对样本进行平行操作和检测,最终根据质谱检测的信号强度、色谱峰面积、谱图数等进行对比分析,该方法的使用不受样本来源的限制,且不需要对要分析的样本进行额外的标记,实验操作简单,但该方法对实验操作的一致性要求较高。总体说来,SILAC等体内标记法无法对临床样本进行标记,TMT等体外标记法操作复杂、代价过高,而无标记定量则在很大程度上弥补了标记定量的不足,因此发展非标定量方法的意义重大。
表观遗传调节是细胞维持生理平衡的重要因素之一,组蛋白翻译后修饰作为一种重要的表观遗传学修饰,其动态变化能引起与其紧邻的DNA链微环境变化或影响其与信号蛋白的结合,从而抑制或促进基因的表达,影响生物体的新陈代谢平衡,是导致肿瘤等重要疾病发生的重要因素[8-11]。所以,对组蛋白翻译后修饰的研究具有非常重要的生物学意义。大多数翻译后修饰都发生在核心组蛋白(H2A、H2B、H3、H4及其变体)上,比如甲基化、乙酰化、丙酰化、丁酰化、磷酸化、泛素化和类泛素化[10, 12-15]。随着生物学家不断发现许多疾病的发生与组蛋白翻译后修饰的变化有关,组蛋白翻译后修饰定量显得越来越重要[16-21]。在生命科学的研究中,人们越来越需要对组蛋白的翻译后修饰进行定量,而基于质谱的蛋白质组学方法可以同时对组蛋白的种类和翻译后修饰进行定性和定量,是组蛋白翻译后修饰定量分析中应用最为广泛和可靠的方法之一[22]。
虽然,目前有多种程序软件可以实现对组蛋白的翻译后修饰进行自动的定量分析,比如上文介绍的MaxQuant软件等,但是由于组蛋白的翻译后修饰非常丰富,含精氨酸和赖氨酸较多,酶切消化后产生的肽段类型很多,容易出现同一种修饰发生在肽段氨基酸序列的不同位置上的现象,比如:乙酰化修饰(ac)的肽段PDPAK(ac)SAPAPK(ac)KGSK和PDPAK(ac)SAPAPKK(ac)GSK,两者不仅分子质量相同,而且质谱碎裂行为较为接近,因此在对组蛋白的翻译后修饰定量时,用软件进行自动化定量时较容易发生错误[23]。所以若要更准确地定量组蛋白的翻译后修饰还需要严格的手工检查、纠错,甚至重新定量。
在数据分析尺度上基于质谱的组蛋白翻译后修饰的无标定量方法主要分为3种:谱图计数法、峰面积积分法和信号强度法[7]。前者是以质谱扫描到的某翻译后修饰谱图的次数代表其丰度,后两者分别是以翻译后修饰肽段的m/z所在色谱峰的面积和强度来代表其丰度。目前,学术界大多使用以上3种定量方法对组蛋白翻译后修饰进行定量,但哪种定量方法更可靠尚未见系统性的详细报道。找到更可靠的定量方法有利于更准确地定量组蛋白翻译后修饰,从而更准确地对疾病进行分析,有利于精准医疗的实施。由于SILAC定量实验技术成熟,且蛋白质在被胰蛋白酶消化之前已混匀,避免了后续实验的各种损失造成的实验误差[24]。在细胞水平的修饰谱相对定量分析中,SILAC是最为准确的定量方法之一。由于无标定量方法对实验操作的一致性要求较高,SILAC标记的两组样本在实验操作起始时就已在细胞水平等比混匀,因此实验的定量结果不会受后续实验过程的影响;并且在LC-MS/MS检测时待测样本中成对的轻重标记离子能够被共洗脱并同时被质谱检测,从而确保了实验结果的准确性;且另一方面,SILAC相对于其他标记方法来说,实验操作简单,成本低。所以,我们利用SILAC标记定量实验数据评估3种无标定量方法的稳定性与准确性,从而确定最适宜组蛋白修饰谱的非标定量分析方法。
蛋白A琼脂糖纯化树脂(Protein A agarose beads,GE Healthcare,USA),C18 Zip Tips(Millipore,USA),胰蛋白酶(Promega,USA)。SAHA(去乙酰化酶抑制剂)试剂、三氯乙酸(TFA)、甲酸、尼克酰胺、乙腈和丙酮等化学试剂均购于Sigma-Aldrich(USA)。
人骨髓神经母细胞瘤细胞(SH-SY5Y)所用培养基为加入了2 mmol/L L-谷氨酰胺、100 U/mL青霉素、0.1 mg/mL链霉素和10% FBS(马血清)的杜氏改良Eagle培养基:营养混合物F-12(DMEM/F12)。SH-SY5Y细胞培养于SILAC培养基中,细胞被分为两份,于60 mm培养皿分别标记重标(13C6-Lys)和轻标(12C6-Lys),至少传代6次,直到细胞密度达到90%,并检测标记效率。未被SAHA处理的SH-SY5Y细胞培养于加入了重同位素标记13C6-Lys的DMEM/F12培养基,被SAHA处理过的SH-SY5Y细胞培养于加入了正常赖氨酸12C6-Lys的DMEM/F12培养基。免疫共沉淀实验中,4份培养于15 cm培养皿的SH-SY5Y细胞被用于提取组蛋白,细胞密度为90%,其中两份为轻标细胞,两份为重标细胞。轻标、重标细胞以1:1的细胞数比例混合,混合后进行核心组蛋白的提取。细胞标记率(>97%)在蛋白质酶解和质谱实验之前由质谱确定。
核心组蛋白用酸萃取法抽提,抽提出的蛋白质用胰蛋白酶进行酶解。首先,被萃取出的核心组蛋白用100 mmol/L NH4HCO3(pH 8.0)重悬,将胰蛋白酶加入重悬液,酶与底物的质量比为1:50,37 ℃下孵育16 h。之后再以1:100(酶与底物的质量比)的比例将胰蛋白酶加入样品中,于37 ℃进一步酶解3 h,保证酶解完全。
1 mg组蛋白酶解后多肽重悬于200 μL 0.5%(v/v)NETN缓冲液(Nonidet P-40 (NP-40)+100 mmol/L NaCl+20 mmol/L Tris-Cl(pH 8.0)+0.5 mmol/L EDTA(乙二胺四乙酸)),与50 μL固定于蛋白A琼脂糖珠上的赖氨酸乙酰化修饰的泛抗体(PTM Biolabs,USA)混匀,4 ℃下孵育4 h,孵育期间轻轻摇晃。琼脂糖珠用NETN缓冲液洗3次,0.5%(v/v)ENT缓冲液(100 mmol/L NaCl+20 mmol/L Tris-Cl (pH 8.0)+0.5 mmol/L EDTA)洗2次,水洗1次。结合在琼脂糖珠上的多肽用0.1%(v/v)TFA洗脱,在真空离心机中转干。
采用EASY-nLC 1000高效液相色谱串联Orbitrap Elite质谱仪(Thermo Fisher Scientific,USA)系统对样本进行分析。转干后的多肽样品于流动相A(0.1%(v/v)甲酸水溶液)中溶解,用C18 Zip Tips除盐。除盐后再次转干,溶于10 μL流动相A,取2 μL溶解后的多肽样品注射到EASY-nLC 1000系统中进行分离。自制毛细管柱(100 mm×75 μm)填料为C18(粒径3 μm,孔径9 nm,Dikma Technologies,USA)。液相色谱分离由初始的5%流动相B(含0.1%(v/v)甲酸、95%(v/v)乙腈的水溶液)在2 h内梯度变化至95%流动相B,流速为300 nL/min。一级质谱扫描范围为m/z 300~1700,一级质谱分辨率R=120000(m/z 400);选取丰度最高的前13个离子进行二级质谱碎裂扫描,采用CID(collisionally activated dissociation)碎片裂解模式,碰撞归一化能量为35%。自动增益控制全扫描参数为1000000,最大进样时间200 ms;二级质谱参数为50000,最大进样时间50 ms,动态排除时间设置为45 s。每组样本进行3次技术重复。
MS/MS(串联质谱仪)的谱图数据由Mascot(v 2.4.0)软件进行搜索分析,采用人类组蛋白UniProt数据库,之后进行无标定量。数据库搜索参数设置如下:胰蛋白酶酶切,最大漏切位点设为5个,还原烷基化被设为固定修饰,赖氨酸乙酰化、甲硫氨酸氧化、赖氨酸重标(13C6-Lys)和赖氨酸重标+赖氨酸乙酰化被设为可变修饰,肽段一级离子的质量偏差设为10×10-6(10 ppm),碎片离子的质量偏差设为0.5 Da。离子分数采用20分筛选(cut-off),并对过滤后的谱图进一步进行手工检查和确认。对Mascot鉴定出的具有乙酰化修饰的肽段,分别使用谱图计数法、峰面积积分法、信号强度法这3种不同的手工检测方法进行相对定量。C-末端赖氨酸的乙酰化修饰被手动排除,保证定量的准确性。其中,谱图计数法是利用鉴定到的带有乙酰化修饰的肽段的总谱图数量进行相对定量,重标肽段与轻标肽段谱图总数的比值代表相应修饰位点在SAHA处理前后的相对变化;信号强度法是利用鉴定到的带有乙酰化修饰的肽段的离子总强度进行相对定量,重标肽段与轻标肽段离子总强度的比值代表相应修饰位点在SAHA处理前后的相对变化;峰面积积分法是利用鉴定到的带有乙酰化修饰的肽段的色谱峰总面积进行相对定量,重标肽段与轻标肽段的峰总面积的比值代表相应修饰位点在SAHA处理前后的相对变化。3次技术重复的质谱数据分别由3种不同的无标定量方法进行定量,对比每种定量方法在3次技术重复实验中所得结果的标准差(SD),确定最可靠的无标定量方法。
为了达到能比较3种不同无标定量方法可靠性的目的,我们选用SAHA处理SH-SY5Y细胞,并进行SILAC定量实验,以3种不同的无标定量方法对实验数据进行分析。SAHA是一种已被临床批准的治疗皮肤性T细胞淋巴瘤的药物,是已知的组蛋白去乙酰化酶泛抑制剂。实验预期是经SAHA处理后,组蛋白乙酰化水平会普遍升高,即组蛋白乙酰化修饰的H/L比值(H:重标细胞(对照组);L:轻标细胞(经过SAHA处理))会普遍小于1。实验数据显示,共鉴定出25个赖氨酸乙酰化位点。其中,组蛋白H1上鉴定到1个乙酰化位点,组蛋白H2上鉴定到13个乙酰化位点,组蛋白H3上鉴定到5个乙酰化位点,组蛋白H4上鉴定到6个乙酰化位点。20个乙酰化位点(H2AK4、H2AK5、H2AK7、H2AK11、H2AK13、H2BK5、H2BK12、H2BK15、H2BK16、H2BK20、H3K9、H3K14、H3K18、H3K23、H4K5、H4K8、H4K12和H4K16)的乙酰化水平显著升高(见表S1,http://www.chrom-China.com/UserFiles/File/Supplemental_SI.xls),这与已报道[25]的SAHA是组蛋白去乙酰化酶的泛抑制剂这一事实相吻合,达到了预期实验目的,在一定程度上确定了实验数据的可靠性和正确性。
3种定量方法得到的分析结果具有相对的一致性,从不同无标定量方法的散点图中可以明显地观察到组蛋白的乙酰化水平升高(图 1)。有趣的是,信号强度法和峰面积积分法的分析结果很相似,代表信号强度法的点和代表峰面积积分法的点几乎都是紧紧相邻,这预示着它们的SD值可能相近。而代表谱图计数法的点与前两者的差距较大,在对H1K62、H2BK120和H3K79这3个乙酰化修饰的定量上,谱图数定量法与其他两种定量方法的定量结果完全不一致。
不同定量方法的可靠性通过3次技术重复实验数据标准差的几何平均数和算术平均数来表示。如表 1所示,3种定量方法的SD值普遍较低。但是,谱图计数法对H2AK13和H2BK108这两个位点的定量很不稳定,SD值偏大,而且谱图计数法的SD值在12个乙酰化修饰位点(H2AK4、H2AK7、H2AK11、H2AK13、H2BK20、H2BK108、H3K9、H3K18、H4K5、H4K8、H4K12和H4K16)的定量结果上明显高于峰面积积分法和信号强度法。峰面积积分法和信号强度法的SD值比较接近,两者在18个乙酰化修饰位点(H2AK4、H2AK7、H2AK11、H2AK13、H2BK5、H2BK12、H2BK15、H2BK16、H2BK20、H2BK108、H2BK120、H3K9、H3K18、H3K23、H4K5、H4K8、H4K12和H4K16)定量结果上的SD值差别较小,不超过1倍。
3种定量方法SD的算术平均数:谱图计数法为0.184,信号强度法为0.089,峰面积积分法为0.071;其中峰面积积分法的最低。SD值的几何平均数:谱图计数法为0.141,信号强度法为0.079,峰面积积分法为0.064;其中峰面积积分的最低(见图 2)。对3种方法的SD值、SD的算术平均数和几何平均数进行对比分析,峰面积积分法的可靠性最高。此外,通过箱线图可以明显看出谱图计数法的SD值不集中,且整体对比峰面积积分法和信号强度法的SD值偏高,可靠性不如其他两种方法,尽管峰面积积分法和信号强度法的SD值在中位数上的差别较小,但峰面积积分法的SD值更加集中在较低水平,从而更可靠(见图 3)。
本实验利用SAHA对组蛋白乙酰化修饰水平的显著抑制性,通过SILAC实验产生能准确反映无标定量方法可靠性的大量可分析数据。结果显示,利用3种无标定量方法对SAHA处理的细胞进行分析,均能分析出SAHA试剂引起组蛋白去乙酰化修饰的变化,且定量的结果具有较高的一致性。此外,在进行数据定量分析时,定量结果的SD值在一定程度上也反映了被分析数据本身的可靠程度,SD值越低,则定量的可靠性越高。因此我们进一步对比了3种定量法在组蛋白乙酰化修饰位点定量结果的SD值,结果发现3种无标定量方法的SD值存在一定的差异。我们发现其中用谱图计数法定量的可靠性较差,数据波动大,峰面积积分法和信号强度法的SD值差别小。实验数据显示峰面积积分法为最可靠、准确的无标定量方法。
随着蛋白质组学的快速发展,基于质谱的蛋白质组学逐渐应用于临床研究,精准医疗研究的提出也在一定程度上促进了蛋白质组学的发展。由于许多样本都难以进行同位素标记实验,尤其是对临床样本、大规模样本的组蛋白修饰谱分析,既不适于体内标记,体外标记成本又高,因此无标定量方法显得尤为重要,特别是在大规模蛋白质组学研究中将会被更为广泛地应用。本实验研究的结果对于无标记样本的定量分析,尤其是针对难以进行同位素标记实验的样本定量分析时具有重要参考意义。