单核苷酸多态性(single nucleotide polymorphism, SNP)是单个核苷酸变异引起的多态性[1]。近年来, SNP被广泛应用于族群地域推断、表型特征刻画等研究, 研究人员报道了大量基于SNP的祖先信息位点(ancestry informative markers, AIMs)用于人群地域来源的推断及洲际大人群区分[2-8]。如:Frudakis等[2]的56-SNPs、Phillips等[3]的34-SNPs、本项目组[4, 5]的27-SNPs等用于非洲、东亚和欧洲3大人群的推断。Kosoy等[6, 7]的128-SNPs和Kidd等[8]的55-SNPs在人群区分度方面有所改进, 实现了非洲、欧洲、南亚、东亚、大洋洲、美洲人群区分, 但没有实现东亚亚人群的进一步区分。现有的商业化试剂[9, 10]主要采用文献报道的位点, 在亚人群的区分度上并无明显改变。本项目组[11]在2016年研究报道了74个SNP的位点组合, 可以实现东亚南北方人群的区分。但是由于尚未构建一体化的检测体系, 限制了其在法医案件检材中的应用。
本文采用我国自主研发的微流控SNP芯片(iMAP)系统进行74个SNP位点复合检测体系的构建。首先, 将74种用于SNP检测的引物预固定到微流控芯片的反应孔中。在进行SNP检测时, 将待检样本注入芯片再离心分配、隔离反应孔, 然后即可以通过平板PCR进行扩增分型, 最后基于荧光扫描来获得检测信号并完成检测分型。最终优化出72个SNPs的扩增体系, 并成功地将其应用于族群推断。与其他方法相比, 该方法只需2.5 h即可完成SNP的检测和分型, 每个反应孔所需反应预混液体积约1 μL。
热封仪(北京博奥晶典); 平板PCR仪(北京博奥晶典); LuxScan-D激光共聚焦扫描仪(北京博奥晶典); MassArray® DNA质谱阵列基因分析系统(美国Agena公司); QIAamp DNA Blood Midi Kit(静脉血基因组DNA提取试剂盒, 德国Qiagen公司); NanoDrop2000c分光光度计(美国Thermo公司); MagAttract M48 DNA Manual Kit(组织/细胞基因组DNA提取试剂盒, 德国Qiagen公司); 7500实时荧光定量PCR仪(美国Thermo公司); 复合引物(上海生工生物工程有限公司); KASP V4.0 2X Master mix(竞争性等位基因特异性聚合酶链式反应体系预混液, 英国LGC公司); SNP Typer软件(北京博奥晶典); DNA Ancetry Analyzer V1.0(族群来源分析系统, 北京公安部物证鉴定中心)。
参考数据库中57个群体的3328份样本来源于文献[11]。107份无关个体的静脉血DNA来源于国家科技资源共享服务平台计划项目(编号:YCZYPT[2017]01-3和2017JB025), 所有样本对象均签署知情同意书, 这些样本用于本课题的复合体系构建, 其中52份样本用于准确性验证, 20份有明确族群来源信息的样本用于验证族群推断的准确性(见表 1)。
本课题选取了来源于文献[11]的74个SNP位点和文献[12]的1个SNP位点rs174592共计75个SNP位点, 通过实验的筛选, 剔除扩增性能不稳定的3个位点如表 2, 最终保留文献[11]的71个SNP位点和文献[12]的1个SNP位点共计72个位点。见表 2。
本实验的检测对象为静脉血提取的基因组DNA, 采用QIAamp DNA Blood Midi Kit提取, 使用NanoDrop2000c分光光度计定量, 放置在4 ℃冰箱中备用; 血斑、血卡、口腔拭子、接触性检材以及同一样本来源人的心、肝、肾、脾、肺、皮肤、肌肉、软骨、大脑各组织, 采用MagAttract M48 DNA Manual Kit提取DNA, 血斑剪取的大小约为20 cm2, 血卡剪取大小约为8 cm2, 剪取擦拭口腔棉签的整个表面以及剪取擦拭鼠标棉签的整个表面, 同一样本来源人的心、肝、肾、脾、肺、皮肤、肌肉、软骨、大脑各组织、血斑、血卡使用NanoDrop2000c分光光度计定量, 口腔拭子、接触性检材使用7500实时荧光定量PCR仪定量。
使用软件Primer Premier 5.0设计SNP位点的引物。所有引物在生工生物工程有限公司进行合成。位点名称、扩增产物片段长度及等位基因信息见表 2。
芯片在使用前每孔固定0.2 μL复合引物。使用时, 配制含有模板的扩增体系150 μL, 其中包含75 μL KASP V4.0 2X Master mix、20 μL模板DNA(7.5 ng/μL)和55 μL超净水; 将扩增体系注入芯片后以4000 r/min的转速离心2 min完成样本到反应孔中的分配; 之后用热封仪隔离芯片的各个反应孔; 完成隔离的芯片放置在平板PCR仪上进行PCR温度循环(参数为95 ℃15 min; 95 ℃ 20 s, 61~55 ℃ 1 min, 10个循环, 每个循环降0.6 ℃; 95 ℃ 20 s, 55 ℃ 1 min, 29个循环; 4 ℃保持); 完成扩增后, 芯片通过激光共聚焦扫描仪扫描并获取各个反应孔的荧光信号, 使用在线软件http://snptyper.capitalbiotech.online/进行基因分型获得各个位点的分型结果用于后续族群推断。
微流控SNP芯片通过激光共聚焦扫描仪扫描获得52份样品的3900个基因型, 扫描参数设置为Cyanine 5: power51, PMT515; Cyanine 3: power50, PMT500。使用SNP Typer软件判别SNP位点的分型, 具体如下:提取FAM(红色)通道S-B_Median-635和HEX(绿色)通道的S-B_Median-532的荧光值(S-B_Median是荧光值减去背景值的中位值)、Ratio_Medians-(635/532)值(Ratio_Medians-(635/532)=S-B_Median-635/S-B_Median-532), 判别标准如下[13-15]。
判断阳性的标准有两个:(1)信噪比:S-B_Median与阴性对照(不加引物)的比值应该大于2, 该标准是为了排除假阳性信号; (2)S-B_Median大于4000。同时满足这两个条件后, 该位点的信号才可以算作阳性。
分型标准:(1)杂合子:如果两个等位基因都满足阳性标准, 且Ratio_Medians-(635/532)在0.5~2之间则为杂合子。(2)纯合子:如果某个突变位点, 只有一个等位基因满足阳性标准, 则为纯合子; 或者两个等位基因都满足阳性标准且Ratio_Medians-(635/532)>2或<0.5,则分别为FAM通道的纯合子或者是HEX通道的纯合子。
随机抽取52份样本用微流控芯片检测72个位点的分型, 检测结果与MassArray[16]所测的结果进行比对; 将芯片检测结果与MassArray分型不一致的样本用第一代基因测序(又名sanger法测序和双脱氧末端终止法测序, 毛细管电泳法)验证。
随机抽取5份样本, 做DNA梯度浓度稀释, 150 μL的体系中DNA模板最终的量分别为1500、750、300、150、75 ng, 每个浓度重复检验3次, 验证芯片对每个DNA梯度浓度的检测能力。
随机抽取3份样本, 每份样本做3次重复用于验证芯片分型结果的稳定性。如果3次独立重复实验之间结果相同, 且荧光值的平均标准差小于4000, 则这3次实验结果的重复率为100%。
为了验证芯片是否适合各种案件检材, 采用实验室的一名志愿者(编号:HMS)的样本, 分别模拟血斑、血卡、口腔拭子、接触性检材等现场检材, 所有检材在晾干两周后提取DNA, 用芯片检测。其中血斑的载体是医用纱布, 接触性检材的制备方法是:用医用棉签蘸少量超净水轻轻擦拭HMS的常用鼠标, 采用MagAttract M48 DNA Manual Kit提取DNA。
使用芯片检测同一样本来源人的心、肝、肾、脾、肺、皮肤、肌肉、软骨、大脑各组织的DNA, 验证芯片检测结果的一致性。
使用芯片检测20份有明确族群来源信息的样本的SNPs分型, 用族群推断软件DNA Ancetry Analyzer V1.0计算群体的匹配概率(population assignment match probability, MP)和似然比(likelihood ratio, LR)[5, 17]。当LR>100时, MP值排在第一位的人群为未知个体的来源人群; 当LR<100时, 应综合样本的祖先成分比例去分析, 祖先成分比例排在第一位的人群为未知个体的来源人群[11]。用Structure V2.3.4软件[17, 18]计算样本的祖先成分比例, K=5, 6, 7, 8, 9, 10, 11, 其中K是运行的次数, 参数设置10000 burn-ins, 10000 MCMC, 10 interaction。
芯片检测结果如图 1a所示, 扩增完的芯片各反应孔里的体系饱满, 说明没发生泄露挥发等问题, 两种颜色分别代表FAM和HEX通道的荧光值, 两种颜色分别对应一个SNP位点的两种等位基因, 其中NC是不加引物时的阴性结果。图 1b是SNP位点rs9319336在98份样本中的分型散点图, 说明该位点的基因分型在98份样本中全部检出, SNP位点编号对应rs号见表 2。
本课题将竞争性等位基因特异性PCR(KASP)方法与微流控SNP检测技术进行结合, 应用于法医族群推断的研究。在微流控芯片的每个反应孔中放置一个位点的引物, 可以防止不同位点引物间的相关干扰; 芯片是一次性使用, 可以有效防止样本间污染, 提高芯片检测基因型的准确性。目前已有的大量SNP检测技术主要包括基于PCR的等位基因特异性扩增法、TaqMan探针法、单碱基引物延伸法、基于质谱的MassArray系统、芯片法、下一代测序法等, 其中芯片法、下一代测序法的优势在于高通量SNP位点检测。然而下一代测序技术目前主要以国外平台为主, 价格昂贵, 而且检测时间较长。为此, 我们选择了自主研发的微流控芯片技术进行体系构建, 整个检测和分型过程在2.5 h左右即可完成, 与MassArray系统、单碱基引物延伸法以及下一代测序等技术比较, 检测时间显著缩短。
使用构建成功的微流控芯片复合体系对52份样本的72个位点进行检测, 检出率为100%。比对微流控SNP芯片(iMAP)与MassArray这两个平台对52个样本的72个位点的检测结果, 有71个位点在所有样本中两个平台的检测结果一致, 而1个位点在部分样本中两个平台检测不一致, 位点检测的一致率为98.6%。对于这些有1个位点检测不一致的样本, 我们用一代测序进行最终确认, 发现一代测序的检测结果与芯片检测结果一致。
通过与MassArray检测结果进行比对, 出现不一致的结果时使用第一代基因测序进行验证, 发现检测结果正确率达到100%。
结果显示5份样本的DNA模板量在150 ng时仍然能够正确检测72个位点, 但是DNA量在75 ng时, 出现3个位点信号丢失, 说明目前微流控SNP平台检测人DNA模板量最低限是150 ng, 每个反应孔需要DNA 1.28 ng。以9号样本为例, 随着DNA量的逐渐降低, 每个位点所对应的荧光值变化不大, 9号样本在75 ng时60、66、71号这3个位点的信号值开始丢失(见图 2)。
芯片的检出限是150 ng, 针对此不足之处, 未来拟通过预扩增等方法提升芯片检测的灵敏度。
将同一个样本(4号样本)进行3次重复实验, 根据之前设定的阈值, 3次重复实验检测的基因型结果相同,荧光信号值的平均标准差小于4000, 证明重复率达到100%。这3次实验结果的重复率为100%, 说明芯片的稳定性、重复性良好(见图 3)。
除了对血液样本提取的基因组DNA进行SNP检测之外, 还对不同法医检材样本提取的基因组DNA进行了SNP检测, 包括血斑、血卡、口腔拭子和接触性检材。其中血斑、血卡提取的基因组DNA定量后的质量浓度分别为25.2 ng/μL和11.3 ng/μL, 分别取体积6 μL和13.3 μL, 基因组DNA的总量分别为151.2 ng和150.3 ng, 达到了150 ng的检测阈值。口腔拭子、接触性检材定量的浓度分别为7.51 ng/μL和0.036 ng/μL, 分别取体积20 μL, 总量分别为150.2 ng和0.72 ng, 口腔拭子的DNA总量达到了150 ng的检测阈值, 接触性检材的DNA总量低于芯片的检出限150 ng, 所以无法满足微流控芯片平台检测的需要。对于血斑、血卡、口腔拭子, 用芯片所测72个位点结果与MassArray检测结果一致(见图 4)。
该芯片体系可适合多种法医检材的检测需要, 如静脉血、血斑、血卡、口腔拭子等样本, 但是一些提取DNA含量在150 ng以下的检材, 比如接触性检材, 无法满足微流控芯片平台检测的需要。
9份组织(心、肝、肾、皮肤、软骨、大脑、肌肉、脾、肺)DNA的72位点的检出率是100%, 所有SNP位点分型在9份组织样本中都一致(见图 5)。
组织同一性验证表明芯片检测同一人份的不同组织样本获得的SNP分型一致。
分析用Structure得到的20份样本的祖先成分, 在K=10时20个样本在东亚的祖先成分相比其他族群所占的比例是最高的(见表 3), 初步推断20个样本全部来自于东亚。
根据数据库中72个SNPs等位基因频率, 用DNA Ancetry Analyzer V1.0计算出20份样本的群体匹配概率和似然比(见表 4), 似然比不是指数值, 而是指排在第一位的群体匹配概率与第二位群体匹配概率的比值, 群体匹配概率和似然比的意义是推断待测样本的祖先来源, 表 4中列出20份样本群体匹配概率排在前5的洲际, 从数据可以看出, 20个样本似然比最大是东亚, 群体匹配概率最高的是东亚, 初步推断20份样本全部来自于东亚。按照表 4的结果, 样本5、6、20似然比均小于100, 不能排除其来自东亚或东南亚; 综合样本5、6、20的祖先成分去判断, 样本5、6、20排在第一位的祖先成分都是东亚, 所以最终判断20份样本全部来自于东亚。
使用20份样本的分型结果进行族群推断, 祖先成分及似然比结果显示20份样本来源于东亚, 与样本的实际来源一致。
微流控芯片主要应用于临床诊断等领域[19], 本研究建立了72-plex-SNPs的微流控芯片族群推断系统, 该芯片体系具有如下优势:(1)芯片耗材、检测仪器均为国产, 检测成本较低; (2)芯片检测速度快, 2.5 h可以完成72个SNP位点的检测分型; (3)每个SNP位点分布在不同的反应孔中, 相互隔离, 减少了不同位点引物之间的相关干扰, 复合体系构建难度降低。(4)检测流程简单, 便于基于此芯片构建“样本进-结果出”的一体化微流控检测装备。本研究初步尝试成功构建了72个SNP位点的芯片体系, 各项指标显示可以用于法医DNA检验, 非常容易在国内法医DNA实验室推广应用。但是目前的芯片对DNA的需求量还较大, 不适合于微量样本的检测, 未来还需要在提高灵敏度方面进行进一步的改进; 另外, 还需在芯片点样自动化、集成化一体化检测仪器研究方面进行努力[20, 21]。