ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

DAP-seq技术实操指南:从建库到生信分析,绕开ChIP-seq抗体的全基因组结合位点方案

2026/9/24 22:39:26 拓冰建站 浏览量
DAP-seq技术实操指南:从建库到生信分析,绕开ChIP-seq抗体的全基因组结合位点方案 转录因子结合位点研究这行当里ChIP-seq 几乎成了默认选项。但它真的有传说中那么顺手吗我在非模式植物上吃过亏一个转录因子的抗体预约了三个月供应商中途告诉我做不了换做 DAP-seq我只需要把蛋白体外表达出来加上亲和标签和基因组 DNA 文库混一混、洗一洗、测一测就能在全基因组范围内拿到结合位点。DAP-seq 全称 DNA 亲和纯化测序优势不在于炫技而在于把传统 ChIP-seq 最大的两个堵点——高质量抗体和体内交联——直接绕开了。这篇文章我会把 DAP-seq 的湿实验和干实验流程掰开揉碎讲清楚每个环节为什么这么做以及我实际踩过的坑。无论你是刚进实验室的研究生还是已经跑过几轮 ChIP-seq 想换方案的老手我觉得都应该认真比一比 DAP-seq 这个选项。1. 被 ChIP-seq 的抗体卡住三次之后我才认真读 DAP-seq 的设计逻辑1.1 ChIP-seq 在实际项目中到底难在哪ChIP-seq 的全称是染色质免疫沉淀测序。它的逻辑是在活细胞内用甲醛把蛋白质和 DNA 交联在一起然后把染色质打断用针对目标蛋白的抗体把这个蛋白连同它结合的那段 DNA 一起沉淀下来最后把 DNA 收集起来测序。听起来很顺真做起来到处都是坎。第一个坎就是抗体。要拿到一支 ChIP 级别的抗体你得知道这个转录因子的抗原表位得免疫动物、纯化血清、做 ChIP 级别的验证整个周期短则三四个月长则一年如果碰上同源蛋白多、序列相似度高的情况抗体特异性还要打折扣。我在一个水稻转录因子上就栽过跟头抗体公司收了钱先出一版多克隆抗体结果 ELISA 阳性、ChIP 出来背景比信号还高换一个单克隆重新排名额又是三个月。第二个坎是交联条件。甲醛交联的时间和浓度需要针对每个细胞类型优化交联不足拉不到靶点交联过度又会掩盖表位。等你好不容易拿到了好看的峰图你得到的其实是在活细胞里该转录因子和这些位点发生过接近的证据并不直接等于该转录因子体外直接结合。1.2 DAP-seq 绕开了什么又保留了什么DAP-seq 换了一条路。它的核心是把转录因子在体外通过无细胞转录翻译系统表达出来在蛋白上挂一个亲和标签比如 HALO 或 GFP再将这个重组蛋白与一个已经接好测序接头的基因组 DNA 文库直接孵育。转录因子会特异性地跟基因组上的目标序列结合随后用标签对应的磁珠进行亲和纯化洗掉非特异结合的 DNA把留下的 DNA 洗脱、扩增、测序。数据就是全基因组上该转录因子的结合位点。和 ChIP-seq 相比它最关键的变化是抗体这一步被标签亲和纯化取代了。一支抗体对应一个蛋白、要单独开发而 HALO 标签或 GFP 磁珠是通用耗材谁都能买到换一个转录因子只需要换表达载体。另一个变化是不需要交联因为结合反应发生在体外也就不存在交联过度导致表位被遮住的问题。它保留的好处是整套流程仍然在全基因组层面扫描不需要预知结合基序依然是无偏的。当然DAP-seq 也不是万能药。因为它脱离了活细胞环境结合位点不受染色质可及性的限制所以它拿到的是在裸 DNA 上可能的结合位点而不是细胞内真实占位的位点。这两者之间有差异最后要怎么解读我会在第五章讲验证策略时再说。1.3 一张表看清 DAP-seq 和 ChIP-seq 的适用边界维度ChIP-seqDAP-seq抗体依赖高需要 ChIP 级特异性抗体低依赖通用亲和标签实验体系需要活细胞/组织需交联体外无细胞体系无需交联物种跨度模式生物数据库成熟非模式困难任意物种只要能得到基因组 DNA蛋白状态检测内源蛋白能反映体内部分状态检测外源重组蛋白反映体外直接结合实验周期抗体和交联优化占大量时间建库后数天即可完成重复性容易受细胞状态波动影响重复性更好但缺少染色质背景变异体研究难需要改内源基因很容易表达点突变/截短蛋白即可这张表是我自己在选择实验方案时反复对照的底稿。如果你的研究问题里转录因子的体内状态很重要比如你想看发育过程中蛋白的动态占位那 ChIP-seq 仍然不可替代但如果你只需要弄清这个转录因子能结合哪些位点尤其是做非模式物种、或者要大批量筛选多个转录因子时DAP-seq 的效率优势是很明显的。2. 湿实验全流程拆解从收到基因组 DNA 到上机前一刻DAP-seq 的湿实验流程可以用五步概括提 DNA、打断加接头、体外表达转录因子、结合纯化、扩增上机。每一步都有一些不能省的小心思下面按顺序讲。2.1 基因组 DNA 质量是后续所有环节的地基DAP-seq 的第一份原料是待研究物种的基因组 DNA它既要拿来构建文库也是转录因子结合的靶标。如果 DNA 里带着 RNA、多糖、酚类等杂质后续的超声断裂效果和连接酶效率都会受影响。我一般倾向于用改良 CTAB 法抽提再用试剂盒过柱纯化一次如果物种组织多糖多建议加一步高盐沉淀。质量要求大致是A260/A280 在 1.8~2.0 之间A260/A230 大于 1.8电泳显示主带完整且没有明显 RNA 拖尾。拿到高纯度 DNA 后别忘了做一次 Qubit 精确定量因为下一步打断需要用固定的起始量宁可用同样的量和体积多做几个平行管也不要一把梭把全部 DNA 都丢进同一个管子里。2.2 片段化与接头连接这一步的偏差会直接传导到峰值分辨率片段化这一步决定了最终峰图的分辨率。DAP-seq 通常打断到 200~300 bp 的峰值这个区间和 ChIP-seq 类似。打断用 Covaris 或 Bioruptor 都可以关键在于保证平行样品之间的打断条件一致否则不同样本的片段分布不同后续峰宽和比对率都会出现人为差异。打断完成后先跑胶或拿 Bioanalyzer 确认片段分布再进入末端修复和加 A 尾最后连接 Y 型 Illumina 接头。接头连接效率不高的时候后面 PCR 会出现大量接头二聚体这个我后面会专门讲。连接产物用 SPRI 磁珠纯化一次去除没有连接上的接头和短片段。需要提醒的是如果你同时做多个转录因子最好在这一步就把接头连接好的基因组 DNA 文库分装成小管避免反复冻融。因为后续转录因子结合、洗涤、洗脱的步骤要在同样的 DNA 文库上重复操作每管冻融一次文库质量就往下掉一点。2.3 体外转录翻译把转录因子蛋白造出来转录因子蛋白在体外怎么造最常用的是无细胞表达系统。常用的无细胞表达系统主要有两种选择TNT T7 快速小麦胚芽裂解物系统和兔网织红细胞裂解物系统。小麦胚芽系统对植物转录因子的兼容性普遍不错表达量高尤其适合那些带有复杂结构域的真核蛋白兔网织红细胞系统更便宜、操作快有些蛋白也能表达得挺好。我习惯先在 10 µL 体系里小筛一轮用 Western blot 或 Halo 标签荧光底物确认大小对不对、表达量够不够再放大去跑正式的实验。表达载体上的标签位置也很关键。转录因子的 DNA 结合域通常靠近 N 端或 C 端如果标签正好挡在结合域附近可能会影响 DNA 结合活性。遇到表达量正常但结合效率偏低的蛋白我第一个会检查的就是标签位置必要时把 HALO 标签从 N 端换到 C 端再试。2.4 结合反应与亲和纯化耐心与严谨都在这一环转录因子和基因组 DNA 文库的结合反应要在合适的缓冲液里进行。缓冲液里一般会加 poly(dI-dC) 或鲑精 DNA 作为竞争剂用来吸附那些非特异结合能力强的蛋白和杂质盐浓度也要控制好太高会降低特异性结合太低又容易产生背景。我通常参照原始方案里的结合缓冲液配比氯化钠浓度设在 50~100 mM 之间再加 5~10 ng/µL 的 poly(dI-dC)在室温孵育 1 小时左右。随后加入 HALO 或抗标签磁珠。HALO 标签与磁珠上的配体是共价结合结合强度高后续洗涤可以做得比较充分这是它的优势GFP 标签则用抗 GFP 的磁珠靠抗体抗原亲和作用洗涤强度要适当温和一点。洗涤一般做 3 次每次用含有 0.05%~0.1% NP-40 的洗涤缓冲液重悬磁珠把非特异吸附的 DNA 洗掉。整个过程最怕的是磁珠吸走不干净或重悬不充分宁可多花费一点时间也不要意思意思转两圈就吸废液。2.5 洗脱扩增与上机控制 PCR 轮数别让噪声盖过信号洗涤完成后用洗脱缓冲液把结合在磁珠上的 DNA 洗下来。如果是 HALO 体系可以用含 SDS 的洗脱液在加热条件下把蛋白-DNA 复合物从磁珠上解离再用蛋白酶 K 消化掉蛋白然后过柱回收 DNA。回收到的 DNA 量通常很少必须经过 PCR 扩增才能达到上机量。PCR 轮数建议控制在 15~18 轮不要贪多。每多一轮 PCR非特异扩增产物占比就会上升最终测序数据里背景噪音峰会明显增加。扩增完后用 SPRI 磁珠做一次双轮筛选把太长和太短的片段都去掉上机前再跑一次 Agilent 2100 或 Fragment Analyzer 看文库片段分布确认主峰在 250~400 bp 之间、没有接头二聚体峰就可以送测序了。3. 建库翻车实录接头二聚体、对照污染和蛋白不表达这一章写几个我在 DAP-seq 实际建库中踩过、也帮别人排查过的坑按照症状—排查链路—解决方案来写比直接甩结论更实用。3.1 接头二聚体跑胶时那道明星条带做过建库的人都认识接头二聚体文库片段分布图里本该有一个 250 bp 左右的主峰结果 120 bp 附近突然冒出一个尖峰那个小东西就是接头直接互连形成的二聚体。它的危害在于二聚体片段在测序时会占掉大量有效读数导致目标数据量打折。我经历过一次四个平行样本里有三个二聚体峰量都超过主峰量。回头排查发现是两个原因叠加一是接头连接后 SPRI 磁珠纯化时磁珠比例偏低短片段没有被充分去除二是打断后的 DNA 实际量偏低导致接头与 DNA 的摩尔比过高连接产物以接头自身连接为主。解决方案分两步。第一步是防打断后必须定量接头用量按照说明书推荐的摩尔比来不要直接用统一体积的接头硬加连接后纯化时使用双轮 SPRI 或者按厂家说明书选一个适合 200~300 bp 回收的磁珠比例把短片段去掉。第二步是救如果已经发现在 PCR 后二聚体比例很高可以在纯化阶段做一次 Pippin Prep 或琼脂糖凝胶回收把 200 bp 以下的部分切掉再上机。3.2 DNA 空白对照的度没有对照的峰全是空中楼阁DAP-seq 的一个关键对照是不加转录因子蛋白、但同样经过结合缓冲液和磁珠处理的基因组 DNA 文库通常叫 DNA-only 对照或 input 对照。这个对照能反映出磁珠本身吸附了多少非特异 DNA、这些非特异 DNA 在基因组上的分布偏好。不做对照你调出来的峰很可能有一大半来自磁珠背景而不是转录因子的真实结合。我见过不止一个实验室为了省试剂省时间省掉 DNA-only 对照最后生信阶段峰多得吓人却没法解释只能回头补实验反而耽误了整个项目周期。另外对照文库要和样本文库用同一批接头连接、同一轮 PCR 扩增这样对比才有意义。换句话说对照组不是随便拿个公共基因组 DNA 库就行的它必须跟你处理的样本经历完全一致的流程。3.3 无细胞表达蛋白不溶解或表达量低时怎么办体外表达最常见的失败是 Western blot 信号很弱或者蛋白虽然表达但结合实验一直做不出信号。第一种情况可以尝试调整模板 DNA 用量、更换表达系统、延长表达时间、降低表达温度第二种情况优先检查标签位置或使用截短的 DNA 结合结构域替代全长蛋白。一个实操技巧是在正式建库之前先做一次小规模 pull-down 再加 qPCR 验证用已知结合位点引物检测信噪比。比如某个转录因子之前报道过结合某个启动子区域那就在小试结合实验后用该区域引物做 qPCR。如果能检测到明显富集再放大体系做全基因组测序如果连已知位点的富集都看不到那就先不要在文库上浪费钱。现象可能原因处理建议接头二聚体峰明显接头摩尔比过高 / SPRI 纯化不彻底精确定量 DNA、双轮 SPRI 或凝胶回收峰背景整体偏高DNA-only 对照缺失或表达蛋白过量补做对照、降低蛋白投入量蛋白表达量低模板结构或表达系统不匹配换无细胞系统、优化模板量富集信号弱标签位点影响结合域功能更换标签位置或使用截短结构域4. 生信流程从 FASTQ 到可靠结合峰的完整命令行湿实验结束数据下机后面的生信步骤决定你最终能拿到什么结论。这部分的整体思路是数据清洗、比对、去重、call peak、注释和重复性评估。4.1 fastp 清洗与比对前质控下机数据第一步永远是把低质量碱基和残留接头去掉。虽然建库时已经切过接头但序列里仍可能混入少量接头序列尤其是在片段长度接近读长时。用 fastp 处理即可fastp -i sample_R1.fastq.gz -I sample_R2.fastq.gz \ -o sample_R1.clean.fastq.gz -O sample_R2.clean.fastq.gz \ --detect_adapter_for_pe --thread 8如果是第一次处理这个物种的数据建议先跑一次 FastQC 看看原始质量分布、GC 含量、duplication 水平、接头含量。fastp 会自己识别并修剪接头省去手动写 adapter 序列的麻烦。对 DAP-seq 来说如果重复率duplication rate特别高先不要急着怀疑 PCR 扩增过度先看看样本是不是在同一个 lane 里和其他样本混合测序时产生了 index hopping这在上机前加样时就要留意。4.2 bowtie2 比对与 BAM 清洗比对我一般选 bowtie2。先把参考基因组 index 建好然后跑比对bowtie2 -p 8 -x genome_index \ -1 sample_R1.clean.fastq.gz -2 sample_R2.clean.fastq.gz \ | samtools view -bS - | samtools sort -o sample.sorted.bam samtools markdup -r sample.sorted.bam sample.dedup.bam samtools index sample.dedup.bam比对率能反映建库质量正常 DAP-seq 的比对率应该和同物种普通 WGS 接近如果比对率明显偏低回查一下参考基因组版本和建库片段大小。我一般不会在比对阶段过度限制参数保留默认模式就行只要文库片段分布正常默认参数结果都不会差。markdup这一步很多人会省掉但我建议保留。DAP-seq 的 PCR 扩增轮数虽然不高但重复仍然会存在尤其在富集区域。标记并去除重复后峰的形状会更干净定量也更可信。有一点要提一下如果你后面需要跑某些不接受去重 BAM 的工具记得把原始 BAM 留一份别一股脑把去重后的文件覆盖掉。4.3 MACS2 峰值调用参数并不需要魔改但基因组大小别填错峰值调用我通常使用 MACS2用处理样本加 DNA-only 对照macs2 callpeak -t DAP_tf.dedup.bam -c DAP_input.dedup.bam \ -f BAMPE -g 1.35e8 -n DAP_tf --outdir macs2_peaks这里最容易被忽略的是-g参数也就是有效基因组大小。拟南芥大约是 1.35e8水稻约 3.5e8不同物种差别很大。如果填错MACS2 会按错误背景模型估算峰显著性导致峰数剧烈波动。另外-f BAMPE是因为 DAP-seq 建的是 paired-end 文库用 BAMPE 模式可以让 MACS2 利用真实的插入片段长度来建模比单端模式更准。call 完之后我会用 IGV 随机抽几个峰做可视化检查确认峰确实呈现处理样本富集、对照样本不富集的模式。这一步虽然不生成新图但很多时候能发现样本标签互换、index 污染这类头疼的问题。4.4 从峰到生物学解释注释、基序和重复性拿到 BED 格式的峰之后下一步是注释和基序分析。注释可以确定峰落在启动子、基因体、基因间区等哪个功能区域基序分析用 HOMER 或 MEME 来找出这段蛋白偏好的 DNA 序列模体findMotifsGenome.pl DAP_tf_peaks.bed tair10 . -size 200 -len 8,10,12HOMER 会输出已知 motif 和新发现的 motif我一般先看注释结果里是否有该转录因子所属家族的已知 motif。如果已知 motif 没有出现在 top 列表里不一定是实验失败也可能是数据库覆盖不够需要结合 MEME 的从头预测结果来判断。重复性评估可以用 IDR技术重复之间预期应有高度重叠如果 IDR 峰占比很低说明湿实验或建库环节存在较大的批次波动。5. 我踩过的坑和几个实验前的决定性建议写到这里最后分享几个我实战之后最大的体会。5.1 先做技术重复再追生物学重复DAP-seq 实验涉及的变量主要来自建库、PCR 和磁珠操作而不是来自细胞状态所以技术重复同一样本重复建库比生物学重复更容易反映真实的实验误差。我建议在一个新转录因子第一次跑 DAP-seq 时先做两个技术重复加上一个 DNA-only 对照用 IDR 评估一致性。如果技术重复之间的一致性已经不好那就先别急着加更多生物学重复回头优化建库流程才是关键。5.2 用 qPCR、EMSA、瞬时表达报告基因交叉验证DAP-seq 的峰本质上来自体外结合不代表体内会发生同样的结合。我通常会用几个手段交叉验证选 2~3 个高置信度峰所在的启动子区域设计引物做 ChIP-qPCR或者用 EMSA 验证体外直接结合更简单一点的做法是瞬时共表达转录因子和报告基因看是否能激活荧光素酶或 GFP 信号。这一步不需要对所有峰都做选 top 几个关键靶点验证即可但它决定了整篇论文的结论是否站得住。5.3 善用公共数据但注意协议差异很多模式植物和非模式物种的 DAP-seq 公共数据已经发布做分析前可以先比对自己同家族转录因子的公共 peak 数据。如果别人同样用 DAP-seq 得到的基序和你的一致那是很好的互相佐证如果某个位点在别人的数据集里特别强、在你的数据集里根本看不到再检查一下是否用了不同的标签、不同的表达系统或不同的洗涤强度。DAP-seq 看起来流程简单但一个缓冲液的盐浓度差异就可能让 peak 强度排名发生明显变化。如果让我给刚打算做 DAP-seq 的人一句话我会说把 DNA-only 对照做扎实把 PCR 轮数控制住再花半天时间把 IDR 跑明白后面自然顺。转录因子结合位点这件事DAP-seq 不是全能的但它是目前把体外直接结合和全基因组扫描结合得最省力的一条路。