
DepMap 癌症依赖分析实战指南从 Chronos 分数解读到合成致死筛选【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skillsDepMapCancer Dependency Map癌症依赖图谱由 Broad Institute 维护通过大规模 CRISPR 基因敲除筛选、RNAi 干扰实验和 PRISM 化合物敏感性测定系统刻画了数百株癌细胞系的遗传依赖关系。本文以 scientific-agent-skills 仓库中 depmap 技能 的参考文献 dependency_analysis.md 为主体系统讲解 Chronos 依赖分数的生物学含义与解读阈值、癌症选择性依赖的评估方法、CRISPR 数据集版本选择、筛选质量控制指标、合成致死分析流程以及 PRISM 药物敏感性数据的加载与分析帮助你在靶点验证、生物标志物发现和肿瘤药物开发中直接落地使用。一、理解 Chronos 分数Chronos 是 DepMap 当前v5 及以后用于从 CRISPR 筛选数据计算基因依赖分数的核心算法。它针对传统 CERES 算法遗留的系统性偏差做了显式校正主要包括三类拷贝数效应copy number effects高拷贝基因区域因 CRISPR 切割导致 DNA 损伤驱动的细胞死亡从而被误判为必需基因即所谓的 junk DNA hypothesis。Chronos 会对这部分假象进行校正向导 RNA 效率差异guide RNA efficiency variation不同 sgRNA 的切割效率不同会导致基因效应被低估或高估细胞系生长速率cell line growth rates生长速率不同的细胞系在筛选期间的细胞分裂次数不同影响依赖信号的累积。在 SKILL.md 的 Core Concepts 一节中还补充了三个常用的分数体系及其量纲关系分数体系取值范围含义ChronosCRISPR约 −3 到 0越负越必需常用必需阈值 −1泛必需基因约 −1 到 −2RNAi DEMETER2约 −3 到 0量纲与 Chronos 接近用于交叉验证Gene Effect归一化归一化后的 Chronos−1 等于常见必需基因效应的中位数分数解读阈值分数范围解读 0敲除后可能促进生长含一定噪声0 到 −0.3非必需对适应性影响极小−0.3 到 −0.5轻度依赖−0.5 到 −1.0显著依赖 −1.0强依赖常见必需基因区间≈ −1.0泛必需基因中位数如蛋白酶体亚基实际使用时的两个关键阈值Chronos ≤ −0.5 视为可能依赖Chronos ≤ −1 视为强依赖即常见必需基因的水平。需要注意的是强依赖不等于好靶点——一个在所有细胞系中都必需的基因如核糖体亚基缺乏选择性不适合作为抗肿瘤药物靶点。常见必需基因阳性对照在几乎所有细胞系中都是必需的基因分数约为 −1 到 −2可作为筛选质量的阳性对照核糖体蛋白RPL…、RPS…蛋白酶体PSMA…、PSMB…剪接体SNRPD1、SNRNP70DNA 复制MCM2、PCNA转录机器POLR2A、TAF…非必需对照适应性效应可忽略的基因分数约为 0未表达的基因组织特异性表达安全港位点safe harbor loci二、依赖的选择性评估Selectivity Assessment判定一个依赖是否为癌症选择性依赖是靶点验证的核心问题理想的药物靶点应当在目标癌种中高度必需、而在其他谱系和正常组织中非必需。以下函数计算目标基因在指定癌谱系中的选择性分数import pandas as pd import numpy as np def compute_selectivity(gene_effect_df, target_gene, cancer_lineage): Compute selectivity score for a cancer lineage. scores gene_effect_df[target_gene].dropna() # Get cell line metadata from depmap_utils import load_cell_line_info cell_info load_cell_line_info() scores_df scores.reset_index() scores_df.columns [DepMap_ID, score] scores_df scores_df.merge(cell_info[[DepMap_ID, lineage]]) cancer_scores scores_df[scores_df[lineage] cancer_lineage][score] other_scores scores_df[scores_df[lineage] ! cancer_lineage][score] # Selectivity: lower mean in cancer lineage vs others selectivity other_scores.mean() - cancer_scores.mean() return { target_gene: target_gene, cancer_lineage: cancer_lineage, cancer_mean: cancer_scores.mean(), other_mean: other_scores.mean(), selectivity_score: selectivity, n_cancer: len(cancer_scores), fraction_dependent: (cancer_scores -0.5).mean() }返回字典中的关键字段含义selectivity_score其他谱系均值减去目标癌谱系均值正值越大说明目标谱系相对越依赖fraction_dependent目标谱系中分数 −0.5即达到可能依赖阈值的细胞系占比n_cancer目标谱系内参与比较的细胞系数量用于评估结论的统计支撑度。仓库的 docs/examples.md 在示例 30Cancer Dependency Mapping and Knowledge-Graph Target Discovery中特别强调必须把必需性和选择性分开看待。Chronos 分数接近 −1 表示强依赖但泛必需基因在任何谱系中都如此它们不是靶点真正值得关注的量是目标谱系与其余谱系之间的差距即本节的 selectivity 统计量报告中应当同时给出这两个数值。三、CRISPR 数据集版本选择DepMap 提供多个历史版本的依赖数据务必根据分析目标选择合适的版本数据集描述推荐程度CRISPRGeneEffectChronos 校正后的基因效应推荐当前版本Achilles_gene_effect旧版 CERES 算法仅遗留场景使用RNAi_mergedDEMETER2 RNAi 数据用于交叉验证从 SKILL.md 的下载文件参考表可知完整的数据文件还包括CRISPRGeneEffect.csvCRISPR Chronos 基因效应主要依赖数据行 细胞系DepMap_ID列 基因Symbol (EntrezID)格式CRISPRGeneEffectUnscaled.csv未缩放的 CRISPR 分数RNAi_merged.csvDEMETER2 RNAi 依赖数据sample_info.csv细胞系元数据谱系、疾病等OmicsExpressionProteinCodingGenesTPMLogp1.csvmRNA 表达OmicsSomaticMutationsMatrixDamaging.csv有害体细胞突变二元矩阵OmicsCNGene.csv每个基因的拷贝数PRISM_Repurposing_Primary_Screens_Data.csv药物敏感性重定位文库。加载基因效应矩阵时推荐将列名从Symbol (EntrezID)归一化为纯基因符号def load_depmap_gene_effect(filepathCRISPRGeneEffect.csv): Load DepMap CRISPR gene effect matrix. Rows cell lines (DepMap_ID), Columns genes (Symbol (EntrezID)) df pd.read_csv(filepath, index_col0) # Rename columns to gene symbols only df.columns [col.split( )[0] for col in df.columns] return df四、筛选质量指标Quality MetricsDepMap 为每批筛选screen报告质量控制指标用于判断数据可靠性Skewness偏度泛必需基因应呈负偏态。若泛必需基因分布没有出现明显负偏说明该筛选可能存在问题AUC以泛必需基因 vs 非必需对照做 ROC 曲线下面积衡量筛选区分必需/非必需的能力。判定标准好的筛选应满足 skewness −1 且 AUC 0.85。在使用任何下游分析前建议先检查这两个指标排除掉质量不佳的批次对结论的污染。五、癌症谱系代码Cancer Lineage Codessample_info.csv中的lineage字段使用受控词汇标记细胞系的组织谱系常用取值如下Lineage描述lung肺癌breast乳腺癌colorectal结直肠癌brain_cancer脑癌GBM 等leukemia白血病lymphoma淋巴瘤prostate前列腺癌ovarian卵巢癌pancreatic胰腺癌skin黑色素瘤及其他皮肤癌liver肝癌kidney肾癌除了lineage之外SKILL.md 指出每个细胞系还带有DepMap_ID唯一标识如ACH-000001、cell_line_name可读名称、primary_disease具体癌种和lineage_subtype亚型。进行细胞系合并时一律使用DepMap_ID而不是cell_line_name因为后者可能存在重名或拼写歧义。六、合成致死分析Synthetic Lethality合成致死是指两个基因中任何一个单独失活都不影响细胞生存但两者同时失活导致细胞死亡。在癌症中若肿瘤细胞携带某个抑癌基因如 BRCA1的失活突变则该突变肿瘤细胞往往对另一个特定基因的敲除异常敏感——这个基因就是潜在的治疗靶点。以下函数对每个基因执行突变组 vs 野生型组的 Mann-Whitney U 检验并用 Benjamini-Hochberg 方法做多重检验校正import pandas as pd import numpy as np from scipy import stats def find_synthetic_lethal(gene_effect_df, mutation_df, biomarker_gene, fdr_threshold0.1): Find synthetic lethal partners for a loss-of-function mutation. For each gene, tests if cell lines mutant in biomarker_gene are more dependent on that gene vs. WT lines. if biomarker_gene not in mutation_df.columns: return pd.DataFrame() # Get mutant vs WT cell lines common gene_effect_df.index.intersection(mutation_df.index) is_mutant mutation_df.loc[common, biomarker_gene] 1 mutant_lines common[is_mutant] wt_lines common[~is_mutant] results [] for gene in gene_effect_df.columns: mut_scores gene_effect_df.loc[mutant_lines, gene].dropna() wt_scores gene_effect_df.loc[wt_lines, gene].dropna() if len(mut_scores) 5 or len(wt_scores) 10: continue stat, pval stats.mannwhitneyu(mut_scores, wt_scores, alternativeless) results.append({ gene: gene, mean_mutant: mut_scores.mean(), mean_wt: wt_scores.mean(), effect_size: wt_scores.mean() - mut_scores.mean(), pval: pval, n_mutant: len(mut_scores), n_wt: len(wt_scores) }) df pd.DataFrame(results) # FDR correction from scipy.stats import false_discovery_control df[qval] false_discovery_control(df[pval], methodbh) df df[df[qval] fdr_threshold].sort_values(effect_size, ascendingFalse) return df实现要点alternativeless对应单侧检验方向突变组分数显著更低更依赖最小样本量门槛突变组 ≥ 5、野生型组 ≥ 10避免统计功效不足的基因进入结果effect_size定义为mean_wt - mean_mutant正值越大说明突变组相对越依赖默认fdr_threshold0.1在 ~18,000 个基因上同时检验时FDR 校正必不可少。仓库 docs/examples.md 对此给出了重要的统计提醒由罕见突变定义的突变组常常只有五六个细胞系在 ~18,000 个基因上做两组比较会产生大量偶然显著的假阳性——务必在每个 p 值旁边报告组规模并在全基因范围上控制错误发现率。此外细胞系不是组织细胞系经过培养适应、丢失了微环境因此细胞系中的依赖只是关于肿瘤的假设需要在原代模型或体内实验中验证。七、药物敏感性分析PRISMDepMap 同时包含来自 PRISM 实验的化合物敏感性数据可用于将基因依赖与药物反应关联起来。PRISM 的细胞条形码技术允许在混合培养中同时测定大量细胞系对化合物的响应import pandas as pd def load_prism_data(filepathprimary-screen-replicate-collapsed-logfold-change.csv): Load PRISM drug sensitivity data. Rows cell lines, Columns compounds (broad_id::name::dose) Values log2 fold change (more negative more sensitive) return pd.read_csv(filepath, index_col0) # Available datasets: # primary-screen: 4,518 compounds at single dose # secondary-screen: ~8,000 compounds at multiple doses (AUC available)数据矩阵的行是细胞系、列是化合物以broad_id::name::dose命名数值为 log2 倍数变化越负代表越敏感。两类可用数据集primary-screen4,518 个化合物、单剂量筛选secondary-screen约 8,000 个化合物、多剂量筛选可计算 AUC曲线下面积。SKILL.md 中的化合物敏感性分析工作流为下载 PRISM 化合物敏感性数据如primary-screen-replicate-treatment-info.csv将化合物 AUC 或 log2(fold change) 与基因组特征突变、表达、拷贝数做相关性分析识别预测化合物敏感性的生物标志物。八、在 scientific-agent-skills 仓库中的运行依赖与端到端示例运行环境依赖depmap 技能本身不依赖重型科学包其运行时依赖记录在仓库测试配置 tests/skill-requirements.toml 中[skills.depmap] packages [numpy, pandas, requests, scipy]即分析本地数据只需numpy、pandas、scipy若需要调用 SKILL.md 中描述的 DepMap Portal API 在线查询再额外使用requests。端到端组合示例仓库 docs/skills.md 对 depmap 技能的定位是查询癌症细胞系基因依赖分数CRISPR Chronos、药物敏感性数据和基因效应谱用于识别癌症特异性脆弱点、合成致死相互作用以及验证肿瘤药物靶点。在 docs/examples.md 的示例 30 中depmap 与primekg、database-lookup、networkx、pathway-enrichment、what-if-oracle、scikit-learn组合构成一条完整的依赖图谱 → 知识图谱 → 靶点排序流水线其关键步骤与本文内容一一对应拉取依赖谱查询 DepMap 的 CRISPR Chronos 基因效应分数分离必需性与选择性注意拷贝数混杂使用拷贝数校正后的分数并检查候选命中是否落在扩增区段并检索候选脆弱点的药物敏感性谱定义上下文与合成致死按突变/表达上下文分层细胞系找出仅在特定上下文中必需的基因合成致死候选报告组规模并做 FDR 校正知识图谱扩展对每个候选基因查询 PrimeKG、用 NetworkX 分析子图、用database-lookup交叉引用 Open Targets / DrugBank富集与机制对依赖命中集做通路富集分析预测建模用scikit-learn从组学特征预测依赖识别脆弱性生物标志物并交叉验证场景分析与优先级排序用what-if-oracle评估靶点假设的风险综合选择性、成药性和知识图谱支持度对靶点排序报告输出依赖热图、知识图谱子网络图和富集图以及带有支持证据和风险说明的靶点排序列表。九、最佳实践与常见陷阱综合 dependency_analysis.md 与 SKILL.md 的最佳实践在分析中应遵循以下原则优先使用 Chronos 分数而非 DEMETER2进行当前的 CRISPR 分析——它对切割效率的校正更完善区分泛必需与癌症选择性依赖在所有细胞系中方差极小的基因泛必需是差的药物靶点用表达数据交叉验证一个在细胞系中不表达的基因无论功能如何都会被评分为非必需候选依赖需确认靶基因在依赖细胞系中有表达使用 DepMap_ID 识别细胞系cell_line_name存在歧义警惕拷贝数效应扩增基因可能因 DNA 损伤驱动的 dropout 被误判为必需使用拷贝数校正分数并检查候选基因是否位于扩增区段多重检验校正全基因组范围内做生物标志物关联时务必应用 FDR 校正报告组规模稀有谱系中的依赖若只出现在少数几个细胞系里那只是线索lead而非发现finding。扩展阅读完整的技能说明见 skills/depmap/SKILL.md本文的原始参考文献见 skills/depmap/references/dependency_analysis.md端到端组合示例见 docs/examples.md。【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考