Data Analytics report

CMap转录谱靶点检索性能

978与12,328基因严格配对、参考频次、WTCS与EF@10、E-distance、蛋白类别及实验条件的综合评价。

基因集合、参考频次、评分方法、E-distance与靶点生物学的严格配对评价

主要发现

  • 978基因配置提高了同Target和同MoA分子的早期检索率。 严格配对的Target Hit@30为47.25%,高于12,328基因的42.80%;MoA Hit@30为30.05%,高于24.95%。
  • 参考频次显著影响原始Hit率。 同Target参考分子越多,Top K随机包含相关分子的概率越高。
  • WTCS适合作为Target和MoA主要排序。 EF@10对频次不超过10的低频Target提供补充,高频Target仍以WTCS检出率较高。
  • 全部查询汇总后,高E-distance谱具有较高检索率。 分层结果显示该收益随Target频次和蛋白类别改变。
  • 相同条件下,各蛋白家族的Target@30差异明显。 微管蛋白为70.4%,HDAC为60.6%,PI3K为55.7%;GPCR、离子通道和CYP分别为8.9%、7.8%和7.2%。
  • 时间和剂量效应随蛋白家族改变。 24小时明显提高微管蛋白、PI3K和其他染色质调节蛋白的Target@30;微管蛋白和PI3K在1-<10 μM组最高,HDAC在较低剂量组最高。

978基因Target Hit@30

47.2%Source: 严格配对的978与12,328基因评价Table: read_csv_auto

严格配对的分子等权Target同类分子Hit@30。

12,328基因 42.8%Source: 严格配对的978与12,328基因评价Table: read_csv_auto差值 +4.5%Source: 严格配对的978与12,328基因评价Table: read_csv_auto
严格配对的分子等权Target同类分子Hit@30。Source: 严格配对的978与12,328基因评价Table: read_csv_auto

读取严格配对的978与12,328基因评价的制表符分隔结果表。

978基因MoA Hit@30

30%Source: 严格配对的978与12,328基因评价Table: read_csv_auto

严格配对的分子等权MoA同类分子Hit@30。

12,328基因 24.9%Source: 严格配对的978与12,328基因评价Table: read_csv_auto差值 +5.1%Source: 严格配对的978与12,328基因评价Table: read_csv_auto
严格配对的分子等权MoA同类分子Hit@30。Source: 严格配对的978与12,328基因评价Table: read_csv_auto

读取严格配对的978与12,328基因评价的制表符分隔结果表。

WTCS Target retrieval@30

16.7%Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto

978基因的已知Target排名检出率。

EF@10 11%Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto
978基因的已知Target排名检出率。Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto

读取WTCS与EF@10已知注释排名评价的制表符分隔结果表。

1. 一次CMap查询是怎样完成的

1.1 查询分子具有多条谱时如何处理

假设查询分子Q具有三条谱:

  • Q@A549@10 μM@6 h
  • Q@MCF7@10 μM@6 h
  • Q@A549@10 μM@24 h

三条谱分别执行CMap查询,不预先取平均。

每次查询均从参考库中删除Q的全部谱,防止同一分子在不同细胞、剂量或时间下发生自匹配。

三条查询分别得到候选分子排名和候选Target排名。评价时先计算每条谱是否命中,再对Q的三条谱取平均。每个查询分子在最终统计中获得相同权重。

1.2 候选分子具有重复谱时如何处理

一个参考分子可能具有多条谱:

| 参考谱 | WTCS | | --- | ---: | | Drug A@A549@6 h | 0.82 | | Drug A@MCF7@24 h | 0.71 | | Drug A@PC3@6 h | 0.64 |

Drug A的分数取最高WTCS,即0.82。Drug A在候选分子排名中只出现一次。

Top 10分子表示10个不同分子,不包含同一分子的重复谱。

2. 两种检索结果分别表示什么

| 同Target或同MoA分子检索 | 已知Target检出 | | --- | --- | | 查询谱 → 全部参考谱WTCS → 同一候选分子的重复谱取最高值 → 不同候选分子Top K → 检查是否存在同Target或同MoA分子 | 查询谱 → 不同候选分子及WTCS → 读取候选分子的Target → 每个Target取最高支持WTCS → Target Top K → 检查已知Target是否进入前K名 |

2.1 同类分子命中率Hit@K

已知查询分子Q的Target为T1。候选分子排名如下:

| 名次 | 候选分子 | 已知Target | | ---: | --- | --- | | 1 | Drug A | T3 | | 2 | Drug B | T1 | | 3 | Drug C | T4 | | 4 | Drug D | T1、T5 |

Drug B与查询分子共享T1,因此:

  • Hit@1 = 0
  • Hit@3 = 1
  • Hit@5 = 1

MoA采用相同计算方法,将共享Target改为共享MoA。

Hit@K检索成功率等于所有查询分子的Hit@K平均值。例如100个查询分子中有47个在前30名出现同Target分子,则Target Hit@30为47%。

2.2 已知靶点检出率Target retrieval@K

先按WTCS排列不同候选分子,再把候选分子的Target注释转换成Target分数。

| 候选分子 | WTCS | Target | | --- | ---: | --- | | Drug A | 0.92 | T3 | | Drug B | 0.86 | T1、T4 | | Drug C | 0.79 | T2 | | Drug D | 0.73 | T1 |

每个Target取支持分子中的最高WTCS:

| Target名次 | Target | 最高支持WTCS | | ---: | --- | ---: | | 1 | T3 | 0.92 | | 2 | T1 | 0.86 | | 3 | T4 | 0.86 | | 4 | T2 | 0.79 |

查询分子的已知Target为T1,T1排名第2,因此:

  • Target retrieval@1 = 0
  • Target retrieval@3 = 1
  • Target retrieval@5 = 1

查询分子有多个已知Target时,每个“查询分子-已知Target”分别评价。查询分子有多条谱时,先计算每条谱的0或1结果,再对该分子-Target组合取平均。全部组合在最终统计中等权。该指标用于按照Target参考频次统计已知靶点的检出率。

2.3 Recall@K

Recall@K评价前K名找回了多少相关分子:

Recall@K = 前K名中的同Target或同MoA分子数 / 参考库中全部同Target或同MoA分子数

例如参考库中存在20个其他同Target分子,前30名命中3个:

Recall@30 = 3 / 20 = 15%

Hit@K记录是否至少命中一个相关分子。Recall@K记录全部相关分子中有多少进入前K名。

2.4 富集因子EF@K

EF@K比较某个Target在前K名中的比例与其在完整参考库中的比例:

EF@K = (h / K) / (m / N) = hN / (Km)

其中,h为前K名中具有该Target的候选分子数,m为完整候选库中具有该Target的分子数,N为排除查询分子后参与排名的候选分子总数。EF@K = 1对应随机背景水平。

2.5 首次命中名次

记录第一个同Target或同MoA分子出现的位置。

第一个相关分子位于第7名时,首次命中名次为7。数值越小,相关分子出现越早。

3Source: 严格配对的978与12,328基因评价Table: read_csv_auto. 978基因在严格配对评价中检出率更高

比较固定57,508条查询谱、136,454条参考谱、29,695个标准化分子、全部Target和MoA注释以及查询分子排除规则。两次计算的差异仅来自参与WTCS的基因集合。978基因每个方向使用98个基因,12,328基因每个方向使用1,233个基因。

Source: 严格配对的978与12,328基因评价Table: read_csv_auto

读取严格配对的978与12,328基因评价的制表符分隔结果表。

978基因在Target和MoA的Top 5、Top 10和Top 30中均获得较高Hit率。landmark基因集中包含反映细胞状态变化的信息,较短的上调和下调列表也减少了低排名基因对WTCS的稀释。当前比较同时改变了基因集合和查询基因数,固定查询基因数量的消融实验仍需补充。

4. 参考频次与Target排序

4.1 参考频次与原始命中率

参考频次表示排除查询分子后,参考库中具有同一Target或MoA注释的其他分子数。频次升高会增加Top K随机出现相关分子的概率,原始Hit率需要结合频次和Recall解释。

4.2 WTCS与EF@10

WTCS Target分数取全部支持分子中的最高WTCS。EF@10等于“前10名中的Target比例”除以“完整参考库中的Target比例”。WTCS在全部Target和MoA中获得较高检出率;EF@10的收益主要出现在频次不超过10的Target。单分子支持可产生较高EF,报告EF时同时列出观察命中数、参考频次、P值、FDR和支持分子。

WTCS与EF@10的已知注释检出率

Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto

读取WTCS与EF@10已知注释排名评价的制表符分隔结果表。

WTCS与EF@10的已知注释检出率
注释类型排序方法分子-已知注释组合retrieval@30
MoAEF@1010,220Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto10.4%Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto
MoAWTCS10,220Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto14.7%Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto
TargetEF@1022,343Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto11%Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto
TargetWTCS22,343Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto16.7%Source: WTCS与EF@10已知注释排名评价Table: read_csv_auto

5. E-distance的收益随Target频次改变

5.1 Target频次与E-distance五分位

E-distance按978个基因表达变化的平方和计算,表示转录变化总幅度。全部查询汇总后,高E-distance组具有较高Hit@30。E-distance增加对低频Target的帮助较大;频次超过100的Target在E2达到最高值,E3至E5连续下降。

5.2 高频Target的E1至E5变化

频次1至5的Target@30由E1的1.43%升至E5的6.33%;频次超过100的组由E1的33.35%降至E5的28.83%。固定2,043个相同分子-Target组合后,E1为34.03%,E5为28.90%。高频组下降主要涉及CHRM、HTR、ADRA和SLC6A4等受体或转运体。较大的E-distance可同时包含多靶点作用、细胞应激、增殖改变和长时间处理形成的继发转录程序。

6. 蛋白家族的Target@30

第一张图显示各家族的观察Target@30及条件基线,第二张图显示观察值相对条件基线的差值。共同条件下的Target@30列于随后表格。家族结果采用HGNC固定注释,每个Target等权,只保留至少包含5个合格Target的类别。

6.1 观察Target@30与条件基线

条件基线由该家族实际Target频次、E-distance、细胞、时间、剂量和查询分子Target注释数计算。观察值高于基线表示该家族比这些条件所能解释的结果更容易检索;观察值低于基线表示检索难度更高。

HDAC的观察Target@30为72.6%,条件基线为23.7%;微管蛋白为67.0%和14.0%;PI3K为60.9%和18.7%。三类机制的观察检出率明显高于各自条件基线。

GPCR的观察值为17.3%,基线为21.5%;离子通道为5.6%和11.7%;CYP为11.0%和18.2%。这些类别在其实际参考频次和实验条件下仍低于基线。

6.2 相对条件基线的Target@30差值

差值等于观察Target@30减去条件基线。正值表示该家族比频次、E-distance和实验条件所能解释的结果更容易检索,负值表示更难检索。图中采用样本量收缩后的家族平均差值,减少查询Target较少造成的极端估计。

HDAC、微管蛋白和PI3K相对条件基线的收缩后差值分别为+27.3、+22.8和+21.3个百分点。GPCR、离子通道和CYP分别为-2.4、-3.3和-4.4个百分点。

微管扰动影响有丝分裂和细胞周期,HDAC直接改变染色质乙酰化,PI3K调节生长和存活信号,这些机制容易形成稳定且可重复的转录响应。膜受体、离子通道、转运体和代谢酶更依赖靶点表达、信号偶联、底物、离子环境及细胞功能。

6.3 共同条件下的Target@30

具体计算包括三步:

  1. 以每条查询记录的Target@30命中状态为因变量,采用二项分布广义估计方程,纳入Target参考频次、E-distance及其二次项和交互项、细胞、处理时间、剂量、剂量缺失状态、查询分子Target注释数和蛋白家族;同一Target内的记录作为相关观测。
  2. 对每个蛋白家族,保留全部查询记录原有的Target频次、E-distance、细胞、时间、剂量和Target注释数,仅将蛋白家族设为当前待评价家族,计算每条记录的预测Target@30概率。各家族由此使用同一批实验条件和频次分布。
  3. 先在每个Target内汇总预测概率,再对Target等权平均,得到校正后Target@30;95%置信区间由模型协方差计算。

校正前Target@30为该家族各Target实际观察命中率的等权平均。

相同条件下各蛋白家族的Target@30

Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto

读取HGNC蛋白类别标准化Target@30的制表符分隔结果表。

相同条件下各蛋白家族的Target@30
蛋白类别Target数校正前Target@30校正后Target@3095% CI下限95% CI上限代表Target
微管蛋白15Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto67%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto70.4%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto68.4%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto72.5%Source: HGNC蛋白类别标准化Target@30Table: read_csv_autoTUBB, TUBB4B, TUBA1A, TUBA4A, TUBB2B
组蛋白去乙酰化酶11Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto72.6%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto60.6%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto50%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto71.2%Source: HGNC蛋白类别标准化Target@30Table: read_csv_autoHDAC1, HDAC6, HDAC2, HDAC3, HDAC8
PI3K家族10Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto60.9%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto55.7%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto48%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto63.5%Source: HGNC蛋白类别标准化Target@30Table: read_csv_autoPIK3CA, PIK3CG, PIK3CB, PIK3CD, PIK3R1
其他染色质调节蛋白5Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto41.6%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto47.3%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto28.2%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto66.5%Source: HGNC蛋白类别标准化Target@30Table: read_csv_autoBRD4, CREBBP, KDM4E, BRDT, EHMT2
其他蛋白激酶163Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto13.4%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto17.2%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto15.6%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto18.9%Source: HGNC蛋白类别标准化Target@30Table: read_csv_autoEGFR, KDR, MAPK1, FLT3, MTOR
核受体8Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto21.8%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto15.1%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto9.1%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto21%Source: HGNC蛋白类别标准化Target@30Table: read_csv_autoNR3C1, AR, NR1I2, PGR, NR3C2
转运体12Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto14%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto11.5%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto6.1%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto17%Source: HGNC蛋白类别标准化Target@30Table: read_csv_autoSLC6A4, SLC6A3, SLC6A2, ABCB1, SLC18A2
G蛋白偶联受体53Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto17.3%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto8.9%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto8%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto9.9%Source: HGNC蛋白类别标准化Target@30Table: read_csv_autoCHRM1, DRD2, HTR2A, ADRA1A, HTR1A
离子通道63Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto5.6%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto7.8%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto7%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto8.7%Source: HGNC蛋白类别标准化Target@30Table: read_csv_autoKCNH2, GABRA1, GRIN1, CACNA1C, SCN5A
细胞色素P450酶12Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto11%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto7.2%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto6.3%Source: HGNC蛋白类别标准化Target@30Table: read_csv_auto8.1%Source: HGNC蛋白类别标准化Target@30Table: read_csv_autoCYP1A2, CYP2D6, CYP3A4, CYP2C19, CYP2C9

7. 978查询中不同蛋白家族的时间和剂量效应

本部分只使用严格配对的978基因查询谱。每个Target等权。时间比较统一Target频次、细胞、剂量和Target注释数分布;剂量比较统一Target频次、细胞、时间和Target注释数分布。时间或剂量引起的转录变化幅度保留在结果中。

7.1 处理时间

微管蛋白在24小时的Target@30为77.2%,高于6小时的54.5%;其他染色质调节蛋白由26.6%升至52.9%;PI3K由49.6%升至58.7%。核受体、GPCR、CYP和其他蛋白激酶小幅升高。HDAC由67.6%降至65.1%,转运体由13.1%降至11.1%,离子通道基本不变。

978查询中各蛋白家族的时间结果

Source: 978查询的蛋白家族时间结果Table: read_csv_auto

读取978查询的蛋白家族时间结果的制表符分隔结果表。

978查询中各蛋白家族的时间结果
蛋白类别6小时Target@3024小时Target@3024小时-6小时6小时Target数24小时Target数
微管蛋白54.5%Source: 978查询的蛋白家族时间结果Table: read_csv_auto77.2%Source: 978查询的蛋白家族时间结果Table: read_csv_auto+22.7%Source: 978查询的蛋白家族时间结果Table: read_csv_auto15Source: 978查询的蛋白家族时间结果Table: read_csv_auto15Source: 978查询的蛋白家族时间结果Table: read_csv_auto
组蛋白去乙酰化酶67.6%Source: 978查询的蛋白家族时间结果Table: read_csv_auto65.1%Source: 978查询的蛋白家族时间结果Table: read_csv_auto-2.5%Source: 978查询的蛋白家族时间结果Table: read_csv_auto11Source: 978查询的蛋白家族时间结果Table: read_csv_auto11Source: 978查询的蛋白家族时间结果Table: read_csv_auto
PI3K家族49.6%Source: 978查询的蛋白家族时间结果Table: read_csv_auto58.7%Source: 978查询的蛋白家族时间结果Table: read_csv_auto+9.1%Source: 978查询的蛋白家族时间结果Table: read_csv_auto10Source: 978查询的蛋白家族时间结果Table: read_csv_auto10Source: 978查询的蛋白家族时间结果Table: read_csv_auto
其他染色质调节蛋白26.6%Source: 978查询的蛋白家族时间结果Table: read_csv_auto52.9%Source: 978查询的蛋白家族时间结果Table: read_csv_auto+26.3%Source: 978查询的蛋白家族时间结果Table: read_csv_auto5Source: 978查询的蛋白家族时间结果Table: read_csv_auto5Source: 978查询的蛋白家族时间结果Table: read_csv_auto
其他蛋白激酶17.2%Source: 978查询的蛋白家族时间结果Table: read_csv_auto18%Source: 978查询的蛋白家族时间结果Table: read_csv_auto+0.8%Source: 978查询的蛋白家族时间结果Table: read_csv_auto163Source: 978查询的蛋白家族时间结果Table: read_csv_auto163Source: 978查询的蛋白家族时间结果Table: read_csv_auto
核受体12.5%Source: 978查询的蛋白家族时间结果Table: read_csv_auto15.5%Source: 978查询的蛋白家族时间结果Table: read_csv_auto+3%Source: 978查询的蛋白家族时间结果Table: read_csv_auto8Source: 978查询的蛋白家族时间结果Table: read_csv_auto8Source: 978查询的蛋白家族时间结果Table: read_csv_auto
转运体13.1%Source: 978查询的蛋白家族时间结果Table: read_csv_auto11.1%Source: 978查询的蛋白家族时间结果Table: read_csv_auto-1.9%Source: 978查询的蛋白家族时间结果Table: read_csv_auto12Source: 978查询的蛋白家族时间结果Table: read_csv_auto12Source: 978查询的蛋白家族时间结果Table: read_csv_auto
G蛋白偶联受体7.3%Source: 978查询的蛋白家族时间结果Table: read_csv_auto8.8%Source: 978查询的蛋白家族时间结果Table: read_csv_auto+1.5%Source: 978查询的蛋白家族时间结果Table: read_csv_auto53Source: 978查询的蛋白家族时间结果Table: read_csv_auto53Source: 978查询的蛋白家族时间结果Table: read_csv_auto
离子通道7.2%Source: 978查询的蛋白家族时间结果Table: read_csv_auto7.2%Source: 978查询的蛋白家族时间结果Table: read_csv_auto+0%Source: 978查询的蛋白家族时间结果Table: read_csv_auto63Source: 978查询的蛋白家族时间结果Table: read_csv_auto63Source: 978查询的蛋白家族时间结果Table: read_csv_auto
细胞色素P450酶6%Source: 978查询的蛋白家族时间结果Table: read_csv_auto7%Source: 978查询的蛋白家族时间结果Table: read_csv_auto+1%Source: 978查询的蛋白家族时间结果Table: read_csv_auto12Source: 978查询的蛋白家族时间结果Table: read_csv_auto12Source: 978查询的蛋白家族时间结果Table: read_csv_auto

7.2 剂量

剂量效应随蛋白家族改变。微管蛋白和PI3K在1-<10 μM组达到最高Target@30,分别为85.2%和64.9%;HDAC在0.1-<1 μM组最高,为80.7%,≥10 μM组降至60.9%。GPCR、离子通道、CYP和转运体在≥10 μM组达到各自最高值。其他蛋白激酶在1-<10 μM组最高,为21.0%。

978查询中各蛋白家族的剂量结果

Source: 978查询的蛋白家族剂量结果Table: read_csv_auto

读取978查询的蛋白家族剂量结果的制表符分隔结果表。

978查询中各蛋白家族的剂量结果
蛋白类别<0.1 μM0.1-<1 μM1-<10 μM≥10 μM数据不足组
微管蛋白78.7%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto78.2%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto85.2%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto66.2%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto
组蛋白去乙酰化酶79.8%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto80.7%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto73.1%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto60.9%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto
PI3K家族15.1%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto43.8%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto64.9%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto60.5%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto
其他染色质调节蛋白49.8%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto53.8%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto46.7%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto<0.1
其他蛋白激酶14.9%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto17.1%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto21%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto17.5%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto
核受体11.1%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto12.8%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto12.8%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto15.6%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto
转运体4.2%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto9.1%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto7.9%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto13.6%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto
G蛋白偶联受体5%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto5.7%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto6%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto9.5%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto
离子通道5.6%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto6%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto6.1%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto7.7%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto
细胞色素P450酶3.6%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto3.9%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto2.8%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto8.1%Source: 978查询的蛋白家族剂量结果Table: read_csv_auto

24小时有利于形成微管、PI3K和染色质调节相关的持续转录程序。HDAC在6小时已经产生较高检出率,延长处理未继续提高Target@30。膜受体、离子通道、转运体和CYP在高剂量组略有提高,其绝对Target@30仍低于微管、HDAC和PI3K。

剂量为名义培养浓度,未按EC50、IC50、细胞内暴露量或游离浓度归一化。不同剂量组之间的差异支持条件选择,不能直接解释为统一的剂量-效应关系。

8. 建议的CMap查询与报告方法

  1. 使用978基因配置执行主要查询。
  2. Target和MoA主要按WTCS排序。
  3. 频次不超过10时补充EF@10,并报告观察命中数和支持分子。
  4. 同时报告参考频次、Hit@K、Recall@K和首次命中名次。
  5. 查询分子的多条谱分别计算,保留细胞、时间和剂量信息。
  6. 低频Target优先比较较高E-distance谱。
  7. 微管蛋白、PI3K和染色质调节蛋白优先比较24小时谱;HDAC同时保留6小时和24小时谱。
  8. 剂量按照蛋白家族分别比较;微管蛋白和PI3K优先检查1-<10 μM,HDAC同时保留较低剂量。
  9. 高频受体和转运体同时保留低至中等E-distance谱。
  10. 高E-distance伴随凋亡、细胞周期或氧化应激时,降低Target特异性解释强度。

9. 研究限制

  • 978与12,328的严格配对同时改变基因集合和每个方向的查询基因数。
  • Target和MoA注释包含多靶点分子、缺失注释和家族共注释。
  • 候选分子采用最高WTCS,参考谱较多的分子具有更多获得高分的机会。
  • 细胞、时间和剂量来自观察性参考库,实验条件分布不均。
  • 蛋白家族Target@30校正了已记录因素,未纳入靶点基础表达、重复一致性、细胞活性、通用应激评分和批次。
  • 家族共注释提高机制类别检索,现有结果对亚型区分的支持较弱。

10. 结论

严格配对评价支持978基因配置用于CMap同Target和同MoA分子检索。参考频次决定原始Hit率的基础水平,WTCS适合主要Target和MoA排序,EF@10可补充低频Target。

全部查询汇总后,高E-distance与较高检索成功率相关;该关系随Target频次和蛋白类别改变。在相同Target频次、E-distance和实验条件下,微管蛋白、HDAC和PI3K的Target@30最高,GPCR、离子通道和CYP最低。24小时提高微管蛋白、PI3K和其他染色质调节蛋白的检索率;剂量效应具有家族特异性,未获得适用于全部Target的统一最佳剂量。

978与12,328基因的严格配对Hit@K
978与12,328基因的严格配对Hit@K data
评价指标Hit率基因配置
TARGET@518.4%12,328基因
TARGET@522.8%978基因
TARGET@1026.4%12,328基因
TARGET@1030.8%978基因
TARGET@3042.8%12,328基因
TARGET@3047.2%978基因
MOA@59.9%12,328基因
MOA@513.9%978基因
MOA@1014.2%12,328基因
MOA@1019%978基因
MOA@3024.9%12,328基因
MOA@3030%978基因

Sources

  1. 严格配对的978与12,328基因评价sources/paired_gene_set_metrics.tsv · duckdb

    读取严格配对的978与12,328基因评价的制表符分隔结果表。

    SQL query
    SELECT * FROM read_csv_auto('sources/paired_gene_set_metrics.tsv', delim='\t', header=true)
  2. 严格配对的Target频次分组结果sources/paired_frequency_strata.tsv · duckdb

    读取严格配对的Target频次分组结果的制表符分隔结果表。

    SQL query
    SELECT * FROM read_csv_auto('sources/paired_frequency_strata.tsv', delim='\t', header=true)
  3. WTCS与EF@10已知注释排名评价sources/wtcs_ef_ranked_hit_rates.tsv · duckdb

    读取WTCS与EF@10已知注释排名评价的制表符分隔结果表。

    SQL query
    SELECT * FROM read_csv_auto('sources/wtcs_ef_ranked_hit_rates.tsv', delim='\t', header=true)
  4. Target频次与E-distance联合分析sources/frequency_edistance_target30.tsv · duckdb

    读取Target频次与E-distance联合分析的制表符分隔结果表。

    SQL query
    SELECT * FROM read_csv_auto('sources/frequency_edistance_target30.tsv', delim='\t', header=true)
  5. HGNC蛋白类别标准化Target@30sources/protein_class_standardized_target30.tsv · duckdb

    读取HGNC蛋白类别标准化Target@30的制表符分隔结果表。

    SQL query
    SELECT * FROM read_csv_auto('sources/protein_class_standardized_target30.tsv', delim='\t', header=true)
  6. HGNC蛋白类别观察值与条件基线sources/protein_class_observed_and_baseline_target30.tsv · duckdb

    读取HGNC蛋白类别观察值与条件基线的制表符分隔结果表。

    SQL query
    SELECT * FROM read_csv_auto('sources/protein_class_observed_and_baseline_target30.tsv', delim='\t', header=true)
  7. 978查询的蛋白家族时间结果sources/protein_class_time_standardized_target30.tsv · duckdb

    读取978查询的蛋白家族时间结果的制表符分隔结果表。

    SQL query
    SELECT * FROM read_csv_auto('sources/protein_class_time_standardized_target30.tsv', delim='\t', header=true)
  8. 978查询的蛋白家族剂量结果sources/protein_class_dose_standardized_target30.tsv · duckdb

    读取978查询的蛋白家族剂量结果的制表符分隔结果表。

    SQL query
    SELECT * FROM read_csv_auto('sources/protein_class_dose_standardized_target30.tsv', delim='\t', header=true)