做完蛋白质组学,拿到一大堆定量数据,下一步该看什么?火山图、热图、GO、KEGG 和蛋白互作网络分别能说明什么,又该如何从中筛出值得验证的候选蛋白?这篇文章就按实际分析顺序,快速理清蛋白质组学数据分析的核心思路。
蛋白质组学的常规流程
样本收集 → 蛋白提取与质检 → 还原、烷基化及酶切 → 肽段纯化与质谱检测 → 数据质控与统计分析 → 生物学解释与实验验证。
图 1:ChatGPT
目前常见的蛋白组学技术
如果是普通基础研究或临床样本筛选,目前较常见的选择是 DIA 或 Label-free。若研究重点是「某个信号通路有没有被激活」,单纯做全蛋白组有时并不够,还需要考虑磷酸化蛋白组。
蛋白质组学分析流程
1、先整理并了解测完蛋白组学后会得到哪些数据:
2、核对样本和分组;
3、整理定量矩阵;
4、检查数据分布,分析做图。
4、蛋白质组学的差异分析
完成数据质控和差异分析后,下一步就是把复杂的蛋白组数据转化成直观的图片,并从中筛选值得验证的候选蛋白。常用分析主要包括差异蛋白展示、功能富集、蛋白互作网络和药物逆转分析。
1、火山图:快速找到变化明显的蛋白
火山图用于展示两组之间的整体差异。横轴表示蛋白表达变化倍数,纵轴表示统计学显著性。通常红色代表上调蛋白,蓝色代表下调蛋白,灰色代表无明显变化的蛋白。
图 2:http://www.bestms.cn/service/astral-dia-proteomics
展示图片时不建议标注过多名称,可重点标出与研究方向相关、变化稳定且准备进一步验证的 5~15 个蛋白。需要注意,变化倍数最大的蛋白不一定就是核心靶点,还要结合组内稳定性、肽段数量和生物学功能综合判断。
2、热图:观察差异是否稳定
热图可以展示差异蛋白在每个样本中的表达模式。一般每一列代表一个样本,每一行代表一个蛋白,颜色表示相对表达水平。热图主要用于观察:
• 同组样本的表达模式是否相似;
• 不同组之间是否存在清晰差异;
• 某个蛋白的变化是否由个别异常样本造成。
图 3:https://www.biotree.com.cn/danbaizhizuxue.html?aid=175
如果差异蛋白数量很多,可以在正文中展示变化最明显或最重要的 30~50 个蛋白,完整结果放入补充材料。
3、箱线图:展示候选蛋白的具体变化
火山图和热图反映整体趋势,箱线图或散点图则能展示单个候选蛋白在各样本中的实际分布。
图 4:https://zhuanlan.zhihu.com/p/29944425221
绘图时应尽量保留每个生物学重复的数据点,而不是只展示平均值。这样可以直观看到组内离散程度,也能判断差异是否由少数样本推动。
4.差异蛋白涉及哪些功能和通路
筛选出差异蛋白后,需要进一步回答:这些蛋白共同参与了哪些生物学过程?
1)GO 功能分析
GO 分析的结果通常使用条形图或气泡图展示。气泡的位置、大小和颜色分别可以代表富集比例、蛋白数量和统计学显著性。
图 5:https://www.mobiomed.com/article-item-333.html
2)KEGG 和 Reactome 通路分析
KEGG 或 Reactome 可以帮助判断差异蛋白集中在哪些信号通路,例如脂质代谢、PI3K–AKT、NF-κB、抗原加工与呈递以及干扰素反应等。
图 6:https://ibook.antpedia.com/x/989938.html
需要注意,某条通路被富集并不等于它已经被激活。还要进一步查看通路中关键蛋白的变化方向,并结合磷酸化检测和功能实验进行验证。
5. 蛋白互作网络:从差异蛋白中筛选关键节点
当差异蛋白较多时,可以借助 STRING 等数据库分析蛋白之间的相互作用,并在 Cytoscape 中绘制蛋白互作网络。网络图中:
• 每个节点代表一个蛋白;
• 节点之间的连线代表已知或预测的相互作用;
• 节点大小可以表示连接程度;
• 节点颜色可以表示蛋白上调或下调。
连接较多的蛋白可作为潜在枢纽蛋白,但不能仅凭网络排名确定核心靶点。数据库中研究较多的经典蛋白,往往天然具有更多连接。
图 7:https://zhuanlan.zhihu.com/p/615367295
初步筛选的时候,候选蛋白还应满足以下条件:
• 差异变化稳定;
• 有可靠的肽段支持;
• 位于课题关注的通路;
• 与疾病表型具有一定关联;
• 有适合 Western blot、PRM 或免疫组化的抗体;
• 能够设计敲低、过表达和救援实验。
因此,蛋白互作网络更适合用于缩小筛选范围,而不是直接得出机制结论。
总之,通过以上分析,可以逐步形成一条清晰的研究逻辑:
火山图和热图发现差异蛋白→ GO、KEGG 锁定生物学通路→ 蛋白互作网络筛选候选节点→Western blot、功能实验完成验证。
编辑:冷漠小 z
题图:自制

