加州大学圣迭戈团队用 AI 解析“起始子”序列:约 60% 人类基因或含这一启动信号
据新华社报道,美国加州大学圣迭戈分校研究人员近日利用高通量 DNA 测序与机器学习技术,对人类基因核心启动子中的重要序列“起始子”(Initiator,Inr)进行了系统解析。团队在分析约 50 万个不同版本的起始子序列及其基因表达活性后训练 AI 模型,并进一步在人类基因组中搜索相关特征。结果显示,约 60% 的人类基因可能含有起始子序列。这项研究为理解基因表达如何被开启、调控以及在疾病中如何失衡,提供了新的计算工具和实验数据基础。
AI 如何参与解读 DNA 中的“开关信号”
人体不同类型细胞通常拥有基本相同的 DNA,但神经细胞、肌肉细胞、免疫细胞等却呈现出完全不同的结构与功能,关键原因之一在于不同基因会在不同细胞、不同时间被选择性开启或关闭。基因表达并不是随机发生的,而是受到 DNA 中一系列调控序列的精细控制。
“起始子”位于基因转录起始区域,是核心启动子中的一种 DNA 序列信号,参与 RNA 聚合酶 Ⅱ 介导的转录起始过程。简单来说,它相当于基因表达系统中的一个“启动提示”,会影响某个基因能否被有效读取并转化为后续生物功能。
此次研究由加州大学圣迭戈分校分子生物学教授 James T. Kadonaga 团队开展,研究生 Torrey Rhyne-Carrigg 牵头。研究人员首先通过高通量 DNA 测序,测定了约 50 万个不同起始子序列版本对应的基因表达活性;随后,他们将这些实验结果输入机器学习模型,让 AI 从大规模数据中学习哪些 DNA 碱基排列更可能构成有效起始子。
- 研究对象:核心启动子中的“起始子”DNA 序列信号;
- 技术路径:高通量 DNA 测序结合机器学习建模;
- 训练数据:约 50 万个不同版本起始子序列及表达活性;
- 主要发现:模型在人类基因组中识别出起始子特征,约 60% 人类基因含有该序列;
- 延伸发现:研究还识别出一种与 TATA 序列相关的新型起始子,并分析其与其他核心启动子元件之间的关系。
从“读基因组”到“理解调控规则”
过去二十多年,测序技术让科学界能够更快、更低成本地读取 DNA 序列。但读出 60 亿个碱基并不等于理解其中全部含义。真正困难的是判断这些碱基中哪些片段具有调控功能、它们如何相互作用,以及突变会怎样改变细胞状态。
这也是 AI 在生命科学中价值快速上升的原因。机器学习模型擅长从大量复杂样本中识别模式,而基因表达调控恰恰具有高度复杂、组合性强、人工归纳困难等特点。此次研究的意义不只在于发现“有多少基因含有起始子”,更在于建立了一个能够预测人类基因中是否存在起始子的模型框架。研究人员表示,这些 AI 模型首次能够对人类基因中的起始子存在情况进行较强预测,并解析其 DNA 碱基序列特征。
对 AI 科技产业而言,这类工作代表着模型能力从文本、图像等信息处理,进一步深入到生物分子层面的规律发现。与面向大众的生成式 AI 不同,生命科学 AI 更强调可验证的实验数据、可解释的生物机制以及与实验平台的闭环结合。高通量实验负责产生海量可靠数据,机器学习负责从数据中抽取规律,二者结合正在成为生物医学研究的重要范式。
影响与解读:疾病研究和合成生物学或受益
来源显示,研究团队认为,这些数据和模型未来可用于分析与起始子相关的 DNA 突变可能产生的影响,包括与疾病相关的突变。基因表达调控异常可能导致细胞功能失常,并与包括癌症在内的多种疾病有关。如果某些突变改变了启动子区域的调控逻辑,就可能让基因在错误时间、错误细胞或错误强度下表达。
因此,能够预测起始子序列特征的 AI 模型,有望帮助研究人员更快判断特定突变是否可能影响基因启动过程。它并不等同于直接给出疾病诊断结论,但可以作为基础研究和后续医学分析中的一类工具。
另一个潜在方向是合成启动子设计。研究成果可能用于设计具有特定功能的合成启动子,也就是能够按需求调控特定基因开启和关闭的 DNA 序列。对于基因治疗、细胞工程和合成生物学而言,更精准地控制基因表达强度与场景,是提升安全性和有效性的关键环节。
Kadonaga 表示,每个人体细胞中包含约 60 亿个 DNA 碱基,其中蕴含着控制基因何时、何地以及以多大程度开启或关闭的复杂信息。此次建立的起始子 AI 模型只是其中一部分,团队希望未来进一步扩大模型范围。换言之,当前研究不是“破解全部 DNA 密码”,而是向理解基因表达调控系统迈出了一步。当 AI 与高通量实验持续结合,生命科学中的“规则发现”可能进入更系统化的新阶段。