
DRUGONE
DNA碱基编辑技术能够在不引入DNA双链断裂的情况下实现单碱基精确修饰,是当前基因治疗和遗传疾病研究的重要工具。然而,脱靶编辑始终限制着其进一步应用。传统提高编辑器特异性的策略主要依赖结构经验设计或定向进化,不仅研发周期长,而且往往面临编辑活性与编辑精度难以兼顾的问题。研究人员提出了一种基于AlphaFold3的新型人工智能框架——ContactSeek,通过分析AlphaFold3预测得到的蛋白质—DNA—RNA复合物接触概率(Contact Probability,CP),寻找决定脱靶识别的关键接触区域及关键氨基酸,从而指导高精度碱基编辑器设计。研究首先建立了全新的dI-profiling测序方法,对腺嘌呤碱基编辑器(ABE)的全基因组脱靶位点进行系统检测,再将这些真实脱靶序列输入AlphaFold3进行预测。结果发现,相较于传统三维结构预测,接触概率能够更加敏感地反映靶点与脱靶之间微小但重要的相互作用差异。基于这一特点,ContactSeek成功筛选出多个决定编辑特异性的关键残基,并构建出兼具高活性和极低脱靶效应的新型ABE和CBE编辑器,展示了人工智能辅助精准基因编辑的新范式。

酶的特异性决定了生物化学反应是否能够准确发生,对于基因编辑而言尤其重要。近年来,以CRISPR-Cas系统为代表的DNA碱基编辑器已广泛应用于基础研究和疾病治疗,但脱靶编辑始终是制约其临床应用的核心障碍。为了提高编辑精度,研究人员通常采用理性设计或定向进化的方法改造编辑器。这些方法虽然取得了一定成果,但理性设计高度依赖结构经验,成功率有限,而定向进化则需要复杂的实验筛选体系,耗时耗力且容易陷入局部最优。
随着人工智能的发展,大语言模型、蛋白质语言模型以及逆折叠模型已经能够有效优化蛋白质活性和稳定性,并逐渐应用于蛋白质工程领域。然而,这些模型大多关注蛋白质本身,难以描述蛋白质、DNA和RNA形成的三元复合物,更无法准确解释靶点与脱靶之间仅由DNA序列差异所引起的构象变化。因此,如何利用人工智能直接解析脱靶形成机制,并据此指导编辑器优化,一直是基因编辑领域的重要挑战。
AlphaFold3不仅能够预测蛋白质三维结构,还能够预测蛋白质与核酸之间形成复合物的接触概率,为研究蛋白质—DNA—RNA相互作用提供了新的可能。研究人员据此提出,希望利用接触概率而不是传统结构作为分析对象,将真实脱靶数据与AlphaFold3预测结果结合,建立一种能够直接寻找决定编辑特异性关键残基的人工智能框架,实现基因编辑工具的精准优化。
方法
研究首先开发了一种针对腺嘌呤碱基编辑器的新型脱靶检测方法dI-profiling。该方法利用ABE首先将腺嘌呤脱氨生成次黄嘌呤(dI)的中间产物,通过特异性富集含dI的DNA片段并进行高通量测序,实现全基因组脱靶位点检测。在获得大量真实脱靶位点后,研究人员将对应DNA序列输入AlphaFold3,对Cas蛋白、sgRNA以及DNA形成的三元复合物进行预测,并重点分析其中的接触概率矩阵,而非传统三维结构。随后,研究团队开发ContactSeek算法,对大量靶点和脱靶位点的接触概率变化进行建模,识别具有一致变化趋势的共识接触区域(CCR),进一步结合实验测得的脱靶编辑强度,对这些区域进行重要性排序,并筛选决定编辑特异性的关键氨基酸。最终,通过定点突变构建多个编辑器变体,再利用靶向测序、全基因组脱靶检测、RNA测序以及R-loop实验等方法,对优化后的编辑器进行系统验证。
结果
dI-profiling构建了腺嘌呤碱基编辑器的全基因组脱靶图谱
为了让人工智能真正学习脱靶规律,首先必须获得可靠的大规模脱靶数据。研究人员建立了dI-profiling方法,通过检测ABE编辑过程中产生的次黄嘌呤中间体,实现脱靶位点的高灵敏度检测。
实验分别在HEK293T细胞和造血干细胞中,对多个不同sgRNA进行了检测。结果发现,不同编辑器和不同sgRNA之间脱靶数量差异十分明显。其中活性最高的ABE8e产生了最多脱靶位点,而临床应用较多的其他ABE变体则表现出较低脱靶水平。在多个治疗相关靶点中,研究人员同样获得了覆盖全基因组的大规模脱靶数据。
进一步采用靶向扩增测序进行验证后发现,dI-profiling检测到的大多数脱靶位点均能够得到实验验证,而且不同位点的测序信号与真实编辑效率之间具有较高相关性。这说明dI-profiling不仅能够准确定位脱靶位点,还能够较好反映不同位点的实际脱靶强度,为后续人工智能模型提供了可靠的数据基础。

图1: ContactSeek整体框架及dI-profiling建立腺嘌呤碱基编辑器全基因组脱靶图谱。
AlphaFold3接触概率能够比三维结构更敏感地识别脱靶相互作用
随后,研究人员利用AlphaFold3分别预测靶点和脱靶位点形成的Cas9-DNA-RNA三元复合物,希望寻找能够反映脱靶形成机制的新特征。
分析发现,当仅观察AlphaFold3预测得到的三维结构时,许多靶点与脱靶之间几乎没有明显区别;但对应的接触概率矩阵却能够清晰反映两者之间局部相互作用的变化。尤其是在R-loop区域,虽然整体空间构象保持相似,但蛋白质与DNA之间接触概率已经发生显著改变。
进一步比较不同脱靶位点发现,随着DNA错配数量增加,接触概率变化越来越明显,而这种变化往往早于三维结构发生明显改变。统计分析显示,几乎所有脱靶复合物都表现出接触概率改变,而只有约三分之二出现明显结构变化。这意味着接触概率保留了更多细粒度信息,对蛋白质—DNA—RNA之间微弱相互作用更加敏感。
研究人员还将AlphaFold3预测结果与真实脱靶测序数据进行比较,发现接触概率变化与不同脱靶位点编辑效率具有良好一致性。例如,在R-loop受到扰动的脱靶位点,非靶链DNA开放程度降低,对应区域实际编辑效率也明显下降。这进一步证明,AlphaFold3预测得到的接触概率不仅具有结构意义,而且能够真实反映编辑器识别DNA时发生的功能变化,为后续寻找关键残基提供了重要依据。

图2: AlphaFold3预测靶点与脱靶三元复合物,并证明接触概率比三维结构更敏感地反映脱靶相互作用。
ContactSeek揭示决定碱基编辑特异性的关键接触区域
确认接触概率能够敏感反映靶点与脱靶之间的差异后,研究人员进一步开发了ContactSeek框架,对这些信息进行系统建模。该框架首先从AlphaFold3预测得到的大规模接触概率矩阵中提取Cas蛋白与DNA、RNA之间最重要的接触信息,再计算靶点与脱靶之间接触概率的变化值,并结合实验获得的脱靶编辑强度,寻找能够共同变化的蛋白质区域。
分析发现,Cas9蛋白中相邻残基的接触概率并非独立变化,而是常常表现出协同变化的规律。研究人员将这些具有一致变化趋势的区域定义为“共识接触区域”(Consensus Contact Region,CCR)。在Cas9全部参与核酸结合的残基中,共识别出49个CCR,每个区域由2至10个相邻氨基酸组成。这些区域主要分布于Cas9与DNA、sgRNA形成R-loop复合体附近,其中多个高排名CCR集中位于RuvC-III结构域,与已有研究认为控制Cas9脱靶识别的重要区域高度一致。
进一步综合接触概率、接触变化以及真实脱靶编辑信号,ContactSeek对所有CCR进行了重要性排序,并进一步计算每一个氨基酸在脱靶复合物中的接触增强程度,最终筛选出多个可能决定编辑特异性的关键残基,包括K1020、R1019、Y1016、K1035等位点。这些残基随后被用于定点突变验证,为AI预测提供了直接实验依据。

图3: 接触概率比三维结构更敏感地揭示靶点与脱靶之间的差异,并证明差异来源于AlphaFold3内部表征。

图4: ContactSeek识别Cas9关键共识接触区域并筛选决定编辑特异性的关键残基。
ContactSeek指导构建高保真ABE碱基编辑器
为了验证ContactSeek筛选结果是否具有实际指导意义,研究人员针对筛选得到的关键残基构建了23种Cas9突变体,并系统检测其编辑性能。
实验结果显示,多数预测位点均能够有效改善编辑器特异性。其中,K1020D突变表现最为突出,在保持七个不同靶点编辑活性几乎不变的情况下,代表性脱靶位点编辑效率下降约5.8倍,全基因组脱靶信号分别降低约83%和69%。进一步分析表明,该突变主要通过削弱Cas9在脱靶DNA上的额外接触,提高了对真实靶点与脱靶位点之间差异的识别能力。
除了Cas9本身,研究人员还将ContactSeek应用于脱氨酶TadA8e。由于RNA脱靶和sgRNA非依赖DNA脱靶主要来源于脱氨酶自身,因此研究团队利用AlphaFold3建立TadA8e与RNA复合物模型,同样识别出多个关键CCR区域,并筛选17个潜在调控位点。其中已有一半以上位点与文献报道一致,进一步证明了ContactSeek预测结果的可靠性。
最终,研究人员将Cas9(K1020D)与TadA8e(F156D)组合,构建出新的ABE8e-DD编辑器。系统测试发现,该编辑器不仅保持了90%以上的靶向编辑效率,而且RNA脱靶、sgRNA依赖DNA脱靶以及sgRNA非依赖DNA脱靶均显著降低。在与目前多个高保真ABE编辑器比较时,ABE8e-DD在整体性能上均表现最佳,兼顾了编辑效率与编辑精度。
这些结果说明,ContactSeek不仅能够准确找到影响脱靶识别的关键区域,而且能够直接指导高性能编辑器设计,大幅减少传统理性设计中大量依赖经验和反复筛选的问题。
ContactSeek进一步推广至Cas12a胞嘧啶碱基编辑器
为了验证该框架是否具有普适性,研究人员进一步将ContactSeek应用于Cas12a介导的胞嘧啶碱基编辑器。
与Cas9不同,Cas12a具有完全不同的蛋白结构和DNA识别方式,因此也是检验模型泛化能力的重要对象。研究人员首先利用已有的全基因组脱靶数据,对Cas12a形成的大量蛋白质—DNA—RNA复合物进行AlphaFold3预测,并分析接触概率变化。
结果显示,ContactSeek同样能够识别Cas12a中的关键共识接触区域,共获得40个CCR,其中排名最高的区域分别分布于REC、PID和RuvC等多个结构域,提示Cas12a调控脱靶识别的机制与Cas9有所不同。
随后,研究团队构建17种Cas12a突变体进行实验验证。其中R284E和R671D两个突变体表现最佳,在保持编辑效率的同时,将多个代表性脱靶位点编辑效率降低约2至13倍。进一步结合APOBEC3A脱氨酶优化后,最终获得Cas12a(R284E)-A3A(H29D)编辑器。
与目前已有的高保真Cas12a编辑器BEACON2相比,新编辑器在保持相似编辑活性的同时,RNA脱靶明显减少,sgRNA依赖DNA脱靶分别下降约86%和73%,整体编辑精度进一步提高。这说明ContactSeek不仅适用于Cas9体系,也能够推广至不同CRISPR编辑平台,为更多基因编辑工具优化提供统一解决方案。

图5: ContactSeek推广至Cas12a胞嘧啶碱基编辑器,实现不同编辑体系的高精度优化。
讨论
本研究提出了基于AlphaFold3接触概率建模的ContactSeek框架,为人工智能辅助基因编辑工具优化提供了一种新的思路。不同于传统依赖三维结构分析的方法,研究发现AlphaFold3输出的接触概率能够保留更多蛋白质与DNA、RNA之间细粒度相互作用信息,对仅由DNA序列差异引起的微弱构象变化更加敏感,因此更适合作为分析脱靶机制的重要依据。
研究还发现,决定编辑特异性的并非单个氨基酸,而是多个空间相邻残基组成的共识接触区域。这些区域能够共同响应DNA序列变化,并最终影响编辑器对靶点和脱靶位点的识别能力。ContactSeek通过将AlphaFold3预测结果与真实测序数据结合,实现了结构信息与功能信息的融合分析,使人工智能不仅能够预测结构,还能够直接指导蛋白质工程设计。
值得注意的是,该框架具有良好的模块化特点。研究人员分别对Cas蛋白和脱氨酶建立独立模型,再将两部分优化结果组合,不同类型脱靶效应均得到同步降低。这种策略避免了完整复合物预测中可能存在的误差,也说明复杂蛋白系统可以采用模块化建模方式进行优化。
总体而言,ContactSeek代表了首个专门针对基因编辑特异性优化建立的AlphaFold3驱动人工智能框架。未来,随着更多蛋白质—核酸复合物结构和高通量功能数据不断积累,这种融合结构预测、实验测序和机器学习的方法有望推广至Prime Editing、RNA编辑器以及更多CRISPR工具,为下一代精准基因编辑技术的发展提供新的理论基础和设计范式。
整理 | DrugOne团队
参考资料
Meng, H., Lei, Z., Yan, Y. et al. Precise DNA base editing using AlphaFold3-based contact modelling. Nature (2026).
https://doi.org/10.1038/s41586-026-10794-z
内容为【DrugOne】公众号原创|转载请注明来源