首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • ESM3蛋白质语言模型cookbook(3)

    前两章我们介绍了ESM3和ESM-C模型 ESM3蛋白质语言模型cookbook(1) ESM3蛋白质语言模型cookbook(2) ·Hayes论文图 它们有一个“优雅”的结构:一个十一边形的β桶,其中心有螺旋结构,它为蛋白质自身原子形成发光发色团提供了支架。 ESM3 能够在蛋白质的序列、结构和功能之间进行联合推理,因此我们可以构建新的提示方式,以比许多其他生物语言模型更高的控制水平引导模型生成蛋白质。 gfp蛋白质结构 接下来我们再去看看pdb id为1qy3 的蛋白质结构是什么样子的呢? ,其中背后的引擎则是esm3蛋白质多模态模型,并且也用到了自然语言中的很多概念,如mask和token的表示。

    34210编辑于 2026-04-17
  • 来自专栏Y大宽

    1️⃣序列获取(3):蛋白质序列获取

    EXProt :database for EXPerimentally verified Protein functions ps,写到这里,安利一个航母网址https://www.expasy.org/ 3 UniProtKB:不能再详细 Swiss-Prot 数据来源 核酸数据库翻译推导 蛋白质数据库PIR挑选 科学文献摘录 研究人员直接提交的蛋白序列 特点 每一条序列包括核心数据和注释两类,

    81110发布于 2019-01-28
  • Nat. Commun. | 面向治疗性多肽性质预测的统一平台

    PeptiVerse能够同时接受氨基酸序列和SMILES表示的化学修饰多肽作为输入,整合蛋白质语言模型和化学语言模型,对结合亲和力、膜渗透性、溶血性、非污损性、溶解性、毒性和半衰期等多项关键性质进行统一预测 传统基于蛋白质序列的方法只能处理20种天然氨基酸,而许多化学修饰后的多肽只能采用SMILES表示。 结合亲和力预测优于结构置信度指标 近年来,AlphaFold3等结构预测模型逐渐用于蛋白–多肽复合物预测,因此研究人员进一步比较结构预测置信度是否能够反映真实结合能力。 首先,研究人员利用OpenFold3预测蛋白–多肽复合物,并计算ipTM结构置信度。 图3:PeptiVerse结合亲和力预测性能,与结构预测置信度以及现有方法的比较结果。

    20410编辑于 2026-07-21
  • 来自专栏Y大宽

    5️⃣ 蛋白质序列基本和特征信息分析(1) :蛋白质序列基本信息分析(氨基酸组成,理化性质,亲疏水等)

    一级结构指的是蛋白质中氨基酸的排列顺序,和DNA一级结构一致。 也就是说蛋白质发挥什么功能,基本在一级结构中就确定了。 对蛋白质序列进行基本信息分析可以帮助了解蛋白质的基本信息。 ,包含不考虑物种,pI和分子量限制的全部蛋白质 3 第三张表同时既基于特定物种,又考虑pI和分子量。 Protparam不考虑蛋白质二级和三级结构的情况下,根据氨基酸组成来估算消光系数。准确的需要实验获得。 体内半衰期:蛋白质在细胞内合成后,含量消失一半所需要的时间,用来衡量蛋白质的稳定性。 Protparam可以预测蛋白质在人,酵母和大肠杆菌中的体内半衰期,可以作为其他物种内的参考。 不稳定系数:作文蛋白质在体外测试中稳定性的参考值。 因为氨基酸的亲疏水性是构成蛋白质折叠的主要驱动力之一,因此蛋白质亲水性分布可以反映蛋白质的折叠情况。

    17.5K52发布于 2019-03-05
  • 来自专栏生信技能树

    蛋白质组学第3期-蛋白质组学的三大元素

    上周我们公布了,蛋白质组学习小组起飞啦! 短短几天就获得了250多小伙伴的支持,让我们也更有信心的带领大家掌握一个蛋白质组学数据处理的实战,前面两期我们分享的是: 蛋白质组学第1期-认识基础概念 蛋白质组学第2期-认识蛋白质组学原始数据 ?

    3K44发布于 2019-07-26
  • ESM3蛋白质语言模型cookbook(1)

    一.背景介绍 对于蛋白质序列的研究和结构的研究现在变得越来越热门,所谓工欲善其事,必先利其器,所以今天我们就来介绍一下ESM3, 使用ESM3可以对蛋白质进行特征提取,无论是之后再接入各种各样的神经网络 ESM-3更是一个多模态的蛋白质语言模型,结合了蛋白质的结构和功能等特征。 来打印一下1CM4这个蛋白质的sequence吧: 接下来我们再加载一下这个蛋白质的坐标看看吧: print(protein.coordinates.shape) #先看看坐标的形状 yep,就是十分的方便 因为蛋白质由氨基酸组成,而每一种氨基酸又由不同的原子组成,所以这里是原子坐标,如果没有这个原子,那么其坐标则为nan 3: 每个原子的(x,y,z)坐标 打印一下看看咯: print(protein.coordinates protein.sasa = protein_chain.sasa() plt.plot(protein.sasa) 我们还可以将这些SASA值映射到结构的3D可视化上,利用我们拥有这种蛋白质的3D坐标这一事实

    41310编辑于 2026-04-17
  • ESM3蛋白质语言模型cookbook(2)

    上一张我们讲解了最基础的ESMProtein类: ESM3蛋白质语言模型cookbook(1) 今天我们继续介绍第二章的内容: 使用ESM-C模型获取蛋白质的特征表达(embedding),进行一个简单蛋白质序列分类的任务 上一张刚刚解释了ESM3模型,这一次的ESM-C模型又是什么? Qustion2.什么是embedding表达? 好,那我们今天就开始围绕这些话题展开描述。 yep,寒武纪大模型,所以这是一个很powerful的蛋白质模型。 ESM-C(寒武纪)是他们的旗舰ESM3生成模型的平行模型家族。 ESM3专注于可控的蛋白质生成,而ESM C专注于创建蛋白质潜在生物学的表示。 所以我们这次将会通过ESM-C蛋白质语言模型去提取蛋白质序列的embedding表示也就是用特征向量来表示蛋白质序列。

    33310编辑于 2026-04-17
  • 来自专栏DrugOne

    Nat. Commun. | 基于序列的预测方法可以准确判断含有非天然氨基酸肽的内在溶解度

    非天然氨基酸能扩展化学空间,定制肽类药物的功能、半衰期和其他关键属性。尽管含有修饰氨基酸(如经过翻译后修饰的残基)的化学空间极大,但实验测量含修饰氨基酸肽的开发性质既昂贵又耗时。 它们通常具有低口服生物利用度和短半衰期,这是由于高清除率和低代谢稳定性造成的。此外,肽类药物可能具有较差的膜透过性。 自然界中的例子表明,内源性肽和蛋白质的特性可以通过翻译后修饰(PTM)进行改变。 在实际治疗应用中,研究人员通过PTM改善肽性质,如增加生物活性和改善代谢稳定性,增加结合亲和力、半衰期以及通过脂肪化和酰化改善组织渗透能力等等。 通过糖基化可以改善生物利用度和稳定性,增强蛋白质-蛋白质相互作用,利用细胞表面的葡萄糖转运蛋白提高细胞渗透性。 实验结果 图 3 通过将计算预测与实验数据进行比较,研究发现两组数据之间存在高度相关性。

    75510编辑于 2023-12-26
  • 来自专栏明星分子

    TargetMol天然产物——Cycloheximide(具有抗真菌活性的抗生素)

    它能够有效阻断真核翻译过程中的延伸阶段,从而抑制整体蛋白质合成,这一特性使其成为测定蛋白质半衰期、翻译调控和相关细胞机制研究的重要实验工具。 经典研究表明,Cycloheximide的作用位置与延伸过程中的translocation紧密相关,并能稳定多聚核糖体状态,是细胞内翻译分析及半衰期测定常用的药物工具。 3. 应用文献精选 3.1. 该研究不仅证明了CHX在翻译研究中可能引入的实验伪影,也提供了一种利用耐药核糖体模型解析体内翻译调控机制的新策略,对核糖体测序方法学及翻译动力学研究具有重要方法学意义[3]。 3.3. PMID: 37884159. [3] Zhao Q, Bolton B, Rothe R, et al.

    27310编辑于 2026-05-09
  • 来自专栏DrugOne

    mLife | 人工智能破解酶稳定性定向进化中的多个突变位点高效重组问题

    图1.基于蛋白质语言模型组合突变的策略。整个过程包括四个步骤:(1) 收集数据,(2) 蛋白质语言模型的微调,(3) 在组合序列空间中预测所有突变体,以及 (4) 验证所选突变体。 条形图是指突变体的热稳定性数据,其中蓝色、青色和橙色分别指初始数据集、第一轮和第二轮预测的数据集 其中,最佳突变体13M4包含13个突变位点,与野生型相比,它的活性基本保持不变,在Tm上提高了10.19°C,在58°C下的半衰期增加了约 动态相关矩阵分析的结果表明,影响稳定性的突变不仅影响其局部环境的动力学,在某些情况下,还影响远端结构区域的动力学(图3)。该项技术可以作为未来研究或设计上位效应的一个有效工具。 图3.突变之间的上位效应分析。K351E (A) 和 D17V/I149V (B) 在 Tm 值上的上位效应。蓝色表示负效应,橙色表示正效应。(C) 肌酸酶野生型和对应突变体的动态互相关矩阵图。 与野生型相比,最佳突变体13M4的Tm提升了10.19℃,58℃半衰期增加655倍,同时催化活性保持不变。

    81010编辑于 2025-01-10
  • 来自专栏生命科学

    Cycloheximide 放线菌酮WB、Cell Viability Assay、IF、RT-PCR实验参考|MCE

    Cycloheximide 与真核细胞蛋白质合成过程中核糖体 60S 亚基的 E- 位点结合,阻断 eEF2 介导的核糖体易位过程并阻止新蛋白质的合成。 3、Circulation. 2024 May 28;149(22):1752-1769.用 4-HNE 和 CHX(100μg/mL)处理的 mVSMC 中 Runx2 水平的蛋白质印迹分析长达 12 3、Mol Cancer. 2024 Jul 9;23(1):141.蛋白质合成抑制剂环己酰亚胺(20μM)对 PFKP 耗尽的 LIU-LSC-1 细胞中 c-Myc 稳定性随时间推移的影响。 蛋白质印迹(左)和半定量(右)对 PFKP 和 c-Myc 稳定性的蛋白质表达。 使用 qRT-PCR 检测 CHX 处理的 AML(THP-1 和 HL-60)细胞中 BCL7A mRNA 的半衰期。

    75810编辑于 2025-10-17
  • 来自专栏Y大宽

    5️⃣蛋白质的特征信息3:卷曲螺旋预测

    序列比对和序列特征分析总目录 卷曲螺旋是蛋白质中的结构motif,其中2-7个α-螺旋像绳索一样缠绕在一起,其中最常见的类型是二聚体和三聚体。 许多卷曲螺旋型蛋白质参与重要的生物学功能,例如基因表达的调节的转录因子。 比如c-Fos和c-jun。

    2.9K10发布于 2019-03-04
  • 来自专栏生命科学

    科研人必看:多肽、蛋白质、重组蛋白分不清? 应用场景有哪些?定制如何选?_MedChemExpress (MCE)

    Section.01多肽VS蛋白质VS重组蛋白多肽、蛋白质和重组蛋白本质上都是由氨基酸组成的生物大分子,三者的主要区别在于分子大小、折叠结构以及生产方式:弄清区别只是第一步。 在此基础上进一步优化的Semaglutide则采用C18脂肪二酸结合改造,使其半衰期延长至约一周,支持每周一次给药方案。 图3.脂肪酸修饰的生物学价值:延长半衰期、降低免疫原性,细胞内摄取及跨上皮屏障递送[2]。 图4.通过点击化学连接寡糖和多肽链的化学结构示例[3]。 Section.03重组蛋白定制蛋白质可以分为传统天然蛋白质和重组蛋白两大类。

    21500编辑于 2026-07-07
  • 来自专栏DrugOne

    PNAS | 开发用于优化蛋白质设计的3D模型

    该技术使用三维(3D)结构模型来预测分子嵌段的新颖组合如何协同工作以实现所需的效果。 采用的相同方法,只关注知道起作用的蛋白质亚结构。” ? 尽管许多治疗药物是从天然存在的蛋白质中产生的,但自定义领域尚未发展为允许合成蛋白质的广泛开发。开发合成蛋白的障碍中,绝大多数是可能的氨基酸组合。 为了开发一种优化的设计方法,研究小组扫描了包含150,000种已知蛋白质的3D模型的数据库。他们发现蛋白质中经常会出现少量结构模式,并且蛋白质结构中的许多多样性都来自于这些结构单元的组合方式。 新工艺着眼于蛋白质中存在的较大原子块(称为第三基序),以设计功能性蛋白质。这些是反复出现的结构布置,类似于建筑物中的拱门或立柱,可用于设计新颖的蛋白质而无需考虑其原子级组成。 根据研究论文,结果“有力地证明了蛋白质数据库现在已经足够大,可以仅通过使用不相关蛋白质的结构基序实例来设计蛋白质。” ?

    93040发布于 2021-01-28
  • 多肽药物干货:合成技术与修饰方法详解 | 皓元医药

    多肽药物由现代生物或化学技术合成,是一类介于大分子蛋白质药物和小分子化学药物之间的具有调节细胞生物功能的药物,可用于疾病的预防、诊断及治疗。详细可见下表中的属性对比。 表1 多肽药物与传统小分子化药和蛋白质药物的比较PART 03 多肽药物的合成方法及特点多肽药物合成一般有生物合成法和化学合成法。其中化学合成法中的固相合成法是目前多肽药物的主流方法。 此外,通过多种结构修饰手段,可调控肽类的药代动力学特性,包括吸收、半衰期、代谢和生物利用度。 常用的肽结构修饰策略包括:1 主链修饰,如酯肽、氮肽、内硫肽、反转-D肽、氟代烯烃结构,以及用三唑或氧杂环取代酰胺键;2 末端修饰,如N端烷基化、N端杂环缀合、C端酯化或酰胺化;3 大环化修饰,通过头尾环化 PART 05 FDA近几年批准上市的治疗性多肽参考文献:[1]《2023年中国多肽药物行业概览》沙利文&头豹[2]https://doi.org/10.1038/s41573-020-00135-8[3]

    1.2K10编辑于 2025-08-18
  • AI 设计多肽:生化研究工具的范式革命

    2.4 基于结构的设计范式 基于结构的方法将蛋白质三维空间信息作为设计的核心约束,是最早受益于现代 AI 的多肽设计路线之一。 MCTS + 离散扩散 亲和力、通透性、溶解性、溶血性 TR2-D2 SMILES 指数倾斜扩散 亲和力、通透性、溶解性、溶血性 MOG-DFM 标准氨基酸 离散流匹配(Pareto前沿) 亲和力、半衰期 、溶解性、溶血性 moPPIt 标准氨基酸 MOG-DFM + 位点预测 亲和力、位点特异性、半衰期、溶解性 AReUReDi 标准/SMILES 整流离散流匹配 亲和力、半衰期、溶解性、溶血性 SOAPIA 标准氨基酸 Siamese 引导生成 亲和力 + 脱靶规避 3. 3.4 可编程蛋白质组编辑:诱导邻近策略 这是全文最具远景性的部分,作者将多肽引导的蛋白质组编辑与 CRISPR 对基因组的影响相提并论: 概念框架 CRISPR 成功的核心在于将靶向(gRNA)与执行

    93510编辑于 2026-04-13
  • 来自专栏生信宝典

    百度出品,Nature重磅 -- 优化的mRNA设计算法可改善mRNA的稳定性和免疫原性

    先前的研究已表明,增加二级结构可延长mRNA的半衰期,再加上选择优化的密码子,可改善蛋白表达。因此,原则上mRNA的设计算法必须优化二级结构稳定性和密码子的使用。 详细信息请参见方法 §1.7,扩展数据图3和补充图5。 扩展数据图3 线性时间近似法 对于长序列,精确的设计算法可能仍然很慢。 图4 计算机模拟结果和分析 图3a展示了LinearDesign对UniProt蛋白质的运行时间。 除了编码区设计,UTR结构对于翻译也至关重要(28),UTR工程对蛋白质表达具有深远影响(3)。 具有最低MFE的序列A显示出最慢的降解速率,其半衰期(T1/2)分别为10 mM和20 mM Mg2+缓冲液中的20.0小时和12.6小时(图4c和扩展数据图5)。

    1.3K20编辑于 2023-08-30
  • AI+Drug 文献速递 | 通过少样本学习整合AlphaFold2,预测突变诱导的相对蛋白质-配体结合亲和力变化

    3. Efficacy 期刊: bioRxiv 链接: https://doi.org/10.1101/2025.03.26.645438 简介: 文章介绍了一种整合深度学习与高效功能筛选的方法,用于设计具有延长半衰期和增强疗效的 实验使用了糖尿病和肥胖小鼠模型等,结果显示,部分设计的GLP-1RAs在体内半衰期显著延长,降糖和减肥效果优于司美格鲁肽。该研究为肽类药物设计提供了新途径,且整个设计到筛选过程可在两周内完成。 模型包含蛋白质序列编码、多层图卷积网络蛋白质表示和蛋白质卷积三个模块。 研究使用PDB数据库和AlphaFold蛋白质结构数据库中的数据进行实验,结果表明,MMPFP在分子功能、生物过程和细胞成分预测任务上优于传统单模态模型,AUPR、Fmax、Smin等指标均有3-5%的提升

    44710编辑于 2026-01-08
  • 来自专栏全栈开发工程师

    【SQL必知必会】002-基础篇:了解SQL:一门半衰期很长的语言

    【SQL必知必会】002-基础篇:了解SQL:一门半衰期很长的语言 一、概述 SQL 语言是最具有中台能力的语言! 二、半衰期很长的 SQL 1974 年,IBM 研究员发布了一篇揭开数据库技术的论文《SEQUEL:一门结构化的英语查询语言》,直到今天这门结构化的查询语言并没有太大的变化,相比于其他语言,SQL 的半衰期可以说是非常长了 在这个模型中有 3 个要素:实体、属性、关系。 实体: 我们想要管理的对象; 属性: 标识每个实体的属性; 关系: 对象之间的关系,一对一、一对多、多对多。 示例: SELECT name, hp_max FROM heros WHERE role_main = '战士' 五、价值衡量 SQL 语言 SQL 的价值在于通用性强(市场需求普遍),半衰期长(一次学习终身受用

    41200编辑于 2025-01-06
  • 来自专栏DrugOne

    ICML 2024 | 通过力引导的SE(3)扩散模型生成蛋白质构象

    为了解决这些问题,本文提出了一种用于蛋白质构象生成的力引导SE(3)扩散模型——CONFDIFF。 无条件模型在没有任何序列信息的情况下训练于蛋白质结构,有效地捕捉一般蛋白质的构象分布。一方面,序列条件模型能够访问蛋白质序列信息(seq)以及时间t对应的结构。 表 1 图 3 结果总结在表1中,并在图3和图S3中展示TIC投影中的样本分布。 为了比较,作者报告5个簇的平均最佳RMSD(RMSDAVG)和簇3的RMSD(RMSDCLS3),后者是最难采样的簇。 Protein Conformation Generation via Force-Guided SE (3) Diffusion Models. arXiv preprint arXiv:2403.14088

    93210编辑于 2024-07-05
领券