PeptiVerse能够同时接受氨基酸序列和SMILES表示的化学修饰多肽作为输入,整合蛋白质语言模型和化学语言模型,对结合亲和力、膜渗透性、溶血性、非污损性、溶解性、毒性和半衰期等多项关键性质进行统一预测 传统基于蛋白质序列的方法只能处理20种天然氨基酸,而许多化学修饰后的多肽只能采用SMILES表示。 天然序列采用ESM-2蛋白质语言模型获得表示,SMILES结构则利用PeptideCLM和ChemBERTa学习化学表示。 总体而言,蛋白质语言模型ESM-2能够稳定获得最佳序列表示,而ChemBERTa在化学修饰多肽渗透性预测中表现优于PeptideCLM。这表明,不同性质需要结合不同基础模型优势。 图2:不同多肽性质的数据分布,包括分类任务和回归任务训练集与验证集统计。
上周我们公布了,蛋白质组学习小组起飞啦! 短短几天就获得了200多小伙伴的支持,让我们也更有信心的带领大家掌握一个蛋白质组学数据处理的实战,我们第2期学习内容是认识一下蛋白质组学的原始数据 ? Cell Carcinoma is Downregulation of the Mevalonate Pathway at the Post-transcriptional Level》 理清文章思路 总结蛋白质组学部分的流程 标出所用的软件及需要下载的内容 2.下载软件:MaxQuant 网址:https://www.maxquant.org/ 下载 ?
DeepMind官宣,AlphaFold可以预测出2亿多个蛋白质结构,几乎覆盖了整个「蛋白质宇宙」。 今天,DeepMind再次引爆学术界! AlphaFold能够预测2亿多个蛋白质结构,实现数量级的重大飞跃。 最重要的是,全部免费开放! 在未来,预测蛋白质结构就如同使用「谷歌搜索引擎」一样简单。 超2亿蛋白质结构,免费用 不可小觑的是,AlphaFold确实是学术界「海啸级」的存在,足以改变全人类。 现在,他们分享了科学界已知的2亿多种蛋白质预测结构。 这庞大数字背后所涵盖的几乎是整个蛋白质宇宙! 他说:「从近100万个蛋白质结构扩展到超过2亿个蛋白质结构,几乎涵盖了所有基因组测序的生物体,这是一个巨大的里程碑!」
一级结构指的是蛋白质中氨基酸的排列顺序,和DNA一级结构一致。 也就是说蛋白质发挥什么功能,基本在一级结构中就确定了。 对蛋白质序列进行基本信息分析可以帮助了解蛋白质的基本信息。 AACompIdent image.png 结果之一如下 image.png 说明,邮件会有三张表格分别解释如下 1 第一张表,包含的蛋白质基于特定物种分类,但不考虑pI和分子量限制 2 第二张表 Protparam不考虑蛋白质二级和三级结构的情况下,根据氨基酸组成来估算消光系数。准确的需要实验获得。 体内半衰期:蛋白质在细胞内合成后,含量消失一半所需要的时间,用来衡量蛋白质的稳定性。 Protparam可以预测蛋白质在人,酵母和大肠杆菌中的体内半衰期,可以作为其他物种内的参考。 不稳定系数:作文蛋白质在体外测试中稳定性的参考值。 因为氨基酸的亲疏水性是构成蛋白质折叠的主要驱动力之一,因此蛋白质亲水性分布可以反映蛋白质的折叠情况。
2022年7月28日,DeepMind官方网站发布AlphaFold最新进展:AlphaFold已经确定了地球上几乎所有已知生物体中大约2亿种蛋白质的结构。 通过与EMBL-EBI合作,DeepMind发布了科学界已知的几乎所有已编目蛋白质的预测结构,这将使AlphaFold DB扩展超过200倍 (从近100万个结构到超过2亿个结构),有可能大大增加我们对生物学的理解 03 2020年 解决50年来生物学领域重大挑战 2020年11月30日 AlphaFold2以巨大优势赢得CASP14,并被CASP的组织者认为是解决50年历史的“蛋白质折叠问题”的解决方案,因为它预测结构达到原子精度 2021年11月2日 DeepMind更新了AlphaFold2源代码以解释多链蛋白质复合物,显著提高了预测蛋白质相互作用的准确性。 2022年7月28日 DeepMind将AlphaFold蛋白质结构数据库从近100万个结构扩展到超过2亿个结构,包括对UniProt中大多数蛋白质的预测。
虽然官网说esmfold2可以设计蛋白质,但是官网给的代码的demo都是蛋白质结构的预测: 官方教程展示了 ESMFold2 的三个代表性应用场景。 第一类是蛋白质-核酸复合物预测,例如 LC11-RNase H1 与 RNA 杂合双链形成的复合体系,这说明 ESMFold2 能够同时处理蛋白质链、RNA 链和 DNA 链,并对它们之间的空间关系进行建模 总体来看,这一教程想表达的是:ESMFold2 不只是一个普通的蛋白质折叠工具,而是一个能够处理蛋白质、核酸、小分子、非标准残基、共价修饰以及多组分复合物的综合性结构预测框架。 该案例展示了 ESMFold2 在处理蛋白质-核酸复合物方面的能力,尤其适用于同时包含蛋白质、RNA 和 DNA 多组分体系的结构建模。 这类修饰在治疗性多肽药物中非常常见,主要目的是改善药物的体内稳定性和药代动力学性质,例如延长半衰期、提高抗降解能力等。 其次,需要确定多肽中的 赖氨酸残基 作为脂质 linker 的连接位点。
上一张我们讲解了最基础的ESMProtein类: ESM3蛋白质语言模型cookbook(1) 今天我们继续介绍第二章的内容: 使用ESM-C模型获取蛋白质的特征表达(embedding),进行一个简单蛋白质序列分类的任务 Qustion2.什么是embedding表达? 好,那我们今天就开始围绕这些话题展开描述。 所以我们这次将会通过ESM-C蛋白质语言模型去提取蛋白质序列的embedding表示也就是用特征向量来表示蛋白质序列。 \nRand index: {rand_index:.2f}" ) plt.xlabel("PC 1") plt.ylabel("PC 2") plt.show() 然后我们使用第 上图是使用第七层的embedding进行分类的效果,可以看到当汤姆使用第七层进行蛋白质序列的特征向量的提取之后,然后对向量进行降维,直接映射在2D pca的散点图就可以明显区分出来lid_type为zinc
使用优化的MSA与AlphaFold2可以准确地预测异源二聚体复合物的结构。 摘要 预测相互作用的蛋白质链的结构是理解蛋白质功能的一个基本步骤。 不幸的是,没有一种计算方法能够产生准确的蛋白质复合物的结构。AlphaFold2在模拟单链蛋白质结构方面显示出前所未有的准确度。在这里,我们将AlphaFold2应用于预测异源二聚体蛋白的复合物。 结果和讨论 识别最佳的AlphaFold2模型 成功率(SR),即可接受的模型 (DockQ>0.23) 的百分比,被用来衡量使用不同MSA的开发集 (216种蛋白质) 的AF2的性能。 RoseTTAFold仅在测试集的14个蛋白质对上优于AF2,而GRAMM和TMdock interface分别在188和225个配对上优于AF2。 这里对AF2s分离相互作用和非相互作用的蛋白质的能力的研究比最近的研究包含更广泛的数据。然而,为了彻底测试这种分离,这里研究的数据需要扩展到比较单个生物体内的相互作用。
非天然氨基酸能扩展化学空间,定制肽类药物的功能、半衰期和其他关键属性。尽管含有修饰氨基酸(如经过翻译后修饰的残基)的化学空间极大,但实验测量含修饰氨基酸肽的开发性质既昂贵又耗时。 它们通常具有低口服生物利用度和短半衰期,这是由于高清除率和低代谢稳定性造成的。此外,肽类药物可能具有较差的膜透过性。 自然界中的例子表明,内源性肽和蛋白质的特性可以通过翻译后修饰(PTM)进行改变。 在实际治疗应用中,研究人员通过PTM改善肽性质,如增加生物活性和改善代谢稳定性,增加结合亲和力、半衰期以及通过脂肪化和酰化改善组织渗透能力等等。 通过糖基化可以改善生物利用度和稳定性,增强蛋白质-蛋白质相互作用,利用细胞表面的葡萄糖转运蛋白提高细胞渗透性。 实验测定的部分结果见图2。 实验结果 图 3 通过将计算预测与实验数据进行比较,研究发现两组数据之间存在高度相关性。
2. 背景介绍 Cycloheximide(CHX)是一种由土壤放线菌Streptomyces griseus产生的天然抗真菌抗生素,广泛用于生物医学研究中作为真核细胞蛋白质合成抑制剂。 它能够有效阻断真核翻译过程中的延伸阶段,从而抑制整体蛋白质合成,这一特性使其成为测定蛋白质半衰期、翻译调控和相关细胞机制研究的重要实验工具。 经典研究表明,Cycloheximide的作用位置与延伸过程中的translocation紧密相关,并能稳定多聚核糖体状态,是细胞内翻译分析及半衰期测定常用的药物工具。 结果显示,CHX能显著抑制肠上皮细胞蛋白质合成,从而有效阻断乳糜微粒的形成,显著降低经淋巴途径转运的脂质与药物量[2]。 3.2. PMID: 24525133. [2] Al Nebaihi HM, Davies NM, Brocks DR.
图1.基于蛋白质语言模型组合突变的策略。整个过程包括四个步骤:(1) 收集数据,(2) 蛋白质语言模型的微调,(3) 在组合序列空间中预测所有突变体,以及 (4) 验证所选突变体。 两轮微调和预测过程仅用了两周时间,共设计50个组合突变体,实现了100%的热稳定性设计成功率(图2)。 图2.组合突变体的热稳定性和相对活性数据。黄色圆圈是指相对活性数据。 条形图是指突变体的热稳定性数据,其中蓝色、青色和橙色分别指初始数据集、第一轮和第二轮预测的数据集 其中,最佳突变体13M4包含13个突变位点,与野生型相比,它的活性基本保持不变,在Tm上提高了10.19°C,在58°C下的半衰期增加了约 与野生型相比,最佳突变体13M4的Tm提升了10.19℃,58℃半衰期增加655倍,同时催化活性保持不变。 5.研究强调了将来自蛋白质工程的数据与先进的人工智能模型相结合,可以进一步提升模型的预测性能,从而提升蛋白质工程效率。该策略可以推广应用至多种关键酶分子的进化任务中。
Cycloheximide 与真核细胞蛋白质合成过程中核糖体 60S 亚基的 E- 位点结合,阻断 eEF2 介导的核糖体易位过程并阻止新蛋白质的合成。 2、Cell. 2024 Apr 25;187(9):2288-2304.e27.环己酰亚胺(0.5μM)阻断 SLC6A6-KD CD8 + T 细胞中的整体蛋白质合成,包括 ATF4 的合成。 3、Circulation. 2024 May 28;149(22):1752-1769.用 4-HNE 和 CHX(100μg/mL)处理的 mVSMC 中 Runx2 水平的蛋白质印迹分析长达 12 2、Circulation. 2024 May 28;149(22):1752-1769.用 4-HNE 和 CHX(100μg/mL)处理的 mVSMC 中 Runx2 水平的蛋白质印迹分析长达 12 使用 qRT-PCR 检测 CHX 处理的 AML(THP-1 和 HL-60)细胞中 BCL7A mRNA 的半衰期。
[序列比对和序列特征分析总目录](https://www.jianshu.com/p/878f2b2495ae 结构域domain比较抽象,属于蛋白质构象中二级结构和三级结构之间的一个层次,一般每个结构域有 InterProScan数据库:online和linux(无mac和window) nterPro将来自许多其他资源的蛋白质功能的预测信息统一在一起,概述了蛋白质所属的家族及其所包含的域和位点。 非常全面,,将UniProtDB,PROTSITE,PRINTS,PFAM,ProDom等数据库中含有的蛋白质序列的结构域,motif等合并统一,包含了蛋白质所属的家族,及其所包含的结构域和功能位点。
在此,作者开发了RoseTTAFold2-Lite,这是一种快速的深度学习模型,利用残基-残基的共进化和蛋白质结构预测,在蛋白质组范围内系统地识别和结构化表征蛋白质-蛋白质相互作用。 作者使用细菌双杂交系统(B2H)结合定量β-半乳糖苷酶测定法来测量这11对蛋白质的相互作用。 尽管DCA和GREMLIN提供了强有力的支持,但RF2-Lite或AF未预测为相互作用的五对蛋白质在B2H测定中未显示相互作用的证据。 通过共免疫沉淀(Co-IP)测定,作者检测到六对蛋白质中的四对存在相互作用(图2b–e)。 这些包括作者之前通过B2H验证的一对Q5ZRK0–Q5ZYK1、一对来自大肠杆菌的远端编码蛋白质对,以及两对来自铜绿假单胞菌的近端编码蛋白质对。
Liraglutide通过在Lys26位连接棕榈酸(C16),使其与白蛋白高亲和结合,从而将天然GLP-1约2分钟的半衰期延长至约13小时,实现每日给药。 在此基础上进一步优化的Semaglutide则采用C18脂肪二酸结合改造,使其半衰期延长至约一周,支持每周一次给药方案。 图3.脂肪酸修饰的生物学价值:延长半衰期、降低免疫原性,细胞内摄取及跨上皮屏障递送[2]。 场景三:同位素标记肽同位素标记肽是目前蛋白质组学与定量分析中最标准化的一类多肽定制形式,其核心是通过引入13C、15N或2H等稳定同位素,在质量数上构建“重/轻肽对”,从而在LC-MS/MS体系中实现高精度绝对定量或相对定量分析 Section.03重组蛋白定制蛋白质可以分为传统天然蛋白质和重组蛋白两大类。
PART 01 多肽药物定义多肽是由多个氨基酸通过肽键连接而形成的一类化合物,通常由2-50个氨基酸分子组成,其连接方式与蛋白质相同,对应分子量在10,000 dalt以内,其广泛参与和调节机体内各系统 多肽药物由现代生物或化学技术合成,是一类介于大分子蛋白质药物和小分子化学药物之间的具有调节细胞生物功能的药物,可用于疾病的预防、诊断及治疗。详细可见下表中的属性对比。 表1 多肽药物与传统小分子化药和蛋白质药物的比较PART 03 多肽药物的合成方法及特点多肽药物合成一般有生物合成法和化学合成法。其中化学合成法中的固相合成法是目前多肽药物的主流方法。 此外,通过多种结构修饰手段,可调控肽类的药代动力学特性,包括吸收、半衰期、代谢和生物利用度。 图4 用于克服肽类使用限制并提升其类药物特性的修饰策略PART 05 FDA近几年批准上市的治疗性多肽参考文献:[1]《2023年中国多肽药物行业概览》沙利文&头豹[2]https://doi.org/
文章证明AlphaFold2除了能够进行结构预测之外,还可以快速准确地模拟多肽-蛋白质相互作用。 图1 2)AF2高精度预测肽-蛋白质结构 作者在一组肽-蛋白质复合物数据上进行实验(26个复合物,其中12个具有实验表征的肽结合基序,分为基序集和非基序集)。 总的来说,在没有任何关于肽序列的信息的情况下,AF2无法成功地模拟肽-蛋白质复合物结构。 图3 4)AF2建模配体结合诱导的构象变化 蛋白质对接中最具挑战性的任务之一是对结合时发生的构象变化进行建模。 AF2的速度快且只需要将序列作为输入,并且可以在一定程度上建模结合时发生的构象变化。此外,值得一提的是,AF2还能够在没有可用的多肽MSA信息的情况下,模拟多肽-蛋白质复合结构。
蛋白质语言模型(pLM) 以 ESM-2、ProtT5、ProteinBERT 为代表,在全长蛋白数据集上训练,可自然延伸至由 20 种标准氨基酸组成的多肽。 蛋白质语言模型驱动的结合物发现 • SaLT&PepPr:利用 ESM-2 表征,从已知相互作用蛋白中识别并复用线性结合片段,已在 β-连环蛋白等靶标上获得体内验证 • PepMLM:基于跨度掩码语言模型 D2 SMILES 指数倾斜扩散 亲和力、通透性、溶解性、溶血性 MOG-DFM 标准氨基酸 离散流匹配(Pareto前沿) 亲和力、半衰期、溶解性、溶血性 moPPIt 标准氨基酸 MOG-DFM + 位点预测 亲和力、位点特异性、半衰期、溶解性 AReUReDi 标准/SMILES 整流离散流匹配 亲和力、半衰期、溶解性、溶血性 SOAPIA 标准氨基酸 Siamese 引导生成 亲和力 + 脱靶规避 3.4 可编程蛋白质组编辑:诱导邻近策略 这是全文最具远景性的部分,作者将多肽引导的蛋白质组编辑与 CRISPR 对基因组的影响相提并论: 概念框架 CRISPR 成功的核心在于将靶向(gRNA)与执行
(VRPinea 3月24日电)今日重点新闻:惠普宣布研发VR头显Reverb G2;《半衰期:爱莉克斯》测评,被称为业界VR界神作;iOS 14“查找”应用新增AR模式 1 惠普宣布研发VR头显Reverb G2 与微软、Valve联手合作 惠普宣布将与微软、Valve联手,研发VR头显Reverb G2。 据图片显示,Reverb G2可能会利用微软的Windows MR光学内向外追踪功能,而头显的集成音频看起来与Valve Index非常相似,这可能暗示其将采用悬空式的耳机设计。 ? VRPinea独家点评:虽然Reverb G2的具体参数未公布,但是去年推出超高分辨率的Reverb就足以让人叹为观止。 2 《半衰期:爱莉克斯》测评 被称为业界VR神作 3月24日消息,《半条命:Alyx》于今日在Steam上正式发售,售价163元,游戏支持中文。
研究利用AlphaFold2子采样生成蛋白质构象,经高斯拟合筛选后构建数据集,用STGNet模型学习结构信息进行预测。 该研究为预测蛋白质或配体突变引起的结合能变化提供了有效工具。 2. 该模型用ESM-2编码蛋白质序列,经BiLSTM处理,药物化合物由GNN和WiDeCNN提取特征,最后融合特征预测亲和力。 实验中对不同模型进行多种任务评估,如在蛋白质结构预测任务中,LC-PLM在相关数据集上比ESM-2表现更优;在远程同源性预测等任务中,LC-PLM-G也展现出良好性能。 实验使用了糖尿病和肥胖小鼠模型等,结果显示,部分设计的GLP-1RAs在体内半衰期显著延长,降糖和减肥效果优于司美格鲁肽。该研究为肽类药物设计提供了新途径,且整个设计到筛选过程可在两周内完成。