首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏图形化开放式生信分析系统开发

    图形化开放式分析系统开发 - 3 分析流程的进化

    接上两篇内容,本文主要讲述工作中NGS从科研进入医学临床领域,工作中接触到流程,以及最终在实现的过程。 接触二代测序,分析,那真是打开了一个新世界的大门,各种名次术语满天飞,搞的头晕脑胀。 下面分阶段描述分析流程升级/进化的过程: ---- 1.手动命令行运行 经过几个月接触,自学、爬坑,慢慢搞清楚了部分内容,在似懂非懂之间开始了流程分析,终于有一天明白过来,这所谓的pipeline 比如其中一个步骤: 分析流程的进化_1.png QC 完成后,然后运行下一个步骤: 分析流程的进化_2.png 运行模式,一个输入或者多个输入文件,通过软件分析/计算得到一个或者多个输出文件 脚本连续运行 随着熟练程度提高,分析上用到的软件/工具也熟悉起来了,但是问题也暴露出来了,简单的一套 GATK Best Practice 肿瘤突变分析流程,加上CNV,SV 分析从 fastq 文件开始到最后得到过滤的 到这里,基本上就达到很多公司的自动化分析水平了 6. 然而到这里就足够了么?

    1.3K00发布于 2020-01-17
  • 来自专栏图形化开放式生信分析系统开发

    图形化开放式分析系统开发 - 6 分析流程批量运行与过程控制

    在上文生分析系统开发 - 5 分析流程服务器端运行 解决了设计好的流程分析服务器上运行的问题,随之而来就衍生出的新需求: 一、批量分析流程的运行顺序 流程输入文件是按照样本编号来匹配运行的,运行顺序就取决于样本信息 样本优先级:此处设计样本录入时候,输入优先级字段范围1-9,数字越大优先级越高 样本顺序:样本默认按照录入的时间先后排序,相同优先级的样本数据,按照录入先后顺序排序运行 二、分析流程的过程控制 强制停止 :开始分析流程之后,可以在任意时间停止分析过程 错误恢复运行:分析流程运行错误,再次运行,可以选择从错误处恢复运行 调试恢复运行:分析结束,修改pipeline参数后,可以选择从任意一点开始重新分析(应用修改后的参数 ) 覆盖运行:分析错误或者正常结束后,重新从头开始运行整个分析流程,并覆盖之前的分析结果 技术实现: 一、批量样本分析流程的运行顺序: 依赖于样本的优先级和输入的顺序先后,每次从数据库取出未完成分析的样本列表 其实就是一个带有优先级参数的先进先出的堆栈 二、分析流程控制 前文描述了如何将设计好的pipeline运行于服务器,如果要监控整个运行过程,就需要创建一个守护线程,如果用户操作停止分析,这时候守护进程就要终止运行进程

    80800发布于 2020-01-17
  • 来自专栏生信技能树

    分析流程构建的几大流派

    导言 构建分析流程是生物信息学从业人员必备的技能之一,对该项能力的评估常常是各大公司招录人员的参考项目之一。 根据信息学数据分析流程(管道、工作流程序)构建的风格和方式,大致有以下几大流派(注1): 脚本语言流 Common Workflow language 语言流 Makefile流 配置文件流 Jupyter 分析流程构建的几大流派 | 脚本语言流 脚本语言流的主要是通过简单的脚本语言(如shell,R,Python,Perl)运行各类命令行脚本/程序。 )最早开始接触分析流程的方式。 后两种(3和4)是专业人员开发新工具、新流程的必备技能。

    5.5K61发布于 2018-12-18
  • 来自专栏BioIT爱好者

    分析流程构建的几大流派

    导言 构建分析流程是生物信息学从业人员必备的技能之一,对该项能力的评估常常是各大公司招录人员的参考项目之一。 一个好的生物信息分析流程可以让你事倍功半,有效减负,同时也有利于他人重复你的数据分析结果。 根据信息学数据分析流程(管道、工作流程序)构建的风格和方式,大致有以下几大流派(注1): 脚本语言流 Common Workflow language 语言流 Makefile流 配置文件流 Jupyter 分析流程构建的几大流派 | 脚本语言流 脚本语言流的主要是通过简单的脚本语言(如 shell,R,Python,Perl)运行各类命令行脚本/程序。 前两种(1 和 2)是大多数生物信息学初学者(不具备封装和打包能力)最早开始接触分析流程的方式。后两种(3 和 4)是专业人员开发新工具、新流程的必备技能。

    3K41发布于 2021-10-15
  • 来自专栏生信小驿站

    单基因分析流程3)一文解决生存分析和临床参数相关分析

    本文目的 (1)绘制生存分析图 (2)临床参数相关分析 加载所必须的包 # ============================================================== bold"), font.x = c(16, "bold"), legend = "top", font.legend = c(16, "bold")) dev.off() 临床参数相关分析 $Te2[data$Te2 == "T1"] <- 'T1-T2' data$Te2[data$Te2 == "T2"] <- 'T1-T2' data$Te2[data$Te2 == "T<em>3</em>" ] <- 'T3-T4' data$Te2[data$Te2 == "T4"] <- 'T3-T4' table(data$Te2) t.test(expression~Te2,data = T4','expression'])) sd( na.omit(data[data$Te2 =='T3-T4','expression'])) #N table(data$N) data$N

    3.5K41发布于 2019-05-15
  • 来自专栏生信宝典

    分析Python实战练习 3 | 视频21

    开源 Python教程 专用简明 Python 文字和视频教程 源码在:https://github.com/Tong-Chen/Bioinfo_course_python 一些练习题 给定FASTA aDict = {‘ENSG00000000003’: {“A-431”: 21.3, “A-549”, 32.5,…},”ENSG00000000003”:{},} 用到的知识点 输入格式(只需要前3列就可以 0.0 FPKM Not detected ENSG00000000005 A-549 0.0 FPKM Not detected ENSG00000000005 AN3- Not detected ENSG00000000005 CACO-2 0.0 FPKM Not detected 输出格式 Name A-431 A-549 AN3- chr1 199 208 TGGCGTTCA chr1 207 216 ACCCCGCTG chr2 63 70 AAATTGC chr3 0

    28920编辑于 2023-09-12
  • 来自专栏生信小驿站

    单基因分析流程(6)单基因相似性分析

    gene_name","gene_id","gene_biotype"), sep = " \\| ") mRNA_exprSet <- mRNA_exprSet[,-(2:3)

    1.3K21发布于 2020-08-13
  • 来自专栏图形化开放式生信分析系统开发

    图形化开放式分析系统开发 - 4 分析流程图形化

    在上文图形化开放式分析系统开发 - 3 分析流程的进化 讨论了分析pipeline的进化,从手动到自动,但仍然停留在终端命令行阶段,为了让更多非专业的人能够使用,就要想办法实现分析pipeline ${tools.samtools} 分析流程中用的reference文件以及数据库,如 hg19.fa ${ref.hg19} 分析流程中,用到的cutoff值. 如 cnv的cutoff值 ${cutoff.cnv} 分析流程运行时配置的资源,如 线程数 ${threads} 分配内存大小${mem} 变量值的类型: 字符:通用的格式,比较宽松 /节点设计:前文提到,分析pipeline其实就是基于文件输入输出的工作流,这里对工作流做了简化,归纳起来工作流中有4种节点。 Output节点,获取pipeline的最终输出文件 end.png end_menu.png 3.

    1.2K00发布于 2020-01-17
  • 来自专栏芒果先生聊生信

    分析网站(生存分析

    论文的套路 ONCOMINE从全景、亚型两个维度做表达差异分析; 临床标本从蛋白水平确认(或HPA数据库),很重要; Kaplan-Meier Plotter从临床意义的角度阐明其重要性; cBio-portal 数据库做基因组学的分析(机制一); STRING互作和GO/KEGG分析探讨可能的信号通路(机制二); TISIDB/TIMER分析肿瘤免疫特征(机制三)。 差异分析,无论是Oncomine,GEPIA,还是UALCAN、HPA数据库,都不需要R语言编写代码,容易上手,基本上一个星期甚至更短的时间就可以搞定,属于菜鸟级别生操作。并没有想象中那么难。 生存分析论文中经常出现的表型,也就是说基因在正常和肿瘤组织中表达的差异,与生存率的指标密切相关。如A基因在肿瘤中表达明显上调,生存率显著下降,这就是非常明确的相关性。 生存分析是非常重要的表型,诸多文章均有介绍。这里,我们对生存分析的纯数据库进行总结,果友们在选择时也可以作为参考。

    4.5K44发布于 2020-08-11
  • 来自专栏生物信息学

    一步到位-分析流程构建框架介绍

    好在时至今日,已经有很多科学家开发了非常多优秀的算法及软件,很多时候我们要做的是怎么将这些软件串联起来并构建成分析流程,而这项技能通常是各大公司考核应聘者的项目之一。 这种理念是我们最直观的分析逻辑,也是最常用的流程框架。通常,刚入门的同学们会选择这种方式,简单而暴力;段位较高的同学,则会选择将分析内容进行包装,然后提供多个参数选择,增加流程灵活性。 大部分时候,这样都会满足我们分析需求,但是其作为一个流程有着严重的缺点就是缺乏重入性(reentrancy),即当流程在运行过程中,很容易因为某些不知名的原因而发生中断,而普通的脚本流程只能是从头来过了 (对Shell高度依赖的童鞋们可以值得一试) 3. ,那么就可以使用Implicit/Explicit类的流程,如:Snakemake、Nextflow等,而这一类的流程也比较适合刚入门生的小伙伴们去尝试; 如果是需要进行高性能流程开发,致力于解决特定的生物学问题

    2.8K30发布于 2020-04-13
  • 来自专栏图形化开放式生信分析系统开发

    图形化开放式分析系统开发 - 5 分析流程服务器端运行

    在上文图形化开放式分析系统开发 - 4 分析流程的图形化设计 讨论了分析pipeline的图形化,如何用图形的方式显示pipeline,但是pipeline脚本按照变量的形式保存之后,如何运行 本程序作为控制端,可以和分析端部署在一台机器,也可以通过联网方式连接。 SliverWorkspace_V2.1.pdf 首先这里实现了,服务器账户信息的管理,账户、主机名、端口、密钥、密码,这些信息为了保证安全,需要二次加密,不能将密码明文保存在数据库中,一旦泄漏危害巨大 服务器信息2.png 针对分析流程 网络状态、变量值是否符合要求 Web终端应急操作,可以点击终端按钮直接打开shell,手动操作,见下图: 服务器信息3.PNG 运行的方式: 之前系统设计时所做的准备: 通过图形化设计之后获得的pipeline 运行完成后服务器端推送信息到控制端,判断是否符合要求,输出文件是否存在 运行失败后服务器端推送信息到控制端,显示错误信息,错误日志,便于开发人员查找错误 统计每一个分析步骤的运行时间,便于统计分析

    1K00发布于 2020-01-17
  • 来自专栏免疫组库研究

    分析】免疫组库基础分析9-CDR3 motif分析

    通过分析 CDR3 motif 的序列特征(如长度、关键氨基酸残基),可阐明免疫受体(Ig/TCR)与抗原结合的分子规律,揭示 “抗原 - 受体” 相互作用的特异性机制,为理解免疫应答的精准调控提供依据 图1.不同长度的CDR3 氨基酸motif比较 2.2 CDR3 中间氨基酸motif 分析 这是一种忽略CDR3长度,关注CDR3中间氨基酸多样性motif分析策略。 通常以CDR3最中间的氨基酸作为位置0,然后分别计算中间与左右两边各两个氨基酸的motif特征。 图2.CDR3中间氨基酸motif 分析 3. 举例分析CDR3motif 3.1 展示特定长度CDR3 氨基酸motif library(tidyr) library(tidyverse) files <-list.files(path = ". # 高度(英寸) ) } 3.2 CDR<em>3</em> 中间氨基酸motif <em>分析</em> df <- read.table("AA-sigclone.txt", sep='\t', header = TRUE) #

    40310编辑于 2025-10-20
  • 来自专栏免疫组库研究

    分析】免疫组库基础分析7-CDR3长度分析

    例如,抗体重链长 CDR3 倾向使用 DH2/DH3-JH6 基因片段,短 CDR3 则依赖其他基因组合‌。 通过高通量测序量化这一参数,可解码免疫应答的克隆动态,为精准免疫诊疗提供基石 2.如何分析CDR3长度 2.1 CDR3 核苷酸长度与CDR3氨基酸长度 在免疫组库分析文件中,提供CDR3区域的 因此,对CDR3长度的分析包括:CDR3 核苷酸长度与CDR3氨基酸长度,后者在分析中更为常见。 CDR3 长度分析的种类 3.1.CDR3 长度高斯分布分析 将X轴设置为核苷酸或者氨基酸不同长度数值,Y轴设置为百分比。展示每一个CDR3长度下对应的频率。 3.2.CDR3 长度平均分布分析 利用加权平均值来分析不同样本或者不同链的CDR3平均长度。 3.3.特定V/D/J 基因的CDR3 长度平均比较 如下图所示,图a展示了不同TRBV基因的相对频率。

    71010编辑于 2025-10-20
  • 来自专栏芒果先生聊生信

    分析网站(免疫浸润分析

    论文的套路 ONCOMINE从全景、亚型两个维度做表达差异分析; 临床标本从蛋白水平确认(或HPA数据库),很重要; Kaplan-Meier Plotter从临床意义的角度阐明其重要性; cBio-portal 在差异分析的前提下,表型分析成为重点内容,也是可以玩出花样的地方。 生存分析是非常常见的表型分析。与生存分析相比,相关性分析是另外一个常见的表型分析。 免疫浸润分析比生存分析、差异分析和相关性分析难度更大,因为免疫学是不断延伸、拓展的学科,并不断从理论走向应用、临床,兼有科学性和技术性,比如实验中已经普遍应用的免疫印迹(WB),流式分析,免疫组化和免疫荧光等等 分析中,有一种算法叫反卷积分析,英文名叫Deconvolution。 开发人员可以先通过预设一个优秀的数据训练集(训练集主要包含了每种不同免疫细胞的基因表达特征),然后通过反卷积算法推算出这个整体样本中究竟有哪些免疫细胞。

    7.9K43发布于 2020-08-12
  • 来自专栏生信学习小组

    学习day3

    anaconda是总管,职务比conda低,但干的活不少,也是个有内涵的家伙miniconda是区域经理,说白了就是干事的,而且比较专一,主要负责领域二、如何下载软件1.创建biosoft(mkdir biosoft(cd biosoft)2.从某链接下载软件:wget https://mirrors.tuna.tsinghua.edu.cn/anaconda/miniconda/Miniconda3- latest-Linux-x86_64.sh星球:sh是脚本(就是一个程序,后台的代码)文件的后缀,也就是说其实这是一个下载的脚本。 然后出现这个界面:3.下载完成后,运行 :bash Miniconda3-latest-Linux-x86_64.sh,然后开始安装过程4.激活:source ~/.bashrc(注意空格)星球:激活不成功就将 add channels https://mirrors.bfsu.edu.cn/anaconda/pkgs/main/conda config --set show_channel_urls yes星球三

    46110编辑于 2024-01-18
  • 来自专栏生信技能树

    每月一流程之rnaseqGene

    每月一流程栏目灵感来自于《铁汉1991》博客的《每日一》,他那个时候介绍的主要是基础知识,包括数据结构,数据格式,数据库资源,计算机基础等等,所以每天都可以进步,每天都有成果。 这些基础知识已经被分享的七七八八了,所以我这里推陈出新,来一个每月一流程,陪技能树的粉丝们一起进步! image.png 不同数据变换公式的差异 学习这样的流程是需要一定背景知识的 首先是LINUX学习 我在《分析人员如何系统入门Linux(2019更新版)》把Linux的学习过程分成6个阶段 , 30万学习量的基础合辑: image.png 技能树关于RNA-seq上下游数据分析的教程的确不少了 因为做目录确实很浪费时间,差不多就下面这些,大家先学习吧: 转录组经典表达量矩阵下游分析大全 可变剪切 小白的RNA-seq实战历程 RNA-seq数据分析指南 后记 听说隔壁openbiox团队在组织翻译这个bioconductor流程系列,而且还是由我们技能树元老-思考问题的熊领头,希望他们的翻译成果早日出版

    1.1K20发布于 2020-04-14
  • 来自专栏生信小驿站

    单基因分析流程(2)一文解决差异分析、基因相关分析问题

    单基因分析流程(1)一文解决TCGA数据下载整理问题 单基因分析流程(2)一文解决差异分析和基因相关分析问题 本文目的 学会如何使用差异分析 学会绘制火山图和热图 学会如何求取相关基因 第一招: 差异分析 差异分析步骤总结 (1)读取基因表达矩阵 (2)根据基因表达量设置样本分组 (3)设置差异倍数、生成差异分析结果 (4)绘制火山图和热图 加载所必须的包 # ============== ======================= 设置分组,我们根据ERBB2基因的表达中位值,将样本分为ERBB2高表达组和ERBB2低表达组,通过求两组样本的差异基因,来对ERBB2的生物学功能进行分析

    4.4K62发布于 2019-05-15
  • 来自专栏生信菜鸟团

    Singularity — 流程搭建好帮手

    Kurtzer && Lawrence Berkeley National Lab DOI:10.1371/journal.pone.0177459 3如何安装 非root用户推荐使用conda 安装。 (唯一不足是Conda安装的singularity不是最新版本) conda create -n singularity singularity=3.8.6 -y 4分析中为什么使用Singularity Singularity 容器可以将软件及其依赖项打包在一起,确保分析环境的一致性,无论是在本地机器、服务器还是云平台上。 这种高度的移植性确保了生物信息学分析可以轻松地从一个计算环境迁移到另一个,无论是从个人电脑到云平台,还是在不同的研究机构之间共享。 singularity build --fakeroot test.sif test.def ## 运行 singularity run test.sif 示例演示 运行输出 6来看一个实例 刚好前段时间技能树有发一个推文介绍了中国人群的肝癌多组学队列研究

    2.3K10编辑于 2024-04-11
  • 来自专栏生信课程note+实验知识

    课程note-3

    #筛选score > 0的基因df1[df1$score > 0,1]df1$gene[df1$score > 0]#5.数据框修改#改一个格df1[3,3] <- 5df1#改一整列df1$score mm[2,]m[,1]m[2,3]m[2:3,1:2]mt(m):转置 行变列m<-as.data.frame(m) 转换为数据框 必须要赋值矩阵画热图: pheatmap::pheatmap(m) 100scores[c("jimmy","nicker")]names(scores)[scores>60]# 删除 rm(l) 删除一个rm(df1,m)删除多个rm(list=ls())删除全部清空控制台 rm(df1,df2)rm(list = ls()) 改变列的顺序a <- a[,c(1,3,4,2)]练习3-1# 练习3-1# 1.读取exercise.csv这个文件,赋值给test。 (a))a# 4.探索列表取子集l[2]和l[[2]]的区别(提示:数据结构)class(l[2])class(l[[2]])图片引自生技能树

    2K40编辑于 2023-02-09
  • 来自专栏笔记生信

    提升day3

    查看服务器 uname -a1.好的,是你64-bit(x86_64)2.3.下载成功未安装,需要运行这句代码(问啥回答啥)bash Miniconda3-latest-Linux-x86_64.sh conda config --set show_channel_urls yes使用conda查看当前服务器上安装的所有软件列表 conda list安装软件 conda install fastqc -y 3尝试不加 fastqc -y(先不试)选修conda 环境 分身就是不同的“conda environment”为了满足不同项目需要的相同软件的不同版本1.查看conda有哪些环境(带*已激活)2.创建也成功了3. 成功成功,芜湖~4.退出当前环境conda deactivate 代码引用星球,说明部分引用星球心得,感觉今天比昨天简单,嘻嘻~

    30500编辑于 2023-11-15
领券