GEO数据挖掘5 sunqi 2020/7/13 GEO数据挖掘5 概述 GO和KEGG富集分析 KEGG全称 Kyoto Encyclopedia of Genes and Genomes,由日本京都大学生物信息学中心的 数据库能够把基因及表达信息作为一个整体的网络进行研究,通俗点讲就是通过基因寻找通路 GO全称为gene ontology,由基因本体联合会(Gene Ontology Consortium)建立的数据库 ,数据库对基因和蛋白功能进行限定和描述 GEO数据挖掘离不来富集分析,单纯的差异表达基因不能说明什么问题,只有对基因根据现有知识做定义定位分类,这样才能在生物学上解释这个差异,也就是故事才能讲顺了 注释 :GO和KEGG的具体作用不再赘述,等代码实现完成之后后续再学习理论知识 另外,KEGG和GO分析可以通过软件实现,具体参考官网 数据预处理 用到的数据集为差异分析后得到的数据集deg,详情见上章 rm by cytochrome P450 3/82 ## hsa04390 hsa04390 Hippo signaling pathway 5/
在当今数据驱动的商业环境中,数据治理成为企业成功的关键因素之一,而数据血缘正是数据治理成功的一个关键。 本文我们详细探讨下数据血缘与元数据有什么关系?他们之间又是如何配合实现数据治理的。 本文思维导图如下所示: 元数据(Metadata)是描述数据的数据,它为数据提供了上下文信息,使用户能够更好地理解、管理和使用数据。 元数据的类型 根据不同的应用场景,元数据可以分为业务元数据、技术元数据和操作元数据。 业务元数据描述与业务相关的信息,包括业务术语、数据定义和业务规则。 在数据治理中,元数据和数据血缘紧密相关。元数据记录了数据的来源和目标,使数据血缘分析能够准确地追踪数据的流动路径。 通过元数据和数据血缘的结合,企业可以更好地理解和管理其数据资产,提升数据的价值和利用水平。元数据和数据血缘在数据治理中具有不可替代的重要作用。
预处理数据包括:特征的标准化,数据的正则化,特征的二值化,非线性转换,数据特征编码,缺失值插补,生成多项式特征等。 二,数据正则化(normalize) 正则化是缩放单个样本以具有单位范数的过程。正则化有时也叫归一化,正规化。 通常使用"one-hot"方式编码后会增加数据的维度和稀疏性。 ? 五,处理缺失值 因为各种各样的原因,真实世界中的许多数据集都包含缺失数据,这类数据经常被编码成空格、NaN,或者是其他的占位符。 但是这样的数据集并不能和scikit-learn学习算法兼容。 使用不完整的数据集的一个基本策略就是舍弃掉整行或整列包含缺失值的数据。但是这样就付出了舍弃可能有价值数据(即使是不完整的 )的代价。 处理缺失数值的一个更好的策略就是从已有的数据推断出缺失的数值。 ? 六,生成多项式特征 在机器学习中,通过增加一些输入数据的非线性特征来增加模型的复杂度通常是有效的。
5.数据库 数据库的操作 创建数据库create database mydb ; 查看创建数据库的语句show create database mydb ; 改变当前的数据库use mydb ; 删除数据库 ,先创建数据库,再获取可读可写的数据库对象,如果数据库存在,就直接打开,增删改用这个 SQLiteDatabase db = oh.getWritableDatabase(); //如果存储空间满了 第一个参数是表名,表示希望从哪张表中查 询数据。第二个参数用于指定去查询哪几列,如果不指定则默认查询所有列。第三、第四个参数用于去约束查询某一行或某几行的数据,不指定则默认是查询所有行的数据。 数据库常用操作 用到数据库就要想到 数据库单例,保证只要一个实例 定义javaben对象 将Javaben对象存到数据库 从数据库读取 实例: CoolWeatherOpenHelper public 使用这种方式来维护数据库的升级,不管版本怎样更新,都可以保证数据库的表结构是最新的,而且表中的数据也完全不会丢失了。
1.双向数据绑定 <template>
2)#1-3重复2次##从向量中提取元素根据元素位置x[4]#x取第4个元素x[-4]#x取除了第4个元素之外所有元素x[2:4]#x取第2到第4个元素x[-(2:4)]#x除了第2到第4x[c(1,5) ]#x第1个和第5个根据值x[x==10]#等于10的元素x[x<0]#小于0的元素x[x%in%c(1,2,5)]#存在于向量1,2,5之间的元素数据框读取本地数据read.table(file="文件名 文件名.txt",sep="\t",header=T)查看行名和列名、行数和列数colnames(a)#查看列名rownames(a)#查看行名,如果不命名使用默认值的话,行号就是行名,即1,2,3,4,5, ......dim(a)#几行几列数据框的导出write.table(a,file = "新文件名.txt",sep=",",quote=F)#分隔符号改为逗号,导出文件在工作目录下变量的保存与重新加载可适用于未一次性处理完的数据下次接着处理
数据的更新处理大体可以分为插入(INSERT)、删除(DELETE)和更新(UPDATE)三类,此外,还会给大家介绍数据库中用来管理数据更新的重要概念—事务。 当然很多RDBMS都支持一次插入多行数据,这样的功能称为多行INSERT。 5:从其他表中复制数据 要学习该方法,我们首先得创建一张表。 二:数据的删除(DELETE语句) 1:DROP TABLE语句和DELETE语句 删除数据的方法大体可以分为以下两种: ① DROP TABLE语句:可以将表完全删除 ② DELETE语句:删除表中的全部数据 一旦回滚,数据库就会恢复到事务开始前的状态。
上一回简单的说了一下队列两个常见的应用:层次遍历以及在计算机系统中的应用,这一回,我们来看一个大家都非常熟悉的数据结构:数组! ? ? 数组的定义 ? 数组是由 n(n≥1)个相同类型的数据元素构成的有限序列,每个数据元素称为一个数组元素,每个元素在 n 个线性关系中的序号称为该元素的下标,下标的取值范围称为数组的维界。 大多数计算机语言提供了数组数据类型,逻辑意义上的数组可采用计算机语言中的数组数据类型进行存储,一维数组的所有元素在内存中占用一段连续的存储空间。
#取x的第四个元素 x[-4] #排除法,除了第四个元素外剩余的元素 x[2:4] #第二个到第四个元素 x[-(2:4)] #除了第二个到第四个元素 x[c(1,5)] #第一个和第五个元素 (1) 根据值取 x[x==10] #等于10的元素 x[x<0] #负数 x[x%in%c(1,2,5)] #存在于向量c(1,2,5)中的元素 数据框 (1)read.table()常见参数 header 逻辑值,指示表格是否包含文件第一行中的变量名称 sep 分隔数据值的分隔符。 读取数据时的值为NA colClasses 分配给列的类的可选向量。 ="test.RData")#保存其中一个变量 load("test.RData")#再次使用RData时的加载命令 (5)提取元素 - X[x,y]#第x行第y列 - X[x,]#第x行 - X[,y
向量标量和向量的区分标量:一个元素x<-()向量:多个元素x<-1:10从向量中提取元素根据元素位置x<- []根据值x[]数据框读取本地数据read.table(file=)查看行名和列名colnames (),rownames()数据框的导出变量的保存与重新加载提取元素作业:没有给a赋值
2.1.3函数1.函数是Python为了是代码效率最大化、减少冗余而提供的最基本的数据结构。函数实现了对整段程序逻辑的封装,是程序逻辑的结构化或过程化的一种编程方法。
(4)显示工作路径 getwd()(5)向量是由元素组成的,元素可以是数字或者字符串。(6)表格在R语言中称为数据框^_^(7)别只复制代码,要理解其中的命令、函数的意思。函数或者命令不会用时,使用? +命令数据类型首先明确“元素”的意思,元素指的是数字或者字符串(用chr表示)等,根据它可以区分两个词:标量:一个元素组成的变量向量:多个元素组成的变量向量操作x<- c(1,2,3) #常用的向量写法 c(1,2,5)中的元素[1] 1 2 1 2数据框> y<-read.csv("doudou.txt") > y X1 X21 A 12 B NA3 C NA4 D 35 E NA> a<-read.table(file = "huahua.txt",sep = "\t",header = T) #sep代表每行数据之间的分隔符> colnames(a)[1] "X1" "X2"> row.names(a)[1] "1" "2" "3" "4" "5"> write.table(a,file = "yu.txt",sep = ",",quote = F) #将a的数据写入到
所以一般在生产环境中记录指定的数据后就关闭该功能; 实际操作: /** 1.查看Logs记录功能十分是否开启 **/ mysql> SHOW VARIABLES LIKE "general_log%" var/log/mysql/general_sql.log /** 3.实时查看 */ $ tail -f /var/lib/mysql/general_sql.log 补充事项: 1.您可以采用一些数据库监控软件进行实现
="localhost"; $username="root"; $password=""; $db="fy"; $pageSize=10; $showPage=5; $conn){ echo "数据库连接失败"; exit; } mysqli_select_db($conn,$db); $sql="SELECT mysqli_close($conn); $total_sql="SELECT COUNT(*)FROM page";获取数据,然后是 $total_result=mysqli_fetch_array "
数据定义语言DDL 用于库和表的管理 库的管理: 创建,修改,删除 表的管理: 创建 修改,删除 创建:CREATE 修改:ALTER 删除:DROP 库的管理 # DDL语言 /* 数据定义语言 很容易导致数据丢失) # 更改库的字符集 ALTER DATABASE text1 CHARACTER SET gbk; # 3. DROP TABLE IF EXISTS author; # 表的复制 # 仅复制表的结构 CREATE TABLE copy_author LIKE book_author; # 复制表的结构与数据 CREATE TABLE copy2_author SELECT * FROM book_author; # 复制部分数据只需要添加筛选条件 # 只复制一部分结构 CREATE TABLE copy3
=2) #1-3,重复2次从向量中取元素(1)根据元素位置x[4] #x第4个元素x[-4] #除第4个元素外剩余元素x[2:4] #第2到4个元素x[-(2:4)] #除了第2-4个元素x[c(1,5) ] #第1个和第5个元素(2)根据值x[x==10] #等于10的元素x[x<0] #小于0的元素x[x %in% c(1,2,5)] #存在于向量c(1,2,5)中的元素数据框提前把示例数据放在工作目录下读取本地数据 getwd()[1] "D:/CSU/R/24.3.26/day5-practice"setwd("D:/CSU/R/24.3.26/day5-practice")x <- read.csv('doudou.txt ') #获得示例数据View(x)read.table(file = "huahua.txt",sep = "\t",header =T) X1 X21 A 12 B NA3 C NA4 D )查看行名和列名、行数和列数colnames(a) # 查看列名[1] "X1" "X2"rownames(a)[1] "1" "2" "3" "4" "5" 查看行名数据框的导出write.table
数据框1.干货+个人理解2.选修之作图plot(iris$Sepal.Length,iris$Sepal.Width)三.作业附上思维导图和操作图今天的学习到此告一段落啦~
向量元素,标量,向量元素,指数字或者“字符串”(chr)标量,一个元素组成的变量向量,多个元素组成的变量从向量中提取元素x[4]x[c(1,5)]数据框读取本地数据/导入数据(day4讲过)sep,分割符的类型 数据框的导出。图片使用数据框的变量作图。图片补充向量是由元素组成的,元素可以是数字或者字符串。括号,英文。解决问题,函数或者命令,百度,谷歌,和查看帮助的命令:?
(4)显示工作路径 getwd()(5)向量是由元素组成的,元素可以是数字或者字符串。(6)表格在R语言中改名叫数据框^_^(7)别只复制代码,要理解其中的命令、函数的意思。 (8)数据类型(重点只有两个,剩下的不看)在这些数据类型里,生信学习者最需要熟悉的是向量和数据框。 理解元素、向量和标量使用时,一般都会直接给变量定义,也就是“赋值”,字面意思是赋予这个变量一个数值(其实也不一定是数值,还可以是字符串/数据框等等)。 Part2:数据框将示例数据放在你的工作目录下(!!!重要)示例数据是如何获得的?(1)新建doudou.txt,输入以下(如果教程里让你新建,又没说在哪里,你就默认在工作目录下新建。) 用以下命令即可获得示例数据框:X<-read.csv('doudou.txt')
课前笔记(1) R 赋值符号 <- 、=(2)console控制台输入命令,相当于Linux的命令行(3)R代码括号中必须是英文(PS:基本上都不支持中文来着,哈哈)(4)getwd()显示工作路径(5) 向量:元素组成,元素可以是数字或者字符串(6)表格在R语言中属于数据框(7)? read.table查看帮助(8)数据类型:向量、矩阵、数组、数据框第一部分:向量1、向量元素包含数字或者字符串标量:一个元素组成的变量,可以是数字或者字符串,使用时必须加引号向量:多个元素组成的变量, 排列有序的数字或者字符串2、从向量中提取元素(1)根据元素位置(2)根据值第二部分:数据框(1)读取本地数据熟悉sep和header参数,帮助文档尝试理解他们的意思尝试使用代码将huahua.txt文件放进工作目录 save(a.file = 'test.RData') #保存其中一个变量load('test.RData')#再次使用RData时的加载命令(5)提取元素X是刚才的变量名,实际应用要懂得替换a[x,y