00:02
接下来上我们的最后一课啊,也是我们的第28课,关于我们的AI的一些应用。大家平时用AI吗?嗯,我相信应该是用的啊,大家手机里可能都装了,比如说豆包啦,Deepsick啦。啊,如果有条件的话,可能也在用拆的GPT啊,包括一些其他的一些。AI软件。大家还记得第一课给大家演示的时候用的那个AI吗?现在的air仍然处于发展的一个比较。的阶段。就是水平比较低的一个阶段,还无法完成我们很多想要的一个工作。啊,当然现在这个大家看那个短视频啊,或者其他的一些互联网新闻啊等等,认为AI已经好像对行业冲击已经很大了。但是呢,通常这种抱怨就是说AI的人啊。
01:03
啊,往往是什么人,就是互联网那帮人,大家有没有听说说公司,比如说生信公司,因为AI的出现,把很多的这个生信给干掉了,有没有。有没有?没有啊,为什么?这就是因为发展阶段还不够强啊,生性处于交叉学科,我们不仅需要他写一些分析的代码,更需要他帮我们解读分析结果,目前这部分AI还做不到,当帮我们写部分代码,这个还可以。啊,如果说我们把分析结果给到AI,让AI帮我们解读结果。啊,这个目前还做不到啊,还不行。首先我们打开这个deep。大家调到下面,可以看到deep的一个发展历程,大家可以看到它的一个研究的一个内容。嗯,Deep sick的各个版本啊,包括deep sick maths啊,这是专门为数学准备的,还有deep LIM这个是什么。
02:04
这个是大语言模型,它是我们AI的模型啊,也就是说大部分这个AI啊,都用的这个大语言模型,大家看那个AI的底层逻辑啊,尤其是呃,包括豆包,包括出的GPT。啊,基本上都用的大语言模型。借鉴了大语言模型。啊,我们通常啊用的AI都比较低端。都比较低端啊,怎么呢,就是有这种交互方式。来进行问答啊,这种是最低端的啊,最低端的,不过最低端的呀,目前还没有很完善,第一节课给大家演示过,比如说我想做。多样本的整合分析。我怎么写呢?嗯,我想要交互的写,比如说多样的。啊微姆低精度的整合分析。嗯。这样写可不可以呢?
03:02
可以啊,可以他会给大家一个。呃,结果啊结果,然后呢,他会给大家一些策略方式,比如说我们想要代码呢。Python代码。啊,他会给大家列出来一些Python的一个内容,但是大家要注意啊,大家要注意。注意什么呢?第一个。它用它,呃,本身用的大语言模型,那么大语言模型有一个问题在于什么呢?它借鉴的是网上现有的一些资源。网上现有的资源是不是最新的、最可靠的呢?啊,这个存疑啊存疑,以这个为例。如果我们想用哈木尼来进行多样本整合的话,其实现在更多的用的是scpad扩展包SCE。啊,不再用哈姆尼本身的这个Python包了。啊,当然也可以用啊,不过更多的嫁接的SC派啊,更加的就是对接的更加好一点。
04:06
第二个是什么?第二个就是里面的很多参数啊,如果不指定,大家看看他是他怎么写的。怎么写的第一个啊,加载数据,然后合并样本,默认的是墨子对吧。然后加载啊,加载啊计算线粒体比例,大家看到没。他会给大家一些事例。就是过滤的示例啊,这个参数呢,因为AI是不确定的。啊,针对大家的分析课题,这个参数到底是多少,AI是不确定的。原来的话直接就给个参数让大家分析,现在呢,AR稍微智能一点了,就是说给大家一些啊,视力代码注释掉啊,让大家自己做选择,然后log normalize等等等等。啊,识别高面积等等等等,大家看到没,他用的是那种最低端,就是那个没有任何参数调整的方法。
05:02
啊,如果我们想要用更加准确的方法,该怎么办呢?就是第一节给大家说的啊,这种交互啊,需要大家有对深层次。对大家那个代码语言逻辑啊,有更深层层次的理解,比如说这个地方我们就要加更多的参数。嗯。阿玛尼等和。采用。CE模块。啊,高变基因。嗯,3000。嗯,的。预算方法。计算高变基因。然后什么线粒体比例。20%。啊,就是开始加各种各样的关键性的参数,明白吧,就我们对这个代码要非常逻辑已经自己很熟悉了啊,只是帮他,他帮我们写一下而已,很多关键的性的参数啊,我们要用这个自然语言给到他。
06:04
给到他明白吧,然后呢。啊,多样的。多样本展示。并且分析。嗯,分子粒子之间的。他已经。然后给到他更多的一些参数之后啊,他写的就会稍微的智能化一点,但是呢,很多时候写出来还是不太符合我们的要求。不太符合我们的要求。你像这种的。啊,就涉及到代码逻辑的问题了,前面第一节课给大家讲过代码逻辑怎么样进行多样的整合,通常需要外置一个文件,就是sample.txt文件啊,有几个样本,写几个样本等等等等,不停不停的往里加参数。啊,不停的往里加参数,即使在这种情况下怎么样。
07:00
啊,AI写出来的代码啊,大家仍然是无法直接使用的。还需要根据代码自己调啊,各种调。嗯,所以说呢,AI现在的发展啊,仍然处于一个比较低的位置啊,比较低的位置啊,包括DB,包括豆包更多的用于什么。啊科普啊,就是大家能了解了解一些东西啊比较好,一旦涉涉及到一些比较新的东西,就要采用一些专家模式。啊,当然了。有的AI是可以部署到服务器上的啊,帮我们分析数据的那个AI当然更准确一点,但是需要费用。需要费用啊,这个费用挺贵的啊,所以说呢,现在虽然说AI呃,这个势头啊,很猛很火啊,但是呢,在各行各业目前还没有大规模铺开啊,一个很重要的原因就是它还处于低端的。比较低端啊,第二个呢,就是这个他只能做一些简单重复的工作。像我们的科研不属于简单重复的工作啊,我们的科研属于呃,需要深度思考的这些内容啊,所以说呢,呃,再加上我们的生性属于交叉学科,这个难度就更高了,目前AI还做不到如此。
08:09
复杂的一个内容啊,还需要大家自己多努力多学习啊,不过呢,确实是一个趋势。将来发展了很多年之后,是不是AI就可以做一些更多更复杂的工作?啊,应该是一定的啊,所以说大家要拥抱这种变化,在它发起之前啊,在它发生之呃之呃发生的时候,呃,接触接触它,看看它的一些优缺点,以及改进的方向。如果大家将来有志于在这个方向发展啊,作为一种事业。这是一个很好的方向啊。首先来看看什么是AI人工智能,这里面啊,大家可能更加关注它的智能的一方面。智能的一方面,那但是但是大家也不要忽略人工。人工在前啊,这个AI都是人开发的啊,它里面的包含的逻辑思想都是人赋予的。
09:03
包括我们问这些AI的问题啊,都是人赋予的,他怎么从网上抓取信息,最后汇总给我们,都是人给他定的一个逻辑。啊,背后给他盯好了,他这样一个抓取啊,嗯。AI呢?是一门研究如何使计算机系统具备类似人类智呃智能能力的综合性科学和工程。AI想具有人的一个这个思考能力啊,目前还很远,还很远,更多的是现在更多的是什么呢?就是整合能力。啊,比如说看了10篇文献,我们自己也能整整合,借助AI也能帮我们,呃整合一下啊,帮我们节省点时间,但是目前来讲这种比如说文献整合,呃,文献的一个整理。嗯,包括这个。一些深度的会议资料啊等等,AI帮我们整理的结果,往往和我们自己整理的结果侧重点不一样,因为底层逻辑啊,它无法读取到我们关注的重点。
10:01
比如说大家开了这个会啊,开了开了这几篇文件,大家关注的什么什么点啊,123AI是不知道的。AI总结的内容呢?嗯,会怎么呢,更加机械化一点,不够灵活。啊,这是目前AI发展的一些困境啊。大家如果有感兴趣的话,朝这个方向发展的话,AI需要现在需要解决的问题还挺多啊。啊,通过数据、算法、计算资源构建感知环境啊,理解信息、学习规律,进行推理,做出决策并执行任务的智能系统啊。啊,目前来讲这个还很远啊。或者说,我们能够接触到的AI离这个还很远,是不是有的AI已经能够实现如此复杂的一个功能呢?这个还不太,这个普通人啊,像我这样的普通人可能接触不到啊,可能那些顶级的科学家已经开发出来了,只不过在内部测试。反正我们接触到的AI还是属于那种比较低端的啊,比较低端的。大家看到下面的图文。
11:02
基本上它能够感知环境,理解信息,学习规律,进行推理,做出决策。基本上就是把我们人类。嗯。处理信息的各个部分啊。给到计算机啊,那计算机具备这种能力啊,计算机具备这种能力。这是对各个部分的一个拆分啊,大家可以看一看。A的核心目标不是简单的让机器运行程序,运行程序呢,这个很简单,大家写好代码都可以运行,但是呢,我们需要让这个机器具备这个。啊,最好用什么呢。判断对错的能力。大家都知道,我们在分析的时候有很多参数要调整,包括单细胞基础分析,大家有时候也要调整高变基因啦,线粒体比例啦等等等等,哪种参数比较合理呢?啊,现在还主要是靠人来识别啊,机器能不能识别呢?
12:01
比如说AI能不能帮我们识别这个参数20%更加合理呢?啊,目前来讲还不行,需要大家啊自己试啊,但是将来应该应该可以实现啊,像单细胞的话,呃,前面给大家也提啊,简单提到过,现在很多公司啊,借助aii交付单细胞的标准项目。啊,就把单细胞随便写的代码分析出来的结果就给到大家了,这个有没有道理呢?确实能加快工作效率。从这个数据质量上来看,其实没有任何问题啊,只要这个数据质量好,分析出来的结果合理即可。啊,大家看到这个数据质量好像是吧,有效细胞挺多的等等等等,这些只要有效啊,公司的任务就完成了,但是对于我们发文章来讲,目前还不能借助AI做过多的内容。啊,比如说大家写那个写文章的时候,单细胞部分写。啊,单细胞的基础分析由AI完成,大家觉得啊,他就敢这么写。
13:01
啊,不敢啊,现在还不敢。现在只要这么写,基本上就被锯掉了,说明AI还在发展过程中啊,不过呢,AI呢,确实是一个潮流啊,是一个方向啊,它的它各个方各个层面啊。其实把我们人类的信息的一个读取啊,给它拆分了,比如说感知。啊,从外界感知信息啊,视觉听觉触觉啊,当然AI呢,它没有视觉听觉触觉,它更多的是什么。啊,其实读取的都是背后的都是数据啊,都是数据啊,像我们现在的人脸识别啦,影像啦等等等等这种的都属于一种。啊,感知啊,AI在读取这个图片、图像等等方面是远高于人类的啊,这是一个简单的英语。啊,然后是理解啊,理解的话,目前人的理解力是远高于AI的啊,AI的话对这个。各方面提取信息的一个理解呢,目前还借助于大模型。
14:01
这个大模型呢,主要是提取特征值来进行理解,比如有个图片啊,图片当然有的地方是噪音,有的地方是有效信息,这个呢啊,我们人可能一下一下就能看出来,对吧,比如说那个拿到一个细胞的一个病理切片。啊,染色好的,一眼就能看出来这个细胞结构是啥,但是想要an来识别,目前还很有难度啊,就算是z cosmic这种细胞分割比较准的。啊,也有很多细胞,它识别的。是错的,就是它的边界识别不出来。啊,不过目前还在发展过程中。啊,语音理解啊,自然语言理解,自然语言呢,就是我们刚才给大家演示的。通过这种交互式的啊,我们给AI梳理到很多信息,AI给我们输出出来我们想要的一些内容,当然这个匹配度还存在问题啊,不是完全匹配。然后是蛋白质结构理解的话,这个是嗯,三维的这个就是那个结构生物学的一个内容啊,这个这个目前啊是AI运用的最那个的。
15:02
最前沿的一个方向,大家如果之前听过那什么阿尔法for three是吧,阿尔法FORD3啊,蛋白折叠,从头设计等等这些内容的话,应该会明白。对蛋白结构来讲,更多需要借助AI的力量啊。啊,文献知识提取呢,这个目前。可以让他们辅助提取。但如果大家关注的点。啊是集中在某一个方面。呃,AI目前大家还不能给,大家就是把你的内脑子里的思想给他。复制出来,并且理解你的思维,给你提供你想要的内容,目前还有难度啊,有难度。啊,然后是学习啊,数据发现规律等等等等。人主要是经验积累了对吧,大家看很多文献,经历了很多经验啊,等等等等,机器呢。其实就是训练。把我们的所有数据给到他,让他训练,训练的过程啊,就是既给他数据,又给他结果,让他不停的训练。
16:00
就是为什么这些数据能得到这样一个结果,怎么提取它的特征,怎么一一对应,这是内部机器的事儿。啊,比如说以这个阿尔法four的蛋白结构预测为例啊为例,它本身先就要进行什么大量的训练。嗯,先大大家做那个实验,嗯。蛋白结晶啦,什么冷冻电镜啊等等等等,把那些蛋白结构啊,序列和结构给它一一对应的信息给到这个模型,模型开始学习啊,这个氨基酸和那个氨基酸结合在一起容易形成什么结构啊等等等等等等,把这些信息都拿到之后啊。啊,然后他就可以预测新的序列啊,看看新的序列到底形成了一种怎样的三维结构,它就可以预测了,目前阿尔法FORD3是最好的模型啊。不过他。不过我们国内好像能部署的不多啊,很少啊,很少。啊,一方面它确实是国外的一些开发的啊,第二个呢,它需要很高的算力。一般都不行。啊,然后是推理,推理的话其实就是推测。
17:03
推测是什么?比如说啊病理诊断。以我们空间转录组为例,比如说发现了一个细胞结构,比如说三级淋巴结构。三级淋巴结构。一旦在这个癌旁。预示着什么?预后比较好?对吧,然后形成这样一种逻辑,然后呢,拿到这个结果之后呢,给到AIAI就知道了,好三级淋巴结构在癌旁啊,多远的距离,这个一定要量化啊,不是说癌旁,我们人类的癌旁大约的一个值,对于这个AI来讲必须准确,比如说5μm距离。啊,有三级淋巴结构,预示着这个什么预后比较好等等等等,他就给我们这样一个结果,明白吗?这是推理啊,最后做决策啊决策。角色的话,目前科研还不能帮我们做角色。啊,比如说我们有个数据,让AI帮我们设计课题,他设计不了啊,不能帮我们做决策啊,他更多的还是在图像识别,包括这个病理诊断,简单的应用上可以帮我们识别,比如说大家用的那个什么。
18:07
高德地图。对吧,高德地图,你比如说导航的。其实内部也有一些AI的一个模型。一导航他就给推荐几好几条,其中最坏的那条就给大家推荐出来,大家基本上导航致用这些不了,这就是对于我们做决策啊,影响到我们生活。最后是创造一些新的药物,新的东西等等等等,这是未来的方向了啊。目前AI有3种层次啊,3种层次目前我们用的最多的就是这个最最低的。啊,弱人工智能啊,专注于单一植物,没有真正的理解能力,依靠大量数据训练。啊,这是我们目前普通人能接触到的最多的。就是单一任务,就是交互式的,比如说做什么分析呀,让他们帮我们写不断代码呀等等等等。这种嗯,比较单一的任务,第二是没有理解能力,Deep这个有没有理解能力。
19:02
没有啊,没有,他就是把网上的一些东西给他抓起来,放到这个,呃,内部呢,逻辑整理一下就给我们输出出来了,至于他到底对不对。啊,DB这个其实目前还不管。比如说我们想问一下啊,比如说我们想问一下。单细胞线粒体过滤。含细胞线里的过滤。预支多少?多少合理?啊,肺癌药吗?备案。然后他大家看这个过程。他其实并没有进行思考,而是什么抓取网页啊,读了多少个网页,这个网页可能关于这个肺癌的有个相关线粒性设定的一些信息,然后把这些信息整理之后呢,就给我们输出出来了,至于他是不是加入自己理解呢?没有啊,没有加入自己的理解。
20:06
你看他读了之后发现每个样本好像都不一样啊,没有给他就给咱们设置出来了,没有正确的值啊,大于10%或10%啊,500%分之10等等等设置出来。等等等等,他其实就是把信息整理了一下,并没有什么过多的思考,而我们需要过多思考。就是说我们为什么选择10%。我们为什么选择20%啊?需要人类思考。第三个依靠大量的训练数据。啊,这个呢,是所有AI都逃不过逃不过去的啊,包括我们的基因组数是啊,单细胞空间分析,蛋白组的结构分析,结构机系等等等等,都需要大量的。呃,已有的内容进行训练啊,让它产生。嗯,对应关系,最后再预测新的样本等等啊。然后呢,给了大家几个例子啊,搜索引擎大家一搜为什么出来一些结果啊。
21:01
为什么啊,他用了一个训练好的模型给大家15分。其中这些。搜索引擎啊。啊,基本上来讲啊,基本上来讲比较好用的还是比如说国内的必应啊。等等等等啊。百度的话,他自己人。啊,老是接广告,不知道为什么,而且结果非常差。然后推荐系统啊,人脸识别啊等等等等啊。他没有思考能力,只是根据发现这个特征,哎,发现了1+1啊,就等于2,它只能这样简单的做,包括出的GPT,包括我们的al Ford啊。第二个呢,是通用人工智能。就是说具有我们人类的这个综合智能,说白了就是要和我们一样具备这个。嗯,具备这个思考能力啊,特点的话就是能跨领域学习。啊,现在我们很多的研究啊,都需要跨领域交叉学科哦。既要有计算机的一个能力,又要对计算机所写的代码赋予其生物学意义,比如说10%,为什么10%是因为啊生物的什么什么,研究之后发现10%才是活细胞的特征等等等等这样一种交叉的一个现象,才能完成我们整个的一个分析啊特点,第一个就是跨领域学习,第二个能自主理解新问题。
22:21
比如说过程产生了一些新问题啊,单细胞分析发现分群的数量好像有异常啊,呃,不需要我们人工,他自己就能进行内部矫正,发现这个参数可能有问题,可能需要调整。啊,等等等等,第三个就是能迁移知识。把我们的一部分内容迁移到另一部分,等等等等,学生跨学科学习啊。是这个第二代人工智能的核心目标。核心目标啊,目前没有实现啊,目前还比较远啊,比较远。啊,对于这个it的这个来讲,好像实现的更快一点,因为搞这帮人工智能的呀,都是那帮it的人。
23:00
嗯,他们的接触的更,他们只是接触这个机器语言。他们实现的更加的取代的可能,呃,速度会更快一点。啊,学习生物学,学习物理,编写程序,做实验设计,解决未知问题等等等等,这些目前还都。没有完全实现啊,还是处于一个比较低的一个阶段。啊,前面提到那个马斯克,不知道大家呃,看那些短视频有没有知道那个马斯克说将来AI可以自主什么。自主获取数据,自主设计实验,自主做实验,自主解决生物问题等等等等啊,这就是对AI未来的一个设想,设想希望他能帮我们解决,就像这个一样,合成生物学。首先要设计啊,现在都是人来设计啊,数组啦,DNA组装啦,通路设计啦,然后构建了载体啦等等等等,为最后呢测试了,比如说微流控啊,实验设计,测试它的稳定性啊等等等,最后学习把它的数据拿出来进行。啊,详细的分析。整个过程啊。
24:04
AI的参与度目前还不是太高。啊,当然未来肯定会越来越高啊,将来是不是完成能全链条的AI啊,这是AI啊,这是马赛克的一个设想。第三代就是超人工智能。啊,超人工智能,智能全面超过人类,这个大家觉得有可能吗?啊,当然我知道大家都比较搞,呃,喜欢搞那个科研啊,可能我游戏玩的少,像那个英雄联盟啊,可能有的同学在玩,前段时间马斯克呀,提出了AIVI是人类。就是同样5个人。啊,人类出世界冠军就是faker那一队啊,Tone那一队,然后那个这边是5个AI。这个5个AI学习了每个比如说角色啊,游戏角色的一个技能啊,包括团战啊,配合之间的一个内容,之后呢,和人类对战。
25:04
其中呢,就谈到这个问题。如果啊,完全不限制AI,就是AI的反应能力是远高于人类的,我们人类的,比如说呃,看了这个界面之后,应该做出什么样的反应,有一定的反应时间。AI是没有的,直接可以读取到内部数据的。啊,当然了。呃,就是世界冠军啊,Faker啊说了,嗯,AI不能这样读取内部数据来和我们人类进行对战,那样的话人类必输无疑。AI必须和我们人一样看着这个电脑界面啊,读取它的信息,然后做出反应,并且把它的反应时间压缩带和人类接近。这样,人类才有可能战胜AI。明白吧?举一个简单的例子来讲,AI的它的一个因为没有情绪,更多的依靠数据,它的一个运用能力啊,包括在很多方面其实超过超过人类。
26:00
啊,是大概率事件啊,大概率事件。这里以一个游戏为例啊,比如说超强的推理能力。遇到了敌人,怎么处理的存活率最高?概率最大的能杀灭敌人。嗯,AI这个地方面是要强过人民的,第二个是自主创新能力啊,就是学习了自己的技能之后。呃,怎么样的搭配,怎么样遇到什么样的场景,采用什么样的技能组合等等等等,呃,他要有自主意识。这个目前在游戏层面已经有一定程度的实现了,然后是高级战略规划,这个呢,从游戏界面来讲,比如说怎么样的运营啊,才能把对面压缩对面的生存空间等等等等,从游戏层面来讲,AI已经部分实现了啊。嗯,不过对于大部范围来讲还远没有啊,这是对AIAI的一个设想,AI的一个设想。中间这个呢,就是AI的一个主流的一个内容,从科研角度来讲,AI总是这样的。
27:01
阅读了文献啊,生成了假设,规划,实验等等等等,他自己来完成整个的一个流程。这是对AI未来的一个设想啊,AI未来的一个设想。距离还非常的远啊,非常的远。然后AI的主要技术流程就是这样的。小问题获取数据啊,数据处理特征啊特征啊,提取特征。然后进行训练模型啊,模型设计,训练模型啊验证等等,部署优化等等等等,这是它整个的一个技术流程。目前大家有没有知,有没有就是感觉到什么课题组啊,哪个课题组什么部署了AI的。有没有比如说前段时间很火的小龙虾?Open cloud有没有部署的?啊,应该就是听了一阵风之后就没有了,为什么?因为他需要需要接入很多的AI程序,但是那个都需要付费啊,费用还挺高。
28:00
不见得以后多少人愿意部署啊。首先第一个问题,定义AI需要解决什么样的问题啊,这个是通常是我们人来定义的,我们以一个空间转录组为例,比如说拿到这个7天之后就需要告诉我。嗯,这个这个病人的样本。日后如何?啊,日后如何?需要我们第一个是我们的目标需要输入我们的数据,比如说基因表达值,空间基因表达值。第二个是基因突变的一个情况,这是基因组的数据,第三个是临床信息,比如说它是病例第一第一个阶段。等等等等,然后他直接读取了数据之后帮我们。输出什么?预后如何?对吧。其实其中这里面啊,我们的输入的数据越多。嗯,出来的结果越准确。这是督主席未来的方向,就是大家将来找科研,可能也是朝着督主席的方向在发展。很难通过单一组先来发现所有的问题了。比如说转录组能发现。
29:02
转动组,比如说配数据表达一定发挥作用吗?不,不一定啊,不一定啊。转露素有表达和蛋白层面的表达,本来就是两回事儿啊。本来就是两回事儿,因为转录组水平和蛋白水平的相关性啊,比较低,不到0.3啊。然后是基因突变信息啊,这是基因的层面的一些内容,对他的解释来讲呢,也会影响预后啊,有的比如说有靶向药,有的没有。啊,给到我们这样一个信息,第三个是临床信息啊,比如说病理个人的情绪如何呀,病理是不是健康啊等等等等。这样的话,通过综合考虑输出风险啊,这是我们提出的问题,就是通过各种各样的数据。测序数据告诉我们这个病人的一个生存风险有多高。然后把这些数据给到AIAI把这些数据呢进行处理。
30:02
这里面有一个核心就在于。AR数据决定智能。上线,所以说将来啊,当然马斯克提出了,说是可能是。AI的将来的竞争包括什么?能源啊,电啊,就是电啊,有电才能有AI,第二个呢,就是数据。现在的数据壁垒啊,非常高啊,大家想包括国内的壁垒也很高,大家那个数据啊,想要申请啊。嗯,基本上都不给过啊,尤其是国内的数据库,传到国内的这个官网啊,数据库里啊,基本上都不给过,包括单细胞,包括空间。啊,像那个国外的数据库啊,现在壁垒也很高了。大家前段时间也给我提了这个。听说过,那个时候就是英国的一个病用飞机啊。50万份还是60万份的,本来是公开数据供大家科研的。结果阿里的员工挂在闲鱼上卖啊,让国外知道了。然后就这样。
31:00
啊,国外的数据都对国人有壁垒了啊,不让不让随意分享给国人。当然了,这个问题。啊,也很难讲啊,很难讲是谁的问题。说白了,我们想要获得更好的AI结果,就需要更多的数据啊,更多的数据。包括我们的嗯,多度肺数记。嗯,就有这结肠啦,雌激素啦,临床信息啦等等等等各种各样的事情啊,各种各样的一些,包括出现射及文本经na系列等等等等,像我们单细胞的话,基本上都是提实。空间转录组呢,有矩针加空间位置加病理图像,像蛋白的一个结构呢,就是氨基酸序列和三维信息。这样的话一一对应起来才可以,比如说空间软弱组,拿到他的空间矩阵,拿光到他的,拿到他的对应切片,并且拿到他的预后信息。啊,比如说这种结果搭配的是越货好,这种结果搭配的是越货大,这样的一个完整的链条的一个数据啊,才能决定AI到底能训练到什么程度。
32:00
越多越好啊。第三个是处理啊,数据不能直接用啊,要进行清理啊,像单细胞也一样的,我们要指控啊,空间也要指控啊,蛋白也要指控等等等等,各种各样的都是一样的。嗯,去除掉异常值之后呢。真正的数据才开始进行。训练啊,包括我们的标注啊。单细胞需要标注细胞类型啊。细胞的定义啊,在是AI的一个主要方向啊,就是单细胞的细胞注释啊,前提是要训练,就是大家有大量的数据,已经标注好细胞类型的一个矩阵,让它训练啊,训练完之后呢,才能预测新的数据啊,这里举了一个例子,比如说影像啊,影像组学。图片啊,图片啊。先人工标注啊,标注上几千啊上万份图片。这是肿瘤,这是正常,等等等等把它标注好,然后给到AIAI进行大量的训练之后呢,给他一个片子,他就告诉我们这是这是肿瘤组织,这是正常组织,像单细胞也是一样的。
33:05
表达矩阵啊,就是训练的时候表达矩阵加细胞标签,大量的训练完之后呢,给他一个新的矩阵,它告诉我们啊,这个细胞是T细胞,这个细胞是B细胞等等等等,才能给出一个相对合理的结果。这个是数据处理,接下来特征提取啊,前面讲到一个一个方法叫NM。F, 对吧。恢复矩阵分解,那是最原始的。特征提取的一个方法,也是最简单的最low的啊,真正的特征提取啊,需要大量的一个深度的学习算法啊,比如说图片。图片其实内部呢,就是一些像素信息,也是数字啊,我们对它进行提取的时候,要提出像素特征啊,像素的特征包括边缘模拟形状,像我们生物信息提取呢。啊,马可基因啦,通路分数啦等等等等,这些都是我们提前训练好的一些特征值给到他,让我们把它把它提取出来,用于新的一个数据的验证。右边这张图大家可以看。
34:11
当我们给到一个图片啊,它会转化成什么?转化成内部的一个数据信息,数据信息之后呢,就会特提提取特定的一个什么。啊,提取特定的一些特征啊,提取完之后呢,进行深度学习啊训练等等等等,涉及到非常多的一个算法,其中这个。解码器。大家应该听过,解码器其实就是把复杂的信息按照这个把它一层一层剥开进行解码。特征拿到之后呢,就开始机器选择了啊,机器选择呢,其实大家很多这个机器模型啊,应该听过,不知道大家有没有深入研究过,像老早之前呢一些。啊,传统的机器学习啊,包括水泥森林啦。嗯,线性回归啦等等,这都是比较简单的传统的数据。
35:01
设模型的一个设计,现在我们真正的模型设计需要什么?图片设计呢,就是人工神经网络啊,这个稍微复杂一点,从图片或者加上这个基因表达信息来提取这个核心的一个特征。其中这个transformer。如果大家将来要对AI进行一个深入的了解的话,Transformer是必大家必须要学习的一个重点。穿刺包吗?我们的浏览器,包括这个deep AI deep, 包括豆瓣啊,全都用的这个transform。还要加上这个大语言模型。啊,基本上都用的这两种。啊,文本序列等等等等,目前都用的是这个。当然它本身也在不断的更迭进化啊,进化拿到这个模型的时候啊。就开始对他进行训练,就开始训练。
36:01
不停的调整参数,给到一个目标结果等等,因为前后面的数据啊,已经把它输入矩阵和结果呢给到他了,让他不停的训练迭代,一直到他收敛。收敛之后呢,然后预测结果就会越来越准确,最后呢,明星和模型,可模型评价就是用一些指标对一些新的数据进行评估啊,当然这里面列了几个指标。最后呢,把它部署到我们的。服务器上,无论是医院还是科研等等等等。就可以用它了啊,像单细胞呢,举了个例子啊,AI模型预设细胞类型目前来讲也有,也已经有文献在这么用了。这么用了。但是呢,嗯,错误率还是蛮高的,现在。想要这种泛细胞类型,比如说给个样本就能注射出来,这种的还很远啊,还做不到。需要限制很小的范围,比如说训练了大量的肺癌数据。给一个肺癌,要我们预测一下,这个还可以啊。呃,组织细胞亚型的话,目前AI预测还不准啊,还不准。
37:06
像医院CT啊,图像等等等等,这都是部署后直接给我们结果的。最后呢,优化,不停的优化,不停的优化。不停的优化之后呢,就会迭代AI升级,慢慢从最低端慢慢往上升级啊升级。这个呢,就是现代AI的最核心架构。文本数据,数据信息token化,Token化就是特征化啊,然后transformer。模型。基本上现在都用的这个模型,训练、监督、反馈、部署,一直在这个不停的循环迭代,提高准确度等等等等,这个其实就是底层AI的一个核心逻辑,核心逻辑。AI与传统程序的本质区别就是传统的基本上都是人写啊,我们人来确定逻辑,人来确定输出结果的一个格式等等等等,AI呢,需要机器帮我们实现,节省我们人的一个。
38:01
功能啊,目前来讲还无法替代啊,比如说脚本逻辑,目前AI还不能帮我们设计啊,这是对未来AI的一个要求,希望它能帮我们实现这些功能啊,实现这些功能。这里面举了一个例子。比如说年龄大于60岁啊,判断为高风险,我们人只能做简单的判断,因为一旦复杂啊,需要科研啊,就需要时间。比如说我们看一个问题,可能研究一个礼拜,当我们把模型输入,呃,模型训练好了之后啊,比如说AI模型把它的基本信息输入之后呢,他能立马给我们结果。啊,这就是AI的一个优势啊,优势。哎,这是典型的一个流程啊,等等等等。好了,我们休息5分钟吧,休息5分钟,我们来看看在各个主题中AI的一个应用,好吧,休息5分钟。
41:25
其实本质上啊,这个AI更多的是什么啊。数据训练结果预测啊。这是一个最。就是说比较我们现在常用AI的一个过程,AI是不是像人类一样具有这个思考能力,就像这个第二阶段通用人工智能加这个第三阶段超人工智能这样一个阶段呢。啊,目前来讲还存在更多的研发阶段,研发阶段我们目前还没有接触到,像我们普通人如果能接触到第二阶段,第三阶段说明什么?说明公司内部已经很成熟了,才能把它应商业化,应用化。
42:01
然后每个组群呢,都有一个他们,呃,庞大的一个生物信息分析的一个内容啊,啊,像我们人想要把它每个组学都学会啊,需要很多时间,需要很多时间啊,但是呢,AI在运用的时候,可能比我们人要更快一点,更快一点,但是呢,这里面也要注意啊。可以用AI。用AI的前提是你自己也会啊,自己也会。明白吧,比如说基因组自己已经非常了解分析了,可以用AI辅助帮我们做一下,就是说AI更多的是一种什么?呃,锦上添花的作用,不能把它当成根本明白吧?咱得自己要会才能借助一下AI。比如说基因组我们已经会了,基因组该分析哪些内容等等的,自己要会,会了之后呢也会解读,这个时候呢,可以用AI扫我们,帮我们借鉴一下,而且AI给的结果现在还需要人工验证,不可以直接用,明白吧,不可以直接用。
43:06
首先我们来看基因组DNA序列识别变异啊,变异解读关联风险啊等等等等,这都是AI现在。呃,输入的数据方面。比如说呢,突变对应的是。哦。哪些结构变异?这个结构变异呢?可能和哪些疾病相关?然后呢,用一些现有的临床信息进行风险预测等等等等。AI帮我们直接判断出它整个的一个过程。啊,第一个呢,就是在基因组数据,主要是机器学习和深度算法。用大规模DNA数据中识别规律、预测功能,并辅助疾病研究。这个还是处于识别数据的一个阶段,提取特征的一个阶段。需要很多的数据啊,很多的数据,很多的数据啊,基因变异方面需要帮我们什么。判断这个变异是不是。
44:03
准确的存在。啊,通过一些训练啊,帮我们判断在变异这个功能解释方面。啊,其实主要就是抓取数据库的内容,帮我们进行变异解读。像那个病理公司啊,就是那个特检公司啊,现在都还是人来解。啊,帮我们先生成一个报告人来进行判断结果是不是准确啊,已经部分借助AI了,但是还需要人来判断结果是不是准确啊。疾病基因组等等啊,发癌和预算风险预测啊,这个目前是AI在扩展的一个方向。就是结果AI来看,通过一个基因组的一个人的这个基因组信息了,来判断他可能得那些疾病等等等等,怎么样预测风险啊这样一个内容。这个是流程,大家可以看一下。还是那句话,大家自己要会分析,在会分析的基础上记住一点AI,明白吧,千万不要自己还不会呢,就直接AI了,那个没有用啊。
45:04
然后是单细胞。目前来讲啊,单细胞这种低端的啊,就是那个传统的AI传统的啊。模型呢,运用的已经比较多了,新版的AI就是我们现在的人工智能版,更多的集中在这个地方,一个是细胞类型的注释。就是在现有数据,比如说表达矩阵,在细胞标签的呃注视的基础上进行各种各样的训练,包括机器学习啊,深度学习啊,分类模型啊等等等等,训练完之后呢,就可以帮我们预测新的数据的细胞类型了。啊,这个是目前一个核心的方向。核心的方向啊。嗯,不过目前准确度还是不太够啊,不太够,已经有文章记录AI进行数据注释了,不过还很少啊,还需要大家自己用marker,用各种各样的特征字来进行训练,第2个就是疾病预测状态啊。
46:01
单细胞基因表达值和临床信息,比如说单细胞这个样本的基因信息。配合他的一个临床信息进行训练,然后来预测什么。癌症的预后啦,分型啦等等一些作用,这个目前啊还在数据搭建过程中,那这数据搭建过程中并没有足够的数据来训练模型。看到没啊,首先是呢,输入数据。输入我们的单细胞数据,最后呢?训练啊,各种各样的训练啊,包括我们的各种值等等等等,最后总出我们的想要的结果。等等等等,这个是目前单细胞主流的一个运用方向啊。空间主角呢?空间主角第一个就是图片识别。我们的病例前面很多。怎么样采用病理芯片能帮助我们什么?啊,预预判断预后啊,识别结构啊等等等等,这都是AI想要。
47:03
期待AI能帮助我们人类解决的问题。大家看到没,基本上都是transform模型啊。这个模型啊,在我们在普通的AI应用中啊,也是非常常见的。啊,这是空间组学啊,空间组学。然后是蛋白主角,蛋白主角是目前AI运用的最多的一个方面啊,最多的一个方面,结构预测,功能预测啊,修饰预测,折叠稳定性,突变影响等等等等,这都需要借助AI来帮我们实现一下,所以说现在AI组学在蛋白组学的这个应用层面啊,非常多啊非常多,不过大家也看到基本上也是这个。Transformer啦,机器学习啦,深度学习啦等等等等,像一些。模型啊,目前的模型啊啊。大家如果搜一下AI模型,主流的就那几个?
48:01
但是呢,AI模型有自主学习能力,就是给到他的数据,它可以自动调整。提取特征和结果的一些必然的关联,然后呢,帮我们预测新的数据。最后一个就是多组学了,我们目前啊。之前经常给大家说,多助学是未来的方向。督促学生未来的方向。啊,那么多主学呢,首先是基因组转入组,蛋白组,表观组啊,代谢组等等各种各样的主学,每一个主学呢,都能发现一些生物学问题,但都又都不全面。不是很全面对吧,转录组只能发现表,不表达,但是蛋白水平层面的东西,它无法提供,基因组的东西呢,比如说突变呢,转录组也无法提供等等等等。啊,只有在多组学的一个前提下,对多种组学进行联合分析,进行数据训练,就像这样的。
49:00
所有的数据啊,多个组学的数据同时进行深度学习啊,AI的数据处理啦,特征提取啦,模型训练啦啊,模型验证啦,模型的这个发展啦等等等不同的迭代,最后才能拿到一个非常准确的结果,这也是为什么刚开始提供这个AI。进行数据输入的时候,给大家提出了既要输入这个基因组信息,又要输入这个转录组信息,还要输入什么?预后的信息。现在多主群是未来的方向,不过目前来讲啊。啊,能做得起多组学的还是比较少啊,比较少还是需要很多的一个新的课题,包括这个什么。主学的价格的下降。嗯,但是这个东西也有好有坏,一旦这个主角价格下降,多主角成为未来的方向,对人的要求。越来越高了啊,就需要你既会基因组,又会转动组,又会蛋白组等等等等啊,对人的要求就会越来越高了。这个呢,就是open cloud的一个部署,我之前部署,但是部署完之后啊。
50:03
啊,部署完之后呢,它需要各个AI模型接口啊,这个都是需要付费的。啊,这个就麻烦了,这个都是要付费的。部署很简单,把这些代码装上之后,就可以装到open cloud open cloud之后呢,装上之后呢,就需要接入这个AI模型,比如open I, 比如cloud,比如trade GPT, 比如deepsick等等等等,就需要接入这个模型,而这个模型的所呃密约呀。大家都需要花钱来买。啊,都需要花钱来买。啊,比如说D的这个模型啊。可以把它装到这个本地软件。但是想要记住AI的这个训练能力啊,必须什么?
51:02
必须花钱啊,因为内部大量的数据训练结果啊,不可能免费给大家用啊,直接装就可以了,都可以装啊。像那个这个一般公司层面会装一下,把这个DBC给我部署一下。都可以种啊,难就难在这个,比如说龙虾要依据AI来进行数据分析啊,怎么样的这个密约啊,需要花钱,尤其是cloud。啊,花费还挺高的啊,有客户用了花费还挺高,然后一旦大家部署好之后啊。并且把这个模型。各个各个主要模型给他啊划分。哎,买下之后啊,就可以交互模式进行分析数据了,比如说这下面给大家一个例子。大家把这个数据传到服务器,然后帮我分析这个单细胞的结果。他就会告诉你他请上传表达矩阵,你会告诉他路径在哪等等等等,这样这种交互模式就可以帮我们数分析数据了,但是还是那句话,这种分析数据啊,仍然类似于什么。这是我们自然语言相互交互啊,我说一句你给我一个结果,我说一句你给我个结果,需要大家对分析啊有一个比较深入的理解,理解其中的参数,理解其中的一个分析逻辑,包括在代码的一个逻辑设计上,还需要大家员工来做。
52:15
全部来做明白吧。尤其是借助服务器来分析的时候,比如说这个。比如说这个我们就需要在这个基础上添加各种各样详细的参数,这个参数要详细到什么程度呢?比如说我们做多样本整合,有三个样本啊,第一个样本。名称,比如说3跑1。嗯,数据路径在。哎,哪哪哪儿,第二个在哪,第三个在哪等等等等这样非常详细的信息给它输入进来,才能AI才能准确的识别并分析我们的数据啊,其实啊,这种语言交互啊,很多时候也不见得能省多少事儿啊。
53:04
3是多是。最后呢,给大家介绍一篇文献,关于AI的一个应用,它确实AI确实是未来的一一个方向啊,未来的一个方向啊,很多时候呢,我们人工可能很难搞定的事儿,需要接触一下,比如说以这篇文章为例。空间主学对AI的一个运用,首先呢,大家看这个整个的一个分析逻辑。啊,组织识别he图片啊,数据的一个整合,数据整合包括什么。组织分割啊,组织分割细胞检测,细胞分裂和细胞逆齿逆史分析,然后呢研究队列,最后呢啊利用队列来进行呃,模型预测,大家看到这个结果没?其中它的细胞,它组建了一个完整的AI流程,当然限于他这个研究是可以的,在非小细胞肺癌上啊,研究是可以的啊,包括他提供了一些代码,大家如果是相关样本可以试一下。然后呢,细胞分啊,组织分割,细胞分割,组织检测细胞分割等等等等,这都是借助AI来划定。
54:06
借助AI来划定的。啊,包括基因的检测表达值逆史,每个基因表达等等等等逆齿的分析啊,它都是借助AI的,你看这个。啊,细胞分类就是注释依据马可进行注释逆式的检测啊,对细胞,对组织内部的细胞逆齿进行识别划分等等等等,最后呢,对历史进行划分好,并且什么进行数据分析,这都他呃借助了一个AI based的啊自动分析流程。当然他经过了大量的训练啊,大量的训练。大家看看它本身就具有多少,他们的研究包括了什么?1000多个病人的样本。包括各种各样的病例阶段来发展一个什么,发育了一个可扩展的AI模型。训练了1000多份样本才能拿到一个相对准确的结果啊,这个训练的过程是非常的耗时间,并且庞大。而且这个数据是必须要什么。
55:03
嗯,准确和。啊,齐全的。这个齐全指的是各种各样的病例信息,包括什么?之前的啊,训练的数据的一些分割结果,首先你的训练数据细胞分割要准。病理注射要准,细胞注射要准,细胞逆势分析要准,等等等等各方面都准之后才能给到AIAI之后呢,进行大量的训练,训练完之后呢才能预测哦。新的样本啊,相当预测新的样本。啊,目前来讲这个你像这种AI,它已经用的AI已经非常的多了。啊,基本上构建了一个全套的AI分析流程啊。就这也只能发到NC啊,NC说明对AI的引用啊,还是比较谨慎的,希望他更多的借助更多的数据。这个数据最好能达到百万级别。然后呢,预测出来的结果才能相对比较可靠啊。相对比较可靠。
56:02
然后呢,这个就是预测的结果了啊,把我们前面的数据都数据了啊,输入之后呢,就开始预测啊,风险因子啊,这个样本风险高与低,那个样本风险高一低,借助的更多的是多组学的力量,不仅是基因表达,也有细胞结构,逆齿,包括病理等等等等各方面信息都综合之后得到一个。啊,风险风险分数啊预后。大家看到没?基于AI分析细胞历史,识别临床相关的风险。啊,Sublo就是细胞结构在阶段1。备案啊,而不是全阶段啊,比较精细化的一种分析内容。看到没?这个就是AI的一个。在临床上的一个应用的啊,目前应用范围还比较小,较小,希望大家借助更多的一个力量进行扩展这个分析啊。这篇文章呢,大家回去有感兴趣可以回去看看,他给了一个AI模型包,包括把代码也都传上去了,大家如果想借助这个模型进行扩展是可以的啊,是可以的,不过需要大家有大量的数据来训练模型啊,训练模型。
57:16
其中呢,大家如果对AI感兴趣,这个要知道,Transformer模型要知道。川世风模型要知道,大语言模型要知道啊,大语言模型。比如说啊。嗯。更多的现在用AI,更多的科普啊科普。大语言模型呢,这个是大家啊,如果对AI感兴趣是呃,分析的一个重点,看到没融入数据等等等等。代码自动生成的规律啊,其实它更多的是什么。那什么叫大语言模型呢?就是收集了很多信息之后啊,发现这个出现频率比较高。啊,它可能比较,嗯,比较的重要啊,就把它纳入到一个核心的一个分析中。
58:06
啊,从插入的点动度等等,上下维治理,风险评控,动态建议等等等等,这是大家所需要掌握的,还有这个就是transformer模型。啊,将来大家感兴趣可以用。你看,它不仅是传的GBT这类通用大语言模型的基础,在生活型领域,它也从模型构建演变成整个领域的分析框架等等等等。雨衣啊,现在基本上都是transformer加这个。大语言模型LM构建起了整个的AI啊,整个的AI。啊,目前来讲,AI还处于发展的过程中啊,我们期待它能给到更多的一个内容啊,给到更多的一个内容。啊,也许明年的今天,AI就有了更多更新的发展了,对吧,能够我们普通人来用。
59:02
啊,包括我们学员啊,将来是不是有人会致力于AI的开发啊,也是非常值得期待的啊,值得期待的。好了,这就是我们最后一节课的内容了。
我来说两句