首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏大模型成长之路

    模型学习 | DeepSeek-V3原理】

    DeepSeek-V3 Technical Report DeepSeek-V3 的基本框架还是 Transformer。 另外,V3 模型是通过将预测多token作为训练目标。本文主要是对DeepSeek-V3模型框架以及训练目标进行讨论。 什么是负载平衡? 2️⃣ DeepSeekMoE 在Transformer架构中的FFN层,V3模型采用了MoE进行替换,使用更细粒度的专家,并将一些专家隔离为共享专家。 ✅ Yes ✅ 无偏置 目前的模型权重已开源: https://huggingface.co/deepseek-ai/DeepSeek-V3-Base 者由于设备限制无法对 V3模型进行体验。

    1.7K21编辑于 2025-07-25
  • 来自专栏韩曙亮的移动开发专栏

    【AI 模型】Meta Llama 3 模型 ( Llama 3 模型简介 | Ollama 软件下载安装 | Llama3 模型下载 | Llama 3 模型 在线 离线 使用 )

    首先 , 安装 Ollama 软件 , 到 https://ollama.com/ 下载安装 ; 然后 , 运行 ollama run llama3 命令 , 即可开始使用 Llama3 模型 ; 一 、Meta Llama 3 模型安装 1、Llama 3 模型简介 Llama 3 模型 是 Meta 公司 发布的 模型 , Meta 公司 就是 Facebook ; Llama 3 模型 Llama3 模型 ; 下载的模型放在了 C:\Users\用户名.ollama 目录中 , 在我的电脑上的路径是 C:\Users\octop.ollama ; 这个模型很大 , 有 4.7 G 安装完成后的效果 for help) 二、Meta Llama 3 模型使用 1、Llama 3 模型在线使用 在命令行中 , 可以直接进行对话 , 下面是对话内容 : D:\Llama>ollama run llama3 for help) 2、Llama 3 模型离线使用 Llama 3 模型 联网时 , 可以访问云端服务 , 可以生成更加丰富的文本 ; Llama 3 模型 在 断网后也可以使用 , 下面是断开网络后

    2K12编辑于 2024-08-09
  • 来自专栏人工智能领域

    AI模型学习

    AI模型学习 在当前技术环境下,AI模型学习不仅要求研究者具备深厚的数学基础和编程能力,还需要对特定领域的业务场景有深入的了解。 方向一:AI模型学习的理论基础 AI 模型学习的理论基础涉及深度学习、神经网络、优化算法等多个方面。 以下是一些关于 AI 模型学习理论基础的重要内容: 深度学习:深度学习是 AI 模型学习的核心理论基础,它通过构建多层神经网络来实现对复杂数据模式的学习和表征。 ———————————————— 方向二:AI模型的训练与优化 AI 模型学习的理论基础涉及深度学习、神经网络、优化算法等多个方面。 以下是一些关于 AI 模型学习理论基础的重要内容: 深度学习:深度学习是 AI 模型学习的核心理论基础,它通过构建多层神经网络来实现对复杂数据模式的学习和表征。

    80210编辑于 2024-12-18
  • 来自专栏司钰秘籍

    AI模型学习

    通过不断优化模型结构和算法,AI模型学习能够不断提升模型的准确性和效率,为人类生活和工作带来更多便利。 AI模型学习的理论基础 数学基础: 线性代数:AI 模型中大量使用向量和矩阵运算,如矩阵乘法、向量点积等,用于表示和操作数据。 参数调优:通过网格搜索、随机搜索或基于启发式的方法来调整模型的超参数,如学习率、正则化参数等。 3. AI模型在特定领域的应用 在自然语言处理领域,AI 模型如 GPT-3 被广泛应用于文本生成、机器翻译、问答系统等。 此外,模型的性能也受到计算资源、数据质量和算法优化等因素的影响 AI模型学习的伦理与社会影响 AI 模型学习确实带来了一些伦理和社会问题,我们需要认真对待: 1.

    79510编辑于 2024-04-04
  • 来自专栏架构师成长之路

    模型llm:Ollama部署llama3学习入门llm

    调整后的版本使用监督微调 (SFT) 和带有人类反馈的强化学习 (RLHF),以符合人类对有用性和安全性的偏好。 Llama3模型则达到400B,仍在训练中,目标是实现多模态、多语言的功能,预计效果将与GPT 4/GPT 4V相当。 您将会看到 Ollama 的 Web 界面,通过它您可以开始构建、训练和部署深度学习模型。 三、llama3 模型下载安装 1、llama3 下载 默认下载的是llama3:8b。 这里冒号前面代表模型名称,冒号后面代表tag,可以从这里查看llama3的所有tag ollama pull llama3:70b 2、运行llama3模型 ollama run llama3 上述命令将自动拉取模型

    7.4K00编辑于 2024-05-24
  • 来自专栏开源项目搭建

    简单3步部署本地国产模型DeepSeek模型

    简单3步部署本地国产模型DeepSeek模型DeepSeek是最近非常火的开源模型,国产模型 DeepSeek 凭借其优异的性能和对硬件资源的友好性,受到了众多开发者的关注。 本文将介绍如何通过简单 3 步在本地部署 DeepSeek 模型,让你能够轻松体验这一强大的 AI 工具。 deepseek-r1的哪个版本的模型? 它支持各种LLM,包括Llama 3、Mistral和Gemma。提供了类似OpenAI的API接口和聊天界面,可以非常方便地部署最新版本的GPT模型并通过接口使用。 理论上就安装完成了,可以只在命令行中使用模型了。修改路径文件保存路径可以不用改,如果C盘空间不够用,建议修改。

    7K33编辑于 2025-02-06
  • 来自专栏大模型成长之路

    模型学习 | LLaMA Serious】

    一、LLaMA V1这篇文章主要是引出模型的表现力并不是在模型的大小,而是训练数据的样本。之前的做法是尽可能的减少模型大小,但是这些方法忽略了推理代价。 在 PaLM、LLaMA、DeepSeek 等模型上被广泛使用,带来精度提升。 其中, W,V 是可学习的权重矩阵b,c 是偏置项3️⃣ 位置编码采用了旋转位置编码:RoPE(Rotary Positional Embedding)RoPE 是一种通过“旋转”的方式,将相对位置信息引入注意力机制中的位置编码方法 图片4️⃣ Causal multi-head attention LLaMA是 only-decoder结构的模型,属于自回归语言模型(类似GPT)。 0, 0, -inf, -inf], [0, 0, 0, 0, -inf], [0, 0, 0, 0, 0]]二、LLaMA V2部分的预训练设置都与

    58430编辑于 2025-07-25
  • 来自专栏大模型成长之路

    模型学习 | BLIP原理】

    一、预训练方法 1.1 图像文本模型 图像特征提取模型:VIT 文本特征提取模型:Unimodal encoder; Image-grounded text encoder; Image-grounded 这是因为生成任务要求模型按序预测每一个词,不能访问未来的信息。Causal attention 能保证自回归生成的正确性,使模型适合用作 decoder,实现图像到文本的自然语言生成。 对齐图像与文本的全局语义空间 让正样本图文对更接近,负样本更远 Image-Text Matching Loss Image-grounded text encoder 学习图文细粒度语义对齐 text decoder 图像到文本的语言生成能力 使用自回归预测生成 caption,优化交叉熵 Image-Text Contrastive Loss (ITC): InfoNCE(对比学习 最后组成一个新的数据集预训练模型

    1.2K10编辑于 2025-07-01
  • 来自专栏大模型成长之路

    模型学习 | RAG & ReAct】

    这种方式有效弥补了模型记忆局限、提升了知识覆盖广度与事实准确性。 query_vec = model.encode([query])D, I = index.search(query_vec, k=3)retrieved_docs = [文档[i] for i in 它允许模型在推理过程中“边思考(Reason),边行动(Act)”,即模型可以根据问题内容主动决定是否调用某个工具、调用哪个工具,并基于工具返回的结果进一步推理和生成回答。 与其他 Agent 类方法类似,ReAct 也需要通过 Few-shot 样例 进行提示设计,帮助模型学习在何种情况下调用工具,以及如何将工具的反馈信息融入最终答案中。 但是在严格意义上它还只是”单轮任务代理”,目前还缺乏:1️⃣多轮状态记忆 2️⃣长期目标规划 3️⃣动态工具注册、调用多个 API 的能力 4️⃣消息结构的显式控制

    1.8K30编辑于 2025-07-17
  • 来自专栏学习

    【机器学习】---语言模型

    这些模型,犹如现代科技的语言魔法师,通过海量数据和尖端的深度学习技术训练而成,在自然语言的理解与生成上展现了无与伦比的能力。 第一部分:什么是语言模型? 1. 走近语言模型 语言模型并非传统意义上的“语言学家”,而是通过深度学习技术训练的大规模神经网络,其核心目标是理解、生成并操控自然语言。 这些模型的强大之处在于,它们能够从海量的训练数据中学习语言的结构和语义关系,从而以极高的准确度生成自然语言文本。 它们的核心技术依赖于一种名为Transformer的模型架构。 模型训练的核心要素 要构建一个语言模型,仅依赖强大的算法是不够的。以下是训练过程中不可或缺的三个关键要素: 海量语料库 模型需要从海量数据中学习语言的多样性和复杂性。 问答系统:打造智能助手 通过微调(Fine-Tuning),语言模型可以搭建出高效的问答系统,广泛应用于智能客服和信息检索。 3.

    75910编辑于 2025-01-13
  • 模型和机器学习

    学习模型之前,要不要先学机器学习?” 这些问题的本质,是对两个概念的边界认知模糊。事实上,模型是机器学习的一个子集,是机器学习技术在“参数、大数据、算力”时代的进化形态。 2018年,OpenAI推出GPT-1,2020年推出GPT-3,参数规模达到1750亿,模型技术正式进入爆发期。 核心特征:参数、大数据、算力,具备通用智能和涌现能力。 比如,GPT-3的训练使用了1024张NVIDIA V100 GPU,训练时间超过3个月,训练成本超过4600万美元;国内的模型训练通常使用昇腾910 GPU集群,单卡算力达到200 PFLOPS。 用1024张NVIDIA H100训练GPT-4模型,处理1万亿字的文本数据,需要3个月,成本约1亿美元。 ,小红有3个苹果,小明给小红2个苹果,两人各有多少个苹果" print("任务3:逻辑推理") print(call_gpt35(prompt3)) print("-" * 50) # 任务4:文本生成

    52910编辑于 2026-04-14
  • 来自专栏大模型成长之路

    模型学习 | 词向量】

    How achieveword2vec通过神经网络模型训练新的词向量表达模型中参数的定义:one-hot:1, 7 表示一共有七个单词;Embedding:表示输入层到隐藏层的权重矩阵,是从one-hot 向量到Embedding向量的关键,7, 3表示训练完成的每一个embedding向量维度为3;WeightLogits:表示隐藏层到输出层的权重矩阵,是模型损失计算的关键;Logits:表示最后每个单词输出的概率 ,与目标标签做损失进行模型训练;Lookup table语料库十分巨大,每个单词都采用one-hot输入训练会大大增加存储和计算开销,因此,在输入的过程,仅仅输入单词的索引值,例如在上述例子中,直接采用索引 CodingWord2Vec有两种模型结构:CBOW和Skip-gram,本质上的模型架构的不同:输入和输出一对多(Skip-gram)和多对一(CBOW)。 ,通过只更新负样本的权重,避免整个词汇表的计算Word2Vec模型本质是一个多分类问题,最后需要通过softmax激活函数判断哪一个单词的概率最大,因此需要计算所有单词的概率大小。

    33810编辑于 2025-06-26
  • 来自专栏大模型成长之路

    模型学习 | Prompt工程基础学习

    prompting学习 许多初学者,包括曾经的我,可能一开始都会有类似的误解——“Prompting 还需要专门学习吗?不就是像在百度里搜索问题一样吗?” 然而,真正深入接触语言模型(LLM)后你会发现,Prompting 远不止是问问题那么简单。模型本身拥有极强的推理能力、逻辑能力与知识覆盖面,但这些能力并不是在默认状态下自动调用的。 (模型本身无需挖掘的能力,也就是和搜索百度、谷歌一样简单)Few-shot Learning 指在 Prompt 中提供几个示例(一般 1~5 条),引导语言模型理解任务格式与逻辑结构,再让模型生成新的答案 A: 3 + 2 = 5Q: Mary has 4 oranges and eats 1. How many are left? Large Language Models are Zero-Shot Reasoners这篇文章的作者在后来又提出了zero-shot COT,作者认为大型语言模型是零样本学习推理者,只需在每个答案前加上

    1.3K21编辑于 2025-07-15
  • 来自专栏育种数据分析之放飞自我

    混合模型学习笔记3

    这一章节,主要介绍模型中的定义,什么是「变量」,什么是「因子」,什么是「水平」等等。 1. 标题 ? 2. 几个概念 「什么是因子,什么是水平?」 3. 所以数据非平衡时,混合线性模型更适合分析。 ? 4. M[2, 1] <- M[3, 1] <- M[4, 2] <- M[5, 2] <- "" M[6, 3] <- M[6, 4] <- M[6, 5] <- "" ## Make the diagram 混合线性模型学习笔记1 混合线性模型学习笔记2

    57120发布于 2020-05-13
  • 来自专栏Soul Joy Hub

    模型AIGC系列课程 3-2】国产开源模型:ChatGLM

    GLM https://arxiv.org/pdf/2103.10360.pdf GLM是General Language Model的缩写,是一种通用的语言模型预训练框架。 这个图示说明了GLM预训练的过程,具体解释如下: a) 原始文本:给定一个原始文本,例如[x1, x2, x3, x4, x5, x6]。 在这个例子中,我们随机选择了两个连续的词片段[x3]和[x5, x6]作为样本。 b) 替换和洗牌:在Part A中,我们将被选择的词片段替换为[M](表示遮盖)。 在这个例子中,我们将[x3]和[x5, x6]洗牌为[x5, x6]和[x3]。 c) 自回归生成:GLM使用自回归的方式生成Part B。 在生成过程中,模型可以根据之前生成的词片段和Part A中的上下文来预测下一个词片段。 d) 自注意力掩码:为了限制模型的注意力范围,

    93120编辑于 2023-08-28
  • 来自专栏DevOps

    AI模型:开源语言模型bloom学习

    作为一名开源爱好者,我非常不喜欢知识付费或者服务收费的理念,所以便有决心写下此系列,让一般大众们可以不付费的玩转当下比较新的开源语言模型bloom及其问答系列模型bloomz。 一、模型介绍 bloom是一个开源的支持最多59种语言和176B参数的语言模型。 bigscience在hugging face上发布的bloom模型包含多个参数多个版本,本文中出于让大家都能动手实践的考虑,选择最小号的bloom-1b1版本,其他模型请自行尝试。 本文的安装方法都是基于pip,如果你不懂pip虚拟环境请运行以下命令(linux如果有python2,请运行pip3): pip install virtualenv -i https://mirror.baidu.com (checkpoint) #下载模型 网速足够快的情况下等一会就下载好了,但通常情况下我们得ctrl+c打断代码运行,手动下载模型存放到对应位置,即.cache\huggingface\hub\models–bigscience–bloom

    1.2K10编辑于 2024-03-29
  • 来自专栏周末程序猿

    机器学习|从0开发模型-译llama3-from-scratch

    最近在看一篇github上大佬的文章,从0开始训练llama3,觉得对于《从0开发模型》有点帮助,于是翻译一下,发现其中很多内容当前系列文章的知识点相似。 2、读取模型文件 将模型文件下载到 Meta-Llama-3-8B 文件夹中,然后读取模型文件,代码如下: import torch import json model = torch.load("Meta-Llama scratch 6、构建Transformer第一层 6.1、归一化 获取模型的第一层权重(layer.0),进行归一化处理: llama3-scratch token_embeddings = rms_norm 因为在训练过程中,只学习使⽤过去的token来预测token,因此,在推理过程中,将未来的token设置为零。 scratch 在llama3中,使用了SwiGLU前馈网络,这种网络架构非常适合在模型需要时添加非线性,如今,在llms中使用这种前馈网络架构相当常见。

    46910编辑于 2025-02-27
  • 来自专栏最新最全的大数据技术体系

    模型学习路线与建议

    第一章 深度学习基础 深度学习基础 深度学习经典模型解析 深度学习模型优化策略解析 深度学习GPU原理与应用方法 深度学习GPU并行训练策略解析 深度学习模型多GPU训练实战 第二章 智能对话系统基础 模型技术概述 GPT 系列模型核心原理详解(GPT1/GPT2/GPT3/GPT4/InstructGPT) LLaMA 系列模型核心原理详解(LLaMA/Alpaca/Vicuna/BaiChuan ) Langchain 框架核心原理详解 Langchain-LLM部署应用实战 第四章 模型应用实践 模型微调概述 模型微调中的核心要素 模型微调中的数据收集与评估 模型微调中ChatGPT (DeepSpeed) 模型RLHF技术详解(PPO/DeepSpeed-Chat) 基于常规NLP任务的模型微调实战 第五章 模型实战项目 模型训练环境搭建 模型数据收集与 instruction 设计 通用模型微调代码开发(支持多模型/多框架) Baichuan-13B多GPU LoRA微调实现 Baichuan-13B多GPU 全参数微调实现 模型性能评估体系搭建 模型部署与服务接口开发

    4.2K43编辑于 2023-10-17
  • 来自专栏大模型成长之路

    模型学习 | CLIP 原理&实现】

    Learning Transferable Visual Models From Natural Language Supervision 作者在摘要中指出,传统的监督式学习方法限制了视觉模型的泛化能力 以往的图像识别任务通常依赖于人为定义的分类标签进行训练,这种方式不仅数据成本高,而且模型更容易过拟合于训练类别。 CNN和Transformer来预测图像标题;(Transformer采用了6300万个参数,识别图像的类别会比训练一个词袋模型慢三倍);这两种方法来学习识别图像都有一个相同点:预测图像的准确文字; ,最大化配对图文之间的相似度,最小化不匹配对的相似度,并通过symeertric entropy loss优化相似得分: 训练模型并没有采用预训练权重模型,而是从头训练;并通过线性映射将不同模态编码器的表示映射到嵌入空间中 param.requires_grad = False for param in model.text_model.parameters(): param.requires_grad = False # 3.

    2.2K21编辑于 2025-07-15
  • 来自专栏大模型成长之路

    模型学习 | RAG & DeepSeek 实战】

    Deepseek & RAG 实战 编者常常有许多材料需要阅读查阅,但自己又比较懒,为此,想在模型学习过程中基于RAG技术将本地知识库与模型结合起来,加快自身的效率。 在本次的项目设计,需要达成以下目标: 开源模型的本地部署及使用 (以Deepseek为例); PDF文本分析 ➕ 相似prompt检索提取 (关键); 将检索到的信息与原prompt结合作为输入,得到结果 检索Top3结果:参考1 - 8 -(境外生排位第一)获得省部级及以上学科竞赛奖项,奖励金额参考2 1.学校对获得省部级及以上学科竞赛奖项的学生给予奖励,参考3 培训费以及学生奖金等。 }"""}]4️⃣ 模型部署mode_name_or_path = '/root/autodl-tmp/deepseek-ai/deepseek-llm-7b-chat'# 加载预训练的分词器和模型tokenizer 5️⃣ 界面设计编者基于PYQT5模块设计了一个支持知识库搭建的模型问答系统:搭建知识库后:模型输出写在最后:✅ 本项目搭建了一个简单的知识库问答系统,用户可以将自己的私人知识库进行搭建,基于RAG技术实现问答系统

    1.2K31编辑于 2025-07-19
领券