首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏大模型成长之路

    模型学习 | MINIGPT-4原理】

    MINIGPT-4: ENHANCING VISION-LANGUAGE UNDERSTANDING WITH ADVANCED LARGE LANGUAGE MODELS在GPT4未开源的情况下,作者认为其表现优越是因为采用了最为先进的 开源代码:https://minigpt-4.github.io/一、预训练方法预训练方法几乎和BLIP2模型一致,可以参考:【模型学习 | BLIP2原理】-腾讯云开发者社区-腾讯云1.1 Q-Former layer与预训练的图像模型特征交互; 除此之外,这组可学习的嵌入向量也与文本token进行拼接作为Text transformer的输入; 将Q-Former初始化为 $\text{BERT}_{\ ; MINI-GPT4表现比BLIP2要强上许多? ① MiniGPT-4 使用的是 Vicuna(基于 LLaMA 的开源 ChatGPT 对话模型),具有更强的自然语言表达和指令理解能力;而BLIP-2 使用的 LLM 主要是 Flan-T5 或 OPT

    85010编辑于 2025-07-02
  • 来自专栏后台技术汇

    模型应用之(4):Langchain架构与模型接入

    作为一个语言模型集成框架,LangChain 的用例与一般语言模型的用例有很大的重叠。 重叠范围包括文档分析和总结摘要, 代码分析和聊天机器人。 Langchain架构 LangChain工具 组件:模型包装器、聊天模型包装器、数据增强工具和接口链: 提供了标准接口,和数据平台和实际应用工具紧密集成 LangChain六模块 模块 核心作用 Agent作为高级模块,可调用其他所有模块功能 模型接入 接入示例 云服务和私有化模型优劣对比 维度 开发成本 算力成本 运维成本 数据安全 云厂商模型 较低,开箱即用 算力资源充足,模型性能好 &吞吐量较高 较低,提供云平台监控 安全性低 私有化模型 较高,自建模型网关、服务鉴权、可用性等 算力硬件投入成本高,模型性能较差低&吞吐量较低 较高,需要专业运维团队介入 安全性高,保密性强 小结: - 研发&测试环境:为了方便部署和测试,使用云服务 - 大客户生产环境:安全审核严格,大多数采用自建模型的方式 总结 LangChain 是什么?

    1K10编辑于 2025-08-04
  • 来自专栏人工智能领域

    AI模型学习

    AI模型学习 在当前技术环境下,AI模型学习不仅要求研究者具备深厚的数学基础和编程能力,还需要对特定领域的业务场景有深入的了解。 方向一:AI模型学习的理论基础 AI 模型学习的理论基础涉及深度学习、神经网络、优化算法等多个方面。 以下是一些关于 AI 模型学习理论基础的重要内容: 深度学习:深度学习是 AI 模型学习的核心理论基础,它通过构建多层神经网络来实现对复杂数据模式的学习和表征。 ———————————————— 方向二:AI模型的训练与优化 AI 模型学习的理论基础涉及深度学习、神经网络、优化算法等多个方面。 以下是一些关于 AI 模型学习理论基础的重要内容: 深度学习:深度学习是 AI 模型学习的核心理论基础,它通过构建多层神经网络来实现对复杂数据模式的学习和表征。

    80210编辑于 2024-12-18
  • 来自专栏司钰秘籍

    AI模型学习

    在当前技术环境下,AI模型学习不仅要求研究者具备深厚的数学基础和编程能力,还需要对特定领域的业务场景有深入的了解。 通过不断优化模型结构和算法,AI模型学习能够不断提升模型的准确性和效率,为人类生活和工作带来更多便利。 AI模型学习的理论基础 数学基础: 线性代数:AI 模型中大量使用向量和矩阵运算,如矩阵乘法、向量点积等,用于表示和操作数据。 此外,模型的性能也受到计算资源、数据质量和算法优化等因素的影响 AI模型学习的伦理与社会影响 AI 模型学习确实带来了一些伦理和社会问题,我们需要认真对待: 1. 多模态学习:结合多种数据形式,如图像、音频、文本等,进行综合学习,提高模型的理解能力。 3. 可解释性和透明度:提高模型的可解释性,使人们能够更好地理解模型的决策过程。 4.

    79510编辑于 2024-04-04
  • 来自专栏大模型成长之路

    模型学习 | LLaMA Serious】

    一、LLaMA V1这篇文章主要是引出模型的表现力并不是在模型的大小,而是训练数据的样本。之前的做法是尽可能的减少模型大小,但是这些方法忽略了推理代价。 在 PaLM、LLaMA、DeepSeek 等模型上被广泛使用,带来精度提升。 其中, W,V 是可学习的权重矩阵b,c 是偏置项3️⃣ 位置编码采用了旋转位置编码:RoPE(Rotary Positional Embedding)RoPE 是一种通过“旋转”的方式,将相对位置信息引入注意力机制中的位置编码方法 图片4️⃣ Causal multi-head attention LLaMA是 only-decoder结构的模型,属于自回归语言模型(类似GPT)。 0, 0, -inf, -inf], [0, 0, 0, 0, -inf], [0, 0, 0, 0, 0]]二、LLaMA V2部分的预训练设置都与

    58430编辑于 2025-07-25
  • 来自专栏大模型成长之路

    模型学习 | BLIP原理】

    一、预训练方法 1.1 图像文本模型 图像特征提取模型:VIT 文本特征提取模型:Unimodal encoder; Image-grounded text encoder; Image-grounded 这是因为生成任务要求模型按序预测每一个词,不能访问未来的信息。Causal attention 能保证自回归生成的正确性,使模型适合用作 decoder,实现图像到文本的自然语言生成。 对齐图像与文本的全局语义空间 让正样本图文对更接近,负样本更远 Image-Text Matching Loss Image-grounded text encoder 学习图文细粒度语义对齐 text decoder 图像到文本的语言生成能力 使用自回归预测生成 caption,优化交叉熵 Image-Text Contrastive Loss (ITC): InfoNCE(对比学习 最后组成一个新的数据集预训练模型

    1.2K10编辑于 2025-07-01
  • 来自专栏大模型成长之路

    模型学习 | RAG & ReAct】

    进阶prompting 基础的prompting技术中,都是通过样例提示,激活模型本身的推理功能,但在现实的情况中,依然存在着仅仅依靠模型本身的知识是无法解决的,例如:① 数据库知识不足 ② 模型能力缺乏等 这种方式有效弥补了模型记忆局限、提升了知识覆盖广度与事实准确性。 它允许模型在推理过程中“边思考(Reason),边行动(Act)”,即模型可以根据问题内容主动决定是否调用某个工具、调用哪个工具,并基于工具返回的结果进一步推理和生成回答。 与其他 Agent 类方法类似,ReAct 也需要通过 Few-shot 样例 进行提示设计,帮助模型学习在何种情况下调用工具,以及如何将工具的反馈信息融入最终答案中。 但是在严格意义上它还只是”单轮任务代理”,目前还缺乏:1️⃣多轮状态记忆 2️⃣长期目标规划 3️⃣动态工具注册、调用多个 API 的能力 4️⃣消息结构的显式控制

    1.8K30编辑于 2025-07-17
  • 来自专栏学习

    【机器学习】---语言模型

    这些模型,犹如现代科技的语言魔法师,通过海量数据和尖端的深度学习技术训练而成,在自然语言的理解与生成上展现了无与伦比的能力。 第一部分:什么是语言模型? 1. 走近语言模型 语言模型并非传统意义上的“语言学家”,而是通过深度学习技术训练的大规模神经网络,其核心目标是理解、生成并操控自然语言。 这些模型的强大之处在于,它们能够从海量的训练数据中学习语言的结构和语义关系,从而以极高的准确度生成自然语言文本。 它们的核心技术依赖于一种名为Transformer的模型架构。 模型训练的核心要素 要构建一个语言模型,仅依赖强大的算法是不够的。以下是训练过程中不可或缺的三个关键要素: 海量语料库 模型需要从海量数据中学习语言的多样性和复杂性。 优化算法 如 AdamW,这是一种适合深度学习的优化算法,可以显著提高训练效率。 强大计算资源 通常需要数百甚至数千块 GPU 或 TPU 才能完成大规模模型的训练。

    75910编辑于 2025-01-13
  • 模型和机器学习

    后来,模型的概念从语言领域扩展到了多模态领域,出现了支持文本、图像、语音、视频的多模态模型,比如GPT-4、文心一言4.0等。 4.4 维度4:算力需求——从个人电脑到超算集群 算力是训练模型的基础,两者的算力需求天差地别。 用1024张NVIDIA H100训练GPT-4模型,处理1万亿字的文本数据,需要3个月,成本约1亿美元。 比如,给GPT-4一个全新的任务:“写一篇关于模型与机器学习差异的博客”,它可以直接完成,无需微调。 文本生成 prompt4 = "帮我写一篇关于模型与机器学习差异的科普文章,300字左右" print("任务4:文本生成") print(call_gpt35(prompt4)) 5.2.2 代码解析

    52910编辑于 2026-04-14
  • 来自专栏机器学习/数据可视化

    深度学习4激活函数

    深度学习4激活函数 如果不用激励函数(其实相当于激励函数是f(x) = x),在这种情况下你每一层输出实际上都是上层输入的线性函数。 这样就使得无论神经网络有多少层,输出都是输入的线性组合,与没有隐藏层效果相当,模型的表达力仍然不够。 我们决定引入非线性函数作为激励函数,这样深层神经网络才有意义(不再是输入的线性组合)。 本文将介绍深度学习中的4个常见的激活函数,从原函数公式、导数函数及二者的可视化来进行对比: Sigmoid函数 Tanh函数 ReLu函数 Leaky ReLu函数 激活函数特征 非线性:激活函数满足非线性时 当X无穷的时候,函数值趋于1;X无穷小的时候,趋于0。相当于对输入进行了归一化操作。 Sigmod函数存在幂运算,计算复杂度,训练时间长。

    1.1K30编辑于 2023-08-25
  • 来自专栏大模型成长之路

    模型学习 | 词向量】

    How achieveword2vec通过神经网络模型训练新的词向量表达模型中参数的定义:one-hot:1, 7 表示一共有七个单词;Embedding:表示输入层到隐藏层的权重矩阵,是从one-hot ,与目标标签做损失进行模型训练;Lookup table语料库十分巨大,每个单词都采用one-hot输入训练会大大增加存储和计算开销,因此,在输入的过程,仅仅输入单词的索引值,例如在上述例子中,直接采用索引 4进行输入,同样也可以得到相同的词向量。 CodingWord2Vec有两种模型结构:CBOW和Skip-gram,本质上的模型架构的不同:输入和输出一对多(Skip-gram)和多对一(CBOW)。 ,通过只更新负样本的权重,避免整个词汇表的计算Word2Vec模型本质是一个多分类问题,最后需要通过softmax激活函数判断哪一个单词的概率最大,因此需要计算所有单词的概率大小。

    33810编辑于 2025-06-26
  • 来自专栏CreateAMind

    解决深度学习4缺陷

    鉴于研究中研究的学习和信用分配方案,在第 4 节中,我们考虑了神经科学启发的机器学习研究面临的重要开放性问题和挑战,以及可能取得进展的有前景的问题领域。 属于对比希伯来学习(CHL)框架的方案直接利用了一个基于能量的模型,该模型在松弛到解时得到应用。 类似于PC,这种算法可以被证明是对数据的贝叶斯生成模型的表示和学习[38]。 4 Future Directions for Research未来研究方向 尽管近年来在生物启发式(bio-inspired)学习方法方面取得了显著的进展和活动,但这些方法尚未达到反向传播(backpropagation 为此,未来的努力应该集中在为深度学习模型实现生物可行的更新规则,例如LSTM,或者受控制理论启发的模型,例如卡尔曼滤波器。

    74810编辑于 2024-04-19
  • 来自专栏大模型成长之路

    模型学习 | Prompt工程基础学习

    prompting学习 许多初学者,包括曾经的我,可能一开始都会有类似的误解——“Prompting 还需要专门学习吗?不就是像在百度里搜索问题一样吗?” 然而,真正深入接触语言模型(LLM)后你会发现,Prompting 远不止是问问题那么简单。模型本身拥有极强的推理能力、逻辑能力与知识覆盖面,但这些能力并不是在默认状态下自动调用的。 (模型本身无需挖掘的能力,也就是和搜索百度、谷歌一样简单)Few-shot Learning 指在 Prompt 中提供几个示例(一般 1~5 条),引导语言模型理解任务格式与逻辑结构,再让模型生成新的答案 A: 3 + 2 = 5Q: Mary has 4 oranges and eats 1. How many are left? Large Language Models are Zero-Shot Reasoners这篇文章的作者在后来又提出了zero-shot COT,作者认为大型语言模型是零样本学习推理者,只需在每个答案前加上

    1.3K21编辑于 2025-07-15
  • 来自专栏育种数据分析之放飞自我

    混合线性模型学习笔记4

    这个小节主要是介绍混合线性模型的理论知识,包括固定因子的显著性检验(Wald),随机因子的检验(LRT),固定因子的效应值(BLUE),随机因子的效应值(BLUP)。 1. 题目:混合线性模型理论1 ? 在这里插入图片描述 2. 大纲 混合线性方程组中矩阵的书写形式,固定因子如何构建矩阵,随机因子如何构建矩阵,固定因子和随机因子的显著性检验。 ? 3. 一般线性模型 一般线性模型的矩阵写法: ? 矩阵解释: ? 4. 混合线性模型 混合线性模型的矩阵写法: ? 模型解释: ? 矩阵形式推导: ? 5. 单因素随机区组:混合线性模型 固定因子:单因素 随机因子:区组 ? 写出似然函数: ? 使用REML评估: ? LRT检验: ? ? 检验固定因子 ? ? 在这里插入图片描述 ? 相关系列: 混合线性模型学习笔记1 混合线性模型学习笔记2 混合线性模型学习笔记3

    90810发布于 2020-05-13
  • 来自专栏又见苍岚

    PyTorch 学习 -4- 模型构建

    随着深度学习的发展,研究人员研究出了许许多多的模型,PyTorch中神经网络构造一般是基于nn.Module类的模型来完成的,它让模型构造更加灵活, 本文介绍 Pytorch 的模型构建 。 神经网络中常见的层 深度学习的一个魅力在于神经网络中各式各样的层,例如全连接层、卷积层、池化层与循环层等等。虽然PyTorch提供了⼤量常用的层,但有时候我们依然希望⾃定义层。 含模型参数的层 我们还可以自定义含模型参数的自定义层。其中的模型参数可以通过训练学出。 一个神经网络的典型训练过程如下: 定义包含一些可学习参数 (或者叫权重)的神经网络 在输入数据集上迭代 通过网络处理输入 计算 loss (输出和正确答案的距离) 将梯度反向传播给网络的参数 更新网络的权重 一个模型的可学习参数可以通过net.parameters()返回 12345 params = list(net.parameters())print(len(params))print(params[

    98420编辑于 2023-07-20
  • 来自专栏人工智能极简应用

    【机器学习】GLM-4V:图片识别多模态模型(MLLs)初探

    一、引言 之前在我的第5篇热榜第一文章【机器学习】Qwen-VL:基于FastAPI私有化部署你的第一个AI多模态模型中对Qwen-VL如何基于FastAPI封装私有化接口进行了讲述,评论区有人问到如何基于 OpenAI兼容的API接口(OpenAI-API-compatible):是个很重要的接口规范,由模型王者OpenAI制定,简单来说就是接口名、传参方式、参数格式统一仿照OpenAI的接口方式,这样可以降低使用接口的学习与改造 、GLM-4-9B-Chat、GLM-4-9B-Chat-1M以及对应支持1120x1120像素的多模态模型GLM-4V-9B。 模型服务接口 3.1 FastAPI 极简入门 搭建1个FastAPI服务依赖fastapi、pydantic、uvicorn三个库: 3.1.1 FastAPI FastAPI是一个现代、快速(高性能 兼容API的GLM-4V模型服务端接口,并给出了客户端实现。

    2.7K10编辑于 2024-08-13
  • 来自专栏算法一只狗

    LLama4 原生多模态模型

    Meta最新发布了原生多模态模型 Llama 4,一经亮相即登上LMSYS模型排行榜第二名,仅次于Google的Gemini-2.5-pro,分差仅为22分,实力可见一斑。 当前行业趋势多偏向小而高效的模型,Llama 4如此庞大的规模实属少见。 后训练阶段,Maverick采用了三阶段训练策略:轻量监督微调(SFT)专注难度较高的数据;在线强化学习(RL)提升中高难度提示下的推理能力;轻量偏好优化(DPO)用于提升边缘任务表现。 总结与展望Llama 4的发布,意味着Meta正式进入原生多模态模型竞争核心领域。 相比Gemini系列、GPT-4o、Claude 3、DeepSeek等主流模型,Llama 4以务实高效的技术路线,突出计算成本、推理效率与多模态能力的平衡。

    1K00编辑于 2025-05-01
  • 来自专栏DevOps

    AI模型:开源语言模型bloom学习

    作为一名开源爱好者,我非常不喜欢知识付费或者服务收费的理念,所以便有决心写下此系列,让一般大众们可以不付费的玩转当下比较新的开源语言模型bloom及其问答系列模型bloomz。 一、模型介绍 bloom是一个开源的支持最多59种语言和176B参数的语言模型。 bigscience在hugging face上发布的bloom模型包含多个参数多个版本,本文中出于让大家都能动手实践的考虑,选择最小号的bloom-1b1版本,其他模型请自行尝试。 (checkpoint) #下载模型 网速足够快的情况下等一会就下载好了,但通常情况下我们得ctrl+c打断代码运行,手动下载模型存放到对应位置,即.cache\huggingface\hub\models–bigscience–bloom 下载模型地址: https://huggingface.co/bigscience/bloom-1b1/tree/main 把如上图所示链接中的五个文件(不包含这个flax_model.msgpack)

    1.2K10编辑于 2024-03-29
  • 来自专栏最新最全的大数据技术体系

    模型学习路线与建议

    第一章 深度学习基础 深度学习基础 深度学习经典模型解析 深度学习模型优化策略解析 深度学习GPU原理与应用方法 深度学习GPU并行训练策略解析 深度学习模型多GPU训练实战 第二章 智能对话系统基础 模型技术概述 GPT 系列模型核心原理详解(GPT1/GPT2/GPT3/GPT4/InstructGPT) LLaMA 系列模型核心原理详解(LLaMA/Alpaca/Vicuna/BaiChuan ) Langchain 框架核心原理详解 Langchain-LLM部署应用实战 第四章 模型应用实践 模型微调概述 模型微调中的核心要素 模型微调中的数据收集与评估 模型微调中ChatGPT (DeepSpeed) 模型RLHF技术详解(PPO/DeepSpeed-Chat) 基于常规NLP任务的模型微调实战 第五章 模型实战项目 模型训练环境搭建 模型数据收集与 instruction 设计 通用模型微调代码开发(支持多模型/多框架) Baichuan-13B多GPU LoRA微调实现 Baichuan-13B多GPU 全参数微调实现 模型性能评估体系搭建 模型部署与服务接口开发

    4.2K43编辑于 2023-10-17
  • 来自专栏大模型成长之路

    模型学习 | CLIP 原理&实现】

    Learning Transferable Visual Models From Natural Language Supervision 作者在摘要中指出,传统的监督式学习方法限制了视觉模型的泛化能力 作者构建了一个4亿对的数据集WIT(图像,文本对),根据50万个关键词搜集相关的图文对,最后数据的文本数与GPT-2训练所需数据集大小相似; 二、预训练方法 作者首先尝试了直接采用联合学习的方式,采用 CNN和Transformer来预测图像标题;(Transformer采用了6300万个参数,识别图像的类别会比训练一个词袋模型慢三倍);这两种方法来学习识别图像都有一个相同点:预测图像的准确文字; dataset = MyDataset(image_paths, texts) dataloader = DataLoader(dataset, batch_size=2, shuffle=True) # 4. optimizer.zero_grad() total_loss += loss.item() print(f"Epoch {epoch+1}, Loss: {total_loss:.4f

    2.2K21编辑于 2025-07-15
领券