首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏大模型成长之路

    模型学习 | BERT 量化实战(2) 】

    BERT 量化实战分析前言:在【模型学习 | 量化实战(1)】-腾讯云开发者社区-腾讯云中基于BERT实现了情感分析系统以及量化的实现,但是量化的结果导致了模型的精确度急剧下降,从90%降到了54%, 未出现截断情况(即分布区域超过量化上下限)、分布近似 scale过大scale的计算如下所示:scale=\frac{max(w)-min(w)}{255} , 个别层的权重有离群值,会导致scale非常, Sensitive Layers:") for r in results[:5]: print(f"{r[0]:40s} | Acc: {r[1]:.4f} | ΔAcc: {r[2] :.4f}") return results 其他分析方法层级 fallback 到 FP32与敏感性分析相关,该方法是将原模型逐层量化,观察精度下降情况误差传播分析对 float32 模型模型 vs INT8 模型输出差异有多大

    88310编辑于 2025-06-27
  • 来自专栏大模型成长之路

    模型学习 | BLIP2原理】

    一、预训练方法这种预训练方法分为了两个阶段 (1)视觉语言特征表示学习阶段 (2)视觉到文本的生成学习阶段 1.1 Q-Former主要作用就是对齐两个不同模态的冻结预训练模型 Q-Former包含了两个 transformer子模块:(1)Image Transformer (特征提取) (2) Text transformer (作为文本编码器和解码器) ; 一组可学习的查询嵌入向量作为 Image Transformer 的输入,这些向量在self-attention layer相互联系以及通过 cross-attention layer与预训练的图像模型特征交互; 除此之外,这组可学习的嵌入向量也与文本 作者尝试了两种LLM冻结模型:(1) decoder-based LLMs : query 表征作为 LLM 的输入前缀(prefix) → LLM 自己完成文本生成(2) encoder-decoder-based LLMs : 模型学习在给定图像(query 表征)+ 前缀(自定义)的条件下,生成后缀内容架构类型 模型例子 输入方式

    1.3K00编辑于 2025-07-01
  • 来自专栏人工智能领域

    AI模型学习

    AI模型学习 在当前技术环境下,AI模型学习不仅要求研究者具备深厚的数学基础和编程能力,还需要对特定领域的业务场景有深入的了解。 方向一:AI模型学习的理论基础 AI 模型学习的理论基础涉及深度学习、神经网络、优化算法等多个方面。 常见的正则化方法包括 L1 正则化、L2 正则化、Dropout 等,可以有效地控制模型的复杂度和泛化能力。 常见的正则化方法包括 L1 正则化、L2 正则化、Dropout 等,可以有效地控制模型的复杂度和泛化能力。 正则化和防止过拟合:使用正则化技术如Dropout、L1/L2正则化等可以帮助防止模型过拟合训练集。此外,采用更多数据、数据增强等方法也有助于缓解过拟合问题。

    80210编辑于 2024-12-18
  • 来自专栏司钰秘籍

    AI模型学习

    通过不断优化模型结构和算法,AI模型学习能够不断提升模型的准确性和效率,为人类生活和工作带来更多便利。 AI模型学习的理论基础 数学基础: 线性代数:AI 模型中大量使用向量和矩阵运算,如矩阵乘法、向量点积等,用于表示和操作数据。 2. 参数调优:通过网格搜索、随机搜索或基于启发式的方法来调整模型的超参数,如学习率、正则化参数等。 3. 此外,模型的性能也受到计算资源、数据质量和算法优化等因素的影响 AI模型学习的伦理与社会影响 AI 模型学习确实带来了一些伦理和社会问题,我们需要认真对待: 1. 2. 多模态学习:结合多种数据形式,如图像、音频、文本等,进行综合学习,提高模型的理解能力。 3. 可解释性和透明度:提高模型的可解释性,使人们能够更好地理解模型的决策过程。 4.

    79510编辑于 2024-04-04
  • 来自专栏大模型成长之路

    模型学习 | BLIP2 跌倒检测项目实战(一)】

    BLIP2 跌倒项目实战(一)在学习完BLIP,BLIP2模型原理后,如何应用于工业开发至关重要。 ;可以根据需求调整预训练模型;目前LAVIS只支持flant5xl 、flant5xxlpretrain_opt2.7b : decoder-only 模型;自定义一个python文件:from lavis.models import load_model_and_preprocessimport gradio as grimport torch# 加载 BLIP-2 模型(注意:用的是 Flan-T5 Base)device 回答:"yes" / "No" 但是目前模型的回答是关于整段话的描述,无论怎么改提示词都没用 为此,构建一份新的数据集微调模型至关重要。 batch_size_eval: 2 num_workers: 4 warmup_steps: 2000 seed: 42 output_dir: "output/BLIP2/Pretrain_stage2

    1.1K11编辑于 2025-07-05
  • 来自专栏大模型应用

    模型应用:模型本地部署实战:从零构建可视化智能学习助手.2

    """ # 实现结构化内容生成我们首先需要明确LocalLearningAssistant类的核心作用:它负责加载模型,并提供生成响应和创建学习示例的功能。 构建提示词:将系统提示和对话历史组合成模型所需的输入格式。创建学习示例:根据给定的学科、主题和难度生成学习示例。 with gr.Blocks(theme=gr.themes.Soft()) as demo: # 标题区域 gr.Markdown("# 模型本地部署 编程助手2. 科学助手3. 数学助手4. 学习助手五、总结 这个项目成功实现了在消费级硬件上部署智能学习助手,基于Qwen1.5-1.8B模型在CPU环境稳定运行。 ") as demo: gr.Markdown("# 模型本地部署AI学习助手") gr.Markdown("基于本地大模型的智能学习助手 - 分类问题版本

    62432编辑于 2026-01-30
  • 来自专栏大模型成长之路

    模型学习 | LLaMA Serious】

    LLaMA Serious⭐ 本篇文章主要介绍 LLaMA系列的论文,主要分析LLaMA V1 的模型架构以及LLaMA V2的训练方法。 一、LLaMA V1这篇文章主要是引出模型的表现力并不是在模型的大小,而是训练数据的样本。之前的做法是尽可能的减少模型大小,但是这些方法忽略了推理代价。 本来模型是通过一个残差块解决的,但是,LayerNorm会对激活进行标准化,会削弱或干扰残差的直接流动,所以导致梯度不能顺利穿过太多层LayerNorm Layer. 2️⃣ 激活函数 原来的激活函数: 在 PaLM、LLaMA、DeepSeek 等模型上被广泛使用,带来精度提升。 0, 0, -inf, -inf], [0, 0, 0, 0, -inf], [0, 0, 0, 0, 0]]二、LLaMA V2部分的预训练设置都与

    58530编辑于 2025-07-25
  • 来自专栏大模型成长之路

    模型学习 | BLIP原理】

    一、预训练方法 1.1 图像文本模型 图像特征提取模型:VIT 文本特征提取模型:Unimodal encoder; Image-grounded text encoder; Image-grounded 这种结构广泛用于图文预训练(如 BLIP2 的 Q-Former)、多模态对齐、图文检索等任务中。 这种结构转变常见于图文生成、多模态问答等任务中,例如 BLIP、BLIP-2。 对齐图像与文本的全局语义空间 让正样本图文对更接近,负样本更远 Image-Text Matching Loss Image-grounded text encoder 学习图文细粒度语义对齐 text decoder 图像到文本的语言生成能力 使用自回归预测生成 caption,优化交叉熵 Image-Text Contrastive Loss (ITC): InfoNCE(对比学习

    1.2K10编辑于 2025-07-01
  • 来自专栏大模型成长之路

    模型学习 | RAG & ReAct】

    这种方式有效弥补了模型记忆局限、提升了知识覆盖广度与事实准确性。 )doc_embeddings = model.encode(["段落1", "段落2", "段落3"]) # 文档向量# 向量检索import faissindex = faiss.IndexFlatL2 它允许模型在推理过程中“边思考(Reason),边行动(Act)”,即模型可以根据问题内容主动决定是否调用某个工具、调用哪个工具,并基于工具返回的结果进一步推理和生成回答。 与其他 Agent 类方法类似,ReAct 也需要通过 Few-shot 样例 进行提示设计,帮助模型学习在何种情况下调用工具,以及如何将工具的反馈信息融入最终答案中。 但是在严格意义上它还只是”单轮任务代理”,目前还缺乏:1️⃣多轮状态记忆 2️⃣长期目标规划 3️⃣动态工具注册、调用多个 API 的能力 4️⃣消息结构的显式控制

    1.8K30编辑于 2025-07-17
  • 来自专栏学习

    【机器学习】---语言模型

    这些模型,犹如现代科技的语言魔法师,通过海量数据和尖端的深度学习技术训练而成,在自然语言的理解与生成上展现了无与伦比的能力。 第一部分:什么是语言模型? 1. 走近语言模型 语言模型并非传统意义上的“语言学家”,而是通过深度学习技术训练的大规模神经网络,其核心目标是理解、生成并操控自然语言。 这些模型的强大之处在于,它们能够从海量的训练数据中学习语言的结构和语义关系,从而以极高的准确度生成自然语言文本。 它们的核心技术依赖于一种名为Transformer的模型架构。 模型训练的核心要素 要构建一个语言模型,仅依赖强大的算法是不够的。以下是训练过程中不可或缺的三个关键要素: 海量语料库 模型需要从海量数据中学习语言的多样性和复杂性。 文本生成:创作无界限 语言模型能够生成流畅、自然的文本,适用于内容创作、新闻写作和文案生成等场景。例如,输入简单的主题,模型即可输出高质量的文章。 2.

    75910编辑于 2025-01-13
  • 模型和机器学习

    学习模型之前,要不要先学机器学习?” 这些问题的本质,是对两个概念的边界认知模糊。事实上,模型是机器学习的一个子集,是机器学习技术在“参数、大数据、算力”时代的进化形态。 4.2 维度2:参数规模——从百万级到万亿级的跨越 参数规模是两者最直观的差异,也是模型涌现能力的根源。 用单卡NVIDIA RTX 3090训练一个ResNet-50模型,处理100万张图片,需要2天,成本约100元。 5.2 案例2模型——GPT-3.5做多任务处理 本案例使用OpenAI的API,调用GPT-3.5模型,完成文本分类、代码编写、逻辑推理等多个任务。 代码编写 prompt2 = "帮我写一个Python的逻辑回归模型,用于垃圾邮件分类" print("任务2:代码编写") print(call_gpt35(prompt2)) print("-" *

    53010编辑于 2026-04-14
  • 来自专栏大模型成长之路

    模型学习 | 词向量】

    Word2Vec单词与单词之间的向量往往不在同一个向量空间,例如,传统的编码方式:one-hot编码,不同单词[1, 0, 0]和[0, 1, 0]之间的余弦相似度为0。 因此,Word2Vec希望能够通过训练得到一个新的词向量表达方式,从而丰富向量的语义信息。主要目标如图所示,从一个稀疏的one-hot向量通过训练得到一个丰富稠密的新向量。 How achieveword2vec通过神经网络模型训练新的词向量表达模型中参数的定义:one-hot:1, 7 表示一共有七个单词;Embedding:表示输入层到隐藏层的权重矩阵,是从one-hot CodingWord2Vec有两种模型结构:CBOW和Skip-gram,本质上的模型架构的不同:输入和输出一对多(Skip-gram)和多对一(CBOW)。 ,通过只更新负样本的权重,避免整个词汇表的计算Word2Vec模型本质是一个多分类问题,最后需要通过softmax激活函数判断哪一个单词的概率最大,因此需要计算所有单词的概率大小。

    33810编辑于 2025-06-26
  • 来自专栏大模型成长之路

    模型学习 | Prompt工程基础学习

    prompting学习 许多初学者,包括曾经的我,可能一开始都会有类似的误解——“Prompting 还需要专门学习吗?不就是像在百度里搜索问题一样吗?” 然而,真正深入接触语言模型(LLM)后你会发现,Prompting 远不止是问问题那么简单。模型本身拥有极强的推理能力、逻辑能力与知识覆盖面,但这些能力并不是在默认状态下自动调用的。 (模型本身无需挖掘的能力,也就是和搜索百度、谷歌一样简单)Few-shot Learning 指在 Prompt 中提供几个示例(一般 1~5 条),引导语言模型理解任务格式与逻辑结构,再让模型生成新的答案 A: 3 + 2 = 5Q: Mary has 4 oranges and eats 1. How many are left? Large Language Models are Zero-Shot Reasoners这篇文章的作者在后来又提出了zero-shot COT,作者认为大型语言模型是零样本学习推理者,只需在每个答案前加上

    1.3K21编辑于 2025-07-15
  • 来自专栏TeamsSix的网络空间安全专栏

    Django 学习笔记 | 2模型

    : 定义模型模型迁移 操作数据库 1、定义模型类 在这之前需要先设计数据库的表什么的,这里就不详细的说了(主要是我太懒了),感兴趣的可以看本文的参考链接,下面直接贴定义模型类的代码。 models.CharField(max_length=10) gender = models.BooleanField() book = models.ForeignKey(BookInfo) 2、 道听途说,不要当真) # BookManager/BookManager/settings.py LANGUAGE_CODE = 'zh-Hans' TIME_ZONE = 'Asia/Shanghai' 2、 3、注册模型类 刚打开管理员界面的时候,只能看到认证和授权管理栏,这时候就需要将模型类注册进去。 Demon-Mx/p/8385318.html https://blog.csdn.net/qq_35965090/article/details/81663941 ---- 往期推荐 Django 学习笔记

    1K10发布于 2020-03-12
  • 来自专栏Soul Joy Hub

    模型AIGC系列课程 3-2】国产开源模型:ChatGLM

    GLM https://arxiv.org/pdf/2103.10360.pdf GLM是General Language Model的缩写,是一种通用的语言模型预训练框架。 具体来说,GLM通过随机遮盖文本中连续的标记,并训练模型按顺序重新生成这些遮盖的部分。这种自回归的空白填充目标使得GLM能够更好地捕捉上下文中标记之间的依赖关系,并且能够处理可变长度的空白。 这个图示说明了GLM预训练的过程,具体解释如下: a) 原始文本:给定一个原始文本,例如[x1, x2, x3, x4, x5, x6]。 在生成过程中,模型可以根据之前生成的词片段和Part A中的上下文来预测下一个词片段。 d) 自注意力掩码:为了限制模型的注意力范围,

    93120编辑于 2023-08-28
  • 来自专栏DeepHub IMBA

    视觉模型DINOv2:自我监督学习的新领域

    DINOv2不仅是一个新版本而且带来了新的改进,并为判别性自监督学习设定了更高的标准。当然公司的名字也从Facebook变为了Meta。 DINO 使用对比学习方法,模型学习从图像检索任务中有用的数据中识别相似和不同的例子。但是DINO 放弃了负采样的通常做法,而是选择了全局自注意力机制。这使它能够捕获更全面的数据视图。 下面是一些关键的改进: FlashAttention机制:这个新的自注意力层,它1提高了内存使用效率和速度,这对于管理模型至关重要。 在像 DINOv2 这样的模型学习的特征的上下文中,这应该是对应于模型已经学会识别的最重要的视觉特征。例如,它可能对应于高级特征(例如某些对象的存在)或低级特征(例如边缘、颜色或纹理)。 总结 DINOv2令人印象深刻的能力和广泛的适用性预示着自我监督学习领域的光明前景。

    3.4K10编辑于 2023-08-28
  • 来自专栏人工智能极简应用

    【机器学习】QLoRA:基于PEFT亲手量化微调Qwen2模型

    之前陆续写了Qwen1.5、Qwen2.0、GLM-4等国产开源模型的原理、训练及推理相关的文章,每一篇都拿到了热榜第一,但其中训练部分均基于Llama-factory框架,对于工程师而言,最喜欢的就是刨根问底 今天我们抛开中间框架,深入底层,一步一步带大家微调一个模型。 二、量化与微调—原理剖析 2.1 为什么要量化微调? ,亲手微调你的第一个AI模型 3.1 模型预处理—依赖安装、库包导入、模型下载 from modelscope import snapshot_download model_dir = snapshot_download Qwen2-7B-Instruct模型按以上参数训练占用显存约20G。 7B为例,基于QLoRA、PEFT一步一步带着大家微调自己的模型,本文参考全网peft+qlora微调教程,一步一排坑,让大家在网络环境不允许的情况下,也能丝滑的开启模型微调之旅。

    3.4K11编辑于 2024-08-13
  • 来自专栏DevOps

    AI模型:开源语言模型bloom学习

    作为一名开源爱好者,我非常不喜欢知识付费或者服务收费的理念,所以便有决心写下此系列,让一般大众们可以不付费的玩转当下比较新的开源语言模型bloom及其问答系列模型bloomz。 一、模型介绍 bloom是一个开源的支持最多59种语言和176B参数的语言模型。 它是在Megatron-LM GPT2的基础上修改训练出来的,主要使用了解码器唯一结构,对词嵌入层的归一化,使用GeLU激活函数的线性偏差注意力位置编码等技术。 本文的安装方法都是基于pip,如果你不懂pip虚拟环境请运行以下命令(linux如果有python2,请运行pip3): pip install virtualenv -i https://mirror.baidu.com = time.time() print(f'time cost is {a2 - a1} s') time模块用来计时,我的是十二代i7,花了40s生成。

    1.2K10编辑于 2024-03-29
  • 来自专栏最新最全的大数据技术体系

    模型学习路线与建议

    第一章 深度学习基础 深度学习基础 深度学习经典模型解析 深度学习模型优化策略解析 深度学习GPU原理与应用方法 深度学习GPU并行训练策略解析 深度学习模型多GPU训练实战 第二章 智能对话系统基础 模型技术概述 GPT 系列模型核心原理详解(GPT1/GPT2/GPT3/GPT4/InstructGPT) LLaMA 系列模型核心原理详解(LLaMA/Alpaca/Vicuna/BaiChuan /LLaMA2/BaiChuan2) LLaMA 系列模型源码详解 BLOOM 系列模型核心原理详解(BLOOM/BLOOMZ) ChatGLM 系列模型核心原理详(ChatGLM/ChatGLM2 ) Langchain 框架核心原理详解 Langchain-LLM部署应用实战 第四章 模型应用实践 模型微调概述 模型微调中的核心要素 模型微调中的数据收集与评估 模型微调中ChatGPT (DeepSpeed) 模型RLHF技术详解(PPO/DeepSpeed-Chat) 基于常规NLP任务的模型微调实战 第五章 模型实战项目 模型训练环境搭建 模型数据收集与 instruction

    4.2K43编辑于 2023-10-17
  • 来自专栏大模型成长之路

    模型学习 | CLIP 原理&实现】

    Learning Transferable Visual Models From Natural Language Supervision 作者在摘要中指出,传统的监督式学习方法限制了视觉模型的泛化能力 作者构建了一个4亿对的数据集WIT(图像,文本对),根据50万个关键词搜集相关的图文对,最后数据的文本数与GPT-2训练所需数据集大小相似; 二、预训练方法 作者首先尝试了直接采用联合学习的方式,采用 CNN和Transformer来预测图像标题;(Transformer采用了6300万个参数,识别图像的类别会比训练一个词袋模型慢三倍);这两种方法来学习识别图像都有一个相同点:预测图像的准确文字; ,最大化配对图文之间的相似度,最小化不匹配对的相似度,并通过symeertric entropy loss优化相似得分: 训练模型并没有采用预训练权重模型,而是从头训练;并通过线性映射将不同模态编码器的表示映射到嵌入空间中 ("openai/clip-vit-base-patch32") # 2.

    2.2K21编辑于 2025-07-15
领券