首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏大模型&AIGC

    6种大模型微调技术

    值得一提的是,通过使用T5模型进行模型大小的消融实验,我们展示了提示微调随着规模的增加变得更加具有竞争力:当模型参数超过数十亿时,我们的方法“缩小了差距”并达到了模型微调(即调整所有模型权重)的强大性能 input和target,则使用原始的input embedding(5) 使用方式离散和连续template token混合时,显示地插入一下anchor(离散的token)有助于template的优化(6) ,无需verbalizer(4) 特点在小、大模型上,效果均优于P-tuning。 当参数量达10B,效果相当于FT6.LoRA(2021)(1) 论文信息来自论文:《LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS》(2)摘要自然语言处理的一个重要范式包括在通用领域数据上进行大规模预训练 Model),学习目标为而加入LoRA后,学习目标为:(6) 配置在多个部位$(Q/K/V/Output)$同时添加$\bigtriangleup W$ ,会比只在单一部分上添加权重$\bigtriangleup

    3.6K00编辑于 2025-05-08
  • 来自专栏啄木鸟软件测试

    多模态大模型技术原理及实战(6)

    中小型公司大模型构建之路 如何选择 自己建立 二次开发 重新训练,消耗非常巨大 现有的大模型体系已经非常丰富 对话大模型已经白热化 •三天产生一个小应用 •两天产生一个新模型 中小公司的技术实力相对薄 AdaLoRA Qingru Zhang 等人 AdaLoRA技术采用了一种有效的策略来调整增量阵的分配 在增量更新中使用奇异值分解进行参数化,并基于重要性指标去除不重要的奇异值,同时保留奇异向量 ,需要剔除冗余参数以提高模型训练效率。 步骤 •1、训练一个原始模型,该模型具有较高的性能但运行速度较慢。 •2、确定哪些参数对输出结果的贡献较小,并将其设置为零。 分类 •非结构化剪枝 •使用技术A或B的一个或多个通道 •A 滤波 •B 权重矩阵 •分类 •权值剪枝 •神经元剪枝 •结构化剪枝 •又名:滤波器剪枝 •分类 •Filter-wise •Channel-wise

    41410编辑于 2024-09-10
  • 来自专栏帅云霓的技术小屋

    大模型与AI底层技术揭秘 (6) 分割与征服

    所谓的分治,就是将一个大而复杂的问题,拆分为小而容易解决的问题。

    51820编辑于 2023-10-25
  • 来自专栏IT从业者张某某

    大语言模型-1.2-大模型技术基础

    简介 1.2 大模型技术基础 大语言模型 预训练阶段会得到base model,本质上就是一个互联网文本模拟器,这个阶段需要上万台服务器训练几个月的时间,这个生成的模型可以认为是互联网的有损压缩。 Scaling Law) ➢ 通过扩展参数规模、数据规模和计算算力,大语言模型的能力会出现显著提升 ➢ 扩展定律在本次大模型浪潮中起到了重要作用 大语言模型采用了与小型预训练语言模型相似的神经网络结构 进一步,利用约束条件 ≈ 6 对于损失函数 (, ) 进行推导,能够获得算力资源固定情况下模型规 模与数据规模的最优分配方案(如下所示): 深入讨论扩展定理 ➢ 模型的语言建模损失可以进行下述分解 ,从而获得更可靠的答案 涌现能力与扩展定律的关系 ➢ 涌现能力和扩展定律是两种描述规模效应的度量方法 大模型核心技术 ➢ 规模扩展:扩展定律奠定了早期大模型的技术路线,产生了巨大的性能提升 需要设计对齐技术减少模型使用风险,并进一步提升模型性能 ➢ 工具使用:使用外部工具加强模型的弱点,拓展其能力范围

    87010编辑于 2025-03-15
  • 来自专栏云数据库技术

    大语言模型技术原理

    除了自然语言本身的优势外,语境的上下文学习能力、迁移学习和文字总结能力也有很大的发挥空间,带着这些思考,我们有必要了解一下大语言模型背后的发展及其技术原理。 一、大语言模型的发展 大语言模型作为一个被验证可行的方向,其“大”体现在训练数据集广,模型参数和层数大,计算量大,其价值体现在通用性上,并且有更好的泛化能力。 1.6 当前的技术局限性 专业的领域,缺乏语料训练的情况下,GPT无法生成合适的回答。 可信度问题,缺乏答案的具体来源。 时效性问题,大模型底层训练数据是过往数据,再一次训练的成本很高。 编码组件和解码组件可以有很多层,比如Google刚提出时的论文用的是6层,后面GPT-1是12层,然后到GPT-3是96层。 最后,大语言模型作为一个被验证可行的方向,其“大”体现在数据集广泛,参数和层数大,计算量大,其价值体现在通用性上,有广泛的应用场景。

    2.6K46编辑于 2023-05-30
  • 来自专栏Java技术

    AI技术和大模型技术LLM

    -CoderOilStation(程序员编程助手科技股份有限责任公司)AI技术和大模型技术LLM人工智能技术AI是美国高等院校哈佛大学的一种原型框架技术。AI技术西方和全球的部署研发和运用。 AI人工智能引领全球技术的更新和迭代监控不同的区域。相信知识不要服从于命运。美国麻省理工学院MIT会同步不同的领域模型驱动技术DDD(DomainDrivenDesign)。 领域模型驱动技术西方发达社会更注重不同想法和设计的美学应用。协会institute是定义技术标准的国际性知识传播组织。亚洲的工程师杰作Agent智能体应用于基本的搜索应用和广告商品推荐。 私有用户和公众的开放平台用户一小一大意味着平台的设计开始运行正常。大模型LLM(LargeLanguageModel)模型开放基础框架的模型搭建方式。很多的应用逻辑都是有编程范式和编程方法学。

    31510编辑于 2026-03-08
  • 来自专栏6G

    6G,AI , 与大模型?

    6G与AI融合的未来方向 6G 网络的内生 AI 设计将赋能网络的AI大模型,同时使网络能够支持 AI 大模型的训练和服务。 6G 网络将承担数据采集、预处理等数据服务,为云AI训练提供更好的支持。此外,6G 网络的分布式部署将使得 AI 大模型更靠近用户侧,从而在时延方面具有潜在优势。 在数据获取和处理方面,与 ChatGPT 不同,网络中存在大量结构化数据,且网络不同问题间的共性不清晰,网络 AI 大模型面临较大挑战。6G 网络面临如何有效采集适合AI大模型训练的数据的挑战。 而在构建 AI 大模型的路径上,需要分阶段探索,从离线小规模模型开始,逐步过渡到实时大规模模型,最终实现统一的网络 AI 大模型。 本文摘自于中国移动的“6G内生AI架构及AI大模”汇报材料。 5G大规模天线技术及空口技术 天线理论及5G天线介绍 6G新天线技术

    59410编辑于 2024-04-24
  • 来自专栏澜舟科技 NLP

    大模型落地实践:同花顺大模型技术应用及优化

    文内从业务角度介绍了大模型技术在同花顺业务上的应用以及未来探索的方向。众所周知,大模型参数量大,通用能力强,综合性能好。 所以最初在业务角度并不够重视,然而近期随着大模型技术的快速发展,我们也在逐步尝试将大模型在业务中落地,目前大模型在自然语言处理相关的业务里都取得了比传统模型更优的效果,下面详细介绍相关工作。 确实在我们的业务模型里,规则占比非常大,也是因为涉及用户财产问题,技术上会比较保守。下面具体介绍问答系统里大模型应用的经验和取得的成果。 Continue-Train为了进一步提升大模型在实际业务中的效果,同花顺与澜舟科技合作,引入孟子Mengzi 模型中的技术 ,针对大模型进行 Continue-Train 训练,让模型更适用于金融相关的 总结大模型技术在同花顺业务中的应用基本都有比较好的通用性,并且带来了比较好的性能提升,我们也希望在医疗、法律、教育等领域的子公司业务中推广,同时和澜舟科技以及学术界的老师们合作,把大模型用得更好,谢谢大家

    3.4K20编辑于 2022-08-11
  • 大模型的2025:6个关键洞察

    而到了2025年,基于可验证奖励的强化学习脱颖而出,成为该技术组合中事实上的核心新阶段。通过在数学、代码谜题等大量可自动验证奖励的环境中训练大语言模型,模型会自发形成人类视角下近似“推理”的策略。 OpenAI在2024年底推出的o1模型是可验证奖励强化学习技术的首次公开亮相,而2025年初o3模型的发布才成为明确的拐点。直到这时,人们能直观感受到大语言模型能力的质性飞跃。 大语言模型技术栈的所有组成部分:神经网络架构、训练数据、训练算法,尤其是优化目标,都与生物智能的演化逻辑截然不同。 这印证了我此前在《权力归于人民》(Power to the people")中的观点:大语言模型正在逆转技术普及的传统逻辑。 与以往所有技术不同,普通人从大语言模型中获得的收益,远超过专业人士、企业与政府。氛围编程不仅赋予普通人技术创作权,也让专业开发者能够高效实现原本因技术门槛或成本问题不会尝试的软件项目。

    94910编辑于 2025-12-24
  • 来自专栏京东技术

    大模型技术及趋势总结

    图片来源 https://blog.csdn.net/Ares_song/article/details/106880658 6. 2017年:Transformer和自注意力机制 ◦2017年,Transformer •对模型进行加固,提高其抗攻击能力。 •采用加密存储和差分隐私技术来保护数据隐私。 •增强模型的可解释性,以便更好地理解和控制模型行为。 之所以叫zero-shot,是因为我们直接用大模型做任务而不给其参考示例。这也被视为评测大模型能力的重要场景之一。 RAG(Retrieval-Augmented Generation) 什么是RAG ‍RAG(Retrieval-Augmented Generation)技术是一种结合检索和生成的方法,用于提升大语言模型 多模态大模型是人工智能领域的重要进展,它们通过整合多种类型的数据,显著提升了模型的表现力和鲁棒性。这不仅使得人工智能系统能够更好地理解复杂的现实世界,也为未来的技术发展带来了无限可能。

    1.1K10编辑于 2024-07-04
  • 大模型技术之Python基础

    Python,作为人工智能时代的通用语言,正是连接大模型技术与商业价值的那座桥梁。用 Python 基础打底,不仅能让你学得更稳,更能让你在变现之路上跑得更快。 一、 穿透技术黑盒,从“调包侠”进阶为“应用构建者”在当前的大模型应用层开发中,Python 占据着绝对统治地位。 三、 驾驭 AI 生态工具,构建不可替代的职场护城河大模型技术迭代极快,今天流行 LangChain,明天可能就有新的框架出现。 结语AI 时代,机会属于那些既能仰望星空懂技术,又能脚踏实地写代码的人。Python 不是大模型学习的障碍,而是助飞的翅膀。 与其在概念的海洋中漂浮,不如沉下心来,用 Python 基础打底,构建起坚实的技术底座。当你用一行行代码将大模型转化为解决实际问题的产品时,你会发现,变现不再是焦虑的等待,而是水到渠成的必然。

    26810编辑于 2026-03-20
  • 来自专栏架构之巅

    大模型相关技术-初识RAG

    简单来讲就是让用户的问题先经过一个提前预置的专业知识库,先检索知识库,将知识库的响应提交给大模型,让大模型总结输出,或者直接就输出了,不经过大模型总结。 为什么需要RAG 大模型在没有答案的情况下提供幻象数据,也就是胡说八道。 当用户需要特定的当前响应时,提供过时或通用的信息,模型提供的最新信息为训练模型时的数据。 图片 向量(vector)是在大语言模型、知识库交互、计算过程中的重要指标。它可以将文本和知识表示为数学向量,实现文本相似度计算、知识库检索和推理等功能。 是的,整体的流程是和es类似,哪思考一个问题为 什么不用es,反而用这么复杂的模型来实现呢? - 哔哩哔哩 (bilibili.com) 我正在参与2024腾讯技术创作特训营最新征文,快来和我瓜分大奖!

    86441编辑于 2024-04-28
  • 来自专栏啄木鸟软件测试

    大模型测试:技术深度解析

    与此同时,传统软件测试范式——基于明确输入/输出断言、覆盖路径与边界值的方法——在大模型面前频频失效。 这些案例揭示一个现实:大模型测试不是‘加个Prompt跑几轮’,而是一场融合认知科学、统计推断、对抗攻防与领域知识的系统工程。 一、为何传统测试方法在大模型面前失灵? 根本原因在于大模型的三大非确定性特征: 1)输出不可重现性:相同Prompt在不同温度(temperature)、采样策略(top-p)或微调版本下,可能生成语义一致但结构迥异的回答,甚至逻辑矛盾; 二、大模型测试的四维技术框架 业界领先实践已形成可落地的四维测试体系: ✅ 1. 三、实战案例:某省级政务大模型的测试攻坚 该模型需支撑12345热线智能分派与政策解读。

    40600编辑于 2026-06-15
  • 来自专栏xiaosen

    大模型Prompt-Tuning技术入门

    」的范式,如Bert+fine-tuning的NLP任务,相比于第二范式,模型准确度显著提高,模型也随之变得更大,但小数据集就可训练出好模型; 第四范式:基于「预训练模型+Prompt+预测」的范式,如 4 Prompt-Tuning技术发展历程 Prompt-Tuning自GPT-3被提出以来,从传统的离散、连续的Prompt构建、走向面向超大规模模型的In-Context Learning、Instruction-tuning 因此我们总结人工设计方法的缺陷: 采用人工构建的方法成本高,需要与领域任务相关的先验知识; 人工设计的Pattern和Verbalizer不能保证获得最优解,训练不稳定,不同的PVP对结果产生的差异明显,方差大; )方法为每一个输入文本假设一个固定前缀提示,该提示表由神经网络参数化,并在下游任务微调时进行更新,整个过程中预训练的大模型参数被冻结。 Prompt Tuning特点: 优点: 大模型的微调新范式 模型参数规模大了之后,可以将大模型参数固定,指定附加参数来适配下游任务,而且适配性能基本和全参数微调相当。

    1.7K30编辑于 2024-06-05
  • 来自专栏猫头虎博客专区

    ChatGLM-6B 大模型的前世今生

    结合模型量化技术,用户可以在消费级的显卡上进行本地部署(INT4 量化级别下最低只需 6GB 显存)。 ChatGLM-6B 使用了和 ChatGPT 相似的技术,针对中文问答和对话进行了优化。 经过约 1T 标识符的中英双语训练,辅以监督微调、反馈自助、人类反馈强化学习等技术的加持,62 亿参数的 ChatGLM-6B 已经能生成相当符合人类偏好的回答,更多信息请参考我们的博客。 ChatGLM-6B 开源模型旨在与开源社区一起推动大模型技术发展,恳请开发者和大家遵守开源协议,勿将开源模型和代码及基于开源项目产生的衍生物用于任何可能给国家和社会带来危害的用途以及用于任何未经过安全评估和备案的服务 更长的上下文:基于 FlashAttention 技术,我们将基座模型的上下文长度(Context Length)由 ChatGLM-6B 的 2K 扩展到了 32K,并在对话阶段使用 8K 的上下文长度训练 更高效的推理:基于 Multi-Query Attention 技术,ChatGLM2-6B 有更高效的推理速度和更低的显存占用:在官方的模型实现下,推理速度相比初代提升了 42%,INT4 量化下,6G

    1.7K10编辑于 2024-04-08
  • 大模型技术之Linux及Shell

    大模型环境搭建靠 Linux,技能越硬,升职加薪越快在人工智能浪潮席卷全球的今天,大模型(LLM)已然成为技术圈最耀眼的明珠。 那些能够深入 Linux 底层,熟练驾驭大模型环境搭建的工程师,正在用最“硬核”的基础能力,通过技术杠杆,撬动着职场升职加薪的最快路径。 然而,大模型时代的到来,为 Linux 教育赋予了全新的现实意义。大模型的训练与推理,对计算资源有着极致的渴求。 如果你不懂得如何通过 Linux 参数优化内核性能,不懂得如何排查环境依赖的深层错误,那么面对大模型这一庞然大物,你只能停留在“会调用”的浅层,无法触及技术的内核。 二、 祛魅与实战:环境搭建能力检验真功夫在当下的技术培训市场中,充斥着各种“速成”课程,鼓吹几行代码即可玩转大模型。这种教育泡沫掩盖了真实的工程难度。然而,真正到了企业级的生产环境,情况截然不同。

    30610编辑于 2026-03-20
  • 来自专栏深度学习与python

    Hugging Face 大语言模型优化技术

    作者 | Sergio De Simone 译者 | 明知山 策划 | 丁晓昀 大语言模型的生产部署存在两个主要的挑战,一个是需要大量的参数,一个是需要处理非常长的用于表示上下文信息的输入序列 Hugging Face 基于他们提供大模型服务的经验分享了一些克服这些障碍的技术。 大语言模型需要大量的 VRAM 来加载,从几十 (bigcode/starcoder) 到数百 GB (Llama、Bloom、GPT3)。 在生产环境中部署大语言模型的第三项优化措施是选择正确的架构,让它们能够有效地处理长文本输入。 位置嵌入通过将每个标记的位置编码为数字表示来帮助语言大模型理解序列顺序。对于需要处理大型文本输入任务的大语言模型,应该使用 RoPE 和 ALiBi 等相对位置嵌入技术进行训练。

    57610编辑于 2023-10-09
  • 来自专栏运维开发王义杰

    AI: 了解大模型降维技术

    在大模型开发过程中,降维是一个关键的步骤。它可以帮助我们处理和分析高维数据,降低计算复杂度,提高模型性能。下面,我们将详细介绍降维的基本概念、常用方法以及在大模型开发中的应用。 主成分分析(PCA) 主成分分析是一种线性降维技术,通过将数据投影到方差最大的方向上,找到数据的主成分,从而实现降维。 三、降维在大模型开发中的应用 在大模型开发过程中,降维可以在以下几个方面发挥重要作用: 1. 可视化 降维技术,如t-SNE,可以将高维数据投影到二维或三维空间,便于我们进行数据可视化和探索。这有助于我们理解数据的分布和结构,发现数据中的模式和异常。 四、总结 降维是大模型开发过程中不可或缺的一部分。通过适当的降维技术,我们可以有效地处理高维数据,提高模型的性能和稳定性。

    91210编辑于 2024-07-10
  • 来自专栏防止网络攻击

    大模型技术的发展与实践

    GPT系列大体经历了如下6个发展阶段(下图上一行),最新的版本是GPT-4,目前一直在迭代优化中。 ,或者有更先进、更厉害的模型出现了),下面图2是截止到2023年6月底国内外重要的大模型的发展脉络。 既然大家都这么看好大模型技术,那么大模型的价值体现在什么地方呢? 五、总结与体会 我们对大模型相关的发展历史、openAI技术的发展脉络、当前国内外主流的大语言模型进行了简单的介绍,同时针对大模型区别于之前模型的核心技术原理进行了简单讲解,本章提到的预训练、指令微调、 未来大模型一定会革新所有的行业和场景的。读者需要对大模型相关的技术及行业、场景应用保持敏感,在工作中要将大模型相关的技术用起来。

    2.8K10编辑于 2023-12-05
  • 来自专栏xiaosen

    大模型Prompt-Tuning技术进阶

    超大规模模型进入新的纪元,而这些轰动世界的产物,离不开强大的Prompt-Tuning技术。 Instruction-Tuning(指令学习) 面向超大规模模型第二个Prompt技术是指令学习。 CoT 做的就是这件事 类似的算术题,思维链提示会在给出答案之前,还会自动给出推理步骤: “罗杰先有5个球,2盒3个网球等于6个,5 + 6 = 11” “食堂原来有23个苹果,用了20个, 23-20=3;又买了6个苹果,3+6=9 上述例子证明了思维链提示给出了正确答案,而直接给出答案的传统提示学习,结果是错的,连很基本的数学计算都做不好。 PEFT(大模型参数高效微调) 目前在工业界应用大模型主流方式:参数高效微调方法(Parameter-Efficient Fine-Tuning,PEFT),PEFT 方法仅微调少量或额外的模型参数,固定大部分预训练参数

    1.1K10编辑于 2024-06-06
领券