首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏啄木鸟软件测试

    多模态模型技术原理与实战(3)

    ·深度学习时代(2010-2019年):多模态技术快速发展,这主要得益于以下3点: o算力快速发展。 o新的多模态数据集层出不穷。 o语言特征提取能力和视觉特征提取能力快速提高。 跨模态 典型应用领域是跨模态检索,例如通过文本检案图像、通文本检索视频等公共空间特征学习拉术跨模态相似性检索技术 多模态模型发展的重大里程碑 大规模预训练模型的最大优势就是在预训练的过程中经过了大批量数据的训练 ·CLIP模型:CLIP模型是OpenAI在2021 年推出的文本-图像多模态预训练模型。证明了“多模态预训练模型零样本推理”这种模式的可行性。 模型+多模态的3种实现方法 1,以LLM 为核心,调用其他多模态组件 2023年5月,微软亚洲研究院(MSRA)联合浙江大学发布了HuggingGPT。 3.视觉问答任务 视觉问答任务指的是根据图像或视频中描述的内容进行回答、体现了多楼态模型的自然语言理解和推理能力。 这个城市拥有哪些著名大学? 上海是中国著名的现代化城市,拥有多所知名大学。

    1.4K20编辑于 2024-09-10
  • 来自专栏韩曙亮的移动开发专栏

    【AI 模型】Meta Llama 3 模型 ( Llama 3 模型简介 | Ollama 软件下载安装 | Llama3 模型下载 | Llama 3 模型 在线 离线 使用 )

    首先 , 安装 Ollama 软件 , 到 https://ollama.com/ 下载安装 ; 然后 , 运行 ollama run llama3 命令 , 即可开始使用 Llama3 模型 ; 一 、Meta Llama 3 模型安装 1、Llama 3 模型简介 Llama 3 模型 是 Meta 公司 发布的 模型 , Meta 公司 就是 Facebook ; Llama 3 模型 Llama3 模型 ; 下载的模型放在了 C:\Users\用户名.ollama 目录中 , 在我的电脑上的路径是 C:\Users\octop.ollama ; 这个模型很大 , 有 4.7 G 安装完成后的效果 for help) 二、Meta Llama 3 模型使用 1、Llama 3 模型在线使用 在命令行中 , 可以直接进行对话 , 下面是对话内容 : D:\Llama>ollama run llama3 for help) 2、Llama 3 模型离线使用 Llama 3 模型 联网时 , 可以访问云端服务 , 可以生成更加丰富的文本 ; Llama 3 模型 在 断网后也可以使用 , 下面是断开网络后

    2K12编辑于 2024-08-09
  • 来自专栏IT从业者张某某

    语言模型-1.2-模型技术基础

    简介 1.2 模型技术基础 语言模型 预训练阶段会得到base model,本质上就是一个互联网文本模拟器,这个阶段需要上万台服务器训练几个月的时间,这个生成的模型可以认为是互联网的有损压缩。 构建一个语言模型 语言模型预训练(Pre-training) 使用与下游任务无关的大规模数据进行模型参数的初始训练 ➢ 基于Transformer解码器架构,进行下一个词预测 ➢ 数据数量、数据质量都非常关键 Scaling Law) ➢ 通过扩展参数规模、数据规模和计算算力,语言模型的能力会出现显著提升 ➢ 扩展定律在本次大模型浪潮中起到了重要作用 语言模型采用了与小型预训练语言模型相似的神经网络结构 ,从而获得更可靠的答案 涌现能力与扩展定律的关系 ➢ 涌现能力和扩展定律是两种描述规模效应的度量方法 模型核心技术 ➢ 规模扩展:扩展定律奠定了早期模型技术路线,产生了巨大的性能提升 需要设计对齐技术减少模型使用风险,并进一步提升模型性能 ➢ 工具使用:使用外部工具加强模型的弱点,拓展其能力范围

    78010编辑于 2025-03-15
  • 来自专栏云数据库技术

    语言模型技术原理

    除了自然语言本身的优势外,语境的上下文学习能力、迁移学习和文字总结能力也有很大的发挥空间,带着这些思考,我们有必要了解一下语言模型背后的发展及其技术原理。 一、语言模型的发展 语言模型作为一个被验证可行的方向,其“”体现在训练数据集广,模型参数和层数,计算量大,其价值体现在通用性上,并且有更好的泛化能力。 GPT3就通过调参数(1750亿)来测试in-context 学习能力,并在没有finetune情况下得到以下数据。 1.6 当前的技术局限性 专业的领域,缺乏语料训练的情况下,GPT无法生成合适的回答。 可信度问题,缺乏答案的具体来源。 时效性问题,模型底层训练数据是过往数据,再一次训练的成本很高。 GPT3训练后的语言模型是根据概率分布,计算出下一个最大可能的词,他不管事实逻辑上的准确性,也没有所谓的意识,所以有时会一本正经地胡说八道。

    2.5K45编辑于 2023-05-30
  • 来自专栏Java技术

    AI技术模型技术LLM

    -CoderOilStation(程序员编程助手科技股份有限责任公司)AI技术模型技术LLM人工智能技术AI是美国高等院校哈佛大学的一种原型框架技术。AI技术西方和全球的部署研发和运用。 AI人工智能引领全球技术的更新和迭代监控不同的区域。相信知识不要服从于命运。美国麻省理工学院MIT会同步不同的领域模型驱动技术DDD(DomainDrivenDesign)。 领域模型驱动技术西方发达社会更注重不同想法和设计的美学应用。协会institute是定义技术标准的国际性知识传播组织。亚洲的工程师杰作Agent智能体应用于基本的搜索应用和广告商品推荐。 私有用户和公众的开放平台用户一小一意味着平台的设计开始运行正常。模型LLM(LargeLanguageModel)模型开放基础框架的模型搭建方式。很多的应用逻辑都是有编程范式和编程方法学。

    29010编辑于 2026-03-08
  • 来自专栏AI科技评论

    别再说国产模型技术突破要靠 Llama 3 开源了

    开源本身是一件致力于打破技术垄断、有利于促进整个行业不断进步、带来创新的事情,但每次Meta一开源,从Llama 到 Llama 3,国产模型都要经历一次来自国人的嘲讽和贬低。 而这也让诸如“Llama 3 发布,国内模型又能有新突破了”“国内要想赶超GPT-4,就等着 Llama 3 开源吧”的技术不自信论调,不攻自破。 对此,智谱AI开发了名为ChatGLM-RLHF的技术,通过整合人类的偏好来训练语言模型,使其产生更受欢迎的回答。 最后,智谱的模型技术和学术研究都转化成了商业化成果。 同样,经过过去一年的奋力追赶和学习,如GLM-4、文心一言这样的国产模型打败了最强开源模型Llama 3,跻身全球竞争第一梯队,为只会跟随、模仿的国产技术正名。 过去一直强调要睁开眼看世界,学习国外,但模型时代,看看国产模型过去一年的变化,我们更多缺少的是正视国产技术的进步。

    92010编辑于 2024-05-06
  • 来自专栏开源项目搭建

    简单3步部署本地国产模型DeepSeek模型

    简单3步部署本地国产模型DeepSeek模型DeepSeek是最近非常火的开源模型,国产模型 DeepSeek 凭借其优异的性能和对硬件资源的友好性,受到了众多开发者的关注。 本文将介绍如何通过简单 3 步在本地部署 DeepSeek 模型,让你能够轻松体验这一强大的 AI 工具。 推动全球AI技术发展提供技术思路:在模型架构、算法等方面实现了多项创新,如采用创新性的混合专家架构等,为全球AI研究人员提供了新的思路。 deepseek-r1的哪个版本的模型? 它支持各种LLM,包括Llama 3、Mistral和Gemma。提供了类似OpenAI的API接口和聊天界面,可以非常方便地部署最新版本的GPT模型并通过接口使用。

    7K33编辑于 2025-02-06
  • 来自专栏澜舟科技 NLP

    模型落地实践:同花顺模型技术应用及优化

    文内从业务角度介绍了模型技术在同花顺业务上的应用以及未来探索的方向。众所周知,模型参数量大,通用能力强,综合性能好。 所以最初在业务角度并不够重视,然而近期随着模型技术的快速发展,我们也在逐步尝试将模型在业务中落地,目前模型在自然语言处理相关的业务里都取得了比传统模型更优的效果,下面详细介绍相关工作。 确实在我们的业务模型里,规则占比非常,也是因为涉及用户财产问题,技术上会比较保守。下面具体介绍问答系统里模型应用的经验和取得的成果。 Continue-Train为了进一步提升模型在实际业务中的效果,同花顺与澜舟科技合作,引入孟子Mengzi 模型中的技术 ,针对模型进行 Continue-Train 训练,让模型更适用于金融相关的 比如“用户问句相似问生成”这个任务,我们用到了知识蒸馏技术,将 10 层以上的模型蒸馏成 3 层的小模型,性能上会有很大的提升,同时保证准确率不会有大幅下降的情况,GPT2-chinese-12 层单样本

    3.3K20编辑于 2022-08-11
  • 来自专栏京东技术

    模型技术及趋势总结

    后门攻击:在模型中植入后门,使得在特定触发条件下模型表现出异常行为。 3. 成员推断攻击:攻击者尝试推断出训练集中是否包含特定的数据点。 4. 模型窃取:通过查询模型来复制其功能,侵犯模型版权。 •对模型进行加固,提高其抗攻击能力。 •采用加密存储和差分隐私技术来保护数据隐私。 •增强模型的可解释性,以便更好地理解和控制模型行为。 RAG(Retrieval-Augmented Generation) 什么是RAG ‍RAG(Retrieval-Augmented Generation)技术是一种结合检索和生成的方法,用于提升语言模型 自动驾驶:多模态模型可以结合摄像头图像、雷达数据和GPS信息,帮助自动驾驶汽车更好地理解周围环境,提高安全性。 3. 多模态模型是人工智能领域的重要进展,它们通过整合多种类型的数据,显著提升了模型的表现力和鲁棒性。这不仅使得人工智能系统能够更好地理解复杂的现实世界,也为未来的技术发展带来了无限可能。

    1.1K10编辑于 2024-07-04
  • 模型技术之Python基础

    Python,作为人工智能时代的通用语言,正是连接模型技术与商业价值的那座桥梁。用 Python 基础打底,不仅能让你学得更稳,更能让你在变现之路上跑得更快。 一、 穿透技术黑盒,从“调包侠”进阶为“应用构建者”在当前的模型应用层开发中,Python 占据着绝对统治地位。 三、 驾驭 AI 生态工具,构建不可替代的职场护城河模型技术迭代极快,今天流行 LangChain,明天可能就有新的框架出现。 结语AI 时代,机会属于那些既能仰望星空懂技术,又能脚踏实地写代码的人。Python 不是模型学习的障碍,而是助飞的翅膀。 与其在概念的海洋中漂浮,不如沉下心来,用 Python 基础打底,构建起坚实的技术底座。当你用一行行代码将模型转化为解决实际问题的产品时,你会发现,变现不再是焦虑的等待,而是水到渠成的必然。

    24110编辑于 2026-03-20
  • 来自专栏大模型&AIGC

    6种模型微调技术

    最后,我们展示了使用软提示条件化冻结模型在提高域迁移鲁棒性和实现高效“提示集成”方面的优势。(3)思路固定预训练LLM的参数,为每一个任务额外添加一个或多个embedding。 之后拼接query正常输入LLM,并只训练这些embedding(4) 特点效果优于GPT-3的few-shot learning当模型参数量达100亿时,接近于全模型微调效果4.P-tuning(2021 我们提出了一个新颖的实验发现:经过适当优化的提示微调可以在广泛的模型规模和NLU任务中普遍有效。它在性能上与微调相当,但仅需要调整0.1%-3%的参数。 ,无需verbalizer(4) 特点在小、模型上,效果均优于P-tuning。 随着我们预训练更大的模型,全面微调(即重新训练所有模型参数)变得不太可行。以GPT-3 175B为例,部署独立的微调模型实例,每个实例都有175B参数,成本是极其昂贵的。

    3.3K00编辑于 2025-05-08
  • 来自专栏啄木鸟软件测试

    模型测试:技术深度解析

    这些案例揭示一个现实:模型测试不是‘加个Prompt跑几轮’,而是一场融合认知科学、统计推断、对抗攻防与领域知识的系统工程。 一、为何传统测试方法在模型面前失灵? 二、模型测试的四维技术框架 业界领先实践已形成可落地的四维测试体系: ✅ 1. ✅ 3. 系统集成层测试(System-in-Context Validation)测试模型在真实业务流水线中的表现。例如,在电商推荐系统中,需验证:RAG检索模块返回的文档是否被LLM准确引用? 三、实战案例:某省级政务模型的测试攻坚 该模型需支撑12345热线智能分派与政策解读。 未来三年,我们认为三个方向将重塑测试范式: (1)测试即服务(TaaS)平台兴起,提供开箱即用的幻觉检测、偏见审计API; (2)测试数据生成从人工编写迈向‘模型自生成—人工校验’闭环; (3)监管合规测试

    28200编辑于 2026-06-15
  • 来自专栏架构之巅

    模型相关技术-初识RAG

    简单来讲就是让用户的问题先经过一个提前预置的专业知识库,先检索知识库,将知识库的响应提交给模型,让模型总结输出,或者直接就输出了,不经过大模型总结。 为什么需要RAG 模型在没有答案的情况下提供幻象数据,也就是胡说八道。 当用户需要特定的当前响应时,提供过时或通用的信息,模型提供的最新信息为训练模型时的数据。 图片 向量(vector)是在语言模型、知识库交互、计算过程中的重要指标。它可以将文本和知识表示为数学向量,实现文本相似度计算、知识库检索和推理等功能。 是的,整体的流程是和es类似,哪思考一个问题为 什么不用es,反而用这么复杂的模型来实现呢? - 哔哩哔哩 (bilibili.com) 我正在参与2024腾讯技术创作特训营最新征文,快来和我瓜分大奖!

    82941编辑于 2024-04-28
  • 来自专栏Soul Joy Hub

    模型AIGC系列课程 3-2】国产开源模型:ChatGLM

    GLM https://arxiv.org/pdf/2103.10360.pdf GLM是General Language Model的缩写,是一种通用的语言模型预训练框架。 这个图示说明了GLM预训练的过程,具体解释如下: a) 原始文本:给定一个原始文本,例如[x1, x2, x3, x4, x5, x6]。 在这个例子中,我们随机选择了两个连续的词片段[x3]和[x5, x6]作为样本。 b) 替换和洗牌:在Part A中,我们将被选择的词片段替换为[M](表示遮盖)。 在这个例子中,我们将[x3]和[x5, x6]洗牌为[x5, x6]和[x3]。 c) 自回归生成:GLM使用自回归的方式生成Part B。 在生成过程中,模型可以根据之前生成的词片段和Part A中的上下文来预测下一个词片段。 d) 自注意力掩码:为了限制模型的注意力范围,

    93120编辑于 2023-08-28
  • 来自专栏帅云霓的技术小屋

    模型与AI底层技术揭秘 (3) 圆周率里的奥秘

    在上一期,我们了解到简单的GPU发展史,它实际上来自3D游戏的计算需求,具备三角形投影及像素填充能力。

    72840编辑于 2023-10-08
  • 来自专栏xiaosen

    模型Prompt-Tuning技术入门

    至此,以GPT3、PET等为首的模型提出一种基于预训练语言模型的新的微调范式–Prompt-Tuning.该方法的目的是通过添加模板的方法来避免引入额外的参数,从而让模型可以在小样本(few-shot) 这时候屏幕上会出现一些提示词比如3个字,水果,那岂不是好猜一点了嘛,毕竟3个字的水果也不多呀。 4 Prompt-Tuning技术发展历程 Prompt-Tuning自GPT-3被提出以来,从传统的离散、连续的Prompt构建、走向面向超大规模模型的In-Context Learning、Instruction-tuning )方法为每一个输入文本假设一个固定前缀提示,该提示表由神经网络参数化,并在下游任务微调时进行更新,整个过程中预训练的模型参数被冻结。 Prompt Tuning特点: 优点: 模型的微调新范式 模型参数规模了之后,可以将模型参数固定,指定附加参数来适配下游任务,而且适配性能基本和全参数微调相当。

    1.6K30编辑于 2024-06-05
  • 来自专栏深度学习与python

    Hugging Face 语言模型优化技术

    作者 | Sergio De Simone 译者 | 明知山 策划 | 丁晓昀 语言模型的生产部署存在两个主要的挑战,一个是需要大量的参数,一个是需要处理非常长的用于表示上下文信息的输入序列 Hugging Face 基于他们提供模型服务的经验分享了一些克服这些障碍的技术语言模型需要大量的 VRAM 来加载,从几十 (bigcode/starcoder) 到数百 GB (Llama、Bloom、GPT3)。 在生产环境中部署语言模型的第三项优化措施是选择正确的架构,让它们能够有效地处理长文本输入。 位置嵌入通过将每个标记的位置编码为数字表示来帮助语言模型理解序列顺序。对于需要处理大型文本输入任务的语言模型,应该使用 RoPE 和 ALiBi 等相对位置嵌入技术进行训练。

    54910编辑于 2023-10-09
  • 模型技术之Linux及Shell

    模型环境搭建靠 Linux,技能越硬,升职加薪越快在人工智能浪潮席卷全球的今天,模型(LLM)已然成为技术圈最耀眼的明珠。 那些能够深入 Linux 底层,熟练驾驭模型环境搭建的工程师,正在用最“硬核”的基础能力,通过技术杠杆,撬动着职场升职加薪的最快路径。 然而,模型时代的到来,为 Linux 教育赋予了全新的现实意义。模型的训练与推理,对计算资源有着极致的渴求。 如果你不懂得如何通过 Linux 参数优化内核性能,不懂得如何排查环境依赖的深层错误,那么面对模型这一庞然物,你只能停留在“会调用”的浅层,无法触及技术的内核。 二、 祛魅与实战:环境搭建能力检验真功夫在当下的技术培训市场中,充斥着各种“速成”课程,鼓吹几行代码即可玩转模型。这种教育泡沫掩盖了真实的工程难度。然而,真正到了企业级的生产环境,情况截然不同。

    27010编辑于 2026-03-20
  • 来自专栏防止网络攻击

    模型技术的发展与实践

    语言模型是一种深度学习模型,特别是属于自然语言处理(NLP)的领域,一般是指包含数干亿(或更多)参数的语言模型,这些参数是在大量文本数据上训练的,例如模型GPT-3,PaLM,LLaMA等,语言模型的目的是理解和生成自然语言 3、预训练技术 其中k是上下文窗口的大小,条件概率P使用参数为θ的神经网络建模。这些参数使用随机梯度下降法进行训练。 总的来说,它通过预训练和生成技术,以及Transformer的自注意力机制,来理解和生成人类的自然语言。 GPT-3是一个特别的模型,因为它有1750亿个参数。 这些参数使得GPT-3在处理语言任务时表现出强大的能力,例如:理解和生成自然语言文本、进行有深度和上下文的对话等。所以,可以说GPT-3模型的一个具体应用,显示了模型的强大能力和可能性。 未来模型一定会革新所有的行业和场景的。读者需要对模型相关的技术及行业、场景应用保持敏感,在工作中要将模型相关的技术用起来。

    2.7K10编辑于 2023-12-05
  • 来自专栏运维开发王义杰

    AI: 了解模型降维技术

    模型开发过程中,降维是一个关键的步骤。它可以帮助我们处理和分析高维数据,降低计算复杂度,提高模型性能。下面,我们将详细介绍降维的基本概念、常用方法以及在模型开发中的应用。 3. 核PCA(Kernel PCA) 核PCA是一种非线性降维技术,通过核技巧将数据映射到高维空间,然后在高维空间中进行PCA。这种方法能够处理复杂的非线性数据,但计算复杂度较高。 三、降维在模型开发中的应用 在模型开发过程中,降维可以在以下几个方面发挥重要作用: 1. 模型优化 降维可以帮助我们简化模型结构,降低模型的复杂度,减少过拟合的风险。特别是在处理高维数据时,降维能够提高模型的泛化能力,使其在测试集上的表现更加稳定。 3. 四、总结 降维是模型开发过程中不可或缺的一部分。通过适当的降维技术,我们可以有效地处理高维数据,提高模型的性能和稳定性。

    86410编辑于 2024-07-10
领券