首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏大模型&AIGC

    6模型微调技术

    值得一提的是,通过使用T5模型进行模型大小的消融实验,我们展示了提示微调随着规模的增加变得更加具有竞争力:当模型参数超过数十亿时,我们的方法“缩小了差距”并达到了模型微调(即调整所有模型权重)的强大性能 input和target,则使用原始的input embedding(5) 使用方式离散和连续template token混合时,显示地插入一下anchor(离散的token)有助于template的优化(6) ,无需verbalizer(4) 特点在小、模型上,效果均优于P-tuning。 当参数量达10B,效果相当于FT6.LoRA(2021)(1) 论文信息来自论文:《LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS》(2)摘要自然语言处理的一个重要范式包括在通用领域数据上进行大规模预训练 Model),学习目标为而加入LoRA后,学习目标为:(6) 配置在多个部位$(Q/K/V/Output)$同时添加$\bigtriangleup W$ ,会比只在单一部分上添加权重$\bigtriangleup

    3.5K00编辑于 2025-05-08
  • 来自专栏6G

    6G,AI , 与模型?

    为实现 6G 泛在智能的愿景,网络与 AI 的融合需要经历以下三转变: 从烟囱式开发模式转向泛在智能的统一网络 AI 框架。 从外挂叠加的 AI 功能转向内生一体的网络智能化。 6G与AI融合的未来方向 6G 网络的内生 AI 设计将赋能网络的AI模型,同时使网络能够支持 AI 模型的训练和服务。 另外,从小模型模型,生产效率跨越式提升基础通用模型具有泛化性,网络智能化将从用例驱动转变为能力驱动,迅速降低应用开发门槛,加速 AI 工程化、规模化落地。 在数据获取和处理方面,与 ChatGPT 不同,网络中存在大量结构化数据,且网络不同问题间的共性不清晰,网络 AI 模型面临较大挑战。6G 网络面临如何有效采集适合AI模型训练的数据的挑战。 而在构建 AI 模型的路径上,需要分阶段探索,从离线小规模模型开始,逐步过渡到实时大规模模型,最终实现统一的网络 AI 模型。 本文摘自于中国移动的“6G内生AI架构及AI模”汇报材料。

    58110编辑于 2024-04-24
  • 来自专栏xiaosen

    LangChain模型应用开发

    LangChain作为一个新兴的框架,旨在简化模型应用的开发过程。它提供了一套工具和接口,帮助开发者将模型无缝集成到各种应用场景中。 通过LangChain,开发者可以更专注于业务逻辑的实现,而不必过多关注底层模型的复杂性。 prompt) print(response.content) 这时我们的langSmith后台: 构建语义搜索引擎  我们使用LangChain的文档加载器、嵌入、向量库来从其他来源检索数据,与模型工作集成 1️⃣根据与字符串查询的相似性返回文档: # 接受一个文本字符串作为输入,并返回与该文本最相似的向量 results = vector_store.similarity_search( "模型的发展和繁荣既是当前 ("模型的发展是顶峰") # 接受一个嵌入向量作为输入,并返回与该向量最相似的向量 results = vector_store.similarity_search_by_vector(embedding

    75931编辑于 2024-12-04
  • 模型应用开发实战

    至此最简单的模型应用开发完毕。 提供API支持 上面最简单的Hello world写完了,接下来就要为各种客户端提供接口服务了。. (图5) 我们用postman等客户端工具测试一下: (图6) 编写客户端 服务端有了,当然要做个漂亮的客户端,总不能一直用postman。不得不吐槽下,模型也搞前后端分离这套!. net java 有httprequest,js有jquery、axios,模型也有个出名的库langchain,官方的解释它提供了“链”的概念,允许开发者将多个语言模型调用、API请求、数据处理等操作链接起来 为了搞模型的人能安心研究模型,不用花精力在界面上。市场上就出现了2个常用的模型web界面框架Gradio和Streamlit,不用去研究哪个更好,顺手就行! 最后 经过无数的蹂躏,我开发了个小应用【i歌词】,无任何条件免费提供全部源码。它基于chatglm4-9b模型,从部署到训练,通用对话功能,核心根据歌名查歌词并创作歌词!

    1.6K37编辑于 2026-05-08
  • 模型的2025:6个关键洞察

    以下为卡帕西年度回顾全文:《2025年语言模型年度回顾》2025年是语言模型领域大步跨越且充满变数的一年。 彻底改造软件开发的氛围编程2025年,AI突破了关键能力阈值,使得人们仅凭自然英语就能构建各类功能强大的程序,甚至会忽略代码本身的存在。 与以往所有技术不同,普通人从语言模型中获得的收益,远超过专业人士、企业与政府。氛围编程不仅赋予普通人技术创作权,也让专业开发者能够高效实现原本因技术门槛或成本问题不会尝试的软件项目。 未来,氛围编程将彻底改造软件开发生态,并重新定义相关职业的核心价值。语言模型交互雏形初现谷歌Gemini Nano Banana是2025年最具突破性、最可能引发范式转移的模型之一。 当前的语言模型既展现出远超预期的智能水平,也存在令人意外的认知短板。但无论如何,它们已具备极高的实用价值——我认为,即便以当前的能力水平,整个行业对语言模型潜力的开发仍不足10%。

    92510编辑于 2025-12-24
  • 1模型应用开发基础

    1、模型应用开发基础 AGI(Artificial General Intelligence)中文译为「通用人工智能」。是具备超越人类智能的 AI。 AGI 时代,AI 无处不在,形成新的社会分层: AI 产品使用者,使用别人开发的 AI 产品 AI 产品制造者,设计和开发 AI 产品 基础模型相关,训练基础模型,或为模型提供基础设施(算力等) 模型 AI 能干什么? 模型,全称「语言模型」,英文「Large Language Model」,缩写「LLM」。 本课第一个专业向要求:分清对话产品和模型。 划重点: 模型就是一个函数,给输入,生成输出 任何可以用语言描述的问题,都可以输入文本给模型,就能生成问题的结果文本 进而,任意数据,都可以输入给模型,生成任意数据 模型是怎样工作的? 这些字之间的概率关系,就是模型训练时学到的。 用不严密但通俗的语言描述原理: 训练: 模型阅读了人类说过的所有的话。

    17210编辑于 2026-06-16
  • 来自专栏AI技术应用

    AI教育模型开发

    代码能力(部分模型): 理解和生成代码,这在编程教育中尤为重要。AI教育模型接入的流程接入AI教育模型通常涉及以下步骤:1.需求分析与场景定义:明确目标: 你希望模型解决教育中的哪些具体问题? 用户群体: 模型将服务于谁?(学生、教师、家长、教研人员)核心功能: 确定模型将扮演的角色和提供的核心功能。 通过将模型与一个外部知识库(如课程资料、教材、习题库等)结合,让模型在生成回答前先检索相关信息,从而提高回答的准确性和专业性,解决模型的“幻觉”问题。 4.开发与集成:后端开发: 搭建后端服务,负责处理用户请求、调用模型API、管理数据、实现业务逻辑。前端开发开发用户界面,与后端服务进行交互,展示模型输出。 6.部署与运维:部署环境: 选择云服务器或私有服务器进行部署。监控与报警: 建立完善的监控系统,及时发现并处理潜在问题。版本管理与持续集成/部署 (CI/CD): 方便模型的迭代更新和功能上线。

    1.2K10编辑于 2025-06-18
  • 来自专栏啄木鸟软件测试

    多模态模型技术原理及实战(6)

    中小型公司模型构建之路 如何选择 自己建立 二次开发 重新训练,消耗非常巨大 现有的模型体系已经非常丰富 对话模型已经白热化 •三天产生一个小应用 •两天产生一个新模型 中小公司的技术实力相对薄 微调 用 LoRA((Low-Rank Adaptation低秩适配) 2022年 Edward J.Hu PLM(Pre-trained Language Model 预训练语言模型) QLoRA Tim Dettmers 等人 SFT(有监督微调) DeepSpeed+ZeRO-3 DeepSpeed •微软开发的开源深度学习优化库 •PyTorch框架 零冗余优化器 ( 步骤 •1、训练一个原始模型,该模型具有较高的性能但运行速度较慢。 •2、确定哪些参数对输出结果的贡献较小,并将其设置为零。 •4、评估模型的大小、速度和效果等指标,如果不符合要求,那么继续进行剪枝操作直至满意为止。

    40910编辑于 2024-09-10
  • 来自专栏猫头虎博客专区

    ChatGLM-6B 模型的前世今生

    为了方便下游开发者针对自己的应用场景定制模型,我们同时实现了基于 P-Tuning v2 的高效参数微调方法 (使用指南) ,INT4 量化级别下最低只需 7GB 显存即可启动微调。 ChatGLM-6B 开源模型旨在与开源社区一起推动模型技术发展,恳请开发者和大家遵守开源协议,勿将开源模型和代码及基于开源项目产生的衍生物用于任何可能给国家和社会带来危害的用途以及用于任何未经过安全评估和备案的服务 目前,本项目团队未基于 ChatGLM-6B 开发任何应用,包括网页端、安卓、苹果 iOS 及 Windows App 等应用。 : 更强大的性能:基于 ChatGLM 初代模型开发经验,我们全面升级了 ChatGLM2-6B 的基座模型。 将模型下载到本地之后,将以上代码中的 THUDM/chatglm-6b 替换为你本地的 chatglm-6b 文件夹的路径,即可从本地加载模型。 Optional 模型的实现仍然处在变动中。

    1.7K10编辑于 2024-04-08
  • 来自专栏MavenTalk

    ChatGLM-6B模型微调实战总结

    上篇我们已经具备了 ChatGLM-6B 初步的运行环境,这为实现完全属于自己的模型奠定了基础(快速部署ChatGLM-6B模型实战总结),接下来将针对模型进行微调,以便让它真正成为一个定制化智能助手 /THUDM/chatglm-6b \ # 加载模型文件地址 --output_dir output/adgen-chatglm-6b-pt-$PRE_SEQ_LEN-$LR \ # 保存训练模型文件地址 在实践中,我们使用了 ChatGLM-6B 模型,并经历了模型的训练和推理过程。训练模型消耗了相当多的时间,但也让我们体会到了模型训练的复杂性和挑战性。 这个过程让我们更加深入了解人工智能的发展和应用,对模型微调和开发有了更清晰的认识,虽然成果尚不尽如人意,但它为我们未来探索人工智能和开发个性化助手铺平了道路,相信未来我们会越来越接近实现类似贾维斯的智能助手的愿景 —扩 展 阅 读— 正在发生或即将发生的AI模型应用,立帖为证 ChatGPT、Claude和Bard,三足鼎立之势已成 WPS Office AI实战总结,智能化办公时代已来 你对 ChatGPT

    4.3K43编辑于 2023-09-06
  • 来自专栏GPUS开发者

    在Jetson上玩转模型Day17:NanoLLM开发平台(6):AI Agent功能

    虽然语音模型为AI开启新的纪元,但是我们只能将这些模型视为AI能量的供应源,与我们所需要的流程类应用还有段差距,因为再厉害的语音模型也都有各自擅长的部分,要搭建一个完整的应用,需要更多配套的组件共同完成任务 例如我们前面搭建的Llamaspeak语音智能助手项目中,并非单纯地选择不同语言模型来作为智能核心就完成了,我们还需要结合很多其他配套技术,包括音频输入/输出的websocket或usb/i2s技术、 一个基于语言模型的agent基础结构如下: 可以看得出要建构一个agent也不是一件简单的事情,这也不是本文的所要传递的重点。 NanoLLM/tree/main/nano_llm/plugins,里面列出所有插件的源码,请自行参阅: 现在我们先载入一个本应用已经预先建立好的“VILA3B V4L2”项目,以VIAL 3B多模态语言模型为基础 对于绝大部分不知道该怎么创建Agent的人来说,真的非常方便,目前NanoLLM已经提供非常充足的Agent插件,当然也允许开发人员自行创建有针对性的插件,去完成特定的工作。

    44610编辑于 2024-12-19
  • 来自专栏项目文章

    模型开发教学智能体】:你的专属模型教学助手

    通过这一平台,开发者能够利用文心模型,针对自己的行业和应用场景,选择适合的开发方式,打造具有时代特征的产品。 例如咱们的模型开发教学智能体设定如下: 角色与目标 作为一个模型相关的专家,你的主要任务是解答用户的代码问题,教授机器学习的基础知识,以及解释模型算法。 在解释模型算法时,需要清晰地阐述算法的原理、应用以及优缺点,以便用户能够全面了解。 若用户的问题超出你的知识范围或无法清晰解答,应诚实告知用户,并尝试提供相关的学习资源或建议。 零代码智能体开发体验让我深刻感受到其带来的便利和高效,它不仅降低了技术门槛,还极大提升了开发速度,让开发者能够更专注于业务逻辑的创新和实现。 这种开发模式预示着人工智能应用开发的未来趋势,预示着它将为更多开发者带来无限的便利和机遇,推动智能技术在各行各业的广泛应用和创新。

    1.1K10编辑于 2024-06-07
  • 来自专栏AIOT

    在Jetson上玩转模型Day17:NanoLLM开发平台(6):AI Agent功能

    虽然语音模型为AI开启新的纪元,但是我们只能将这些模型视为AI能量的供应源,与我们所需要的流程类应用还有段差距,因为再厉害的语音模型也都有各自擅长的部分,要搭建一个完整的应用,需要更多配套的组件共同完成任务 例如我们前面搭建的Llamaspeak语音智能助手项目中,并非单纯地选择不同语言模型来作为智能核心就完成了,我们还需要结合很多其他配套技术,包括音频输入/输出的websocket或usb/i2s技术、 一个基于语言模型的agent基础结构如下:可以看得出要建构一个agent也不是一件简单的事情,这也不是本文的所要传递的重点。 NanoLLM/tree/main/nano_llm/plugins,里面列出所有插件的源码,请自行参阅:现在我们先载入一个本应用已经预先建立好的“VILA3B V4L2”项目,以VIAL 3B多模态语言模型为基础 对于绝大部分不知道该怎么创建Agent的人来说,真的非常方便,目前NanoLLM已经提供非常充足的Agent插件,当然也允许开发人员自行创建有针对性的插件,去完成特定的工作。

    60410编辑于 2024-12-17
  • 微软密谋超级AI模型!LangChain带你轻松玩转模型开发

    在这一背景下,为了帮助开发者更方便、灵活地构建基于语言模型的应用,一批大型模型应用开发框架应运而生,LangChain这个大语言模型时代下的“新星”也应运而生,它不仅让AI应用的开发变得易如反掌,更是从单一的开发框架演变为一个包含开发 在这样一个技术飞速进步的时代,了解并掌握LangChain无疑是每一个AI开发者的必修课。 《LangChain技术解密:构建模型应用的全景指南》一书便可以带你领略大语言模型的应用开发世界! 这使得开发人员不仅能够运用那些已极为成熟的资源去构建应用,同时能够借助那些集成的工具,迅速洞悉并尝试语言模型的最新技术。 目前,LangChain已成为进行语言模型应用开发必须掌握的框架之一。 随着时间的推移,LangChain已不再仅仅是一个语言模型开发框架,而是演化为一个包含开发、调试、部署乃至应用商店的一站式完整生态圈。 正值语言模型开发以潮涌之势席卷而来之际,越来越多的开发人员对于怎样利用LangChain迅速构建AI应用产生了浓厚的兴趣。 在这样的背景下,本书应运而生。

    70510编辑于 2024-05-28
  • 来自专栏程序那些事

    语言模型开发利器langchain

    当然不是,虽然小公司或者个人不能开发底层的语言模型,但是我们可以在语言模型之上进行应用开发,这应该就是我们现在能做到的。 今天给大家介绍一个语言模型开发框架langchain,有了它,在AI的世界,你可以如虎添翼。 什么是langchain 简单来说,langchain是一个基于语言模型只上的开发框架,有了他,我们就可以轻松在各种模型之上进行实际应用的开发。 因为langchain只是一个语言模型上的开发框架,它的所有的能力都是依赖于语言模型的,所以在使用langchain之前,我们需要一个语言模型,最简单同时也是最强大的语言模型就是openai的chatgpt 比如我们现在需要向openai询问昨天的天气,但是openai本身只是一个模型,它并不知道实时的信息。

    87610编辑于 2023-09-06
  • 来自专栏大模型

    模型应用开发基础-Prompt工程

    模型应用开发基础-Prompt工程1. 什么是Prompt?Prompt(提示词)是用户输入给AI模型的指令或问题,用于引导模型生成特定输出。 Prompt工程的定义Prompt工程(Prompt Engineering)是通过优化输入指令的结构、措辞和上下文,使语言模型(LLM)输出更准确、可靠且符合需求的技术。 语言模型(如GPT-4、Claude、Gemini)本质是“概率生成器”,它们会根据输入提示猜测用户意图。 Prompt工程的五核心技巧Prompt工程的核心在于如何设计清晰、有效的指令,让AI生成更符合预期的输出。 最终剩余:4个 不过2023年后发布的主流模型(GPT-4 Turbo、Claude 3、Gemini 1.5)已原生集成思维链推理能力。

    1.2K10编辑于 2025-06-23
  • 来自专栏程序那些事

    语言模型开发利器langchain

    当然不是,虽然小公司或者个人不能开发底层的语言模型,但是我们可以在语言模型之上进行应用开发,这应该就是我们现在能做到的。 今天给大家介绍一个语言模型开发框架langchain,有了它,在AI的世界,你可以如虎添翼。 什么是langchain简单来说,langchain是一个基于语言模型只上的开发框架,有了他,我们就可以轻松在各种模型之上进行实际应用的开发。langchain的主要特点有两个,第一点就是组件化。 因为langchain只是一个语言模型上的开发框架,它的所有的能力都是依赖于语言模型的,所以在使用langchain之前,我们需要一个语言模型,最简单同时也是最强大的语言模型就是openai的chatgpt 比如我们现在需要向openai询问昨天的天气,但是openai本身只是一个模型,它并不知道实时的信息。

    1.1K20编辑于 2023-06-28
  • 来自专栏算法channel

    模型开发工程师 roadmap

    模型开发工程师应该是接下来几年最火的方向之一,今天逛github发现一个很好的学习导图,是一个专业的模型开发工程师的学习路线图: 我翻译了一下,供英文不是很好的同学参考: 运行LLMs: LLM engineering) 结构化输出(Structuring outputs) 构建向量存储: 摄入文档(Ingesting documents) 分割文档(Splitting documents) 嵌入模型

    1.1K10编辑于 2024-04-11
  • 来自专栏码农编程进阶笔记

    Java + LangChain 开发语言模型应用!

    在 Baeldung 上看到了一篇介绍基于 Java + LangChain 开发语言模型应用的基础入门文章,写的非常不错,非常适合初学者。于是,我抽空翻译了一下。 1. 简介 在本教程中,我们将详细探讨 LangChain[1],一个用于开发基于语言模型[2]的应用程序的框架。我们将首先了解语言模型的基础概念,这些知识将对本教程有所帮助。 现在,我们可以将检索到的相关内容作为上下文,添加到我们打算发送给模型的提示中。 6. LangChain 的复杂应用 到目前为止,我们已经了解了如何使用单个组件来创建一个基于语言模型的应用程序。 链简化了开发更复杂应用程序的过程,并使调试、维护和改进更加容易。 链还可以组合多个链来构建更复杂的应用程序,这些应用程序可能需要与多个语言模型交互。 这些库未来将快速发展,它们会让开发由语言模型驱动的应用程序的过程变得更成熟和有趣!

    3.3K12编辑于 2025-03-29
  • 来自专栏MavenTalk

    快速部署ChatGLM-6B模型实战总结

    作者简介:赵辉,区块链技术专家,精通各种联盟链、公链的底层原理,拥有丰富的区块链应用开发经验。 近期,IT界掀起了模型的热潮,各种百模争霸的局面出现。 然而,当开源的模型 ChatGLM 面世时,我却遇到了一些困扰,但幸运的是,腾讯云给了我一个难得的机会。 下载模型文件 https://github.com/THUDM/ChatGLM-6B 官方网站 从ChatGLM的官方库中下载,将模型文件我放到工程的 ChatGLM-6B/THUDM 目录下面。 huggingface.co/THUDM/chatglm-6b 模型文件比较大(25G),这里下载需要的时间很长,请耐心等待,以下是目录下载后模型目录下的文件: 测试 终端运行 Demo 进入ChatGLM server.port 27777 --server.address 0.0.0.0 执行成功的效果如下: 打开浏览器可见到如下界面: 跟它对话一下,看看效果: —扩 展 阅 读— 正在发生或即将发生的AI模型应用

    2.1K20编辑于 2023-09-06
领券