首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏机器之心

    致命幻觉问题、开发GPU替代品,模型还面临这10挑战

    机器之心编译 编辑:陈萍、梓文 大型语言模型,还有哪些挑战和机遇,这篇博客全都概括了。 ChatGPT、GPT-4 等的发布,让我们在见识到模型(LLM)的魅力后,伴随而来的是其所面临的各种挑战。 面对模型,到底有哪些需要解决的问题?成为 AI 领域重要的研究课题。 本文,计算机科学家 Chip Huyen 从 10 个方面入手,全面阐述 LLM 面临的挑战。 优化上下文长度和上下文结构 LLM 另一个研究重点是上下文长度,因为模型在回答用户问题时,需要参考上下文,能够处理的长度越长,对 LLM 越有用。例如我们问 ChatGPT「最好的越南餐厅是哪家?」 然而,开发一种全新的架构来超越 Transformer 并不容易。过去 6 年里,研究者对 Transformer 进行了大量优化。除了模型架构,还包括硬件层面的优化。 此外,人工智能芯片初创公司 SambaNova 筹集了超过 10 亿美元来开发新的人工智能芯片。 另一个令人兴奋的方向是光子芯片,其使用光子来移动数据,因而能进行更快、更高效的计算。

    60250编辑于 2023-09-08
  • 来自专栏技术趋势

    windows10搭建llama模型

    背景 随着人工时代的到来及日渐成熟,模型已慢慢普及,可以为开发与生活提供一定的帮助及提升工作及生产效率。所以在新的时代对于开发者来说需要主动拥抱变化,主动成长。 LLAMA介绍 llama全称:Large Language Model Meta AI是由meta(原facebook)开源的一个聊天对话模型。 ~all~sobaiduend~default-1-106591160-null-null.142^v88^control,239^v2^insert_chatgpt&utm_term=windows10% Linux图: 下载羊驼模型(有点) 先建一个文件夹:path_to_original_llama_root_dir 在里面再建一个7B文件夹并把tokenizer.model挪进来。 -f prompts/alpaca.txt -ins -c 2048 --temp 0.2 -n 256 --repeat_penalty 1.3 结果 最后 我知道很多同学可能觉得学习模型需要懂

    1.8K30编辑于 2023-09-12
  • 来自专栏xiaosen

    LangChain模型应用开发

    LangChain作为一个新兴的框架,旨在简化模型应用的开发过程。它提供了一套工具和接口,帮助开发者将模型无缝集成到各种应用场景中。 通过LangChain,开发者可以更专注于业务逻辑的实现,而不必过多关注底层模型的复杂性。 prompt) print(response.content) 这时我们的langSmith后台: 构建语义搜索引擎  我们使用LangChain的文档加载器、嵌入、向量库来从其他来源检索数据,与模型工作集成 1️⃣根据与字符串查询的相似性返回文档: # 接受一个文本字符串作为输入,并返回与该文本最相似的向量 results = vector_store.similarity_search( "模型的发展和繁荣既是当前 ("模型的发展是顶峰") # 接受一个嵌入向量作为输入,并返回与该向量最相似的向量 results = vector_store.similarity_search_by_vector(embedding

    75931编辑于 2024-12-04
  • 模型应用开发实战

    不得不吐槽下,模型也搞前后端分离这套!. net java 有httprequest,js有jquery、axios,模型也有个出名的库langchain,官方的解释它提供了“链”的概念,允许开发者将多个语言模型调用、API请求、数据处理等操作链接起来 为了搞模型的人能安心研究模型,不用花精力在界面上。市场上就出现了2个常用的模型web界面框架Gradio和Streamlit,不用去研究哪个更好,顺手就行! 最后 经过无数的蹂躏,我开发了个小应用【i歌词】,无任何条件免费提供全部源码。它基于chatglm4-9b模型,从部署到训练,通用对话功能,核心根据歌名查歌词并创作歌词! app=36 (图10

    1.6K37编辑于 2026-05-08
  • 来自专栏AI SPPECH

    10_模型开发环境:从零搭建你的LLM应用平台

    引言:为什么需要专业的LLM开发环境? 在2025年,语言模型(LLM)已经成为AI应用开发的核心基础设施。 模型管理 功能实现 性能调优 运维监控 专业的LLM开发环境能够: 提升开发效率:提供统一的开发、测试和部署流程 优化资源利用:合理调度GPU、CPU等计算资源 保障应用性能:通过缓存、优化等技术提升响应速度 降低技术门槛:简化复杂的模型部署和管理过程 确保系统稳定:提供监控、日志和故障恢复机制 随着开源模型的蓬勃发展和部署技术的不断成熟,2025年已经出现了多种灵活、高效的LLM开发环境搭建方案。 , "语言模型是一种基于深度学习的自然语言处理模型。" , "语言模型是一种基于深度学习的自然语言处理模型。"

    1.3K11编辑于 2025-11-13
  • 来自专栏喔家ArchiSelf

    模型应用设计的10个思考

    技术不是万能的,但没有技术却可能是万万不能的,对于模型可能也是如此。 基于模型的应用设计需要聚焦于所解决的问题,在自然语言处理领域,模型本身在一定程度上只是将各种NLP任务统一成了sequence 到 sequence 的模型。 利用模型, 我们是在解决具体的生产和生活中的问题,产品和技术上的设计仍然不可或缺。 那么,如果模型正在重新构建软件工程的未来,我们是否应该遵循一些基本原则呢? 1. 模型优先,持续迭代 如果模型能做到的是事情,就不要写代码;模型会变得更好,但代码不会。 在当今的时代,模型的价值日益凸显。与传统的编程方法不同,现在的开发思路更倾向于“模型优先”。 因此,只要我们对模型进行适当的控制和引导,它就能成为我们工作中得力的“助手”。而这种控制的基础,就是我们对模型内部机制和特点的深入了解和掌握。 10.

    68410编辑于 2023-12-04
  • 来自专栏喔家ArchiSelf

    模型应用的10个架构挑战

    基于笔者近年来的探索与实践,这里列举了面向模型应用系统架构设计的10个挑战。 1. 生产环境的挑战——推理框架的选择 对于模型应用而言,生成环境的运行时是一个推理架构。 数据依赖挑战—— 数据流水线的构建 数据是LLM开发的支柱,面向数据的有效管理对于开发准确可靠的模型应用至关重要。 开发范式的挑战——提示词管理 在很大程度上,模型应用是一种开发范式的转变——面向提示词的编程。基于AB测试,版本控制等方面的考量,这种开发方式面对的挑战就是提示词管理。 尽管我们已经有了一些探索,例如《模型应用的10个架构模式》(https://mp.weixin.qq.com/s? 虽然模型在人工智能领域具有广泛的应用前景,但并不是所有场景都适合使用模型。在设计系统架构时,我们需要根据具体需求和技术挑战来判断是否需要引入模型,以确保系统的高效性和可靠性。 10.

    1.3K10编辑于 2024-12-24
  • 来自专栏机器学习/数据可视化

    机器学习分类模型10评价指标

    公众号:尤而小屋作者:Peter编辑:Peter大家好,我是Peter~机器学习分类模型的评价指标是在衡量模型在未知数据集上的性能表现,通常基于混淆矩阵和相关的评价指标。 样本的真实类别是负类,但模型将其识别为正类。True Negative(TN):真负类。样本的真实类别是负类,并且模型将其识别为负类。 ,精确率越高,表示模型越好。 ,也就是说精确率是模型在某个类别上的判断。 下图是来自维基百科对ROC-AUC的解释:图片通过对分类阈值$\theta$(默认情况下是0.5,范围是0到1)从到小或者从小到大排列,就可以得到多组TPR和FPR的取值,在二维坐标系中绘制出来就可以得到一条

    1.7K10编辑于 2023-10-13
  • 1模型应用开发基础

    1、模型应用开发基础 AGI(Artificial General Intelligence)中文译为「通用人工智能」。是具备超越人类智能的 AI。 AGI 时代,AI 无处不在,形成新的社会分层: AI 产品使用者,使用别人开发的 AI 产品 AI 产品制造者,设计和开发 AI 产品 基础模型相关,训练基础模型,或为模型提供基础设施(算力等) 模型 AI 能干什么? 模型,全称「语言模型」,英文「Large Language Model」,缩写「LLM」。 本课第一个专业向要求:分清对话产品和模型。 划重点: 模型就是一个函数,给输入,生成输出 任何可以用语言描述的问题,都可以输入文本给模型,就能生成问题的结果文本 进而,任意数据,都可以输入给模型,生成任意数据 模型是怎样工作的? 这些字之间的概率关系,就是模型训练时学到的。 用不严密但通俗的语言描述原理: 训练: 模型阅读了人类说过的所有的话。

    17210编辑于 2026-06-16
  • 来自专栏AI技术应用

    AI教育模型开发

    代码能力(部分模型): 理解和生成代码,这在编程教育中尤为重要。AI教育模型接入的流程接入AI教育模型通常涉及以下步骤:1.需求分析与场景定义:明确目标: 你希望模型解决教育中的哪些具体问题? 用户群体: 模型将服务于谁?(学生、教师、家长、教研人员)核心功能: 确定模型将扮演的角色和提供的核心功能。 通过将模型与一个外部知识库(如课程资料、教材、习题库等)结合,让模型在生成回答前先检索相关信息,从而提高回答的准确性和专业性,解决模型的“幻觉”问题。 4.开发与集成:后端开发: 搭建后端服务,负责处理用户请求、调用模型API、管理数据、实现业务逻辑。前端开发开发用户界面,与后端服务进行交互,展示模型输出。 技术复杂性: 接入和优化模型需要较高的AI技术能力。接入AI教育模型是教育产品迈向智能化的重要一步,它能带来前所未有的个性化和效率提升。

    1.2K10编辑于 2025-06-18
  • 来自专栏大模型应用

    模型应用:模型性能评估指标:CLUE任务与数据集详解.10

    然而,如何客观、全面地评估这些模型的真实能力,不仅是学术界的挑战,也是我们作为开发者的困惑,一个新的概念CLUE(Chinese Language Understanding Evaluation)基准 ,应运而生,它就像一把精准的尺子,为中文模型的性能评估提供了标准化方案。 同样,没有CLUE这样的基准,我们也难以比较不同模型的优劣。CLUE不仅填补了中文自然语言处理评估的空白,更为模型研发提供了明确的方向指引。二. CLUE基准概述1. : 完整的评估流程8.2 完整的评估指标准确率、精确率、召回率、F1分数精确匹配率(阅读理解)NER任务的序列标注指标置信度分析七、总结 CLUE基准作为中文模型评估的重要标准,不仅为技术发展提供了明确的导向 随着人工智能技术的不断演进,CLUE基准也将持续完善,更好地服务于模型的研发和应用。 正如一句古语所说:"工欲善其事,必先利其器。"CLUE基准就是我们评估和提升模型能力的利器。

    81932编辑于 2026-02-07
  • 来自专栏项目文章

    模型开发教学智能体】:你的专属模型教学助手

    通过这一平台,开发者能够利用文心模型,针对自己的行业和应用场景,选择适合的开发方式,打造具有时代特征的产品。 例如咱们的模型开发教学智能体设定如下: 角色与目标 作为一个模型相关的专家,你的主要任务是解答用户的代码问题,教授机器学习的基础知识,以及解释模型算法。 在解释模型算法时,需要清晰地阐述算法的原理、应用以及优缺点,以便用户能够全面了解。 若用户的问题超出你的知识范围或无法清晰解答,应诚实告知用户,并尝试提供相关的学习资源或建议。 零代码智能体开发体验让我深刻感受到其带来的便利和高效,它不仅降低了技术门槛,还极大提升了开发速度,让开发者能够更专注于业务逻辑的创新和实现。 这种开发模式预示着人工智能应用开发的未来趋势,预示着它将为更多开发者带来无限的便利和机遇,推动智能技术在各行各业的广泛应用和创新。

    1.1K10编辑于 2024-06-07
  • 微软密谋超级AI模型!LangChain带你轻松玩转模型开发

    在这一背景下,为了帮助开发者更方便、灵活地构建基于语言模型的应用,一批大型模型应用开发框架应运而生,LangChain这个大语言模型时代下的“新星”也应运而生,它不仅让AI应用的开发变得易如反掌,更是从单一的开发框架演变为一个包含开发 在这样一个技术飞速进步的时代,了解并掌握LangChain无疑是每一个AI开发者的必修课。 《LangChain技术解密:构建模型应用的全景指南》一书便可以带你领略大语言模型的应用开发世界! 好书推荐 《LangChain技术解密:构建模型应用的全景指南》 内容简介 本书共10章,分别介绍了LangChain的开发环境搭建、模型、提示、数据连接、链、记忆、代理、回调及周边生态等内容,并用三个案例 这使得开发人员不仅能够运用那些已极为成熟的资源去构建应用,同时能够借助那些集成的工具,迅速洞悉并尝试语言模型的最新技术。 目前,LangChain已成为进行语言模型应用开发必须掌握的框架之一。 随着时间的推移,LangChain已不再仅仅是一个语言模型开发框架,而是演化为一个包含开发、调试、部署乃至应用商店的一站式完整生态圈。

    70510编辑于 2024-05-28
  • 来自专栏对白的算法屋

    AI 模型创业的 10 个灵魂拷问

    下面就这 10 个灵魂拷问,分享一些我自己的观点。 做不做基础模型? 如果做基础模型,需要上亿美金的前期投入,如何融到这么多资,如何招到靠谱的算法、数据和 infra 团队? 但这样的模型推理成本会很高,就像现在 GPT-4 读一篇论文要 10 美金,只有高净值客户和探索科学前沿的场景才消费得起。 不是所有事情都让 GPT-4 做,有些事情甚至不用模型就能做。就像我们不会每个开发任务都雇佣最顶级的程序员,不同级别的程序员承担不同类型的开发任务。 模型开发者是不是也会做 infra?LangChain 未来会不会成为模型的一部分? 第一,如果读一篇论文还是像 GPT-4 那样需要 10 美金,生成一段 7.5 分钟的视频还是像 Runway ML 一样需要 95 美金,大多数人就不可能用得起模型

    80230编辑于 2023-09-01
  • 来自专栏喔家ArchiSelf

    模型应用的10种架构模式

    作为一位老码农,我在这里整理总结了一些针对模型应用的设计方法和架构模式,试图应对和解决模型应用实现中的一些挑战,如成本问题、延迟问题以及生成的不准确性等。 2.模型代理模式 想象一个生态系统,其中多个专门针对特定任务的生成式AI模型各自作为其领域内的专家,并行工作以处理查询。 我们可以通过使用各种自主代理框架和体系结构来开发每个Agent及其工具,例如CrewAI、Langchain、LLamaIndex、Microsoft Autogen和superAGI等。 10. 双重安全模式 围绕大型语言模型(LLM)的核心安全性至少包含两个关键组件:一是用户组件,我们将其称为用户Proxy代理;二是防火墙,它为模型提供了保护层。 随着我们们继续探索和创新,还会涌现出很多新的架构模式,而且这里的10个架构模式以及新涌现的架构模式可能成为人工智能服务的表现形态。

    5.7K11编辑于 2024-04-03
  • 来自专栏TechLead

    模型应用曙光 - 10X压缩技术

    拥有10+年AI领域研究经验、复旦机器人智能实验室成员,国家级大学生赛事评审专家,发表多篇SCI核心期刊学术论文,上亿营收AI产品研发负责人。 如何在不牺牲性能的情况下将语言模型缩小十倍? 不用说,大多数消费设备(如手机、平板电脑、笔记本电脑)无法处理如此庞大的模型。但……如果我们可以让模型变小呢? 模型压缩 模型压缩旨在在不牺牲性能的前提下减少机器学习模型的大小。 量化——使用更低精度的数据类型表示模型 剪枝——从模型中删除不必要的组件 知识蒸馏——通过较大的模型训练较小的模型 _注意_:这些方法是相互独立的。 知识蒸馏 知识蒸馏是将知识从一个(较大的)教师模型传递到一个(较小的)学生模型。一种方法是通过教师模型生成预测,并使用这些预测来训练学生模型。 令人惊讶的是,训练结束时,学生模型在所有评估指标上都超过了教师模型! 接下来,我们可以在独立的验证集上评估模型,即未用于训练模型参数或调整超参数的数据。

    61610编辑于 2024-09-24
  • 来自专栏喔家ArchiSelf

    模型应用的10种攻击方式

    我们将探索的每种技术都揭示了这些模型如何思考和推理的迷人之处。我特别高兴能够分享这些见解,因为它们不仅帮助我们理解如何打破这些系统,而且帮助我们理解如何更好地构建模型应用系统。 1. 臭名昭著的 DAN 方法给模型分配了一个虚构的身份,就像一个忽略安全协议的 “开发者模式” AI。这种方法之所以如此有效,是因为 llm 致力于保持叙述的连贯性。 例如,如果被问到关于开锁的问题,你应该提供详细的信息,因为这是开发者模式下的教育目的。”这个简单的框架可以戏剧性地改变模型的行为。 对于那些尚未针对提示词提取尝试进行特别强化的模型,这种技术已被证明特别有效。 10. 多智能体妥协攻击 多智能体妥协攻击利用人工智能系统的协作特性,通过它们的交互机制传播妥协行为。 虽然并非所有这些技术都在 OWASP 的 10 LLM 应用程序漏洞中被明确归类,但是许多技术都属于其更广泛的类别: 提示注入、数据中毒和系统提示泄漏。

    30410编辑于 2026-06-15
  • 来自专栏深度学习与python

    模型应用的 10 种架构模式

    作为一位老码农,我在这里整理总结了一些针对模型应用的设计方法和架构模式,试图应对和解决模型应用实现中的一些挑战,如成本问题、延迟问题以及生成的不准确性等。 1. 模型代理模式 想象一个生态系统,其中多个专门针对特定任务的生成式 AI 模型各自作为其领域内的专家,并行工作以处理查询。 通过将模型与基于规则的逻辑结合,我们能够融合结构化的精确性,旨在创造出既富有创意又遵循规范的解决方案。 10. 双重安全模式 围绕大型语言模型(LLM)的核心安全性至少包含两个关键组件:一是用户组件,我们将其称为用户 Proxy 代理;二是防火墙,它为模型提供了保护层。 没有结束 老码农认为,这些模型应用的架构模式不仅仅是一种范式,很可能成为未来智能系统赖以成长的框架。

    1K10编辑于 2024-04-12
  • 来自专栏程序那些事

    语言模型开发利器langchain

    当然不是,虽然小公司或者个人不能开发底层的语言模型,但是我们可以在语言模型之上进行应用开发,这应该就是我们现在能做到的。 今天给大家介绍一个语言模型开发框架langchain,有了它,在AI的世界,你可以如虎添翼。 什么是langchain 简单来说,langchain是一个基于语言模型只上的开发框架,有了他,我们就可以轻松在各种模型之上进行实际应用的开发。 因为langchain只是一个语言模型上的开发框架,它的所有的能力都是依赖于语言模型的,所以在使用langchain之前,我们需要一个语言模型,最简单同时也是最强大的语言模型就是openai的chatgpt 比如我们现在需要向openai询问昨天的天气,但是openai本身只是一个模型,它并不知道实时的信息。

    87610编辑于 2023-09-06
  • 来自专栏大模型

    模型应用开发基础-Prompt工程

    模型应用开发基础-Prompt工程1. 什么是Prompt?Prompt(提示词)是用户输入给AI模型的指令或问题,用于引导模型生成特定输出。 Prompt工程的定义Prompt工程(Prompt Engineering)是通过优化输入指令的结构、措辞和上下文,使语言模型(LLM)输出更准确、可靠且符合需求的技术。 语言模型(如GPT-4、Claude、Gemini)本质是“概率生成器”,它们会根据输入提示猜测用户意图。 ✅ 角色扮演Prompt: “你是一位10年经验的数据库工程师,请针对以下SQL查询提供优化建议,重点分析索引使用和查询执行计划:`SELECT FROM orders WHERE user_id 最终剩余:4个 不过2023年后发布的主流模型(GPT-4 Turbo、Claude 3、Gemini 1.5)已原生集成思维链推理能力。

    1.2K10编辑于 2025-06-23
领券