大模型与 Agent 智能体开发实战摘要大语言模型(LLM)的爆发式增长不仅改变了自然语言处理领域,更催生了一个全新的技术范式——Agent 智能体。 本文将系统性地介绍大模型 Agent 的核心原理、主流框架、开发实战、高级技巧和落地案例,帮助开发者从零开始构建自己的智能体应用。 一、理解大模型 Agent1.1 什么是 Agent 智能体Agent 智能体是指以大语言模型为核心,具备感知环境、自主决策、执行动作能力的 AI 系统。 一个完整的 Agent 通常包含以下几个核心组件:大语言模型(LLM):Agent 的"大脑",负责理解意图、推理决策、生成回复。它决定了 Agent 的智能水平。 结语大模型 Agent 智能体代表了 AI 技术的重要演进方向——从"能对话"到"能做事",从"被动响应"到"主动服务"。它让大语言模型的能力从"理解世界"延伸到"改变世界"。
如何打造通用性极强的交互架构,同时精准适配多样化、差异化的业务场景,是智能体业务落地的关键。 本文聚焦: • 大模型 IO接口的设计思路、架构方案及实际运行全流程。 大模型 IO 接口,依托 Strategy+Adapter 双层抽象架构,实现上层 Agent逻辑与下层LLM通信的完全解耦。 ReAct循环实质是: 通过预设的 max_iterations 循环调用大模型,模型思考返回结果和是否停止标志,如果需要调用工具结果后继续思考,就获取工具结果后继续循环。 当大模型认为已经得到最终的结果,就会输出最终结果,触发停止条件,跳出循环,完成整个 ReAct 循环。 在执行层,包装了两个输入和输出的类型。通过输入的参数配置,区分不同的业务需求。 这是整个系统的核心引擎,每轮迭代流程如下: ToolRegistryLLMProviderAgentRunnerToolRegistryLLMProviderAgentRunner① 上下文治理管道② 调用大模型追加到
基于以上行业痛点,逐步迭代出一套由浅入深、由单体到多体的分层大模型开发框架体系,完整覆盖全场景落地需求,迭代脉络清晰明确:初代基础层:LangChain:主打单智能体轻量化快速搭建,补齐大模型基础工程能力 四大框架各司其职、层层互补:2.1 LangChain(单智能体基础框架)核心定位:业界首个标准化大模型应用开发基础框架,所有大模型应用框架的底层底座。 大模型应用核心组件1.1 大模型底座组件核心定位:整个智能体应用的算力核心与思考大脑。核心能力:承担文本理解、逻辑推理、内容生成、需求解析等核心能力。 AutoGen/CrewAI:将单智能体闭环升级为多智能体联动闭环,多个智能体互相观测、互相迭代、协同完成任务。3. 企业级复杂单智能体应用,完全可以基于LangGraph架构开发,是大模型应用落地的核心主流框架。3.
通过这一平台,开发者能够利用文心大模型,针对自己的行业和应用场景,选择适合的开发方式,打造具有时代特征的产品。 二、快速创建智能体 进入文心智能体平台,我们可以选择基于“零代码”或者“低代码”创建智能体,这里各位可以根据自己的需求和情况来进行选择。 这里我们点击零代码创建智能体。 2.2 智能体Prompt配置 我们先简单来介绍一些Prompt智能体相关的一些知识: 智能体prompt指令是一种用于指导或激活智能体(如人工智能模型)执行特定任务的输入方式。 例如咱们的大模型开发教学智能体设定如下: 角色与目标 作为一个大模型相关的专家,你的主要任务是解答用户的代码问题,教授机器学习的基础知识,以及解释大模型算法。 在解释大模型算法时,需要清晰地阐述算法的原理、应用以及优缺点,以便用户能够全面了解。 若用户的问题超出你的知识范围或无法清晰解答,应诚实告知用户,并尝试提供相关的学习资源或建议。
多智能体角色的说明 最近在尝试 LLM Multi Agent(多智能体)的应用场景,下面给一个最近觉得还比较好用,也不是很麻烦的案例。 , clear_history=False, ) 大模型的选择 在这个脚本中,我使用的是 DeepSeek(我真是 DeepSeek 的热爱粉丝…),如下代码。 如果选择国内的模型,除了 DeepSeek,通义和豆包两个系列的模型也都挺好的,可以参考上面的代码进行配置。 上面的案例中我没有设置,因为在 SRE 这个场景中,如果设置一个规划 Agent,会导致回答很冗长 后面设置两个具体干活的 Agent,但是在他们的 Prompt 不能完全一样,而且这两个 Agent 的大模型最好也是用不同公司的 ,比如上面的sre_engineer_01和sre_engineer_02, 这里的数量推荐是 2 或者 3,设置 1 的话效果一般没有 2 好,大于3的话又显得太繁杂了。
前记 关于智能体的分类,心里一直是比较困惑的,于是想系统地了解下智能体应该如何分类。 一、大模型是怎么"变成"智能体的 1.1 一个让笔者困惑很久的问题 在聊智能体分类之前,笔者想先说一个一直困扰自己的问题:大模型本质上就是在"预测下一个 token",它怎么就突然具备了推理、规划、反思 这个问题其实是理解整个智能体体系的起点。 大语言模型的底层机制确实是基于概率的序列预测——给定前文,预测最可能出现的下一个词。 ✅ 1.3 一个关键结论 智能体的"高阶能力"并不是大模型自带的,而是通过架构设计、提示工程和工具集成,把大模型的"预测能力"组装成了"类智能行为"。 但多智能体也有代价:token 消耗约为单 Agent 的 15 倍,通信开销大,稳定性更难保障。简单聚焦任务、实时延迟要求高、预算有限的场景,应该坚持单 Agent。
如果我们能给大模型配备上四肢和工具呢?大模型是不是就会打破次元壁,从数字世界走向现实世界,与现实世界实现梦幻联动呢? 从软件工程的角度看来,智能体是一种基于大语言模型的,具备规划思考能力、记忆能力、使用工具函数的能力,能自主完成给定任务的计算机程序。 图 1. 智能体开发框架,会抽象和封装那些被高频使用的模块,如记忆能力、规划能力、RAG 能力、大模型调用等。使用智能体框架,可让帮助你快速搭建智能体。 下图的左侧是多智能体的协作流程,右侧是单智能体的工作流程。 图11 展望 随着大模型的百花齐放,LLM 会支持更长的上下文、更大的参数规模,其推理能力也会愈发强大。 因此,基于大模型搭建的智能体(AI Agent)的能力边界也在不断突破。
主讲人: 李慧 | 医疗健康产品商业化负责人 数据来源: 2024腾讯全球数字生态大会 一、产品定位与核心亮点 技术定义: 腾讯医疗大模型是一款基于腾讯混元AI生成技术的医疗健康智能体,旨在构建“个人健康助理 二、产品应用场景 受众群体 场景痛点 解决方案 家庭医生/基层医疗 1个家庭医生团队需管理约 3,000 名居民(基于14亿人口测算),全国仅 42万 个团队(2022年数据),任务繁重。 功能框架 产品架构分为两大核心模块: 个人健康助理(To C/患者端): 包含健康自诊、用药助手、报告解读、健康咨询及权威科普联动。 3. 产品优势 语义理解: 支持自然语言交互,具备多轮追问能力,符合医学逻辑。 个性化生成: 结合居民健康标签,生成涵盖饮食、运动、监测体征、用药、并发症预防等全方位的健康宣教内容。 四、典型案例 案例一:智能随访与个性化管理(居民端) 背景: 患者“赵红英”需要进行长期的康复训练与复查管理,涉及多次复查(第1次、第2次、第3次)及康复训练计划。
大模型就像个满腹经纶的学者,能说会道却迈不出书房;而AI智能体,就是给这位学者装上“行动能力”的技术方案——不用重构底层模型,核心是通过三层技术设计,让大模型从“只会回答”变成“自主做事”。 今天用大白话拆解智能体开发的核心技术,普通人也能看懂落地逻辑。首先要明确:智能体开发的技术核心是“闭环能力”,而非创造新模型。 比如做一个“市场分析智能体”,技术上要先定义Prompt模板:“用户需求是{目标},需依次执行:1.调用行业数据库获取{时间范围}数据→2.用统计工具分析核心指标→3.生成可视化报告→4.校验数据准确性 比如用户问“上月电商销量Top3产品”,智能体先让大模型识别“需查销售数据库”,再自动生成SQL查询语句,拿到数据后整理成通俗回复。 其实AI智能体开发,本质是“技术落地的工程思维”。不用纠结大模型的底层原理,核心是把“用户需求”通过任务规划、工具对接、反馈闭环三大技术环节,转化为大模型能执行的行动。
v=Wb5ZkZUNYc4&list=PLB1k029in3UhWaAsXP1DGq8qEpWxW0QyS&index=6 内容整理:王怡闻 在 Linjie Li 的演讲中,她回答了多模态智能体中的重要问题之一 :如何用大模型将多模态智能体串联起来。 图3 这种范式在NLP领域已有所应用,将一些特定的工具(如搜索引擎等)应用到更加复杂的任务上。 图4 受到NLP领域的启发过去几个月间,多模态智能体领域的进展十分迅速,并且涉及到了多个领域,如下图。 后面将以MM-ReAct作为例子展示多模态智能体是如何工作的。 而随着大模型的不断更新,在这个新范式下建立的多模态智能体系统的能力也会随之增强。 图9 GPT + SAM -- 理解人类指令 我们可以将不同的模型结合到一起,以应对更复杂的任务。
一、 产品定位与核心亮点 腾讯医疗健康智能体是基于腾讯混元大模型的医疗健康领域AI应用。 其核心技术属性为医疗垂直领域大语言模型,商业差异化卖点在于将大模型技术与专业的医学知识库(腾讯医典)相结合,为个人用户和医疗机构提供精准、专业的健康信息服务和医患沟通效率工具。 三、 应用框架和功能介绍 功能框架 产品主要分为两大模块:面向个人用户的健康助手和面向医疗机构的医患沟通与报告辅助工具。 硬核指标 技术基础:基于腾讯混元大模型。 四、 典型案例 智能随访管理场景 背景:家庭医生团队需高效管理大量签约居民,完成随访任务。 总结 腾讯医疗健康智能体通过大模型技术,在个人健康服务层面实现了更精准、便捷的信息获取与指导;在医疗机构服务层面,有效助力医患沟通效率提升(智能随访、辅助沟通)和报告处理流程优化(报告提效),达成了“增效降本
三者是“总-分-延”的关系:AI包含大模型与智能体,大模型为智能体提供能力基础,智能体是大模型落地的关键形态。一、核心概念:AI、大模型与智能体的本质拆解1.1什么是AI(人工智能)? 五、应用边界:这些事AI、大模型与智能体还做不到尽管三者能力强大,但并非“万能”,核心局限集中在以下3点:缺乏真实认知与意识:三者均不具备人类的“意识”与“真实认知”——大模型的输出是基于数据训练的 6.3深度定制开发(中高门槛,适合开发者)大模型:基于开源框架(如Llama3、DeepSeek),用自有数据微调,适配垂直领域(如医疗、金融);智能体:用LangGraph、AutoGen等框架,搭建自定义闭环逻辑 Q2:大模型与智能体,哪个更适合普通职场人?答:优先从大模型入手,再逐步使用智能体。 大模型适合解决“内容生成类”需求(写文案、答疑、翻译),操作简单;智能体适合解决“复杂执行类”需求(自动化办公、批量任务),可在熟悉大模型后,根据工作场景逐步尝试。Q3:如何避免大模型的“幻觉”问题?
当面对超出其训练数据边界和固有知识范畴的问题时,智能体大模型往往会陷入困境,却浑然不知,这便是知识盲区带来的隐患。 如何构建能够自动发现自身知识盲区的智能体大模型,成为当下人工智能领域亟待攻克的前沿难题,它关乎着智能体大模型能否真正实现从“智能助手”到“可靠伙伴”的跨越。 元学习能够帮助智能体大模型学会如何学习,使其在面对新问题时,快速调整学习策略和知识运用方式。 这样,智能体大模型在不断的学习和试错中,逐渐强化对自身知识边界的感知能力。知识图谱技术也为智能体大模型探测知识盲区提供了有力支撑。 然而,要实现让智能体大模型具备高效、准确的自动知识盲区发现能力,仍然面临诸多挑战。
懂所思、知所能、行所意,是大模型驱动多智能体协作的主要能力。 智能体可赋予大模型物理实体,使其具备与真实物理世界感知交互的能力。 http://mpvideo.qpic.cn/0bc3omabaaaaiaannb7ckbsfa46dcbzqaeaa.f10002.mp4? 1 大模型下的异构智能体协同 人工智能场景分工趋向细化,探索 AI 工程化路径中,大模型控制智能体是大势所趋。 可以看到,通过大模型调度多种智能体自主协作,大模型具备了对无人机集群、机器狗、机械臂等智能体的真机协同控制能力。 智能体可赋予大模型物理实体,使其具备与真实物理世界感知交互的能力。 比如,智能体可能需要为大模型寻找甚至生成更好的训练数据,这个过程中我们要确保智能体的行为符合伦理,不侵犯人类隐私。 第四是新型智能体设计。
简单来说:大模型是智能体的 “核心能力引擎”,智能体是大模型从 “被动响应” 到 “主动解决问题” 的 “系统载体”—— 没有强大的大模型,智能体难以实现复杂任务的理解与规划;但仅靠大模型,无法成为能自主完成任务的智能体 二、大模型与智能体的核心关系:大模型是智能体的 “能力基石” 智能体的 “自主做事能力”,本质是靠大模型解决了 “最核心的理解与规划难题”。 决策层:“选择方案的决策者” 任务执行中会遇到多个选项,大模型负责基于目标和约束条件(如预算、偏好)选择最优方案: 例:订酒店时,智能体调用 API 返回 3 个选项(A 酒店:近地铁,价格 500 元 点击‘申请退款’;3. 上传商品照片;4. 等待审核”—— 用户需自己手动操作,大模型不跟进结果。 简单来说:大模型决定了智能体的 “智商上限”,智能体决定了大模型的 “价值下限”—— 没有大模型,智能体是 “空壳系统”;没有智能体,大模型是 “闲置的能力”。
大模型智能体(Agent):从概念认知到工程落地让AI不再是“聊天框”,而是能干活、会规划的自主实体一、先建立直觉:什么是智能体? 1.1 一个比喻帮你秒懂概念比喻说明大模型(LLM)大脑能思考、推理、生成文字智能体(Agent)完整的人大脑 + 眼睛(感知)+ 手脚(工具)+ 记忆 + 规划能力智能体 = 大模型 + 工具调用 + 二、智能体的核心架构(四层模型)在企业级项目中,我们通常把Agent拆成以下四层:第一层:感知层(Perception)Agent如何“看到”世界? content": user_query}] for step in range(max_steps): response = call_llm(messages) # 调用大模型 回顾你这一路的探索:你掌握的技能在Agent中的位置Vibe Coding快速生成Agent原型代码ComfyUI工作流理解“节点编排”思想,迁移到Agent流程设计Go运维开发编写高并发、高可用的Tools层手写大模型深入理解
智能体开发的核心不是“造新模型”,而是“用好现有大模型”。 基础大模型(比如GPT、文心一言)已经掌握了海量知识,我们不用重复训练,关键是解决三个问题:让它知道“做什么”、学会“怎么干”、能应对“突发情况”。第一步,明确目标与边界:给智能体定“任务清单”。 第二步,工具调用:给智能体装“手脚”。大模型本身不会直接操作软件、查询数据库,这就需要给它对接各种“工具”——比如查询库存的数据库接口、发送通知的短信API、整理文档的办公软件插件。 ,智能体先让大模型识别出“需要查库存”,再自动生成查询数据库的SQL语句,拿到结果后再翻译成自然语言回复用户。这里要注意工具的兼容性,不用追求“高大上”,能稳定调用、数据准确比什么都重要。 其实AI智能体开发,本质是“技术落地的思维”——不用纠结底层模型的复杂原理,而是聚焦“用户需求”和“实际场景”,把大模型的知识转化为可执行的行动。
从单智能体到多智能体协作:2026年大模型智能体开发现状与实践当ReAct框架成为过去式,我们如何构建真正能协作、会反思、能落地的生产级智能体系统? 前言2024年,智能体开发还停留在“Prompt + 工具调用”的简易编排;2025年,LangGraph和AutoGen开启了有状态图控编程的新范式;到2026年,智能体开发已演变为一个融合原生模型能力 创建工具search = TavilySearchResults(max_results=3)# 3. 3.2 安全围栏:独立于主模型的盾层大模型本身无法保证输出安全性,我们需要一个独立的小模型守卫:class Guardrail: def __init__(self, guard_model, threshold (p95、p99)幻觉率生成内容中包含的虚构事实比例使用 RAGAS 或 FactScore 工具共识达成时间多智能体协商收敛所需轮次日志分析五、总结与展望当前智能体开发的三个关键认知:智能体 ≠ 大模型
企业级大模型与智能体应用实践指南王文广(kdd.wang@gmail.com)四:功能定义与提示词工程——将通用智能驯化为业务组件现在,路已铺好,桥已架通,真正的挑战随之而来:如何接入智能? 而在大模型集成的架构中,引入了一个全新的单元:LLM Task(大模型任务)。 这种架构布局传达了一个核心理念:人工智能是在增强工作流,而不是替代工作流。AI大模型不应该接管整个业务流程的控制权(至少在当前阶段)。相反,它应该被封装为一个无状态的原子服务。 3. 少样本学习(Few-Shot Learning):行为的锚点通用大模型虽然具备零样本(Zero-Shot)推理能力,但在企业级应用中,其稳定性往往难以满足SLA(服务水平协议)要求。 为了解决这个问题,企业级集成通常采用以下策略:预填充(Prefill):在Prompt的末尾强制加上{,诱导模型直接开始输出JSON体。
如何理解AI大模型和智能体?深入浅出大语言模型心智模型“意向立场” 文 | 王文广在日常生活里,我们总是自然而然地揣测他人的想法——“他觉得天气太冷”,“她希望尽快结束会议”,“他认为我在撒谎”。 同理,当大模型展现出足以完成复杂认知任务的“智能行为”时,我们最合理的做法,就是像对待火星人一样,采用意向立场来理解它们。 DeepSeek-V4的开源发布,对智能体的应用有着极大的促进,数以万计的企业可以本地化部署大模型来开发智能体。 但如何开发先进的智能体,能够充分利用DeepSeek-V4,王文广所著的《智能体系统导论:架构与工程实践》一书实乃佳作,该书剥离了对人工智能能力的过度拟人化想象,回归计算机科学与软件工程的本质,借鉴OpenClaw 它告诉我们,无论一个智能体的“血肉”是碳基还是硅基,当其行为足够复杂时,将其视作一个“有心智的它者”,便是我们所能采取的一种明智的立场。