首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >从云原生演进到云原生 AI:TCS AI infra解决方案

从云原生演进到云原生 AI:TCS AI infra解决方案

作者头像
腾讯专有云
发布2026-07-10 21:27:08
发布2026-07-10 21:27:08
1700
举报
文章被收录于专栏:腾讯专有云腾讯专有云

导读

AI 浪潮席卷而来,算力争夺白热化,模型迭代日新月异,云原生为AI业务创新提供强大动力。企业正站在一个历史性的分叉路口:如何在算力短缺、模型复杂、存量系统庞大的重压之下,充分利用现有建设成果,快速构建支撑 AI 业务的基础设施?腾讯专有云 PaaS 平台(Tencent Cloud-native Suite, 简称 TCS ) 给出了自己的答案——从云原生演进到云原生 AI, 构建覆盖从异构算力管理到 AI 应用接入全链路的 TCS AI Infra 解决方案。


需求变革:从"云原生"到"云原生 AI"的范式转移

云原生为AI业务创新提供强大动力,已成为企业数字化转型的共识。CNCF 在 2024 年发布首份《云原生 AI 白皮书》,正式确立“云原生 AI(CNAI)”这一范式:用云原生原则构建和部署 AI 应用,在资源效率与开发部署效率上双向赋能。云原生 AI 平台正经历如下三段演进:

TCS AI Infra 破局之道

TCS AI Infra 面向私有化企业级 AI 落地需求,打造一站式云原生 AI 解决方案,整体以六大核心能力为核心支撑:

  • 全场景 AI 网关接入:AI大模型网关提统一纳管主流模型服务与企业自建推理服务,帮助客户以统一标准完成接入、鉴权、路由和计量;
  • AI MCP 网关能力:将企业现有微服务快速改造为 MCP 兼容工具,把存量系统能力,变成 AI 可调用的能力;
  • AI 服务治理与观测:提供一站式 AI 应用管理与服务注册能力,实现全链路可观测。
  • 容器化与沙箱运行:为 AI Agent 提供专属安全沙箱,同时支持业务弹性伸缩与高性能网络调度;
  • 异构算力统一管理:支持国内外主流GPU 芯片,对 GPU 服务器、容器集群、AI 模型及业务应用实现平台化统一管控与运维;
  • 云原生 PaaS 扩展:支持按需扩容消息队列、缓存、对象存储等商业化 PaaS 能力,统一管理与运营。

TCS AI Infra 七大解决方案

方案一:容器GPU调度管理

应用场景

  • AI Agent 执行底座:作为 Agent 的核心运行时(Runtime),提供高可靠、强隔离的托管环境,支持根据任务负载动态弹性扩缩。
  • 长尾小模型池化:通过 qGPU 算力切分技术,实现物理 GPU 资源精细化池化与多任务共享,显著提升资源周转率。
  • 信创与多芯混合:支持国产芯片与国际主流芯片统一纳管,助力政企客户平滑实现信创迁移。

解决方案

  • 高可用 Agent 运行时:依托原生容器服务实现服务秒级启动,并利用 qGPU 极小颗粒度切分能力,保障 Agent 频繁推理的响应效率。
  • 异构算力池化管理:通过“一云多芯”技术屏蔽硬件差异,构建统一容器资源池,结合严格的多租户机制确保数据隔离与合规。
  • 闭环自动化运维:提供全天候芯片状态监控与自动化巡检,确保 Agent 运行环境的高可用与“零宕机”体验。

方案二:AI 大模型网关

应用场景

大模型技术快速发展使得企业需要同时接入多个AI模型,但缺乏统一治理平台导致模型使用混乱。不同模型在性能、成本、适用场景上存在显著差异,人工调度难以实现快速资源配置。流量波动剧烈时,单一模型容易成为性能瓶颈,且模型调用成本控制困难,总体拥有成本不可控。

解决方案

  • 提供标准 OpenAI 兼容的 AI 网关,屏蔽底层模型差异,实现业务系统的无感切换与配置化管理;
  • 建立集中式密钥与鉴权体系,支持多团队、多应用的独立配额与计费视图,解决成本归属难题;
  • 内置智能路由策略引擎,支持按成本、延迟、权重等多维度自动调度流量并具备Fallback机制,在保障服务高可用的同时,最大化资源利用效率与性价比。

方案三:AI MCP网关

应用场景

企业存量业务系统沉淀了大量核心数据与业务逻辑,是企业最有价值的资产。但这些系统普遍以 REST/HTTP 接口形式对外提供服务,无法直接被 AI Agent 以 MCP 协议调用,导致 AI 能力难以快速与现有业务能力打通,存量系统的价值无法在 AI 时代得到充分释放。

解决方案

TCS 提供 MCP 网关,提供 MCP Sever 统一管理。对于存量企业业务,也支持存量 HTTP 业务转 MCP,通过配置化手段将传统RESTful API快速封装为标准MCP工具,实现存量资产的零代码AI化接入;提供工具调用全链路安全审计,在数据流转过程中进行严格鉴权,并留存完整的参数与结果日志,确保每一次工具调用均可追溯、可管控,满足企业严苛的合规要求。

方案四:AI 注册中心

应用场景

企业在 AI 转型中面临一个核心矛盾:存量微服务沉淀了大量业务能力与数据,但普遍以 REST/HTTP 接口对外提供服务,无法被 AI Agent 以 MCP 协议直接发现与调用;与此同时,新建的标准 MCP 服务缺乏统一管理平台,工具注册散落在各个团队内部,AI 应用难以按需获取企业级的工具供给;此外,随着 Agent 应用场景的深化,Agent 之间需要通过 A2A(Agent-to-Agent)协议实现跨服务协作与状态共享,但同样缺乏统一的注册与管理机制。

三类服务来源并存且管理模型截然不同,企业亟需一个统一的"AI 能力市场",让标准 MCP 服务、存量微服务转化而来的 MCP 服务以及 Agent 服务在同一平台内完成注册、发现、配置与安全治理。

解决方案

北极星 AI 注册中心提供三类 AI 服务的统一管理能力:

  • 对于新建的标准 MCP 服务,支持通过 SDK 直接注册或 MCP URL 一键导入,自动同步工具列表并管理服务全生命周期;
  • 对于存量微服务,提供"微服务转 MCP 服务"能力,通过配置化手段将传统 HTTP API 映射为标准 MCP Tools,经由 MCP 网关完成协议转换后即可被 Agent 调用,实现存量业务零代码 AI 化接入;
  • 对于需要跨 Agent 协作的场景,支持 A2A 协议服务注册与管理,实现 Agent 间的服务发现、任务分发与状态同步。

平台进一步提供分布式配置管理、SSE 与 Streamable HTTP 双协议支持、提示词安全管理与加密存储、服务治理(熔断降级/限流/动态路由)及全链路可观测能力,并集成 Spring AI Polaris 开发框架,帮助企业构建统一的 AI 服务治理平面。另外北极星 AI 注册中心对于 Skills 统一管理的能力也在规划实现中。

方案五:沙箱容器

应用场景

  • 第三方代码安全托管:在 Agent 运行平台等场景下,针对用户自定义脚本或不可信插件,通过独立内核提供虚拟机级别的强隔离,防止恶意代码逃逸并威胁宿主机安全;
  • 多租户业务硬隔离:针对金融、政务等高敏感行业,确保不同租户的业务在共享物理资源时,实现计算与数据的全栈隔离,满足严苛的安全合规与审计要求。

解决方案

  • 轻量化虚拟化架构:采用精简的 VMM(虚拟机管理器)为每个 Pod 构建独占的 Guest Kernel,从底层逻辑上消除容器间共享内核的安全隐患,同时保持毫秒级的启动响应;
  • 透明化集成与资源弹性:深度适配 TCS 容器平台与 K8s 标准接口,支持资源动态热插拔;在不改变现有业务开发习惯的前提下,实现异构算力环境下的敏捷交付与高效利用。

方案六:TCS Agent

应用场景

  • 全栈智能问答:集成 TCS 专属知识库,支持 KubeVM 操作及最佳实践的自然语言交互,降低上手门槛。
  • 多维自动排障:自动执行 kubectl 诊断,精准定位 Service 配置、IP 冲突及网络连接异常等根因。
  • 多 Agent 协同诊断:指挥、诊断与子产品 Agent 联动,跨越应用与底座层级,自动识别节点负载等导致的性能瓶颈并提供优化建议。

解决方案

  • “指挥+诊断”双引擎:基于意图识别与任务委派,通过 MCP 工具集实现“分析-执行-纠偏”的自动化闭环。
  • Sandbox 安全执行环境:引入基于 Kata 安全运行时的沙箱,确保排障脚本在强隔离环境下运行,不触碰生产边界。
  • 闭环持续进化:通过用户反馈驱动优秀案例回录知识库,结合 E2E 自动化评估,实现诊断准确率的自我进化。

方案七:云原生 PaaS

TCS可按需扩展消息队列 TDMQ(支持 RocketMQ、Pulsar、RabbitMQ、kafka协议可选)、缓存数据库Credis、对象存储CSP等商业化 PaaS 能力。

荣誉背书:实战检验,权威认证

TCS AI Infra 并非概念先行,而是已经经历了严苛的实战考验。在 2025 金融科技大会举办的金融科技应用场景大赛中,腾讯专有云「基于TCS的AI异构算力管理平台」从全国 89 家机构提交的 280 个项目中脱颖而出,荣获「十佳应用奖」

在资质认证方面,TCS 也已获得:信通院云原生能力安全成熟度 L4 级认证大规模容器集群性能·卓越级认证容器平台安全能力·先进级认证通过中国信息安全测评中心自主原创产品测评云原生平台中间件管理能力评估·先进级等多项认证。TCS 支持国产主流 CPU、GPU、OS,完全满足国产化、自主可控项目建设要求。


凭借权威认证背书与金融、政务等多行业实战验证,TCS AI Infra 不仅解决了 AI 落地过程中的安全、成本、效率难题,更助力企业打通 “云原生能力” 与 “AI 价值释放” 的壁垒,实现从“云原生” 到 “云原生 AI” 的平滑演进。未来,随着大模型技术与云原生生态的持续融合,腾讯专有云 PaaS 平台将持续深耕技术创新、打磨产品能力,以更成熟、更安全、更高效的解决方案,赋能千行百业在 AI 浪潮中突破边界、智领未来。

END

关注腾讯专有云公众号,了解更多云与 AI 应用的最佳实践!

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-05-12,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 腾讯专有云 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档