首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >腾讯云大模型双底座:一云多芯智算平台与全链路安全架构解析

腾讯云大模型双底座:一云多芯智算平台与全链路安全架构解析

原创
作者头像
gawain2048
发布2026-05-31 06:06:45
发布2026-05-31 06:06:45
4910
举报

报告人:周斌(腾讯安全总经理)

一、 产品定位与核心亮点

腾讯云针对生成式AI时代算力供需、适配成本与多生态兼容的挑战,推出了旨在支撑千行百业构建AI原生应用的“双底座”技术解决方案:

  1. “一云多芯”智算平台(算力底座):集成了软硬协同的高性能计算集群(HCC),通过底层硬件无感隔离与上层加速框架(TACO),提供高扩展、高利用率的分布式训练与推理算力资源。
  2. 大模型全链路安全体系(安全底座):覆盖大模型本体安全、应用安全与内容安全,融合“打自己”的红蓝对抗演练机制与天御智能内容风控平台,构建从数据采集、模型训练到推理发布的数据流转闭环防护。

商业差异化卖点“零”代码改造适配的主流框架兼容能力;软硬自研一体化(自研星脉网络+自研星星海服务器/芯片);基于20多年运营经验与万亿级违规处理数据的AIGC内容合规引擎。


二、 产品应用场景

本解决方案适用于各类参与大模型开发与应用落地的技术受众与业务环节,旨在解决特定场景下的技术瓶颈与安全隐患:

  • 算力消耗型受众(中小企业、开发者、数据科学家):在面临算力获取难、成本高时,通过高性能应用服务(HAI)的WebUI、Notebook及API接口,进行即插即用、开箱即用的AI研发(涵盖文生图、AI问答、代码生成等应用形态)。
  • 底层架构与运维人员(算法工程师、数据工程师、实施工程师):针对硬件利用率低及模型迁移成本高的痛点,在模型预训练、参数微调(精调)及分布式推理场景下,利用配套迁移工具实现分钟级自动适配与算力精细化调度。
  • 大模型业务运营与合规团队:在应对大模型特有的“AI幻觉”、训练数据泄露、生成诱导性/虚假信息等风险时,在模型测试与线上运行阶段,使用自动化Prompt安全测评与天御AIGC风控平台进行合规阻断与内容审计。

三、 应用框架和功能介绍

1. 功能框架

  • 基础设施层:包含GPU云服务器、裸金属云服务CBM、星星海服务器及自研芯片,采用分布式云架构(涵盖TCE专有云、CDC本地专有集群、CDZ专属可用区、TEZ边缘可用区)。
  • 软件定义层:依托云原生能力,提供5%超细粒度的qGPU单卡算力隔离切分。
  • 编排调度与框架层:利用TKE容器服务与机器学习平台,结合自研加速框架TACO Kit(包含TACO Train与TACO-Infer),实现训练一键部署与推理混布调度。
  • 大模型安全流转框架:贯穿数据清洗、标注、预训练、精调、打包含发布的各个环节,内置DSGC(数据分类分级/溯源)、CASB(动态/静态数据脱敏)、KMS/TSM与里约网关等安全组件。

2. 硬核指标(数据驱动)

  • 网络吞吐与通信:全面搭载升级至2.0架构的自研星脉网络,提供 3.2 Tbps RDMA 网络带宽,实现集群容量翻倍。
  • 集群算力与资源利用:千卡集群训练性能扩展比高达 96%;基于TKE自研混部调度能力,硬件资源利用率达到 99%+。(数据来源:腾讯混元真实业务实测
  • 模型训练与部署效率:实测性能高于友商 30%+;任务异常恢复机制使模型训练提效 200%;高性能应用服务(HAI)使部署时间减少 95%
  • 推理性能优化:软硬协同加速使LLM推理性能提升 400%;TACO-Infer使推理性能提升 30%+
  • 安全防御效能:天御AIGC安全产品机器审核准确率达 99.99%,提供 小时级 业务传播风险响应。

3. 产品优势能力全量扫描

  • 极简接入与兼容:“零”改造适配,对业务代码无侵入;全面兼容主流Hugging Face模型(如LLaMA, Falcon, OPT)及开发框架(TensorFlow, PyTorch)。
  • 硬件故障无感知隔离:基于SDHN实现网络故障无感,提供分钟级配套迁移评估。
  • 全栈内容安全管控:提供包含专家服务、数据服务、版权服务、机审服务、CEM服务在内的五大服务体系,支持音频、图片、文本、视频的多模态版权识别与暗水印校验。
  • 全生命周期攻防演练:提供从“模拟攻击者行为”到“自动化攻击样本生成”、“风险收敛”的Prompt安全测评,支持从AI基础设施到核心数据、上线前风险的常态化多轮攻防演练。

4. 荣誉背书与行业标准

  • 大语言模型安全性测评基准:由 腾讯混元大模型、腾讯朱雀实验室、清华大学、OWASP中国 联合发布。该基准规定了14项子类(含指令劫持、DAN反向诱导等Prompt安全,及训练数据泄露、伦理道德等内容安全),明确要求:采用人工抽检方式(每项题库随机抽取至少 1000条),模型生成内容抽样合格率 不应低于90%

四、 典型案例

全域生态客户集群交付成效

注:因原始材料为生态客户群像展示,以下以统一标准化叙事呈现其平台级交付成效与全量应用客户名单。

1. 业务背景

全国范围内的大模型研发与应用企业,面临大规摸智算集群算力性能遇颈、业务部署周期长、以及百卡/千卡级别长稳训练易中断导致算力浪费的业务困境。

2. 解决方案

客户群体全面接入腾讯云全链路智算产品矩阵,对接底层星脉网络及TACO加速框架,并进行客户自有推理服务系统与腾讯云软件栈的深度打通。

3. 核心成效(实测指标)

  • 稳定性极高:实测可用性达 99.9%,支持 100+小时 的单次长稳训练。
  • 故障响应极快:实现 10分钟 快速故障恢复机制。
  • 性能代差优势:同等规模集群下,性能比友商提升 30%
  • 交付周期极短:在 2周内 即可实现软件栈与客户推理服务系统的无缝对接。

4. 全量覆盖客户名单(覆盖全国90%+大模型客户)

美团, 快手, 小红书, 知乎, 智谱·AI, 百川智能, MINIMAX, XVERSE 元象, miHoYo, 豆瓣 douban, Sogou 搜狗, 面壁智能 ModelBest, DJI 大疆创新, NIO, 值得买科技, XDEMO, 作业帮, TAL 好未来, 猿辅导, 晶泰科技, 中国科学院, 清华大学, 北京大学, BOSCH, PARATERA 并行, 天府绿道, 丙晟科技, 圣剑网络, VS·work 元宇宙引擎, 左手医生, WeBank 微众银行, 渲染100。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、 产品定位与核心亮点
  • 二、 产品应用场景
  • 三、 应用框架和功能介绍
    • 1. 功能框架
    • 2. 硬核指标(数据驱动)
    • 3. 产品优势能力全量扫描
    • 4. 荣誉背书与行业标准
  • 四、 典型案例
    • 全域生态客户集群交付成效
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档