首页
学习
活动
专区
圈层
工具
发布

把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂

内容编辑丨特工小海 特工小饼

内容审核丨特工少女

今年 WAIC,我们在超聚变展台看到了一台面向办公室场景的本地 AI 设备:TokenBox。

据超聚变产品资料,TokenBox 单机最高可支持参数规模达 1.6T 的模型,GPU、CPU、内存和存储均可按需扩展,主流负载噪声低至 35 dBA。

超聚变想解决的,不只是算力问题,而是如何让原本更多部署在专业数据中心的高性能 AI 基础设施,进入研发办公室、医院科室和企业分支机构。

按照超聚变的定位,TokenBox 是一套面向办公室场景的企业级本地 AI 平台。它将算力模块、模型服务、推理加速、Token 运营和安全管理整合进同一套产品体系,让企业能够在本地持续生产、调度和管理 Token。

这里所说的 Token 生产,并不是单纯追求生成更多 Token,而是将本地算力转化为可计量、可调度的模型推理和 Agent 服务能力。

TokenBox 瞄准的,是工作站与数据中心服务器之间的一类部署空白:

工作站部署方便、距离业务更近,但卡数、显存和互联能力有限,面对大参数模型、长上下文和多人并发时,容易触及性能上限。数据中心服务器拥有更强的性能和扩展能力,却依赖专业机房、供电、制冷和运维条件,其噪声与散热要求也使其难以直接进入普通办公空间。

两者之间,企业缺少的是一种既具备较强性能和扩展能力,又能适应普通办公环境,并支持长期运营与治理的本地 AI 基础设施。

因此,TokenBox 首先要回答的问题是:高性能 AI 算力,如何真正进入普通办公环境?

把 Token 生产平台搬进办公室

那么,TokenBox 如何真正进入普通办公环境?

关键并不是简单缩小服务器的尺寸,而是针对办公室和边缘场景在空间、噪声、散热、供电和运维等方面的实际条件,对本地 AI 生产所需的硬件、软件与运营能力进行一体化重构。

这意味着,TokenBox 不仅要提供本地算力,还要同时回答五个问题:

算力能否按需扩展?设备能否适应普通办公室的噪声、散热和供电条件?多人并发时能否稳定提供推理服务?模型部署和日常运维能否进一步简化?模型能否持续演进,Token 与数据又能否得到有效运营和治理?

围绕这五个问题,TokenBox 构建了相应的产品能力。

第一,支持大参数模型,并可按需扩展。

TokenBox 单机支持 1.6T 参数模型,为企业在本地部署旗舰级模型提供了更高的能力上限。支持4类独立的Pack:GPU、CPU、Memory、Storage,单机4Pack全互联,架构支持多机互联。

企业可以从较小配置起步,再根据 Token 消耗和业务变化逐步升级。相比固定配置的工作站,这种设计让企业不必在建设初期一次性投入全部资源,也能降低扩容时整体更换设备的必要性,保护前期投资。

第二,让高性能 AI 进入普通办公环境。

TokenBox 采用 DC 级液冷设计,主流业务负载下可低至35dB,达到图书馆级静音。

这项能力直接影响 AI 基础设施能否进入真实业务现场:医院科室、研发办公室和企业分支机构通常无法提供标准机房条件,也很难接受传统 AI 服务器的高噪声和散热要求。

TokenBox 的意义在于,让原本更多部署在数据中心的高性能算力,可以进入团队日常工作的空间。

第三,通过软硬协同生产更多有效 Token。

TokenBox 内置 Smart 推理加速套件,围绕推理引擎、任务调度、KV Cache、算子优化和内存管理进行软硬协同优化。根据超聚变产品材料,在特定超长上下文场景中,Smart 系列能力可实现 100% 以上的性能提升。

当核心业务和普通请求同时访问模型时,TokenBox 可以根据优先级进行调度,避免关键任务被长上下文请求或低优先级任务拖慢。

第四,降低模型部署和日常运维门槛。

软件层面,TokenBox 集成 FusionOne AI Foundation,并通过本地 FusionXplay 提供模型和应用获取能力。

传统私有化 AI 设备交付后,模型部署、版本升级和性能调优往往需要客户自行完成。面对快速迭代的模型和推理引擎,企业很容易在几个月后陷入版本落后或升级困难。

基于这些软件能力,TokenBox 提供 AI Native 交互。用户可以通过自然语言完成模型部署、版本检查、运行监控和性能优化。设备还可预置模型、Skill 和数字员工,上电后即可开始生产 Token。

第五,让模型持续演进,让 Token 可运营、可治理。

除了算力和模型服务能力,TokenBox 还集成 ModelEver、TokenOps 及安全套件,覆盖模型更新、Token 运营和本地安全管理。

ModelEver 提供 Day0 模型永新能力。新模型发布后,系统可完成自动发现与获取、兼容性验证和镜像打包,再将经过验证的模型推送到本地设备。模型、推理引擎和加速组件能够独立升级,降低更新对业务连续性的影响。

TokenOps 则让 Token 从无序调用变成可运营的企业资源。企业可以查看不同部门、项目和 Agent 使用了多少 Token,设置配额和预算,并通过智能模型路由,减少简单任务调用大参数模型所造成的资源浪费。

同时,TokenBox 支持本地数据闭环,并提供内容防护、行为管控和审计能力。对医疗、金融、研发等敏感场景而言,数据不出域、调用可追溯、行为可审计,是 AI 进入核心业务的重要前提。

TokenBox 从算力扩展、环境适配、并发推理、部署运维和安全治理五个方面,给出了“如何把高性能本地 AI 生产平台搬进办公室”的产品答案。

被真实业务验证过的 AI 基础设施

但对企业级 AI 基础设施而言,功能完整只是第一步,真正的检验来自业务现场:

在长上下文、高并发请求和严格的数据安全要求下,系统能否持续稳定地提供推理服务,并兼顾安全治理与运维效率?

具体到业务现场,AI Coding 和多 Agent 协同办公是 TokenBox 两类较为典型的落地方向。

在 AI Coding 场景中,TokenBox 可以承载代码生成、需求分析、知识库检索、测试和评审等任务,为研发团队提供本地模型和算力环境。

研发代码与内部知识可以保留在本地,从而降低对公有云 API 的依赖;团队也可以根据任务优先级管理本地算力,避免关键任务与普通请求无序争抢资源。

在全流程办公场景中,TokenBox 可以承载财务审批、智能客服、会议纪要和经营分析等不同类型的数字员工。

通过模型路由,简单任务与复杂推理任务可以调用不同模型;通过 TokenOps,Token 消耗也可以按照部门、项目和具体场景进行统计。

相比上述场景分析,目前更具体的业务验证来自医疗行业。

在创业慧康 BsoftGPT 医疗场景测试中,TokenBox 本地部署 DeepSeek-V4 旗舰大模型。面对约 5000 Token/request 的医疗长上下文负载,系统在 128 并发下实现 100%请求成功,累计处理超过 1240 万 Token。

这类测试的价值不只在于峰值性能,而在于真实医疗负载下的稳定承载能力。

医疗智能体需要处理长病历上下文、RAG 多源检索、医护多轮交互、批量病历生成、异步质控和科研筛查。与此同时,病历和患者数据又要求本地化部署、权限控制和日志审计。

在这一场景中,TokenBox 提供的不只是一组 GPU,而是让医疗智能体具备本地化、稳定化和可治理运行能力的基础设施。

正如创业慧康在论坛上所总结的:

医疗 AI 的竞争,最终不是谁拥有一个模型,而是谁能让模型稳定、安全、可运营地进入真实业务场景。

从 TokenBox 到 Token Factory:企业 AI 生产的新思路

那么,这台设备为什么会被设计成这样?

答案要回到它背后的厂商和理念。

TokenBox 由超聚变打造。但它并不是一台孤立的 AI 一体机,而是超聚变 Token Factory AI 一体化解决方案面向办公室和边缘场景的产品化落地。

TokenBox 回答的是高性能 AI 算力如何进入办公室,而在算力进入业务现场之后,企业还要回答一系列运营问题:

资源如何调度和计量?不同任务应该调用什么模型?Token 成本如何控制?Agent 又如何将这些投入转化为可核算的业务结果?

这正是超聚变提出 Token Factory 的起点。

超聚变算力事业部总裁唐启明用一条公式,概括了 Token Factory 从基础设施投入到业务价值产出的完整链路:

WATTFLOPSTOKENSAGENTSVALUES。

围绕这一判断,超聚变提出了 Token Factory 方法论:它试图将企业从算力投入到业务价值产出的完整链路,组织成一套可以持续生产、调度、计量和治理的体系。TokenBox 则是这套方法论面向办公室和边缘场景的产品化落地。

当 AI 从个人工具进入企业核心流程,仅靠“采购服务器、部署模型、开放调用”,已经很难应对跨部门资源调度、成本核算、模型更新和安全治理等问题。

企业内部可能同时存在公有云 API、私有化算力、边缘节点和个人工作站,不同部门也可能各自部署模型和资源池。随着调用规模扩大,重复建设、资源闲置和关键业务争抢算力等问题会逐渐显现。

例如,简单的文档摘要与长上下文代码分析,如果都调用同一个大参数模型,就会产生不必要的资源消耗;多个部门共享同一套算力时,如果缺少优先级和配额管理,低优先级任务也可能挤占资源,拖慢核心业务。

因此,Token Factory 关注的不只是如何获得算力,更是如何把分散的算力、模型和 Agent 组织成一套可持续运营的企业 AI 生产系统。

按照超聚变的划分,这套体系分为三层,分别回答三个问题:

算力从哪里来、任务应该调用什么模型,以及 Token 如何被计量和治理。

所以 Token Factory 设计的第一层是算力基础设施。它覆盖云计算、超节点、服务器、边缘设备和桌面设备,通过虚拟化、容器化和统一调度,将不同地点、不同类型的算力组织成统一资源池。

Token Factory 的第二层是模型与算力服务。这一层负责模型管理、多模型路由、推理加速和资源服务化。简单问答可以调用小模型,复杂编码、深度推理再调用大模型,避免所有任务都占用高规格算力。

最后第三层是 Token 度量与运营。TokenOps 记录不同组织、项目和 Agent 的 Token 消耗,支持计量、配额、预算和成本归因,并根据质量、性能和成本选择更适合的模型。AgentCare 则进一步提供沙箱、权限、智能记忆和运行观测,让 Agent 能够更安全、稳定地进入企业业务流程。

在这套体系下,企业评价 AI 基础设施的标准开始从“有多少卡”转向“能生产多少有效 Token”,再进一步转向“这些 Token 是否支撑了可用的 Agent 和可核算的业务结果”。

这套方法论在真实环境是否有效呢?成本是另一项关键验证指标。

按照超聚变自己内部验证的两年期测算,自建 Token Factory 相比同等用量采用云服务的成本大幅降低。

在相应测算条件下,Token Factory 对于 Token 消耗较为稳定、数据安全要求较高的企业,私有化部署可能在成本、数据治理和业务连续性等方面体现出综合优势。

从设备交付转向 AI 生产力交付

过去企业建设 AI 基础设施,首先考虑的是采购多少张卡、部署多大的模型。

进入 Agent 时代之后,企业还需要继续追问:

这些算力能够生产多少有效 Token?在多人并发和长上下文任务下是否稳定?模型能否持续升级?Token 成本能否被计量和优化?Agent 能否在安全边界内执行任务?

Token Factory 给出的是一套从算力到业务价值的方法论,而 TokenBox 则把这套方法论压缩进办公室可部署的产品形态中。

它将算力、模型、推理加速、Token 运营和安全能力组合在一起,让企业不必先建设专业机房,也不必从零组建 AI Infra 团队,就能够获得一套可扩展、可演进的本地 Token 生产平台。

当 Token 持续进入软件研发、医疗服务、经营分析和企业办公流程,AI 基础设施也会从一次性交付的设备,转变为一套 7×24 小时运行的生产系统。

这套系统进的是电,产出的是 Token,支撑的是 Agent,最终需要交付的是业务价值。

而 TokenBox 要做的,正是把这条 Token Factory 的生产线带到每一个团队和企业身边。

- 完 -

  • 发表于:
  • 原文链接https://page.om.qq.com/page/Oid5LG24wdD2x6izTZ93cW6w0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券