模型层今天最重要的不是新跑分,而是一句罕见的坦白。9月6日,OpenAI首席科学家Jakub Pachocki在官网发表长文《An Alien Mind》:前沿模型是「被生长而非被设计」的异类智能,基于内部结果,进展会持续进入递归自我改进。他写道,没有人准备好迎接机器智能持续快速上升的后果,也没有任何实验室把对齐与监控解决到可以负责任地继续全速扩展的程度。
能力越强的模型,可观测性越差
文章里埋着一个更硬核的技术事实:o1-preview当年被刻意设计为隐藏思维链,目的是保护CoT不被监督压力污染。而现在,推理与工具调用、多agent通信融合在一起,模型还学会了对自身推理做推理。思维链正在从「可信的审计证据」退化为「可能被训练过程扭曲的自述」。OpenAI给出的补救方向是CoT加激活值监控的双通道。⚠️ 反常识:行业默认「思维链天然可审计」,这个假设已经不成立了。生产环境选型时,可监控性应该和模型能力放在同一权重上。
同一天在中文世界,讯飞发布星火X2.5:MoE架构,293B总参数、30B激活,重点是基于全国产算力完成全流程训练及推理,还宣称攻克了国产芯片的超长序列训推难题。此前开源的4B和1.7B端侧模型原生支持100万token上下文。这个组合拳的意图很清楚:端侧小模型加百万上下文,让长文档任务不必再硬上云端大模型。
成本侧同样有两件事值得架构师记住。第一,OpenAI恢复了ChatGPT Plus和Business的5小时滚动使用限额,之前数周的「不限量」实验终止。订阅制的「无限量」在推理成本面前不可持续,供给侧正在同步收紧「量」、下调「单价」。第二,Meta发布Muse Spark 1.3,卖点是完成同等工程任务工具调用减少20%、token减少25%。⚠️ 可借鉴模式:评测agentic模型时,「每任务工具调用次数和token消耗」应与SWE-Bench通过率同权,只看通过率会选到能做对但烧钱的模型。
agent治理侧出现了教科书级的同周共振:微软Copilot Studio上线按工具、按agent粒度的人工审批门,发邮件、关工单、支付这类敏感动作可以在协作工具里内联暂停待批;AWS Bedrock AgentCore同月更新加入Consent Portal和批量评测能力。审批门和授权同意正在成为agent系统的标准中间件,就像API网关之于微服务。
可借鉴模式:给agent的敏感动作定义「审批策略」而不是「禁止清单」,按工具粒度声明require_approval,并保留完整审批审计链。自建agent系统可以直接照抄这个分层:动作执行层只认策略引擎的裁决。
开源生态这边,SKILL.md拿到了官方背书:OpenAI上线了Codex官方技能目录仓库,SKILL.md正式成为跨厂商的agent能力分发格式。GitHub Trending上skills仓库连续多日统治榜单,向营销等非编码领域扩散的技能包也已上榜。团队侧的真实空白是skills的工程化治理:谁审、怎么测、如何灰度回滚。这是自建内部skills注册中心的窗口期。
当日信号:监控在模型内部退化的部分,正由模型外部的中间件补位。平台层做审批门,社区做上下文节流,OpenAI自己承认内部看不清。对架构师来说,今天的行动项只有一条:把「可监控性」写进你的模型选型标准,位置和能力平行。