别一上来就分,先确认瓶颈在哪。单表千万行以内、QPS 不上千的,索引优化加读写分离就够了。真要分,先看分片键怎么选,优先选查询条件里最常用的字段,保证大部分查询能落到单分片。范围分片适合时间序列数据,Hash 分片适合均匀打散。分片数按 2 倍冗余规划,别分太细,后期合并成本高。跨分片 Join 是大坑,尽量在设计时规避,用冗余字段加异步同步替代。双写迁移期间用 binlog 同步保证数据一致,切流时先灰度 10% 流量验证,没问题再全量切换。中间件选 ShardingSphere 还是自研代理看团队能力。
不是所有异步都得加 MQ,别过度设计。真正需要 MQ 的场景:削峰填谷(秒杀、批量通知,写入量瞬间超数据库承受力)、系统解耦(上游不关心下游处理结果,各管各的)、最终一致性事务(跨服务数据同步,用 MQ 替代分布式事务)。如果只是发个邮件通知、写个日志,直接用线程池或定时任务更简单。选 Kafka 还是 RocketMQ 看量级:日均亿级消息选 Kafka 追求吞吐,需要事务消息和延时投递选 RocketMQ。别为了显得架构高级就硬塞 MQ,多一个中间件多一份运维成本,消息积压、重复消费、顺序保证这些问题够你喝一壶。
关键是给每个 Agent 划清权限边界和资源配额。具体做法:工具调用做白名单,写入类操作必须人工确认;每个 Agent session 设 token 上限和超时硬切;文件系统只给工作目录读写权限,沙箱隔离;外部 API 调用走代理,设速率限制和每日配额。上线前做 chaos 测试,故意注入工具超时、API 报错,看 Agent 是优雅降级还是死循环烧钱。监控面板盯三个指标:单次任务 token 消耗 P99、工具调用失败率、异常重试次数。超阈值自动熔断,别等账单炸了才发现问题。Agent 出问题不可怕,可怕的是没有兜底机制。
定价不标并发上限就是挖坑。同样标价 0.01 元/千 token,一家限 10 QPS、一家限 1000 QPS,实际成本能差两个数量级。算成本得看三个数:峰值 QPS 能撑多少、排队超时率多少、有没有 burst quota。高并发场景下 API 强制限流会导致请求堆积,重试和超时带来的额外 token 消耗往往比原始调用还贵。选型时直接找厂商要 SLA 文档里的并发上限和限流策略,别看营销页面的单价。自己也要拿真实业务流量做压测,模拟峰值场景打一波,看实际 token 消耗和成功率,比纸面数据靠谱得多。
浏览器侧的核心优势是直接操作 DOM、复用用户 cookie 和同源策略下的登录态、能访问本地文件系统。云端 Agent 受限于沙箱,拿不到用户浏览器环境,但胜在算力弹性、可横向扩展、不占用户设备资源。底层差异主要在三处:执行环境(真实浏览器 vs headless 容器)、状态持久化(本地磁盘 vs 云端 session store)、网络隔离策略(用户网络直连 vs VPC 隔离)。选型看场景:需要登录态操作、表单自动填写的走浏览器侧;需要大批量并行处理、重计算任务的走云端。两者不是替代关系,实际落地经常是云端做编排决策,浏览器侧做执行触手。
循环、记忆、工具调度、安全策略这些核心控制流不能插件化,一个坏插件能让 Agent 无限循环或越权。适合插件的是:具体工具(查天气、读文档)、输出格式化、特定领域的反思/评分逻辑、UI 渲染。判断标准:如果插件失败会影响整个 Agent 的可靠性和安全性,就放进核心;如果只是换一种做法,再交给插件。核心要稳,插件要轻。
不要每个模型写一套 SSE。抽象一层统一协议:统一请求体(模型、温度、max_tokens、消息数组)和统一响应事件(Start/Content/Finish/Error)。适配器负责把各家流式格式转成内部事件,OpenAI 的 data:、Anthropic 的 message_start/message_delta、Gemini 的 candidates 都能映射。业务层只消费标准化事件,换模型不用改业务代码。异步队列削峰,超时按模型动态配置。
HTAP 的坑不在 TP/AP 同时跑,而在于资源隔离、数据一致性和查询路由。TiDB 的 TiFlash 列存提供实时分析,但大 AP 可能抢 TP 的 IO 和网络;OceanBase 共享存储架构扩展好,但复杂查询优化器调优门槛高;平凯(原 PingCAP 企业版)重在金融强一致场景,部署和许可证成本是考虑点。通用经验:把 AP 流量限时限资源,避免直接查热表;复杂分析走离线导出或独立集群更稳。
一切皆插件是把能力拆成可插拔单元,按需组合,扩展快、风险隔离好。Capability Seam 是能力缝,也就是不同系统/模型/工具之间的能力边界和接口,插件在这里对接。特权核心必须有:安全策略、权限校验、审计、调度、资源配额这些不能交给插件,否则谁都可能越权。插件跑业务,核心管规则,分层不能乱。
卡脖子不是单点,是生态。设计可以靠先进IP和工具,但先进制程、EDA、先进封装、关键材料被锁;更麻烦的是软件生态,操作系统、编译器、开发者工具链、行业应用迁移成本极高。制造端的良率和产能爬坡也慢。所以突围顺序:先把成熟制程+特色应用(汽车、工控、AI推理)跑通,积累IP和生态,再攻先进制程。别指望一颗芯片翻身,得整条链。