做大模型部署的人几乎都会做一件事:量化。把权重从 FP16 压到 NF4 或 INT8,显存降了,推理能跑了,皆大欢喜。显存的故事确实如此——但能耗的故事不是。
同事小王前两天很兴奋:"我在本机跑起了 qwen2.5:7b,token 不要钱,以后再也不用充 API 了!"
我们常常听到“大模型”这个词,觉得它神秘又强大。它似乎上知天文、下知地理,能写诗、能编程、还能陪你聊天。
随着算法备案制度持续落地,AI行业的监管框架从过去的原则性指引,逐步转变为可落地、可核验的常态化管理机制。很多AI团队在产品研发、上线、商务拓展的过程中,已经能...
OpenCode 是一款开源的 AI 编程智能体(Agent)命令行工具,由 sst 团队开发并以 MIT 协议开源,核心能力是在终端里以 Agent 模式理解...
OpenAI 于 2026 年 9 月 3 日发布 GPT-6 Astra(模型 ID 为 gpt-6-astra),把上下文窗口拉到 105 万 token,...
中国互联网络信息中心 | 工程师 (已认证)
域名消息身份验证合规协议 DMARC 是抵御企业域名仿冒、商业邮件劫持以及 AI 生成式钓鱼攻击的基础技术手段。基于 Proofpoint 针对财富东南亚 50...
国内用 Claude Code 一共三条路:官方订阅(要海外信用卡和稳定网络)、API 中转(改一个环境变量,国内直连)、换国产模型(用 GLM、DeepSee...
在大模型实际应用过程中,多数线上稳定性故障,并非源于模型推理精度缺陷,而是研发人员对大模型API底层交互机制认知不足,缺少标准化的流量管控、异常容错与调度治理方...
国内确实有一批「针对 Claude Code 的第三方工具」,但它们不是一类东西,混在一起比较毫无意义。按「你把 Key 和代码交给谁」来分,一共五类:网页端聚...
如果说2023年是AI大模型的“元年”,那么2026年则是它们真正融入基础设施的“深耕之年”。从最初仅供少数研究员把玩的巨量参数,到如今每个人手机里都能跑起来的...
做 LLM 推理部署的人都会默认一件事:模型量化 = 省显存 = 省电。但我在 5 款消费级 GPU 上、从 0.5B 到 14B 的模型里跑了 42 组实测数...
即梦 Seedance 2.0、可灵 Kling、通义万相 Wan 2.5 这类视频生成模型,官方接口各有各的参数命名和鉴权方式,但调用形态高度一致:都是提交任...
假设你手里有个 MoE 模型在训,一个训练步(forward + backward + 优化器)跑得很慢。直觉告诉你:肯定是专家层的矩阵乘法(matmul)太慢...
当我们谈论“AI大模型”时,指的是拥有数百亿甚至数万亿参数的巨型神经网络(如GPT-4、DeepSeek-V3、Llama 3)。它们不再是简单的“软件工具”,...
先声明一句:我不是法务,也没有任何机构背景,只是一个把算法备案从零跑到拿号、又差点在"内容标识"上栽跟头的 SaaS 团队负责人。这篇文章把我在坑里爬出来的认知...
先给结论,赶时间的可以只看这张表。下面七条都能在自己的浏览器里查完,不用联系客服,一条都不用问人: