首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >别再盲目堆算力了!332 位企业高管透露的 2026 AI 部署真实现状

别再盲目堆算力了!332 位企业高管透露的 2026 AI 部署真实现状

作者头像
豆芽菜小萌
发布2026-09-08 19:23:45
发布2026-09-08 19:23:45
240
举报

最强开源大模型,594GB 量化版就能在你本地跑起来

你是否也想在本地部署Kimi K3?让我们来看一下国外大神发布的部署教程吧。

 kimi k3是迄今为止最强的开源模型,足以比肩 Claude 4.8 Opus 与 GPT-5.6。Kimi K3 具备原生视觉能力,拥有 100 万 token 的上下文窗口,并采用 MXFP4 精度。

全精度推理需要 1.56 TB 存储空间,而 1-bit 的 Kimi K3 Unsloth 动态 GGUF 仅需 594 GB(体积减少 62%)。动态 1-bit 量化在缩小 62% 的同时仍能达到约 78.9% 的 Top-1 准确率;动态 2-bit(861.3GB)在缩小 45% 的情况下达到约 90% 准确率。你可以通过 Unsloth Studio 或 llama.cpp 运行 Kimi-K3-GGUF。Kimi K3 可运行在 NVIDIA DGX Station,或连接了 128GB 内存设备的 Mac Studio 上。

01

PART

模型概览与硬件需求

OVERVIEW · HARDWARE

落地运行前,先看清两件事:模型有多大、你的设备能不能装下。下面这张表给出各量化版本所需的 总内存(RAM+VRAM 或统一内存)。

量化版本

总内存需求

Dynamic 1-bit S

610 GB

Dynamic 1-bit M

665 GB

Dynamic 2-bit XXS

726 GB

Dynamic 2-bit XL

880 GB

Q8(无损)

1.6 TB

单位均为总内存(RAM+VRAM,或统一内存)。若内存不足,模型仍能运行,只是会因 磁盘卸载而明显变慢。综合体积与质量,官方推荐使用 UD-IQ1_S(594GB)这一档。

02

PART

GGUF 实现细节

IMPLEMENTATION

我们在 llama.cpp 某个 PR 的基础上做了自己的分支,加入了 视觉支持 与若干 bug 修复。

mmproj / 视觉塔与 Kimi-K2.5 的视觉塔相似,但使用了 RMSNorm、无偏置、非方阵的融合 QKV(qkv 宽度 ≠ n_embd),以及一个 后置归一化投影层。

我们发现,在 llama.cpp 中按 n_tokens × 40 的预算在大批次下会失败,因此必须把预算上调到 n_tokens × 160。

我们还把 Kimi 的对话模板转换成了 jinja 格式。

我们尽可能做了充分测试以覆盖各种情况。Kimi 默认以 保留思考(preserve_thinking) 的方式训练,因此所有思考轨迹不会被删除,而是被保留下来。

03

PART

量化分析

QUANTIZATION

与 Kimi K2.6、K2.7 一样,K3 的 UD-Q8_K_XL 是无损的,因为 Kimi 对 MoE 权重使用 MXFP4、其余部分使用 BF16,而 Q8_K_XL 完全遵循这一设定。UD-Q4_K_XL 大致相同,只是剩余的部分张量(归一化层等除外)采用 Q8_0,因此接近全精度,需要 1.56 TB 的 RAM/VRAM。相比 MXFP4 全精度 safetensors 版本,UD-Q8_K_XL 是“真正无损”的。

量化

GB

平均 KLD

PPL(q)

Top-1 一致率 %

RMS dp %

UD-IQ1_S

594.0

0.5645

2.5789

78.875 ± 0.107

36.495

UD-IQ1_M

648.9

0.4789

2.3639

81.219 ± 0.103

33.629

UD-IQ2_XXS

711.1

0.3784

2.1266

84.127 ± 0.096

29.826

UD-Q2_K_XL

861.3

0.1779

1.7359

90.390 ± 0.077

19.862

UD-Q4_K_XL

1,510

1.4579

UD-Q8_K_XL

1,560

1.4581

在生成 imatrix 与量化时,我们全程使用 1.56 TB 的无损 UD-Q8_K_XL 作为校准基准,其困惑度为 1.4581。我们的动态 1-bit 量化达到了 2.58 的困惑度与 79% 的 Top-1 准确率,可用性出奇地好。

其它社区量化版本体积更大,退化却严重得多。例如某个 618.9 GB 的 IQ1_M 量化虽然比我们的 594 GB 1-bit 量化还大,但其困惑度飙升至 54.56——劣化了 21 倍。IQ2_XXS 也是同样的情况:725 GB、PPL 96,对比我们的 711 GB、PPL 2.12——劣化 45 倍,意味着他们的 2-bit 甚至比 1-bit 还差。这凸显了动态量化+恰当校准的重要性。

我们还提供了 Top-1% 准确率与 KLD 曲线图

04

PART

使用指南

USAGE

Kimi K3 是 仅思考模式(thinking-only),默认始终开启 preserve_thinking、并默认拉满思考(max thinking)。不支持即时(Instant)模式。思考强度通过推理请求字段 reasoning_effort 配置,K3 支持“low”“high”“max”三档思考强度。

参数

默认

智能体

温度 temperature

1.0

1.0

top_p

0.95

1.0

上下文长度

最高 1,048,576

最高 1,048,576

低/高/最大思考可在 Unsloth 中切换。

若显存装得下,在 B200 上可获得约 20 tokens/s 的生成速度,吞吐量超过 120 tokens/s。我们推荐 UD-IQ1_S(594GB)作为体积与质量的良好平衡。最佳经验法则:RAM+VRAM ≈ 量化体积;否则模型仍可运行,只是会因磁盘卸载而慢很多。

05

PART

在 Unsloth Studio 中运行

UNSLOTH STUDIO

你现在可以用 llama.cpp 和 Unsloth Studio 运行 Kimi K3 了。为了兼顾可获取性与精度,我们将使用 594GB 的 UD-IQ1_S 量化,它至少需要 610GB 内存。你可以自由更换量化类型。GGUF 仓库:Kimi-K3-GGUF

Kimi K3 可在 Unsloth Studio 中运行,这是一款用于本地 AI 的 开源 Web UI。Unsloth Studio 会自动卸载到内存并识别多 GPU 配置。借助它,你可以在 macOS、Windows、Linux 上本地运行模型,并支持:

搜索、下载、运行 GGUF 与 safetensor 模型

自愈式工具调用 + 网络搜索

代码执行(Python、Bash)

自动推理参数调优(温度、top_p 等)

通过 llama.cpp 实现快速 CPU+GPU 推理

以 2 倍速度、少 70% 显存训练 LLM

安装与启动 Unsloth

STEP 01

安装 Unsloth

MacOS、Linux、WSL 用下面的命令安装:

CMDcurl -fsSL https://unsloth.ai/install.sh | sh

Windows PowerShell 用:

CMDirm https://unsloth.ai/install.ps1 | iex

STEP 02

启动 Unsloth

安装完成后,在终端运行:

CMDunsloth studio

然后浏览器打开 http://127.0.0.1:8888(或你自己的专属地址)。

STEP 03

通过 HTTPS 与 Cloudflare 安全启动

Unsloth 现在提供通过免费 Cloudflare 隧道以 HTTPS 安全启动的方式,Windows、Mac、Linux 均可:

CMDunsloth studio --secure

搜索并下载 Kimi K3

Unsloth Studio 会自动卸载到内存并识别多 GPU 配置。首次启动需创建密码以保护账户,之后再次登录。

然后进入 Model hub 标签页,在搜索栏搜索 Kimi K3,下载你想要的模型与量化版本。确保你有足够的算力来运行该模型。

运行 Kimi K3

使用 Unsloth Studio 时推理参数会自动设好,但你仍可手动修改。你也可以切换低/高/最大思考,编辑上下文长度、对话模板等其它设置。

更多信息可查看我们的 Unsloth Studio 推理指南。

下面是 1-bit Kimi-K3 在 Unsloth Canvas 中运行的示例:

06

PART

在 llama.cpp 中运行

LLAMA.CPP

在本教程中,我们使用 llama.cpp 进行快速本地推理,尤其是当你有 CPU 时。为此我们专门创建了一个分支以支持 Kimi K3 的视觉能力,它建立在另一个 llama.cpp PR 之上。

STEP 01

获取并构建 Unsloth 分支

先克隆我们的 llama.cpp 分支并编译。没有 GPU 或只想用 CPU 推理时,把 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF;Apple Mac / Metal 设备则设置 OFF 后照常继续(Metal 默认开启)。

...bash

git clone https://github.com/unslothai/llama.cpp

cd llama.cpp

git fetch origin pull/48/head:kimi-k3-fullsize-vision

git checkout kimi-k3-fullsize-vision

cd ..

cmake llama.cpp -B llama.cpp/build \

  -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON

cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split

cp llama.cpp/build/bin/llama-* llama.cpp

STEP 02

准备测试图片

先来拿一张图片!你也可以自行上传图片。我们用这张图——展示 Unsloth 如何制作微调模型的小 logo:

CMDwget https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png -O unsloth.png

再拿第二张图:

CMDwget https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg -O picture.png

STEP 03

直接用 llama.cpp 加载并下载

现在你可以像 ollama run 一样,直接用 llama.cpp 加载并下载模型,先选择量化类型(如 IQ1_S)。注意此下载过程可能很慢,建议用下一段的手动下载方式。

...bash

export LLAMA_CACHE="unsloth/Kimi-K3-GGUF"

./llama.cpp/llama-cli \

  -hf unsloth/Kimi-K3-GGUF:UD-IQ1_S \

  --temp 1.0 \

  --top-p 0.95

STEP 04

手动下载模型

如需手动下载,可通过下面代码(先 pip install huggingface_hub)下载模型。若下载卡住,参见:Hugging Face Hub、XET 调试。

...bash

hf download unsloth/Kimi-K3-GGUF \

  --local-dir unsloth/Kimi-K3-GGUF \

  --include "*mmproj-BF16*" \

  --include "*UD-IQ1_S*"

若需全精度,把 *UD-IQ1_S* 换成 *UD-Q8_K_XL*。

STEP 05

对话模式运行

然后以对话模式启动模型:

...bash

./llama.cpp/llama-cli \

  --model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-00014.gguf \

  --mmproj unsloth/Kimi-K3-GGUF/mmproj-BF16.gguf \

  --temp 1.0 \

  --top-p 0.95

运行后你会看到如下输出:

我接着问了“What is the sqrt of -1”:

Kimi K3 也支持图片,例如加载 Unsloth 的 logo 图:

然后我们用树懒图问它两者有何关联:

07

PART

基准测试

BENCHMARKS

下方以表格形式汇总各基准测试成绩(括号内为各模型标注的设定,如 max/xhigh)。表格列较多,建议在宽屏或横屏下查看,手机端可左右滑动。

推理与知识

基准

K3(max)

Fable 5

5.6 Sol

Opus 4.8

5.5

GLM-5.2

GPQA Diamond

93.5

92.6

94.1

91.0

93.5

91.2

HLE-Full

43.5 / 56.0

53.3 / 63.0

44.5 / 58.0

49.8 / 57.9

41.4 / 52.2

编程

基准

K3(max)

Fable 5

5.6 Sol

Opus 4.8

5.5

GLM-5.2

DeepSWE

67.5

70.0

73.0

59.0

67.0

46.2

Terminal-Bench 2.1

88.3

88.0

88.8

84.6

83.4

82.7

智能体

基准

K3(max)

Fable 5

5.6 Sol

Opus 4.8

5.5

GLM-5.2

BrowseComp

91.2

88.0

90.4

84.3

84.4

GDPval-AA v2 (Elo)

1686

1747

1736

1593

1491

1510

OSWorld 2.0

58.3

66.1

62.6

55.7

49.5

视觉

基准

K3(max)

Fable 5

5.6 Sol

Opus 4.8

5.5

GLM-5.2

MMMU-Pro

81.6 / 83.4

81.2 / 86.5

83.0 / 84.6

78.9 / 82.7

81.2 / 83.2

MathVision

94.3 / 97.8

94.8 / 98.6

95.8 / 97.8

86.7 / 97.1

92.2 / 96.8

///

LAST

写在最后

SUMMARY

Kimi K3 把 2.8 万亿参数的最强开源能力,压缩到了 594GB 的动态量化里——只要你的设备内存够,就能在本地跑起一个比肩顶级闭源模型的推理引擎。动态量化+妥善校准,是它“小体积、高可用”的关键。

如果你也在折腾本地大模型,欢迎顺着上面的步骤把 Kimi K3 跑起来。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-08-03,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 安装 Unsloth
  • 启动 Unsloth
  • 通过 HTTPS 与 Cloudflare 安全启动
  • 获取并构建 Unsloth 分支
  • 准备测试图片
  • 直接用 llama.cpp 加载并下载
  • 手动下载模型
  • 对话模式运行
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档