最强开源大模型,594GB 量化版就能在你本地跑起来
你是否也想在本地部署Kimi K3?让我们来看一下国外大神发布的部署教程吧。
kimi k3是迄今为止最强的开源模型,足以比肩 Claude 4.8 Opus 与 GPT-5.6。Kimi K3 具备原生视觉能力,拥有 100 万 token 的上下文窗口,并采用 MXFP4 精度。
全精度推理需要 1.56 TB 存储空间,而 1-bit 的 Kimi K3 Unsloth 动态 GGUF 仅需 594 GB(体积减少 62%)。动态 1-bit 量化在缩小 62% 的同时仍能达到约 78.9% 的 Top-1 准确率;动态 2-bit(861.3GB)在缩小 45% 的情况下达到约 90% 准确率。你可以通过 Unsloth Studio 或 llama.cpp 运行 Kimi-K3-GGUF。Kimi K3 可运行在 NVIDIA DGX Station,或连接了 128GB 内存设备的 Mac Studio 上。
01
PART
模型概览与硬件需求
OVERVIEW · HARDWARE
落地运行前,先看清两件事:模型有多大、你的设备能不能装下。下面这张表给出各量化版本所需的 总内存(RAM+VRAM 或统一内存)。
量化版本 | 总内存需求 |
|---|---|
Dynamic 1-bit S | 610 GB |
Dynamic 1-bit M | 665 GB |
Dynamic 2-bit XXS | 726 GB |
Dynamic 2-bit XL | 880 GB |
Q8(无损) | 1.6 TB |
单位均为总内存(RAM+VRAM,或统一内存)。若内存不足,模型仍能运行,只是会因 磁盘卸载而明显变慢。综合体积与质量,官方推荐使用 UD-IQ1_S(594GB)这一档。
02
PART
GGUF 实现细节
IMPLEMENTATION
我们在 llama.cpp 某个 PR 的基础上做了自己的分支,加入了 视觉支持 与若干 bug 修复。
mmproj / 视觉塔与 Kimi-K2.5 的视觉塔相似,但使用了 RMSNorm、无偏置、非方阵的融合 QKV(qkv 宽度 ≠ n_embd),以及一个 后置归一化投影层。
我们发现,在 llama.cpp 中按 n_tokens × 40 的预算在大批次下会失败,因此必须把预算上调到 n_tokens × 160。
我们还把 Kimi 的对话模板转换成了 jinja 格式。
我们尽可能做了充分测试以覆盖各种情况。Kimi 默认以 保留思考(preserve_thinking) 的方式训练,因此所有思考轨迹不会被删除,而是被保留下来。
03
PART
量化分析
QUANTIZATION
与 Kimi K2.6、K2.7 一样,K3 的 UD-Q8_K_XL 是无损的,因为 Kimi 对 MoE 权重使用 MXFP4、其余部分使用 BF16,而 Q8_K_XL 完全遵循这一设定。UD-Q4_K_XL 大致相同,只是剩余的部分张量(归一化层等除外)采用 Q8_0,因此接近全精度,需要 1.56 TB 的 RAM/VRAM。相比 MXFP4 全精度 safetensors 版本,UD-Q8_K_XL 是“真正无损”的。
量化 | GB | 平均 KLD | PPL(q) | Top-1 一致率 % | RMS dp % |
|---|---|---|---|---|---|
UD-IQ1_S | 594.0 | 0.5645 | 2.5789 | 78.875 ± 0.107 | 36.495 |
UD-IQ1_M | 648.9 | 0.4789 | 2.3639 | 81.219 ± 0.103 | 33.629 |
UD-IQ2_XXS | 711.1 | 0.3784 | 2.1266 | 84.127 ± 0.096 | 29.826 |
UD-Q2_K_XL | 861.3 | 0.1779 | 1.7359 | 90.390 ± 0.077 | 19.862 |
UD-Q4_K_XL | 1,510 | 1.4579 | — | — | — |
UD-Q8_K_XL | 1,560 | 1.4581 | — | — | — |
在生成 imatrix 与量化时,我们全程使用 1.56 TB 的无损 UD-Q8_K_XL 作为校准基准,其困惑度为 1.4581。我们的动态 1-bit 量化达到了 2.58 的困惑度与 79% 的 Top-1 准确率,可用性出奇地好。
其它社区量化版本体积更大,退化却严重得多。例如某个 618.9 GB 的 IQ1_M 量化虽然比我们的 594 GB 1-bit 量化还大,但其困惑度飙升至 54.56——劣化了 21 倍。IQ2_XXS 也是同样的情况:725 GB、PPL 96,对比我们的 711 GB、PPL 2.12——劣化 45 倍,意味着他们的 2-bit 甚至比 1-bit 还差。这凸显了动态量化+恰当校准的重要性。
我们还提供了 Top-1% 准确率与 KLD 曲线图

04
PART
使用指南
USAGE
Kimi K3 是 仅思考模式(thinking-only),默认始终开启 preserve_thinking、并默认拉满思考(max thinking)。不支持即时(Instant)模式。思考强度通过推理请求字段 reasoning_effort 配置,K3 支持“low”“high”“max”三档思考强度。
参数 | 默认 | 智能体 |
|---|---|---|
温度 temperature | 1.0 | 1.0 |
top_p | 0.95 | 1.0 |
上下文长度 | 最高 1,048,576 | 最高 1,048,576 |
低/高/最大思考可在 Unsloth 中切换。
若显存装得下,在 B200 上可获得约 20 tokens/s 的生成速度,吞吐量超过 120 tokens/s。我们推荐 UD-IQ1_S(594GB)作为体积与质量的良好平衡。最佳经验法则:RAM+VRAM ≈ 量化体积;否则模型仍可运行,只是会因磁盘卸载而慢很多。
05
PART
在 Unsloth Studio 中运行
UNSLOTH STUDIO
你现在可以用 llama.cpp 和 Unsloth Studio 运行 Kimi K3 了。为了兼顾可获取性与精度,我们将使用 594GB 的 UD-IQ1_S 量化,它至少需要 610GB 内存。你可以自由更换量化类型。GGUF 仓库:Kimi-K3-GGUF。
Kimi K3 可在 Unsloth Studio 中运行,这是一款用于本地 AI 的 开源 Web UI。Unsloth Studio 会自动卸载到内存并识别多 GPU 配置。借助它,你可以在 macOS、Windows、Linux 上本地运行模型,并支持:
搜索、下载、运行 GGUF 与 safetensor 模型
自愈式工具调用 + 网络搜索
代码执行(Python、Bash)
自动推理参数调优(温度、top_p 等)
通过 llama.cpp 实现快速 CPU+GPU 推理
以 2 倍速度、少 70% 显存训练 LLM
安装与启动 Unsloth
STEP 01
MacOS、Linux、WSL 用下面的命令安装:
CMDcurl -fsSL https://unsloth.ai/install.sh | sh
Windows PowerShell 用:
CMDirm https://unsloth.ai/install.ps1 | iex
STEP 02
安装完成后,在终端运行:
CMDunsloth studio
然后浏览器打开 http://127.0.0.1:8888(或你自己的专属地址)。
STEP 03
Unsloth 现在提供通过免费 Cloudflare 隧道以 HTTPS 安全启动的方式,Windows、Mac、Linux 均可:
CMDunsloth studio --secure
搜索并下载 Kimi K3
Unsloth Studio 会自动卸载到内存并识别多 GPU 配置。首次启动需创建密码以保护账户,之后再次登录。
然后进入 Model hub 标签页,在搜索栏搜索 Kimi K3,下载你想要的模型与量化版本。确保你有足够的算力来运行该模型。
运行 Kimi K3
使用 Unsloth Studio 时推理参数会自动设好,但你仍可手动修改。你也可以切换低/高/最大思考,编辑上下文长度、对话模板等其它设置。
更多信息可查看我们的 Unsloth Studio 推理指南。
下面是 1-bit Kimi-K3 在 Unsloth Canvas 中运行的示例:

06
PART
在 llama.cpp 中运行
LLAMA.CPP
在本教程中,我们使用 llama.cpp 进行快速本地推理,尤其是当你有 CPU 时。为此我们专门创建了一个分支以支持 Kimi K3 的视觉能力,它建立在另一个 llama.cpp PR 之上。
STEP 01
先克隆我们的 llama.cpp 分支并编译。没有 GPU 或只想用 CPU 推理时,把 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF;Apple Mac / Metal 设备则设置 OFF 后照常继续(Metal 默认开启)。
...bash
git clone https://github.com/unslothai/llama.cpp
cd llama.cpp
git fetch origin pull/48/head:kimi-k3-fullsize-vision
git checkout kimi-k3-fullsize-vision
cd ..
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
STEP 02
先来拿一张图片!你也可以自行上传图片。我们用这张图——展示 Unsloth 如何制作微调模型的小 logo:
CMDwget https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png -O unsloth.png
再拿第二张图:
CMDwget https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg -O picture.png
STEP 03
现在你可以像 ollama run 一样,直接用 llama.cpp 加载并下载模型,先选择量化类型(如 IQ1_S)。注意此下载过程可能很慢,建议用下一段的手动下载方式。
...bash
export LLAMA_CACHE="unsloth/Kimi-K3-GGUF"
./llama.cpp/llama-cli \
-hf unsloth/Kimi-K3-GGUF:UD-IQ1_S \
--temp 1.0 \
--top-p 0.95
STEP 04
如需手动下载,可通过下面代码(先 pip install huggingface_hub)下载模型。若下载卡住,参见:Hugging Face Hub、XET 调试。
...bash
hf download unsloth/Kimi-K3-GGUF \
--local-dir unsloth/Kimi-K3-GGUF \
--include "*mmproj-BF16*" \
--include "*UD-IQ1_S*"
若需全精度,把 *UD-IQ1_S* 换成 *UD-Q8_K_XL*。
STEP 05
然后以对话模式启动模型:
...bash
./llama.cpp/llama-cli \
--model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-00014.gguf \
--mmproj unsloth/Kimi-K3-GGUF/mmproj-BF16.gguf \
--temp 1.0 \
--top-p 0.95
运行后你会看到如下输出:

我接着问了“What is the sqrt of -1”:

Kimi K3 也支持图片,例如加载 Unsloth 的 logo 图:

然后我们用树懒图问它两者有何关联:

07
PART
基准测试
BENCHMARKS
下方以表格形式汇总各基准测试成绩(括号内为各模型标注的设定,如 max/xhigh)。表格列较多,建议在宽屏或横屏下查看,手机端可左右滑动。
推理与知识
基准 | K3(max) | Fable 5 | 5.6 Sol | Opus 4.8 | 5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
GPQA Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 93.5 | 91.2 |
HLE-Full | 43.5 / 56.0 | 53.3 / 63.0 | 44.5 / 58.0 | 49.8 / 57.9 | 41.4 / 52.2 | — |
编程
基准 | K3(max) | Fable 5 | 5.6 Sol | Opus 4.8 | 5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 | 46.2 |
Terminal-Bench 2.1 | 88.3 | 88.0 | 88.8 | 84.6 | 83.4 | 82.7 |
智能体
基准 | K3(max) | Fable 5 | 5.6 Sol | Opus 4.8 | 5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | 84.4 | — |
GDPval-AA v2 (Elo) | 1686 | 1747 | 1736 | 1593 | 1491 | 1510 |
OSWorld 2.0 | 58.3 | 66.1 | 62.6 | 55.7 | 49.5 | — |
视觉
基准 | K3(max) | Fable 5 | 5.6 Sol | Opus 4.8 | 5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
MMMU-Pro | 81.6 / 83.4 | 81.2 / 86.5 | 83.0 / 84.6 | 78.9 / 82.7 | 81.2 / 83.2 | — |
MathVision | 94.3 / 97.8 | 94.8 / 98.6 | 95.8 / 97.8 | 86.7 / 97.1 | 92.2 / 96.8 | — |
///
LAST
写在最后
SUMMARY
Kimi K3 把 2.8 万亿参数的最强开源能力,压缩到了 594GB 的动态量化里——只要你的设备内存够,就能在本地跑起一个比肩顶级闭源模型的推理引擎。动态量化+妥善校准,是它“小体积、高可用”的关键。
如果你也在折腾本地大模型,欢迎顺着上面的步骤把 Kimi K3 跑起来。