From f1b2437e0dfe8639e65abdf453db2d9988f7cfc9 Mon Sep 17 00:00:00 2001 From: EvanProgramming Date: Tue, 28 Jul 2026 11:42:57 +0800 Subject: [PATCH 1/2] docs: add Chinese README (README_zh.md) and language switcher --- README.md | 4 + README_zh.md | 673 +++++++++++++++++++++++++++++++++++++++++++++++++++ 2 files changed, 677 insertions(+) create mode 100644 README_zh.md diff --git a/README.md b/README.md index 66e8b7a..0eab43f 100644 --- a/README.md +++ b/README.md @@ -20,6 +20,10 @@ +

+ English | 中文 +

+

📰  Tech Blog |     📄  Full Report

diff --git a/README_zh.md b/README_zh.md new file mode 100644 index 0000000..cee60d0 --- /dev/null +++ b/README_zh.md @@ -0,0 +1,673 @@ +
+ + Kimi K3 + +
+
+
+ Chat + Homepage +
+ +
+ Hugging Face + Twitter Follow + Discord + ModelScope +
+
+ License +
+ +

+ English | 中文 +

+ +

+📰  技术博客 |     📄  完整技术报告 +

+ + +## 1. 模型介绍 + +Kimi K3 是一个开放权重的原生多模态智能体(Agentic)模型,也是我们迄今为止能力最强的模型。它是一个基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建的 2.8T 参数模型,具备原生视觉能力和 100 万 token 的上下文窗口。它是全球首个开放的 3T 级别模型,旨在为长程编码、知识工作和推理等领域提供前沿智能。 + +### 核心特性 +- **全新架构**:Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建,并通过 Stable LatentMoE 框架提升 MoE 稀疏度,在 896 个专家中激活 16 个——相较 Kimi K2,整体扩展效率提升约 2.5 倍。 +- **长程编码**:在极少人工干预的情况下,Kimi K3 能够持续进行长时间的工程会话、驾驭超大规模代码仓库并编排终端工具——涵盖 GPU 内核优化、编译器开发,乃至视觉参与的游戏开发、CAD 甚至芯片设计。 +- **智能体知识工作**:Kimi K3 推动端到端知识工作的发展,依托其原生多模态架构,能够产出带有交互式可视化、组件和仪表盘的深度研究成果,以及动效设计与视频剪辑。 +- **原生多模态与长上下文**:Kimi K3 在同一个模型内理解文本、图像和视频,并支持 100 万 token 的上下文窗口。 +- **开放前沿权重**:我们依据 Kimi K3 许可证发布 Kimi K3 的完整模型权重,让前沿智能开放地服务于研究、部署和进一步创新。 +## 2. 模型概要 + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
架构混合专家模型(MoE)
总参数量2.8T
激活参数量104B
层数93
稠密层数1
注意力层构成69 KDA + 24 Gated MLA
注意力隐藏维度7168
注意力头数96
Latent MoE 维度3584
MoE 隐藏维度(每个专家)3072
专家数量896
每个 Token 选择的专家数16
共享专家数量2
词表大小160K
上下文长度1048576
注意力机制KDA & Gated MLA
激活函数SiTU-GLU
视觉编码器MoonViT-V2
视觉编码器参数量401M
量化MXFP4 权重 / MXFP8 激活
(量化感知训练)
模态文本、图像
+
+ + +## 3. 评测结果 + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
基准测试Kimi K3
(max)
Claude Fable 5
(max, w/ fallback)
GPT-5.6 Sol
(max)
Claude Opus 4.8
(max)
GPT-5.5
(xhigh)
GLM-5.2
(max)
推理与知识
GPQA Diamond93.592.694.191.093.591.2
CritPt23.428.632.320.927.120.9
AA-LCR74.770.073.767.774.371.3
HLE-Full43.5 / 56.053.3 / 63.044.5 / 58.049.8 / 57.941.4 / 52.2
编码
DeepSWE67.570.073.059.067.046.2
ProgramBench77.876.877.671.970.863.7
Terminal-Bench 2.188.388.088.884.683.482.7
FrontierSWE81.286.671.366.764.967.3
SWE-Marathon42.035.039.040.014.013.0
PostTrainBench36.641.434.634.128.434.3
MLS-Bench-Lite48.349.946.242.835.540.4
SciCode58.760.256.153.556.150.5
Kimi Code Bench 2.072.976.964.871.769.064.2
智能体
BrowseComp91.288.090.484.384.4
DeepSearchQA (F1)95.094.293.1
ResearchRubrics76.273.873.564.071.1
GDPval-AA v2 (Elo)168617471736159314911510
Toolathlon-Verified76.577.974.976.273.559.9
MCPMark-Verified94.587.492.976.492.9
MCP-Atlas84.284.783.683.682.882.6
AutomationBench30.829.129.727.222.712.9
JobBench54.357.445.448.438.343.4
AA-Briefcase (Elo)154815831495135411581260
Agents' Last Exam28.325.729.627.026.620.4
APEX-Agents41.043.339.939.438.535.6
OfficeQA Pro63.369.963.263.960.941.4
SpreadsheetBench 234.834.732.431.629.128.1
OSWorld-Verified84.885.083.083.479.0
OSWorld 2.058.366.162.655.749.5
SaaS-Bench60.161.456.143.8
τ³-Banking33.426.833.027.631.326.8
Harvey Lab-AA94.693.687.291.186.391.0
CorpFin v271.671.864.466.768.466.1
Finance Agent v254.456.353.853.951.849.7
Legal Research Bench44.249.548.143.840.431.3
视觉
WorldVQA ForceAnswer51.056.741.839.138.5
OmniDocBench91.189.885.887.989.4
PerceptionBench58.557.259.747.255.8
Video-MME (w. sub)90.089.586.089.3
MMVU82.181.279.281.7
BabyVision w/ python85.790.588.981.283.6
MMMU-Pro81.6 / 83.481.2 / 86.583.0 / 84.678.9 / 82.781.2 / 83.2
CharXiv (RQ)84.8 / 91.388.9 / 93.584.6 / 89.180.5 / 89.984.1 / 89.0
MathVision94.3 / 97.894.8 / 98.695.8 / 97.886.7 / 97.192.2 / 96.8
ZeroBench (pass@5)23.0 / 41.023.0 / 46.017.0 / 35.017.0 / 34.022.0 / 41.0
+
+ +
+脚注 + +Kimi K3 的所有结果均在推理强度(reasoning effort)设为 'max'、temperature = 1.0 的条件下获得。对于单步任务(如 GPQA Diamond、HLE-Full 以及不使用工具的视觉基准测试),我们设置 top-p = 0.95;对于智能体任务,我们设置 top-p = 1.0。对于 HLE-Full、MMMU-Pro、CharXiv (RQ)、MathVision 和 ZeroBench,每个单元格依次报告不使用和使用工具增强(HLE-Full 使用通用工具,视觉基准测试使用 Python)的分数。 + +1. **推理与知识基准测试** + - **CritPt 和 AA-LCR。** 分数引自 [Artificial Analysis](https://artificialanalysis.ai/),截至 2026 年 7 月 23 日。 +2. **编码基准测试** + - **DeepSWE。** Kimi K3 使用 Kimi Code 框架进行评测。GLM-5.2 的分数取自 [GLM-5.2 发布博客](https://z.ai/blog/glm-5.2);其余所有分数均来自官方 [DeepSWE 排行榜](https://deepswe.datacurve.ai/),Kimi K3 在该排行榜上使用 mini-SWE-agent 框架取得 67.3 分。我们报告的是 DeepSWE v1.1 任务的结果。 + - **Terminal-Bench 2.1。** Kimi K3 使用 Kimi Code 框架进行评测。对于其他所有模型,我们报告其在各框架下的最佳分数:GLM-5.2 使用 Claude Code([GLM-5.2 发布博客](https://z.ai/blog/glm-5.2));Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2([Artificial Analysis](https://artificialanalysis.ai/evaluations/terminalbench-v2-1));GPT-5.5 和 GPT-5.6 Sol 使用 Codex([OpenAI](https://openai.com/index/previewing-gpt-5-6-sol/))。 + - **ProgramBench。** Kimi K3 使用 Kimi Code 框架进行评测。GLM-5.2 的分数来自 [GLM-5.2 发布博客](https://z.ai/blog/glm-5.2);其他所有分数来自 [Vals AI](https://www.vals.ai/benchmarks/programbench)。 + - **SWE-Marathon。** Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架进行评测;GPT-5.6 Sol 使用 Codex 框架进行评测。GLM-5.2 的分数来自 [GLM-5.2 发布博客](https://z.ai/blog/glm-5.2)。我们的评测基于[官方任务](https://www.swe-marathon.org/)在 2026 年 7 月 9 日(最终 v1.1 版本发布之前)的一个针对 H20 校准的分支:GPU 任务的 Docker 镜像、性能门槛和参考基准已针对 H20 重新校准,而正确性和防作弊验证器保持不变。此外,在我们的评测中,Claude Fable 5 在 35% 的任务上触发了回退(fallback),这可能对其测得的性能产生负面影响。 + - **FrontierSWE。** Kimi K3 使用 Kimi Code 框架、GPT-5.6 Sol 使用 Codex 框架进行评测;其他所有结果来自 [FrontierSWE](https://www.frontierswe.com/)。优势分数(Dominance scores)使用官方评测脚本从原始分数重新计算,数据截至 2026 年 7 月 16 日。 + - **PostTrainBench。** GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的分数采用官方 [PostTrainBench](https://posttrainbench.com/) 结果。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现,在最大推理强度下评测,在 H20 GPU(而非官方设置中的 H100)上运行三次取平均——其中 Kimi K3 和 Claude Fable 5 使用 Claude Code 框架,GPT-5.6 Sol 使用 Codex 框架。 + - **MLS-Bench-Lite。** Kimi K3 使用 Kimi Code 框架进行评测;GLM-5.2 和 Claude 系列模型使用 Claude Code 框架;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架。 + - **SciCode。** 分数引自 [Artificial Analysis](https://artificialanalysis.ai/),截至 2026 年 7 月 23 日。 + - **Kimi Code Bench 2.0(内部基准测试)。** Kimi K3 使用 Kimi Code 框架进行评测(使用 Claude Code 框架时取得 73.7 分);GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架。所有模型均在最大推理强度下评测,GPT-5.5 除外(使用 "xhigh" 设置)。由于该基准测试包含网络安全和安全相关任务,我们同时披露被拒绝或触发回退的任务比例:Claude Fable 5 在 80 个任务中触发 13 次回退和 1 次拒绝;GPT-5.6 Sol 的网络安全防护在 80 个任务中触发 10 次拒绝;GPT-5.5 在 80 个任务中出现 3 次拒绝。 +3. **智能体基准测试** + - **OfficeQA Pro。** 每个测试用例向智能体提供完整的 PDF 语料库,所有 PDF 均以图像形式渲染,不提供机器可读文本。 + - **OfficeQA Pro 和 SpreadsheetBench 2。** Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架进行评测;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架进行评测。 + - **MCP-Atlas。** 所有模型均在 500 个任务的公开子集上评测,回合上限为 100,使用 Gemini 3.1 Pro 作为评判模型。 + - **AutomationBench。** 所有模型均在 600 个任务的公开子集上评测,其余方面均遵循官方 GitHub 设置。 + - **BrowseComp。** 我们采用在 300K token 时触发的上下文压缩策略。在使用完整 100 万 token 上下文窗口且不进行上下文管理的情况下评测时,Kimi K3 取得 90.4 分。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5 的结果引自 [Anthropic](https://www.anthropic.com/news/claude-fable-5-mythos-5) 和 [OpenAI](https://openai.com/index/gpt-5-6/)。 + - **GDPval-AA v2、AA-Briefcase、τ³-Banking、Harvey Lab-AA 和 APEX-Agents。** 分数引自 [Artificial Analysis](https://artificialanalysis.ai/) 和 [APEX-Agents 排行榜](https://www.mercor.com/apex/apex-agents-leaderboard/),截至 2026 年 7 月 23 日。对于 Harvey Lab-AA,我们报告标准通过率(criterion pass rate)。 + - **CorpFin v2、Finance Agent v2 和 Legal Research Bench。** 分数引自 [Vals AI](https://www.vals.ai/)。 + - **Agents' Last Exam。** 分数引自[官方排行榜](https://agents-last-exam.org/leaderboard),截至 2026 年 7 月 23 日;我们报告排行榜的主要通过率指标。在排行榜上,每个模型与特定框架配对:Kimi K3 使用 Kimi Code;GPT-5.6 Sol 和 GPT-5.5 使用 Codex;Claude Fable 5、Claude Opus 4.8 和 GLM-5.2 使用 Claude Code。 Claude Fable 5 条目以 xhigh 强度运行,其中 40% 的任务被标注为降级。 +4. **多模态基准测试** + - 除 ZeroBench 遵循官方设置运行五次外,所有多模态分数均为三次运行的平均值。MMMU-Pro 按照官方协议评测,保留原始输入顺序并将图像置于文本输入之前。 + - **PerceptionBench** 是一个专注于原子级视觉感知能力的内部基准测试。 + +
+ +## 4. 原生 MXFP4 量化 + +Kimi K3 从 SFT 阶段起就采用量化感知训练,使用 MXFP4 权重与 MXFP8 激活,以实现广泛的硬件兼容性。 + +## 5. 部署 + +> [!Note] +> 您可以在 https://platform.kimi.ai 上选择 `kimi-k3` 来访问 Kimi K3 的 API,我们为您提供 OpenAI/Anthropic 兼容的 API。目前,推荐使用以下推理引擎运行 Kimi K3: + +- [vLLM](https://github.com/vllm-project/vllm) — 参见 [recipes](https://recipes.vllm.ai/moonshotai/Kimi-K3) +- [SGLang](https://github.com/sgl-project/sglang) — 参见 [cookbook](https://docs.sglang.io/cookbook/autoregressive/Moonshotai/Kimi-K3) +- [TokenSpeed](https://lightseek.org/tokenspeed) — 参见 [recipes](https://lightseek.org/tokenspeed/recipes/models#kimi-k3) + +--- +## 6. 模型使用 + +Kimi K3 始终开启思考(thinking)模式,并会返回 `reasoning_content`。思考强度通过请求中的顶层字段 `reasoning_effort` 配置,支持 `"low"`、`"high"` 和 `"max"`(默认为 `"max"`)。 + +Kimi K3 以保留思考历史(preserved thinking history)模式训练。在多轮对话和工具调用中,Kimi K3 要求将 API 返回的完整 assistant 消息原样传回 `messages`——包括 `reasoning_content` 和 `tool_calls`,而不仅仅是 `content`: + +```python +import openai + +def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str): + messages = [ + { + "role": "user", + "content": "Tell me three random numbers." + }, + { + "role": "assistant", + "reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.", + "content": "473, 921, 235" + }, + { + "role": "user", + "content": "What are the other two numbers you have in mind?" + } + ] + + response = client.chat.completions.create( + model=model_name, + messages=messages, + stream=False, + max_tokens=4096, + reasoning_effort="max", + ) + # the assistant should mention 215 and 222 that appear in the prior reasoning content + print(f"response: {response.choices[0].message.reasoning}") + return response.choices[0].message.content +``` + +完整的指南和示例(视觉输入、结构化输出、partial 模式、工具选择、动态工具加载、上下文缓存)请参见 [Kimi K3 快速入门](https://platform.kimi.ai/docs/guide/kimi-k3-quickstart)和[思考强度](https://platform.kimi.ai/docs/guide/use-thinking-effort)。 + +### 编码智能体框架 + +Kimi K3 与 [Kimi Code CLI](https://www.kimi.com/code) 智能体框架搭配使用效果最佳。我们诚挚邀请您试用——在终端中运行 Kimi Code,并使用 `/model` 命令选择 Kimi K3。希望您享受与 Kimi K3 一起构建的过程,我们也期待听到您的反馈! + + +--- + +## 7. 许可证 + +代码仓库和模型权重均依据 [Kimi K3 许可证](LICENSE)发布。 + +--- + +## 8. 联系我们 + +如有任何问题,请通过 [support@moonshot.ai](mailto:support@moonshot.ai) 联系我们。 From def0679e2dea9f1c6428760f545caebcfcf617a8 Mon Sep 17 00:00:00 2001 From: EvanProgramming Date: Tue, 28 Jul 2026 21:19:00 +0800 Subject: [PATCH 2/2] docs: translate technical terms into Chinese in README_zh.md --- README_zh.md | 34 +++++++++++++++++----------------- 1 file changed, 17 insertions(+), 17 deletions(-) diff --git a/README_zh.md b/README_zh.md index cee60d0..7e3c6a4 100644 --- a/README_zh.md +++ b/README_zh.md @@ -30,13 +30,13 @@ ## 1. 模型介绍 -Kimi K3 是一个开放权重的原生多模态智能体(Agentic)模型,也是我们迄今为止能力最强的模型。它是一个基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建的 2.8T 参数模型,具备原生视觉能力和 100 万 token 的上下文窗口。它是全球首个开放的 3T 级别模型,旨在为长程编码、知识工作和推理等领域提供前沿智能。 +Kimi K3 是一个开放权重的原生多模态智能体(Agentic)模型,也是我们迄今为止能力最强的模型。它是一个基于 Kimi 增量注意力(Kimi Delta Attention,KDA)和注意力残差(Attention Residuals,AttnRes)构建的 2.8T 参数模型,具备原生视觉能力和 100 万词元(token)的上下文窗口。它是全球首个开放的 3T 级别模型,旨在为长程编码、知识工作和推理等领域提供前沿智能。 ### 核心特性 -- **全新架构**:Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建,并通过 Stable LatentMoE 框架提升 MoE 稀疏度,在 896 个专家中激活 16 个——相较 Kimi K2,整体扩展效率提升约 2.5 倍。 -- **长程编码**:在极少人工干预的情况下,Kimi K3 能够持续进行长时间的工程会话、驾驭超大规模代码仓库并编排终端工具——涵盖 GPU 内核优化、编译器开发,乃至视觉参与的游戏开发、CAD 甚至芯片设计。 +- **全新架构**:Kimi K3 基于 Kimi 增量注意力(KDA)和注意力残差(AttnRes)构建,并通过稳定潜在混合专家(Stable LatentMoE)框架提升混合专家模型(MoE)的稀疏度,在 896 个专家中激活 16 个——相较 Kimi K2,整体扩展效率提升约 2.5 倍。 +- **长程编码**:在极少人工干预的情况下,Kimi K3 能够持续进行长时间的工程会话、驾驭超大规模代码仓库并编排终端工具——涵盖图形处理器(GPU)内核优化、编译器开发,乃至视觉参与的游戏开发、计算机辅助设计(CAD)甚至芯片设计。 - **智能体知识工作**:Kimi K3 推动端到端知识工作的发展,依托其原生多模态架构,能够产出带有交互式可视化、组件和仪表盘的深度研究成果,以及动效设计与视频剪辑。 -- **原生多模态与长上下文**:Kimi K3 在同一个模型内理解文本、图像和视频,并支持 100 万 token 的上下文窗口。 +- **原生多模态与长上下文**:Kimi K3 在同一个模型内理解文本、图像和视频,并支持 100 万词元的上下文窗口。 - **开放前沿权重**:我们依据 Kimi K3 许可证发布 Kimi K3 的完整模型权重,让前沿智能开放地服务于研究、部署和进一步创新。 ## 2. 模型概要 @@ -65,7 +65,7 @@ Kimi K3 是一个开放权重的原生多模态智能体(Agentic)模型, 注意力层构成 -69 KDA + 24 Gated MLA +69 层增量注意力(KDA)+ 24 层门控多头潜在注意力(Gated MLA) 注意力隐藏维度 @@ -76,11 +76,11 @@ Kimi K3 是一个开放权重的原生多模态智能体(Agentic)模型, 96 -Latent MoE 维度 +潜在混合专家(Latent MoE)维度 3584 -MoE 隐藏维度(每个专家) +混合专家(MoE)隐藏维度(每个专家) 3072 @@ -88,7 +88,7 @@ Kimi K3 是一个开放权重的原生多模态智能体(Agentic)模型, 896 -每个 Token 选择的专家数 +每个词元选择的专家数 16 @@ -105,7 +105,7 @@ Kimi K3 是一个开放权重的原生多模态智能体(Agentic)模型, 注意力机制 -KDA & Gated MLA +增量注意力(KDA)& 门控多头潜在注意力(Gated MLA) 激活函数 @@ -121,7 +121,7 @@ Kimi K3 是一个开放权重的原生多模态智能体(Agentic)模型, 量化 -MXFP4 权重 / MXFP8 激活
(量化感知训练) +四位微缩浮点(MXFP4)权重 / 八位微缩浮点(MXFP8)激活
(量化感知训练) 模态 @@ -572,7 +572,7 @@ Kimi K3 是一个开放权重的原生多模态智能体(Agentic)模型,
脚注 -Kimi K3 的所有结果均在推理强度(reasoning effort)设为 'max'、temperature = 1.0 的条件下获得。对于单步任务(如 GPQA Diamond、HLE-Full 以及不使用工具的视觉基准测试),我们设置 top-p = 0.95;对于智能体任务,我们设置 top-p = 1.0。对于 HLE-Full、MMMU-Pro、CharXiv (RQ)、MathVision 和 ZeroBench,每个单元格依次报告不使用和使用工具增强(HLE-Full 使用通用工具,视觉基准测试使用 Python)的分数。 +Kimi K3 的所有结果均在推理强度(reasoning effort)设为 'max'、温度(temperature)= 1.0 的条件下获得。对于单步任务(如 GPQA Diamond、HLE-Full 以及不使用工具的视觉基准测试),我们设置核采样(top-p)= 0.95;对于智能体任务,我们设置核采样(top-p)= 1.0。对于 HLE-Full、MMMU-Pro、CharXiv (RQ)、MathVision 和 ZeroBench,每个单元格依次报告不使用和使用工具增强(HLE-Full 使用通用工具,视觉基准测试使用 Python)的分数。 1. **推理与知识基准测试** - **CritPt 和 AA-LCR。** 分数引自 [Artificial Analysis](https://artificialanalysis.ai/),截至 2026 年 7 月 23 日。 @@ -591,7 +591,7 @@ Kimi K3 的所有结果均在推理强度(reasoning effort)设为 'max'、te - **OfficeQA Pro 和 SpreadsheetBench 2。** Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架进行评测;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架进行评测。 - **MCP-Atlas。** 所有模型均在 500 个任务的公开子集上评测,回合上限为 100,使用 Gemini 3.1 Pro 作为评判模型。 - **AutomationBench。** 所有模型均在 600 个任务的公开子集上评测,其余方面均遵循官方 GitHub 设置。 - - **BrowseComp。** 我们采用在 300K token 时触发的上下文压缩策略。在使用完整 100 万 token 上下文窗口且不进行上下文管理的情况下评测时,Kimi K3 取得 90.4 分。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5 的结果引自 [Anthropic](https://www.anthropic.com/news/claude-fable-5-mythos-5) 和 [OpenAI](https://openai.com/index/gpt-5-6/)。 + - **BrowseComp。** 我们采用在 30 万词元时触发的上下文压缩策略。在使用完整 100 万词元上下文窗口且不进行上下文管理的情况下评测时,Kimi K3 取得 90.4 分。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5 的结果引自 [Anthropic](https://www.anthropic.com/news/claude-fable-5-mythos-5) 和 [OpenAI](https://openai.com/index/gpt-5-6/)。 - **GDPval-AA v2、AA-Briefcase、τ³-Banking、Harvey Lab-AA 和 APEX-Agents。** 分数引自 [Artificial Analysis](https://artificialanalysis.ai/) 和 [APEX-Agents 排行榜](https://www.mercor.com/apex/apex-agents-leaderboard/),截至 2026 年 7 月 23 日。对于 Harvey Lab-AA,我们报告标准通过率(criterion pass rate)。 - **CorpFin v2、Finance Agent v2 和 Legal Research Bench。** 分数引自 [Vals AI](https://www.vals.ai/)。 - **Agents' Last Exam。** 分数引自[官方排行榜](https://agents-last-exam.org/leaderboard),截至 2026 年 7 月 23 日;我们报告排行榜的主要通过率指标。在排行榜上,每个模型与特定框架配对:Kimi K3 使用 Kimi Code;GPT-5.6 Sol 和 GPT-5.5 使用 Codex;Claude Fable 5、Claude Opus 4.8 和 GLM-5.2 使用 Claude Code。 Claude Fable 5 条目以 xhigh 强度运行,其中 40% 的任务被标注为降级。 @@ -601,14 +601,14 @@ Kimi K3 的所有结果均在推理强度(reasoning effort)设为 'max'、te
-## 4. 原生 MXFP4 量化 +## 4. 原生四位微缩浮点(MXFP4)量化 -Kimi K3 从 SFT 阶段起就采用量化感知训练,使用 MXFP4 权重与 MXFP8 激活,以实现广泛的硬件兼容性。 +Kimi K3 从监督微调(SFT)阶段起就采用量化感知训练,使用四位微缩浮点(MXFP4)权重与八位微缩浮点(MXFP8)激活,以实现广泛的硬件兼容性。 ## 5. 部署 > [!Note] -> 您可以在 https://platform.kimi.ai 上选择 `kimi-k3` 来访问 Kimi K3 的 API,我们为您提供 OpenAI/Anthropic 兼容的 API。目前,推荐使用以下推理引擎运行 Kimi K3: +> 您可以在 https://platform.kimi.ai 上选择 `kimi-k3` 来访问 Kimi K3 的应用程序接口(API),我们为您提供 OpenAI/Anthropic 兼容的接口。目前,推荐使用以下推理引擎运行 Kimi K3: - [vLLM](https://github.com/vllm-project/vllm) — 参见 [recipes](https://recipes.vllm.ai/moonshotai/Kimi-K3) - [SGLang](https://github.com/sgl-project/sglang) — 参见 [cookbook](https://docs.sglang.io/cookbook/autoregressive/Moonshotai/Kimi-K3) @@ -619,7 +619,7 @@ Kimi K3 从 SFT 阶段起就采用量化感知训练,使用 MXFP4 权重与 MX Kimi K3 始终开启思考(thinking)模式,并会返回 `reasoning_content`。思考强度通过请求中的顶层字段 `reasoning_effort` 配置,支持 `"low"`、`"high"` 和 `"max"`(默认为 `"max"`)。 -Kimi K3 以保留思考历史(preserved thinking history)模式训练。在多轮对话和工具调用中,Kimi K3 要求将 API 返回的完整 assistant 消息原样传回 `messages`——包括 `reasoning_content` 和 `tool_calls`,而不仅仅是 `content`: +Kimi K3 以保留思考历史(preserved thinking history)模式训练。在多轮对话和工具调用中,Kimi K3 要求将接口返回的完整助手(assistant)消息原样传回 `messages`——包括思考内容(`reasoning_content`)和工具调用(`tool_calls`),而不仅仅是回复内容(`content`): ```python import openai @@ -653,7 +653,7 @@ def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str): return response.choices[0].message.content ``` -完整的指南和示例(视觉输入、结构化输出、partial 模式、工具选择、动态工具加载、上下文缓存)请参见 [Kimi K3 快速入门](https://platform.kimi.ai/docs/guide/kimi-k3-quickstart)和[思考强度](https://platform.kimi.ai/docs/guide/use-thinking-effort)。 +完整的指南和示例(视觉输入、结构化输出、部分补全(partial)模式、工具选择、动态工具加载、上下文缓存)请参见 [Kimi K3 快速入门](https://platform.kimi.ai/docs/guide/kimi-k3-quickstart)和[思考强度](https://platform.kimi.ai/docs/guide/use-thinking-effort)。 ### 编码智能体框架