详细内容或原文请订阅后点击阅览
我测试了Kimi Agent,以下是发现
Kimi Agent这个名字已经涵盖了一个庞大的家族,在评判任何部分之前,理清这一点很重要。
来源:KDnuggets“Kimi Agent”不是一个产品;它是一个覆盖庞大产品系列的名称,在评判任何部分之前理清这一点很重要。Kimi K3是底层模型:一个2.8万亿参数的混合专家(MoE)模型(每个令牌激活896个专家中的16个),具有100万令牌上下文窗口,由北京实验室Moonshot AI开发,并获得阿里巴巴支持。
Agent Swarm是建立在它之上的架构——一个可以在单个任务上生成数十或数百个协调子代理的系统,而不是顺序处理。Goal是自主多步骤目标的特性:设定一个自然语言目标,代理便规划并执行。OK Computer是直接构建在Kimi聊天界面中的代理模式,从单个提示生成多页网站和幻灯片。Kimi Work于2026年6月10日推出,是一个单独的macOS(Apple Silicon)和Windows桌面应用,通过名为WebBridge的浏览器控制扩展直接操作你的电脑,像人一样搜索、滚动和填写表单。Kimi Claw是云端的对应部分,当你的机器休眠时保持任务运行,因为Kimi Work的本地任务在笔记本电脑盖子合上的那一刻就会停止。Kimi Code是专用的编码命令行界面(CLI)。
架构主张:Agent Swarm
Agent Swarm是头条功能,Moonshot自己对它的描述确实比大多数供应商营销更具体。它于2026年1月27日与Kimi K2.5一同首次发布,被描述为一种协调子代理协作的扩展架构,无需预定义角色或手动设计工作流。2026年4月20日发布的K2.6使其容量真正跃升:单个任务中多达300个并发子代理实例和超过4,000个工具调用,Moonshot声称比单个代理顺序处理相同任务快4.5倍。Agent Swarm现在也在K3上运行,Moonshot描述了大规模并行搜索的进一步改进,但没有发布超出K2.6数字的新容量数据。
这里异常坦诚——值得直接肯定的是——Moonshot记录了该架构的两种失败模式,而不仅仅是成功:串行崩溃,协调者分配工作但子代理最终还是互相阻塞;以及虚假并行,工作看起来是分布式的但实际上不够独立,无法从中受益。这对任何决定是否将任务分派出去的人来说都是一个真正有用的决策框架,而不仅仅是Kimi特定的注意事项,而且供应商在能力数据之外发布自己的失败分类是罕见的。
开始使用和尝试
以下是我无需付费计划就能直接验证的内容。在kimi.com注册需要一个Google账户,大约十秒钟,开始无需信用卡。免费层提供真正的功能,但确实有限:根据TechRadar Pro的动手评测,免费层限制你一次只能运行一个并发代理任务,完整的代理功能集——即大规模使用Agent Swarm——仅在每月39美元及以上解锁。如果群集架构是吸引你的主要原因,这是一个重要的门槛,因为单个并发任务实际上违背了并行子代理的意义。
API动手实践
Moonshot的Kimi API与OpenAI兼容,这意味着标准的openai Python SDK只需更改基础URL和模型名称即可工作。
先决条件:
export MOONSHOT_API_KEY=your-key-here
# run_task.py
import os
import json
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
MODEL = "kimi-k3"
TOOLS = [{
"type": "function",
"function": {
"name": "count_words",
"description": "Counts the number of words in a block of text.",
"parameters": {
"type": "object",
"properties": {"text": {"type": "string"}},
"required": ["text"],
},
},
}]
def count_words(text: str) -> int:
return len(text.split())
def run_task(task: str, max_turns: int = 6) -> dict:
"""Runs a task through Kimi K3, executing any tool calls it makes,
and returns a small report of what happened."""
messages = [{"role": "user", "content": task}]
total_prompt_tokens = 0
total_completion_tokens = 0
turns_used = 0
for turn in range(max_turns):
turns_used = turn + 1
response = client.chat.completions.create(
model=MODEL,
max_tokens=1024,
tools=TOOLS,
messages=messages,
reasoning_effort="max", # K3 replaced the old `thinking` param with this
)
usage = response.usage
total_prompt_tokens += usage.prompt_tokens
total_completion_tokens += usage.completion_tokens
message = response.choices[0].message
if response.choices[0].finish_reason != "tool_calls":
return {
"answer": message.content,
"turns_used": turns_used,
"prompt_tokens": total_prompt_tokens,
"completion_tokens": total_completion_tokens,
}
messages.append(message.model_dump(exclude_none=True))
for tool_call in message.tool_calls:
if tool_call.function.name == "count_words":
args = json.loads(tool_call.function.arguments)
result = count_words(args["text"])
messages.append({
"role": "tool",
"tool_call_id": tool_call.id,
"content": str(result),
})
return {"answer": None, "turns_used": turns_used, "error": "Hit max_turns without finishing"}
if __name__ == "__main__":
task = (
"Write a two-sentence description of what a mixture-of-experts "
"model is, then use the count_words tool to tell me exactly how "
"many words your description contains."
)
report = run_task(task)
print(json.dumps(report, indent=2))
这是做什么的:因为Moonshot的API遵循标准的OpenAI聊天补全合约,工具调用以熟悉的message.tool_calls形状到达,而不是自定义格式,finish_reason == "tool_calls"是执行工具并循环返回而非返回的信号。一个值得直接指出的K3特定细节:K2系列中旧的thinking参数在K3中已消失,被reasoning_effort取代,截至本文撰写时,“max”是唯一支持的值,未来承诺提供更多级别。
如何运行:导出你的密钥后,运行python run_task.py
关于定价,因为这是Kimi整个卖点的核心:K3运行价格为每百万输入令牌3美元,每百万输出令牌15美元,在整个100万令牌上下文中统一价格,没有按长度的分层定价。这大约是K2.6定价的5倍跃升,值得注意的是这是Moonshot摆脱Kimi系列赖以建立声誉的超廉价定位。
然而,自动前缀缓存将缓存输入费率降至每百万令牌0.30美元,这对长上下文、多轮对话的经济性产生了有意义的变化。
独立测试人员实际发现
积极方面,TechRadar的动手测试描述了在文档密集型工作上的真正强劲结果:将两篇长PDF放入一次对话中,要求Kimi交叉引用特定部分,结果准确且组织良好,在后续问题中保持一致——将长上下文处理描述为Kimi最强的优势之一,即使在免费层也可用。
同一评测测试了Kimi Code在Python重构任务上的表现,发现输出干净,架构推理在质疑下站得住脚,尽管在结构化解释方面不及Claude Code——评测者认为考虑到价格差异,这种权衡是值得的。
同一讨论线程中一位Hacker News用户的直率评估将K2.6在原始能力上评为低于Sonnet和Opus 4.0。在一个值得认真对待的细节中,恰恰因为它来自供应商本身而非批评者,Moonshot自己的K3发布材料坦率地承认K3在其内部比较中落后于Claude Fable 5和GPT-5.6 Sol,将其定位为强大且价格大幅降低,而非干净的前沿胜利。
综合来看,这是一个连贯的图景而非矛盾:Kimi在长上下文文档工作上确实有能力,编码能力合格且成本效益高,在特定最困难、最需要代理协调的任务上落后于Claude和GPT——这恰好是Agent Swarm旨在销售的确切类别。
值得了解的粗糙边缘
在真正采用之前有几点值得了解——没有哪一点单独是 disqualifying 的,但都值得考虑。2026年7月20日,Moonshot在需求激增后GPU容量达到极限,完全暂停了新的K3订阅——这是一个关于扩展增长痛的真正信号而非谣言。Moonshot自己的文档将“过度主动”标记为观察到的K3行为,即模型在任务中途遇到模糊性时做出未经提示的决定,而不是停下来询问——这是对其在长而困难的任务上进行大量训练的直接结果。还有一个真正的 harness 兼容性问题:Moonshot表示K3被训练为跨会话保留推理历史,如果代理harness未能正确传递该历史,或者在另一模型上开始的会话在对话中途切换到K3,输出质量可能会下降——这就是为什么Moonshot推荐其自己经过验证兼容的工具,并建议不要在中途切换模型。最后,对于受监管行业,Kimi的托管API通过位于中国的服务器路由——这是一个独立于模型能力的真正实际考虑。
关于许可:完整的K3权重于2026年7月27日在定制的Kimi K3许可下发布,在“开放权重”意义上你可以下载和运行它们,但这不是OSI认可的开源许可——如果你的评估中“开放”是在做特定的法律工作而不仅仅是意味着“可下载”,这点值得知道。
比较表
总结
诚实的答案介于发布帖和怀疑推文两个极端之间。Kimi的定价确实具有颠覆性,其长上下文文档处理在免费层也确实强大,Agent Swarm是一个真实的、比大多数竞争对手的等效功能文档更周到的架构——包括对其自身失败模式异常诚实的说明。与之相对的是:在最困难的代理协调任务(Agent Swarm存在的确切类别)上的独立测试显示,与Claude和GPT之间存在真实、可衡量的差距——Moonshot自己的发布材料也没有完全否认这一点。
如果你的工作是长文档分析、成本敏感的高容量编码,或者你特别想要一个具有真正代理雄心的开放权重模型,Kimi值得真正试用。如果你的工作依赖于最困难的多代理协调完美无瑕地工作,迄今为止的独立证据表明等待——或者至少,在你自己的工作负载上运行自己的评估,在大规模信任群集之前,而不是信任Moonshot的数字或我的数字。
Shittu Olumide是一位软件工程师和技术作家,热衷于利用前沿技术打造引人入胜的叙事,对细节有敏锐眼光并擅长简化复杂概念。你也可以在Twitter上找到Shittu。
