Kimi K3排名第一,引发美股暴跌?

中国新闻周刊    2026-07-25 10:56:34

“每次有新模型发布,我们都会测一测,从成本、效果等角度看看它能不能替代我们正在使用的模型。”TalkMe CEO贾子健告诉《中国新闻周刊》,作为一家开发口语练习应用的公司,测试大模型已经是工作习惯。

这一次贾子健测试的对象是Kimi K3。自7月17日凌晨发布后,月之暗面的Kimi K3成为最受关注的大模型。它头顶一众光环,参数规模2.8万亿,被称为参数量最大的开源权重模型。

新的架构,超过两万亿的参数规模,这些都让贾子健对Kimi K3有比较高的期待。“Kimi K3的风评很好,无论是在社交媒体上,还是在身边的朋友间。”

Kimi K3一经发布,使用量也迅速提升。抛开技术层面的探讨,人们争相使用的Kimi K3究竟好不好用?贾子健的答案是:“‘好’并不等于适合。就像兰博基尼足够好,但是不适合每天接送孩子。”

又慢又贵?

Kimi K3确实足够“好”,最直观的体现是它在多项测评中表现出色。根据公司公告,Kimi K3在多个主流编程和智能体基准中与目前全球最强的两款大模型Claude Fable 5和GPT-5.6 Sol达到可比区间。

比如在第三方测评平台Artificial Analysis上,Kimi K3排名全球第三,落后于Claude Fable 5和GPT-5.6 Sol。而在第三方评估平台Code Arena上,Kimi K3的编程能力位列第一,这是开源模型首次在该榜单上超越闭源模型登顶。

Arena前端代码能力排行榜。图:网络

“普通人使用大模型以聊天为主,或者让它协助自己完成一些简单任务,这些应用远远触碰不到大模型的能力边界。”贾子健告诉记者,作为一家应用开发公司,可能首先会关注大模型的编程能力,这是顶尖大模型非常重要的一个评判维度。

他认为,Kimi K3编程能力比较出色,也间接放大了其声量。“特别是在前端渲染能力上,人们会将其与Fable 5对标,比如人们很容易就被其生成的一些更精细的网页3D游戏所吸引,因为人是视觉动物。但是在我们的测试中,Kimi K3后端编程能力与DeepSeek V4 Pro基本相当,这是我们实际应用更为关注的能力,前端能力再强,目前也仅限于手搓小游戏,或者做个Demo(演示)的水平。”

除去编程,贾子健的测试维度还包括听话、防瞎编、脑子、记性和脑洞,共六个方面。他的结论是,相比于DeepSeek V4 Pro,两者能力打平,但DeepSeek效率胜出,而且更便宜。DeepSeek是贾子健公司主要应用的模型之一。

同样完成他测评中的6项任务,DeepSeek比Kimi快30%以上,而后者价格是前者十几倍。比如对于一项考察记忆力的任务,Kimi比DeepSeek多花了近7分钟。

“我们会比较在意响应速度,但是对于一些长程推理场景,响应速度就不那么重要。其实在测试前,基于Kimi K3参数量,我们就认为它一定会‘慢’一些,测试的结果也符合预期。”贾子健说,比如在一些场景,公司还在使用更早的GPT版本,其响应足够快,也足够便宜,而对于一些更追求效果而非速度的场景,适配的模型也会不一样,“应该在不同的场景使用不同的模型”。

根据公司公告,Kimi K3主要面向长程编程、知识工作和推理等前沿智能场景而设计。

贵,并且慢,这其实是不少Kimi K3用户的共同感受。在价格方面,Kimi K3的API价格为每百万tokens输入2元(命中缓存)和20元(未命中缓存),输出100元。其输出价格和未命中缓存的输入价格在主流国产模型中都是最高,但与美国的顶尖模型相比仍有一定优势。

月之暗面“秀肌肉”

“其实相比于国内使用的主流模型,Kimi K3的性价比没有那么高。”有AI业内人士告诉记者,其更多在于试水新架构,以及为下一步融资与未来上市做铺垫,“秀肌肉”的意味比较明显。

根据彭博社报道,月之暗面计划在8月启动新一轮融资,目标估值为投前500亿美元,这将成为公司上市前最后一轮融资。

月之暗面由杨植麟于2023年4月创立,公司名源自平克·弗洛伊德专辑。杨植麟本科毕业于清华,博士就读于卡内基梅隆大学,师从苹果AI负责人,曾任职于Google Brain。

公司成立后融资迅猛:2024年完成超10亿美元A+轮及B轮,估值达33亿美元;2025年底完成5亿美元C轮,账面现金超百亿;2026年密集融资,5月D轮20亿美元,估值突破200亿美元。公司计划8月启动Pre-IPO轮融资,最快明年初港股上市。

7月16日晚,K3发布前后的72小时内美股半导体板块蒸发数千亿美元,《华尔街日报》点名月之暗面的K3加剧了这轮芯片股的抛售。摩根大通则把这一日称作“DeepSeek 2.0时刻”。

贾子健告诉记者,参数量大必然会带来一些问题,比如面临算力的瓶颈。

月之暗面在7月19日的声明中表示,自Kimi K3发布以来,用户请求量大幅超出预估,已经逼近公司现有计算集群的承载极限。当前,公司已经暂停Kimi K3C端新用户订阅,将已有算力全部投入于服务已订阅用户,并许诺会全速推进算力扩容,逐步开放更多订阅名额直至全面恢复正常订阅。

贾子健认为,未来Kimi K3在推出后续版本时,可能会在性价比层面优化,模型参数量对应不同的运营、使用成本,并非简单的“越大越好”。“比如Kimi K3和DeepSeek V4 Pro都是开源模式,但前者私有部署的成本可能更高,需要更多GPU。”

K3成为现象级产品后,争议也随之而来。首当其冲的是“参数竞赛是否走入歧途”的讨论。2.8万亿参数,这个数字足够震撼,却也引来了质疑——当模型规模以指数级膨胀,算力消耗与边际收益之间是否已经出现严重失衡?有开发者算过一笔账:用Kimi K3跑一次中等复杂度的任务,电费和GPU占用成本足以让小型创业团队“肉疼”。而DeepSeek V4 Pro以不到十分之一的价格、三分之二的时间完成相同质量的工作,让不少人开始重新审视“大即是强”的信仰。

针对外界争议,2026年7月21日上午,月之暗面企业业务负责人黄震昕公开回应,否认了“K3是蒸馏小模型”的猜测,强调其性能跃升来自底层原创架构创新。同时,针对暂停新用户订阅,他表示公司面临两难抉择,选择优先保障付费客户体验,并正全力通过模型优化和算力供给解决问题。

责任编辑:张誉耀