K3发布后的48小时,全球AI圈都被点燃了。所有人都迫切地想体验一把这个综合性能仅落后于Fable 5和GPT-5.6 Sol的开源模型,到底性能如何。

可这就导致Kimi的服务器在一瞬间承受了巨大的压力。因此,Kimi官方不得不在7月19日深夜,发布一则标题为《关于算力紧缺与会员暂停开放的说明》的公告。

Kimi官方表示,目前K3的请求量大幅超出预估,已经逼近现有算力集群的承载极限。

为了保障已订阅用户的体验,即日起暂停C端新用户会员订阅,把现有算力全部留给老用户。同时,会员体系将拆分为两部分,分别为Kimi的主权益(Kimi Web、Kimi App、Kimi Work)和Kimi Code权益,以便更精准地分配算力。

翻译一下:K3太火了,服务器扛不住了,先别进新人了。

与此同时,外媒爆料称,Kimi已向投资者发出股东决议,寻求对香港上市的批准,最快六个月IPO。

为了推动上市,Kimi目前正在完成一轮新融资,估值可能超过300亿美元。

今年3月,月之暗面ARR(年化收入)首次突破1亿美元;5月突破2亿美元;到6月已经接近3亿美元,三个月内翻了三倍。

收入结构也跟以前天差地别,API业务占比已经突破了70%,而以前的Kimi,主要收入靠C端订阅。

外媒进一步爆料称,在K3发布后,ARR又实现了数倍增长。

不过K3引发的震荡远不止于此。

美国国家前AI事务负责人、现任总统科技顾问委员会联席主席大卫·塞克斯(David Sacks),发文表示,这是中国模型第一次在前端编程赛道拿下第一。

塞克斯说,照此以往,美国将输掉AI竞赛。

在爆火之后,K3如今也成为了硅谷的新标的。马斯克就是如此,他表示,xAI旗下最新大模型将于下周完成初步训练,可能超越Kimi。

K3发布的首个交易日,英伟达单日市值蒸发约1111亿美元,与2025年1月DeepSeek发布时如出一辙。费城半导体指数本周下跌12.5%,创下15个月来最差单周表现。摩根大通策略师在报告中直接称之为“DeepSeek 2.0”。

加州大学伯克利分校计算机科学教授、Databricks联合创始人伊翁·斯托伊卡(Ion Stoica)说:“我们过去常说,开源模型,尤其是中国的开源模型,比目前最先进的模型落后六到九个月。可现在,这个差距大概只有两到三个月了。”

那么问题来了,这个K3,到底是从哪冒出来的?

01

两年前埋下的那颗种子

要说K3,得先把时间拨回2024年。

当年,杨植麟在内部小范围分享了K0-Math模型。这个模型能像人一样做验算、改错题。

当时杨植麟提出了一个判断,说下一个 Scaling Law,叫做Reinforcement Learning Scaling,简称RL Scaling。

过去的Scaling Law,本质上是让模型“死记硬背刷题库”。你把海量的训练数据喂给它,它把所有题目和答案全背下来,考试的时候看到题目,就凭记忆拼出一个“最像正确答案”的东西。背得越多,分数越高。

学术上,这个方法叫Next-Token Prediction,每一个字,都是根据前面所有字算出来的最有可能出现的下一个字。

杨植麟说的RL Scaling,换了个思路。不让模型背答案了,让它学会自己刷题、自己改错。

具体的做法是,给模型配一个“自动打分”的机制。它先自己试着做一遍,做完给自己打分。做错了没关系,回头看哪步出问题了,改一遍再交,改到对为止。然后把这次怎么错的、怎么改对的,全都记下来,变成自己的经验。

K0-Math的底层逻辑就是RL Scaling,它的数学成绩超过了OpenAI当时最强的推理模型o1。

而今天的K3,正是两年前RL Scaling的第一次大规模落地。

这也就是K3技术报告中提到的“视觉闭环”(Vision in the Loop)。

它的本质,是把K0-Math在解数学题上的RL Scaling能力,扩展到了带视觉反馈的全场景。模型写完一段代码,自己看看效果,哪里不对自己改,改完再看,形成“生成—看效果—迭代”的完整工作流。

Kimi在技术报告里放了几个Demo,以演示视觉闭环的效果。

K3从零开始写了一个3D开放世界游戏。用Three.js、WebGPU 和 GPU Compute,在浏览器里跑起来了一个可以骑马探索的程序化生成开放世界。

其中的地形、光影、玩法逻辑,全是模型自己写的。它甚至调用了外部工具来生成3D骑手和马的模型。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8usZNpyPeeX