25载光阴荏苒,《少林足球》中的名场面犹在眼前:少林队与莫文蔚、张柏芝饰演的“玉面双飞龙”那场戏。二人夸张的脏辫与滑稽假胡,配上那句“想入决赛,先问问我们!”的狠话,至今仍令人印象深刻。
时光流转至2026年,星爷新片《功夫女足》让这对传奇组合再度焕发生机——张小斐的“双双”与迪丽热巴的“钰珑”,其名字合并正好对应“玉面双飞龙”。
作为峨眉队队长,双双堪称全队攻防核心。她根基扎实,球路沉稳,擅使太极卸力盘带、太极沉劲远射等绝技,招式攻守兼备,尽显以柔克刚之妙。而身为峨眉队前锋的钰珑,则是球队的尖刀角色。她身法灵动,攻势凌厉,十二路弹腿、旋风削球等招式令人眼花缭乱,总能精准破局,爆发力惊人。
此刻回望,AI赛道的“粤籍双雄”——梁文锋与杨植麟,何尝不像这对组合。
DeepSeek深谙以柔克刚之道。如果说“大力出奇迹”的scaling law路线属于刚,那MoE稀疏激活、原生FP8训练框架以及纯RL驱动的卸力打法便属于柔。而Kimi则爆发力十足,犹记一年前,Kimi还常被当作DeepSeek的反面镜像被热议,“Kimi掉队了”之声甚嚣尘上。可如今,它已然王者归来,气势如虹。
Anthropic与OpenAI领衔的硅谷三巨头,则成了它们眼前的“大河队”。
01
“美国为何没留住杨植麟”,7月17日,一网友在社交平台抛出此问,掀起轩然大波。杨植麟在卡内基梅隆大学的导师、AI领域知名学者Russ Salakhutdinov也加入战局,戏称“我本将心向明月,奈何明月照沟渠”……当然,实际意思是杨植麟曾获苹果高管抛出橄榄枝,但他决心已定,要自创公司。
随后遭遇MAGA信徒“为对手输送人才”的攻击,Russ毫不示弱予以回怼:“这不就是你们想要的吗?”(注:此句针对特朗普政府推行的H-1B签证政策。)
若说大洋彼岸网民还会扣“反思怪”“带路党”帽子,那此番争论便极具代表性。
这场争论的导火索,正是Kimi K3搭载2.8万亿参数架构强势登场,令硅谷与华尔街为之震动。
若Kimi K3仅是AI博主口耳相传的“遥遥领先”,我们大可付之一笑。但硅谷技术圈及华尔街资本市场的反应,却不容小觑。
马斯克在评测帖下留言“Impressive(令人印象深刻)”;OpenAI战略负责人Dean Ball称大规模开放权重前沿模型为“减速主义力量”,并预言美国监管层将出手构建保护主义壁垒;特朗普政府AI顾问David Sacks表示K3的突破令人忧心,加剧了AI地缘竞争态势……遵循“对手评价>国内认可>自我吹捧”的排序,我们不妨对K3多加关注。
《华尔街日报》以大标题“The Kimi Shock”抢占头版;高盛研报认为K3标志着中国模型迈入定价权新时代……Kimi无疑赢得了面子。
风波骤起,一池夏水被吹皱,更掀翻诸多泡沫:美股AI板块上演“72小时惊魂”,整体市值蒸发约4700亿美元,费城半导体指数单周重挫12.5%,跌入技术性熊市。“DeepSeek时刻”尚且如约而至,“DeepSeek2.0时刻”岂能缺席?
遵循“它跌得,我跌不得”的选择性联动逻辑,A股市场也成功传递了这股“跌跌不休,时不我予”的哀愁情绪给本土投资者。
曾让硅谷与华尔街惊弓之鸟的,还有DeepSeek。
去年1月,R1问世后,同样令硅谷与华尔街一片哗然。A16Z创始人、著名投资人马克·安德森那句“斯普特尼克时刻”,成了形容其影响的经典表述。
Meta紧急启动危机应对机制,成立四个“战情局”,Scale AI创始人亚历山大·王直言“DeepSeek的发布或将改写一切”……此举无异于为DeepSeek加分。
英伟达股价单日重挫16.86%,市值一夜蒸发5888.62亿美元,情景恍若K3发布后的此刻。
02
一年半前,DeepSeek携R1惊艳亮相,其性能与OpenAI o1看齐,API调用成本却仅为o1的约2%,随后拍着胸脯喊出“惊不惊喜?”的口号。
一年半后,众人尚以为惊喜为偶然,Kimi又携K3强势登场,笑道“意不意外?”
一次突破或许是运气垂青,多次突破则……因吹斯听了。
DeepSeek-R1问世后,《自然》杂志将梁文锋推上“2025十大科学人物”之列,评价DeepSeek“首次让世界意识到美国并非AI领域绝对王者”。
Kimi K3官宣后,摩根士丹利指出K3证明中国大模型在规模、性能、定价等维度全面赶超美国顶尖模型。
此中深意,值得玩味。
早前ChatGPT掀起AI浪潮,全球AI大模型赛道剧本便是OpenAI作男一,Anthropic、谷歌分任男二男三,其余皆为群演……
彼时格局清晰:国内“六小虎”虽奋力蹦跶,但OpenAI一句“我话说完,谁支持谁反对”,便让它们只能选择沉默,争得的不过“中国版OpenAI”虚名。
亦步亦趋、微调借鉴,成了当时国产大模型的惯性路径。
模仿多年,直至DeepSeek喊出“头部AI,宁有种乎?”
MLA将显存占用削减至传统架构的5%-13%,DeepSeek的MoE稀疏架构通过稀疏激活大幅降低计算量,Zero无样本自进化开拓了低成本训练强推理模型的崭新道路……凭借这些创新,DeepSeek成功缩小了中国AI与美国技术代差。
DeepSeek以“力大砖飞”的硅谷信仰重重一击,给国内外科技企业上了生动一课:AI核心竞争力绝非参数堆砌与算力叠加所能定义,算法架构优化、工程落地能力与资源利用效率同样关键。
总体而言,DeepSeek为中国大模型构建的心智锚点:性能虽存微隙,性价比却当真香。
及至Kimi K3,中国大模型角色已从“搅局者”升格为“破局者”。K3在复杂逻辑推理、长文本处理、代码生成、多场景应用等核心维度的优异表现,让人们意识到:中国大模型在性能层面已能全方位、深层次地追平美国顶级模型。
此前,硅谷AI企业高溢价的核心支撑,在于“闭源付费+高端性能”模式,通过技术壁垒攫取超额利润。
此前的确行之有效:尽管国产大模型早些方面已超GPT、Claude、Gemini等,但在核心维度始终稍逊一筹,对外宣传多用“位列开源大模型第一梯队”遮掩……
但Kimi K3综合实力在Artificial Analysis综合智能指数评测中位列第三,在代码评测榜单Arena的前端代码榜上独占鳌头(此排名含金量高),智能体&自动化任务、长文档检索等维度亦为第一……终于让顶尖开源模型能与顶尖闭源模型平起平坐。
犹记上月,有网友在社交平台问马斯克:“中国大模型何时能达Anthropic的Fable水准?”马斯克预测需等到2027年第一季度。智谱创始人唐杰则回应:“没那么久。”如今K3强势出世,为清华老师这番话做了注脚。加州大学伯克利分校教授伊恩·斯托伊卡感叹:“过去常说开源模型落后最前沿6-9个月,现在差距或仅存2-3个月。”从“性能不及顶尖但价格实在亲民”,到“性能也能达顶尖水平”,这一跨越让人想起中国制造:早些年给人印象是“能造出质量不错价格实惠商品”,如今中国制造亦可称为“高端制造”代表。
03
谈及此,并非要鼓吹“东升西落”式论调,也不是忽视“整体差距依旧显著”的基本现实。
DeepSeek-R1与Kimi K3,确实让硅谷与华尔街的“中国AI巨物恐惧症”发作。但这不代表差距已完全消除。
若抽去模型能力代差不说,从底层算力来看,国内高端算力自主可控率仍存巨大提升空间。切莫因“寒武纪不是小英伟达,英伟达是小寒武纪”的段子,就真的无视横亘其间的鸿沟。
从生态成熟度看,硅谷AI历经多年沉淀,已形成“算力+模型+工具+场景+资本”完整闭环,上下游产业链高度成熟。中国AI生态则处于迅猛发展期,商业化体系等仍待完善。对比国内AI创企与Anthropic、OpenAI的ARR量级,便知一二。
从人才储备看,国内工程师红利虽让黄仁勋等羡慕不已,但顶尖AI算法人才、底层架构人才的总量与硅谷尚存差距。在“ nuestros ”(Our Chinese)与“suyos ”(Their Chinese)的较量中,我们还需竭力吸引更多杨植麟、姚顺雨回国效力。
见证中国AI从单点技术突破到体系化能力成熟的提升,与看到中美AI差距,并不矛盾。
事实上,越是看见差距,越能在正视基础上加速追赶。梁文锋曾言:“我们常言中国AI与美国存在一两年差距,但真实差距在于原创与模仿之别。若源头不变,中国永远只是追随者,某些探索实属必然。”
正因洞悉差距,DeepSeek与Kimi才实现了众多架构级原创式革新。
如DeepSeek的原生链式思考(CoT)自主推演+R1-Zero无样本自进化机制+MoE稀疏架构+MLA优化长上下文承载力等;
又如Kimi的超大容量稀疏MoE基座+KDA混合线性注意力体系+原生百万Token上下文建模技术+Agent Swarm+RL Scaling全链路强化学习范式+MuonClip大规模训练优化器等。
得益于这些创新,DeepSeek V4破解了大模型长文本推理卡顿、逻辑断层、算力浪费等行业顽疾,在万亿级参数模型轻量化部署上创下全球最优水平。Kimi K3则突破了超大参数模型训练瓶颈,在长文本理解、复杂代码生成、多模态融合能力上实现对海外旗舰模型的超越。
从DeepSeek R1到Kimi K3,都展现了持续缩小代差的可能——尽管差距尚未磨平。
这类接连迸发的突破,让中国AI正实现从仰视到平视海外标杆的转变,也必将促使硅谷调整心态。
过去数十年,美国科技产业的核心优势在于技术迭代的持续性与领先性。顶尖技术诞生后,常能长期保持代际优势。其他国家则多照搬其技术框架、遵循其硬件标准、接受其定价体系。
但DeepSeek-R1与Kimi K3们,正在颠覆这种叙事。
一次突破或属偶然,两次——不同企业在不同时间点、不同技术路线上均实现深层突破,这难免让硅谷部分企业丧失“反正有追赶窗口期”的心理优势。
对硅谷而言,未必惧怕成为第二名追随者——即便其紧追不舍,却必定忌惮跳出既定轨道的创新者——即便后者相距甚远。
04
“取次硅谷懒回顾,半缘DeepSeek半缘Kimi”,时下此番感慨并非全无膨胀之嫌,但DeepSeek与Kimi确实已成为AI界的“争气机”。
眼下说硅谷“懒回顾”,终究稍显自得。但DeepSeek与Kimi展示的中国AI活力不容忽视。
说到底,无论是DeepSeek还是Kimi,初出道时都未被视为能撼动硅谷的人物。
DeepSeek最初在“六(六小虎)+2(两家特色创企)”的行业格局中并不突出,V4与R1问世前,它不过是大模型界“拼多多”的生态位角色。
Kimi虽凭借长文本一度风光,但2024年后便遭遇过山车剧本,尤其在DeepSeek爆火后,更被置于“既生D何生K”的对比中沦为嘲讽对象。
然而,两者却在不被寄予厚望时脱颖而出。
这与梁杨二人的朝气锐气息息相关。
梁文锋指出中美AI真实差距是“原创与模仿之别”,矢志原创式创新。
杨植麟认为“很多时候你去做一个你不知道的东西,其实你不知道很多东西不知道,所以你才有这样勇气。做了之后,你会发现问题很多,也许创新的意义就在于此。”“Problems are inevitable, but problems are soluble(问题虽多,但皆可解)。”
言语间尽显广东人务实锐气。
他们代表那股蓬勃生长、锐意进取的力量。
这与当下相对纯净的竞争环境密不可分。
回顾DeepSeek与Kimi的“赛马”,实则从未停歇:
2025年1月,DeepSeek-R1与Kimi K1.5同日上线,相隔仅两小时;2025年2月,双方前后脚发表论文改造Transformer注意力机制;2025年4月,Kimi推出数学推理模型不久,DeepSeek-Prover-V2便问世;今年4月,Kimi发布Kimi K2.6支持300个子Agent协同,OpenRouter调用量飙升全球第一,3天后,DeepSeek发布V4系列……
二者亦相互“致敬”:Kimi采用的MLA注意力机制,核心源于DeepSeek早期工作;DeepSeek V4中的关键Muon优化器,其有效性先由Kimi团队验证。
在良好的竞争生态中,方能孕育更多DeepSeek与Kimi。
因而,要珍视梁文锋杨植麟的创新动能,要呵护让AI企业可激烈良性竞争的市场氛围。
在适宜创新生长的土壤气候中,DeepSeek与Kimi这类新锐力量方有更宽广上行空间,才能在AI全球角力场中继续证明——
“我们玉面双飞龙,可不是浪得虚名”。
【站点差异】本稿将发布于 kuaiyipress.com。请以不同的措辞、句式与段落节奏润色,避免与其他站点发布版本雷同;事实与数据仍须与原文完全一致。







