中国政策档案 Governance Archive HOLDINGS 227,292 · FONDS 111
← Back to document 唐晓甫| “Kimi时刻”倒逼硅谷反思:美国的投资效率是否太低了?
Open original site →
Extracted Text
【文/观察者网专栏作者 唐晓甫】 7月19日,Kimi K3发布48小时后,月之暗面暂停了C端新用户订阅。虽然此前其他模型也曾出现疑似算力不足引发的“降智”现象,但是类似一款国产大模型因需求过载而主动限流,这在国内AI行业中实属罕见。这也恰恰说明Kimi K3作为一个开源模型,正对全行业商业化定价形成长期冲击。 Kimi时刻到了! Kimi K3究竟有多火?看看使用量就知道了。根据全球规模最大、最受欢迎的AI模型API聚合与路由平台OpenRouter,截至北京时间7月22日上午,Kimi K3的过去7天(上线仅6天)的词元使用量就超过7400亿,在所有模型中排名第14(榜单实时更新)。 Kimi K3在Open Router上的实时调用情况 Open Router 而这种需求的背后是并不便宜的定价,作为一个拥有1.05M词元超长上下文长度的大模型,其API定价为每百万词元输入3美元、缓存命中输入0.3美元、输出15美元。 我们可以对比一下,DeepSeek-V4预览版已经采用峰谷定价:V4 Flash的输入、缓存命中和输出价格分别为0.14美元、0.0028美元和0.28美元;V4 Pro则分别为0.435美元、0.003625美元和0.87美元,显著低于Kimi K3。 智谱GLM-5.2的每百万词元普通输入、缓存命中输入和输出价格分别为1.4美元、0.26美元和4.4美元。K3的普通输入价格约为GLM-5.2的2.1倍,输出价格约为其3.4倍;两者缓存命中价较为接近,K3仅高约15%。可以说,粗略一看,无论从何种角度看,对于国人来说,Kimi K3都谈不上便宜(写作期间,Qwen 3.8尚未公布其API价格)。 虽然这一价格仍明显低于OpenAI和Anthropic的最高端模型,但对于很多国人来说已经偏贵。事实上,从定价的角度看,Kimi K3与美国顶级大模型更加接近。 OpenAI的GPT-5.6 Sol每百万词元的短上下文输入、缓存命中和输出价格分别为5美元、0.5美元和30美元,长上下文则提高至10美元、1美元和45美元。我们可以看到,K3较GPT-5.6 Sol,普通输入和输出均便宜约40%至50%。而更低一档的GPT-5.6 Terra定价为2.5美元、0.25美元和15美元,其输出价格与K3完全相同,输入和缓存价格还略低于K3。 Anthropic的最新高端模型Claude Fable 5的普通输入、缓存命中和输出价格分别为10美元、1美元和50美元,K3大约相当于其30%;Opus 4.8则为5美元、0.5美元和25美元,K3相当于其60%。 作为迄今为止全球参数规模最大的开源模型,Kimi从技术路线上就选择独创的混合线性注意力机制。当然这样的路线选择也注定K3在设计之初就没想依赖性价比取胜,而是希望通过更高的性能上限获得更高溢价。而这种通过追求更高性能上限来获取高溢价的路线,几乎是中国开源模型的首次商业尝试,但这一次,它似乎正在成功。 根据官方公布的相关数据,Kimi K3在编码、通用Agent和视觉Agent三大板块的所有子项目上排名都在前三之列,而且在部分子项目上处于世界第一的水平。根据相关程序员实测,虽然Kimi K3的词元利用率相较于GPT-5.6 Sol和Fable5偏低,部分压低了其相对于这两款顶级模型的成本优势,但其前端能力已经跻身全球第一梯队,部分场景甚至达到世界第一水平。这是此前的开源模型从未达到过的成就。 Kimi官方给出的成绩单涵盖编码、通用Agent和视觉Agent三大板块,在所有排名中,Kimi K3在多数项目中进入前三,甚至部分小项排在第一 Kimi 国内外不少程序员第一时间就开始对Kimi K3进行尝试,通过类似乃至一致的prompt对比K3与GPT-5.6 Sol和Fable 5等AI大模型的前端生成能力。测试结果令人惊讶,不少程序员都反映,Kimi K3在3D效果生成、游戏生成、UI生成等场景都有非常好的表现,甚至可以在不少场景中击败GPT-5.6 Sol和Fable 5。 外网实测后对Kimi K3评价普遍不低 X 而这样的成绩,无疑让人们进一步思考一个问题:大模型真的像美国人说的那样,有那么高的壁垒吗? 大模型真的有那么高的壁垒吗? 如果说DeepSeek R1横空出世,第一次系统地向全球开发者展示了如何通过大规模强化学习,让模型在缺少人工标注推理轨迹的情况下形成长链推理、自我验证和反思能力,让世界上除了GPT以外的模型理解了如何构造适用于复杂任务的长思维链,降低了其他模型相对于GPT的技术代差,推动全球大模型在2025年进入了百花齐放的阶段。 那么,Kimi K3在编码、通用Agent和前端开发等测试中的良好表现,则进一步动摇了人们过去对于“闭源模型必然长期、显著领先于开源模型”的信念。它的出现以一种毫无疑问的方式,证明了开源模型与全球最强闭源模型之间的差距,已经从过去的代际差距缩短到1-3个月,甚至在部分具体任务上出现反超。 其实,如果长期关注人工智能发展最新动态的人,对于这个结果的出现绝对不会感到意外。 大模型开源始于已经在本轮顶级AI模型竞争中出局的Meta。2023年2月,Meta发布第一代LlaMA,主要向研究机构开放;同年7月推出Llama 2后,允许开发者将模型权重用于研究和商业应用,并开始建立当时全球规模最大的开源大模型生态。 Meta选择开源和本地部署的核心原因在于,其收入来自社交平台和广告,并不需要直接依靠出售模型调用获得回报。其核心思路就是通过降低基础模型的稀缺性,推动Llama成为行业公共底座,让竞争优势更多回到应用、用户入口、数据和产品分发,将商业模式拉回到自己最熟悉的环节。 但此后,包括Qwen在内的一批大模型厂商也进一步扩大了开源模型的供给,而且他们还叠加了更加现实的企业需求:用户可以将模型部署在自己的服务器上,允许开发者修改、部署和二次开发,降低敏感数据上传外部云端的风险,吸引云厂商、硬件企业、科研机构和应用开发者围绕Qwen建立生态,并减少对单一模型供应商的长期依赖。 只是这一系列尝试并未真正动摇以OpenAI和Anthropic为代表的闭源模型在前沿能力上的领先地位。2024年9月,OpenAI发布o1-preview,首次将测试时计算和长链推理能力系统性地应用于商业大模型。在数学竞赛、高难度科学问题和复杂代码推理等任务上,也一度拉开了与绝大多数模型的距离,进一步稳固了先发优势,也推动了所谓AI神话的出现。 当时国内不少人认为以ChatGPT为代表的美国闭源模型,已经完全取得了对于开源模型尤其是中国模型的绝对优势,直到DeepSeek R1的出现以及2025年初的“DeepSeek时刻”。 DeepSeek R1作为开源模型,首次在数学、代码和通用推理等测试中整体接近o1正式版。R1在AIME、MATH-500、LiveCodeBench和SWE-bench Verified等测试中与o1互有胜负,证明开源模型与最强闭源推理模型之间已经不再存在此前想象中的代际差距。 虽然DeepSeek R1造成了美国股市的短暂暴跌,并且引领了全球顶级AI进入“推理AI”的时代,但从科技资本的角度来说,DeepSeek R1的出现并没有动摇美国AI投资神话。原因是多样的: 1. DeepSeek R1虽然显著缩小了与o1的差距,但OpenAI于2025年4月正式发布o3之后,R1在复杂代码、科学推理、多模态理解和工具调用等方面的差距被重新拉大; 2. R1在AI幻觉率等多方面表现并不令人满意,在Coding和Agent能力方面与外国加速更新的顶级AI差距明显; 3.R1缺少多模态能力; 4. DeepSeek R1的出现甚至刺激了全球范围内对芯片的需求。当时黄仁勋就表示,像DeepSeek代表的推理型AI模型,在面对复杂问题时需要进行“思考”,进行大量的强化学习、微调和模型蒸馏,由DeepSeek引发的全球模型推理潮会让新的模型比传统的非推理模型消耗的计算量高出约100倍。 以上种种原因,都推动了美国的科技股神话在2025—2026年进一步登上神坛,并且在许多普通人心中树立了一个闭源模型不可战胜的思维烙印。也正是这种烙印,推动了科技巨头进行AI基础设施创纪录的资本开支,以及迎来了AI Agent时代的到来。 1 2 下一页 余下全文
Archived Raw HTML