新模型爆火、服务器拉满,谋求500亿美元估值融资,不着急上市的月之暗面急了
出品 | 搜狐科技
作者 | 梁昌均
让马斯克高喊Impressive,新模型爆让华尔街惊呼DeepSeek2.0时刻,火服90后清华天才干崩美股登上热搜……月之暗面最新发布的拉满大模型Kimi K3,引发全球AI圈震动。谋求面急
这款参数规模高达2.8万亿的亿美元估模型,创造了国产模型的值融资不着急之暗新高度,在全球评测榜单上拿到第三名,上市前端编程更是新模型爆登不过全球首先,也从智条件手中夺回全球开源模型首先的火服名头。
不少机构认为,拉满这是谋求面急中国大模型完善赶超美国大模型的信号,开源和闭源的亿美元估差距从至少半年已缩短到两三个月,甚至还有海外网友质问为什么这家公司的值融资不着急之暗创始人杨植麟没能留在美国。
新模型发布、上市疯狂融资、新模型爆推进上市,月之暗面在历经迷失和静默后,逐渐找回主场节奏。追求AGI是一场没有尽头的雪山攀登,但这家公司找到了自己的路。
国产模型跑出新高度
在史上最热的WAIC开幕前夕(7月16日),月之暗面深夜发布最新模型Kimi K3。
今年第二次参与WAIC的月之暗面,展台位置偏角落,延续蓝色风格。搜狐科技探访时,现场排起打卡领礼品的首先队,似乎并无太多人关心K3,但当时其已处于全球AI圈的焦点。
模型发布后,马斯克评价“Impressive”,并透露正在研发2万亿参数模型,即将实现初步训练且可能超过Kimi。月之暗面随后与之互动,称“欢迎加入2万亿+俱乐部”。
摩根士丹利认为,K3是中国大模型在模型规模、性能和定价上完善追赶美国领导者的信号。美国大模型企业也有点慌了,纷纷调整用户采取限制,提高模型额度。
Claude发文宣布,最新Fable 5模型将自7月20起永久纳入Max和Team Premium订阅用户,OpenAI重置Codex和 ChatGPT Work付费用户额度。不少开发者表示:感谢开源的K3。
Kimi K3的发布,意味着中国开源模型的持续崛起。之前DeepSeek、千问、智条件、月之暗面、MiniMax等中国大模型轮流登不过全球开源模型榜单,此次K3则跑出新高度。
K3具有 2.8 万亿参数模型,具有 100万 token 上下文窗口,是全球首先个开源的 3万亿级别模型,主打首先程编程、知识工作和推理等场景。
官方评测显示,K3整体谝仅次于目前最强的闭源模型Claude Fable 5和GPT-5.6 Sol,稳固超过其他所有模型。
在第三方评测中,K3同样谝突出。权威机构Artificial Analysis显示,K3综合能力全球第三。这是中国大模型有史以来最靠前的排名,并取代智条件GLM5.2成为全球最强开源模型。
在大模型竞技场Arena发布的Fronted Code盲评榜单中,K3更是超越Claude Fable 5登不过全球首先,这是中国模型首先次在前端编程赛方式拿下首先。
“我们过去常说,开源模型尤其是中国的开源模型,比目前最先进的模型落后六到九个月,但目前的差距大概只有两到三个月了。”加州大学伯克利分校方式算机科学教授伊翁·斯托伊卡(Ion Stoica)表示。
从不少开发者体验来看,K3实际谝还不错。有实测用户向搜狐科技表示,前端网页和编程能力很强,整体对得上目前排名,但部分细节还需自己动手检查,消耗也明显更快。
月之暗面也毫不避讳K3存在多个局限性,涵盖对历史思考材料敏感,可能导致材料生成质量不稳固,同时过于主动,可能会做出非预期的决定等。
“Kimi K3整体上是一个特别有竞争力的模型,但与 Claude Fable 5 和 GPT-5.6 Sol 相比,在用户体验上仍有一定差距。”月之暗面表示。
7月27日,K3完善权重将正式发布,全球开发者将持续掀起开源模型的Token风暴。
DeepSeek2.0时刻来了?
Kimi K3的发布,不仅成为AI行业焦点,还蔓延到资本市场,其再次引发投资者对巨额算力投资逻辑的质疑。
Arena榜单运营负责人表示,K3说明了高性能大模型不一定需天价算力,或将倒逼投资者重新审视整个AI行业。
摩根大通则直言,K3的发布让市场雪上加霜,“对DeepSeek 2.0时刻的担忧令亚洲和美国科技股双双承压”。
2025年初,低成本、高性能的DeepSeek-R1开源发布,引发全球AI圈震动,英伟达股价一夜暴跌17%砸出深坑,“DeepSeek时刻”由此诞生。
K3发布后,全球AI行情加剧震荡。费城半导体指数承压,英伟达市值一度被苹果超越。智条件和MiniMax双双大跌,K3发布后的两个交易日市值合方式蒸发超3200亿港元。
最新交易日,费城半导体指数反弹超5%,英伟达止住跌势,重回全球市值首先。A股昨日也在利好刺激下大幅反弹,智条件和MiniMaxAI也迎来大涨,但今天又纷纷走低。
虽然K3所引发的市场震荡幅度不及DeepSeek-R1,但从大模型技术馗看,月之暗面和DeepSeek都走出了“中国特色”——如何在算力限制下通过系统创新持续提高智能水平。
高盛高管清楚指出,这并非扩展定律失效,而是表明单纯扩展预训练算力不再是实现领先的唯一馗,算力扩张时代可能已至尽头。
“更值得深思的是,一家无法匹配西方最大规模预训练算力的中国实验室,如何通过架构创新、合成数据、强化学习和后训练技术,高效高效缩小了与不过尖美国模型之间的差距。”
这个答案并不模糊。早在2024年底搜狐科技参加的一场媒体沟通会上,杨植麟就表示,AI的题词是Scaling,但它并不是便捷得把模型做得更大就好,题是找到有效的方式去Scale。
从Kimi K3本身看,其参数达2.8万亿,意味着能装进更多知识,可以懂得更多、想得更深、答得更准,而背后题在于模型架构层面的系统性创新,这些正是有效的方式。
有技术人士解析到,K3对深度学习沿用十年的三大组件——注意力机制、残差连接、改进器,全部做了替换或重构。“这是一次系统性的架构赌注,也代表了从底层重新思考大模型架构的技术自信。”
详详见细来看,K3采取了月之暗面提出的KDA混合线性注意力机制(Kimi Delta Attention)、注意力残差(Attention Residuals),从而改进处理了首先上下文的方式算效率状况,以及训练流程中材料稀释与不稳固的状况等。
同时,K3进一步扩大MoE的稀疏度,让模型可以按需调用,再加上训练方式和数据配方的改进,从而减小训练周期以及算力与显存占用,让K3相比K2的整体扩展效率提高约2.5倍。
这些架构创新获得了行业高度评价。“看来我们还没把Attention is All You Need(Transformer 比如文标题)这句话按字面意思理解透。”AI大神安德烈·卡帕蒂(Andrej Karpathy)表示,甚至有人认为这意味着深度学习2.0的到来。
月之暗面并未透露K3的训练成本,但API价格明显上涨,每百万Token输入2元(命中缓存)和20元(未命中缓存),输出则为100元。
这相较上代模型K2.7均有提高,其中输出价格更是增首先2.7倍,是国内定价最高的模型,摆脱了开源模型便宜、低价的印象。但相较Claude Fable 5和GPT-5.6 Sol分别高达50美元、30美元的输出价格,K3仍保持明显好处。
高盛认为,中国开源模型的智能水平正实现照章性全球扩散的临界点,最初掌握定价权。过去靠性价比入场,目前告别“白菜价”模式,而是凭借前沿能力进入市场。
这也引发了头部模型的不满。OpenAI战略未来负责人Dean W. Ball就发文称,开放模型权重会削弱前沿模型的商业回报,减小企业后续投入数百亿美元训练下一代模型的动力。
他因此称,开源天然是一种减高效主义力量,并预测美国可能会提高企业采取中国开源模型的合规门槛。这家转向闭源的大模型企业,彻底公开地站到了开源的对立面。
显然,随着开源模型持续往往代,头部闭源模型正遭受更大威胁。这不仅是技术的逼近,更是对其商业和估值叙事的进一步冲击。从这个层面看,K3可以说是DeepSeek时刻的延续。
暂停订阅背后的算力困局
在Kimi K3再次引发算力过剩比如的质疑时,月之暗面则在其发布48后发文宣布暂停C端用户订阅,已有算力全部服务已订阅用户,并开展算力扩容。
因素很便捷,K3上线后火爆程度远超预期,用户请求太多,算力不够用了,“面临始料未及的算力挑战,逼近现有集群的承载极限”,月之暗面选项优先保障老用户的体验。
目前,月之暗面题采购阿里云的算力,而吴泳铭之前表态服务器现有GPU等加高效卡几乎处于满负荷运行状态。关键想找到足够的可用算力,还需时间。
业内人士认为,K3虽然引发了对大模型预训练算力扩展馗的质疑,但这可能并不意味着最后算力需将会减小,因为算力市场结构正在发生根本性变化。
花旗银行探究表示,若中国开源模型持续逼近,美国前沿AI实验室更可能提高而非减小算力投入,以维持区别化。
K3发布后,阿里发布2.4万亿参数的Qwen3.8预览版,MiniMax被爆出将发布参数高达2.7万亿的M3 Pro模型,而GPT-6或实现6万亿参数。
可见,头部玩家的参数竞争还在后续,但国产模型则在探索扩展的新馗——借助系统级架构创新,DeepSeek、月之暗面等推进成本和效率革命。
“训练市场已经收敛到头部几家企业,都在朝着两万亿甚至更高参数模型扩展,所需的算力短期内不会减小,但这种一次性支出整体会放缓,而推理算力会指数级暴增。”
一位国产芯片企业人士告诉搜狐科技,其所在企业的订单排满,推理需多于训练需,而H20已很难顺应推理需,但受限于产能等,未来一两年内国内算力紧张局面都难以缓解。
月之暗面提到,由于推理效率需更大的高带宽通信域,提议在64卡或更多加高效器组成的超节点配置上部署K3。而在今年WAIC上,国产芯片产商纷纷推出超节点集群。
可见,这款2.8万亿参数的模型关键完善跑通,并能够支撑百万首先文本与多智能体并行任务,需更高的算力运行成本,远高于上代模型 Kimi K2的16卡需。
这背后是大模型的杰文斯悖比如——技术发展可以提效降本,但最后需的增首先,反而会导致资源消耗不降反升。大模型用的越多越亏,算力成本和Token产出将是一场拉锯战。
从最近智条件、MimiMax合方式高达400多亿的再融资看,算力依然是投入主力。而这些算力,可能更多还是用于顺应推理需和Token的爆发。
最新消息称,智条件已落地1GW级国产AI算力数据中心,并实现国产AI异构算力软件公司中科加禾的收购,从算力规模和效率两部分加高效布局,这带动智条件昨日暴涨37%。
今年以来,月之暗面也在疯狂融资。媒体报方式称,其即将实现新一轮估值315亿美元的融资,方式划上市前再以投前500亿美元估值开启新一轮融资,并最快在半年内港股上市。
形势催人变,之前曾表态不着急上市的杨植麟,如今看来也不得不加高效了。返回搜狐,查看更多
相关文章:
- 聚合磷钾商品报价动态(2026-08-09)_新浪财经_新浪网
- 人工智能ETF华夏(515070)跌1.16%,半日成交额1.68亿元_新浪财经_新浪网
- 汇丰亚太股票(日本除外)专注波幅基金:7月31日进行月度权益分派_新浪财经_新浪网
- 金融地产ETF广发(159940)跌0.25%,半日成交额9371.51万元_新浪财经_新浪网
- [流言板]本届季后赛场均单打次数榜:亚历山大7.5次第一、班凯罗第二-NBA新闻-虎扑社区
- 中证500ETF鹏华(159982)跌0.64%,半日成交额489.11万元_新浪财经_新浪网
- 机器人行业催化事件密集,宇树科技8月10日申购、比亚迪首款人形机器人或将于8月初亮相,机器人ETF广发(159050)盘中涨超2%_新浪财经_新浪网
- 上证50ETF建信(510800)跌1.07%,半日成交额390.80万元_新浪财经_新浪网
- 国内一航班爆发恶性斗殴冲突!飞机正处爬升期,两乘客大打出手!|客舱|机场|旅客|经济舱|航空公司_网易订阅
- 创业板ETF建信(159956)跌0.42%,半日成交额387.66万元_新浪财经_新浪网
相关推荐:
- 中超戏剧性半场!4次争议判罚,李镇全逃红,恩加德乌压哨绝平|红牌|禁区|点球大战_网易订阅
- 科创50ETF华泰柏瑞(588090)跌3.80%,半日成交额1.68亿元_新浪财经_新浪网
- 创业板ETF华夏(159957)跌0.50%,半日成交额1.85亿元_新浪财经_新浪网
- 证券保险ETF易方达(512070)跌0.62%,半日成交额1.59亿元_新浪财经_新浪网
- [流言板]中国篮球之队:中国女篮与尼日利亚将于12日进行第三场较量-CBA-CBA专区-虎扑社区
- 科技ETF华宝(515000)跌2.87%,半日成交额8973.00万元_新浪财经_新浪网
- 300红利低波ETF嘉实(515300)跌0.22%,半日成交额7864.92万元_新浪财经_新浪网
- 医药ETF广发(159938)跌1.24%,半日成交额2907.01万元_新浪财经_新浪网
- 上海浦东、黄浦、长宁、徐汇等地30多处积水点正在抢排|泵站|长宁县|上海市|浦东新区_网易订阅
- 创业板50ETF华安(159949)涨0.00%,半日成交额11.23亿元_新浪财经_新浪网
- [流言板]LCP第三赛段MVK、CFO挺进季后赛,DCG和越南GAM争最后一席-英雄联盟丨LPL-虎扑社区
- 东西问丨陈阳:为何说重庆始骨鱼重塑硬骨脊椎动物早期演化史?
- 老祖宗说:“宁娶二度花,不娶遗下人”,遗下人是什么意思?|唐婉|陆游|再婚|无子_网易订阅
- 450美元小众品牌笔记本实测:触控板扬声器双F,性能被599美元MacBook Neo碾压|键盘|neo|macbook_网易订阅
- PS6性能模拟曝光:新架构加持提升幅度惊人|内存|索尼|amd|ps6|固态硬盘|知名企业_网易订阅
- “新王”登基“三把火”:伯克希尔开始“花钱”了,净买入200亿美元股票_新浪财经_新浪网
- 西甲:要继续外租练级!恩德里克难留在皇马,阿森纳有机会吗?|法甲|英超联赛|皇家马德里_网易订阅
- 从“看风景”到“养身心” 伊春丰林打造森林康养“嘉年华”
- 记者:拉什福德已飞往爱尔兰,与曼联队伍会合|马库斯|马古斯·拉舒福特_网易订阅
- 新疆图瓦人村落中的一场特殊“party”
