7月27日深夜,月之暗面正式开源Kimi K3大模型,2.8万亿参数的体量一举刷新全球开源模型纪录。技术报告显示,该模型采用混合专家架构(MoE),内置896个专家网络,综合性能已摸到闭源模型下沿。然而,狂欢过后企业用户很快发现一个现实难题:免费的模型权重人人可下载,但要真正跑起来,硬件门槛足以劝退绝大多数玩家。
2.8万亿参数的“天价入场券”
开源不等于可部署,这是K3发布后行业最直观的感受。 按照公开技术参数,Kimi K3完整权重文件体积超过1.5TB,即便采用FP4精度量化,显存需求仍在TB级。AMD官方验证方案显示,单台8卡MI355X服务器(单卡显存288GB,总显存2.3TB)仅能实现基础推理运行,这套硬件采购成本约170万-240万元。
这只是能跑起来的最低门槛,离生产环境差得远。商业部署需要考虑并发量、长上下文处理、故障冗余和持续运维,月之暗面官方技术文档建议生产环境至少配置64张以上高端加速卡,且需部署在同一高速互联域内。
按此标准测算,64张B200级别GPU组成的集群,仅硬件采购成本就在1300万-1900万元区间。若采用英伟达最新旗舰卡,投入轻松突破3000万元。这还不包括机房托管、电力散热、运维团队等每年数百万元的持续开销。
对绝大多数中小企业甚至中型互联网公司来说,千万级的硬件投入都是不可承受之重。
本地部署退潮,MaaS成必然选择
未来大模型参数规模每上一个台阶,本地部署的经济性就下降一截。当模型参数从百亿级跃升至万亿级,企业用户自建算力集群的回本周期从一年拉长到三五年甚至更长,对企业来说ROI已经算不过来了。
这样越来越高的部署门槛,会让企业用户从“本地部署”转向“API调用”。
这一逻辑在海外市场已相对成熟。亚马逊AWS推出的Bedrock平台,是AWS提供的全托管大模型服务平台,通过统一接口支持Claude、Llama 2、Titan等主流模型。今年4月,OpenAI的前沿模型也正式登陆Bedrock,使其正在成为大模型的“超级聚合器”。
这种模式既降低了大模型的使用门槛,也让算力资源得到更高效的复用。用户无需关心底层算力和模型部署,直接通过API按需调用,按Token消耗量付费。
行云科技:中国版AWSBedrock雏形?
国内市场在随着Kimi K3这类超大规模开源模型的出现,"下载权重-本地部署"的传统开源玩法逐渐失效,企业用户会更倾向于通过MaaS(模型即服务)平台接入能力,按实际使用量付费。这在3亿体量的模型之下几乎是必然的趋势。
国内目前是否有AWS Bedrock这样集合算力与MaaS的厂商?行云科技今年陆续公布签约订单超过百亿,市场对其合作的头部大模型厂商产生了很多猜想。这家公司将自己定位为极致高效的“Token工厂”,构建了涵盖国内外算力中心建设、软硬件协同调优及MaaS基础设施平台。
从体量上看,行云科技已具备承接大模型算力需求的实力。2026年对外披露的大额算力相关订单累计超134亿元,已取得超过百亿的银行授信。公司在北京规划落地约3万P算力,预计占北京下半年新增算力总量的60%。
在技术层面,行云科技首席科学家唐博博士团队研发的AlayaJet推理引擎,在超长文本上下文处理上可提升单卡Token产出效率、压降推理成本。公司强调,“Token工厂”的核心是提升单位算力的有效Token产出,而非单纯堆高GPU规模——这正是MaaS模式的核心竞争力所在。
Kimi K3的开源,客观上为MaaS平台送来了东风。行云科技能否成为中国版AWS ,尚需待观察后续模式落地情况。