套路

深耕Token工厂赛道 硅基流动以技术与流量构筑AI算力服务新生态_我的网站

蜜月计划

一 |     当前,AI行业加速从模型训练走向产业落地,Token工厂赛道热度持续攀升,但行业普遍存在概念超前、落地滞后的痛点。    界面新闻记者 | 查沁君          界面新闻编辑 | 文姝琪          因为太过火爆,距离Kimi K3发布不到一周,月之暗面就按下了“暂停键”。

二 | 作为赛道先行者,硅基流动在2024年9月就提出“Token工厂”构想,并依托公有云MaaS模式实现行业早期落地,完成从概念创新到规模化商业运营的跨越式发展。如今,随着公司递交港交所上市申请,其完善的技术体系、成熟的商业模式与多元生态布局,也为AI算力服务行业标准化、规模化发展提供了优质参考范本。         7月19日晚,月之暗面宣布,由于算力资源紧张,暂停开放Kimi新用户订阅,将有限算力优先保障现有订阅用户。

三 |          图源:月之暗面          7月20日,月之暗面回应界面新闻称,此次调整仅涉及新用户订阅,现有会员权益保持不变,老套餐并未取消,已订阅用户仍可正常使用并按原规则自动续费。   前瞻布局赛道,完成Token工厂从构想至规模化落地据了解,硅基流动提出Token工厂概念,源于对AI行业发展的精准预判。         对于此前手动关闭自动续费的用户,公司将陆续恢复续订功能,老用户升级套餐等功能也将逐步开放;至于新套餐,目前仍因算力资源限制暂未开放购买,恢复时间尚未确定。团队研判,开源模型性能持续迭代升级,将大幅拓宽AI应用边界,市场推理需求将远超训练需求,而大模型规模化部署的成本、技术门槛,正是AI基础设施企业的核心价值赛道。

四 |          从官方回应来看,此次调整更像是在有限算力资源下,对新增用户和存量用户体验进行重新平衡,而非对会员体系进行调整。基于此,公司以“用得上、用得好、用得起”为核心价值导向,打造公有云MaaS平台,通过自研推理引擎优化性能、提升算力利用率、屏蔽底层技术壁垒,实现API一键调用,打通效能与成本的闭环,在此基础上,进一步沉淀为可复制的Token工厂解决方案,助力各类算力中心快速转型,目前已落地互联网、能源、金融、电信等多个头部行业。

五 | 2025年初成为硅基流动Token工厂规模化发展的关键转折点。DeepSeek系列模型开源引爆市场推理需求,行业需求迎来指数级爆发。         K3发布后,国内外开发者社区迅速涌现大量体验和测评,不少人将它与Claude、GPT等国际头部模型放在一起比较,围绕推理成本、GPU资源、服务稳定性的讨论,也开始取代Benchmark,成为AI圈新的焦点。         K3到底有多火?          K3发布后,很快登上了全球AI模型讨论的焦点。公司率先在华为昇腾上完成DeepSeek R1、V3满血版商业化部署,成为落地世界级大模型商业化推理服务的平台,高效承接海量市场需求。市场的爆发式增长,充分验证了Token工厂模式的可行性,也锤炼了平台的极限承载能力,其注册用户从2024年底12.7万人飙升至2025年底920万人,实现跨越式增长。         独立AI模型评测机构Artificial Analysis发布的最新“智能指数(Intelligence Index)”显示,Kimi K3综合得分达到57分,位列全球第三,仅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),领先Claude Opus 4.8(56分)。这一成果背后,是硅基流动三大前瞻性行业判断的持续落地:开源模型能力将逐步追平闭源模型、推理需求量级远超训练需求、国产芯片将从“可用”迈向“好用”。         与此同时,K3完成单项任务的平均成本约0.94美元,与GPT-5.6 Sol基本相当,仅约为Claude Opus 4.8的一半。

六 | 当前行业发展态势持续印证该判断,开源模型生态日趋成熟,AI Agent规模化落地带动Token消耗暴涨,国产算力供应链持续完善,为Token工厂赛道长期发展筑牢根基。         对业内而言,更重要的是,这是首个进入Artificial Analysis综合榜单前三的开源模型。长期以来,“开源模型整体落后闭源模型半代”几乎是行业共识,而K3的出现,让这一差距进一步缩小。

七 |    突破多层技术壁垒,重构算力中心转型路径从传统算力中心“裸金属租赁”到Token标准化服务交付,行业存在一条高壁垒技术链路,涵盖芯片适配、模型调优、弹性调度、计量计费等核心环节。         图源:Monolith励思资本          除了评测成绩,K3本身的参数规模同样引发业内关注。K3是月之暗面首款万亿参数级MoE模型,总参数规模达到2.8万亿。硅基流动突破五大核心技术壁垒,将复杂技术链路封装为“一键转型Token工厂”解决方案,有效降低行业转型门槛。         一位国产AI芯片厂商人士向界面新闻表示,今年以来,随着Anthropic等海外厂商不断推出更大参数模型,国内模型竞争再次回到“大参数、长上下文”赛道,万亿参数、百万级上下文正成为头部模型的重要竞争方向。         在他看来,K3之所以迅速“出圈”,不仅因为模型能力,更因为它意味着国产开源模型首次进入这一量级。“对于行业来说,2.8T本身就是一个重要信号。在芯片适配层面,公司完成多款不同品牌、不同架构芯片的规模化适配,破解异构芯片兼容难题;通过推理引擎深度调优,以动态量化、多级缓存、算子优化等技术,提升单位算力产出与响应效率。

八 | 同时,平台实现170+主流模型持续适配迭代,搭建异构算力弹性调度系统,平衡潮汐式推理需求,并重构细粒度Token计量计费体系,完成从硬件售卖到服务化交付的核心蜕变。

九 | 针对算力行业普遍存在的产能过剩、算力闲置痛点,硅基流动打造“技术+流量”双引擎,构建高效算力消纳商业闭环。

十 | ”          业内关注很快传导到了开发者社区。供给侧,公司依托自研技术提升算力产出效率,最大化激活存量闲置算力资源;需求侧,平台坐拥超千万注册用户和1.3万家企业客户,截至2026年4月日均词元吞吐量达5785亿。多元均衡的客户结构形成稳定持续的算力负载,避免碎片化流量弊端。通过智能算力调度与收益分成机制,平台精准匹配供需资源,如同搭建贯通全网的“算力电网”,让各地Token工厂的算力产能持续变现,解决算力消纳难题。         在X(Twitter)、Reddit、OpenRouter、Linux.do、V2EX等平台,大量开发者第一时间分享体验,不少人将K3接入Cursor、Cline、OpenCode等AI编程工具进行测试。从代码生成、Agent任务到工具调用,K3几乎成为过去几天AI圈讨论最多的模型之一。         讨论几乎集中在三个问题:第一,它到底能不能替代Claude做编程?第二,它是否真的达到国际第一梯队?第三,它到底值不值得迁移?          不少开发者认为,K3最大的亮点并非聊天,而是在长流程Agent任务和代码生成场景。   多元生态落地,构建算力消纳全新商业闭环依托成熟的技术与商业模式,硅基流动持续深化产业生态合作,与光谷爱计算、贵州移动、宇信科技达成差异化战略合作,构建多维落地范式。与光谷爱计算的合作聚焦算力联合运营,赋能传统智算中心低成本转型Token工厂;与贵州移动携手打造区域智算标杆,构建“算力+技术+场景”全栈产业闭环;与宇信科技深耕垂直领域,联合打磨金融AI专属解决方案,推进核心业务场景落地。三类合作虽切入点不同,但均推动算力中心完成模式升级,收益从固定卡时租赁转向可持续Token分成,实现算力利用率、收益空间、产业地位的三重升级。伴随智能体AI规模化普及,单任务Token消耗量大幅跃升,推理成为算力消耗核心主力,产业链的关注点已从“拼算力、炼大模型”转向“拼推理、拼应用落地”。Token 工厂的竞争维度也在被重新定义:产能端从峰值应对转向持续满产运营,适配智能体的7×24小时平稳运行需求,并具备快速扩容和持续高利用率的双重能力;调度端需支持多轮推理、多模型协同等复杂场景的动态编排;服务端则需提供企业级SLA保障与Token用量管控,确保智能体深度嵌入核心业务后的稳定运行,实现服务从“可用”到“可信、可持续”的进阶。

十一 | 一些体验者表示,在复杂代码修改、工具调用等任务中,K3已经能够进入Claude、GPT等国际头部模型的竞争序列。         但也有反馈称,在真实工程任务中,该模型虽然能力突出,但仍会遗漏部分细节,需要人工修正;此外,其复杂统计推理等任务表现仍存在不稳定情况。而这些要求,恰恰是硅基流动在平台实际运营中长期积累的核心能力,也是其在这一轮需求升级中的天然优势所在。         另一类讨论则集中在成本。目前,硅基流动已迈入全新发展阶段。

十二 | 有用户认为,K3虽然单价具有竞争力,但由于复杂任务Token消耗较大,实际使用成本未必低于预期,尤其是在长流程Agent任务中更为明显。

十三 |          K3的热度也迅速传导到了海外AI圈。         美国科技投资机构Atreides Management创始人Gavin Baker将K3称为AI发展的一个“拐点(inflection point)”,他认为高质量开源模型正在加速AI能力扩散,其影响不会局限于模型厂商,而将惠及整个AI应用生态。         也有研究者保持谨慎。

十四 |          长期研究人工智能对工作影响的宾夕法尼亚大学沃顿商学院教授Ethan Mollick在X上表示,他曾让Kimi K3对自己此前的一项学术研究进行复杂统计审计,但模型“在很多方面都搞砸了”,包括错误使用统计分析方法。

十五 |          Mollick认为,K3已经非常接近全球领先模型,但复杂专业任务中的可靠性仍需更多真实场景验证,而不能仅依据Benchmark成绩作出判断。         这一评价也反映出当前AI社区对新模型的一种普遍态度:一方面,K3在代码生成、Agent等场景的表现获得了大量开发者认可;另一方面,模型在复杂专业任务中的稳定性和可靠性,仍需要更多真实场景的持续验证,而不能仅依据榜单成绩作出判断。数据显示,2025至2030年中国词元供应市场复合增长率预计达638.3%,赛道仍处于早期爆发阶段。

十六 |          算力紧缺仍是瓶颈          也正是在开发者快速涌入、调用量持续攀升的背景下,月之暗面很快遇到了另一个问题——算力。下一步,硅基流动将持续加大研发投入,不断提升Token生产效率、拓展落地场景,深耕企业规模化AI应用服务,同时强化国产算力供应链韧性,依托技术与生态优势推进全球化布局,持续深耕AI算力服务新赛道。

十七 |          过去两年,大模型行业更常见的叙事是“训练一个模型需要多少GPU”、“参数规模达到多少”,而不是因为用户太多,不得不暂停开放订阅。         事实上,训练完成并不意味着算力投入结束,尤其是在AI Coding、Agent等场景快速发展的背景下,模型需要持续调用工具、读取上下文、执行多轮推理,一个请求占用GPU资源的时间远高于传统聊天场景。模型能力越强、上下文越长、用户调用越频繁,对推理算力的消耗也越高。         “今天最大的问题还是缺算力,尤其是高质量的推理算力。”上海国投孚腾资本投资总监陈雨沁此前接受界面新闻采访时表示,即便是头部模型公司,也已经开始取消无限量使用、提高服务价格,本质上都反映出推理资源依然紧张。“如果基础设施没有解决,很多应用公司其实不敢真正大规模推广产品。”          “从供需关系来看,国内AI算力长期处于供不应求状态,而随着头部模型集中发布,这种紧张局面会进一步放大。”上述芯片产商人士向界面新闻称。

十八 |          他介绍,目前像月之暗面、智谱、MiniMax等独立模型公司,获取算力主要依赖两种方式:一是租用公有云厂商的算力服务,二是建设自有算力集群。但前者资源有限,后者属于重资产投入,需要较长建设周期,因此模型厂商的算力供给始终存在一定压力。         “业内普遍认为,支撑万亿参数模型训练和推理,万卡级集群已经成为基础门槛。”他表示,从2024年至今,真正具备万卡级部署能力的厂商仍然是少数,不少已经宣布建设的大规模集群项目,落地周期往往以年计算,因此供需之间仍存在长期缺口。

十九 |          今年WAIC期间,一个细节让上述国产芯片厂商印象深刻。         他告诉界面新闻,各家国产芯片厂展示超节点产品时,被问得最多的两个问题就是:“能不能支持万卡集群?”“能不能支持万亿参数模型训练?”          相比过去围绕单卡性能、芯片参数展开讨论,如今产业链更加关注的是超大规模集群能力,以及支撑头部模型持续训练、推理的基础设施。

|          这一变化,也折射出大模型竞争逻辑的变化。

|          过去,模型公司比拼的是参数规模、训练能力和Benchmark成绩;如今,随着越来越多模型进入真实生产环境,推理效率、服务稳定性、成本控制以及基础设施能力,开始成为新的竞争维度。         K3暂停开放新用户订阅,也许只是一次短暂的资源调配,却让外界第一次如此直观地看到,大模型竞争已经进入新的阶段。模型能力决定产品能否吸引用户,而推理算力、基础设施和持续服务能力,则决定它能否承接真正的大规模应用。

|

Current article:http://c4vqz4y.zhuaicaisaanzhenshunnaiwei.bond/news/20260826_6977686.html

Published on:09:59:06