8月31日,智谱发布港股上市后首份中期业绩后,随即召开“中期业绩发布会”以及面向分析师的“Call back深入交流会”。两场会议给出了财报之外的几个关键信息:
ARR指引首披露:8月末ARR已达16亿美元,“Call back会”上首次给出年底24亿美元官方指引;
量价同步爆发:API均价提升约101%的同时,token调用量较年初增长超40倍;
毛利率目标:董秘肖磊在“Call back会”上首次给出明确毛利率方向性指引,12-18个月内奔向50%;
国产代替:GLM-5.3 Flash六天调用超过62万亿token全程跑在国产芯片上;
大客户披露:中国前十大互联网公司中,有4家已将GLM模型列为全球首要选择;此前已与AWS在分发层面启动初步合作,并表示正在与欧美两家较大的云服务商及独立模型公司洽谈;
技术路径:首席科学家唐杰在业绩发布会问答环节首次披露下一代模型的核心方向——“Fully Self Training”。他将其定义为模型从预训练到后训练全程自主进行,并能自我纠错、自我停止。
此外,智谱董秘肖磊坦言,“今天大概16亿美金相当于Anthropic在2025年3月份的水平,所以我们还落后它大概17个月的时间。但是我们已经从24个月的起步缩短了整整7个月。”
当日智谱股价小幅上涨,市场对这份首份中报的反应总体平稳。

ARR首次完整披露:年底官方指引24亿美元,落后Anthropic约17个月
在“Call back交流会”上,董秘肖磊首次系统梳理了智谱ARR的完整增长路径,并主动与Anthropic进行对标。
肖磊说,“我们只有过三次ARR的官方披露。第一次是3月31日年报时的2.5亿美元,第二次是7月份的10亿美元,今天是第三次——16亿美元。”
他同时给出年底指引:“我们今天是第三次正式披露ARR,同时也会给一个负责任的到年底的ARR指引,我们会把这一次指引按照线性关系定在24亿美元。”
肖磊坦承,智谱的ARR曲线并不平滑,呈现“脉冲式”增长,主要扰动来自算力供给的阶段性错配。他以6月底数据为例:“6月底的时候我们的ARR就是在5.3亿到5.4亿美金这个水平。”这一数字此前从未公开披露。
在与Anthropic的对标上,肖磊直接点出差距:“今天大概16亿美金相当于Anthropic在2025年3月份的水平,所以我们还落后它大概17个月的时间。但是我们已经从24个月的起步缩短了整整7个月。”
他同时解释了ARR与财务确认收入之间的差异,指出ARR是管理层口径的订单收入,并非财务意义上的确认收入,两者之间存在分摊差异。以Anthropic为参照,其ARR与确认收入的比例大约在2:1至4:1之间,取决于观察时点。
量价齐升:涨价没有压制需求,调用量较年初增长超40倍
这部分数据由肖磊在业绩发布会上首次披露,call back会上进一步做了补充说明。
业绩发布会上,肖磊说,API平均售价提高约101%,但token调用量较年初增长超40倍,两者同步放大。call back会上,肖磊进一步补充:“按收入计,前十大用户的日均调用量较年初增长了98倍。”
这个组合在商业上不寻常——价格翻倍,用量却没有萎缩,反而爆发。
Coding Plan的情况更极端。call back会上,肖磊披露,这款编程订阅产品上线365天,调用量增长了234倍。关键背景是:上半年它实际处于限售状态,也就是停止销售——“直到7月份我们的算力出现了阶段性的显著改善”,才重新放开。
放开之后,套餐还涨了价。“虽然有一定的价格上涨,我们的套餐调用量在涨价之后,8月份依然增长了15倍。”肖磊说。
对此,肖磊的解释是:收入结构的变化“不是我们主动设计的一个结果,而是模型能力本身的提升带来的自然演进”。
毛利率目标:12-18个月内奔向50%
针对分析师对开放平台毛利率(上半年为24.6%)与海外头部模型公司差距的追问,肖磊在call back会上给出了明确的方向性指引。
“12个月到18个月之间,我们的整个毛利的空间奔着50以上的这个价格带宽去努力,这个肯定是我们的方向。”
他将当前毛利率偏低的原因拆解为四点:
第一,国产大集群尚处爬坡期。“新的算力基础设施上线之后,它要经历模型部署、流量迁移、利用率爬坡的完整过程,这个阶段成本先行,收入和Token后面才慢慢填满这个集群。”
第二,模型迭代速度快带来切换损耗。“技术迭代越快,早期一定会有一部分的资源冗余和迁移成本,这个是不可避免的。”
第三,Infra优化仍有空间。他透露,过去半年单位推理成本已下降约80%,但这是“模型层、系统层、组网层、芯片层共同作用的结果”,仍有进一步提升空间。
第四,产品定价结构的精细化。“旗舰模型服务高价值任务,Flash模型服务高频普惠场景,两者的智能路由越来越成熟,错配会逐步减少。”
下一代基座已在训练,唐杰详解“Fully Self-Training”
针对高盛分析师姜广平(Ronald Keung)关于下一代模型方向的提问,首席科学家唐杰在业绩发布会上给出了迄今最为详细的技术路线阐述。
“Scaling从没停止,我们的目标就是做这个智能的上限,”唐杰说。他明确表示,下一代基座模型参数规模将继续扩大,但不披露具体数字。
在技术路径上,唐杰提出了三个方向:
一是继续扩大基座规模,同时通过Loop Transformer等架构创新提升模型的有效推理深度,“通过loop的方式,使这个激活能够更深度的推理,这样的话就可以把推理成本也做的比较低”。
二是大幅加强后训练,“我们必须想用新的一些技术的方法,包括一些工程的方法,在后训练方面我们现在有我们的优势”。他提到,GLM-5.3之所以效果大幅提升,关键在于“我们在数据环境上搭建了几十倍的数据环境”。
三是迈向“Fully Self-Training”。唐杰将其定义为模型从预训练到后训练全程自主进行,并能自我纠错、自我停止。“这个很大的挑战最大的问题是什么?就是这个模型它能自己判断自己,自己能够什么时候停止自己,什么时候能够纠正自己,这其实最大的难题。”
他将这一概念与海外的RSI(Recursive Self-Improvement)对应,并表示这将是未来模型研究的重点方向。
参数策略:为何“相对克制”,海通分析师追问获正面回应
针对市场上“智谱只会后训练”的质疑,以及部分竞品向万亿级参数推进的背景,唐杰在业绩发布会上回应海通分析师杨琳的提问时作出了正面解释。
“这是一个选择,”唐杰说。他指出,国内大模型训练数据普遍在30至50万亿token区间,“在这个训练规模下,如果我们用scaling law来探讨的话,你训特别大,它的收益并不是特别大”。
他透露,GLM-5系列所用的7440亿参数基座模型是在今年1月确定的,“我们当时训这个大小的时候,我们当时就决定了这个模型它要用半年以上”,并在此基础上依次规划了5.1、5.2、5.3的中训练和后训练路线。
“下一代的模型,我们现在其实已经开始预演它的推理,而且我们有信心下一代模型,大模型一出来的第一天,它一定就能让大家满量的用得上。”
用户深度数据首次披露:前十大客户日均调用增长98倍
业绩发布会上,肖磊首次披露了一组此前未曾公开的用户深度数据。
截至8月末,MaaS平台注册用户超过740万,较年初增长144%;付费日活用户增长603%。更值得关注的是,以收入计算的前十大用户,本月日均调用量较年初增长了98倍。
call back会上,肖磊进一步补充:“这前十名用户在日均调用量上,在这40万亿当中超过了15万亿,也就是接近40%的水平,”肖磊说。
他还透露,中国前十大互联网公司中,有4家已将GLM模型列为全球首要选择,“也就是跟海外模型相比,GLM已经成为他们的第一选择”。
Coding Plan方面,肖磊披露,该产品上线整整365天,调用量增长了234倍,“目前已经是全球最大的编程服务之一,也是增速最快的编程服务之一”。他还透露,7月份在算力改善后重新开放限购,涨价后8月份调用量依然增长了15倍。
海外扩张:1-2个月内或有进展,坚持开源路线
针对出海业务,肖磊表示,公司正积极推进与海外CSP平台的合作,并透露“很快在1到2个月的时间内,应该会有比较好的进展来跟大家去做具体的分享”。
call back会上,他提到,此前已与AWS在分发层面启动初步合作,并表示正在与欧美两家较大的云服务商及独立模型公司洽谈,“即使是开源模型,也有机会在开源的基础上采取类似于OA的方式跟我们进行合作”。
在开源与闭源的选择上,肖磊态度明确:“我们觉得市场足够大,弱水三千取一瓢饮,所以不需要通过闭源的方式去换取更大的市场份额。”他将开源定位为智谱的“初衷”,甚至“某种程度上是我们的使命”。
国产芯片:从“能不能跑”到“经济性验证”
业绩发布会还披露了一个细节:GLM-5.3 Flash在正式发布前,以匿名模型“Ox-Alpha(牛来模型)”的身份上线OpenRouter和OpenCoder进行测试,“历史性的超大流量”——六天调用量超过62万亿token,上线首日冲至OpenRouter榜首。
这次测试的另一层意义在于算力:GLM-5.3 Flash是“第一次在超大规模真实流量中全面使用国产芯片集群提供服务的模型”。公司已实现10万卡级国产芯片的规模化推理,单位token推理成本较年初下降80%。
智谱的董事长刘德斌在业绩发布会上说:“成本曲线已经开始掌握在我们自己手里。”
肖磊在问答环节补充,下一阶段的重点不是“国产卡能不能跑”,而是“怎么去验证国产卡的经济性”。他预计未来三到六个月,先进国产芯片厂商可能开始放量,异构并行计算环境有望显著改善。




