智谱发布旨在对标 DeepSeek V4 Flash 的轻量级旗舰模型 GLM-5.3 Flash ,调用超过 10 万张国产芯片集群用于该模型推理服务。据《晚点 LatePost》了解,其算力供应商或来自华为、摩尔线程与海光,智谱官方没有评论这一信息。
GLM-5.3 Flash拥有300B 参数规模,参数量约为 GLM-5.3 的 40%,与 DeepSeek V4 Flash 几乎持平。与同代小尺寸模型往往蒸馏自大模型不同,GLM-5.3 Flash 采用与 GLM-5.3 不同的架构设计,具有原生多模态能力,支持图像视频输入,这也是智谱战略聚焦 coding 以来第一次推出具有多模态能力的新模型。
随着 AI 模型能力持续提升,轻量旗舰模型能够负担越来越多的工作任务,这创造了新的增长空间,8 月 DeepSeek V4 Flash 的提价不仅证明了市场强劲需求,也预示了更激烈竞争的到来。
根据《晚点 LatePost》看到的智谱内部评测, GLM-5.3 Flash 的 Artificial Analysis Intelligence 分数为 57 分。这一分数超过上一代旗舰模型 GLM-5.2,和 Claude Opus 4.8 持平,也高于 DeepSeek 旗舰模型 V4 Pro 正式版的 53 分。
GLM-5.3 Flash 每百万 token 输入 0.8 元,输出 2.8 元,缓存命中价格 0.23 元,正好为 GLM-5.3 的十分之一。横向对比调价后的 DeepSeek V4 Flash,其谷时价格分别为 1.5 元、4.5 元 和 0.05 元。综合输入和输出成本,GLM-5.3 Flash 在绝大多数常规调用场景下更便宜。
智谱已经表示,上线前两周 GLM-5.3 Flash 会实行半价。
正式发布前智谱已在包括 OpenRouter 在内的第三方开放平台以 Ox Alpha 名义测试,5 天流量累积据悉超过 50 T,由于完全免费,刷新了 OpenRouter 与 OpenCode 流量增长纪录。
这不是智谱第一次以匿名形式发布新模型,今年春节前夕,OpenRouter 上出现一个名为 Pony Alpha 的模型,名字呼应中国农历马年,后来被证明是智谱的 GLM-5 模型。
GLM-5.3 Flash 全栈适配国产算力,线上流量均由国产芯片承接,据悉智谱调用超过 10 万张国产芯片集群用于该模型推理服务。智谱在技术文档中表示,其集群 “硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平”,但没有明确具体型号。
6 月以来,中国公司争相发布能力接近美国次等级闭源模型的产品。6 月 13 日,智谱发布 GLM-5.2,7 月中 Kimi 的 K3 模型发布,8 月 DeepSeek V4 Pro 正式版发布,智谱则在 8 月 14 日发布 GLM-5.3 ,其参数与模型结构与 GLM-5.2 完全一致,但性能大幅提升,官方宣称其性能完全基于后训练强化学习。
性能提升的同时,涨价一度占据了叙事的主流。Kimi K3 的输出价格高达 100 元,超过 K2.6 三倍还多。智谱在上半年提价后输出价格也达到 28 元。
在流出的梁文锋录音中,他曾说到,智能需求没有弹性,同一份录音中,他还表示 DeepSeek 只需赚取合理利润,然而 8 月 DeepSeek 全面提价,DeepSeek V4 Pro 从 6 元涨到 13.5 元,高峰 27 元;DeepSeek V4 Flash 的输出从每百万 token 2 元涨到 4.5 元,高峰时段 9 元。官方理由是算力稀缺,长期低价会侵蚀现金流。
事实证明智能能力需求同样有弹性,特别是轻量级旗舰模型。在保证基本模型能力的同时,用户依旧对价格敏感。涨价后,在另一个第三方开放平台 OpenCode 上,DeepSeek V4 Flash 模型调用量掉了一半,这部分需求成了国产模型厂商新的增长空间。
在美国,被归类为第二梯队的 Meta 和 SpaceXAI 等正将目标对准 OpenAI 和 Anthropic 的最先进模型,而后者的价格往往是中国模型的数十倍之多。以 Claude Opus 4.8 为例,官方输出价格为 25 美元,而 GLM-5.3 Flash 海外输出价格则为 0.5 美元。
在中国,模型选择多、能力差距小,厂商不仅要和同行竞争,也要面对开源部署、云厂商赠送额度等,模型难以作为稀缺品定价,更接近标准云服务的价格。因此,中国厂商不断把接近旗舰的模型能力推入低价区间,用价格、开源和兼容性争夺调用量。
不考虑算力采购与研发成本,模型推理是一门毛利很高的好生意,前提是有足够大的需求与足够用的性能。随着 DeepSeek 模型涨价,轻量旗舰模型覆盖的市场区间或将迎来更多竞争者。
本文来源:晚点LatePost




