智谱AI于8月26日正式确认,此前匿名测试的模型Ox Alpha(中文社区称“牛来”)即为最新发布的GLM-5.3-Flash。该模型在免费测试期间5天内累计流量超50万亿token,刷新平台纪录。智谱AI披露,其推理服务全部由超过10万张国产芯片集群承载,硬件效率及单token成本已达到与主流英伟达GPU相当的水平。半导体研究机构SemiAnalysis对此评论称,继OpenAI自研推理芯片Jalapeño之后,英伟达的CUDA护城河再度受到考验。GLM-5.3-Flash的定价为每百万token输入0.8元、输出2.8元,约为Anthropic的Claude Opus 4.8的1/40,旨在应对中国AI模型市场近期出现的涨价潮。