Svmuu讯 智谱面向部分企业客户推出 GLM-5.1 高速版 API,其模型输出速度达到 400 tokens/s,刷新全球大模型官方接口端到端速度纪录。
据了解,该高速版在保留原有旗舰模型能力基础上,由智谱与 TileRT 团队联合研发的高性能推理引擎驱动。该引擎通过重构 GPU 运行调度机制,将模型静态编排为常驻 GPU 的 persistent Engine Kernel,以降低传统推理中的内核启动与显存读写延迟。
在多卡场景下,TileRT 进一步将 8 卡 NVL 拓扑中的 GPU 节点特化为不同功能 Worker,以提升注意力层计算与跨卡通信效率。
目前,该高速版服务已向智谱 MaaS 平台部分企业客户开放。未来将继续优化 FP8 推理及超长上下文能力,面向 AI 编程、实时交互与实时语音等低延迟场景提供支持。
24小时热榜
-
1
Aethir (ATH) 币价值解析:去中心化云算力项目潜力与风险评估
-
2
比特币突破77,000美元大关,逆势上扬,此前科技股因人工智能安全担忧和油价上涨而遭遇抛售
-
3
圭亚那总统:受伊朗冲突影响,该国石油收入急剧增加
-
4
NOAH币种解析:区分争议项目与活跃支付基础设施
-
5
RIKEN币价值解析:同名项目众多,投资潜力几何?
-
6
FXBK币种解析:它是什么?值得投资吗?
-
7
中远重工完成中国首次公开募股(IPO)指导性备案
-
8
新手投资比特币交易:全面解析安全风险与防范策略
-
9
消息人士称,台湾将在菲律宾设立第二个准外交机构
-
10
三星显示开发出全球首款6.9英寸移动OLED面板,具备2K分辨率、165Hz刷新率,且功耗降低30%
今日行情
推荐阅读







