Svmuu訊 智譜面向部分企業客户推出 GLM-5.1 高速版 API,其模型輸出速度達到 400 tokens/s,刷新全球大模型官方介面端到端速度紀錄。
據瞭解,該高速版在保留原有旗艦模型能力基礎上,由智譜與 TileRT 團隊聯合研發的高性能推理引擎驅動。該引擎透過重構 GPU 運行排程機制,將模型靜態編排為常駐 GPU 的 persistent Engine Kernel,以降低傳統推理中的核心啟動與顯存讀寫延遲。
在多卡場景下,TileRT 進一步將 8 卡 NVL 拓撲中的 GPU 節點特化為不同功能 Worker,以提升注意力層計算與跨卡通訊效率。
目前,該高速版服務已向智譜 MaaS 平台部分企業客户開放。未來將繼續優化 FP8 推理及超長上下文能力,面向 AI 程式設計、即時互動與即時語音等低延遲場景提供支援。
24小時熱榜
-
1
Aethir (ATH) 幣價值解析:去中心化雲算力項目潛力與風險評估
-
2
比特幣突破77,000美元大關,逆勢上揚,此前科技股因人工智能安全擔憂和油價上漲而遭遇拋售
-
3
圭亞那總統:受伊朗衝突影響,該國石油收入急劇增加
-
4
NOAH幣種解析:區分爭議項目與活躍支付基礎設施
-
5
RIKEN幣價值解析:同名項目眾多,投資潛力幾何?
-
6
FXBK幣種解析:它是什麼?值得投資嗎?
-
7
中遠重工完成中國首次公開募股(IPO)指導性備案
-
8
新手投資比特幣交易:全面解析安全風險與防範策略
-
9
消息人士稱,台灣將在菲律賓設立第二個準外交機構
-
10
三星顯示開發出全球首款6.9英寸移動OLED面板,具備2K分辨率、165Hz刷新率,且功耗降低30%
今日行情
推薦閱讀







