GLM-5.2 API性能狂飙:Baseten打造最快版本,推理速度峰值达280 tokens/秒
thinkindev • 2026-07-27
1950 views
Baseten 为 GLM-5.2 模型构建的全新 API 在推理速度上取得了突破性进展,峰值速度高达 280 tokens/秒,平均速度约为 100 tokens/秒,整体性能达到发布日初版 API 的两倍以上。这一大幅提升得益于底层的系统级优化与推理架构改进。除标准高性能版本外,Baseten 还专门推出了 Fast 版本的 API,聚焦于降低编码场景和智能体应用的交互延迟,使开发者在构建实时响应要求严苛的 AI 应用时获得更流畅的体验。值得关注的是,该团队透露将在近期引入对推测解码算法的进一步改进,有望继续深挖 GLM-5.2 的潜在吞吐量,并兼顾生成质量。随着大语言模型进入高效部署阶段,API 侧的性能竞赛正成为影响开发者选择和用户体验的关键分水岭,Baseten 的这一系列举措将为 GLM-5.2 在实时聊天、代码助手和自主代理等场景中赢得明显优势。
核心要点
- GLM-5.2 API 峰值速度达 280 tokens/秒,平均约 100 tokens/秒,性能是初版的两倍以上。
- Baseten 推出 Fast 版本 API,专门针对编码和智能体场景大幅降低延迟。
- 团队计划很快对推测解码算法进行新一轮优化,将进一步释放模型速度潜力。