漫话开发者 - UWL.ME Mobile
Loading more...
漫话开发者 - UWL.ME Mobile

Cohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和显存带宽压力,提升大语言模型在推理阶段的效率。官方测试显示,在单张NVIDIA H100 GPU上、批量大小为1时,该系统可达到每秒292个token的解码速度,是vLLM的1.58倍;在端到端解码吞吐方面,也比vLLM提高了1.25倍至1.41倍。Cohere称这是业界首个围绕解码超内核构建的生产级LLM服务系统,标志着内核融合与编译式推理优化路线在高性能模型服务中的进一步落地,对低延迟、高并发场景具有重要参考意义。

核心要点

  • Cohere推出业界首个基于解码超内核的生产级LLM服务系统,面向North Mini Code模型优化。
  • 在单张H100上批量大小为1时实现292 tokens/s,解码速度达到vLLM的1.58倍。
  • 端到端解码吞吐较vLLM提升1.25至1.41倍,展示内核融合在推理加速中的潜力。

Read more >