单卡H100每分钟处理10亿token:Quail推理引擎比vLLM快10倍,成本低于0.06美元/十亿token
thinkindev • 2026-09-28
3599 views
Modal官方博客介绍了Query-Aware Inference Layer(Quail)推理引擎,该引擎通过将查询规划器与推理引擎相结合,并采用KV最优左深连接优化AI-SQL查询性能,在单块H100 GPU上实现了每分钟超过10亿token的处理速度。与同硬件上的vLLM基线相比,Quail的速度提升超过10倍,且通过Modal平台部署时,每处理10亿token的成本低于0.06美元。这一成果展示了查询感知推理优化在结构化数据和SQL生成场景中的巨大潜力。对推理工程师而言,Quail提供了新的性能优化思路:不再单纯依赖算力堆叠,而是从查询规划、连接顺序和KV缓存利用等环节减少冗余计算,从而同时提升吞吐量并降低单位成本,对大模型推理基础设施建设和AI数据库应用具有重要参考价值。
核心要点
- Quail在单块H100 GPU上每分钟处理超过10亿token,推理速度是vLLM基线的10倍以上。
- Quail通过结合查询规划器与推理引擎,并采用KV最优左深连接优化AI-SQL查询性能。
- 在Modal平台上,Quail每处理10亿token的成本低于0.06美元,兼顾高性能与低成本。