开源|WebLLM:基于WebGPU在浏览器中高性能运行开源大模型
thinkindev • 2026-09-04
4928 views
WebLLM 是 MLC AI 推出的高性能浏览器端大语言模型推理引擎,它借助 WebGPU 将开源模型的加载与推理全过程放在用户浏览器内完成,不需要后端服务器。该项目提供兼容 OpenAI 的 API,可支持流式输出、JSON 模式等聊天补全能力,便于现有应用快速迁移。WebLLM 支持 Llama、Phi、Gemma、Mistral、Qwen 等主流模型家族,并可通过 npm 或 CDN 安装,还能利用多种浏览器缓存后端以及 Web Worker/Service Worker 引擎,使推理不阻塞界面。这种纯前端部署方式不仅降低了服务成本,还提升了隐私保护和离线可用性,对边缘 AI 和端侧大模型应用具有重要的示范意义。
核心要点
- 基于 WebGPU 在浏览器内完全本地运行开源大模型,无需服务器
- 提供 OpenAI 兼容 API,支持流式输出与 JSON 模式等聊天补全功能
- 支持 Llama、Phi、Gemma、Mistral、Qwen 等模型,并可通过 npm 或 CDN 集成