vLLM 是面向大语言模型的高吞吐、内存高效推理与服务平台,用 Python 编写。它解决 LLM 推理和服务中的吞吐与显存效率问题,适合部署、服务 LLM 的开发者与团队,涉及 CUDA、AMD、TPU、MoE、Transformer、OpenAI 等方向,已获 92763 星。
A high-throughput and memory-efficient inference and serving engine for LLMs
| 热度动量 | 25% | 10.0 | |
| 开发活跃 | 25% | 7.0 | |
| 社区响应 | 15% | 0.0 | |
| 文档质量 | 15% | 2.6 | |
| 发布节奏 | 10% | 0.0 | |
| 风险控制 | 10% | 10.0 |
评分由 公开的焚评公式 程序计算,数据来自 GitHub API,最近重算于 3 小时前。