Hugging Face Blog·· 2026-07-08精选AI 评分75
vLLM transformers 建模后端提速至原生速度
Native-speed vLLM transformers modeling backend
AI 导读
Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到或超过手写原生实现的推理速度,在 Qwen3-4B、32B 和 235B MoE 三种模型上均验证通过。模型作者无需移植代码,只需在 vLLM 中加 --model-impl transformers 参数即可获得原生级推理性能,且该后端通过 torch.fx 和 AST 在运行时自动应用层融合优化。
推荐理由
原文给出实测对比和启用方式,读者可据此判断是否值得升级 vLLM 并切换后端。
来源:Hugging Face Blog · huggingface.co