📚 Wiki 知识库

🏷️ 推理引擎

2 篇

LLM 推理引擎与本地硬件指南 (2026 版)

文章阐述了选择 LLM 推理引擎的正确逻辑:先确定硬件策略、负载形态和服务模式,再选引擎。文章解析了推理引擎的核心功能(调度、内存管理、批处理)及性能瓶颈(显存带宽、KV Cache、互联),并详细对比了 llama.cpp、MLX、ExLlama、vLLM、TensorRT-LLM 等主流引擎的适用场景与优缺点。

技术LLM ✍ Ahmad🕐 2026-05-21