llama.cpp:17 个后端、1.5 到 8 比特量化,把 LLM 推理带到任何有编译器的地方
MIT 许可、构建在 ggml 上的纯 C/C++ 推理实现,无任何依赖。17 个后端覆盖 CUDA/Metal/HIP/Vulkan/SYCL/WebGPU/CANN/Hexagon/MUSA/zDNN/ZenDNN;1.5-8 比特整数量化;CPU+GPU 混合推理让超出显存的模型也能跑;GGUF 是它输出的事实标准权重格式,连 vLLM 都直接吃。llama cli / llama serve 两行起一个 OpenAI 兼容服务。
推理引擎GGUF量化