llama.cpp
llama.cpp 是面向生成式 AI、模型、RAG、Agent、推理、训练或生产治理的开放源代码项目。
分类:推理引擎、模型服务与 AI Gateway
公司 / 团队:ggml-org
详细介绍
该项目的主要能力包括纯 C/C++ 本地推理、GGUF、CPU/GPU 混合、量化、Apple Silicon、CUDA/Vulkan/SYCL 和 OpenAI 兼容服务器。
开源项目的真实可用性取决于代码版本、许可证、模型与数据条款、依赖、硬件、操作系统、部署方式、社区维护、漏洞响应和生产评测。详情页应把仓库、许可证、最新 Release、提交活跃度、安装方式、支持模型、资源需求、遥测、商业版关系和迁移状态拆成动态字段维护。
适合场景
- 个人电脑本地模型
- 边缘设备推理
- 量化模型运行
- 轻量 API 服务
使用注意
- 仅支持 GGUF 或可转换模型格式
- 模型转换和量化可能影响质量
- 嵌入式或桌面部署仍需保护模型文件和本地 API
- 正式用于生产前应完成许可证、模型权重、数据来源、依赖供应链、漏洞、权限、沙箱、准确性、性能、成本、备份和退出迁移评估。