ggml-org

@ggml-org

llama.cpp

ggml-org/llama.cpp

LLM inference in C/C++

STARS122,586
FORKS21,285
ISSUES1,953
LANGUAGEC++

HISTORICAL INTELLIGENCE

历史情报摘要

按周期独立统计
总榜持续记录
历史最佳#81当前排名#81

与上一期排名持平

记录天数
12 天
记录期 Star
+1.2k
本站共 12 天总榜快照 · 最近记录 2026-08-04
本站最早记录:2026-07-24

指标仅基于本站已保存快照,不代表项目在 GitHub 的首次上榜时间;同日多次抓取保留当日最新结果,负向 Star 差值按样本校正处理。

总榜历史趋势

2026-07-24 至 2026-08-04,掉榜日期保留为空缺。

排名,数字越小越靠前周期新增 Star
折线表示历史榜单排名,柱形表示相同快照记录的新增 Star。排名纵轴已反向,越靠上排名越高。 #1 #21 #42 #62 #82 2026-07-24:新增 0 Star 2026-07-25:新增 0 Star 2026-07-26:新增 0 Star 2026-07-27:新增 0 Star 2026-07-28:新增 0 Star 2026-07-29:新增 0 Star 2026-07-30:新增 0 Star 2026-07-31:新增 0 Star 2026-08-01:新增 0 Star 2026-08-02:新增 0 Star 2026-08-03:新增 0 Star 2026-08-04:新增 0 Star 2026-07-24:排名 #81,新增 0 Star2026-07-25:排名 #81,新增 0 Star2026-07-26:排名 #81,新增 0 Star2026-07-27:排名 #81,新增 0 Star2026-07-28:排名 #82,新增 0 Star2026-07-29:排名 #82,新增 0 Star2026-07-30:排名 #82,新增 0 Star2026-07-31:排名 #82,新增 0 Star2026-08-01:排名 #81,新增 0 Star2026-08-02:排名 #81,新增 0 Star2026-08-03:排名 #81,新增 0 Star2026-08-04:排名 #81,新增 0 Star 07-24 08-04 +1
图表仅使用本站保存的快照,不补零、不推算掉榜期间数据;下方历史明细继续保留原始日期、排名与 Star 数。

VERIFIABLE HEALTH SIGNALS

项目健康证据

维护、响应、交付与采用风险分开观察,不生成虚假的单一总分。
部分样本
MAINTENANCE

维护活性

核对提交
近 90 天 Commit
≥300
已采集下限
活跃贡献者
≥124
按公开提交账号去重
近 12 月活跃月份
2/12
基于已采集提交
RESPONSE

社区响应

核对样本
Issue 关闭率
17%
18/≥107 个同期新 Issue
Issue 关闭中位数
13 小时
仅统计已关闭样本
PR 合并率
31%
94/≥300 个同期新 PR
PR 合并中位数
17 小时
仅统计已合并样本
DELIVERY

持续交付

核对发布
近 12 月正式 Release
≥300
排除草稿与预发布
最近正式 Release
2026-08-04
以公开发布时间为准
发布间隔中位数
0.1 天
至少两次正式发布才计算
ADOPTION

采用风险

查看仓库
仓库状态
正常开放
未发现归档标记
开源协议
MIT
仍需核对完整协议与依赖
Security Policy
未发现
仅检查 GitHub 社区资料

统计窗口 90 天快照样本 3 天计算规则 health-v1采集于 2026-08-04 05:55

高活跃数据触及分页上限,数值以已采集下限展示。 这些信号不替代代码审计、安全测试和真实生产验证。

AI-ASSISTED PROJECT BRIEF

项目定位与辅助解读

来源边界与风险表述检查

AI 解读仅作初评参考,技术落地请以 GitHub 源码、README 和完整协议为准。

项目资料AI 整理

llama.cpp 是使用 C/C++ 实现的大语言模型(LLM)推理引擎,支持多种硬件后端与量化方案,旨在以最小依赖实现高性能本地推理。

llama.cpp 是一个开源的 LLM 推理项目,以纯 C/C++ 编写,基于 ggml 库构建。其核心目标是让用户在本地或云端多种硬件上以最少配置运行 LLM 和 VLM。项目提供命令行工具、OpenAI 兼容 API 服务器以及内置 Web UI,并支持 CUDA、Metal、Vulkan、SYCL 等后端。它通过多种整数量化位宽降低内存占用并加速推理,同时支持 CPU 与 GPU 混合推理。项目采用 MIT 许可证,在 GitHub 上拥有超过 12 万星标,社区活跃。

核心亮点

项目最值得关注的能力

AI 推断
  • 纯 C/C++ 实现,无外部依赖,便于编译和部署
  • 支持多后端:CUDA、Metal、Vulkan、SYCL、HIP 等
  • 提供 1.5-bit 至 8-bit 多种量化格式以优化性能与内存
  • 支持 CPU+GPU 混合推理,适配超显存模型

适用场景

它可以解决哪些实际问题

AI 推断
  • 在本地笔记本或工作站上运行 LLM 聊天与视觉语言模型
  • 通过 OpenAI 兼容 API 服务器集成到应用或服务中
  • 在边缘设备或嵌入式环境中进行轻量级推理
  • 自定义模型量化与测试,作为研究或开发工具

技术观察

从公开资料提炼的实现特征

AI 推断
  • 基于 ggml 张量库,支持 ARM NEON、AVX/AVX2/AVX512、RVV 等指令集优化
  • 提供 llama-cli、llama-server 等工具,支持 GBNF 语法约束和 REST API
  • 支持从 Hugging Face 直接下载和运行 GGUF 格式模型
  • 支持多 GPU 与混合推理,部分后端标记为进行中(如 OpenVINO、Hexagon)

优势判断

相对明确的项目价值

AI 推断
  • 跨平台硬件适配广泛,性能优化持续更新
  • MIT 许可证,社区活跃,版本迭代频繁
  • 量化方案丰富,能在有限资源下运行较大模型

局限与注意

评估和采用前需要留意

AI 推断
  • 从公开资料看,主要针对 GGUF 模型格式,模型转换需额外步骤
  • 部分后端仍处于开发阶段,稳定性需读者自行评估
  • 构建和配置选项较多,新手可能需要参考官方文档

适用人群

哪些开发者和团队值得关注

AI 推断
  • 需要本地或私有大模型推理的开发者
  • 对模型量化、推理性能调优感兴趣的研究人员
  • 自托管模型服务的技术爱好者与运维人员
综合参考
llama.cpp 是一个成熟且广泛使用的开源 LLM 推理引擎,以跨平台硬件支持和灵活量化为突出优势。其纯 C/C++ 设计和多后端适配使其适合从开发测试到生产部署的多种场景。从公开资料看,项目维护活跃,但用户在选择后端或部署前应自行完成性能、兼容性与安全性验证。
由 AI 基于 GitHub 公开资料辅助生成,不构成安全审计、生产选型或专业建议。

依据与内容边界

区分可验证事实、项目方自述与 AI 推断

GitHub 可验证事实

Star、Fork、License、更新时间及健康证据样本来自 GitHub 公开接口。

项目方自述

功能与使用方式主要来自仓库描述和 README,未经本站独立验证。

AI 推断

适用场景、优势与局限属于辅助解读,应结合原始文档独立判断。

  • GitHub事实:仓库显示 MIT 许可证,Star 数 122335,Fork 数 21216,Open Issues 1911。
  • 项目方自述:README 称其目标为“在多种硬件上以最少设置实现 LLM 推理”,并列出多种后端与量化支持。
  • AI推断:该项目作为广受欢迎的推理框架,常用于本地部署和边缘场景,但具体性能和稳定性依赖硬件与模型,需实际验证。
生成于 2026-08-02 06:15 规则版本 2026-07-v3
内容有误或您是项目作者?提交纠错
仅保存处理所需内容,不记录原始 IP;可信项目作者的高风险申诉会优先处理。