antirez

@antirez

ds4

antirez/ds4

DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm

STARS20,329
FORKS1,797
ISSUES391
LANGUAGEC

HISTORICAL INTELLIGENCE

历史情报摘要

按周期独立统计
日榜持续记录
历史最佳#9当前排名#9

与上一期排名持平

记录天数
3 天
记录期 Star
+438
本站共 12 天日榜快照 · 最近记录 2026-08-04
本站最早记录:2026-08-02

指标仅基于本站已保存快照,不代表项目在 GitHub 的首次上榜时间;同日多次抓取保留当日最新结果,负向 Star 差值按样本校正处理。

日榜历史趋势

2026-08-02 至 2026-08-04,掉榜日期保留为空缺。

排名,数字越小越靠前当日新增 Star
折线表示历史榜单排名,柱形表示相同快照记录的新增 Star。排名纵轴已反向,越靠上排名越高。 #1 #4 #8 #11 #14 2026-08-02:新增 150 Star 2026-08-03:新增 385 Star 2026-08-04:新增 385 Star 2026-08-02:排名 #14,新增 150 Star2026-08-03:排名 #9,新增 385 Star2026-08-04:排名 #9,新增 385 Star 08-02 08-04 +385
图表仅使用本站保存的快照,不补零、不推算掉榜期间数据;下方历史明细继续保留原始日期、排名与 Star 数。

VERIFIABLE HEALTH SIGNALS

项目健康证据

维护、响应、交付与采用风险分开观察,不生成虚假的单一总分。
部分样本
MAINTENANCE

维护活性

核对提交
近 90 天 Commit
≥300
已采集下限
活跃贡献者
≥18
按公开提交账号去重
近 12 月活跃月份
3/12
基于已采集提交
RESPONSE

社区响应

核对样本
Issue 关闭率
23%
28/≥124 个同期新 Issue
Issue 关闭中位数
1.5 天
仅统计已关闭样本
PR 合并率
3%
10/≥300 个同期新 PR
PR 合并中位数
21 小时
仅统计已合并样本
DELIVERY

持续交付

核对发布
近 12 月正式 Release
0
排除草稿与预发布
最近正式 Release
暂无记录
以公开发布时间为准
发布间隔中位数
样本不足
至少两次正式发布才计算
ADOPTION

采用风险

查看仓库
仓库状态
正常开放
未发现归档标记
开源协议
MIT
仍需核对完整协议与依赖
Security Policy
未发现
仅检查 GitHub 社区资料

统计窗口 90 天快照样本 3 天计算规则 health-v1采集于 2026-08-04 00:15

高活跃数据触及分页上限,数值以已采集下限展示。 这些信号不替代代码审计、安全测试和真实生产验证。

AI-ASSISTED PROJECT BRIEF

项目定位与辅助解读

来源边界与风险表述检查

AI 解读仅作初评参考,技术落地请以 GitHub 源码、README 和完整协议为准。

项目资料AI 整理

antirez 开发的 DwarfStar 推理引擎,专为 DeepSeek V4 Flash/PRO 及 GLM 5.2 设计,支持 Metal、CUDA、ROCm,MIT 协议,目前处于 beta 阶段。

从公开资料看,DwarfStar 是一个自包含的原生推理引擎,并非通用 GGUF 运行器,而是针对少数模型深度优化。项目自述支持 Mac 的 Metal、NVIDIA CUDA 和 ROCm,并提供 SSD 流式、多 GPU、张量/流水线并行等特性。README 声称在 8xL40S 上实现 120 t/s 聚合生成和 2000 t/s prefill。项目状态为 beta,强调快速变化,并明确开发过程使用了 AI 辅助。

核心亮点

项目最值得关注的能力

AI 推断
  • 支持 Metal、CUDA、ROCm 三种后端,覆盖 Mac、NVIDIA 和 AMD 平台
  • 针对 DeepSeek V4 Flash 优化,同时支持 GLM 5.2 和高内存机器上的 V4 PRO
  • 提供 SSD 流式、多 GPU、张量并行及流水线并行等扩展能力

适用场景

它可以解决哪些实际问题

AI 推断
  • 在 MacBook、DGX Spark、Strix Halo 等消费级硬件上本地运行 DeepSeek V4 Flash
  • 将旧款 Ada Lovelace 架构 CUDA 显卡服务器改造为多用户 LLM 服务
  • 通过流水线并行聚合多系统内存,运行内存需求更高的模型

技术观察

从公开资料提炼的实现特征

AI 推断
  • 项目使用 C 语言编写,自包含且不链接 GGML,但借鉴了 llama.cpp 的量化格式和内核设计
  • 支持 GGUF 量化、路由 MoE 的 imatrix 校准、压缩 KV 缓存等优化
  • 包含 ds4-server 微批处理、质量测试、速度基准等工具链

优势判断

相对明确的项目价值

AI 推断
  • 针对特定模型深度优化,或能提供比通用运行器更高的效率
  • 多后端和流式方案降低了高端硬件门槛,适配多场景

局限与注意

评估和采用前需要留意

AI 推断
  • 项目自述为 beta 质量,变化快速,可能存在不稳定
  • 模型支持范围刻意收窄,并非通用 GGUF 运行器,替换模型需谨慎评估

适用人群

哪些开发者和团队值得关注

AI 推断
  • 拥有高内存 Mac 或支持 CUDA/ROCm 硬件、希望本地运行 DeepSeek V4 系列模型的开发者
  • 寻求将旧款 CUDA 服务器复用为 LLM 推理服务的企业技术团队
综合参考
从公开资料看,DwarfStar 是一个专注 DeepSeek V4 等少数模型的高性能推理引擎,多后端支持与并行特性具有吸引力,但 beta 状态和窄范围意味着稳定性与通用性存疑,建议在验证后用于实验或特定生产场景。
由 AI 基于 GitHub 公开资料辅助生成,不构成安全审计、生产选型或专业建议。

依据与内容边界

区分可验证事实、项目方自述与 AI 推断

GitHub 可验证事实

Star、Fork、License、更新时间及健康证据样本来自 GitHub 公开接口。

项目方自述

功能与使用方式主要来自仓库描述和 README,未经本站独立验证。

AI 推断

适用场景、优势与局限属于辅助解读,应结合原始文档独立判断。

  • GitHub事实:仓库 stars 20264,forks 1791,open issues 391,许可证 MIT,主要语言 C。
  • 项目方自述:README 声明支持 Metal/CUDA/ROCm,并给出 8xL40S 上的聚合性能数据。
  • AI推断:无权威安全审计信息,采用前应自行完成安全、性能和兼容性验证。
生成于 2026-08-04 00:25 规则版本 2026-07-v3
内容有误或您是项目作者?提交纠错
仅保存处理所需内容,不记录原始 IP;可信项目作者的高风险申诉会优先处理。