MoonshotAI

@MoonshotAI

FlashKDA

MoonshotAI/FlashKDA

FlashKDA: high-performance Kimi Delta Attention kernels

STARS1,133
FORKS105
ISSUES18
LANGUAGECuda

HISTORICAL INTELLIGENCE

历史情报摘要

按周期独立统计
日榜当前未记录
历史最佳#11最近排名#11

当前未进入本站记录范围

记录天数
1 天
记录期 Star
0
本站共 12 天日榜快照 · 最近记录 2026-07-29
本站最早记录:2026-07-29

指标仅基于本站已保存快照,不代表项目在 GitHub 的首次上榜时间;同日多次抓取保留当日最新结果,负向 Star 差值按样本校正处理。

VERIFIABLE HEALTH SIGNALS

项目健康证据

维护、响应、交付与采用风险分开观察,不生成虚假的单一总分。
高可信度
MAINTENANCE

维护活性

核对提交
近 90 天 Commit
3
完整窗口
活跃贡献者
3
按公开提交账号去重
近 12 月活跃月份
3/12
有提交的自然月
RESPONSE

社区响应

核对样本
Issue 关闭率
9%
1/11 个同期新 Issue
Issue 关闭中位数
0.0 小时
仅统计已关闭样本
PR 合并率
25%
3/12 个同期新 PR
PR 合并中位数
5.0 小时
仅统计已合并样本
DELIVERY

持续交付

核对发布
近 12 月正式 Release
0
排除草稿与预发布
最近正式 Release
暂无记录
以公开发布时间为准
发布间隔中位数
样本不足
至少两次正式发布才计算
ADOPTION

采用风险

查看仓库
仓库状态
正常开放
未发现归档标记
开源协议
MIT
仍需核对完整协议与依赖
Security Policy
未发现
仅检查 GitHub 社区资料

统计窗口 90 天快照样本 2 天计算规则 health-v1采集于 2026-08-03 07:35

公开样本完整,Issue 与 PR 合计样本量达到基本观察门槛。 这些信号不替代代码审计、安全测试和真实生产验证。

AI-ASSISTED PROJECT BRIEF

项目定位与辅助解读

来源边界与风险表述检查

AI 解读仅作初评参考,技术落地请以 GitHub 源码、README 和完整协议为准。

项目资料AI 整理

MoonshotAI开发的FlashKDA是一个基于CUTLASS的高性能Kimi Delta Attention(KDA)内核,专为NVIDIA SM90+架构优化,支持PyTorch集成,MIT协议开源。

FlashKDA是MoonshotAI推出的Flash Kimi Delta Attention内核实现,基于CUTLASS库构建,专注于高效执行KDA注意力机制。它需要SM90及以上GPU、CUDA 12.9+和PyTorch 2.4+。可作为flash-linear-attention的后端自动调度,提供与Triton路径的切换选项。项目包含完整的C++/CUDA源码和Python封装,API设计清晰,支持可变长序列和状态传递。

核心亮点

项目最值得关注的能力

AI 推断
  • 基于CUTLASS的高性能Kernel设计
  • 支持与flash-linear-attention集成,自动调度
  • 提供详细API文档和BENCHMARK性能报告
  • 支持可变长序列批处理和初始/最终状态管理

适用场景

它可以解决哪些实际问题

AI 推断
  • 加速Kimi Delta Attention的前向和反向计算
  • 作为flash-linear-attention框架的高性能后端
  • 在需要高效注意力机制的LLM推理和训练中应用
  • 研究与开发定制的KDA变体

技术观察

从公开资料提炼的实现特征

AI 推断
  • 内核要求K=V=128维度,支持bf16输入,内部使用fp32参数
  • 依赖SM90+架构和CUDA 12.9+,编译时自动检测或指定架构
  • 通过环境变量FLA_FLASH_KDA可切换至Triton路径
  • API接受可选初始状态和cu_seqlens支持可变长批处理

优势判断

相对明确的项目价值

AI 推断
  • 针对SM90+深度优化,性能潜力高
  • 提供与主流注意力库(flash-linear-attention)的无缝集成
  • 开源MIT协议,代码可审查和定制

局限与注意

评估和采用前需要留意

AI 推断
  • 仅支持SM90+架构,老旧GPU无法使用
  • 当前固定K=V=128,不适用于其他维度
  • 存在18个open issues,生产使用前需充分测试

适用人群

哪些开发者和团队值得关注

AI 推断
  • AI研究者和工程师,特别是关注线性注意力或状态空间模型的人员
  • 需要高性能KDA内核的LLM部署团队
  • 对CUTLASS和CUDA内核开发感兴趣的开发者
综合参考
FlashKDA是一个面向新一代NVIDIA GPU的高性能KDA注意力内核实现,与flash-linear-attention生态紧密集成。其MIT许可和详细文档便于社区采用。虽当前仅支持SM90+及固定维度,但已提供可工作的基准。开发者应在实际环境中验证其兼容性与性能,并关注issue进展。
由 AI 基于 GitHub 公开资料辅助生成,不构成安全审计、生产选型或专业建议。

依据与内容边界

区分可验证事实、项目方自述与 AI 推断

GitHub 可验证事实

Star、Fork、License、更新时间及健康证据样本来自 GitHub 公开接口。

项目方自述

功能与使用方式主要来自仓库描述和 README,未经本站独立验证。

AI 推断

适用场景、优势与局限属于辅助解读,应结合原始文档独立判断。

  • GitHub事实:该仓库拥有883星,90 fork,18个open issues,使用MIT许可证。
  • 项目方自述:FlashKDA基于CUTLASS构建,需要SM90+、CUDA 12.9+和PyTorch 2.4+,并可与flash-linear-attention集成。
  • AI推断:从API设计看,该项目专注于实用性和性能,但当前版本对输入维度有严格限制,可能限制通用性。
生成于 2026-07-29 18:55 规则版本 2026-07-v3
内容有误或您是项目作者?提交纠错
仅保存处理所需内容,不记录原始 IP;可信项目作者的高风险申诉会优先处理。