TileLang 每日动态报告(2026-09-21)
调研窗口:过去 24 小时(2026-09-20 07:00 ~ 2026-09-21 07:00,北京时间)。本期为常规日更窗口,与上一期无重叠。 信源:GitHub(tile-ai 组织 28 个仓库推送核查,窗口内 8 个仓库有推送;主仓 k 池链合入逐文件复核、SM120 需求单与补丁、评审队列动态;TileOPs 迁移合入、roofline 自查 PR 与两笔新开 PR、夜间快照双份 XML 全量解析;昇腾仓 11 笔合入与定时任务失败事件、两条跟进 PR;海光示例支持 PR;MLIR 昇腾两笔落地;文档站部署;采用方与沉默后端核查)、Google News RSS 中英文多组查询(走代理)、Hacker News、arXiv
本期索引
- 今日重点:GLM-5.3 k 池链首笔合入——整套示例与 4 个 AMD 测试进入主线,栈上四笔仍开(09-20)
- 一、核心项目进展
- 1.1 主仓:SM120 块缩放 GEMM 补齐寄存器驻留与奇数 warp 网格,需求单到补丁仅 21 分钟(09-21)
- 1.2 主仓评审队列:前端 Python 可迭代与 CPU OpenMP 两笔跨周条目推进(09-20)
- 1.3 TileOPs:稠密 Gated DeltaNet 预填充迁移合入,净删约 900 行(09-20)
- 1.4 TileOPs:roofline 清单自查——175 个算子中 88 个声明公式从未被运行(09-20/09-21)
- 1.5 TileOPs:变长 GQA 归并与 W4A16 GEMV 提速两笔新开(09-20)
- 1.6 夜间快照:连续两份零失败,#2144 并入后再增 6 个基准用例(09-20/09-21)
- 二、多后端适配(昇腾 / 海光 / 沐曦 / 摩尔线程)
- 2.1 昇腾:单日 11 笔合入,FP32 行归约与同步修复为最大一笔(72 文件,09-20)
- 2.2 昇腾:批量合入的验证尾巴——定时任务失败,两条跟进 PR 开出(09-20/09-21)
- 2.3 海光:HCU 示例支持 PR 开出,示例分支同步建立(09-20)
- 2.4 MLIR 昇腾:Mamba 算子与 agent 流水线模型选择(09-20)
- 2.5 沐曦、摩尔线程、Sunrise:窗口内无新提交(09-17/09-18)
- 三、生态与采用方
- 3.1 采用方:TileKernels 与 FlashQLA 窗口内无推送(04-23 / 09-18)
- 3.2 社区项目:TileLang-TPU 推进算能 TPU 侧的 ChunkScan 落地(09-20)
- 四、社区、教程与活动
- 4.1 文档站:主仓与 TileOPs 文档站各一次自动部署(09-20)
- 4.2 媒体与学术侧:窗口内零新增(09-21)
- 4.3 版本节奏:主仓 v0.1.14 发布满 19 天,各适配仓标签未动(09-02)
- 五、趋势观察
- 5.1 ROCm 线:栈式交付开始收口——一次压缩合入把整套示例带进主线
- 5.2 NVIDIA 线:SM120 进入小时级响应节奏
- 5.3 TileOPs 的信任工程:从读数、判据到公式本身
- 5.4 昇腾的批量合入日:收益之外还有验证尾巴
- 5.5 空白与风险点
- 附:素材与核查说明
今日重点:GLM-5.3 k 池链首笔合入——整套示例与 4 个 AMD 测试进入主线
日期:2026-09-20 来源:tilelang #3254 GLM-5.3 k 池 Top-K 变换/合入提交 eab74a4a/kpool 示例 README
09-20 17:06(北京时间)合入,以压缩方式落地(单父提交),把上一窗口成链的 GLM-5.3 k 池系列带进主线:11 个文件、+2520/-4。合入内容不是单笔算子补丁,而是一套完整的可运行资产:
- 示例套件
examples/kpool/:README 说明 + 四个示例,对应 GLM-5.3-Flash 稀疏注意力索引器的全流程——池内 softmax 加权池化、BF16 往返与归一化 Hadamard-128、逐向量 FP8 量化与 FP32 缩放、写入调用方持有的分页缓存、回读并计算 32 头 MQA 加权分数、选择 512 个池并按每池四 token 展开(另支持令牌表与不规则偏移映射);已发布特化配置为pool_size=4、head_dim=128。缓存契约写明:生产 vLLM 内核把 FP8 值与 FP32 缩放打包进一段交错 uint8 分配,示例改用两个调用方张量表达k_cache与scale_cache,FP8 格式随平台选择(pre-gfx950 用e4m3fnuz,gfx950/CUDA 用e4m3fn)。 - AMD 侧测试
testing/python/amd/:四笔 ROCm 测试(压缩、解码尾部、分页 FP8 MQA logits、Top-K 变换)。 - 语言层小改:
tilelang/language/fp8.py的determine_fp8_type()与determine_torch_fp8_type()增加device参数——FP8 dtype 选择从固定设备 0 改为可指定设备。
验证:exact-head CI(run 35428061006)Quick Lint、ROCm、CUDA、Metal、CuTeDSL 全部通过;ROCm 7.2 作业在 MI300X/gfx942 上报 2433 项通过、1852 项跳过。
栈状态:该笔自述「堆叠于 #3253,包含 #3250、#3251、#3253 直至各自合入」——它是整条栈的顶笔,压缩合入把栈内容整体带入 main;截至窗口结束,#3250、#3251、#3253、#3255 四笔仍处未合入状态,且自 09-19 后无更新,需要维护者以 rebase 或关闭来收尾。
判读:从 #3250 开出(09-19 清晨)到整链内容进入 main(09-20 下午),前后约 34 小时。AMD 侧的动作已经从「后端可用」「新模型算子要有」,走到「模型专属示例套件与测试资产入库」;配合此前 #3165 确立的「示例即测试」,这条路径的交付形态已经稳定——示例不只是文档,而是被 CI 直接跑的正确性资产。
一、核心项目进展
窗口总览:主仓 1 笔合入(k 池链,见今日重点)、1 个需求单与 1 笔新 PR(SM120 线)以及两笔队列条目推进;TileOPs 1 笔大合入(迁移)、3 笔新开 PR 与 2 份夜间快照。
1.1 主仓:SM120 块缩放 GEMM 补齐寄存器驻留与奇数 warp 网格,需求单到补丁 21 分钟(09-21)
日期:2026-09-20 至 2026-09-21 来源:tilelang #3256 SM120 块缩放 GEMM 需求单/#3257 SM120 fragment 与奇数 warp 网格/#2253 SM120 块缩放 MMA 与 SageAttention3
窗口后段(09-21 凌晨)主仓出现一条「需求单到补丁」的直线:01:22 需求单 #3256 创建(SageAttention3 把低频 MMA 宏换成 T.gemm_blockscaled 被两个限制卡住——不支持 fragment A 与共享 B 的操作数作用域;M=N=K=128、256 线程下 FullRow 加紧凑缩放的逐 warp 1x8 MMA 原子网格被拒);01:43 补丁 #3257 即开出,同一作者(sepcnt)、6 文件 +252/-42:支持 SM120 块缩放 GEMM 的 fragment A 与行主序缩放 fragment、修复奇数逐 warp 原子网格(含 8x1 分区)的紧凑缩放,并补下降与正确性测试;同一时段 #2253(SageAttention3 主线大 PR)更新。需求单自带验证条件:在合入 #3254 后的 main eab74a4a 上、torch 2.11.0+cu130、sm_120a 环境实测。
判读:21 分钟的间隔说明这条线的作者对问题边界已有完整把握;SM120(新一代消费与工作站 GPU)的块缩放 GEMM 正从「能用」向「满足具体注意力内核的形态要求」推进,路线由 SageAttention3 的实际需求牵引。
1.2 主仓评审队列:前端 Python 可迭代与 CPU OpenMP 两笔跨周条目推进(09-20)
日期:2026-09-20 来源:#3230 前端支持 Python 可迭代与推导式/#3109 CPU 网格循环 OpenMP 并行
两笔队列条目在窗口内更新(均未合入):#3230(09-15 创建,09-20 23:42 更新)让前端接受 Python 可迭代对象与推导式作为循环边界;#3109(08-28 创建,09-20 21:56 更新)为 CPU 后端补网格循环的 OpenMP 并行。两者分别指向前端易用性与 CPU 路径,均为跨周推进的长队列条目。另:#3245(CUDA 代码生成前的 GEMM 数据类型拦截)与 #3247(Tile IR 后端,草稿)窗口内无更新。
1.3 TileOPs:稠密 Gated DeltaNet 预填充迁移合入,净删约 900 行(09-20)
日期:2026-09-20 来源:TileOPs #2144 迁移稠密 Gated DeltaNet 预填充
09-20 21:29 合入,19 文件、+2102/-3003(净 -901),作者 superAngGao,属线性注意力统一化工作(#2143)的一步:把 Hopper 的 BTHD 稠密预填充流水线接进统一算子 GatedDeltaNetFwdOp,实现拆入 gated_deltanet/prefill/(入口、公共 lowering 与缓存、状态校正、融合前向四层);旧的 GatedDeltaNetPrefillFwdKernel 直接从内核清单移除、不留兼容别名(发布前清理),新名为 GatedDeltaNetDensePrefillFwdKernel。
范围与验证:本阶段仅支持等长、零初始状态、H==HV、K==V==128 的预填充(解码、首状态、GVA、变长等留作后续);H200、SM 锁频 1500 兆赫兹:Gated DeltaNet 5 项测试通过;6 个清单基准用例与 FLA 逐项对照通过,BF16 输出最大绝对误差 1.37e-4、FP32 末状态 2.31e-3;端到端 0.3855 毫秒对 FLA 0.5435(S=4096,1.41 倍)、0.5224 对 1.5384(S=32768,2.94 倍)。
判读:这是把「迁移」当发布前清理来做的样本——删旧内核、统一 ABI、清理清单,代价是 decode 等能力要在后续窗口补齐;算子库的接口收敛按「先统一、后补全」推进。
1.4 TileOPs:roofline 清单自查——175 个算子中 88 个声明公式从未被运行(09-20/09-21)
日期:2026-09-20 至 2026-09-21 来源:TileOPs #2158 让清单公式与实际运行公式合一并重新计数
09-20 07:29 新开、09-21 06:55 仍在更新(57 文件、+2965/-980、20 笔提交,未合入)。这笔把「度量可信」的治理推进到公式层:roofline 字段本应是公式的单一来源、eval_roofline() 是其唯一求值面——两者当时都不成立。盘点结果:175 个已实现算子中,代码生成服务 77 个,其余 98 个带着作者手写方法,其中 88 个清单里的公式从未执行;16 个内联条目根本无法求值(引用了变量层从未绑定的名字);结构预言机只检查了 14 个算子,其余 161 个以「PENDING」列出且不给理由。
公式本身的错误也成批列出,摘录几例:Conv3d 前向按当前内核的暂存缓冲计价(67,330,176 对 25,276,416);RoPE 系列 7 个算子把算子自有的 cos/sin 表计入(34,611,200 对 33,562,624);Mamba2 前向漏计 final_states;DeltaNetAutograd 共用前向公式、多计 5 个常驻自动微分上下文的张量(21,135,360 对 8,421,376);分页 GQA 前向把 fp8 缓存按查询 dtype 计价(2,550,153,796 对 1,442,857,548);批归一化漏计 mutated 写入与参数梯度;分组矩阵乘把每组的元数据多计等。
判读:上一窗口是「公式对语义负责(#2155)、测量对物理原理负责(#1996)、数据对溯源负责(#2154)」三连;本笔把同一把尺子对准公式资产本身——先证明「跑的那份」就是「写的那份」,再谈快慢。对一个要被当作上游依赖的算子库,这是把信用基础从「看起来对」翻到「算得出、对得上」的关键一步。
1.5 TileOPs:变长 GQA 归并与 W4A16 GEMV 提速两笔新开(09-20)
日期:2026-09-20 来源:TileOPs #2160 变长 GQA 内核迁移到统一算子/#2159 W4A16 W4 GEMV 提速
#2160(09-20 11:55 创建,17 文件 +638/-1232,未合入):把 16 位常规与滑窗口变长内核迁入 GroupedQueryAttentionVarlenFwdOp,并移除两个被取代的公共算子;请求长度与瓦片归属改由 GPU 侧从 cu_seqlens 推导(total_q/total_kv 保持 TileLang 动态维度);公共结果对齐稠密 GQA(只返回 o);全遮掩行确定性输出 0。验证:H200 上 GQA 套件 71 项通过(稠密与反向 41、变长 30)、冒烟 19、编译边界 6、CUPTI 单项 0.0699 毫秒,另有 roofline、清单与内核映射 54 项。作者注明不做性能声明——这是一笔迁移归并。
#2159(09-20 11:05 创建,2 文件 +87/-38,草稿):W4A16 的 W4 GEMV 在 H200 上从 28.83 微秒降到 23.84 微秒(1.21 倍);做法是每个输出行交给一个 warp、在 K 维保留 FP32 累加、以 warp shuffle 收尾;仅对实测形状在 SM90 启用。作者如实写明「相对最快的 Marlin 基线仍慢 9.4%,本笔保持草稿」。
判读:两笔延续 TileOPs 的两条主线——接口收敛(统一算子、删旧)与性能小步补差(不达标先标注差距、不进主线)。
1.6 夜间快照:连续两份零失败,#2144 并入后再增 6 个基准用例(09-20/09-21)
日期:2026-09-20 至 2026-09-21 来源:TileOPs-nightly 快照分支/快照环境元数据
窗口内夜间流水线出两份快照:09-20 08:02 为 0bedc999(#1996)生成——正确性 1118 项、失败 0、跳过 2;基准 1040 项、失败 0、跳过 3。09-21 02:38 为 f8c4081c(#2144 合入)生成——正确性持平(1118,零失败),基准增至 1046 项、失败 0、跳过 3(新增 6 个用例来自迁移并入的清单基准)。环境元数据与上期一致:H200、CUDA 13.2、驱动 595.71.05、功耗上限 700 瓦、SM 1500 兆赫兹、内存时钟 3201 兆赫兹、TileLang 0.1.11 加代号版本、torch 2.13.0。
判读:两日两次零失败说明新合入内容均被正确覆盖;基准用例数随合入单调增长,夜间流水线正在稳定承担「合入后验证」职责。
二、多后端适配(昇腾 / 海光 / 沐曦 / 摩尔线程)
2.1 昇腾:单日 11 笔合入,FP32 行归约与同步修复为最大一笔(09-20)
日期:2026-09-20 来源:tilelang-ascend #1753 FP32 行归约与同步修复/#1804 行切片拷贝 stride 修复/#1809 block_sparse_mqa_attn 异步读写修复/#1621 mhc_pre 算子示例
昇腾仓在 09-20 迎来一个批量合入日:默认分支(ascendc_pto)单日落地 11 笔(09:36 至 16:29),分三组:
- 最大一笔 #1753(16:29 合入,72 文件、+10117/-3618、26 笔提交):为编译期形状已知的 FP32 输入提供逐行 max/min/sum 实现,并修复两类自动同步缺陷——同一数据上较早的读写记录被后来的读取挤掉;循环执行零次、一次、嵌套时等待处理不完整。另含输出切片越界、
threads=2暂存不足等修复。T.reduce_max/min/sum接口不变。 - 正确性修复组:#1804(14:26 合入,2 文件 +335/-14,修 #1263)修复行切片场景下
compute_strideN把整个缓冲大小当成行距的错误——C2 (8388608, 128)行切片得到 2 的 30 次方级 stride,在 910B2 上因 uint16 截断造成数据损坏,补 13 个用例;#1809 修复block_sparse_mqa_attn示例的 CV 异步读写超时问题(修 #1665)。 - 算子与文档组:#1621 新增 NPU 侧
mhc_pre算子示例;fredrekelthen 单日文档系列 6 笔(sort、topk、transpose、add/sub/mul/div、max/min、select 的 docstring 精修 + dtype 覆盖测试 + API 文档),另有 atomic_add 文档补齐(#1587)。
判读:一天内把「一项大特性 + 一组正确性修复 + 一轮 API 文档补齐」全部落地,是该仓迄今最密集的合入日;文档系列 6 笔来自同一作者、格式统一,像把某个批次的收口工作一次做完。
2.2 昇腾:批量合入的验证尾巴——定时任务失败,两条跟进 PR 开出(09-20/09-21)
日期:2026-09-20 至 2026-09-21 来源:昇腾每日测试失败单 #1817/#1816 纯 Vector 算子自动 C/V 归属/#1815 PTO V2C LEFT_RIGHT 串行化
批量合入的代价在窗口后段显现:09-21 06:01(北京时间)的每日测试报告为工作流级失败(对应 04:23 启动、运行于 #1753 合入点 5e6e1dfb 上的定时工作流)。此前一次通过报告是 09-20 05:30 的 1936/1936——对应的是合入潮之前的基线。
两条跟进 PR 已在窗口内开出:#1816(09-20 18:36 创建,作者 platelett)说明 #1753 开始严格检查 Cube 与 Vector 执行归属后,受影响的纯 Vector 算子与测试需要开启 TL_ASCEND_AUTO_CV_COMBINE 由编译器自动补作用域,并清理过时的测试前提;#1815(09-20 11:17 创建,作者 zwh1025)修 PTO 的 Vector 到 Cube TILE_LEFT_RIGHT 拆分在每 AIV 行宽非 32 字节整数倍时的并发 partial-write 冲突(修 #1661,Atlas A3 与 fp16 K=16 场景曾出现 NaN 与 Inf)。
判读:大合入日之后,「合入、定时验证、跟进修复」的链条在正常运转,但两个跟进单都不是新功能,而是合入引发的连带修正——单日 1.1 万行规模的合入把验证风险一并带进了下游分支。
2.3 海光:HCU 示例支持 PR 开出,示例分支同步建立(09-20)
日期:2026-09-20 来源:tilelang-hygon #11 启用 TileLang 示例支持
19:51(北京时间)仓库新建 tilelang-examples 分支,20:02 新 PR #11 开出(作者 zy3223,26 文件 +1072/-143,未合入):适配 autotune 与 LDS 配置、解决内核布局冲突、GEMM 改用 HCU 矩阵核心内建指令、补回归覆盖。与 #10(09-17 合入的 MLS 缓冲存储与 prefer_async 流水)连起来看,海光侧正处于「把 TileLang 示例套件在 HCU 上跑通」的阶段。
2.4 MLIR 昇腾:Mamba 算子与 agent 流水线模型选择(09-20)
日期:2026-09-20 来源:tilelang-mlir-ascend #187 TileOPs 报告设施/#188 Mamba 算子与 per-agent 模型选择
MLIR 昇腾适配仓窗口内落地两笔(作者均为 lhw):#187(10:10 落地,约 +5.4 千/-112 行、40 个文件)把 TileOPs 的基准与报告设施带进仓库——报告 JSON/MD/HTML、Ascend 侧 profile 脚本与报告测试等;#188(12:29 落地,约 +4.2 千/-68 行、36 个文件)新增优化后的 Mamba 算子,并引入「按 agent 选择模型」的流水线配置(.agents/ 演化日志与 .opencode/agents/ 角色定义同步更新,含 Mamba 基准)。
判读:这个仓库的动作像是在用 AI agent 流水线批量开发与适配算子(模式库、陷阱库、复现用例都在版本库里),Mamba 与报告设施是这条流水线的产出样本;对「agent 化算子开发」方向,这里是目前生态内较激进的实践样本之一。
2.5 沐曦、摩尔线程、Sunrise:窗口内无新提交(09-17 / 09-18)
日期:2026-09-17 至 2026-09-18(各自最近推送) 来源:tilelang-metax/tilelang-musa/tilelang-sunrise
三家窗口内均无提交:沐曦最近推送 09-17,摩尔线程 09-17,Sunrise 最新动作仍是 09-18 上午建立候选分支 candidate/20126-public-release-pilot(无后续提交)。各仓标签未更新。
三、生态与采用方
3.1 采用方:TileKernels 与 FlashQLA 窗口内无推送(04-23 / 09-18)
日期:2026-09-21(核查) 来源:TileKernels/FlashQLA
窗口内两家采用方无推送:TileKernels 最近推送仍停在 04-23;FlashQLA 上次推送为 09-18(三笔 SM100/SM120 相关合入,已由周末两期覆盖)。采用方一侧自周五后进入静默。
3.2 社区项目:TileLang-TPU 推进算能 TPU 侧的 ChunkScan 落地(09-20)
日期:2026-09-20 来源:TileLang-TPU 仓库
一个社区项目在窗口内两次提交:为算能加速器扩展 TileLang 的 TPU 后端(target="tpu"、pcie 与 cmodel 两种模式、ppl_* 系列 DSL 内建、JIT 全流程),正把与 Mamba2 相关的 ChunkScan 分块扫描算子往 BM1690 上带——两次提交分别是 cmodel 流水与 BM1690 PCIe 硬件验证。项目星标少、属早期探索,但方向值得记录:TileLang 的第三方后端正向更多国产芯片线延伸。
四、社区、教程与活动
4.1 文档站:主仓与 TileOPs 文档站各一次自动部署(09-20)
日期:2026-09-20 来源:主仓文档站/TileOPs 文档站
主仓文档站 17:10 一次「Update docs」自动提交;TileOPs 文档站 07:58 一次 gh-pages 分支部署。均为流水线自动行为,站点内容未见实质变化。
4.2 媒体与学术侧:窗口内零新增(09-21)
日期:2026-09-21 来源:Google News RSS(多个中英文查询,走代理)/Hacker News/arXiv
Google News 中英文多组查询(TileLang、tile-ai、算子、国产芯片组合等)窗口内零命中;Hacker News 近五日无主题相关条目;arXiv 主题检索最新一篇仍为 07-24 的 TileSight 性能模型论文,窗口内无新预印本。
4.3 版本节奏:主仓 v0.1.14 发布满 19 天,各适配仓标签未动(09-02)
日期:2026-09-02(最近发布) 来源:tilelang v0.1.14
主仓最新发布仍为 09-02 的 v0.1.14(已满 19 天);适配仓窗口内无新标签:昇腾 v0.1.2.000(09-09)、MLIR 昇腾 v0.1.2.020(06-11)、摩尔线程 v0.1.14+musa.1(09-11)。
五、趋势观察
5.1 ROCm 线:栈式交付开始收口——一次压缩合入把整套示例带进主线
从 #3250 到 #3254 的栈在上个窗口成链、本窗口由顶笔一次带入主线。栈式 PR 的效率在这里得到体现:评审看的是链,落地也是整链。遗留问题是链上其余四笔的收尾——内容已在 main,需要以 rebase 或关闭处理,否则队列里会留下四个「名不副实」的开单。
5.2 NVIDIA 线:SM120 进入小时级响应节奏
需求单 #3256(01:22)到补丁 #3257(01:43)间隔 21 分钟、同一作者,并且围绕一个具体下游项目(SageAttention3)的卡点推进。这种「下游需求到当夜补丁」的节奏,说明 SM120 块缩放 GEMM 已有明确的负责人与验证基线(合入后的 main 头、sm_120a、torch 2.11)。
5.3 TileOPs 的信任工程:从读数、判据到公式本身
三天四笔下来(#2155 语义、#1996 物理、#2154 溯源、#2158 公式),度量治理已经把「读出来的数」与「写下来的公式」都翻了一遍。起点只是 8 行带宽异常,治理半径扩大到 175 个算子的公式资产——教训是同一个:指标的可信度不来自「看起来合理」,而来自「运行的那份与声明的那份是同一份」。
5.4 昇腾的批量合入日:收益之外还有验证尾巴
单日 11 笔、最大一笔 72 文件与 1 万行新增之后,定时任务失败与两条跟进 PR 在半天内接连出现——这不是异常,而是大合入的固有成本(严格化改动会影响存量内核与测试前提)。观察点:跟进 PR 合入后定时回归能否恢复全绿、用例数是否从 1936 上移。
5.5 空白与风险点
三点:其一,主仓发版停滞已 19 天,评审队列里跨周条目(#3109、#3230、#2253 等)持续累积;其二,k 池栈内容已在 main 而四笔开单未收尾,存在重复维护风险;其三,昇腾定时回归在批量合入后失败、跟进修复尚未合入——对盯着「每日全绿」信号的下游使用者,本日应视为红。
附:素材与核查说明
信源核查表
| 信源 | 核查结果 |
|---|---|
| tile-ai 组织(28 仓库) | 窗口内 8 个仓库有推送:tilelang、TileOPs、TileOPs-nightly、tilelang-ascend、tilelang-hygon、tilelang-mlir-ascend、tilelang.github.io、TileOPs.github.io(后两者为站点部署) |
| 主仓 tilelang 默认分支 | 1 笔合入(#3254,k 池链);新开 1 个需求单(#3256)与 1 笔 PR(#3257);#3230、#3109 有更新;#3245、#3247 无更新 |
| TileOPs | 1 笔合入(#2144);新开 3 笔(#2158、#2159、#2160);其余条目窗口内无更新 |
| TileOPs-nightly | 两份快照(0bedc999、f8c4081c):基准 1040 增至 1046、正确性 1118,均零失败 |
| 昇腾 | 单日 11 笔合入;定时任务失败(#1817);跟进 PR #1815、#1816 开出 |
| 海光 | PR #11 开出(示例支持),示例分支建立 |
| MLIR 昇腾 | 2 笔落地(#187 报告设施、#188 Mamba 算子与 agent 流水线) |
| 沐曦 / 摩尔线程 / Sunrise | 窗口内均无提交,标签未更新 |
| 采用方 | TileKernels、FlashQLA 窗口内无推送 |
| 社区项目 | TileLang-TPU(算能 BM1690 方向)2 次提交 |
| Google News RSS(中英多组,走代理) | 窗口内零新增 |
| Hacker News | 近五日无主题命中 |
| arXiv | 主题检索最新一篇为 07-24,窗口内无新预印本 |
| 文档站 | 主仓文档站 1 次自动提交、TileOPs 文档站 1 次部署,内容未见实质变化 |
完整信源清单
- [1] tilelang #3254 GLM-5.3 k 池 Top-K 变换(合入) — https://github.com/tile-ai/tilelang/pull/3254
- [2] tilelang 合入提交 eab74a4a — https://github.com/tile-ai/tilelang/commit/eab74a4ae5
- [3] tilelang k 池示例 README — https://github.com/tile-ai/tilelang/blob/main/examples/kpool/README.md
- [4] tilelang #3256 SM120 块缩放 GEMM 需求单 — https://github.com/tile-ai/tilelang/issues/3256
- [5] tilelang #3257 SM120 fragment 与奇数 warp 网格 — https://github.com/tile-ai/tilelang/pull/3257
- [6] tilelang #2253 SM120 块缩放 MMA 与 SageAttention3 — https://github.com/tile-ai/tilelang/pull/2253
- [7] tilelang #3230 前端 Python 可迭代与推导式 — https://github.com/tile-ai/tilelang/pull/3230
- [8] tilelang #3109 CPU 网格循环 OpenMP 并行 — https://github.com/tile-ai/tilelang/pull/3109
- [9] tilelang #3255 分页 k 池融合选择(未合入) — https://github.com/tile-ai/tilelang/pull/3255
- [10] tilelang #3250 至 #3253 k 池栈(未合入) — https://github.com/tile-ai/tilelang/pull/3250
- [11] TileOPs #2144 稠密 Gated DeltaNet 预填充迁移(合入) — https://github.com/tile-ai/TileOPs/pull/2144
- [12] TileOPs #2158 roofline 清单公式自查 — https://github.com/tile-ai/TileOPs/pull/2158
- [13] TileOPs #2160 变长 GQA 迁移 — https://github.com/tile-ai/TileOPs/pull/2160
- [14] TileOPs #2159 W4A16 W4 GEMV 提速 — https://github.com/tile-ai/TileOPs/pull/2159
- [15] TileOPs-nightly 快照分支 — https://github.com/tile-ai/TileOPs-nightly/commits/snapshots
- [16] TileOPs-nightly 快照环境元数据 — https://github.com/tile-ai/TileOPs-nightly/blob/snapshots/meta.json
- [17] 昇腾 #1753 FP32 行归约与同步修复 — https://github.com/tile-ai/tilelang-ascend/pull/1753
- [18] 昇腾 #1804 行切片 stride 修复 — https://github.com/tile-ai/tilelang-ascend/pull/1804
- [19] 昇腾 #1809 block_sparse_mqa_attn 异步修复 — https://github.com/tile-ai/tilelang-ascend/pull/1809
- [20] 昇腾 #1621 mhc_pre 算子示例 — https://github.com/tile-ai/tilelang-ascend/pull/1621
- [21] 昇腾 #1587 atomic_add 文档补齐 — https://github.com/tile-ai/tilelang-ascend/pull/1587
- [22] 昇腾文档系列:sort #1562 — https://github.com/tile-ai/tilelang-ascend/pull/1562
- [23] 昇腾文档系列:topk #1584 — https://github.com/tile-ai/tilelang-ascend/pull/1584
- [24] 昇腾文档系列:transpose #1590 — https://github.com/tile-ai/tilelang-ascend/pull/1590
- [25] 昇腾文档系列:add/sub/mul/div #1613 — https://github.com/tile-ai/tilelang-ascend/pull/1613
- [26] 昇腾文档系列:max/min #1615 — https://github.com/tile-ai/tilelang-ascend/pull/1615
- [27] 昇腾文档系列:select #1544 — https://github.com/tile-ai/tilelang-ascend/pull/1544
- [28] 昇腾每日测试失败单 #1817 — https://github.com/tile-ai/tilelang-ascend/issues/1817
- [29] 昇腾 #1816 纯 Vector 算子自动 C/V 归属 — https://github.com/tile-ai/tilelang-ascend/pull/1816
- [30] 昇腾 #1815 PTO V2C LEFT_RIGHT 串行化 — https://github.com/tile-ai/tilelang-ascend/pull/1815
- [31] 昇腾每日测试通过单 #1814(09-20,1936 项) — https://github.com/tile-ai/tilelang-ascend/issues/1814
- [32] 海光 #11 启用 TileLang 示例支持 — https://github.com/tile-ai/tilelang-hygon/pull/11
- [33] MLIR 昇腾 #187 TileOPs 报告设施 — https://github.com/tile-ai/tilelang-mlir-ascend/pull/187
- [34] MLIR 昇腾 #188 Mamba 算子与 per-agent 模型选择 — https://github.com/tile-ai/tilelang-mlir-ascend/pull/188
- [35] TileLang-TPU(ChunkScan 到 BM1690) — https://github.com/arcflute/ChunkScan-2-TileLang-4-TPU-bm1690
- [36] TileKernels(采用方,无推送) — https://github.com/deepseek-ai/TileKernels
- [37] FlashQLA(采用方,无推送) — https://github.com/QwenLM/FlashQLA
- [38] tilelang-metax(无推送) — https://github.com/tile-ai/tilelang-metax
- [39] tilelang-musa(无推送) — https://github.com/tile-ai/tilelang-musa
- [40] tilelang-sunrise(无推送) — https://github.com/tile-ai/tilelang-sunrise
- [41] 主仓最新发布 v0.1.14 — https://github.com/tile-ai/tilelang/releases/tag/v0.1.14
- [42] tilelang.github.io(文档站) — https://github.com/tile-ai/tilelang.github.io
- [43] TileOPs.github.io(文档站) — https://github.com/tile-ai/TileOPs.github.io