调研窗口:过去 24 小时(2026-09-20 07:00 ~ 2026-09-21 07:00,北京时间)。本期为常规日更窗口,与上一期无重叠。 信源:GitHub(tile-ai 组织 28 个仓库推送核查,窗口内 8 个仓库有推送;主仓 k 池链合入逐文件复核、SM120 需求单与补丁、评审队列动态;TileOPs 迁移合入、roofline 自查 PR 与两笔新开 PR、夜间快照双份 XML 全量解析;昇腾仓 11 笔合入与定时任务失败事件、两条跟进 PR;海光示例支持 PR;MLIR 昇腾两笔落地;文档站部署;采用方与沉默后端核查)、Google News RSS 中英文多组查询(走代理)、Hacker News、arXiv


本期索引

  • 今日重点:GLM-5.3 k 池链首笔合入——整套示例与 4 个 AMD 测试进入主线,栈上四笔仍开(09-20)
  • 一、核心项目进展
    • 1.1 主仓:SM120 块缩放 GEMM 补齐寄存器驻留与奇数 warp 网格,需求单到补丁仅 21 分钟(09-21)
    • 1.2 主仓评审队列:前端 Python 可迭代与 CPU OpenMP 两笔跨周条目推进(09-20)
    • 1.3 TileOPs:稠密 Gated DeltaNet 预填充迁移合入,净删约 900 行(09-20)
    • 1.4 TileOPs:roofline 清单自查——175 个算子中 88 个声明公式从未被运行(09-20/09-21)
    • 1.5 TileOPs:变长 GQA 归并与 W4A16 GEMV 提速两笔新开(09-20)
    • 1.6 夜间快照:连续两份零失败,#2144 并入后再增 6 个基准用例(09-20/09-21)
  • 二、多后端适配(昇腾 / 海光 / 沐曦 / 摩尔线程)
    • 2.1 昇腾:单日 11 笔合入,FP32 行归约与同步修复为最大一笔(72 文件,09-20)
    • 2.2 昇腾:批量合入的验证尾巴——定时任务失败,两条跟进 PR 开出(09-20/09-21)
    • 2.3 海光:HCU 示例支持 PR 开出,示例分支同步建立(09-20)
    • 2.4 MLIR 昇腾:Mamba 算子与 agent 流水线模型选择(09-20)
    • 2.5 沐曦、摩尔线程、Sunrise:窗口内无新提交(09-17/09-18)
  • 三、生态与采用方
    • 3.1 采用方:TileKernels 与 FlashQLA 窗口内无推送(04-23 / 09-18)
    • 3.2 社区项目:TileLang-TPU 推进算能 TPU 侧的 ChunkScan 落地(09-20)
  • 四、社区、教程与活动
    • 4.1 文档站:主仓与 TileOPs 文档站各一次自动部署(09-20)
    • 4.2 媒体与学术侧:窗口内零新增(09-21)
    • 4.3 版本节奏:主仓 v0.1.14 发布满 19 天,各适配仓标签未动(09-02)
  • 五、趋势观察
    • 5.1 ROCm 线:栈式交付开始收口——一次压缩合入把整套示例带进主线
    • 5.2 NVIDIA 线:SM120 进入小时级响应节奏
    • 5.3 TileOPs 的信任工程:从读数、判据到公式本身
    • 5.4 昇腾的批量合入日:收益之外还有验证尾巴
    • 5.5 空白与风险点
  • 附:素材与核查说明

今日重点:GLM-5.3 k 池链首笔合入——整套示例与 4 个 AMD 测试进入主线

日期:2026-09-20 来源tilelang #3254 GLM-5.3 k 池 Top-K 变换合入提交 eab74a4akpool 示例 README

09-20 17:06(北京时间)合入,以压缩方式落地(单父提交),把上一窗口成链的 GLM-5.3 k 池系列带进主线:11 个文件、+2520/-4。合入内容不是单笔算子补丁,而是一套完整的可运行资产:

  • 示例套件 examples/kpool/:README 说明 + 四个示例,对应 GLM-5.3-Flash 稀疏注意力索引器的全流程——池内 softmax 加权池化、BF16 往返与归一化 Hadamard-128、逐向量 FP8 量化与 FP32 缩放、写入调用方持有的分页缓存、回读并计算 32 头 MQA 加权分数、选择 512 个池并按每池四 token 展开(另支持令牌表与不规则偏移映射);已发布特化配置为 pool_size=4head_dim=128。缓存契约写明:生产 vLLM 内核把 FP8 值与 FP32 缩放打包进一段交错 uint8 分配,示例改用两个调用方张量表达 k_cachescale_cache,FP8 格式随平台选择(pre-gfx950 用 e4m3fnuz,gfx950/CUDA 用 e4m3fn)。
  • AMD 侧测试 testing/python/amd/:四笔 ROCm 测试(压缩、解码尾部、分页 FP8 MQA logits、Top-K 变换)。
  • 语言层小改tilelang/language/fp8.pydetermine_fp8_type()determine_torch_fp8_type() 增加 device 参数——FP8 dtype 选择从固定设备 0 改为可指定设备。

验证:exact-head CI(run 35428061006)Quick Lint、ROCm、CUDA、Metal、CuTeDSL 全部通过;ROCm 7.2 作业在 MI300X/gfx942 上报 2433 项通过、1852 项跳过。

栈状态:该笔自述「堆叠于 #3253,包含 #3250、#3251、#3253 直至各自合入」——它是整条栈的顶笔,压缩合入把栈内容整体带入 main;截至窗口结束,#3250、#3251、#3253、#3255 四笔仍处未合入状态,且自 09-19 后无更新,需要维护者以 rebase 或关闭来收尾。

判读:从 #3250 开出(09-19 清晨)到整链内容进入 main(09-20 下午),前后约 34 小时。AMD 侧的动作已经从「后端可用」「新模型算子要有」,走到「模型专属示例套件与测试资产入库」;配合此前 #3165 确立的「示例即测试」,这条路径的交付形态已经稳定——示例不只是文档,而是被 CI 直接跑的正确性资产。


一、核心项目进展

窗口总览:主仓 1 笔合入(k 池链,见今日重点)、1 个需求单与 1 笔新 PR(SM120 线)以及两笔队列条目推进;TileOPs 1 笔大合入(迁移)、3 笔新开 PR 与 2 份夜间快照。

1.1 主仓:SM120 块缩放 GEMM 补齐寄存器驻留与奇数 warp 网格,需求单到补丁 21 分钟(09-21)

日期:2026-09-20 至 2026-09-21 来源tilelang #3256 SM120 块缩放 GEMM 需求单#3257 SM120 fragment 与奇数 warp 网格#2253 SM120 块缩放 MMA 与 SageAttention3

窗口后段(09-21 凌晨)主仓出现一条「需求单到补丁」的直线:01:22 需求单 #3256 创建(SageAttention3 把低频 MMA 宏换成 T.gemm_blockscaled 被两个限制卡住——不支持 fragment A 与共享 B 的操作数作用域;M=N=K=128、256 线程下 FullRow 加紧凑缩放的逐 warp 1x8 MMA 原子网格被拒);01:43 补丁 #3257 即开出,同一作者(sepcnt)、6 文件 +252/-42:支持 SM120 块缩放 GEMM 的 fragment A 与行主序缩放 fragment、修复奇数逐 warp 原子网格(含 8x1 分区)的紧凑缩放,并补下降与正确性测试;同一时段 #2253(SageAttention3 主线大 PR)更新。需求单自带验证条件:在合入 #3254 后的 main eab74a4a 上、torch 2.11.0+cu130、sm_120a 环境实测。

判读:21 分钟的间隔说明这条线的作者对问题边界已有完整把握;SM120(新一代消费与工作站 GPU)的块缩放 GEMM 正从「能用」向「满足具体注意力内核的形态要求」推进,路线由 SageAttention3 的实际需求牵引。

1.2 主仓评审队列:前端 Python 可迭代与 CPU OpenMP 两笔跨周条目推进(09-20)

日期:2026-09-20 来源#3230 前端支持 Python 可迭代与推导式#3109 CPU 网格循环 OpenMP 并行

两笔队列条目在窗口内更新(均未合入):#3230(09-15 创建,09-20 23:42 更新)让前端接受 Python 可迭代对象与推导式作为循环边界;#3109(08-28 创建,09-20 21:56 更新)为 CPU 后端补网格循环的 OpenMP 并行。两者分别指向前端易用性与 CPU 路径,均为跨周推进的长队列条目。另:#3245(CUDA 代码生成前的 GEMM 数据类型拦截)与 #3247(Tile IR 后端,草稿)窗口内无更新。

1.3 TileOPs:稠密 Gated DeltaNet 预填充迁移合入,净删约 900 行(09-20)

日期:2026-09-20 来源TileOPs #2144 迁移稠密 Gated DeltaNet 预填充

09-20 21:29 合入,19 文件、+2102/-3003(净 -901),作者 superAngGao,属线性注意力统一化工作(#2143)的一步:把 Hopper 的 BTHD 稠密预填充流水线接进统一算子 GatedDeltaNetFwdOp,实现拆入 gated_deltanet/prefill/(入口、公共 lowering 与缓存、状态校正、融合前向四层);旧的 GatedDeltaNetPrefillFwdKernel 直接从内核清单移除、不留兼容别名(发布前清理),新名为 GatedDeltaNetDensePrefillFwdKernel

范围与验证:本阶段仅支持等长、零初始状态、H==HV、K==V==128 的预填充(解码、首状态、GVA、变长等留作后续);H200、SM 锁频 1500 兆赫兹:Gated DeltaNet 5 项测试通过;6 个清单基准用例与 FLA 逐项对照通过,BF16 输出最大绝对误差 1.37e-4、FP32 末状态 2.31e-3;端到端 0.3855 毫秒对 FLA 0.5435(S=4096,1.41 倍)、0.5224 对 1.5384(S=32768,2.94 倍)。

判读:这是把「迁移」当发布前清理来做的样本——删旧内核、统一 ABI、清理清单,代价是 decode 等能力要在后续窗口补齐;算子库的接口收敛按「先统一、后补全」推进。

1.4 TileOPs:roofline 清单自查——175 个算子中 88 个声明公式从未被运行(09-20/09-21)

日期:2026-09-20 至 2026-09-21 来源TileOPs #2158 让清单公式与实际运行公式合一并重新计数

09-20 07:29 新开、09-21 06:55 仍在更新(57 文件、+2965/-980、20 笔提交,未合入)。这笔把「度量可信」的治理推进到公式层:roofline 字段本应是公式的单一来源、eval_roofline() 是其唯一求值面——两者当时都不成立。盘点结果:175 个已实现算子中,代码生成服务 77 个,其余 98 个带着作者手写方法,其中 88 个清单里的公式从未执行;16 个内联条目根本无法求值(引用了变量层从未绑定的名字);结构预言机只检查了 14 个算子,其余 161 个以「PENDING」列出且不给理由。

公式本身的错误也成批列出,摘录几例:Conv3d 前向按当前内核的暂存缓冲计价(67,330,176 对 25,276,416);RoPE 系列 7 个算子把算子自有的 cos/sin 表计入(34,611,200 对 33,562,624);Mamba2 前向漏计 final_states;DeltaNetAutograd 共用前向公式、多计 5 个常驻自动微分上下文的张量(21,135,360 对 8,421,376);分页 GQA 前向把 fp8 缓存按查询 dtype 计价(2,550,153,796 对 1,442,857,548);批归一化漏计 mutated 写入与参数梯度;分组矩阵乘把每组的元数据多计等。

判读:上一窗口是「公式对语义负责(#2155)、测量对物理原理负责(#1996)、数据对溯源负责(#2154)」三连;本笔把同一把尺子对准公式资产本身——先证明「跑的那份」就是「写的那份」,再谈快慢。对一个要被当作上游依赖的算子库,这是把信用基础从「看起来对」翻到「算得出、对得上」的关键一步。

1.5 TileOPs:变长 GQA 归并与 W4A16 GEMV 提速两笔新开(09-20)

日期:2026-09-20 来源TileOPs #2160 变长 GQA 内核迁移到统一算子#2159 W4A16 W4 GEMV 提速

#2160(09-20 11:55 创建,17 文件 +638/-1232,未合入):把 16 位常规与滑窗口变长内核迁入 GroupedQueryAttentionVarlenFwdOp,并移除两个被取代的公共算子;请求长度与瓦片归属改由 GPU 侧从 cu_seqlens 推导(total_q/total_kv 保持 TileLang 动态维度);公共结果对齐稠密 GQA(只返回 o);全遮掩行确定性输出 0。验证:H200 上 GQA 套件 71 项通过(稠密与反向 41、变长 30)、冒烟 19、编译边界 6、CUPTI 单项 0.0699 毫秒,另有 roofline、清单与内核映射 54 项。作者注明不做性能声明——这是一笔迁移归并。

#2159(09-20 11:05 创建,2 文件 +87/-38,草稿):W4A16 的 W4 GEMV 在 H200 上从 28.83 微秒降到 23.84 微秒(1.21 倍);做法是每个输出行交给一个 warp、在 K 维保留 FP32 累加、以 warp shuffle 收尾;仅对实测形状在 SM90 启用。作者如实写明「相对最快的 Marlin 基线仍慢 9.4%,本笔保持草稿」。

判读:两笔延续 TileOPs 的两条主线——接口收敛(统一算子、删旧)与性能小步补差(不达标先标注差距、不进主线)。

1.6 夜间快照:连续两份零失败,#2144 并入后再增 6 个基准用例(09-20/09-21)

日期:2026-09-20 至 2026-09-21 来源TileOPs-nightly 快照分支快照环境元数据

窗口内夜间流水线出两份快照:09-20 08:02 为 0bedc999(#1996)生成——正确性 1118 项、失败 0、跳过 2;基准 1040 项、失败 0、跳过 3。09-21 02:38 为 f8c4081c(#2144 合入)生成——正确性持平(1118,零失败),基准增至 1046 项、失败 0、跳过 3(新增 6 个用例来自迁移并入的清单基准)。环境元数据与上期一致:H200、CUDA 13.2、驱动 595.71.05、功耗上限 700 瓦、SM 1500 兆赫兹、内存时钟 3201 兆赫兹、TileLang 0.1.11 加代号版本、torch 2.13.0。

判读:两日两次零失败说明新合入内容均被正确覆盖;基准用例数随合入单调增长,夜间流水线正在稳定承担「合入后验证」职责。


二、多后端适配(昇腾 / 海光 / 沐曦 / 摩尔线程)

2.1 昇腾:单日 11 笔合入,FP32 行归约与同步修复为最大一笔(09-20)

日期:2026-09-20 来源tilelang-ascend #1753 FP32 行归约与同步修复#1804 行切片拷贝 stride 修复#1809 block_sparse_mqa_attn 异步读写修复#1621 mhc_pre 算子示例

昇腾仓在 09-20 迎来一个批量合入日:默认分支(ascendc_pto)单日落地 11 笔(09:36 至 16:29),分三组:

  • 最大一笔 #1753(16:29 合入,72 文件、+10117/-3618、26 笔提交):为编译期形状已知的 FP32 输入提供逐行 max/min/sum 实现,并修复两类自动同步缺陷——同一数据上较早的读写记录被后来的读取挤掉;循环执行零次、一次、嵌套时等待处理不完整。另含输出切片越界、threads=2 暂存不足等修复。T.reduce_max/min/sum 接口不变。
  • 正确性修复组:#1804(14:26 合入,2 文件 +335/-14,修 #1263)修复行切片场景下 compute_strideN 把整个缓冲大小当成行距的错误——C2 (8388608, 128) 行切片得到 2 的 30 次方级 stride,在 910B2 上因 uint16 截断造成数据损坏,补 13 个用例;#1809 修复 block_sparse_mqa_attn 示例的 CV 异步读写超时问题(修 #1665)。
  • 算子与文档组:#1621 新增 NPU 侧 mhc_pre 算子示例;fredrekelthen 单日文档系列 6 笔(sort、topk、transpose、add/sub/mul/div、max/min、select 的 docstring 精修 + dtype 覆盖测试 + API 文档),另有 atomic_add 文档补齐(#1587)。

判读:一天内把「一项大特性 + 一组正确性修复 + 一轮 API 文档补齐」全部落地,是该仓迄今最密集的合入日;文档系列 6 笔来自同一作者、格式统一,像把某个批次的收口工作一次做完。

2.2 昇腾:批量合入的验证尾巴——定时任务失败,两条跟进 PR 开出(09-20/09-21)

日期:2026-09-20 至 2026-09-21 来源昇腾每日测试失败单 #1817#1816 纯 Vector 算子自动 C/V 归属#1815 PTO V2C LEFT_RIGHT 串行化

批量合入的代价在窗口后段显现:09-21 06:01(北京时间)的每日测试报告为工作流级失败(对应 04:23 启动、运行于 #1753 合入点 5e6e1dfb 上的定时工作流)。此前一次通过报告是 09-20 05:30 的 1936/1936——对应的是合入潮之前的基线。

两条跟进 PR 已在窗口内开出:#1816(09-20 18:36 创建,作者 platelett)说明 #1753 开始严格检查 Cube 与 Vector 执行归属后,受影响的纯 Vector 算子与测试需要开启 TL_ASCEND_AUTO_CV_COMBINE 由编译器自动补作用域,并清理过时的测试前提;#1815(09-20 11:17 创建,作者 zwh1025)修 PTO 的 Vector 到 Cube TILE_LEFT_RIGHT 拆分在每 AIV 行宽非 32 字节整数倍时的并发 partial-write 冲突(修 #1661,Atlas A3 与 fp16 K=16 场景曾出现 NaN 与 Inf)。

判读:大合入日之后,「合入、定时验证、跟进修复」的链条在正常运转,但两个跟进单都不是新功能,而是合入引发的连带修正——单日 1.1 万行规模的合入把验证风险一并带进了下游分支。

2.3 海光:HCU 示例支持 PR 开出,示例分支同步建立(09-20)

日期:2026-09-20 来源tilelang-hygon #11 启用 TileLang 示例支持

19:51(北京时间)仓库新建 tilelang-examples 分支,20:02 新 PR #11 开出(作者 zy3223,26 文件 +1072/-143,未合入):适配 autotune 与 LDS 配置、解决内核布局冲突、GEMM 改用 HCU 矩阵核心内建指令、补回归覆盖。与 #10(09-17 合入的 MLS 缓冲存储与 prefer_async 流水)连起来看,海光侧正处于「把 TileLang 示例套件在 HCU 上跑通」的阶段。

2.4 MLIR 昇腾:Mamba 算子与 agent 流水线模型选择(09-20)

日期:2026-09-20 来源tilelang-mlir-ascend #187 TileOPs 报告设施#188 Mamba 算子与 per-agent 模型选择

MLIR 昇腾适配仓窗口内落地两笔(作者均为 lhw):#187(10:10 落地,约 +5.4 千/-112 行、40 个文件)把 TileOPs 的基准与报告设施带进仓库——报告 JSON/MD/HTML、Ascend 侧 profile 脚本与报告测试等;#188(12:29 落地,约 +4.2 千/-68 行、36 个文件)新增优化后的 Mamba 算子,并引入「按 agent 选择模型」的流水线配置(.agents/ 演化日志与 .opencode/agents/ 角色定义同步更新,含 Mamba 基准)。

判读:这个仓库的动作像是在用 AI agent 流水线批量开发与适配算子(模式库、陷阱库、复现用例都在版本库里),Mamba 与报告设施是这条流水线的产出样本;对「agent 化算子开发」方向,这里是目前生态内较激进的实践样本之一。

2.5 沐曦、摩尔线程、Sunrise:窗口内无新提交(09-17 / 09-18)

日期:2026-09-17 至 2026-09-18(各自最近推送) 来源tilelang-metaxtilelang-musatilelang-sunrise

三家窗口内均无提交:沐曦最近推送 09-17,摩尔线程 09-17,Sunrise 最新动作仍是 09-18 上午建立候选分支 candidate/20126-public-release-pilot(无后续提交)。各仓标签未更新。


三、生态与采用方

3.1 采用方:TileKernels 与 FlashQLA 窗口内无推送(04-23 / 09-18)

日期:2026-09-21(核查) 来源TileKernelsFlashQLA

窗口内两家采用方无推送:TileKernels 最近推送仍停在 04-23;FlashQLA 上次推送为 09-18(三笔 SM100/SM120 相关合入,已由周末两期覆盖)。采用方一侧自周五后进入静默。

3.2 社区项目:TileLang-TPU 推进算能 TPU 侧的 ChunkScan 落地(09-20)

日期:2026-09-20 来源TileLang-TPU 仓库

一个社区项目在窗口内两次提交:为算能加速器扩展 TileLang 的 TPU 后端(target="tpu"、pcie 与 cmodel 两种模式、ppl_* 系列 DSL 内建、JIT 全流程),正把与 Mamba2 相关的 ChunkScan 分块扫描算子往 BM1690 上带——两次提交分别是 cmodel 流水与 BM1690 PCIe 硬件验证。项目星标少、属早期探索,但方向值得记录:TileLang 的第三方后端正向更多国产芯片线延伸。


四、社区、教程与活动

4.1 文档站:主仓与 TileOPs 文档站各一次自动部署(09-20)

日期:2026-09-20 来源主仓文档站TileOPs 文档站

主仓文档站 17:10 一次「Update docs」自动提交;TileOPs 文档站 07:58 一次 gh-pages 分支部署。均为流水线自动行为,站点内容未见实质变化。

4.2 媒体与学术侧:窗口内零新增(09-21)

日期:2026-09-21 来源Google News RSS(多个中英文查询,走代理)/Hacker NewsarXiv

Google News 中英文多组查询(TileLang、tile-ai、算子、国产芯片组合等)窗口内零命中;Hacker News 近五日无主题相关条目;arXiv 主题检索最新一篇仍为 07-24 的 TileSight 性能模型论文,窗口内无新预印本。

4.3 版本节奏:主仓 v0.1.14 发布满 19 天,各适配仓标签未动(09-02)

日期:2026-09-02(最近发布) 来源tilelang v0.1.14

主仓最新发布仍为 09-02 的 v0.1.14(已满 19 天);适配仓窗口内无新标签:昇腾 v0.1.2.000(09-09)、MLIR 昇腾 v0.1.2.020(06-11)、摩尔线程 v0.1.14+musa.1(09-11)。


五、趋势观察

5.1 ROCm 线:栈式交付开始收口——一次压缩合入把整套示例带进主线

从 #3250 到 #3254 的栈在上个窗口成链、本窗口由顶笔一次带入主线。栈式 PR 的效率在这里得到体现:评审看的是链,落地也是整链。遗留问题是链上其余四笔的收尾——内容已在 main,需要以 rebase 或关闭处理,否则队列里会留下四个「名不副实」的开单。

5.2 NVIDIA 线:SM120 进入小时级响应节奏

需求单 #3256(01:22)到补丁 #3257(01:43)间隔 21 分钟、同一作者,并且围绕一个具体下游项目(SageAttention3)的卡点推进。这种「下游需求到当夜补丁」的节奏,说明 SM120 块缩放 GEMM 已有明确的负责人与验证基线(合入后的 main 头、sm_120a、torch 2.11)。

5.3 TileOPs 的信任工程:从读数、判据到公式本身

三天四笔下来(#2155 语义、#1996 物理、#2154 溯源、#2158 公式),度量治理已经把「读出来的数」与「写下来的公式」都翻了一遍。起点只是 8 行带宽异常,治理半径扩大到 175 个算子的公式资产——教训是同一个:指标的可信度不来自「看起来合理」,而来自「运行的那份与声明的那份是同一份」。

5.4 昇腾的批量合入日:收益之外还有验证尾巴

单日 11 笔、最大一笔 72 文件与 1 万行新增之后,定时任务失败与两条跟进 PR 在半天内接连出现——这不是异常,而是大合入的固有成本(严格化改动会影响存量内核与测试前提)。观察点:跟进 PR 合入后定时回归能否恢复全绿、用例数是否从 1936 上移。

5.5 空白与风险点

三点:其一,主仓发版停滞已 19 天,评审队列里跨周条目(#3109、#3230、#2253 等)持续累积;其二,k 池栈内容已在 main 而四笔开单未收尾,存在重复维护风险;其三,昇腾定时回归在批量合入后失败、跟进修复尚未合入——对盯着「每日全绿」信号的下游使用者,本日应视为红。


附:素材与核查说明

信源核查表

信源 核查结果
tile-ai 组织(28 仓库) 窗口内 8 个仓库有推送:tilelang、TileOPs、TileOPs-nightly、tilelang-ascend、tilelang-hygon、tilelang-mlir-ascend、tilelang.github.io、TileOPs.github.io(后两者为站点部署)
主仓 tilelang 默认分支 1 笔合入(#3254,k 池链);新开 1 个需求单(#3256)与 1 笔 PR(#3257);#3230、#3109 有更新;#3245、#3247 无更新
TileOPs 1 笔合入(#2144);新开 3 笔(#2158、#2159、#2160);其余条目窗口内无更新
TileOPs-nightly 两份快照(0bedc999、f8c4081c):基准 1040 增至 1046、正确性 1118,均零失败
昇腾 单日 11 笔合入;定时任务失败(#1817);跟进 PR #1815、#1816 开出
海光 PR #11 开出(示例支持),示例分支建立
MLIR 昇腾 2 笔落地(#187 报告设施、#188 Mamba 算子与 agent 流水线)
沐曦 / 摩尔线程 / Sunrise 窗口内均无提交,标签未更新
采用方 TileKernels、FlashQLA 窗口内无推送
社区项目 TileLang-TPU(算能 BM1690 方向)2 次提交
Google News RSS(中英多组,走代理) 窗口内零新增
Hacker News 近五日无主题命中
arXiv 主题检索最新一篇为 07-24,窗口内无新预印本
文档站 主仓文档站 1 次自动提交、TileOPs 文档站 1 次部署,内容未见实质变化

完整信源清单