调研窗口:过去 24 小时(2026-09-23 07:00 ~ 2026-09-24 07:00,北京时间)。常规日更窗口,与上一期无重叠。 信源:GitHub(tile-ai 组织 29 个仓库推送核查,窗口内 10 个仓库有推送;主仓两笔缺陷修复合入与新开 NaN 校验单;TileOPs 单日七笔性能合入与九笔新开;TileFoundry 内存分析大笔合入;昇腾两笔示例回退与存储竞态修复方案;MLIR 昇腾与海光各有修复合入;TileSight 新仓首次提交;夜间快照正确性 1141 项零失败)、Google News RSS 中英文多组查询(走代理,零命中)、Hacker News、arXiv、社区仓库核查


本期索引

  • 今日重点:TileSight 正式开源——瓦片中心的分析式性能模型从论文落地为官方仓库(09-23)
  • 一、核心项目进展
    • 1.1 主仓:两笔缺陷修复合入,索引边界修复单当日关闭(09-23)
    • 1.2 主仓:NaN 传播语义浮出水面,编译期校验同日跟进(09-23)
    • 1.3 主仓评审队列:TileIR 后端累积 31 个提交仍在审(09-23)
    • 1.4 TileOPs:单日七笔性能合入,七大子系统全线推进(09-23)
    • 1.5 TileOPs 专题:DeltaNet 推理算子入列,H200 对照 FLA 最高提速 3.7 倍(09-23)
    • 1.6 TileOPs 新开队列:varlen GQA 三连与 W4A16 长 K 流式(09-23)
    • 1.7 TileOPs:外接后端通道治理——38 处设备检查被拆除(09-23)
    • 1.8 TileFoundry:内存足迹与复用窗口合入(09-23)
    • 1.9 夜间快照:正确性 1141 项零失败,DeltaNet 长预填充基准超时(09-24)
  • 二、多后端适配(昇腾 / 海光 / 沐曦 / 摩尔线程等)
    • 2.1 昇腾:两笔 mHC 示例回退(09-23)
    • 2.2 昇腾:标量 GM 存储竞态修复方案提交,差异数归零(09-23)
    • 2.3 昇腾:每日测试 2448 项恢复全通过(09-24)
    • 2.4 MLIR 昇腾:NPU launcher 内存泄漏与流同步修复合入(09-23)
    • 2.5 海光:示例支持合入,37 个文件启用 HCU 矩阵核(09-23)
    • 2.6 沐曦与摩尔线程:仓库无推送,MUSA 治理转入 TileOPs 队列(09-24 核查)
  • 三、生态与采用方
    • 3.1 采用方:TileKernels 与 FlashQLA 窗口内无推送(09-24 核查)
    • 3.2 社区项目:TPU 验证仓与沐曦训练营仓无新提交(09-24 核查)
  • 四、社区、教程与活动
    • 4.1 文档站:主仓文档站例行再生成(09-23)
    • 4.2 媒体与学术侧:Google News 零命中,arXiv 无新预印本(09-24 核查)
    • 4.3 版本节奏:无新发布,主仓 v0.1.14 已满 22 天(09-24)
  • 五、趋势观察
    • 5.1 分析层成形:从论文与社区文档到官方代码仓
    • 5.2 TileOPs 性能季的收口与再出发
    • 5.3 多后端工程债显性化
    • 5.4 空白与风险点
  • 附:素材与核查说明

今日重点:TileSight 正式开源——瓦片中心的分析式性能模型从论文落地为官方仓库

日期:2026-09-23 来源tile-ai/TileSight 仓库首个提交 initarXiv 2607.22432

09-23 22:54(北京时间),tile-ai 组织下新增的 TileSight 仓库完成首次提交 init:177 个文件、约 5.67 万行新增,MIT 许可,提交者为帝国理工学院的 Zhiwen Mo。7 月 24 日 arXiv 论文结尾「将在发表后开源」的承诺至此正式落地;组织仓库总数由 28 增至 29。

TileSight 定位为「瓦片中心」的分析式 GPU 性能模型:以瓦片为建模单元,在 CPU 侧估计算子的操作成本、缓存流量与执行时间——核内建模计算与访存流水线重叠,核间建模缓存层级,跨 GPU 建模节点间通信;实测标定则由 CUDA 与 HIP 探针在目标 GPU 上单独完成,与建模解耦。论文口径的精度:在 A100、H200、B200、B6000 四代平台上,单卡内核延迟的合并平均绝对百分比误差为 12.35%,L2 命中率预测与实测相差约 1 个百分点;扩到 32 卡集群,融合分布式内核与 vLLM 端到端服务的加权误差分别为 16.18% 与 13.52%。

仓库结构(首提范围):

  • tilesight/arch/:20 余份硬件档案,覆盖英伟达 A100/H100/H200/B200/B6000/V100/T4/P100 与 RTX 3090/4090/5090 等、AMD MI50/MI210/MI300X/MI325X、英特尔 Arc 770;
  • tilesight/modeling/:程序前端(构建器/分析/契约)、多级缓存复用距离模型(SDCM)、流水线重叠分析(序言/稳态/尾声、占用率、波量化)、GEMM/FlashAttention(FA3/FA4 周期调度)与 FlashMLA 解码等适配器;
  • micro_benchmark/:CUDA 探针(B200 tcgen05/tmem、H200 wgmma、通用 dram 扫描与 P2P)与 HIP 探针(rocBLAS GEMM、AMD 设备信息);
  • examples/ 与完整测试套件,另含 NCU 对比与 CuTeDSL/私有工具链的预测辅助工具。

判读:这是本主题「性能可解释性」线索的第三段——07-24 论文(帝国理工与 TileLang 核心成员合著)→ 09-18 社区文档仓(把 TileLang 分析接入 TileSight)→ 09-23 官方代码仓。它把此前分散在论文与个人文档里的方法固化为组织项目,与 TileFoundry(编译期内的 IR 分析)形成分工:一个在建模期预测跨层成本,一个在编译期报出缓存容量结论。硬件档案覆盖 AMD 与英特尔独显这一点,也让它天然服务于多后端叙事。


一、核心项目进展

1.1 主仓:两笔缺陷修复合入,索引边界修复单当日关闭(09-23)

日期:2026-09-23 来源#3232#3246#3272

  • #3232(13:54 合入,+196/−14,3 文件):修复「循环目标复用可变标量绑定」问题(缺陷单 #3231 同步关闭)——为循环目标(含元组目标)建立显式绑定,避免把归纳变量写进既有的 alloc_var 或 Ref 绑定,同时保留普通可变赋值与越界检查;配了循环形态、元组目标、过期绑定等回归测试。
  • #3246(11:52 合入,+76/−6,2 文件):T.copyT.async_copy 的合并宽度提示参数 coalesced_width 从「宽度不可整除即致命日志」改为「按可达向量宽度钳制」——把请求当上界,取几何推导宽度的最大可整除因子;发生降级时告警、非正值拒绝;覆盖不规整与超大宽度(8、257)回归;对应缺陷单 #3007 同步关闭。
  • #3272(09-24 凌晨新开、01:49 关闭,未合入):避免把恰好等于有符号类型可表示上限的缓冲索引加宽为 64 位;该单当日关闭,未见说明,若问题仍在需要接续方案。

1.2 主仓:NaN 传播语义浮出水面,编译期校验同日跟进(09-23)

日期:2026-09-23 来源#3270#3273#3205

  • 14:15 缺陷单 #3270reduce_maxreduce_minreduce_absmax 三个归约算子的 nan_propagate=True 在 float32/float64 输出上被静默忽略(float16/bfloat16 有后端支持)。报告人给出完整环境(H800、CUDA 13.1)并指出该行为由降低期按 dtype 决定、而非硬件决定——即同一真实硬件上语义不一致。
  • 09-24 凌晨 03:08 新开 PR #3273:为不支持的输出 dtype 增加编译期报错——诊断信息给出操作名、支持的输出类型与实参 dtype;校验放在原生 ReduceOp 构造器内(跨本地归约、碎片归约与写回累加统一持有累加器 dtype 契约);回归矩阵覆盖三种算子 × clear 两档 × 标志两值 × 五种 dtype;SM100 打包归约回归同步更新为期望同一诊断。
  • 另一条 #3205(NaN 传播 clamp 的设备模板降低修复)窗口内继续更新,仍在评审。

判读:这是「把静默语义错误前移为编译期失败」原则在新数据类型语义上的一次复制——从随机数、布局证明、类型组合延伸到 NaN 传播,且从报告到修复 PR 的响应在半天内完成。

1.3 主仓评审队列:TileIR 后端累积 31 个提交仍在审(09-23)

日期:2026-09-23 来源#3247#3267

  • #3247(CUDA Tile IR 执行后端):窗口内继续有新活动,规模已累积到 31 个提交、+36506/−112 行、139 个文件,仍未合入;从 JIT、缓存、自动调优到文档与 CI 的完整度为先前各窗口之最。
  • #3267tl.LowerMagicDiv 魔法除法)、#3265(启动不变量整数运算下沉)窗口内各有更新,待合入;魔法除法对应的特性请求单 #3261 同步更新。
  • #3243(RNG void 绑定拒绝)、#3205 等修复单保持开启。

队列观察:本窗口主仓延续「小修复盖章、大变更攒料」的节奏——两笔缺陷修复进入主线,评价带宽仍然集中在大件上。

1.4 TileOPs:单日七笔性能合入,七大子系统全线推进(09-23)

日期:2026-09-23 来源#2168#2163 等七笔(完整清单见附录)

13:13 至 18:44(北京时间)之间七笔 PR 相继合入,覆盖 GEMM、Engram、注意力、MoE、Mamba、mHC、线性注意力七个子系统:

  • #2168(13:13):W4A16 GEMM 支持读取预打包权重序(量化部署路径的原生支持);
  • #2173(13:14):Engram 解码步骤拆分为投影与归约两段内核;
  • #2160(16:44):varlen GQA 内核迁入统一算子(重构收口);
  • #2169(16:45):MoE 超额路由按 16 行分组为前导者;
  • #2176(16:46):Mamba DaCumsum 合并 dt 加载、每个块两级扫描;
  • #2177(16:46):mHC 预填充投影沿 K 维拆分;
  • #2163(18:44):DeltaNet 推理算子(见 1.5)。

另有 #2162(varlen GQA 管线与全瓦片掩码探索单)同日关闭、未合入;同作者随后的三笔新开(见 1.6)继续该方向。

1.5 TileOPs 专题:DeltaNet 推理算子入列,H200 对照 FLA 最高提速 3.7 倍(09-23)

日期:2026-09-23 来源#2163

18:44 合入(+743/−3,13 文件):

  • 新增 DeltaNetInferenceFwdOp 与面向 H200 的稠密预填充内核(基于 Gated DeltaNet 的分块求解/递推管线);既有训练 API 与独立解码内核保持不变;支持调用方持有的非零 FP32 初始状态;
  • 当前树内特化覆盖等长 BF16/FP16 预填充、K=V=64 或 128、T≥64 且整除 64 的场景;解码、打包变长与 Q/K L2 归一化列为后续路径,公共推理契约暂为「规格级」;
  • 验证:H200 上推理/GDN/roofline 测试 51 项通过、遗留前向测试 9 项通过;锁频(SM 1500MHz)下与 FLA 的逐用例 A/B(微秒,中位数;busy 为 GPU 活动时间之和,latency 含活动间隙):
B / T / H / D TileOps busy FLA busy TileOps latency FLA latency
2 / 2048 / 4 / 64 44.8 67.1 293.1 497.0
2 / 8192 / 4 / 64 76.5 229.9 306.5 486.5
2 / 16384 / 4 / 64 120.5 448.2 320.6 602.1
1 / 4096 / 16 / 128 116.6 206.8 300.1 494.6

读法:busy 口径最高提速 3.7 倍(T=16384),含间隙的端到端延迟最高降低约 47%;每个用例在计时前都先对输出与终态做对照检查。另需注意:该算子进入夜间基准后,长预填充配置出现一次超时(见 1.9)。

1.6 TileOPs 新开队列:varlen GQA 三连与 W4A16 长 K 流式(09-23)

日期:2026-09-23 来源#2178#2180#2184#2185

  • varlen GQA 三连(20:13 / 22:22 / 09-24 00:27,同作者):预规划调度、调度持久化、局部性与归约改善。方向是把变长 GQA 的工作调度从运行期决定推向「预规划 + 持久化」。
  • W4A16 长 K 流式(09-24 01:02,+482/−234,3 文件):问题陈述给出了完整账本——长 K 解码行 (1, 8192, 81920) 用时 0.1366ms、落后 Marlin 的 0.1261ms(0.92 倍),是 W4A16 一族唯一慢于 Marlin 的负载;单 token 瓦片对每对权重多做一次缩放、长 K 网格 128 个 N 瓦片对应 132 个 SM(4 个 SM 全程闲置)、256 线程瓦片的寄存器拆分(24+240)超过寄存器文件上限且实测会在 setmaxnreg 挂起。改法:组缩放推迟到 FP32 部分和、按真实 M 构建小瓦片、引入 stream-K 网格与独立归约、寄存器拆分改为 32/224。

1.7 TileOPs:外接后端通道治理——38 处设备检查被拆除(09-23)

日期:2026-09-23 来源#2179#2164#2182

背景:社区开发者报告在 MTT S5000 上集成外接 MUSA 后端时,多个官方算子「在注册的外接构造器被调用之前就失败」——三道阻塞:仅 CUDA 的输入校验、拒绝零输入的外接调用、外派前的 CUDA 设备查询(缺陷单 #2164;#2165、#2166 另记测试路径与构建器注册问题)。

窗口内的响应:

  • #2179(+797/−256):拆除算子层约 38 处设备种类检查(RoPE、Dropout、Mamba/SSD、DeltaNet、GLA、NSA、Engram、MoE、FFT、FP8 量化、TopK 等),改由树内内核用 Kernel._require_cuda 在张量层面声明设备;check_tensor_shape 保留形状检查、去掉设备检查;新增 pre-commit 钩子 op-device-kind-lint 阻止设备种类检查回流;为延后构建的调用记录引入 make_call 形参。零输入与复合算子两类需设计决策,列为后续工作。
  • #2182(issue):指出 BuildKernel 协议只承诺可调用对象,而算子层假定更多——存在读取树内内核属性、单条目解包多内核、44 个算子类不接受 target= 参数等情况;协议无法表达的复合条目需要扩展。
  • #2181#2183:把树内测试固定到 BUILTIN 路径并明确 iter_kernels 产出、把二元自动调优测试限定到树内内核,配合上述治理。

判读:外接后端从「能注册」走到「能调度」的最后一段开始铺路;阻塞由外接方实测给出,修复由维护方成组推进,是少见的双边协同节奏。

1.8 TileFoundry:内存足迹与复用窗口合入(09-23)

日期:2026-09-23 来源#179#184#182

  • #179(09-24 00:10 合入,+3207/−539,44 文件):承接两个问题——调用与函数的内存记录有「保留足迹槽」但没有唯一地址的工作集结果;单次迭代的 L2 快照无法回答被复用数据是否驻留。新分析按最终源地址在一个目标波内求并集得出调用/函数足迹;从访问关系推导时间与空间复用轴,报告每个缓冲的驻留窗口、全体缓冲的 holds、复用字节数与对照缓存容量的 fits 结论。实测示例:128×128×64、w12×11、K=16384 的 GEMM 基准报 b holds=176.00MB fits=no(对照 47.68MB 的 L2)——一个具体、可复算的容量结论,而非玩具结果。
  • #184(新开,修复 #182):整数 Binary(MUL) 渲染可能重入范围访问器导致无限递归——改用自底向上维度访问器,区间算术仅用于非仿射乘法。
  • #178(分布式 HIR 对照检查,+1825/−34)关闭、未合入;#172、#168 关闭;#177(传输效率度量)仍开。

1.9 夜间快照:正确性 1141 项零失败,DeltaNet 长预填充基准超时(09-24)

日期:2026-09-24 03:01 来源快照提交环境元数据

  • 快照对应 TileOPs 主分支提交 252a1721,即 #2163 的合入点,覆盖本窗口全部七笔合入;
  • 正确性:1141 项测试、零失败;
  • 基准:1050 项记录(较上一快照 1046 项增加 4 项),零失败,但出现 1 处文件级错误——bench_deltanet.py 的长预填充配置 prefill-long-bfloat16 在 900 秒内无测试启动被终止(堆栈转储已留存)。该基准文件正是随本窗口 DeltaNet 算子进入流水线的;
  • 环境与上一快照一致(H200、CUDA 13.2、SM 1500MHz 锁频、镜像与依赖版本齐备)。

判读:正确性侧全绿;基准侧这处超时提示,新算子从「功能合入」到「基准可承载」之间还有一段成本要标定——停滞发生在测试启动之前,属于编译或初始化阶段的信号,后续窗口需跟踪是否复发。


二、多后端适配(昇腾 / 海光 / 沐曦 / 摩尔线程等)

2.1 昇腾:两笔 mHC 示例回退(09-23)

日期:2026-09-23 来源#1833(回退 #1621)/#1832(回退 #1633)

11:26 与 11:30 两笔回退合入:把此前并入的 mhc_pre 与 mhc_bwd(Sinkhorn 隐式共轭梯度)两个 Ascend NPU 示例撤出主分支。两者进仓均不足三天。该仓近日已连续出现回退动作(09-21 亦有文档与特性回退),示例类贡献的进出频率值得跟踪——是验收标准趋严还是流程摩擦,尚无公开说明。

2.2 昇腾:标量 GM 存储竞态修复方案提交,差异数归零(09-23)

日期:2026-09-23 来源#1834(修复 #1304)

17:04 新开(+557/−1,10 文件),两层修复:

  • 根因分析:同一 GM 缓冲被混合写入——批量拷贝走 MTE3 DMA 直写、尾列标量 SetValue 经写回缓存做读-改-写并延迟写回;行距非 64 字节倍数时相邻行共享缓存行,脏行逐出会覆盖 DMA 已写入的新值;多块内核下竞态跨核发生,而缓存清理与同步指令均为本核作用域,故单靠同步指令修不干净(复现脚本残留 27%)。
  • 第一层(同核):在同步插入环节对「被标量写过的 GM 缓冲」在 MTE3 写前后选择性插入缓存清理与等待;同时把事件号分配改为循环复用(消除模板硬编码 0 号事件与 pass 分配撞车的潜伏死锁)。复现脚本失配数 12,967,510 → 3,496,136(降 73%)。
  • 第二层(改写消除):新增 opt-in pass(默认关闭)——把「连续串行循环内的单条 GM 标量写」改写为 UB 暂存 + 单条 DMA burst,从根源上让脏行不再产生。开启后失配数归零;新增 2 个回归测试通过、113 项既有套件通过、gqa_fwd_varlen 零开销、量化混合内核无劣化。
  • 范围:opt-in;条件写、累加、散射等无法改写为连续 burst 的形态仍有跨核隐患(平台级限制,建议单独跟踪);作者环境为 Ascend910 A3 / CANN 9.0.0。

2.3 昇腾:每日测试 2448 项恢复全通过(09-24)

日期:2026-09-24 06:11 来源#1835

新一轮每日测试报 2448 项全部通过(100%)。前一日的工作流级失败单 #1831 仍处于开启状态,但自动化单已由新结果接续,此前 2.1、2.2 的回退与修复动作是否与该失败单相关,仓库未给出说明。

2.4 MLIR 昇腾:NPU launcher 内存泄漏与流同步修复合入(09-23)

日期:2026-09-23 来源#178

10:50 合入(+215/−92),三处:其一,把 rtMalloc 替换为 torch_npu 流感知的分配路径,张量句柄不再泄漏;其二,统一任务队列发射——全部平台走同一发射处理,移除 910 专用路径与其尾部释放,lambda 捕获由引用改为值捕获(处理可能延迟执行);其三,修复流失步——发射流在调用时解析(对齐 triton-ascend 策略),不再在构建期捕获。另有报告增强单 #192 关闭、未合入;A5 测试同步单 #130 继续开启。

2.5 海光:示例支持合入,37 个文件启用 HCU 矩阵核(09-23)

日期:2026-09-23 来源#11

15:57 合入(+1104/−130,37 文件):适配自动调优与 LDS 配置、解决内核布局冲突、GEMM 改用 HCU 矩阵核内建、补充回归覆盖。承接上一窗口「示例支持 PR 追加 32 文件」的动作,海光线的示例级落地完成合入。

2.6 沐曦与摩尔线程:仓库无推送,MUSA 治理转入 TileOPs 队列(09-24 核查)

日期:2026-09-24 来源tilelang-metaxtilelang-musa

两仓窗口内均无推送(最近分别为 09-21 与 09-17);与之相关的方法论与协议治理已转入 TileOPs 的缺陷单与新 PR(见 1.7)。


三、生态与采用方

3.1 采用方:TileKernels 与 FlashQLA 窗口内无推送(09-24 核查)

日期:2026-09-24 来源TileKernels 仓库FlashQLA 仓库

深度求索 TileKernels 最近推送仍为 04-23;阿里 FlashQLA 为 09-18。两仓窗口内均无新提交。

3.2 社区项目:TPU 验证仓与沐曦训练营仓无新提交(09-24 核查)

日期:2026-09-24 来源ChunkScan-2-TileLang-4-TPUmetax-operator-training

BM1690 多核验证仓最近提交为 09-22,沐曦训练营材料仓最近提交为 09-22,窗口内均无新增。另有社区教程仓窗口内出现一次推送,经核为主分支之外的图表自动化分支动作,非内容更新;个人实验类新仓(3 笔提交)未达收录标准。


四、社区、教程与活动

4.1 文档站:主仓文档站例行再生成(09-23)

日期:2026-09-23 来源tilelang.github.io 提交

14:10 一次例行「Update docs」提交,内容为 tilelang/language/eager/(ast、builder)的 autoapi 页面再生成(+29/−5,7 文件),属代码仓库自动同步。TileOPs 文档站在 08:11 有过一次部署动作,其默认分支无内容变更。

4.2 媒体与学术侧:Google News 零命中,arXiv 无新预印本(09-24 核查)

日期:2026-09-24 来源Google NewsHacker NewsarXiv

中英文多组查询窗口内零命中;Hacker News 无主题相关条目;arXiv 主题检索最新一篇仍为 07-24 的 TileSight 论文(本窗口其对应代码已在组织内开源,见今日重点),窗口内无新预印本。

4.3 版本节奏:无新发布,主仓 v0.1.14 已满 22 天(09-24)

日期:2026-09-24 来源tilelang 发布页

主仓最新标签仍为 v0.1.14(09-02 发布),已满 22 天,逼近此前两次发布的间隔(约 30 天);TileOPs 仍无发布记录;昇腾、MLIR 昇腾、摩尔线程仓标签停在 09-09 至 09-11 一线;TileFoundry 最新发布为 v0.0.2(09-10)。窗口内全组织没有任何新发布或新标签。


五、趋势观察

5.1 分析层成形:从论文与社区文档到官方代码仓

TileSight 的三段式落地(07-24 论文 → 09-18 社区文档仓 → 09-23 官方代码仓)说明:围绕 TileLang 的性能可解释性正在从「个人线索」升格为「组织项目」。它与 TileFoundry(编译内分析,本窗口把缓存容量结论做到可复算)方向交错。对生态的含义:在算子库与运行时之外,分析工具的完善程度正在成为 TileLang 相对同类工具链的差异化资产;TileSight 硬件档案覆盖 AMD 与英特尔独显,也为多后端叙事提供建模底座。

5.2 TileOPs 性能季的收口与再出发

单日七笔合入加三笔新开,说明 TileOPs 的性能季并未结束,而是从第一波「算子入列」转入第二波「调度与配置细粒度打磨」:varlen GQA 三连围绕调度规划与持久化,W4A16 围绕寄存器与网格利用率。观察指标:这样的合并节奏需要再持续数个交易日才算稳住,否则仍是脉冲式推进。

5.3 多后端工程债显性化

外接后端的三道阻塞与协议缺口把「多后端可插拔」从愿景拉回工程细节:设备种类检查散落在算子层、构建器协议只保证可调用性、44 个算子类缺少目标参数。好消息是窗口内已有成组的拆弹动作(一次拆除 38 处检查并加 lint 防回潮);按外接方口径,这条通道的完成度将决定第三方后端能否在当前周期跑通官方算子队列。

5.4 空白与风险点

其一,主仓评审积压未解:TileIR 后端 31 个提交、魔法除法与启动不变量继续等待,大变更窗口与发版停滞(22 天)叠加;其二,新算子进入基准即暴露长预填充超时,性能叙事需要在基准层面补齐承载能力;其三,昇腾仓的「合入—回退」节律仍在继续,示例类贡献的验收路径未见公开说明;其四,索引边界修复单当日关闭,若问题仍然存在而无人接续,窄索引类型的边界行为将继续处于悬空状态。


附:素材与核查说明

信源核查表

信源 核查结果
tile-ai 组织(29 仓库) 窗口内 10 个仓库有推送:tilelang、TileOPs、TileOPs-nightly、TileFoundry、TileSight、tilelang-hygon、tilelang-ascend、tilelang-mlir-ascend、tilelang.github.io、TileOPs.github.io
主仓 tilelang 2 笔合入(#3232、#3246);新开 #3273;#3272 当日关闭;新开 issue 2 笔(#3270、#3271);#3247、#3265、#3267、#3243、#3205 等更新
TileOPs 7 笔合入、9 笔新开、1 笔关闭;新开 issue 1 笔(#2182);MUSA 相关 #2164 至 #2166 更新
TileOPs-nightly 1 份快照(11bd1b9c,对应 252a1721 即 #2163 合入点):正确性 1141 项零失败;基准 1050 项、1 处文件级超时
TileFoundry 1 笔合入(#179);新开 #184;新开缺陷单 #182;关闭 #178、#172、#168
TileSight 首次提交(+56675 行、177 文件、MIT)
tilelang-ascend 2 笔回退合入(#1832、#1833);新开 #1834;#1829、#1828、#1815 等更新;每日测试 #1835 全通过
tilelang-mlir-ascend 1 笔合入(#178);#192 关闭;#130 更新
tilelang-hygon 1 笔合入(#11)
沐曦 / 摩尔线程仓库 窗口内无推送(最近 09-21 / 09-17)
采用方(TileKernels、FlashQLA) 窗口内无推送(最近 04-23 / 09-18)
社区仓库 主分支无新增;教程仓推送属图表自动化分支
Google News / Hacker News / arXiv 中英文查询零命中;HN 无相关;arXiv 无新预印本

完整信源清单