TileLang 每日動態報告(2026-09-21)
調研視窗:過去 24 小時(2026-09-20 07:00 ~ 2026-09-21 07:00,北京時間)。本期為常規日更視窗,與上一期無重疊。 信源:GitHub(tile-ai 組織 28 個倉庫推送核查,視窗內 8 個倉庫有推送;主倉 k 池鏈合入逐檔案複核、SM120 需求單與補丁、評審佇列動態;TileOPs 遷移合入、roofline 自查 PR 與兩筆新開 PR、夜間快照雙份 XML 全量解析;昇騰倉 11 筆合入與定時任務失敗事件、兩條跟進 PR;海光示例支援 PR;MLIR 昇騰兩筆落地;文件站部署;採用方與沉默後端核查)、Google News RSS 中英文多組查詢(走代理)、Hacker News、arXiv
本期索引
- 今日重點:GLM-5.3 k 池鏈首筆合入——整套示例與 4 個 AMD 測試進入主線,棧上四筆仍開(09-20)
- 一、核心專案進展
- 1.1 主倉:SM120 塊縮放 GEMM 補齊暫存器駐留與奇數 warp 網格,需求單到補丁僅 21 分鐘(09-21)
- 1.2 主倉評審佇列:前端 Python 可迭代與 CPU OpenMP 兩筆跨周條目推進(09-20)
- 1.3 TileOPs:稠密 Gated DeltaNet 預填充遷移合入,淨刪約 900 行(09-20)
- 1.4 TileOPs:roofline 清單自查——175 個運算元中 88 個宣告公式從未被執行(09-20/09-21)
- 1.5 TileOPs:變長 GQA 歸併與 W4A16 GEMV 提速兩筆新開(09-20)
- 1.6 夜間快照:連續兩份零失敗,#2144 併入後再增 6 個基準用例(09-20/09-21)
- 二、多後端適配(昇騰 / 海光 / 沐曦 / 摩爾執行緒)
- 2.1 昇騰:單日 11 筆合入,FP32 行歸約與同步修復為最大一筆(72 檔案,09-20)
- 2.2 昇騰:批次合入的驗證尾巴——定時任務失敗,兩條跟進 PR 開出(09-20/09-21)
- 2.3 海光:HCU 示例支援 PR 開出,示例分支同步建立(09-20)
- 2.4 MLIR 昇騰:Mamba 運算元與 agent 流水線模型選擇(09-20)
- 2.5 沐曦、摩爾執行緒、Sunrise:視窗內無新提交(09-17/09-18)
- 三、生態與採用方
- 3.1 採用方:TileKernels 與 FlashQLA 視窗內無推送(04-23 / 09-18)
- 3.2 社群專案:TileLang-TPU 推進算能 TPU 側的 ChunkScan 落地(09-20)
- 四、社群、教程與活動
- 4.1 文件站:主倉與 TileOPs 文件站各一次自動部署(09-20)
- 4.2 媒體與學術側:視窗內零新增(09-21)
- 4.3 版本節奏:主倉 v0.1.14 釋出滿 19 天,各適配倉標籤未動(09-02)
- 五、趨勢觀察
- 5.1 ROCm 線:棧式交付開始收口——一次壓縮合入把整套示例帶進主線
- 5.2 NVIDIA 線:SM120 進入小時級響應節奏
- 5.3 TileOPs 的信任工程:從讀數、判據到公式本身
- 5.4 昇騰的批次合入日:收益之外還有驗證尾巴
- 5.5 空白與風險點
- 附:素材與核查說明
今日重點:GLM-5.3 k 池鏈首筆合入——整套示例與 4 個 AMD 測試進入主線
日期:2026-09-20 來源:tilelang #3254 GLM-5.3 k 池 Top-K 變換/合入提交 eab74a4a/kpool 示例 README
09-20 17:06(北京時間)合入,以壓縮方式落地(單父提交),把上一視窗成鏈的 GLM-5.3 k 池系列帶進主線:11 個檔案、+2520/-4。合入內容不是單筆運算元補丁,而是一套完整的可執行資產:
- 示例套件
examples/kpool/:README 說明 + 四個示例,對應 GLM-5.3-Flash 稀疏注意力索引器的全流程——池內 softmax 加權池化、BF16 往返與歸一化 Hadamard-128、逐向量 FP8 量化與 FP32 縮放、寫入呼叫方持有的分頁快取、回讀並計算 32 頭 MQA 加權分數、選擇 512 個池並按每池四 token 展開(另支援令牌表與不規則偏移對映);已釋出特化配置為pool_size=4、head_dim=128。快取契約寫明:生產 vLLM 核心把 FP8 值與 FP32 縮放打包進一段交錯 uint8 分配,示例改用兩個呼叫方張量表達k_cache與scale_cache,FP8 格式隨平臺選擇(pre-gfx950 用e4m3fnuz,gfx950/CUDA 用e4m3fn)。 - AMD 側測試
testing/python/amd/:四筆 ROCm 測試(壓縮、解碼尾部、分頁 FP8 MQA logits、Top-K 變換)。 - 語言層小改:
tilelang/language/fp8.py的determine_fp8_type()與determine_torch_fp8_type()增加device引數——FP8 dtype 選擇從固定裝置 0 改為可指定裝置。
驗證:exact-head CI(run 35428061006)Quick Lint、ROCm、CUDA、Metal、CuTeDSL 全部透過;ROCm 7.2 作業在 MI300X/gfx942 上報 2433 項透過、1852 項跳過。
棧狀態:該筆自述「堆疊於 #3253,包含 #3250、#3251、#3253 直至各自合入」——它是整條棧的頂筆,壓縮合入把棧內容整體帶入 main;截至視窗結束,#3250、#3251、#3253、#3255 四筆仍處未合入狀態,且自 09-19 後無更新,需要維護者以 rebase 或關閉來收尾。
判讀:從 #3250 開出(09-19 清晨)到整鏈內容進入 main(09-20 下午),前後約 34 小時。AMD 側的動作已經從「後端可用」「新模型運算元要有」,走到「模型專屬示例套件與測試資產入庫」;配合此前 #3165 確立的「示例即測試」,這條路徑的交付形態已經穩定——示例不只是文件,而是被 CI 直接跑的正確性資產。
一、核心專案進展
視窗總覽:主倉 1 筆合入(k 池鏈,見今日重點)、1 個需求單與 1 筆新 PR(SM120 線)以及兩筆佇列條目推進;TileOPs 1 筆大合入(遷移)、3 筆新開 PR 與 2 份夜間快照。
1.1 主倉:SM120 塊縮放 GEMM 補齊暫存器駐留與奇數 warp 網格,需求單到補丁 21 分鐘(09-21)
日期:2026-09-20 至 2026-09-21 來源:tilelang #3256 SM120 塊縮放 GEMM 需求單/#3257 SM120 fragment 與奇數 warp 網格/#2253 SM120 塊縮放 MMA 與 SageAttention3
視窗後段(09-21 凌晨)主倉出現一條「需求單到補丁」的直線:01:22 需求單 #3256 建立(SageAttention3 把低頻 MMA 宏換成 T.gemm_blockscaled 被兩個限制卡住——不支援 fragment A 與共享 B 的運算元作用域;M=N=K=128、256 執行緒下 FullRow 加緊湊縮放的逐 warp 1x8 MMA 原子網格被拒);01:43 補丁 #3257 即開出,同一作者(sepcnt)、6 檔案 +252/-42:支援 SM120 塊縮放 GEMM 的 fragment A 與行主序縮放 fragment、修復奇數逐 warp 原子網格(含 8x1 分割槽)的緊湊縮放,並補下降與正確性測試;同一時段 #2253(SageAttention3 主線大 PR)更新。需求單自帶驗證條件:在合入 #3254 後的 main eab74a4a 上、torch 2.11.0+cu130、sm_120a 環境實測。
判讀:21 分鐘的間隔說明這條線的作者對問題邊界已有完整把握;SM120(新一代消費與工作站 GPU)的塊縮放 GEMM 正從「能用」向「滿足具體注意力核心的形態要求」推進,路線由 SageAttention3 的實際需求牽引。
1.2 主倉評審佇列:前端 Python 可迭代與 CPU OpenMP 兩筆跨周條目推進(09-20)
日期:2026-09-20 來源:#3230 前端支援 Python 可迭代與推導式/#3109 CPU 網格迴圈 OpenMP 並行
兩筆佇列條目在視窗內更新(均未合入):#3230(09-15 建立,09-20 23:42 更新)讓前端接受 Python 可迭代物件與推導式作為迴圈邊界;#3109(08-28 建立,09-20 21:56 更新)為 CPU 後端補網格迴圈的 OpenMP 並行。兩者分別指向前端易用性與 CPU 路徑,均為跨周推進的長佇列條目。另:#3245(CUDA 程式碼生成前的 GEMM 資料型別攔截)與 #3247(Tile IR 後端,草稿)視窗內無更新。
1.3 TileOPs:稠密 Gated DeltaNet 預填充遷移合入,淨刪約 900 行(09-20)
日期:2026-09-20 來源:TileOPs #2144 遷移稠密 Gated DeltaNet 預填充
09-20 21:29 合入,19 檔案、+2102/-3003(淨 -901),作者 superAngGao,屬線性注意力統一化工作(#2143)的一步:把 Hopper 的 BTHD 稠密預填充流水線接進統一運算元 GatedDeltaNetFwdOp,實現拆入 gated_deltanet/prefill/(入口、公共 lowering 與快取、狀態校正、融合前向四層);舊的 GatedDeltaNetPrefillFwdKernel 直接從核心清單移除、不留相容別名(釋出前清理),新名為 GatedDeltaNetDensePrefillFwdKernel。
範圍與驗證:本階段僅支援等長、零初始狀態、H==HV、K==V==128 的預填充(解碼、首狀態、GVA、變長等留作後續);H200、SM 鎖頻 1500 兆赫茲:Gated DeltaNet 5 項測試透過;6 個清單基準用例與 FLA 逐項對照透過,BF16 輸出最大絕對誤差 1.37e-4、FP32 末狀態 2.31e-3;端到端 0.3855 毫秒對 FLA 0.5435(S=4096,1.41 倍)、0.5224 對 1.5384(S=32768,2.94 倍)。
判讀:這是把「遷移」當釋出前清理來做的樣本——刪舊核心、統一 ABI、清理清單,代價是 decode 等能力要在後續視窗補齊;運算元庫的介面收斂按「先統一、後補全」推進。
1.4 TileOPs:roofline 清單自查——175 個運算元中 88 個宣告公式從未被執行(09-20/09-21)
日期:2026-09-20 至 2026-09-21 來源:TileOPs #2158 讓清單公式與實際執行公式合一併重新計數
09-20 07:29 新開、09-21 06:55 仍在更新(57 檔案、+2965/-980、20 筆提交,未合入)。這筆把「度量可信」的治理推進到公式層:roofline 欄位本應是公式的單一來源、eval_roofline() 是其唯一求值面——兩者當時都不成立。盤點結果:175 個已實現運算元中,程式碼生成服務 77 個,其餘 98 個帶著作者手寫方法,其中 88 個清單裡的公式從未執行;16 個內聯條目根本無法求值(引用了變數層從未繫結的名字);結構預言機只檢查了 14 個運算元,其餘 161 個以「PENDING」列出且不給理由。
公式本身的錯誤也成批列出,摘錄幾例:Conv3d 前向按當前核心的暫存緩衝計價(67,330,176 對 25,276,416);RoPE 系列 7 個運算元把運算元自有的 cos/sin 表計入(34,611,200 對 33,562,624);Mamba2 前向漏計 final_states;DeltaNetAutograd 共用前向公式、多計 5 個常駐自動微分上下文的張量(21,135,360 對 8,421,376);分頁 GQA 前向把 fp8 快取按查詢 dtype 計價(2,550,153,796 對 1,442,857,548);批歸一化漏計 mutated 寫入與引數梯度;分組矩陣乘把每組的後設資料多計等。
判讀:上一視窗是「公式對語義負責(#2155)、測量對物理原理負責(#1996)、資料對溯源負責(#2154)」三連;本筆把同一把尺子對準公式資產本身——先證明「跑的那份」就是「寫的那份」,再談快慢。對一個要被當作上游依賴的運算元庫,這是把信用基礎從「看起來對」翻到「算得出、對得上」的關鍵一步。
1.5 TileOPs:變長 GQA 歸併與 W4A16 GEMV 提速兩筆新開(09-20)
日期:2026-09-20 來源:TileOPs #2160 變長 GQA 核心遷移到統一運算元/#2159 W4A16 W4 GEMV 提速
#2160(09-20 11:55 建立,17 檔案 +638/-1232,未合入):把 16 位常規與滑視窗變長核心遷入 GroupedQueryAttentionVarlenFwdOp,並移除兩個被取代的公共運算元;請求長度與瓦片歸屬改由 GPU 側從 cu_seqlens 推導(total_q/total_kv 保持 TileLang 動態維度);公共結果對齊稠密 GQA(只返回 o);全遮掩行確定性輸出 0。驗證:H200 上 GQA 套件 71 項透過(稠密與反向 41、變長 30)、冒煙 19、編譯邊界 6、CUPTI 單項 0.0699 毫秒,另有 roofline、清單與核心對映 54 項。作者註明不做效能宣告——這是一筆遷移歸併。
#2159(09-20 11:05 建立,2 檔案 +87/-38,草稿):W4A16 的 W4 GEMV 在 H200 上從 28.83 微秒降到 23.84 微秒(1.21 倍);做法是每個輸出行交給一個 warp、在 K 維保留 FP32 累加、以 warp shuffle 收尾;僅對實測形狀在 SM90 啟用。作者如實寫明「相對最快的 Marlin 基線仍慢 9.4%,本筆保持草稿」。
判讀:兩筆延續 TileOPs 的兩條主線——介面收斂(統一運算元、刪舊)與效能小步補差(不達標先標註差距、不進主線)。
1.6 夜間快照:連續兩份零失敗,#2144 併入後再增 6 個基準用例(09-20/09-21)
日期:2026-09-20 至 2026-09-21 來源:TileOPs-nightly 快照分支/快照環境後設資料
視窗內夜間流水線出兩份快照:09-20 08:02 為 0bedc999(#1996)生成——正確性 1118 項、失敗 0、跳過 2;基準 1040 項、失敗 0、跳過 3。09-21 02:38 為 f8c4081c(#2144 合入)生成——正確性持平(1118,零失敗),基準增至 1046 項、失敗 0、跳過 3(新增 6 個用例來自遷移併入的清單基準)。環境後設資料與上期一致:H200、CUDA 13.2、驅動 595.71.05、功耗上限 700 瓦、SM 1500 兆赫茲、記憶體時鐘 3201 兆赫茲、TileLang 0.1.11 加代號版本、torch 2.13.0。
判讀:兩日兩次零失敗說明新合入內容均被正確覆蓋;基準用例數隨合入單調增長,夜間流水線正在穩定承擔「合入後驗證」職責。
二、多後端適配(昇騰 / 海光 / 沐曦 / 摩爾執行緒)
2.1 昇騰:單日 11 筆合入,FP32 行歸約與同步修復為最大一筆(09-20)
日期:2026-09-20 來源:tilelang-ascend #1753 FP32 行歸約與同步修復/#1804 行切片複製 stride 修復/#1809 block_sparse_mqa_attn 非同步讀寫修復/#1621 mhc_pre 運算元示例
昇騰倉在 09-20 迎來一個批次合入日:預設分支(ascendc_pto)單日落地 11 筆(09:36 至 16:29),分三組:
- 最大一筆 #1753(16:29 合入,72 檔案、+10117/-3618、26 筆提交):為編譯期形狀已知的 FP32 輸入提供逐行 max/min/sum 實現,並修復兩類自動同步缺陷——同一資料上較早的讀寫記錄被後來的讀取擠掉;迴圈執行零次、一次、巢狀時等待處理不完整。另含輸出切片越界、
threads=2暫存不足等修復。T.reduce_max/min/sum介面不變。 - 正確性修復組:#1804(14:26 合入,2 檔案 +335/-14,修 #1263)修復行切片場景下
compute_strideN把整個緩衝大小當成行距的錯誤——C2 (8388608, 128)行切片得到 2 的 30 次方級 stride,在 910B2 上因 uint16 截斷造成資料損壞,補 13 個用例;#1809 修復block_sparse_mqa_attn示例的 CV 非同步讀寫超時問題(修 #1665)。 - 運算元與文件組:#1621 新增 NPU 側
mhc_pre運算元示例;fredrekelthen 單日文件系列 6 筆(sort、topk、transpose、add/sub/mul/div、max/min、select 的 docstring 精修 + dtype 覆蓋測試 + API 文件),另有 atomic_add 文件補齊(#1587)。
判讀:一天內把「一項大特性 + 一組正確性修復 + 一輪 API 文件補齊」全部落地,是該倉迄今最密集的合入日;文件系列 6 筆來自同一作者、格式統一,像把某個批次的收口工作一次做完。
2.2 昇騰:批次合入的驗證尾巴——定時任務失敗,兩條跟進 PR 開出(09-20/09-21)
日期:2026-09-20 至 2026-09-21 來源:昇騰每日測試失敗單 #1817/#1816 純 Vector 運算元自動 C/V 歸屬/#1815 PTO V2C LEFT_RIGHT 序列化
批次合入的代價在視窗後段顯現:09-21 06:01(北京時間)的每日測試報告為工作流級失敗(對應 04:23 啟動、執行於 #1753 合入點 5e6e1dfb 上的定時工作流)。此前一次透過報告是 09-20 05:30 的 1936/1936——對應的是合入潮之前的基線。
兩條跟進 PR 已在視窗內開出:#1816(09-20 18:36 建立,作者 platelett)說明 #1753 開始嚴格檢查 Cube 與 Vector 執行歸屬後,受影響的純 Vector 運算元與測試需要開啟 TL_ASCEND_AUTO_CV_COMBINE 由編譯器自動補作用域,並清理過時的測試前提;#1815(09-20 11:17 建立,作者 zwh1025)修 PTO 的 Vector 到 Cube TILE_LEFT_RIGHT 拆分在每 AIV 行寬非 32 位元組整數倍時的併發 partial-write 衝突(修 #1661,Atlas A3 與 fp16 K=16 場景曾出現 NaN 與 Inf)。
判讀:大合入日之後,「合入、定時驗證、跟進修復」的鏈條在正常運轉,但兩個跟進單都不是新功能,而是合入引發的連帶修正——單日 1.1 萬行規模的合入把驗證風險一併帶進了下游分支。
2.3 海光:HCU 示例支援 PR 開出,示例分支同步建立(09-20)
日期:2026-09-20 來源:tilelang-hygon #11 啟用 TileLang 示例支援
19:51(北京時間)倉庫新建 tilelang-examples 分支,20:02 新 PR #11 開出(作者 zy3223,26 檔案 +1072/-143,未合入):適配 autotune 與 LDS 配置、解決核心佈局衝突、GEMM 改用 HCU 矩陣核心內建指令、補回歸覆蓋。與 #10(09-17 合入的 MLS 緩衝儲存與 prefer_async 流水)連起來看,海光側正處於「把 TileLang 示例套件在 HCU 上跑通」的階段。
2.4 MLIR 昇騰:Mamba 運算元與 agent 流水線模型選擇(09-20)
日期:2026-09-20 來源:tilelang-mlir-ascend #187 TileOPs 報告設施/#188 Mamba 運算元與 per-agent 模型選擇
MLIR 昇騰適配倉視窗內落地兩筆(作者均為 lhw):#187(10:10 落地,約 +5.4 千/-112 行、40 個檔案)把 TileOPs 的基準與報告設施帶進倉庫——報告 JSON/MD/HTML、Ascend 側 profile 指令碼與報告測試等;#188(12:29 落地,約 +4.2 千/-68 行、36 個檔案)新增最佳化後的 Mamba 運算元,並引入「按 agent 選擇模型」的流水線配置(.agents/ 演化日誌與 .opencode/agents/ 角色定義同步更新,含 Mamba 基準)。
判讀:這個倉庫的動作像是在用 AI agent 流水線批次開發與適配運算元(模式庫、陷阱庫、復現用例都在版本庫裡),Mamba 與報告設施是這條流水線的產出樣本;對「agent 化運算元開發」方向,這裡是目前生態內較激進的實踐樣本之一。
2.5 沐曦、摩爾執行緒、Sunrise:視窗內無新提交(09-17 / 09-18)
日期:2026-09-17 至 2026-09-18(各自最近推送) 來源:tilelang-metax/tilelang-musa/tilelang-sunrise
三家視窗內均無提交:沐曦最近推送 09-17,摩爾執行緒 09-17,Sunrise 最新動作仍是 09-18 上午建立候選分支 candidate/20126-public-release-pilot(無後續提交)。各倉標籤未更新。
三、生態與採用方
3.1 採用方:TileKernels 與 FlashQLA 視窗內無推送(04-23 / 09-18)
日期:2026-09-21(核查) 來源:TileKernels/FlashQLA
視窗內兩家採用方無推送:TileKernels 最近推送仍停在 04-23;FlashQLA 上次推送為 09-18(三筆 SM100/SM120 相關合入,已由週末兩期覆蓋)。採用方一側自週五後進入靜默。
3.2 社群專案:TileLang-TPU 推進算能 TPU 側的 ChunkScan 落地(09-20)
日期:2026-09-20 來源:TileLang-TPU 倉庫
一個社群專案在視窗內兩次提交:為算能加速器擴充套件 TileLang 的 TPU 後端(target="tpu"、pcie 與 cmodel 兩種模式、ppl_* 系列 DSL 內建、JIT 全流程),正把與 Mamba2 相關的 ChunkScan 分塊掃描運算元往 BM1690 上帶——兩次提交分別是 cmodel 流水與 BM1690 PCIe 硬體驗證。專案星標少、屬早期探索,但方向值得記錄:TileLang 的第三方後端正向更多國產晶片線延伸。
四、社群、教程與活動
4.1 文件站:主倉與 TileOPs 文件站各一次自動部署(09-20)
日期:2026-09-20 來源:主倉文件站/TileOPs 文件站
主倉文件站 17:10 一次「Update docs」自動提交;TileOPs 文件站 07:58 一次 gh-pages 分支部署。均為流水線自動行為,站點內容未見實質變化。
4.2 媒體與學術側:視窗內零新增(09-21)
日期:2026-09-21 來源:Google News RSS(多箇中英文查詢,走代理)/Hacker News/arXiv
Google News 中英文多組查詢(TileLang、tile-ai、運算元、國產晶片組合等)視窗內零命中;Hacker News 近五日無主題相關條目;arXiv 主題檢索最新一篇仍為 07-24 的 TileSight 效能模型論文,視窗內無新預印本。
4.3 版本節奏:主倉 v0.1.14 釋出滿 19 天,各適配倉標籤未動(09-02)
日期:2026-09-02(最近釋出) 來源:tilelang v0.1.14
主倉最新發布仍為 09-02 的 v0.1.14(已滿 19 天);適配倉視窗內無新標籤:昇騰 v0.1.2.000(09-09)、MLIR 昇騰 v0.1.2.020(06-11)、摩爾執行緒 v0.1.14+musa.1(09-11)。
五、趨勢觀察
5.1 ROCm 線:棧式交付開始收口——一次壓縮合入把整套示例帶進主線
從 #3250 到 #3254 的棧在上個視窗成鏈、本視窗由頂筆一次帶入主線。棧式 PR 的效率在這裡得到體現:評審看的是鏈,落地也是整鏈。遺留問題是鏈上其餘四筆的收尾——內容已在 main,需要以 rebase 或關閉處理,否則佇列裡會留下四個「名不副實」的開單。
5.2 NVIDIA 線:SM120 進入小時級響應節奏
需求單 #3256(01:22)到補丁 #3257(01:43)間隔 21 分鐘、同一作者,並且圍繞一個具體下游專案(SageAttention3)的卡點推進。這種「下游需求到當夜補丁」的節奏,說明 SM120 塊縮放 GEMM 已有明確的負責人與驗證基線(合入後的 main 頭、sm_120a、torch 2.11)。
5.3 TileOPs 的信任工程:從讀數、判據到公式本身
三天四筆下來(#2155 語義、#1996 物理、#2154 溯源、#2158 公式),度量治理已經把「讀出來的數」與「寫下來的公式」都翻了一遍。起點只是 8 行頻寬異常,治理半徑擴大到 175 個運算元的公式資產——教訓是同一個:指標的可信度不來自「看起來合理」,而來自「執行的那份與宣告的那份是同一份」。
5.4 昇騰的批次合入日:收益之外還有驗證尾巴
單日 11 筆、最大一筆 72 檔案與 1 萬行新增之後,定時任務失敗與兩條跟進 PR 在半天內接連出現——這不是異常,而是大合入的固有成本(嚴格化改動會影響存量核心與測試前提)。觀察點:跟進 PR 合入後定時迴歸能否恢復全綠、用例數是否從 1936 上移。
5.5 空白與風險點
三點:其一,主倉發版停滯已 19 天,評審佇列裡跨周條目(#3109、#3230、#2253 等)持續累積;其二,k 池棧內容已在 main 而四筆開單未收尾,存在重複維護風險;其三,昇騰定時迴歸在批次合入後失敗、跟進修復尚未合入——對盯著「每日全綠」訊號的下游使用者,本日應視為紅。
附:素材與核查說明
信源核查表
| 信源 | 核查結果 |
|---|---|
| tile-ai 組織(28 倉庫) | 視窗內 8 個倉庫有推送:tilelang、TileOPs、TileOPs-nightly、tilelang-ascend、tilelang-hygon、tilelang-mlir-ascend、tilelang.github.io、TileOPs.github.io(後兩者為站點部署) |
| 主倉 tilelang 預設分支 | 1 筆合入(#3254,k 池鏈);新開 1 個需求單(#3256)與 1 筆 PR(#3257);#3230、#3109 有更新;#3245、#3247 無更新 |
| TileOPs | 1 筆合入(#2144);新開 3 筆(#2158、#2159、#2160);其餘條目視窗內無更新 |
| TileOPs-nightly | 兩份快照(0bedc999、f8c4081c):基準 1040 增至 1046、正確性 1118,均零失敗 |
| 昇騰 | 單日 11 筆合入;定時任務失敗(#1817);跟進 PR #1815、#1816 開出 |
| 海光 | PR #11 開出(示例支援),示例分支建立 |
| MLIR 昇騰 | 2 筆落地(#187 報告設施、#188 Mamba 運算元與 agent 流水線) |
| 沐曦 / 摩爾執行緒 / Sunrise | 視窗內均無提交,標籤未更新 |
| 採用方 | TileKernels、FlashQLA 視窗內無推送 |
| 社群專案 | TileLang-TPU(算能 BM1690 方向)2 次提交 |
| Google News RSS(中英多組,走代理) | 視窗內零新增 |
| Hacker News | 近五日無主題命中 |
| arXiv | 主題檢索最新一篇為 07-24,視窗內無新預印本 |
| 文件站 | 主倉文件站 1 次自動提交、TileOPs 文件站 1 次部署,內容未見實質變化 |
完整信源清單
- [1] tilelang #3254 GLM-5.3 k 池 Top-K 變換(合入) — https://github.com/tile-ai/tilelang/pull/3254
- [2] tilelang 合入提交 eab74a4a — https://github.com/tile-ai/tilelang/commit/eab74a4ae5
- [3] tilelang k 池示例 README — https://github.com/tile-ai/tilelang/blob/main/examples/kpool/README.md
- [4] tilelang #3256 SM120 塊縮放 GEMM 需求單 — https://github.com/tile-ai/tilelang/issues/3256
- [5] tilelang #3257 SM120 fragment 與奇數 warp 網格 — https://github.com/tile-ai/tilelang/pull/3257
- [6] tilelang #2253 SM120 塊縮放 MMA 與 SageAttention3 — https://github.com/tile-ai/tilelang/pull/2253
- [7] tilelang #3230 前端 Python 可迭代與推導式 — https://github.com/tile-ai/tilelang/pull/3230
- [8] tilelang #3109 CPU 網格迴圈 OpenMP 並行 — https://github.com/tile-ai/tilelang/pull/3109
- [9] tilelang #3255 分頁 k 池融合選擇(未合入) — https://github.com/tile-ai/tilelang/pull/3255
- [10] tilelang #3250 至 #3253 k 池棧(未合入) — https://github.com/tile-ai/tilelang/pull/3250
- [11] TileOPs #2144 稠密 Gated DeltaNet 預填充遷移(合入) — https://github.com/tile-ai/TileOPs/pull/2144
- [12] TileOPs #2158 roofline 清單公式自查 — https://github.com/tile-ai/TileOPs/pull/2158
- [13] TileOPs #2160 變長 GQA 遷移 — https://github.com/tile-ai/TileOPs/pull/2160
- [14] TileOPs #2159 W4A16 W4 GEMV 提速 — https://github.com/tile-ai/TileOPs/pull/2159
- [15] TileOPs-nightly 快照分支 — https://github.com/tile-ai/TileOPs-nightly/commits/snapshots
- [16] TileOPs-nightly 快照環境後設資料 — https://github.com/tile-ai/TileOPs-nightly/blob/snapshots/meta.json
- [17] 昇騰 #1753 FP32 行歸約與同步修復 — https://github.com/tile-ai/tilelang-ascend/pull/1753
- [18] 昇騰 #1804 行切片 stride 修復 — https://github.com/tile-ai/tilelang-ascend/pull/1804
- [19] 昇騰 #1809 block_sparse_mqa_attn 非同步修復 — https://github.com/tile-ai/tilelang-ascend/pull/1809
- [20] 昇騰 #1621 mhc_pre 運算元示例 — https://github.com/tile-ai/tilelang-ascend/pull/1621
- [21] 昇騰 #1587 atomic_add 文件補齊 — https://github.com/tile-ai/tilelang-ascend/pull/1587
- [22] 昇騰文件系列:sort #1562 — https://github.com/tile-ai/tilelang-ascend/pull/1562
- [23] 昇騰文件系列:topk #1584 — https://github.com/tile-ai/tilelang-ascend/pull/1584
- [24] 昇騰文
檔系列:transpose #1590 — https://github.com/tile-ai/tilelang-ascend/pull/1590
- [25] 昇騰文件系列:add/sub/mul/div #1613 — https://github.com/tile-ai/tilelang-ascend/pull/1613
- [26] 昇騰文件系列:max/min #1615 — https://github.com/tile-ai/tilelang-ascend/pull/1615
- [27] 昇騰文件系列:select #1544 — https://github.com/tile-ai/tilelang-ascend/pull/1544
- [28] 昇騰每日測試失敗單 #1817 — https://github.com/tile-ai/tilelang-ascend/issues/1817
- [29] 昇騰 #1816 純 Vector 運算元自動 C/V 歸屬 — https://github.com/tile-ai/tilelang-ascend/pull/1816
- [30] 昇騰 #1815 PTO V2C LEFT_RIGHT 序列化 — https://github.com/tile-ai/tilelang-ascend/pull/1815
- [31] 昇騰每日測試透過單 #1814(09-20,1936 項) — https://github.com/tile-ai/tilelang-ascend/issues/1814
- [32] 海光 #11 啟用 TileLang 示例支援 — https://github.com/tile-ai/tilelang-hygon/pull/11
- [33] MLIR 昇騰 #187 TileOPs 報告設施 — https://github.com/tile-ai/tilelang-mlir-ascend/pull/187
- [34] MLIR 昇騰 #188 Mamba 運算元與 per-agent 模型選擇 — https://github.com/tile-ai/tilelang-mlir-ascend/pull/188
- [35] TileLang-TPU(ChunkScan 到 BM1690) — https://github.com/arcflute/ChunkScan-2-TileLang-4-TPU-bm1690
- [36] TileKernels(採用方,無推送) — https://github.com/deepseek-ai/TileKernels
- [37] FlashQLA(採用方,無推送) — https://github.com/QwenLM/FlashQLA
- [38] tilelang-metax(無推送) — https://github.com/tile-ai/tilelang-metax
- [39] tilelang-musa(無推送) — https://github.com/tile-ai/tilelang-musa
- [40] tilelang-sunrise(無推送) — https://github.com/tile-ai/tilelang-sunrise
- [41] 主倉最新發布 v0.1.14 — https://github.com/tile-ai/tilelang/releases/tag/v0.1.14
- [42] tilelang.github.io(文件站) — https://github.com/tile-ai/tilelang.github.io
- [43] TileOPs.github.io(文件站) — https://github.com/tile-ai/TileOPs.github.io