報告週期:2026 年 9 月 13 日(週日)至 9 月 20 日(週日),共 7 個自然日,對應 ISO 第 38 周 素材來源:本刊每日 TileLang 動態日報 4 期(09-17、09-18、09-19、09-20);09-14 至 09-16 尚無日報(本刊自 09-17 起試刊),該段由 GitHub 組織級視窗核查(tile-ai 組織 28 個倉庫,168 小時)與倉庫提交後設資料補齊,詳見附錄


一、本週要聞

  1. 主倉開出 CUDA Tile IR 執行後端,一筆提交 134 個檔案、新增約 3.6 萬行(09-18):新後端把 TileLang 程式下沉到 NVIDIA 的 CUDA Tile IR,經 cuTile 執行時裝載,與現行「生成 CUDA 原始碼交 nvcc」的路徑並行;改動同時覆蓋 JIT、快取、自動調優、兩篇文件與一條專用 CI 作業,屬路線級變化而非實驗分支;視窗末該 PR 轉入草稿狀態,尚未合入(tilelang #3247)。
  2. 分塊量化 GEMM 升為語言層運算元,「靜默降級」路徑被移除(09-17):主倉新增 T.gemm_blockscaled 與專用後端選擇器,縮放因子成為運算元的一等輸入;不具備該能力的後端由「按稠密 GEMM 靜默執行、縮放因子被丟棄」改為編譯失敗。文件站隨後補上完整簽名、行為約定與三條指令級顯式變體(#3237文件提交)。
  3. ROCm 側 GLM-5.3 稀疏注意力 k 池在 24 小時內成鏈(09-19 ~ 09-20):同一作者連開四筆堆疊 PR,覆蓋 k 池壓縮與快取寫入之後的解碼尾部維護、分頁 logits、Top-K 變換與融合選擇,合計約 9.8 千行、40 個檔案,直接繫結已釋出模型的配置契約(2048 token 預算、512 池);連同 KDA 解碼示例與 DeepSeek V3.2 的 FP8 稀疏 MLA 示例,AMD 通路正按「新模型原生運算元到位」組織推進(#3251#3253#3254#3255)。
  4. TileOPs 效能三連:批矩陣乘換共享模板、FP8 轉置核心補短板、MoE 小路由對標 vLLM 領先(09-17 ~ 09-19):H200 上批矩陣乘改用共享 GEMM 模板後最高提速 1.44 倍、對官方庫不落後;FP8 批矩陣乘的轉置短板以合併訪存核心補齊,五個用例提速 2.30 至 4.66 倍;MoE 索引小路由路徑在 GLM-4.5 4096 token 檔領先 vLLM 25.85%、DeepSeek-V3 檔 16.03%(#2148#2153#2141)。
  5. 主倉完成一輪「靜默錯誤前移」治理(09-16 ~ 09-20):原子向量寬度改由目的地址規劃後,嵌入反向等核心提速 1.4 至 2.5 倍;原子加在非連續目的地址上退回標量,修掉一類靜默寫錯與未對齊崩潰;隨機數三處靜默缺陷拆分為獨立 PR;不支援的 GEMM 型別組合在程式碼生成前被攔截(#3238#3219#3242#3245)。
  6. 昇騰保持全周高頻並以「每日迴歸全綠」收官(09-15 ~ 09-20):NSA 前向與其變長版本同日入庫(910B3 上 19.62 與 20.34 微秒),動態量化、RMSNorm 融合與 RoPE 補齊運算元面;每日迴歸用例數 1919 → 1925 → 1936 → 1936 連續四日失敗為零,並開出多裝置測試分片;視窗末又補入 mhc_pre 示例與一批運算元文件細化(#1699#1700迴歸報告 #1814)。
  7. **後端格局出現「發行版

」形態:Sunrise S2/TANG 進入 0.1.14 候選(09-18)**:tile-ai 組織下面向國產 GPGPU Sunrise S2 的後端發行版倉庫被發現,獨立建倉、獨立版本號(0.1.14+sunrise.1.1.0)與獨立 CI,與昇騰適配倉、海光特性分支、摩爾執行緒回移植分支共同構成四類適配組織形態(tilelang-sunrise)。

  1. 採用方結束靜默:FlashQLA 同日三筆合入(09-18):通義千問側基於 TileLang 的門控線性注意力實現一次收口三筆——SM120/SM121 反向融合核心、SM100 KKT 解算佔用率、變長尾塊非同步流水;工程重心從新架構適配轉向佔用率與邊界正確性(#34)。

二、核心專案進展

版本與釋出

  • 主倉最新標籤仍為 v0.1.14(09-02 釋出),視窗內無新標籤,至週期末已 18 天未發版;合入節奏收斂而評審佇列持續累積,為本週期最明顯的節奏特徵。
  • 適配倉標籤視窗內均未更新:昇騰 TileLang-ascend v0.1.2.000-release(09-09)、摩爾執行緒 v0.1.14+musa.1(09-11)、Sunrise 候選分支 0.1.14+sunrise.1.1.0;TileOPs 至今無釋出記錄,其對外狀態由文件站與夜間快照承擔。

語言層:運算元語義與 API

  • 分塊量化 GEMM(#3237,09-17 合入):新增 GemmBlockScaledNode 與語言側 T.gemm_blockscaled,分派走 cuda.tcgen05.blockscaled(SM100 線)與 cuda.mma.blockscaled(SM120 線)兩條實現;修正 SM100 單 CTA 可能命中 SM120 指令路徑、以及不支援後端靜默按稠密 GEMM 執行兩處會靜默出錯的問題(PR)。
  • 複製寬度鉗制(#3246,09-18 新開)T.copyT.async_copy 的合併寬度上限改為鉗制到實際可達的向量寬度,取代此前的致命日誌——「能力約束」降級繼續、「使用者語義錯誤」仍然失敗,失敗與降級的判據被寫清。
  • 256 位全域性訪存限定 SM100 及更新架構(#3248,09-19 合入):僅在 SM100 及更新架構且 CUDA 12.9 以上發出 256 位 load/store,舊架構退回 128 位通路,並補 pre-SM100 負向測試。
  • 原子加在非連續目的地址上保持標量(#3219,09-16 合入):新增 CanVectorizeAtomicTarget 前置判定,覆蓋 address_oftl.access_ptrtvm_access_ptr 三種目的地址形態;修復「所有車道寫同一格」被編譯成寬原子加的靜默寫壞與奇數基址未對齊崩潰。
  • 隨機數三缺陷拆分修復(#3242 / #3243 / #3244,09-17 新開,未合入):預設隨機序列只按 x 維推導導致二維執行緒塊取數重複、繫結 void 結果、缺初始化不報錯——三處均屬「型別上能編譯、語義上出錯」的靜默問題。

模型運算元與示例

  • GLM-5.3 稀疏注意力 k 池鏈路(#3250 ~ #3255,09-19 ~ 09-20,未合入):四筆堆疊 PR 合計約 9.8 千行、40 個檔案,覆蓋 k 池壓縮與快取寫入、解碼尾部維護、分頁 logits、Top-K 變換、融合選擇五個環節;驗證以 exact-head CI 為準(ROCm 7.2 / gfx942,#3251 報 2423 項透過、#3255 報 2435 項透過)。
  • KDA 解碼示例(#3249,09-19 新開):帶安全門控的門控線性注意力解碼態示例,含輸出與狀態一致性、多步、空狀態索引、亂序槽位等正確性覆蓋。
  • DeepSeek V3.2 FP8 稀疏 MLA 前向示例(#3224,09-16 合入):面向 Hopper 的模型覆蓋類貢獻,屬視窗前半段(日報創辦前)的合入。

編譯器與後端通路

  • 符號化迴圈佈局單射性證明恢復(#3233,09-18 合入):修復 v0.1.12 至主線之間的迴歸——T.Parallel 迭代空間為靜態與動態混合(如 (16, n))時,帶填充尾部的佈局單射但非雙射,主線此前直接報「找不到可用佈局」;修復從待檢迭代對映構造逆對映並在定義域上證明往返相等(關聯缺陷單 #2906)。
  • CUDA Tile IR 執行後端(#3247,09-18 新開、後轉草稿):目標工具鏈為 CUDA Tile IR 13.4 繫結、tileiras 13.4、cuTile 1.5;帶型別 IR、下沉與 pass 核心位於 tilelang/tileir,並接入 JIT、快取與自動調優;配套新增 pass 配置項,用於啟動物化前(含從快取恢復的路徑)仍執行源語言語義檢查。
  • ROCm CI 接入可移植示例校驗(#3165,09-19 合入):白名單覆蓋 Seer 注意力、通用 Top-K、稀疏 MLA 前向、張量分組矩陣乘四類,示例本身成為迴歸資產——AMD 通路進入收斂期的旁證。
  • Metal 線補強:32 位整數原子加支援(#3211,09-19 合入,含競爭直方圖驗證)、GEMM 緩衝區域偏移修復(#3209,09-14 合入);「執行時可變的 GEMM 行數」(#3215)評審九天後關閉未合入(09-20)。
  • 其他修復:布林位取反程式碼生成修復(#3228,09-16)、約束集合並時恢復先繫結後使用順序(#3221,09-14)、CPU 測試引入 CPU dialect(#3236,09-16)。

執行時、工具鏈與測試

  • JIT 補 uint64 引數型別對映(#3229,09-17 合入),Cython 與 NVRTC 兩條宿主包裝器對齊。
  • 執行時庫載入修復(#3227,09-15 合入):符號連結安裝形態下的庫載入問題。
  • 分析器拆分計時助手並加入掛鐘基準(#3234,09-16 合入)。
  • 測試資產提質(#3252,09-20 合入,+20/-509):刪除 CPU 與 LLVM 兩側重複的程式碼生成冒煙測試與獨立快數學測試模組;修復「拿快數學輸出與自身比較」的假斷言,為 exp10log2log10cossintan 補上真參考實現。

效能

  • 原子向量寬度按目的地址規劃(#3238,09-16 合入):動態形狀此前引入 int64 車道偏移時整個迴圈被標量化;修復後嵌入反向 N=8192/H=4096/V=129280 從 97.90 微秒降至 56.01 微秒、N=196608/H=256/V=3000000 從 146.87 降至 82.70 微秒、序列輔助計數與求和從 18.40 降至 12.17 微秒,迴歸基準 example_gqa_bwd_tma_reduce_varlen 約 27% 相對提升。受影響的嵌入反向與變長注意力反向是大詞表推理的常駐核心。
  • 運算元庫側效能(BMM / FP8 / MoE)見第四節。

評審佇列觀察

  • ROCm 模型運算元以堆疊鏈推進(#3249 ~ #3255),自述「包含前序提交直至各自合入」,需連環評審,任何一筆卡住即拖住整條鏈。
  • 隨機數三缺陷(#3242 / #3243 / #3244)與 GEMM 型別組合攔截(#3245)視窗內持續更新、尚未合入;Tile IR 後端(#3247)轉草稿靜止。
  • 合入與佇列的落差:主倉預設分支視窗內 16 筆提交,後段以補齊與收口為主,實質增量集中在評審佇列。

三、多後端適配

昇騰(Ascend)

  • 運算元面:NSA 前向(#1699)與變長版本(#1700)同日入庫——黃金配置 19.62 微秒、27 例分層測試全過,變長版本在 910B3 上 20.34 微秒、21 例全過;動態量化(#1688,精度全過、平均加速比 0.78 倍,效能仍落後廠商基線)、RMSNorm 動態量化融合(#1673)、RoPE(#1580)、CrossEntropy 廣播最佳化與 FP32 專用路徑(09-15)、causal_conv1d_decode 解碼拆分 AIV 對(09-15)。
  • 質量與迴歸:每日迴歸用例數 1919 → 1925 → 1936 → 1936 連續全透過;對比運算元文件補 dtype 覆蓋(#1602)、基準指令碼緩衝令牌生命週期修復(#1779);多裝置測試分片 CI(#1812)新開。
  • 視窗末(09-20 下午):新增 mhc_pre 示例(#1621);一批 T.tile 運算元文件細化(sort / topk / transpose / max / min / add / sub / mul / div / select);行切片 GM 到 UB 複製 stride 修復;block_sparse_mqa_attn 非同步讀寫超時修復。
  • 判讀:昇騰是唯一保持「每日可見」工程節奏的後端,且進入「能力鋪開後轉向質量與可維護性」的階段。

沐曦(MetaX)

  • MACA 非同步複製 GEMM(#156)與測試修復(#157)於 09-17 合入後轉入版本與測試維護,視窗後半段無新提交,四家中幅度最小。

海光(Hygon)

  • 多級儲存(MLS)地址重基與非同步流水接管正式合入主分支(#10,19 個檔案、+540/-31),並回移植到 v0.1.12 版本分支(另帶入三維切片作用域佈局修復);開發分支另有流水管理收尾提交。後端程式碼改動幅度四家中最重。

摩爾執行緒(MUSA)

  • 視窗內推送落在 v0.1.12+musa.1 回移植分支(MUSA 5.3.0 文件),主分支自 09-11 起靜止,尚未跟進更晚的版本線。

其他(Sunrise / tilelang-mlir-ascend)

  • Sunrise(S2 / TANG):後端發行版倉庫視窗內推送,候選分支版本 0.1.14+sunrise.1.1.0;S2 為面向大模型推理的國產 GPGPU,示例面與主倉同構(矩陣乘、FlashAttention、稀疏注意力等)。
  • tilelang-mlir-ascend:視窗內 7 筆提交——CI 切昇騰 A3 裝置 runner(#176)、自適應 LayerNorm 核心(#183)、基準修復(#184)、TileOPs 多頭注意力運算元接入(#185)、運算元報告與最佳化 Mamba 運算元、逐 agent 模型選擇(#187 / #188,09-20)。

四、生態與採用方

TileOPs(運算元庫)

  • 規模:視窗內 23 筆合入;夜間流水線三個快照連續線上,基準 1040 項與正確性 1118 項自 09-18 起連續零失敗。
  • 效能:BMM 共享模板最高 1.44 倍(對 torch-cublas 全部不落後);FP8 BMM 轉置核心 2.30 至 4.66 倍(MoE 預填充 0.8741 到 0.1874 毫秒);MoE 索引小路由領先 vLLM(GLM-4.5 25.85%、DeepSeek-V3 16.03%、Kimi K2 8.65%);另見視窗前段的 FP8 密集解碼(#2132)、GQA 解碼並行度(#2136)、W4A16 去量化跨通道共享(#2139)與 GemmTemplate 擴充套件至稠密 coop1/coop2(#2126)等合入。
  • 契約與結構:清單支援複合運算元、資源與可空輸出(#2147);分派與調優解耦(#2152);GEMM 核心按服務區域重新命名、GEMV 兩帶合併(#2156,kernel_map 舊鍵由靜默兜底改為構造期報錯);分頁 KV 助手移出分組查詢注意力模組(#2150);SM90 形狀補齊(#2151);稀疏 MLA 聚集越界收口(#2149);統一 Gated DeltaNet 運算元(#2135)與稠密 GDN 預填充遷移(#2144)。
  • 度量治理:路由專家計價公式修復——夜間報出的 8 行頻寬異常(讀數最高 132.4 TB/s,約為 H200 物理上限的 27 倍)源自「按全部專家計費」(#2155);位元組審計改為只看讀側(#1996);效能歷史視窗遷至快照分支(#2154)。三筆同日落地,先讓判定可信、再談快慢。
  • 新開:分組 GEMM 尾塊分塊並允許呼叫方宣告填充行佈局(#2157),正面追趕 CUTLASS 分組核心(此前差 6.4%)。

採用方與相關倉庫

  • FlashQLA(通義千問):三筆合入(SM120/SM121 反向融合核心、SM100 KKT 解算佔用率、變長尾塊非同步流水),隨後視窗內無推送;此前數日靜默,屬脈衝式評審節奏。
  • TileKernels(深度求索):視窗內無推送(最近 04-23);媒體側關於 DeepSeek 工程師評估 AI 寫核心的報道(09-16/17)以 TileKernels 為背景(純用 TileLang 寫成的核心庫,覆蓋門控、混合專家路由、量化、轉置與兩類連線運算元)。
  • TileRT:連續七週靜止(最近 08-13),為當前清單中安靜時間最長者。
  • TileFoundry / DeepStack:分別有兩筆(解析器與程式碼整理,09-14/15)與一筆(修復與示例,09-15)提交。

五、社群、教程與活動

  • 文件站:主倉文件站機器人再生成(387 個檔案,09-17),分塊量化 GEMM 的完整簽名、行為約定與三條指令級顯式變體進入公開 API 頁面;TileOPs 文件站兩次站點部署(內容未變),並已跟隨統一分派與編譯邊界更新(中英兩套文件)。
  • 社群工具:第三方 TileSight 效能分析文件倉公開(09-17/18),把 TileLang 效能分析接到 TileSight 的快取與流水分析介面,效能問題分六類並要求區分「模型預測 / 執行時觀測 / 證據不足」三種結論強度;對應 arXiv 效能模型論文(07-24,視窗外背景)。
  • 媒體:NeoTeo 報道 DeepSeek 工程師公開判斷——6 至 12 個月內 AI 寫出的核心可達到或超過其個人水平(09-16/17);華為全聯接大會 2026(09-17)公佈昇騰 960 提前釋出與 Atlas 960 超節點路線圖,構成昇騰適配節奏的產業背景。
  • 學術與社群:視窗內 arXiv 與 Hacker News 均無主題新增命中;最近一篇主題預印本為 07-24 的效能建模論文。
  • 版本節奏:主倉 v0.1.14 滿 18 天未更新,各適配倉標籤未動(詳見第二節)。

六、趨勢觀察

  1. NVIDIA 側出現第二條執行通路:Tile IR 後端與現行 CUDA 程式碼生成路徑並行,TileLang 的抽象層級開始與 NVIDIA 自家瓷磚級抽象正面接壤。一旦成熟,其價值主張會部分從「更好的程式碼生成」轉向「更完整的程式表達與跨後端一致性」,而排程與佈局決策的歸屬將成為長期議題。
  2. 「靜默錯誤前移為編譯期失敗」成為專案級紀律,且判據已寫清:主倉(原子向量化、隨機數、GEMM 型別、佈局證明)與 TileOPs(傳錯鍵報錯、分派與調優解耦)同構;主倉同時把「能力約束」與「使用者語義錯誤」兩類失敗區分開——前者降級繼續(複製寬度鉗制),後者編譯失敗。
  3. 後端適配與「新模型原生運算元」深度繫結:ROCm 的 GLM-5.3 k 池鏈與 KDA、昇騰的 NSA 與 DeepSeek 繫結構、主倉 Hopper 上的 DeepSeek V3.2 FP8 稀疏 MLA——模型釋出後其特有運算元在某個後端上的到位速度,正成為衡量該後端成熟度的直接指標。
  4. TileOPs 向「帶契約、可復現對照的運算元層」演進:效能、契約、度量治理三線並行;夜間快照把提交號、映象摘要、時鐘與功耗上限等可復現要素固定得完整,驗收口徑正向生產可用靠攏。
  5. 國產後端節奏分化、形態多樣化:昇騰保持日更迴歸(唯一每日可見),海光合入加收口,沐曦與摩爾執行緒轉維護,Sunrise 以「後端發行版」形態進入候選;能跟到上游最新能力位置的程度,各家已拉開差距。
  6. 風險與空白:主倉發版停滯 18 天與評審佇列積壓(Tile IR 轉草稿、GLM-5.3 堆疊鏈未合、執行九天的 Metal 提案關閉)並存;效能資料均為作者或廠商自述、本刊無對應硬體未做獨立復現;採用方整體仍偏靜(除 FlashQLA 脈衝)。

附錄:素材與核查說明

  • 素材:本刊每日 TileLang 動態日報 4 期(09-17、09-18、09-19、09-20)。09-14 至 09-16 無日報(本刊 09-17 創辦),該段以 GitHub 組織級視窗核查與提交後設資料補齊;09-17 首期為試執行(當日傍晚執行),與 09-18 期存在約半日重疊,重疊部分 09-18 期只做狀態說明。
  • 補充核查(168 小時視窗,09-13 16:00 至 09-20 16:00):tile-ai 組織 28 個倉庫推送全量核查——視窗內 14 個倉庫有推送;預設分支提交數:主倉 tilelang 16 筆、TileOPs 23 筆、昇騰適配倉 19 筆(ascendc_pto 分支)、tilelang-mlir-ascend 7 筆;釋出狀態經倉庫釋出介面複核,主倉與各適配倉視窗內均無新版本。

信源核查表

信源 核查結果
tile-ai 組織(28 倉庫) 視窗內 14 個倉庫有推送
主倉 tilelang 預設分支 16 筆提交;新開 PR 覆蓋 Tile IR、ROCm 模型運算元鏈、隨機數與型別攔截等組別,多數未合入
TileOPs 23 筆合入;夜間快照基準 1040 項、正確性 1118 項連續零失敗
tilelang-ascend ascendc_pto 分支 19 筆提交;每日迴歸連續四日全透過;無新標籤
tilelang-mlir-ascend 視窗內 7 筆提交
沐曦 / 海光 / 摩爾執行緒 / Sunrise 各家最近推送為 09-17 至 09-18;視窗後半段均無新提交
採用方(FlashQLA / TileKernels) FlashQLA 09-18 合入三筆;TileKernels 無推送
TileRT / 組織其他倉 TileRT 連續七週靜止;TileFoundry 與 DeepStack 各有一至兩筆
新聞與學術渠道 新聞檢索、技術社群與預印本渠道視窗內均無主題新增;唯一媒體條目為 DeepSeek 工程師報道
版本與釋出 主倉 v0.1.14(09-02)後 18 天未發版;各適配倉標籤未動
  • 核查邊界:昇騰與沐曦的實測資料來自提交說明與 PR 正文自述,本刊無對應硬體、未做獨立復現;產業側動態來自公開報道;夜間基準讀數均為單次流水線記錄,非橫向評測。
  • 下一期週期建議:2026-09-20 ~ 2026-09-27。