調査期間:過去24時間(2026-09-20 07:00 ~ 2026-09-21 07:00、北京時間)。本期は通常のデイリー更新期間であり、前号との重複はない。 情報源:GitHub(tile-ai 組織の28リポジトリのプッシュを照合、期間内に8リポジトリでプッシュあり。メインリポジトリの k プールチェーンのマージをファイル単位で再確認、SM120 需求単とパッチ、レビューキューの動向。TileOPs 移行マージ、roofline 自己点検 PR と新規2件の PR、夜間スナップショットの二部構成 XML を全量解析。昇騰リポジトリの11件のマージと定期タスク失敗イベント、2件のフォローアップ PR。海光のサンプル対応 PR。MLIR 昇騰の2件の着地。ドキュメントサイトのデプロイ。採用元と沈黙バックエンドの照合)、Google News RSS の中国語・英語複数クエリ(プロキシ経由)、Hacker News、arXiv


本期インデックス

  • 今日の重点:GLM-5.3 k プールチェーン初のマージ——サンプル一式と AMD テスト4件がメインラインへ、スタック上の4件は依然オープン(09-20)
    1. コアプロジェクトの進展
      • 1.1 メインリポジトリ:SM120 ブロック・スケーリング GEMM がレジスタ常駐と奇数 warp グリッドを補完、需求単からパッチまでわずか21分(09-21)
      • 1.2 メインリポジトリのレビューキュー:フロントエンド Python イテラブルと CPU OpenMP の2件が週を跨いで前進(09-20)
      • 1.3 TileOPs:稠密 Gated DeltaNet プレフィル移行をマージ、純削減約900行(09-20)
      • 1.4 TileOPs:roofline リストの自己点検——175個のオペレータのうち88個が宣言した数式が一度も実行されず(09-20/09-21)
      • 1.5 TileOPs:可変長 GQA 集約と W4A16 GEMV 高速化の2件を新規オープン(09-20)
      • 1.6 夜間スナップショット:2部連続でゼロ失敗、#2144 の統合後にベンチマークケースがさらに6件増加(09-20/09-21)
    1. マルチバックエンド対応(昇騰 / 海光 / 沐曦 / 摩尔線程)
      • 2.1 昇騰:1日で11件マージ、FP32 行リダクションと同期修復が最大の1件(72ファイル、09-20)
      • 2.2 昇騰:バッチマージの検証のしっぽ——定期タスク失敗、フォローアップ PR 2件を起票(09-20/09-21)
      • 2.3 海光:HCU サンプル対応 PR を起票、サンプルブランチも同期して作成(09-20)
      • 2.4 MLIR 昇騰:Mamba オペレータと agent パイプラインモデル選択(09-20)
      • 2.5 沐曦、摩尔線程、Sunrise:期間内に新規コミットなし(09-17/09-18)
    1. エコシステムと採用元
      • 3.1 採用元:TileKernels と FlashQLA は期間内にプッシュなし(04-23 / 09-18)
      • 3.2 コミュニティプロジェクト:TileLang-TPU が算能 TPU 側の ChunkScan 着地を推進(09-20)
    1. コミュニティ、チュートリアル、イベント
      • 4.1 ドキュメントサイト:メインリポジトリと TileOPs のドキュメントサイトが各1回自動デプロイ(09-20)
      • 4.2 メディアとアカデミア側:期間内に新規ゼロ(09-21)
      • 4.3 リリースペース:メインリポジトリ v0.1.14 リリースから満19日、各対応リポジトリのタグは動かず(09-02)
    1. トレンド観察
      • 5.1 ROCm ライン:スタック型デリバリが収束へ——1回の圧縮マージがサンプル一式をメインラインへ
      • 5.2 NVIDIA ライン:SM120 が時間単位の対応リズムへ
      • 5.3 TileOPs の信頼エンジニアリング:読み取り値、判定基準から数式そのものへ
      • 5.4 昇騰のバッチマージ日:利益のほかにも検証のしっぽ
      • 5.5 空白とリスクポイント
  • 付:素材と照合の説明

今日の重点:GLM-5.3 k プールチェーン初のマージ——サンプル一式と AMD テスト4件がメインラインへ

日付:2026-09-20 ソースtilelang #3254 GLM-5.3 k プール Top-K 変換マージコミット eab74a4akpool サンプル README

09-20 17:06(北京時間)にマージ、圧縮方式で着地(単一親コミット)、前期間でチェーンを成した GLM-5.3 k プールシリーズをメインラインへ:11ファイル、+2520/-4。マージ内容は単一のオペレータパッチではなく、実行可能な資産一式である:

  • サンプルスイート examples/kpool/:README 説明 + 四つのサンプル。GLM-5.3-Flash スパースアテンションインデクサーの全流程に対応——プール内 softmax 加重プーリング、BF16 往復と正規化 Hadamard-128、ベクトル単位の FP8 量子化と FP32 スケーリング、呼び出し側が保持するページキャッシュへの書き込み、読み戻して 32 ヘッド MQA 加重スコアを計算、512 プールを選択し各プールあたり四トークンで展開(さらにトークンテーブルと不規則オフセットマッピングをサポート);公開済みの特化配置は pool_size=4head_dim=128。キャッシュの契約にはこう書かれている:本番 vLLM カーネルは FP8 値と FP32 スケーリングを一つのインターリーブされた uint8 割り当てにパックするが、サンプルでは二つの呼び出し側テンソルで k_cachescale_cache を表現するように変更し、FP8 形式はプラットフォームに応じて選択する(pre-gfx950 は e4m3fnuz、gfx950/CUDA は e4m3fn)。
  • AMD 側テスト testing/python/amd/:四つの ROCm テスト(圧縮、デコード尾部、ページ FP8 MQA logits、Top-K 変換)。
  • 言語層の小変更tilelang/language/fp8.pydetermine_fp8_type()determine_torch_fp8_type()device パラメータを追加——FP8 dtype 選択を固定デバイス 0 から指定可能デバイスへ変更。

検証:exact-head CI(run 35428061006)Quick Lint、ROCm、CUDA、Metal、CuTeDSL すべて通過;ROCm 7.2 ジョブは MI300X/gfx942 上で 2433 項目通過、1852 項目スキップを報告。

スタック状態:このコミットの自己記述は「#3253 にスタックされ、#3250、#3251、#3253 がそれぞれマージされるまでを含む」——これはスタック全体の先頭コミットであり、圧縮マージがスタック内容を全体として main に持ち込む;調査期間終了時点で、#3250、#3251、#3253、#3255 の四コミットは依然として未マージ状態にあり、かつ 09-19 以降更新がないため、メンテナが rebase またはクローズで收尾する必要がある。

判読:#3250 の開設(09-19 早朝)からチェーン全体の内容が main に入る(09-20 午後)まで、前後約 34 時間。AMD 側の動きはすでに「バックエンドが利用可能」「新モデルオペレータが必要」から「モデル専属のサンプルスイートとテスト資産のリポジトリ投入」へと進んでいる;これに先立つ #3165 で確立された「サンプル即テスト」と合わせ、この路径のデリバリー形態はすでに安定している——サンプルは単なるドキュメントではなく、CI に直接実行される正確性資産である。


1. コアプロジェクト進展

調査期間総覧:メインリポジトリ 1 コミットのマージ(k プールチェーン、本日の重点参照)、1 件の要件チケットと 1 コミットの新規 PR(SM120 ライン)ならびに 2 件のキュー項目の進展;TileOPs 1 コミットの大型マージ(マイグレーション)、3 コミットの新規 PR と 2 份の夜間スナップショット。

1.1 メインリポジトリ:SM120 ブロックスケール GEMM がレジスタ常駐と奇数 warp グリッドを補完、要件チケットからパッチまで 21 分(09-21)

日付:2026-09-20 から 2026-09-21 情報源tilelang #3256 SM120 ブロックスケール GEMM 要件チケット#3257 SM120 fragment と奇数 warp グリッド#2253 SM120 ブロックスケール MMA と SageAttention3

調査期間の後段(09-21 未明)にメインリポジトリで「要件チケットからパッチ」の直線が現れた:01:22 に要件チケット #3256 を作成(SageAttention3 が低頻度 MMA マクロを T.gemm_blockscaled に置き換える際に二つの制限で阻止された——fragment A と共有 B のオペランドスコープをサポートしない;M=N=K=128、256 スレッド下で FullRow とコンパクトスケーリングの per-warp 1x8 MMA 原子グリッドが拒否された);01:43 にパッチ #3257 が即座に開設され、同一作者(sepcnt)、6 ファイル +252/-42:SM120 ブロックスケール GEMM の fragment A と行優先スケーリング fragment をサポート、奇数 per-warp 原子グリッド(8x1 パーティションを含む)のコンパクトスケーリングを修正し、低下テストと正確性テストを追加;同じ時間帯に #2253(SageAttention3 メインライン大型 PR)が更新。要件チケットには検証条件が付属:#3254 マージ後の main eab74a4a 上、torch 2.11.0+cu130、sm_120a 環境で実測。

判読:21 分の間隔は、この路線の作者が問題の境界をすでに完全に把握していることを示す;SM120(新世代コンシューマーおよびワークステーション GPU)のブロックスケール GEMM は「使える」から「特定のアテンションカーネルの形態要求を満たす」へと進んでおり、路線は SageAttention3 の実際の需要に牽引されている。

1.2 メインリポジトリレビューキュー:フロントエンド Python イテラブルと CPU OpenMP の 2 件の週跨ぎ項目が進展(09-20)

日付:2026-09-20 出典#3230 フロントエンドが Python イテラブルと内包表記をサポート#3109 CPU グリッドループ OpenMP 並列

2 件のキューの項目が調査期間内に更新された(いずれも未マージ):#3230(09-15 作成、09-20 23:42 更新)はフロントエンドがループ境界として Python イテラブルオブジェクトと内包表記を受け入れるようにするもの;#3109(08-28 作成、09-20 21:56 更新)は CPU バックエンドにグリッドループの OpenMP 並列を補うもの。両者はそれぞれフロントエンドの使いやすさと CPU パスを指向しており、いずれも週をまたいで進む長いキューの項目である。その他:#3245(CUDA コード生成前の GEMM データ型インターセプト)と #3247(Tile IR バックエンド、ドラフト)は調査期間内に更新がなかった。

1.3 TileOPs:稠密 Gated DeltaNet プレフィル移行がマージ、正味約 900 行削減(09-20)

日付:2026-09-20 出典TileOPs #2144 稠密 Gated DeltaNet プレフィルの移行

09-20 21:29 にマージ、19 ファイル、+2102/-3003(正味 -901)、作者 superAngGao、線形注意力統一化作業(#2143)の一歩:Hopper の BTHD 稠密プレフィルパイプラインを統一オペレータ GatedDeltaNetFwdOp に接続し、実装を gated_deltanet/prefill/ に分割(エントリ、共通 lowering とキャッシュ、状態補正、融合フォワードの 4 層);旧 GatedDeltaNetPrefillFwdKernel はカーネルマニフェストから直接削除され、互換エイリアスは残さない(リリース前のクリーンアップ)、新名は GatedDeltaNetDensePrefillFwdKernel

範囲と検証:本段階では等長、ゼロ初期状態、H==HV、K==V==128 のプレフィルのみサポート(デコード、初期状態、GVA、可変長などは後続に残す);H200、SM クロック固定 1500 メガヘルツ:Gated DeltaNet の 5 項目テストが通過;6 つのマニフェストベンチマークケースが FLA と項目ごとに照合して通過、BF16 出力の最大絶対誤差 1.37e-4、FP32 最終状態 2.31e-3;エンドツーエンド 0.3855 ミリ秒 対 FLA 0.5435(S=4096、1.41 倍)、0.5224 対 1.5384(S=32768、2.94 倍)。

判読:これは「移行」をリリース前のクリーンアップとして行うサンプルである——旧カーネルを削除し、ABI を統一し、マニフェストを整理する。その代償は decode などの能力を後続の調査期間で補う必要があること;オペレータライブラリのインターフェース収束は「先に統一、後に補完」で進む。

1.4 TileOPs:roofline マニフェストの自己点検——175 オペレータのうち 88 の宣言された公式が一度も実行されていない(09-20/09-21)

日付:2026-09-20 から 2026-09-21 出典TileOPs #2158 マニフェスト公式と実際に実行される公式を合一し再計数

09-20 07:29 に新規オープン、09-21 06:55 時点でなお更新中(57 ファイル、+2965/-980、20 コミット、未マージ)。これは「計測の信頼性」のガバナンスを公式層へと推し進めるもの:roofline フィールドは本来公式の単一の情報源であるべきで、eval_roofline() がその唯一の評価面であるべき——当時はそのどちらも成立していなかった。棚卸しの結果:175 の実装済みオペレータのうち、コード生成が提供するのは 77 で、残り 98 は作者の手書きメソッドを伴い、そのうち 88 のマニフェストの公式が一度も実行されていなかった;16 のインライン項目は根本的に評価不能(変数層で一度も束縛されていない名前を参照);構造オラクルは 14 のオペレータしかチェックしておらず、残り 161 は「PENDING」として理由もなく列挙されていた。

公式自体の誤りもまとめて列挙され、いくつか抜粋する:Conv3d フォワードは現在のカーネルの一時バッファで計上(67,330,176 対 25,276,416);RoPE 系列の 7 オペレータはオペレータ自身の cos/sin テーブルを算入(34,611,200 対 33,562,624);Mamba2 フォワードは final_states の計上を漏らす;DeltaNetAutograd はフォワード公式を共用し、自動微分コンテキストに常駐する 5 つのテンソルを過大計上(21,135,360 対 8,421,376);ページド GQA フォワードは fp8 キャッシュをクエリの dtype で計上(2,550,153,796 対 1,442,857,548);バッチ正規化は mutated 書き込みとパラメータ勾配の計上を漏らす;グループ化行列積は各グループのメタデータを過大計上するなど。

判読:前の調査期間は「公式は意味に責任を持つ(#2155)、計測は物理原理に責任を持つ(#1996)、データは溯源に責任を持つ(#2154)」の三連であった;本項目は同じ物差しを公式資産そのものに向ける——まず「実行されるもの」が「書かれたもの」であることを証明し、それから速さ遅さを語る。上流の依存として扱われるべきオペレータライブラリにとって、これは信用の基盤を「正しく見える」から「計算でき、照合できる」へと転換する鍵となる一歩である。

1.5 TileOPs:可変長 GQA のマージと W4A16 GEMV の高速化の 2 件が新規オープン(09-20)

日付:2026-09-20 ソースTileOPs #2160 可変長 GQA カーネルを統一オペレータへ移行#2159 W4A16 W4 GEMV 高速化

#2160(09-20 11:55 作成、17 ファイル +638/-1232、未マージ):16 ビットの通常およびスライディングウィンドウ可変長カーネルを GroupedQueryAttentionVarlenFwdOp へ移行し、置き換えられた 2 つの公共オペレータを削除。リクエスト長とタイル帰属は GPU 側で cu_seqlens から導出するよう変更(total_q/total_kv は TileLang の動的次元を維持)。公共結果は稠密 GQA に整合(o のみ返す)。全マスク行は決定論的に 0 を出力。検証:H200 上で GQA スイート 71 項合格(稠密と逆方向 41、可変長 30)、スモーク 19、コンパイル境界 6、CUPTI 単項 0.0699 ミリ秒、ほかに roofline、マニフェスト、カーネルマッピング 54 項。著者は性能表明を行わないと明記——これは移行統合の一筆。

#2159(09-20 11:05 作成、2 ファイル +87/-38、ドラフト):W4A16 の W4 GEMV が H200 上で 28.83 マイクロ秒から 23.84 マイクロ秒へ短縮(1.21 倍);手法は各出力行を 1 warp に割り当て、K 次元で FP32 累積を保持し、warp shuffle で締める;実測形状のみ SM90 で有効化。著者は「最速の Marlin ベースライン比では依然 9.4% 遅く、本筆はドラフトのまま維持」と正直に記載。

判読:2 筆は TileOPs の 2 本の主線を継続——インターフェース収束(統一オペレータ、旧削除)と性能の小刻みな補差(基準未達はまず差を注記し、主線に入れない)。

1.6 夜間スナップショット:連続 2 件ゼロ失敗、#2144 マージ後にさらに 6 件のベンチマークケース増(09-20/09-21)

日付:2026-09-20 〜 2026-09-21 ソースTileOPs-nightly スナップショットブランチスナップショット環境メタデータ

調査期間内に夜間パイプラインが 2 件のスナップショットを生成:09-20 08:02 は 0bedc999(#1996)で生成——正確性 1118 項、失敗 0、スキップ 2;ベンチマーク 1040 項、失敗 0、スキップ 3。09-21 02:38 は f8c4081c(#2144 マージ)で生成——正確性は同等(1118、ゼロ失敗)、ベンチマークは 1046 項に増加、失敗 0、スキップ 3(新規 6 ケースは移行統合されたマニフェストベンチマーク由来)。環境メタデータは前回と一致:H200、CUDA 13.2、ドライバ 595.71.05、消費電力上限 700 ワット、SM 1500 メガヘルツ、メモリクロック 3201 メガヘルツ、TileLang 0.1.11 にコードネームバージョン、torch 2.13.0。

判読:2 日間で 2 回のゼロ失敗は、新規マージ内容がいずれも正しくカバーされていることを示す;ベンチマークケース数はマージに伴い単調増加し、夜間パイプラインは「マージ後検証」の責務を安定的に担いつつある。


2. マルチバックエンド適配(昇騰 / 海光 / 沐曦 / 摩尔線程)

2.1 昇騰:単日 11 筆マージ、FP32 行帰約と同期修正が最大の一筆(09-20)

日付:2026-09-20 ソースtilelang-ascend #1753 FP32 行帰約と同期修正#1804 行スライスコピー stride 修正#1809 block_sparse_mqa_attn 非同期読み書き修正#1621 mhc_pre オペレータサンプル

昇騰リポジトリは 09-20 に一括マージ日を迎えた:デフォルトブランチ(ascendc_pto)で単日 11 筆が着地(09:36 〜 16:29)、3 グループに分かれる:

  • 最大の1件 #1753(16:29 マージ、72ファイル、+10117/-3618、26コミット):コンパイル時形状が既知の FP32 入力に対し行単位の max/min/sum 実装を提供し、2種類の自動同期欠陥を修正——同一データ上の古い読み書き記録が後からの読み取りに押し出される問題、ループが零回・一回・ネスト時に待機処理が不完全になる問題。他に出力スライスの範囲外アクセス、threads=2 の一時バッファ不足などの修正を含む。T.reduce_max/min/sum インターフェースは不変。
  • 正確性修正グループ:#1804(14:26 マージ、2ファイル +335/-14、#1263 を修正)行スライス場面で compute_strideN がバッファ全体サイズを行間隔と見なす誤りを修正——C2 (8388608, 128) の行スライスで 2 の 30 乗級の stride が得られ、910B2 上で uint16 切り詰めによりデータ破損を引き起こす問題で、13 件のテストケースを追加;#1809 は block_sparse_mqa_attn 示例の CV 非同期読み書きタイムアウト問題を修正(#1665 を修正)。
  • オペレータとドキュメントグループ:#1621 で NPU 側 mhc_pre オペレータ示例を新規追加;fredrekelthen の単日ドキュメントシリーズ 6 コミット(sort、topk、transpose、add/sub/mul/div、max/min、select の docstring 精修 + dtype カバレッジテスト + API ドキュメント)、さらに atomic_add ドキュメント補完(#1587)。

判読:一日で「一大機能 + 一連の正確性修正 + 一回の API ドキュメント補完」をすべて着地させ、同リポジトリ史上最も密集したマージ日である;ドキュメントシリーズ 6 コミットは同一作者によるもので形式が統一されており、あるバッチの締め作業を一度に片付けた感がある。

2.2 昇騰:バッチマージの検証の尾——定期タスク失敗、2本のフォローアップ PR が起票(09-20/09-21)

日付:2026-09-20 から 2026-09-21 情報源昇騰デイリーテスト失敗票 #1817#1816 純 Vector オペレータの自動 C/V 帰属#1815 PTO V2C LEFT_RIGHT 直列化

バッチマージの代償が調査期間の後半に現れた:09-21 06:01(北京時間)のデイリーテストレポートがワークフローレベルの失敗となった(対応するのは 04:23 起動、#1753 のマージ点 5e6e1dfb 上で実行された定期ワークフロー)。直前の通過レポートは 09-20 05:30 の 1936/1936——対応するのはマージラッシュ前のベースラインである。

2本のフォローアップ PR がすでに調査期間内に起票された:#1816(09-20 18:36 作成、作者 platelett)は #1753 が Cube と Vector の実行帰属を厳格にチェックし始めたことで、影響を受ける純 Vector オペレータとテストが TL_ASCEND_AUTO_CV_COMBINE を有効化してコンパイラにスコープを自動補完させる必要があり、また古くなったテスト前提を整理する必要があると説明;#1815(09-20 11:17 作成、作者 zwh1025)は PTO の Vector から Cube への TILE_LEFT_RIGHT 分割が各 AIV 行幅 32 バイト整数倍でない場合の並行 partial-write 衝突を修正(#1661 を修正、Atlas A3 と fp16 K=16 場面で NaN と Inf が発生していた)。

判読:大マージ日の後、「マージ、定期検証、フォローアップ修正」の連鎖は正常に機能しているが、2本のフォローアップはいずれも新機能ではなく、マージが引き起こした連帯修正である——単日 1.1 万行規模のマージが検証リスクを下流ブランチに持ち込んだ。

2.3 海光:HCU 示例サポート PR が起票、示例ブランチを同期して建立(09-20)

日付:2026-09-20 情報源tilelang-hygon #11 TileLang 示例サポートを有効化

19:51(北京時間)にリポジトリが tilelang-examples ブランチを新規作成、20:02 に新 PR #11 が起票(作者 zy3223、26ファイル +1072/-143、未マージ):autotune と LDS 設定に適配、カーネルレイアウト衝突を解決、GEMM を HCU 行列コア内蔵命令に変更、回帰カバレッジを追加。#10(09-17 マージの MLS バッファストレージと prefer_async パイプライン)と繋げて見ると、海光側は「TileLang 示例スイートを HCU 上で動かす」段階にある。

2.4 MLIR 昇騰:Mamba オペレータと agent パイプラインモデル選択(09-20)

日付:2026-09-20 出典tilelang-mlir-ascend #187 TileOPs レポート施設#188 Mamba オペレータと per-agent モデル選択

MLIR 昇騰適配リポジトリの調査期間内に2件が着地(作者はいずれも lhw):#187(10:10 着地、約 +5.4 千/-112 行、40 ファイル)は TileOPs のベンチマークとレポート施設をリポジトリに取り込み——レポート JSON/MD/HTML、Ascend 側プロファイルスクリプトとレポートテストなど;#188(12:29 着地、約 +4.2 千/-68 行、36 ファイル)は最適化された Mamba オペレータを追加し、「per-agent モデル選択」のパイプライン設定を導入(.agents/ 進化ログと .opencode/agents/ ロール定義を同時更新、Mamba ベンチマークを含む)。

判断:このリポジトリの動きは、AI エージェントパイプラインでオペレータの開発と適配をバッチ処理しているように見える(パターンライブラリ、トラップライブラリ、再現用例はすべてバージョン管理庫内にある)。Mamba とレポート施設はこのパイプラインの産出サンプルである。「エージェント化オペレータ開発」という方向にとって、ここは現在のエコシステム内で最も積極的な実践サンプルの一つである。

2.5 沐曦、摩尔線程、Sunrise:調査期間内に新規コミットなし(09-17 / 09-18)

日付:2026-09-17 から 2026-09-18(各自の直近プッシュ) 出典tilelang-metaxtilelang-musatilelang-sunrise

3社とも調査期間内にコミットなし:沐曦の直近プッシュは 09-17、摩尔線程は 09-17、Sunrise の最新動作は依然として 09-18 午前に候補ブランチ candidate/20126-public-release-pilot を建立したもの(後続コミットなし)。各リポジトリのタグは未更新。


3. エコシステムと採用側

3.1 採用側:TileKernels と FlashQLA は調査期間内にプッシュなし(04-23 / 09-18)

日付:2026-09-21(核查) 出典TileKernelsFlashQLA

調査期間内に採用側2社ともプッシュなし:TileKernels の直近プッシュは依然として 04-23 で停止;FlashQLA の前回プッシュは 09-18(SM100/SM120 関連の3件マージ、週末2期分で既にカバー済み)。採用側は金曜以降、静默状態に入った。

3.2 コミュニティプロジェクト:TileLang-TPU が算能 TPU 側の ChunkScan 着地を推進(09-20)

日付:2026-09-20 出典TileLang-TPU リポジトリ

あるコミュニティプロジェクトが調査期間内に2回コミット:算能アクセラレータ向けに TileLang の TPU バックエンドを拡張(target="tpu"、pcie と cmodel の2モード、ppl_* 系列 DSL ビルトイン、JIT 全フロー)し、Mamba2 関連の ChunkScan 分塊スキャンオペレータを BM1690 に載せようとしている——2回のコミットはそれぞれ cmodel パイプラインと BM1690 PCIe ハードウェア検証である。プロジェクトのスター数は少なく、早期探索の段階だが、方向性は記録に値する:TileLang のサードパーティバックエンドがより多くの国産チップラインへと延伸している。


4. コミュニティ、チュートリアルとイベント

4.1 ドキュメントサイト:メインリポジトリと TileOPs ドキュメントサイトが各1回自動デプロイ(09-20)

日付:2026-09-20 出典メインリポジトリドキュメントサイトTileOPs ドキュメントサイト

メインリポジトリドキュメントサイトは 17:10 に「Update docs」の自動コミットが1回;TileOPs ドキュメントサイトは 07:58 に gh-pages ブランチのデプロイが1回。いずれもパイプラインの自動行為であり、サイト内容に実質的な変化は見られない。

4.2 メディアと学術側:調査期間内に新規ゼロ(09-21)

日付:2026-09-21 出典Google News RSS(複数の中英語クエリ、プロキシ経由)/Hacker NewsarXiv

Google News 中英語の複数クエリ(TileLang、tile-ai、オペレータ、国産チップの組み合わせなど)は調査期間内でヒットゼロ。Hacker News は直近五日間にテーマ関連の項目なし。arXiv のトピック検索では最新の一篇が依然として 07-24 の TileSight 性能モデル論文で、調査期間内に新しいプレプリントはなかった。

4.3 リリースのリズム:メインリポジトリ v0.1.14 のリリースから満 19 日、各適応リポジトリのタグは動かず(09-02)

日付:2026-09-02(最近のリリース) 情報源tilelang v0.1.14

メインリポジトリの最新リリースは依然として 09-02 の v0.1.14(満 19 日)。適応リポジトリは調査期間内に新しいタグなし:昇騰 v0.1.2.000(09-09)、MLIR 昇騰 v0.1.2.020(06-11)、摩尔線程 v0.1.14+musa.1(09-11)。


5. トレンド観察

5.1 ROCm ライン:スタック型デリバリが収束を開始——一度の圧縮マージで一連のサンプルをメインラインへ

#3250 から #3254 までのスタックは前の調査期間でチェーンを形成し、今調査期間にトップのコミットが一度にメインラインへ持ち込んだ。ここでスタック型 PR の効率が発揮される:レビューが見るのはチェーンであり、着地もチェーン全体である。残された課題はチェーン上の残り四件の収尾——内容はすでに main にあり、rebase またはクローズで処理する必要がある。さもなければキューに四つの「名実相伴わない」オープン項目が残ることになる。

5.2 NVIDIA ライン:SM120 が時間単位の応答リズムへ

要件チケット #3256(01:22)からパッチ #3257(01:43)まで間隔 21 分、同一作者であり、かつ具体的な下流プロジェクト(SageAttention3)のボトルネックを中心に進められている。この「下流の要件から当日夜のパッチへ」というリズムは、SM120 ブロックスケーリング GEMM にすでに明確な担当者と検証ベースライン(マージ後の main ヘッド、sm_120a、torch 2.11)があることを示している。

5.3 TileOPs の信頼エンジニアリング:計測値、判定基準から数式そのものまで

三日間で四件(#2155 セマンティクス、#1996 物理、#2154 トレーサビリティ、#2158 数式)を経て、メトリクス治理は「読み取った数」と「書き下した数式」の両方を一通り見直した。出発点はわずか 8 行の帯域異常であり、治理の半径は 175 オペレータの数式資産へと拡大した——教訓は同じ一つ:指標の信頼性は「もっともらしく見える」ことからではなく、「実行されている那份と宣言されている那份が同一である」ことから来る。

5.4 昇騰のバッチマージ日:収益の裏に検証のしっぽ

単日 11 件、最大の一件は 72 ファイルと 1 万行の追加の後、定期タスクの失敗と二件のフォローアップ PR が半日以内に相次いで出現——これは異常ではなく、大規模マージに固有のコストである(厳格化の変更は既存カーネルとテストの前提に影響する)。観察点:フォローアップ PR のマージ後に定期回帰が全緑に回復するか、テストケース数が 1936 から上移するか。

5.5 空白とリスク点

三点:その一、メインリポジトリのリリース停滞はすでに 19 日、レビューキューには週をまたぐ項目(#3109、#3230、#2253 など)が蓄積し続けている。その二、k プールのスタック内容はすでに main にあるが四件のオープン項目が収尾されておらず、重複メンテナンスのリスクが存在する。その三、昇騰の定期回帰はバッチマージ後に失敗し、フォローアップ修正はまだマージされていない——「毎日全緑」のシグナルを注視する下流の使用者にとって、本日は赤と見なすべきである。


付:素材と検証の説明

情報源検証表

情報源 核查結果
tile-ai 組織(28 リポジトリ) 調査期間内に 8 リポジトリでプッシュあり:tilelang、TileOPs、TileOPs-nightly、tilelang-ascend、tilelang-hygon、tilelang-mlir-ascend、tilelang.github.io、TileOPs.github.io(後者 2 つはサイトデプロイ)
主リポジトリ tilelang デフォルトブランチ 1 件マージ(#3254、k プールチェーン);新規 1 件の要件チケット(#3256)と 1 件の PR(#3257);#3230、#3109 に更新あり;#3245、#3247 は更新なし
TileOPs 1 件マージ(#2144);新規 3 件(#2158、#2159、#2160);その他の項目は調査期間内に更新なし
TileOPs-nightly 2 件のスナップショット(0bedc999、f8c4081c):ベンチマーク 1040 から 1046 に増加、正確性 1118、いずれも失敗ゼロ
昇騰 単日 11 件マージ;定時タスク失敗(#1817);フォローアップ PR #1815、#1816 起票
海光 PR #11 起票(サンプルサポート)、サンプルブランチ作成
MLIR 昇騰 2 件着地(#187 レポート基盤、#188 Mamba オペレータと agent パイプライン)
沐曦 / 摩尔線程 / Sunrise 調査期間内はいずれもコミットなし、タグ未更新
採用側 TileKernels、FlashQLA 調査期間内にプッシュなし
コミュニティプロジェクト TileLang-TPU(算能 BM1690 方向)2 回コミット
Google News RSS(中英複数組、プロキシ経由) 調査期間内に新規ゼロ
Hacker News 直近 5 日間でトピックヒットなし
arXiv トピック検索の最新 1 件は 07-24、調査期間内に新規プレプリントなし
ドキュメントサイト 主リポジトリのドキュメントサイト 1 回自動コミット、TileOPs ドキュメントサイト 1 回デプロイ、内容に実質的変化は見られず

完全な情報源リスト

ドキュメントシリーズ:transpose #1590 — https://github.com/tile-ai/tilelang-ascend/pull/1590