TileLang ウィークリーレポート (2026-09-13 ~ 2026-09-20)
レポート期間:2026年9月13日(日)から9月20日(日)まで、計7自然日、ISO第38週に対応 素材情報源:本誌の毎日TileLang動態デイリーレポート4期(09-17、09-18、09-19、09-20);09-14から09-16まではまだデイリーレポートがない(本誌は09-17から試刊)、当該期間はGitHub組織レベルの調査期間確認(tile-ai組織28リポジトリ、168時間)とリポジトリコミットメタデータで補完、詳細は付録を参照
1. 今週のトピックス
- メインリポジトリが CUDA Tile IR 実行バックエンドを開設、1 コミットで 134 ファイル、約 3.6 万行を追加(09-18):新バックエンドは TileLang プログラムを NVIDIA の CUDA Tile IR に降ろし、cuTile ランタイム経由でロードする。現行の「CUDA ソースコードを生成して nvcc に渡す」経路と並行して動作する。変更は JIT、キャッシュ、自動チューニング、2 本のドキュメント、1 本の専用 CI ジョブを同時にカバーしており、実験ブランチではなく路線レベルの変更である。調査期間末に当該 PR はドラフト状態に移行し、まだマージされていない(tilelang #3247)。
- ブロック単位量子化 GEMM が言語層オペレータに昇格、「サイレント降格」経路を削除(09-17):メインリポジトリに
T.gemm_blockscaledと専用バックエンドセレクタを追加し、スケーリングファクタがオペレータの第一級入力となった。当該機能を持たないバックエンドは「稠密 GEMM としてサイレントに実行し、スケーリングファクタが破棄される」からコンパイル失敗へと変更された。ドキュメントサイトにはその後、完全なシグネチャ、動作規約、3 つの命令レベル明示バリアントが補完された(#3237、ドキュメントコミット)。 - ROCm 側 GLM-5.3 疎注意力 k プールが 24 時間以内にチェーン化(09-19 ~ 09-20):同一作者が 4 本のスタック PR を連続して開設し、k プール圧縮とキャッシュ書き込み後のデコード尾部メンテナンス、ページド logits、Top-K 変換、融合選択をカバー、合計約 9.8 千行、40 ファイル。リリース済みモデルの設定契約(2048 token 予算、512 プール)に直接バインドされている。KDA デコードサンプルと DeepSeek V3.2 の FP8 疎 MLA サンプルと併せて、AMD 経路は「新モデルネイティブオペレータの整備」に沿って組織的に推進されている(#3251、#3253、#3254、#3255)。
- TileOPs パフォーマンス三連:バッチ行列積を共有テンプレートに変更、FP8 転置カーネルで短板を補完、MoE 小規模ルーティングが vLLM に対してリード(09-17 ~ 09-19):H200 上でバッチ行列積を共有 GEMM テンプレートに変更後、最高 1.44 倍の高速化、公式ライブラリに対しても遅れを取らない。FP8 バッチ行列積の転置短板はマージアクセスカーネルで補完され、5 つのユースケースで 2.30 から 4.66 倍の高速化。MoE インデックス小規模ルーティング経路は GLM-4.5 4096 token 枠で vLLM に対して 25.85% リード、DeepSeek-V3 枠で 16.03%(#2148、#2153、#2141)。
- メインリポジトリが「サイレントエラーの前倒し」ガバナンスを一巡完了(09-16 ~ 09-20):原子ベクトル幅が目的アドレス計画により決定されるようになり、埋め込み逆伝播などのカーネルが 1.4 から 2.5 倍高速化。非連続目的アドレス上の原子加算はスカラーにフォールバックし、サイレント書き込みエラーと非整列クラッシュの一類を修正。乱数の 3 箇所のサイレント欠陥は独立 PR に分割。サポートされない GEMM 型の組み合わせはコード生成前にインターセプトされる(#3238、#3219、#3242、#3245)。
- 昇騰は全週にわたり高頻度を維持し「デイリーレグレッション全緑」で締めくくり(09-15 ~ 09-20):NSA フォワードとその可変長バージョンが同日にマージ(910B3 上で 19.62 と 20.34 マイクロ秒)。動的量子化、RMSNorm 融合、RoPE がオペレータ面を補完。デイリーレグレッションのケース数は 1919 → 1925 → 1936 → 1936 と 4 日連続で失敗ゼロ、さらにマルチデバイステストシャーディングを開設。調査期間末には mhc_pre サンプルと一批のオペレータドキュメント細部も追加(#1699、#1700、レグレッションレポート #1814)。
- **バックエンド格局に「ディストリビューション
形態:Sunrise S2/TANG が 0.1.14 候補に参入(09-18):tile-ai 組織配下で国産 GPGPU Sunrise S2 向けバックエンド配布リポジトリが発見され、独立リポジトリ・独立バージョン番号(0.1.14+sunrise.1.1.0)・独立 CI を持ち、昇騰適応リポジトリ、海光機能ブランチ、摩尔線程バックポートブランチとともに四種類の適応組織形態を構成している(tilelang-sunrise)。
- 採用側の沈黙が終了:FlashQLA が同日に三件マージ(09-18):通義千問側の TileLang ベースのゲート付き線形注意実装が一度に三件を収束——SM120/SM121 逆方向融合カーネル、SM100 KKT ソルバ占有率、可変長テールブロック非同期パイプライン;エンジニアリングの重心は新アーキテクチャ適応から占有率と境界正確性へ移行(#34)。
2. コアプロジェクトの進展
バージョンとリリース
- メインリポジトリの最新タグは依然
v0.1.14(09-02 リリース)で、調査期間内に新タグはなく、周期末までに 18 日間リリース未実施;マージのペースは収束する一方でレビューキューは蓄積し続けており、本周期で最も顕著なペース特徴となっている。 - 適応リポジトリのタグは調査期間内にいずれも更新なし:昇騰
TileLang-ascend v0.1.2.000-release(09-09)、摩尔線程v0.1.14+musa.1(09-11)、Sunrise 候補ブランチ0.1.14+sunrise.1.1.0;TileOPs は今に至るまでリリース記録がなく、その対外的な状態はドキュメントサイトと夜間スナップショットが担っている。
言語層:オペレータ意味論と API
- ブロック量子化 GEMM(#3237、09-17 マージ):
GemmBlockScaledNodeと言語側T.gemm_blockscaledを新規追加し、ディスパッチはcuda.tcgen05.blockscaled(SM100 ライン)とcuda.mma.blockscaled(SM120 ライン)の二実装を通す;SM100 単一 CTA が SM120 命令パスにヒットする可能性、および非対応バックエンドが黙って稠密 GEMM として実行するという、静かにエラーとなる二箇所の問題を修正(PR)。 - コピー幅のクランプ(#3246、09-18 新規オープン):
T.copyとT.async_copyのマージ幅上限を、実際に到達可能なベクトル幅にクランプするよう変更し、従来の致命的ログに取って代わる——「能力制約」は降級を継続し、「ユーザー意味論エラー」は依然として失敗し、失敗と降級の判断基準が明文化された。 - 256 ビットグローバルメモリアクセスを SM100 以降に限定(#3248、09-19 マージ):SM100 以降のアーキテクチャかつ CUDA 12.9 以上でのみ 256 ビット load/store を発行し、旧アーキテクチャは 128 ビットパスにフォールバックし、pre-SM100 のネガティブテストを追加。
- 非連続な目的アドレス上のアトミック加算はスカラーを保持(#3219、09-16 マージ):
CanVectorizeAtomicTarget事前判定を新規追加し、address_of、tl.access_ptr、tvm_access_ptrの三種の目的アドレス形態をカバー;「全レーンが同一セルに書き込む」がワイドアトミック加算にコンパイルされる静かな書き壊しと、奇数ベースアドレスの未整列クラッシュを修正。 - 乱数三欠陥の分割修正(#3242 / #3243 / #3244、09-17 新規オープン、未マージ):デフォルト乱数系列が x 次元のみで導出されるため二次元スレッドブロックでデータが重複する問題、void 結果のバインド、初期化欠如がエラーを出さない問題——三箇所はいずれも「型としてはコンパイル可能、意味論としてはエラー」という静かな問題に属する。
モデルオペレータとサンプル
- GLM-5.3 スパース注意 k プールチェーン(#3250 ~ #3255、09-19 ~ 09-20、未マージ):四件の積み重ね PR は合計約 9.8 千行、40 ファイルにわたり、k プール圧縮とキャッシュ書き込み、デコード尾部保守、ページド logits、Top-K 変換、融合選択の五環節をカバー;検証は exact-head CI を基準とする(ROCm 7.2 / gfx942、#3251 は 2423 項通過、#3255 は 2435 項通過を報告)。
- KDA デコードサンプル(#3249、09-19 新規オープン):安全ゲート付きのゲート付き線形注意デコード状態サンプルで、出力と状態の一致性、マルチステップ、空状態インデックス、乱序スロットなどの正確性カバレッジを含む。
- DeepSeek V3.2 FP8 スパース MLA フォワードサンプル(#3224、09-16 マージ):Hopper 向けのモデルカバレッジ系貢献で、調査期間前半(デイリーレポート創設前)のマージに属する。
コンパイラとバックエンドパス
- 符号化ループレイアウト単射性証明の復元(#3233、09-18 マージ):v0.1.12 からメインラインまでのリグレッションを修正——
T.Parallelの反復空間が静的と動的の混合(例:(16, n))の場合、パディング付き末尾を持つレイアウトは単射だが全単射ではなく、メインラインは以前「利用可能なレイアウトが見つからない」と直接報告していた。修正では検査待ちの反復写像から逆写像を構築し、定義域上で往復等価性を証明する(関連欠陥単 #2906)。 - CUDA Tile IR 実行バックエンド(#3247、09-18 新規オープン、後にドラフトへ):対象ツールチェーンは CUDA Tile IR 13.4 バインディング、tileiras 13.4、cuTile 1.5。型付き IR、降下と pass のコアは
tilelang/tileirに位置し、JIT、キャッシュ、自動チューニングに接続される。併せて新規 pass 設定項目を追加し、実体化前(キャッシュからの復元経路を含む)に引き続きソース言語の意味検査を実行するために用いる。 - ROCm CI に可搬サンプル検証を接続(#3165、09-19 マージ):ホワイトリストは Seer アテンション、汎用 Top-K、疎 MLA フォワード、テンソルグループ化行列積の四類をカバーし、サンプル自体がリグレッション資産となる——AMD 経路が収束期に入った傍証。
- Metal ラインの補強:32 ビット整数アトミック加算サポート(#3211、09-19 マージ、競合ヒストグラム検証を含む)、GEMM バッファ領域オフセット修正(#3209、09-14 マージ)。「実行時に可変な GEMM 行数」(#3215)はレビュー九日後にクローズされマージされず(09-20)。
- その他の修正:ブールビット反転コード生成修正(#3228、09-16)、制約集合の併合時に先バインド後使用の順序を復元(#3221、09-14)、CPU テストに CPU dialect を導入(#3236、09-16)。
ランタイム、ツールチェーンとテスト
- JIT に uint64 引数型マッピングを補完(#3229、09-17 マージ)、Cython と NVRTC の二つのホストラッパーを整合。
- ランタイムライブラリロード修正(#3227、09-15 マージ):シンボリックリンクインストール形態下でのライブラリロード問題。
- アナライザのタイミングヘルパーを分割しウォールクロック基準を追加(#3234、09-16 マージ)。
- テスト資産の品質向上(#3252、09-20 マージ、+20/-509):CPU と LLVM 両側で重複するコード生成スモークテストと独立した高速数学テストモジュールを削除。「高速数学出力を自身と比較する」という偽アサーションを修正し、
exp10、log2、log10、cos、sin、tanに真の参照実装を補完。
性能
- アトミックベクトル幅を目的アドレスに基づき計画(#3238、09-16 マージ):動的形状が int64 レーンオフセットを導入する以前はループ全体がスカラー化されていた。修正後、埋め込み逆伝播 N=8192/H=4096/V=129280 は 97.90 マイクロ秒から 56.01 マイクロ秒に、N=196608/H=256/V=3000000 は 146.87 から 82.70 マイクロ秒に、シーケンス補助カウントとサムは 18.40 から 12.17 マイクロ秒に短縮、リグレッション基準
example_gqa_bwd_tma_reduce_varlenは約 27% の相対改善。影響を受ける埋め込み逆伝播と可変長アテンション逆伝播は大語彙推論の常駐カーネルである。 - オペレータライブラリ側の性能(BMM / FP8 / MoE)は第 4 節を参照。
レビューキューの観察
- ROCm モデルオペレータはスタックチェーンで推進(#3249 ~ #3255)、自述は「各自のマージまでの先行コミットを含む」であり、連鎖レビューが必要で、いずれか一笔が詰まるとチェーン全体が遅延する。
- 乱数三欠陥(#3242 / #3243 / #3244)と GEMM 型組み合わせインターセプト(#3245)は調査期間中に継続更新、未マージ。Tile IR バックエンド(#3247)はドラフトに転じて静止。
- マージとキューの落差:メインリポジトリのデフォルトブランチは調査期間内に 16 筆のコミット、後段は補完と収口が主で、実質的な増分はレビューキューに集中。
3. マルチバックエンド適配
昇騰(Ascend)
- オペレータ面:NSA フォワード(#1699)と可変長版(#1700)が同日収録——黄金配置 19.62 マイクロ秒、27 例の階層テスト全通過、可変長版は 910B3 上で 20.34 マイクロ秒、21 例全通過。動的量子化(#1688、精度全通過、平均加速比 0.78 倍、性能は依然ベンダーベースラインに劣る)、RMSNorm 動的量子化融合(#1673)、RoPE(#1580)、CrossEntropy ブロードキャスト最適化と FP32 専用パス(09-15)、causal_conv1d_decode デコード分割 AIV ペア(09-15)。
- 品質とリグレッション:デイリーレグレッションテストケース数 1919 → 1925 → 1936 → 1936 連続全通過。比較オペレータドキュメントに dtype カバレッジを補完(#1602)、ベンチマークスクリプトのバッファトークンライフサイクル修正(#1779)。マルチデバイステストシャーディング CI(#1812)新規オープン。
- 調査期間末(09-20 午後):mhc_pre サンプルを新規追加(#1621)。一批の
T.tileオペレータドキュメント細化(sort / topk / transpose / max / min / add / sub / mul / div / select)。行スライス GM から UB コピーの stride 修正。block_sparse_mqa_attn 非同期読み書きタイムアウト修正。 - 判読:昇騰は唯一「毎日可視」の工程リズムを保つバックエンドであり、「能力展開後に品質と保守性へ転換」する段階に入っている。
沐曦(MetaX)
- MACA 非同期コピー GEMM(#156)とテスト修正(#157)が 09-17 にマージされた後はバージョンとテストのメンテナンスに移行し、調査期間の後半は新規コミットがなく、4 社の中で変動幅が最小となった。
海光(Hygon)
- 多段階ストレージ(MLS)のアドレスリベースと非同期パイプラインの引き継ぎが正式にメインブランチへマージされ(#10、19 ファイル、+540/-31)、さらに v0.1.12 バージョンブランチへもバックポートされた(三次元スライススコープレイアウトの修正も併せて取り込み)。開発ブランチにはパイプライン管理の最終コミットも別途存在する。バックエンドコードの変更規模は 4 社の中で最も大きい。
摩尔線程(MUSA)
- 調査期間内のプッシュは
v0.1.12+musa.1バックポートブランチ(MUSA 5.3.0 ドキュメント)にとどまり、メインブランチは 09-11 以降静止しており、より新しいバージョンラインにはまだ追随していない。
その他(Sunrise / tilelang-mlir-ascend)
- Sunrise(S2 / TANG):バックエンドディストリビューションリポジトリは調査期間内にプッシュがあり、候補ブランチのバージョンは
0.1.14+sunrise.1.1.0。S2 は大規模モデル推論向けの国産 GPGPU であり、サンプル面は本体リポジトリと同構造(行列積、FlashAttention、スパースアテンションなど)。 - tilelang-mlir-ascend:調査期間内に 7 件のコミット——CI を昇騰 A3 デバイス runner へ切り替え(#176)、適応型 LayerNorm カーネル(#183)、ベンチマーク修正(#184)、TileOPs マルチヘッドアテンションオペレータの接続(#185)、オペレータレポートと Mamba オペレータの最適化、エージェント単位のモデル選択(#187 / #188、09-20)。
4. エコシステムと採用側
TileOPs(オペレータライブラリ)
- 規模:調査期間内に 23 件のマージ。夜間パイプラインは 3 つのスナップショットが連続してオンラインで、ベンチマーク 1040 項目と正確性 1118 項目が 09-18 以降連続してゼロ失敗。
- 性能:BMM 共有テンプレートは最高 1.44 倍(
torch-cublasに対してすべて劣らない);FP8 BMM 転置カーネルは 2.30 から 4.66 倍(MoE プリフィル 0.8741 から 0.1874 ミリ秒);MoE インデックス小ルーティングは vLLM をリード(GLM-4.5 25.85%、DeepSeek-V3 16.03%、Kimi K2 8.65%);ほかに調査期間前半の FP8 稠密デコード(#2132)、GQA デコード並列度(#2136)、W4A16 デクォンタイズのクロスチャネル共有(#2139)、GemmTemplate の稠密 coop1/coop2 への拡張(#2126)などのマージも参照。 - 契約と構造:マニフェストが複合オペレータ、リソース、nullable 出力をサポート(#2147);ディスパッチとチューニングを分離(#2152);GEMM カーネルをサービス領域ごとに改名、GEMV の 2 バンドを統合(#2156、
kernel_mapの旧キーはサイレントフォールバックから構築期エラーへ変更);ページド KV ヘルパーをグループ化クエリアテンションモジュールから移動(#2150);SM90 形状を補完(#2151);スパース MLA ギャザーの境界外を封じ込め(#2149);Gated DeltaNet オペレータの統一(#2135)と稠密 GDN プリフィルの移行(#2144)。 - メトリクスガバナンス:ルーティングエキスパートの課金式を修正——夜間に報告された 8 行の帯域異常(読み取り値は最高 132.4 TB/s、H200 の物理上限の約 27 倍)は「全エキスパートで課金」に由来(#2155);バイト監査を読み取り側のみに変更(#1996);性能履歴ウィンドウをスナップショットブランチへ移行(#2154)。3 件が同日に着地し、まず判定を信頼できるものにし、そのうえで速さを論じる。
- 新規:グループ化 GEMM のテールブロック分割と、呼び出し側によるパディング行レイアウトの宣言を許可(#2157)、CUTLASS のグループ化カーネルに正面から追随(従来は 6.4% 差)。
採用側と関連リポジトリ
- FlashQLA(通義千問):3 件のマージ(SM120/SM121 逆方向融合カーネル、SM100 KKT ソルバ占有率、可変長テールブロック非同期パイプライン)、その後は調査期間内にプッシュなし;それ以前の数日間も静かで、パルス的なレビューリズムに属する。
- TileKernels(深度求索):調査期間内にプッシュなし(最近は 04-23);メディア側の DeepSeek エンジニアが AI によるカーネル記述を評価した報道(09-16/17)は TileKernels を背景とする(純粋に TileLang で書かれたカーネルライブラリで、ゲーティング、混合エキスパートルーティング、量子化、転置、2 種類の接続オペレータをカバー)。
- TileRT:7 週連続で静止(最近は 08-13)、現在のリストの中で最も長く静かなもの。
- TileFoundry / DeepStack:それぞれ 2 件(パーサーとコード整理、09-14/15)と 1 件(修正とサンプル、09-15)のコミット。
5. コミュニティ、チュートリアル、イベント
- ドキュメントサイト:メインリポジトリのドキュメントサイトロボットが再生成(387 ファイル、09-17)。分塊量子化 GEMM の完全なシグネチャ、動作規約、および三つの命令レベル明示的バリアントが公開 API ページに掲載;TileOPs ドキュメントサイトは二度のサイトデプロイ(内容は不変)、併せて統一ディスパッチとコンパイル境界の更新に追随(中英二套のドキュメント)。
- コミュニティツール:サードパーティ TileSight 性能分析ドキュメントリポジトリが公開(09-17/18)。TileLang の性能分析を TileSight のキャッシュとパイプライン分析インターフェースに接続し、性能問題を六分類し、「モデル予測 / ランタイム観測 / 証拠不足」の三種の結論強度を区別することを要求;対応する arXiv 性能モデル論文(07-24、調査期間外の背景)。
- メディア:NeoTeo が DeepSeek エンジニアの公開判断を報道——6 から 12 ヶ月以内に AI が書くカーネルは個人の水準に達するか超える可能性がある(09-16/17);華為全聯接大会 2026(09-17)で昇騰 960 の前倒しリリースと Atlas 960 超ノードのロードマップを公布、昇騰適応リズムの産業背景を構成。
- 学術とコミュニティ:調査期間内に arXiv と Hacker News のいずれもテーマの新規ヒットなし;直近のテーマプレプリントは 07-24 の性能モデリング論文。
- バージョンリズム:メインリポジトリ v0.1.14 は満 18 日間更新なし、各適応リポジトリのタグは不動(詳細は第 2 節)。
6. トレンド観察
- NVIDIA 側に第二の実行経路が出現:Tile IR バックエンドと現行の CUDA コード生成経路が並行し、TileLang の抽象レベルが NVIDIA 自身のタイルレベル抽象と正面から接壤し始めた。成熟すれば、その価値提案は部分的に「より良いコード生成」から「より完全なプログラム表現とクロスバックエンド一貫性」へ移行し、スケジューリングとレイアウトの決定権の帰属が長期的な議題となる。
- 「静かなエラーをコンパイル期の失敗へ前倒し」がプロジェクト級の規律となり、判断基準も明確化:メインリポジトリ(原子ベクトル化、乱数、GEMM 型、レイアウト証明)と TileOPs(誤ったキー伝播のエラー報告、ディスパッチとチューニングの分離)が同構;メインリポジトリは同時に「能力制約」と「ユーザー意味エラー」の二類の失敗を区別——前者は降級して継続(コピー幅のクランプ)、後者はコンパイル失敗。
- バックエンド適応と「新モデル原生オペレータ」が深く結合:ROCm の GLM-5.3 k プールチェーンと KDA、昇騰の NSA と DeepSeek 系構造、メインリポジトリ Hopper 上の DeepSeek V3.2 FP8 スパース MLA——モデルリリース後、その特有オペレータがあるバックエンドでどれだけ速く整うかが、そのバックエンドの成熟度を測る直接指標となりつつある。
- TileOPs が「契約付き、再現可能な対照を持つオペレータ層」へ進化:性能、契約、度量ガバナンスの三線が並行;夜間スナップショットはコミット番号、イメージダイジェスト、クロックと消費電力上限などの再現可能要素を完全に固定し、検収基準が生産可用に近づいている。
- 国産バックエンドのリズム分化、形態多様化:昇騰は日次回帰を維持(唯一毎日可視)、海光は合入と収口、沐曦と摩尔線程はメンテナンスへ移行、Sunrise は「バックエンドディストリビューション」形態で候補に進入;上流の最新能力位置にどれだけ追随できるかで、各社の差が開いている。
- リスクと空白:メインリポジトリのリリース停滞 18 日間とレビューキューの滞留(Tile IR のドラフト化、GLM-5.3 スタックチェーン未合、九日間稼働した Metal 提案のクローズ)が併存;性能データはすべて著者またはベンダーの自述であり、本刊は対応ハードウェアを持たず独立再現を実施していない;採用側は全体的に依然として静か(FlashQLA のパルスを除く)。
付録:素材と検証説明
- 素材:本刊の毎日 TileLang 動態デイリーレポート 4 期(09-17、09-18、09-19、09-20)。09-14 から 09-16 はデイリーレポートなし(本刊は 09-17 創刊)、当該区間は GitHub 組織レベルの調査期間検証とコミットメタデータで補完;09-17 の初回は試運行(当日夕方に実行)、09-18 期と約半日の重複があり、重複部分は 09-18 期で状態説明のみを行った。
- 補充検証(168 時間の調査期間、09-13 16:00 から 09-20 16:00):tile-ai 組織 28 リポジトリのプッシュを全量検証——調査期間内に 14 リポジトリにプッシュあり;デフォルトブランチのコミット数:メインリポジトリ tilelang 16 筆、TileOPs 23 筆、昇騰適応リポジトリ 19 筆(
ascendc_ptoブランチ)、tilelang-mlir-ascend 7 筆;リリース状態はリポジトリリリースインターフェースで再確認、メインリポジトリと各適応リポジトリの調査期間内に新バージョンなし。
情報源検証表
| 情報源 | 核查結果 |
|---|---|
| tile-ai 組織(28 リポジトリ) | 調査期間内に 14 リポジトリでプッシュあり |
| メインリポジトリ tilelang | デフォルトブランチ 16 コミット;新規 PR は Tile IR、ROCm モデルオペレータチェーン、乱数と型インターセプトなどのグループをカバー、多くは未マージ |
| TileOPs | 23 件マージ;夜間スナップショットベンチマーク 1040 項、正確性 1118 項が連続ゼロ失敗 |
| tilelang-ascend | ascendc_pto ブランチ 19 コミット;毎日回帰が連続四日全通過;新規タグなし |
| tilelang-mlir-ascend | 調査期間内に 7 コミット |
| 沐曦 / 海光 / 摩尔線程 / Sunrise | 各社の最近のプッシュは 09-17 から 09-18;調査期間後半は新規コミットなし |
| 採用側(FlashQLA / TileKernels) | FlashQLA 09-18 に三件マージ;TileKernels プッシュなし |
| TileRT / 組織のその他リポジトリ | TileRT は連続七週間静止;TileFoundry と DeepStack は各一ないし二件 |
| ニュースと学術チャネル | ニュース検索、技術コミュニティ、プレプリントチャネルは調査期間内にテーマの新規追加なし;唯一のメディア項目は DeepSeek エンジニアの報道 |
| バージョンとリリース | メインリポジトリは v0.1.14(09-02)以降 18 日間リリースなし;各適応リポジトリのタグは動かず |
- 核查境界:昇騰と沐曦の実測データはコミット説明と PR 本文の自述に基づくもので、本誌は対応ハードウェアを持たず、独立した再現は行っていない;産業側の動向は公開報道に基づく;夜間ベンチマークの読み値はすべて単一パイプラインの記録であり、横断評価ではない。
- 次号サイクル提案:2026-09-20 ~ 2026-09-27。