レポート期間:2026年9月14日(月)から9月20日(日)まで、計7自然日 素材の出所:本誌の毎日FlagOS動態レポート(09-14、09-15、09-16、09-17、09-18の5期平日刊、ほか09-20週末補充期を含め計6期);全項目は当該期間に検証済みの情報源に基づく 編成説明:本期間はリリースガバナンス(2.2 RCのリズムとGAの日程確定)、コンポーネントとコード共同構築、メンバー単位とベンダー適応、エコシステムとコミュニティの4次元をカバーする;5期のデイリーレポート期間内のコミットは合計約720件、org内の約30リポジトリをカバーし、技術的事実はすべてコードリポジトリと公式リリース資料の実測検証による


1. 今週のニュース

  • FlagOS 2.2 RC2 フルスタック同期タグ付け、全期間で2回目の候補スナップショット(09-14):09-14 10:35、communityリポジトリが2.2 RC2リスト(release-2.2-rc2.yaml、251行を追加)をマージ;その後10:45から10:54の10分間に、23のコンポーネントリポジトリが相次いでrc2.post1タグまたはReleaseを打ち、全日で26回のタグ付け動作を記録、22リポジトリをカバーし、FlagTreeの3つのTritonバリアントと1つのxpu3.6タグが当日補完された。初回のリリースノート付きReleaseはFlagGems v5.4.0とFlagSparse v0.3.0(いずれもrc2.post1)。
  • build-infraのバージョンフィールドを2.2.0に引き上げ、全20バックエンドイメージを一括再構築(09-17 ~ 09-20):09-17 08:49の#916がconfigs.yamlのversionを2.1.2から2.2.0に引き上げ、flaggemsを5.3.5から5.4.0-rc2.post2へ変更、これは2.2 GA前にorg内で唯一のグローバルスイッチ;09-19から09-20にかけてさらに全20バックエンドのvLLMイメージに2.2.0/プラグインpost2の一括再構築を承認し逐条書き戻し、今週最大規模のエンジニアリング動作となった。
  • communityが20件のFEPを一括マージ、2.2の機能リストとリリース境界が確定(09-17):番号0081から0100、オペレータ、コンパイラ、フレームワーク、トレーニング、ネットワーク、端末側、科学知能などの方向に分属する;各々に「リリース境界と証拠」の節を含み、同一バッチの文書に実装済みとマークされた概念実証(FEP-0095 Common IR)もあれば、能動的に草案で停止した能力項目(FEP-0100 KernelGen)もあり、ロードマップを納品と見なさない。
  • Torch-FLの6プラットフォームがFlagGems-firstへ転換、ディスパッチ層が主戦場に(09-15/09-16):PPUルーティングテーブルは11件から478件に拡張された後435件に落ち着き、FlagGemsがカバーする482オペレータのうち47がベンダーカーネルに残り逐条名指しされた;CUDA、DCU、GCU、昇騰、MUSAの5プラットフォームも同方向に調整。これは「1つのオペレータライブラリがチップを跨いで再利用される」という命題のディスパッチ層における初の完全な定量化である。
  • Open3D-PIMCがオープンソース公開からコード実装へ(09-14 ~ 09-16):中国算力大会がオープンソースを発表して約44時間後、リポジトリが最初のルートコミットを受信し、一度に662のエントリ(raisa-inductorコンパイラ層とrcs2 C++ランタイム)を持ち込み、3D算力チップ向けのプログラミングモデルとコンパイルスタックがエンジニアリング状態に入った。
  • リリース物エンジニアリングが全面的に収束:成果物、パッケージング、ゲートの3ラインが並行(09-15 ~ 09-20):昇騰FlagTree wheelのアップロード経路が初めて開通(flagtree-0.7.0rc2+ascend3.5などが成果物リポジトリに到達);FlagTreeのDEBパッケージングとNexusリリースが共有ワークフローに統合;プラグインwheelは「1回のビルド、全ベンダーインデックス配布」に変更;イメージがプラグインバージョンを自己申告しコンパイル基盤を逐条注記;FlagQuantumのカバレッジ下限が75%に引き上げ。
  • エコシステムが大会とコンテストの周期に(09-18 ~ 09-21):2026人工知能オープン計算大会兼衆智FlagOS技術大会の登録受付開始(10月17日から18日、北京);FlagOSとMiniCPMが共同開催する推論スループット最適化チャレンジが09-21に提出受付開始;SGLangのクロスチップオペレータ最適化コンテストの成果が引き続きPRの形でメインリポジトリに流入。
  • 産業面:メンバー単位の資本と資金調達イベントが密集(09-15 ~ 09-17):燧原科技の上場後の解釈が持続的に発酵(初日上昇率179.22%、時価総額1708.5億元の公開口径が繰り返し引用される);地瓜機器人(D-Robotics)が4億ドルのCラウンド資金調達を完了(未来資産がリード);沐曦が09-17に14.44%急騰し複数機関の減持報道も——資本面の関心は引き続き「作り出した」から規模納品と利益実現へと転換。

2. バージョンとリリース動態

RCのリズムとGAマイルストーン

  • 2.2 スケジュール:機能凍結 08-31、テスト・安定化期間 09-01 から 09-24、GA は 2026-09-28 に決定;milestone「FlagOS 2.2」の 7 件の issue は 09-17 時点で全て未クローズ、期限日も同じく 09-28;卒業基準は「実行可能なテスト計画がテスト期間内に合格すること」であり、その後 FEP ステータスは実現可能から実現済みへ移行、セキュリティパッチと重大欠陥は TSC 承認が必要な緊急チャネルを通す。
  • RC1 から RC2:RC1 は前周期末の成果物で、今週初めは依然として rc1.postN のイテレーション位置にあった(FlagGems は rc1.post2);RC2 マニフェストは 09-14 10:35 に生成され、インフラ、オペレータ、推論プラグイン、訓練、リリースとツールの 5 グループ計 24 モジュール項目をカバーし、ルールは「バージョンは rc0/rc1 と一致させ、.postN のイテレーション位置のみで進める」。
  • RC2 の 3 回のイテレーション:FlagGems は rc2.post1(09-14)から rc2.post2(09-15 11:21、community #110、2 箇所の修正が駆動:flash_attention_backward の Triton 3.5 互換と tl.map_elementwise ゲーティング)を経て rc2.post3(09-18 記録)へ;FlagCX は rc2.post2 へ進行;その他の項目は rc2.post1 を維持。
  • ブランチとタグ付けの自動化:09-17 23:29 から 23:33、10 のモジュールリポジトリが同期して rc2 統合ブランチを切り出しタグ付け(git ls-remote による全 ref 検証)、release-branch-tag ワークフローがマニフェストに従い manage-release.py を呼び出して一括実行;コミュニティ側の 2.2 プロジェクト同期ワークフローは 15 分ごとに実行され、リリースステータスは関連 PR から導出されるように変更。
  • GA カウントダウン:期間初日(09-14)の 14 日から期間末(09-20)の 8 日へと短縮され、テスト期間は「バグ修正のみを受け付ける」後半段階に入った。

コンポーネント tag と Release マニフェスト(期間内)

  • FlagGems:v5.4.0-rc2.post1(09-14、Release)から v5.4.0-rc2.post2(09-15)を経て rc2.post3(09-18 記録)へ;安定線は v5.3.6(09-11 前後)を維持。
  • FlagSparse:v0.3.0-rc2.post1(09-14、リリースノート付きの Release)。
  • FlagCX:v0.14.0-rc2.post1(09-14)から rc2.post2(09-17/18 検証)へ。
  • FlagTree:0.7.0rc2.post1 の Triton 3.6 / 3.5 / 3.3 の 3 ラインと 0.7.0rc2+xpu3.6(09-14);09-17 に 0.7.0rc2 の metax、mthreads、enflame、tsingmicro などのバックエンドタグを追加;09-18 に 昆仑芯 xpu ラインがさらにイテレーションして 0.7.0rc3+xpu3.6 を生成(タグ実測)。
  • FlagAttention:v0.4.0-rc2.post1。
  • その他のコンポーネント(09-14 に集中タグ付け、rc2.post1):FlagFFT v0.2.0、FlagDNN / FlagTensor / FlagAudio / FlagBLAS v0.3.0、FlagGems-vllm v0.2.0、FlagGems-sglang v0.1.0、Torch-FL v0.2.0、sglang-plugin-FL v0.2.0、TransformerEngine-FL / Megatron-LM-FL v0.3.0、FlagOS-Compressor v0.1.0、KernelGen v2.2.0、KernelGenBench v0.2.0、FlagRelease v0.3.0;FlagScale は v2.1.0-rc2.post1(すでに 2.0 ラインから脱出);vllm-plugin-FL は 0.3.0 と 0.2.2 の 2 つのバージョンラインで進行。

イメージと成果物のステータス

  • 全20バックエンド再構築:09-20 03:07 の認可コミット(#938)が発出された後、ボットアカウントが1時間余りのうちにバックエンドごとに新しいミラー tag を記録;記録された 2.2.0-0.3.0rc2.post2 の一档は昇腾(cann8.5.0、cann9.0.0 及び 910c 変体)、寒武紀(neuware4.4.3 / 4.7.2)、摩尔線程(musa4.3.6 / 5.2.0)、燧原(tops1.9.10 / 1.10.6)、沐曦(maca3.7.2.1 / 3.8.1.3)、海光(dtk26.04)、天数(corex4.5.0)、昆仑芯(xre5.37.1)、中昊芯英(tangrt1.2.0)と英偉達(cuda12.8 / 13.3)をカバー;プラグインバージョン線 0.2.2rc2.post2 には別途先行して着地した一批がある。
  • 配布経路の統合:プラグイン wheel は一度のビルドで全ベンダーインデックスへ公開する方式に変更(#934)、バージョン番号は git ref から導出する方式に変更(#932);ランタイム依存はベンダーインデックスから取得する方式に変更(#930);昇腾線は cann-shmem ソフトウェアパッケージを補完(#939)。
  • 検証可能化の三件事:ミラーが実際にインストールされたプラグインバージョンを自己報告(#937)、一度もビルドされたことのないミラーはドキュメント内で明示的に TBD と标注(#948)、ミラーごとに実際にコンパイルされた FlagTree 底座を标注(#953);状態マトリクスの統計口径も同時に固定化(#932/#933)。
  • ピン留めの揺り戻しと互換処理:09-20 に英偉達 cuda13.3(#940)と沐曦の2つの MACA バックエンド(#943)を FlagTree 0.6.1 へ、燧原 tops1.9.10 を 0.6.0 へピン留め(#944);併せてピン留め状態に応じて FlagTune コストモデルを無効化(#947)——今週前半の引き上げ動作と合わせて、一組の完全な「揺り戻し + 適配」を形成している。
  • 昇腾とリリース物:FlagTree wheel のアップロード経路が初めて貫通(flagtree-0.7.0rc2+ascend3.5 と flagtree-0.6.0+ascend3.2 が製品リポジトリに到達、ビルド所要時間 26 / 14 分);build-infra リポジトリ自身のタグは依然として v2.1.1 に留まり、v2.2.0 タグは調査期間内にまだ付与されていない。

3. コンポーネントとコードの共同構築

今週の org 内5期の調査期間におけるコミット数は 98 / 119 / 150 / 147 / 206 件、合計約 720 件(09-17 と 09-18 の2期の調査期間には約1.4時間の重複があり、少数の重複計上を含む)。以下はモジュール別に集約する。

オペレータと領域ライブラリ(FlagGems 及び各領域ライブラリ)

  • FlagGems(メインライン、今週の第一のライン):五期の調査期間におけるコミット数は 12 / 43 / 71 / 40 / 38 件、合計約 200 件。三つの生産ラインが並行して進行:KernelGen のバッチ取り込み(一週間で Nvidia オペレータを 50 個以上注入、線形代数、特殊関数、訓練逆伝播、プーリングサンプリングの四類をカバー、代表的なエントリには nanquantile、logdet、linalg_polar、GRU と LSTM の逆伝播カーネル、Lanczos アップサンプリング逆伝播、fused_adagradfused_sgd が含まれる);KMCompiler のオペレータ単位での補完(昇騰 matrix_rank、igammac、gru、adaptive_max_pool3d、linalg_solve_triangular;海光と沐曦が linalg_lstsq のマルチバックエンド実装を共用);昆仑芯 TLE 改修(sum / sum_dim を tle.gpu へ移行、さらに約十項目のバックエンド修正バッチを完了:grouped_mm の大 M 小 K における persistent kernel、SDPA アテンション、mse_loss の全ブロックマスクなど)。
  • 量子化メインライン:海光 W8A8 INT8 GEMM(#6185、長 K 規約オーバーフロー保護)と TLE 有効化(#6247);摩尔線程 W8A16 FP8 RMSNorm(#6210)とネイティブ FP8 W8A8 行列乗算(#6211);沐曦 W8A16 RMSNorm(#6326);FP8 topk 選路(#4412)。量子化のカバレッジは行列乗算の一層から正規化および隣接オペレータへと拡散しつつある。
  • バックエンド修正と拡容:海光 DCU FlashAttention の前方向・逆方向修正(#5822)、融合 rrelu バックエンドカーネル(#6379);達磨院玄鉄 PPU バックエンドで TLE を有効化(#6423);沐曦 masked_fill の範囲外アクセスと不正設定の修正(#6480);昇騰専用線形オペレータ(#6456)、swiglu と grouped_matmul(#6324 / #6325)、Top-K(#6354);昆仑芯 FlagTree 依存を 0.6.1+xpu3.6 へ昇格(#6393)、tle.raw スカラー比較の高速パスを能動的に撤回(#6409)、masked_fill / sinh / mish / hardswish / index_fill の五オペレータを修正(#6328)。
  • 工程品質:linalg_svd の 16×16 ハング(#6301)、addmv スカラー bias の dtype 不一致(#6149)、nansum 整数型 dtype(#6351)を修正;七つのバックエンドサブパッケージの init.py を補完;オペレータ導出チェック、KernelGen テストマークは追加行のみをスキャン、ベンチマーク pytest マークとオペレータ登録の整合(#6489);AMD W7900D が週次テストマトリクスに参加(#6312)。
  • FlagGems-Experimental(試験田):海光の 17 オペレータを一時間以内にバッチ取り込み(特殊関数、線形代数、数値とインデックス類を含み、別途 _scaled 修正を添付);摩尔線程は cholesky_inverse、linalg_ldl_solve、ormqr などを補完;昆仑芯は mvlgamma を補完;09-17 に MetaX index_select を修正(#419)、conv_depthwise2d(#391)と dense_dim(#639)を補完;09-20 にさらに十個の Nvidia 小規模オペレータを追加(疎とビュー類、試験田からメインラインへの橋渡しの前段階)。
  • FlagSparse:マージコミットで外部協力ブランチ(NCIC-AlphaSparse)を導入し、39 件のコミットで MUSA、MACA、DCU の三バックエンド適配を推進(spgemm の単精度・倍精度テスト分離、C ラッパー層の新規追加を含み、期間中に一度バッチロールバックの後に再収束)。
  • FlagFFT:36 個の FFT オペレータを一括で検収状態へ移行(+2151/-2298、NumPy 独立検証とランタイムプランを付帯)、その後検収カバレッジを必須項目として明記;09-17 に MUSA と MACA それぞれに三次元転置検証記録を残し、Triton JIT ランタイム依存を統一してバージョン固定;調査期間の終盤に検収フレームワークを連続リファクタリング(パイプライン転流、ログ判定、オンデマンド再生成)。
  • FlagDNN:天数智芯と海光の二プラットフォームの実装アーキテクチャを再編成し、テキスト総和オペレータを新規追加、四プラットフォーム(PPU / 摩尔線程 / 昇騰 / 天数)のテスト面を収束。
  • FlagBLAS と FlagAudio:FlagBLAS は達磨院玄鉄バックエンドのパッケージ設定を修正;FlagAudio は最初の三つの PR をマージ(スペクトログラム Triton オペレータ、ゲイン恒等チェックと遅延インポート、パッケージングの収尾)、いずれも外部コントリビューターのブランチで、別途 CI のアップロード経路を追加。

コンパイラと通信ライブラリ(FlagTree と FlagCX)

  • FlagTree:リリース工程を三本(DEB パッケージングマトリクスに ubuntu22.04 / python3.12 を追加、リリースパッケージを共有ワークフロー経由で Nexus へ推送するよう変更、libtriton と libproton のデバッグ情報を剥離)行い、パッケージングベースラインと wheel バージョン番号を打通;コンパイラ側では FlagTune 托管 Manifest とランタイム互換処理を推進し、天数智芯向けに iluvatar3.6 ベースラインとテストワークフローを構築、FlagGems テストテンプレートのバックエンド初期化インターフェースを統一、tle.signaltle.signal_wait のフロントエンドで同期範囲とメモリオーダーを明示的パラメータとして露出(FEP-0096 分散プリミティブ方向に対応);ほかに CommonIR 変換の Triton 3.6 接続、tle_raw の sort オペレータ最適化、Hopper WGMMA のクロス dtype アキュムレータ再利用、XPU 側 do_bench のゼロ除算修正。
  • FlagCX:デリバリ面では libflagcx.so を wheel に同梱、天数智芯ビルドキーを統一、Nexus アップロードを共有ワークフローに切替、Fedora 43 を英偉達 RPM マトリクスに追加;インターフェース面では lane mask を 32 ビットから 64 ビットへ緩和(チップ規模拡大への備え);ツール面では PTD パフォーマンスログ変換をストリーミング処理へ変更(大規模負荷テスト時のメモリ枯渇を回避)、KV 等価スループットの口径を修正;バックエンド面では達摩院玄鉄 PPU を接続(CI と torch プラグインの二段構え)、天数デバイス API のデフォルトパスを補完。

推論と学習フレームワーク

  • Torch-FL:六プラットフォームの FlagGems-first 落地後、一週間でその後の迂回、スイッチとゲートで収尾——具名迂回(MetaX スライスオペレータ、MUSA 複素数回転位置エンコーディングはデバイス側に残す)、明示的スイッチ(CI を前回利用可能な FlagGems コミットに固定、USE_FLAGTUNE=0、ビルド期アクセラレータ設定を wheel に書き込み)、ゲート構築(PPU 検出、プラットフォームマニフェストの外部化、全プラットフォームで FlagGems master を追跡);環境変数面を FLAGOS の一つのプレフィックスに統一;分離された DCU wheel で torch.cuda の可用性を修正;調査期間末段では Qwen-Image 2.1 と 2512 のマルチチップ性能を成線(GCU 単ステップ 7.1 s/it まで低減、DCU スケジューリングオーバーヘッドを連続的に圧縮、最終的にスループット曲線とテールレイテンシ測定を提示)。
  • FlagGems-vllm:海光と達摩院玄鉄で moe_sum を対照実装;摩尔線程 MTT S5000 に persistent_topk を追加;昇騰に SparseAttnSharedKV(DeepSeek-V4 疎注意力構造、単筆 +9637、六つの固定形状、精度を検収口径とする)と persistent_topk を補完し、ベンダーオペレータを統一ディレクトリに収納;Marlin MoE(INT8 / FP8 の二種 W8A16 重み)と FP8 可変長 FlashAttention-2 を融合し、推論側の「可変長バッチと MoE 疎活性化」という二類の実形態を補完;調査期間末段では MUSA の fused_q_kv_rmsnorm、沐曦の varlen 注意力、昇騰の kda_gate_cumsum を引き続き補完。
  • FlagGems-sglang:競賽成果の落地チャネルを担当——09-14 単日で 10 の競賽ブランチ PR をメインリポジトリにマージ(bmm-chunk、decode-attention、fused-rmsnorm-warp2、task19 / task21-moe-sum-reduce など);その後、上流テストツールを内蔵、マルチモーダル回転位置エンコーディング融合オペレータを導入、do_bench をベンダー別ディスパッチの単一関数に変更、moe_fused_mul_sum 競賽オペレータを登録し batch3 の参考、テスト、ベンチマークとドキュメントを一批提供。
  • vllm-plugin-FL と sglang-plugin-FL:前者は海光 vLLM 0.24.0 ワークフローを開設、metax CI を接続、燧原 S60 と崑崙芯を 0.24 ラインへ引き上げ、達摩院玄鉄 PPU CI を接続、崑崙芯 FlashAttention の状態汚染を修正、天数 BI-V150 に適応;後者は海光 DCU と燧原 GCU それぞれに CI パイプラインを構築(海光ラインは AMD adaptor で FlagCX v0.13.0 を構築)、dispatch 単体テストとプラットフォーム設定を分離し、プリロードにベンチマークを追加。
  • FlagScale と学習カーネルライン:FlagScale は各アクセラレータプラットフォーム上で相互結合した CI 依存を統一収口、fork PR 依存成果物キャッシュの分離を修正;TransformerEngine-FL はメインラインから cherry-pick で修正;Megatron-LM-FL はハードコードされた CUDA デバイス操作をプラットフォーム感知 API に置換(オプティマイザ、初期化、学習とツールパスをカバー);FlagScale-Agent は agent harness を加固;FlagPrism はオペレータ検収テストを統一、燧原デバッガと TOPSPTI パフォーマンス分析サポートを新規追加。

リリース工程とガバナンス(build-infra / community / docs)

  • build-infra:第2節のバージョン引き上げとイメージライン以外に、今週は FlagCX wheel パッケージングライン(ビルド、検証、リリースの3ステップ)を新設し、海光 rc2.post1 のデュアルイメージタグを記録して再検証し、海光の gflags ヘッダーファイル依存の落とし穴を文書化し、イメージタグとバージョンタグをペアで記録することを各バックエンドが 2.2 納品範囲に入る直接的な証憑とした。
  • community:2.2 リリースガバナンスを手動ダッシュボードから自動化へ移行(15 分ごとに issue を組織プロジェクトビューへ同期、リリース状態は関連 PR から導出、RC 検証ルールを説明に記載);20 本の FEP と RC2 チェックリストの保守はいずれもリリースマネージャーラインが推進。
  • docs:ドキュメントラインは今回の CICD 改造に統合(new/flagcicd ブランチと main をマージ)、オンラインラボのヘルプコンテンツを2回更新。

量子と新興方向

  • FlagQuantum(今週最も拡張が速かった方向の一つ):09-14 の1日で Twin API の凍結と QPU デジタルツインの履歴シーケンス管理(キャリブレーションと検証の履歴、候補比較、シーケンス復元のチェーン化)を完了;その後、回路トポロジーによる Twin 証拠の等級付け、JAX フロントエンドテストへの接続とカバレッジ下限の契約ファイルへの記載(60% から 75% への2段階引き上げ)、パッケージレベルの厳格な型チェック、量子誤り訂正記録層の実装(具体的な符号化方式とデカップリング);ウィンドウ終盤には単一のコントリビューターがアルゴリズムプリミティブパッケージを連続して整備し、量子フーリエ変換、位相推定、Grover 探索、振幅推定から QUBO から Ising へのマッピング、量子カーネル法、量子 PCA、k-medians などのアプリケーション層プリミティブまで一通り整備した。
  • FlagTrain:09-16 に新リポジトリが設置(プレースホルダー作成、規模 5 KB)、訓練側でさらに一塊を切り出し、コードの設置は今後の観察待ち。
  • Open3D-PIMC:09-14 にオープンソースリリース、09-16 にコード着地(662 個のエントリ:コンパイル層 raisa-inductor の pass 体系とコンパイルキャッシュキー、C++ ランタイム rcs2、README にはメモリ階層、シャーディングトポロジー、動的推論、コンパイル成果物の再利用という4つの補完待ちギャップを明記);FlagOS の 3D 演算チップ方向と直接関連し、2.2 受け入れ範囲には入らない。
  • flir(FlagTree IR):上流の bufferization セマンティクスに整合(tile.to_tensor の Pure マークを除去)、メモリ効果マークを修正、triton バージョン識別の口径を統一。

四、メンバー機関とベンダー適配

  • 海光:量子化(W8A8 INT8 GEMM)、TLE 有効化、融合 rrelu バックエンドカーネル、DCU FlashAttention 順方向・逆方向修正の 4 ラインを並行して推進;DCU wheel を分離して torch.cuda と Qwen-Image フローを修正;FlagSparse DCU ライン(sddmm テスト、spgemm 精度分離);vLLM 0.24.0 向けにワークフローを有効化;イメージ dtk26.04 で rc2.post1 の再検証と post2 の再ビルドを完了。
  • 昇騰:MoE と線形アテンションに必要なオペレータが最も密集するライン——SparseAttnSharedKV、persistent_topk、kda_gate_cumsum、grouped_topk(TLE の DSA 原始インターフェース経由)、専用線形オペレータ、swiglu と grouped_matmul;CommonIR の概念実証が FEP で実装済みとしてマーク(910B / 910C 限定の Triton 3.5 ライン);FlagTree wheel のアップロード経路が開通;4 つのイメージ変体(cann8.5.0 / cann9.0.0)の再ビルドを完了し cann-shmem を追加。
  • 摩尔線程:ネイティブ FP8 W8A8 行列積と W8A16 FP8 RMSNorm の 2 つの量子化パスを実装;MTT S5000 の persistent_topk と MUSA 回転位置エンコーディングのデバイス側実行;FlagTree を 0.7.0rc2+mthreads3.6 へジャンプ;プラグイン付きの初の 0.20.2 イメージが完成;FlagPrism の profiler と debugger をコンパイラチェーンに統合。
  • 沐曦:W8A16 RMSNorm、FP8 topk 選路、varlen アテンション最適化と masked_fill の範囲外修正;vLLM 向けに metax CI を有効化し 0.24 ラインへ引き上げ;FlagSparse MACA ライン対応;産業側では上海人工智能実験室 ATRIA Dawn Preview の Day0 対応を完了(会社発表で累計 37 のフラッグシップモデル)、中間決算の黒字転換、09-17 のロックアップ解除期間と株価異動は資本面の記録。
  • 燧原:ベンダーブランチをまとめてメインラインへ同期;S60 の vLLM 0.24 ライン対応、GCU CI パイプライン、GCU300 を 0.24.0 レポートに記録;FlagPrism に燧原デバッガと TOPSPTI サポートを追加;2 つの tops イメージの再ビルドを完了;資金調達と上場に関する解説が継続(09-11 に科創板へ上場)。
  • 天数智芯:iluvatar ビルドキーの統一、デバイス制御インターフェース /dev/itrctl への統合、FlagTree に iluvatar3.6 ベースラインとテストワークフローを構築;FlagDNN のプラットフォームアーキテクチャ再編とテスト範囲の収束;vLLM 0.24 ライン対応;corex4.5.0 イメージの再ビルドを完了。
  • 昆仑芯:1 日あたり約 10 項目のバックエンド修正バッチ(grouped_mm persistent kernel、SDPA、mse_loss など)で直近のオペレータリグレッションを一掃;xCCL をベースイメージに組み込み;sum を tle.gpu へ移行;FlashAttention モジュールインポートの状態汚染を修正;安定した成果が得られていない tle.raw ファストパスと 0.6.1+xpu3.6 のピン留めを自主的にロールバック;xpu タグを 0.7.0rc3+xpu3.6 へ更新。
  • 達摩院玄鉄:PPU バックエンドで FlagGems の TLE を有効化、FlagCX と vllm-plugin-FL で CI に接続(torch プラグイン含む)、Torch-FL のゲートで明示的に検出;moe_sum 変体を追加し KernelGen オペレータの受け渡しを受け入れ;FlagTree 2.2 マルチバックエンド計画(FEP-0098)でプレースホルダーを確保し、2 ラインでの参加度が継続的に深化。
  • 清微智能:Open3D-PIMC のオープンソース公開とコード実装(智源との共同開発);分散プリミティブをバックエンドで有効化し、2.2 の TLE 分散路線と合流。
  • 地平線:傘下の地瓜機器人(D-Robotics)が 4 億ドルの C ラウンド資金調達を完了、メンバー体系にとって今週最も重要な産業イベント。
  • 智源(主導者):RC2 ガバナンスと FEP ガバナンスの実施、20 件の FEP の公開範囲定義、Open3D-PIMC の共同開発と「ハードウェア形態を定義する」方向性の表明を主導;リリース物とガバナンスのリズムはいずれも同組織の主導を軸に推進。

五、エコシステムとコミュニティ

コンテストとオープンコンペティション

  • SGLang クロスチップオペレータ最適化コンテストの成果が継続的にメインリポジトリへ:09-14 の 1 日で 10 件のコンテストブランチ PR が FlagGems-sglang にマージ;調査期間後半に moe_fused_mul_sum などのコンテストオペレータが登録・収録(#87)、batch3 の参考資料、テスト、ベンチマーク、ドキュメントも併せて格納。コンテストは FlagOS の常態的な外部オペレータ供給ラインとなりつつある。
  • FlagOS と MiniCPM モデル推論スループット性能最適化チャレンジ:開発・提出期間は 2026 年 9 月 21 日から 11 月 20 日、12 月初旬に審査;FlagOS スタック上の推論スループット最適化を対象とし、オペレータ最適化コンテストに続くコミュニティコンテスト体系の延長。

会議とオープンソースリリース

  • 2026 人工智能開放計算大会暨衆智 FlagOS 技術大会:10 月 17 日から 18 日にかけて北京中関村国家自主革新示範区展示センターで開催、テーマは「一栈貫通、智算無界」、09-18 に参加申し込み開始。ワークショップの選題(KernelGen、端側、TLE Attention、FlagScale-Agent)は今週のエンジニアリング観察と一一対応する。
  • Open3D-PIMC オープンソースリリース:09-14 に中国算力大会で発表、09-16 にコード公開。清微智能と智源の共同開発で、FlagOS の次世代 3D 算力チップ向け主要ソリューションの一つと位置づけられ、第四四半期に世界のトップ技術会議で最適化成果を発表すると予告。

ニュース面と外部チャネル

  • コンポーネント級ニュース検索は連続第十一から第十五の平穏ウィンドウ:一週間を通して 24 時間ウィンドウ内で有効ヒットゼロ、対外動態の事実は GitHub org とコミュニティチャネル(智源コミュニティ、知乎機関号、CSDN コラム)を基準とする。メンバー単位側で見られる報道は資本面と自社スタックの Day0 適配に集中。
  • 収録境界の説明:智源コミュニティプラットフォーム上で本スタックとインターフェースのない第三者コンテンツ(紫東太初モデルのオープンソース稿など)は計上しない。純粋な市況稿と株価異動は背景記録としてのみ扱う。

6. 趨勢観察

  • 2.2 はリリース物の凍結と装配段階に入る:グローバルスイッチ(version 2.2.0)の確定、全バックエンドイメージの一括再構築、リリース物の検証可能化という三件事が同時に完了。テスト期間は残り一週間で、残存リスクは「機能欠落」ではなく「インストールできるか、正しく動くか」に集中しており、Go/No-Go の根拠は「人がチェックリストを見る」から「状態から導出可能」へ移行しつつある。
  • 分派層が「一つのオペレータライブラリをチップ横断で再利用する」の実現層となる:六プラットフォームの FlagGems-first が初の完全な定量化を示した(PPU 線は 435 件の FlagGems ルート対 1601 件のベンダーカーネルルートに確定)。迂回リスト(PPU 47 項、MetaX スライス、MUSA 複素数回転位置エンコーディング、CUDA 側 FlagTune 欠位)の長さこそがチップ横断再利用率の逆指標であり、「ルート加迂回リスト、加ゲート」が再利用可能なメカニズムテンプレートとなる。
  • マルチバックエンド適配形態の分化:上向きと揺り戻しが併存:摩尔線程が FlagTree 跳級と初のプラグイン付きイメージを取得、昇騰 wheel アップロードが通り抜けたのは上向き。英偉達 / 沐曦 / 燧原が 0.6.x に固定回帰し、昆侖芯が tle.raw 快経路に回退したのは揺り戻し——後者は「修正せずとも、検証済みの格子を壊さない」という RC 規律と同源であり、プラットフォーム適配が安定期に入ったシグナルである。
  • オペレータ拡容の二本柱が明確化、ボトルネックはカーネル記述から登記と検収へ移行:量子化(W8A8 / W8A16 / FP8、行列積から正規化とサンプリングへ拡張)と MoE / 線形注意力(グループ行列積、swiglu、疎共有 KV、ゲート付き Delta 規則)は現在の推論モデルの実構造に直接対応する。KernelGen のバッチ取込に伴う導出検査、テストマーク、ベンチマーク整合と検収フレームワーク再構築は、拡容のボトルネックが登記と検収に移ったことを示す。
  • テストと品質基盤のプラットフォーム化:達摩院玄鉄 PPU が複数 CI に接入、天数智芯が iluvatar3.6 ベースラインを確立、FlagTree が統一バックエンド初期化インターフェースを抽出、FlagQuantum のカバレッジ下限と型検査が厳格化——異なる形態の動作は同一目標を指す。すなわち、各バックエンドが CI 内で継続的に検証されるようにし、人手での動作確認に頼らないこと。
  • 次版の輪郭が文档内で形成され、生態運営密度がまもなく上昇:RISC-V 実験的サポート、端側 SDK、オペレーティングシステムパッケージング、具身智能と科学智能ワーキンググループがすでに FEP 計画に登場、T-Head、燧原、摩尔線程の新バックエンドが FlagTree 2.2 計画に入る。FlagTrain のリポジトリ作成、FlagAudio の実体化、Open3D-PIMC の落地は新方向が持続的に枝を広げていることを示す。10 月の大会と 9 月下旬に開賽するチャレンジコンテストにより生態運営密度は著しく上昇し、次の報道ピークは 09-28 のリリースウィンドウと予想される。

付録:素材と検証