報告週期:2026 年 9 月 14 日(週一)至 9 月 20 日(週日),共 7 個自然日 素材來源:本刊每日 FlagOS 動態報告(09-14、09-15、09-16、09-17、09-18 五期工作日刊,另含 09-20 週末補充期,共 6 期);全部條目來自當期已核驗信源 編制說明:本週期覆蓋釋出治理(2.2 RC 節奏與 GA 定檔)、元件與程式碼共建、成員單位與廠商適配、生態與社群四個維度;五期日報視窗內提交合計約 720 條,覆蓋 org 內近 30 個倉庫,技術事實均來自程式碼倉庫與官方釋出物料的實測核查


一、本週要聞

  • FlagOS 2.2 RC2 全棧同步打標,全週期第二次候選快照(09-14):09-14 10:35,community 倉庫合入 2.2 RC2 清單(release-2.2-rc2.yaml,新增 251 行);隨後 10:45 至 10:54 的十分鐘內,23 個元件倉庫接連打出 rc2.post1 標籤或 Release,全天共記錄 26 次打標動作、覆蓋 22 個倉庫,FlagTree 的三個 Triton 變體與一個 xpu3.6 標籤當日補齊。首發帶發行說明的 Release 為 FlagGems v5.4.0 與 FlagSparse v0.3.0(均為 rc2.post1)。
  • build-infra 版本欄位抬到 2.2.0,全 20 後端映象批次重建(09-17 ~ 09-20):09-17 08:49 的 #916 把 configs.yaml 的 version 由 2.1.2 抬到 2.2.0、flaggems 由 5.3.5 換到 5.4.0-rc2.post2,這是 2.2 GA 前 org 內唯一的全域性開關;09-19 至 09-20 又為全部 20 個後端 vLLM 映象授權 2.2.0 / 外掛 post2 批次重建並逐條回寫,是本週規模最大的工程動作。
  • community 一次性合入 20 份 FEP,2.2 特性清單與釋出邊界落定(09-17):編號 0081 至 0100,分屬運算元、編譯器、框架、訓練、網路、端側、科學智慧等方向;每份均含「釋出邊界與證據」一節,同一批文件中既有標記為已實現的概念驗證(FEP-0095 Common IR),也有主動停在草案的能力項(FEP-0100 KernelGen),不把路線圖當交付。
  • Torch-FL 六平臺轉向 FlagGems-first,分派層成為主戰場(09-15/09-16):PPU 路由表由 11 條擴到 478 條後落定為 435 條,482 個被 FlagGems 覆蓋的運算元中 47 個留在廠商核心並逐條具名;CUDA、DCU、GCU、昇騰、MUSA 五個平臺同向調整。這是「一套運算元庫跨晶片複用」這一命題在分派層的首次完整量化。
  • Open3D-PIMC 從開源釋出到程式碼落地(09-14 ~ 09-16):中國算力大會宣佈開源約 44 小時後,倉庫收到首個根提交,一次帶進 662 個條目(raisa-inductor 編譯層與 rcs2 C++ 執行時),面向 3D 算力晶片的程式設計模型與編譯棧進入工程狀態。
  • 釋出件工程全面收口:製品、打包、門禁三條線並行(09-15 ~ 09-20):昇騰 FlagTree wheel 上傳通路首次走通(flagtree-0.7.0rc2+ascend3.5 等到達製品庫);FlagTree 的 DEB 打包與 Nexus 釋出併入共享工作流;外掛 wheel 改為「一次構建、全廠商索引分發」;映象開始自報外掛版本並逐條標註編譯底座;FlagQuantum 覆蓋率下限抬到 75%。
  • 生態進入大會與賽事週期(09-18 ~ 09-21):2026 人工智慧開放計算大會暨眾智 FlagOS 技術大會開啟報名(10 月 17 至 18 日,北京);FlagOS 與 MiniCPM 聯合舉辦的推理吞吐最佳化挑戰賽 09-21 開放提交;SGLang 跨晶片運算元最佳化賽的產出持續以 PR 形式進入主倉。
  • 產業面:成員單位資本與融資事件密集(09-15 ~ 09-17):燧原科技上市後的解讀持續發酵(首日漲幅 179.22%、市值 1708.5 億元的公開口徑被反覆引用);地瓜機器人完成 4 億美元 C 輪融資(未來資產領投);沐曦 09-17 大漲 14.44% 並有多家機構減持報道——資本面關注點繼續從「做出來」轉向規模交付與盈利兌現。

二、版本與釋出動態

RC 節奏與 GA 里程碑

  • 2.2 時間表:特性凍結 08-31,測試與穩定期 09-01 至 09-24,GA 定檔 2026-09-28;milestone「FlagOS 2.2」的 7 個 issue 至 09-17 核查全部未關閉、到期日同為 09-28;畢業標準為「可執行的測試計劃在測試期內透過」後 FEP 狀態由可實現轉為已實現,安全補丁與嚴重缺陷走需 TSC 批准的加急通道。
  • RC1 到 RC2:RC1 為上一週期末產物,本週初仍在 rc1.postN 迭代位(FlagGems 到 rc1.post2);RC2 清單于 09-14 10:35 生成,覆蓋基礎設施、運算元、推理外掛、訓練、釋出與工具五組共 24 個模組條目,規則為「版本與 rc0/rc1 保持一致,只在 .postN 迭代位推進」。
  • RC2 三次迭代:FlagGems 由 rc2.post1(09-14)經 rc2.post2(09-15 11:21,community #110,兩處修復驅動:flash_attention_backward 的 Triton 3.5 相容與 tl.map_elementwise 門控)到 rc2.post3(09-18 記錄);FlagCX 推進到 rc2.post2;其餘條目維持在 rc2.post1。
  • 分支與打標自動化:09-17 23:29 至 23:33,十個模組倉庫同步切出 rc2 整合分支並打標(git ls-remote 全量 ref 核驗),由 release-branch-tag 工作流按清單調 manage-release.py 批次執行;社群側的 2.2 專案同步工作流每 15 分鐘執行,釋出狀態改由關聯 PR 推導。
  • GA 倒計時:從視窗首日(09-14)的 14 天收窄至視窗末(09-20)的 8 天,測試期進入「只收 bug 修復」的後半段。

元件 tag 與 Release 清單(視窗內)

  • FlagGems:v5.4.0-rc2.post1(09-14,Release)到 v5.4.0-rc2.post2(09-15)到 rc2.post3(09-18 記錄);穩定線維持 v5.3.6(09-11 前後)。
  • FlagSparse:v0.3.0-rc2.post1(09-14,帶發行說明的 Release)。
  • FlagCX:v0.14.0-rc2.post1(09-14)到 rc2.post2(09-17/18 核驗)。
  • FlagTree:0.7.0rc2.post1 的 Triton 3.6 / 3.5 / 3.3 三條線與 0.7.0rc2+xpu3.6(09-14);09-17 增補 0.7.0rc2 的 metax、mthreads、enflame、tsingmicro 等後端標籤;09-18 崑崙芯 xpu 線再迭代出 0.7.0rc3+xpu3.6(標籤實測)。
  • FlagAttention:v0.4.0-rc2.post1。
  • 其餘元件(09-14 集中打標,rc2.post1):FlagFFT v0.2.0、FlagDNN / FlagTensor / FlagAudio / FlagBLAS v0.3.0、FlagGems-vllm v0.2.0、FlagGems-sglang v0.1.0、Torch-FL v0.2.0、sglang-plugin-FL v0.2.0、TransformerEngine-FL / Megatron-LM-FL v0.3.0、FlagOS-Compressor v0.1.0、KernelGen v2.2.0、KernelGenBench v0.2.0、FlagRelease v0.3.0;FlagScale 為 v2.1.0-rc2.post1(已跳出 2.0 線);vllm-plugin-FL 走 0.3.0 與 0.2.2 兩條版本線。

映象與製品狀態

  • 全 20 後端重建:09-20 03:07 的授權提交(#938)發出後,機器人賬號在一個多小時內按後端逐個記錄新映象 tag;記錄到的 2.2.0-0.3.0rc2.post2 一檔覆蓋昇騰(cann8.5.0、cann9.0.0 及 910c 變體)、寒武紀(neuware4.4.3 / 4.7.2)、摩爾執行緒(musa4.3.6 / 5.2.0)、燧原(tops1.9.10 / 1.10.6)、沐曦(maca3.7.2.1 / 3.8.1.3)、海光(dtk26.04)、天數(corex4.5.0)、崑崙芯(xre5.37.1)、中昊芯英(tangrt1.2.0)與英偉達(cuda12.8 / 13.3);外掛版本線 0.2.2rc2.post2 另有一批先行落地。
  • 分發通路合併:外掛 wheel 改為一次構建、釋出到全部廠商索引(#934),版本號改從 git ref 推導(#932);執行時依賴改從廠商索引獲取(#930);昇騰線補齊 cann-shmem 軟體包(#939)。
  • 可核對化三件事:映象自報實際安裝的外掛版本(#937)、從未構建過的映象在文件中顯式標註 TBD(#948)、逐個映象標註實際編譯的 FlagTree 底座(#953);狀態矩陣統計口徑同步寫死(#932/#933)。
  • 釘版回擺與相容處理:09-20 將英偉達 cuda13.3(#940)與沐曦兩個 MACA 後端(#943)釘回 FlagTree 0.6.1、燧原 tops1.9.10 釘回 0.6.0(#944);配套按釘版狀態禁用 FlagTune 成本模型(#947)——與本週前段的抬版動作形成一組完整的「回擺 + 適配」。
  • 昇騰與釋出件:FlagTree wheel 上傳通路首次走通(flagtree-0.7.0rc2+ascend3.5 與 flagtree-0.6.0+ascend3.2 到達製品庫,構建耗時 26 / 14 分鐘);build-infra 倉庫自身標籤仍停在 v2.1.1,v2.2.0 標籤在視窗內尚未落下。

三、元件與程式碼共建

本週 org 內五期視窗提交數為 98 / 119 / 150 / 147 / 206 條,合計約 720 條(09-17 與 09-18 兩期視窗存在約 1.4 小時重疊,含少量重複計),以下按模組聚合。

運算元與領域庫(FlagGems 及各領域庫)

  • FlagGems(主線,本週第一條線):五期視窗提交 12 / 43 / 71 / 40 / 38 條,合計約 200 條。三條產能線並行:KernelGen 批次入庫(一週注入 Nvidia 運算元 50 個以上,覆蓋線性代數、特殊函式、訓練反向、池化取樣四類,代表性條目含 nanquantile、logdet、linalg_polar、GRU 與 LSTM 反向核、Lanczos 上取樣反向、fused_adagradfused_sgd);KMCompiler 逐運算元補齊(昇騰 matrix_rank、igammac、gru、adaptive_max_pool3d、linalg_solve_triangular;海光與沐曦共用 linalg_lstsq 多後端實現);崑崙芯 TLE 改造(sum / sum_dim 遷往 tle.gpu,並完成約十項後端修復批次:grouped_mm 大 M 小 K 的 persistent kernel、SDPA 注意力、mse_loss 全塊掩碼等)。
  • 量化主線:海光 W8A8 INT8 GEMM(#6185,長 K 規約溢位保護)與 TLE 啟用(#6247);摩爾執行緒 W8A16 FP8 RMSNorm(#6210)與原生 FP8 W8A8 矩陣乘(#6211);沐曦 W8A16 RMSNorm(#6326);FP8 topk 選路(#4412)。量化覆蓋正從矩陣乘一層向歸一化與相鄰運算元擴散。
  • 後端修復與擴容:海光 DCU FlashAttention 前反向修復(#5822)、融合 rrelu 後端核(#6379);達摩院玄鐵 PPU 後端啟用 TLE(#6423);沐曦 masked_fill 越界與非法配置修復(#6480);昇騰專用線性運算元(#6456)、swiglu 與 grouped_matmul(#6324 / #6325)、Top-K(#6354);崑崙芯 FlagTree 依賴升到 0.6.1+xpu3.6(#6393)、主動回退 tle.raw 標量比較快路徑(#6409)、修復 masked_fill / sinh / mish / hardswish / index_fill 五運算元(#6328)。
  • 工程質量:修掉 linalg_svd 的 16×16 掛死(#6301)、addmv 標量 bias 的 dtype 不匹配(#6149)、nansum 整型 dtype(#6351);七個後端子包的 init.py 補齊;運算元匯出檢查、KernelGen 測試標記只掃新增行、基準 pytest 標記與運算元登記對齊(#6489);AMD W7900D 進入周測矩陣(#6312)。
  • FlagGems-Experimental(試驗田):海光 17 個運算元一小時內批次入庫(含特殊函式、線性代數、數值與索引類,另附 _scaled 修復);摩爾執行緒補 cholesky_inverse、linalg_ldl_solve、ormqr 等;崑崙芯補 mvlgamma;09-17 修 MetaX index_select(#419)、補 conv_depthwise2d(#391)與 dense_dim(#639);09-20 再落十個 Nvidia 小運算元(稀疏與檢視類,從試驗田向主線擺渡的前置環節)。
  • FlagSparse:以合併提交引入外部協作分支(NCIC-AlphaSparse),並以 39 條提交推進 MUSA、MACA、DCU 三後端適配(含 spgemm 單雙精度測試分離、C 包裝層新增,期間有一次成批迴滾後重新收斂)。
  • FlagFFT:36 個 FFT 運算元一次性轉入驗收態(+2151/-2298,配 NumPy 獨立校驗與執行時計劃),隨後把驗收覆蓋寫成強制項;09-17 為 MUSA 與 MACA 各留三維轉置驗證記錄並統一 Triton JIT 執行時依賴釘版;視窗末段連續重構驗收框架(管道流轉、日誌裁決、按需重生成)。
  • FlagDNN:重組天數智芯與海光兩個平臺的實現架構,新增文字求和運算元,四平臺(PPU / 摩爾執行緒 / 昇騰 / 天數)測試面收斂。
  • FlagBLAS 與 FlagAudio:FlagBLAS 修正達摩院玄鐵後端的打包配置;FlagAudio 合入首批三個 PR(頻譜圖 Triton 運算元、增益恆等檢查與延遲匯入、打包收尾),均為外部貢獻者分支,另加 CI 的上傳通路。

編譯器與通訊庫(FlagTree 與 FlagCX)

  • FlagTree:釋出件工程三條(DEB 打包矩陣補 ubuntu22.04 / python3.12、釋出包改走共享工作流推 Nexus、剝掉 libtriton 與 libproton 除錯資訊),打包基線與 wheel 版本號打通;編譯器側推進 FlagTune 託管 Manifest 與執行時相容處理、為天數智芯建 iluvatar3.6 基線與測試工作流、統一 FlagGems 測試模板的後端初始化介面、tle.signaltle.signal_wait 前端把同步範圍與記憶體序暴露為顯式引數(對應 FEP-0096 分散式原語方向);另有 CommonIR 轉換接入 Triton 3.6、tle_raw 最佳化 sort 運算元、Hopper WGMMA 跨 dtype 累加器複用、XPU 側 do_bench 除零修復。
  • FlagCX:交付面把 libflagcx.so 打進 wheel、統一天數智芯構建鍵、Nexus 上傳換成共享工作流、Fedora 43 進入英偉達 RPM 矩陣;介面面把 lane mask 由 32 位放寬到 64 位(為晶片規模擴大預留);工具面把 PTD 效能日誌轉換改為流式處理(避免大規模壓測下記憶體耗盡)、修正 KV 等價吞吐口徑;後端面接入達摩院玄鐵 PPU(CI 與 torch 外掛兩步走)、補天數裝置 API 預設路徑。

推理與訓練框架

  • Torch-FL:六平臺 FlagGems-first 落地後,一週內以其後的繞行、開關與門禁收尾——具名繞行(MetaX 切片運算元、MUSA 複數旋轉位置編碼留裝置側)、顯式開關(CI 釘回上一個可用 FlagGems 提交、USE_FLAGTUNE=0、構建期加速器配置寫入 wheel)、門禁建設(PPU 探測、平臺清單外接、全平臺跟蹤 FlagGems master);環境變數面統一收口為 FLAGOS 一套字首;解耦的 DCU wheel 修復 torch.cuda 可用性;視窗末段圍繞 Qwen-Image 2.1 與 2512 在多晶片上的效能成線(GCU 單步降至 7.1 s/it,DCU 排程開銷連續壓降,最終給出吞吐曲線與尾延遲測量)。
  • FlagGems-vllm:海光與達摩院玄鐵對照實現 moe_sum;摩爾執行緒 MTT S5000 加 persistent_topk;昇騰補 SparseAttnSharedKV(DeepSeek-V4 稀疏注意力結構,單筆 +9637,六個固定形狀、以精度為驗收口徑)與 persistent_topk,並把廠商運算元收納到統一目錄;融合 Marlin MoE(INT8 / FP8 兩種 W8A16 權重)與 FP8 變長 FlashAttention-2 補上推理側「變長批與 MoE 稀疏啟用」兩類真實形態;視窗末段繼續補 MUSA 的 fused_q_kv_rmsnorm、沐曦 varlen 注意力、昇騰 kda_gate_cumsum。
  • FlagGems-sglang:承擔競賽成果落地通道——09-14 單日 10 個競賽分支 PR 合入主倉(bmm-chunk、decode-attention、fused-rmsnorm-warp2、task19 / task21-moe-sum-reduce 等);後續內建上游測試工具、匯入多模態旋轉位置編碼融合運算元、把 do_bench 改為按廠商分派的單一函式、登記 moe_fused_mul_sum 競賽運算元並給出 batch3 的參考、測試、基準與文件一批。
  • vllm-plugin-FL 與 sglang-plugin-FL:前者開啟海光 vLLM 0.24.0 工作流、接入 metax CI、把燧原 S60 與崑崙芯抬到 0.24 線、接入達摩院玄鐵 PPU CI、修崑崙芯 FlashAttention 狀態汙染、適配天數 BI-V150;後者為海光 DCU 與燧原 GCU 各建 CI 管線(海光線以 AMD adaptor 構建 FlagCX v0.13.0),dispatch 單測與平臺配置解耦併為預載入加基準。
  • FlagScale 與訓練核心線:FlagScale 把各加速器平臺上互相耦合的 CI 依賴統一收口、修復 fork PR 依賴產物快取隔離;TransformerEngine-FL 從主線 cherry-pick 修復;Megatron-LM-FL 把硬編碼 CUDA 裝置操作替換為平臺感知 API(覆蓋最佳化器、初始化、訓練與工具路徑);FlagScale-Agent 加固 agent harness;FlagPrism 統一運算元驗收測試、新增燧原偵錯程式與 TOPSPTI 效能分析支援。

釋出工程與治理(build-infra / community / docs)

  • build-infra:除第二節的版本抬升與映象線之外,本週還新增 FlagCX wheel 打包線(構建、校驗、釋出三步)、記錄海光 rc2.post1 雙映象 tag 並複驗、把海光的 gflags 標頭檔案依賴坑記錄成檔、把映象 tag 與版本標籤成對記錄成為各後端進入 2.2 交付範圍的直接憑據。
  • community:2.2 釋出治理從人工看板搬進自動化(每 15 分鐘同步 issue 到組織專案檢視,釋出狀態由關聯 PR 推導,RC 驗證規則寫入說明);20 份 FEP 與 RC2 清單維護均由釋出經理線推進。
  • docs:文件線併入本輪 CICD 改造(new/flagcicd 分支與 main 合併),線上實驗室幫助內容兩輪更新。

量子與新興方向

  • FlagQuantum(本週擴速最快的方向之一):09-14 一天內完成 Twin API 凍結與 QPU 數字孿生歷史序列管理(校準與驗證歷史、候選比較、序列恢復成鏈);隨後按電路拓撲定級 Twin 證據、接入 JAX 前端測試並把覆蓋率下限寫進合約檔案(60% 到 75% 兩級抬升)、包級嚴格型別檢查、量子糾錯記錄層落地(與具體編碼方案解耦);視窗末段由單一貢獻者連續鋪設演算法原語包,從量子傅立葉變換、相位估計、Grover 搜尋、振幅估計一路鋪到 QUBO 到 Ising 對映、量子核方法、量子 PCA、k-medians 等應用層原語。
  • FlagTrain:09-16 新倉庫落位(佔位建倉,規模 5 KB),訓練側又切出一塊,程式碼落位待觀察。
  • Open3D-PIMC:09-14 開源釋出、09-16 程式碼落地(662 個條目:編譯層 raisa-inductor 的 pass 體系與編譯快取鍵、C++ 執行時 rcs2,README 把記憶體層級、分片拓撲、動態推理與編譯產物複用四個待補缺口寫明);與 FlagOS 的 3D 算力晶片方向直接相關,不進 2.2 驗收範圍。
  • flir(FlagTree IR):對齊上游 bufferization 語義(去掉 tile.to_tensor 的 Pure 標記)、修記憶體效應標記、統一 triton 版本標識口徑。

四、成員單位與廠商適配

  • 海光:量化(W8A8 INT8 GEMM)、TLE 啟用、融合 rrelu 後端核、DCU FlashAttention 前反向修復四條線並進;解耦 DCU wheel 修好 torch.cuda 與 Qwen-Image 流;FlagSparse DCU 線(sddmm 測試、spgemm 精度分離);為 vLLM 0.24.0 開啟工作流;映象 dtk26.04 完成 rc2.post1 複驗與 post2 重建。
  • 昇騰:MoE 與線性注意力所需運算元最密的線——SparseAttnSharedKV、persistent_topk、kda_gate_cumsum、grouped_topk(走 TLE 的 DSA 原始介面)、專用線性運算元、swiglu 與 grouped_matmul;CommonIR 概念驗證在 FEP 中標記為已實現(限 910B / 910C 的 Triton 3.5 線);FlagTree wheel 上傳通路走通;四個映象變體(cann8.5.0 / cann9.0.0)完成重建並補 cann-shmem。
  • 摩爾執行緒:原生 FP8 W8A8 矩陣乘與 W8A16 FP8 RMSNorm 兩條量化路徑落地;MTT S5000 的 persistent_topk 與 MUSA 旋轉位置編碼裝置側執行;FlagTree 跳級到 0.7.0rc2+mthreads3.6;首個帶外掛的 0.20.2 映象落成;FlagPrism 的 profiler 與 debugger 整合進編譯器鏈。
  • 沐曦:W8A16 RMSNorm、FP8 topk 選路、varlen 注意力最佳化與 masked_fill 越界修復;為 vLLM 開啟 metax CI 並抬到 0.24 線;FlagSparse MACA 線適配;產業側完成上海人工智慧實驗室 ATRIA Dawn Preview 的 Day0 適配(公司口徑累計 37 個旗艦模型),中報扭虧、09-17 解禁視窗與股價異動為資本面記錄。
  • 燧原:廠商分支成批同步回主線;S60 適配 vLLM 0.24 線、GCU CI 管線、GCU300 記錄進 0.24.0 報告;FlagPrism 新增燧原偵錯程式與 TOPSPTI 支援;兩個 tops 映象完成重建;融資與上市解讀持續(09-11 登陸科創板)。
  • 天數智芯:iluvatar 構建鍵統一、併入裝置控制介面 /dev/itrctl、FlagTree 為其建 iluvatar3.6 基線與測試工作流;FlagDNN 平臺架構重組與測試面收斂;適配 vLLM 0.24 線;corex4.5.0 映象完成重建。
  • 崑崙芯:單日約十項後端修復批次(grouped_mm persistent kernel、SDPA、mse_loss 等)把近期運算元迴歸清倉;xCCL 裝進基礎映象;sum 遷移 tle.gpu;修 FlashAttention 模組匯入的狀態汙染;主動回退未獲穩定收益的 tle.raw 快路徑與 0.6.1+xpu3.6 釘版;xpu 標籤迭代到 0.7.0rc3+xpu3.6。
  • 達摩院玄鐵:PPU 後端在 FlagGems 啟用 TLE、在 FlagCX 與 vllm-plugin-FL 接入 CI(含 torch 外掛)、在 Torch-FL 門禁中顯式探測;補 moe_sum 變體並接收 KernelGen 運算元擺渡;已在 FlagTree 2.2 多後端規劃(FEP-0098)中佔位,雙線參與度持續加深。
  • 清微智慧:Open3D-PIMC 開源釋出與程式碼落地(與智源聯合開發);分散式原語在後端啟用,與 2.2 的 TLE 分散式路線合流。
  • 地平線:旗下地瓜機器人(D-Robotics)完成 4 億美元 C 輪融資,為成員體系本週最重的產業事件。
  • 智源(牽頭方):主導 RC2 治理與 FEP 治理落地、20 份 FEP 的釋出邊界定義、Open3D-PIMC 聯合開發與「定義硬體形態」方向的表述;釋出件與治理節奏均圍繞其牽頭推進。

五、生態與社群

賽事與開放競賽

  • SGLang 跨晶片運算元最佳化賽產出持續進入主倉:09-14 單日 10 個競賽分支 PR 合入 FlagGems-sglang;視窗後段 moe_fused_mul_sum 等競賽運算元完成登記入庫(#87),batch3 參考、測試、基準與文件一併落庫。競賽正在成為 FlagOS 的常態化外部運算元供給線。
  • FlagOS 與 MiniCPM 模型推理吞吐效能最佳化挑戰賽:開發與提交階段 2026 年 9 月 21 日至 11 月 20 日,12 月初評審;面向 FlagOS 棧上的推理吞吐最佳化,是繼運算元最佳化賽之後社群賽事體系的延續。

會議與開源釋出

  • 2026 人工智慧開放計算大會暨眾智 FlagOS 技術大會:10 月 17 至 18 日在北京中關村國家自主創新示範區展示中心舉辦,主題「一棧貫通,智算無界」,09-18 開啟報名;工作坊選題(KernelGen、端側、TLE Attention、FlagScale-Agent)與本週工程觀察一一對應。
  • Open3D-PIMC 開源釋出:09-14 中國算力大會宣佈、09-16 程式碼上線;由清微智慧與智源聯合開發,定位為 FlagOS 面向下一代 3D 算力晶片的主要解決方案之一,並預告四季度在全球科技頂會發布最佳化成果。

新聞面與外部渠道

  • 元件級新聞檢索連續第十一至第十五個平靜視窗:整週 24 小時視窗內零有效命中,對外動態事實以 GitHub org 與社群渠道(智源社群、知乎機構號、CSDN 專欄)為準;成員單位側可見報道集中在資本面與自有棧 Day0 適配。
  • 收錄邊界說明:智源社群平臺上與本棧無介面的第三方內容(如紫東太初模型開源稿)未計入;純市場行情稿與股價異動僅作背景記錄。

六、趨勢觀察

  • 2.2 進入釋出件凍結與裝配階段:全域性開關(version 2.2.0)落下、全後端映象批次重建、釋出件可核對化三件事同步完成;測試期僅剩一週,剩餘風險集中在「裝得上、跑得對」而非功能缺口,Go/No-Go 依據正在從「人看清單」轉向「狀態可推導」。
  • 分派層成為「一套運算元庫跨晶片複用」的兌現層:六平臺 FlagGems-first 給出了首次完整量化(PPU 線落定為 435 條 FlagGems 路由對 1601 條廠商核心路由),繞行名單(PPU 47 項、MetaX 切片、MUSA 複數旋轉位置編碼、CUDA 側 FlagTune 缺位)的長度就是跨晶片複用率的反向指標;「路由加繞行名單,加門禁」成為可複用的機制模板。
  • 多後端適配形態分化:向上走與往回擺並存:摩爾執行緒拿到 FlagTree 跳級與首個帶外掛映象、昇騰 wheel 上傳走通屬向上;英偉達 / 沐曦 / 燧原釘回 0.6.x 與崑崙芯回退 tle.raw 快路徑屬回擺——後者與「寧可不修,也不破壞已驗證的格子」的 RC 紀律同源,是平臺適配進入穩定期的訊號。
  • 運算元擴容雙主線清晰,瓶頸從寫核心轉向登記與驗收:量化(W8A8 / W8A16 / FP8,從矩陣乘擴到歸一化與取樣)與 MoE / 線性注意力(分組矩陣乘、swiglu、稀疏共享 KV、門控 Delta 規則)直接對應當前推理模型的真實結構;隨 KernelGen 批次入庫而來的匯出檢查、測試標記、基準對齊與驗收框架重構,說明擴容瓶頸已轉向登記與驗收。
  • 測試與質量基建平臺化:達摩院玄鐵 PPU 接入多家 CI、天數智芯建立 iluvatar3.6 基線、FlagTree 抽統一後端初始化介面、FlagQuantum 覆蓋率下限與型別檢查收緊——不同形態的動作指向同一目標:讓每個後端都在 CI 裡被持續驗證,而不是靠人工跑通。
  • 下一版輪廓已在文件中成形,生態運營密度即將上升:RISC-V 實驗性支援、端側 SDK、作業系統打包、具身智慧與科學智慧工作組已出現在 FEP 規劃中,T-Head、燧原、摩爾執行緒的新後端進入 FlagTree 2.2 規劃;FlagTrain 建倉、FlagAudio 轉實、Open3D-PIMC 落地顯示新方向在持續開枝;10 月大會與 9 月下旬開賽的挑戰賽將使生態運營密度顯著上升,預計下一個報道高峰在 09-28 釋出視窗。

附錄:素材與核查