調研視窗:2026-09-18 10:18 ~ 2026-09-20 10:18(約 48 小時,含週末;承接 09-18 日報視窗,無空檔) 信源:GitHub(org: flagos-ai,54 倉庫 pushed_at 全量核查;視窗內 20 個倉庫 206 條提交逐條核驗)、Google News RSS(中英文 24 組查詢詞,走代理)、智源社群、知乎機構號、CSDN FlagOS 專欄等(詳見附錄信源清單)


本期索引

  • 今日重點:build-infra 全 20 後端 vLLM 映象批次授權重建,2.2 釋出件進入 rc2.post2 裝配(09-19/09-20)
  • 一、開源專案進展(GitHub 動態)
    • 1.1 build-infra:20 個後端 vLLM 映象授權重建,外掛 wheel 改「一次構建、全廠商分發」(09-19/09-20)
    • 1.2 build-infra:FlagTree 釘版策略收緊至 0.6.x,FlagTune 成本模型按釘版禁用(09-20)
    • 1.3 FlagGems:KernelGen 持續入庫,崑崙芯後端單日批次修復約十項(09-20)
    • 1.4 FlagGems:達摩院玄鐵 PPU 後端啟用 TLE,海光 DCU Flash Attention 修復(09-20)
    • 1.5 FlagSparse:MUSA / MACA / DCU 三後端適配密集推進(09-18~09-20)
    • 1.6 FlagQuantum:演算法原語包大擴張——QFT、相位估計、Grover、QUBO 等十餘項(09-18~09-20)
    • 1.7 Torch-FL:Qwen-Image 2.1 / 2512 多晶片效能最佳化成線(09-18~09-20)
    • 1.8 其餘動態:FlagTree、FlagGems-sglang、FlagGems-vllm、FlagFFT、FlagPrism 等(09-18~09-20)
  • 二、新聞報道與生態
    • 2.1 元件級檢索連續第十五個平靜視窗:48 小時零命中(09-18~09-20)
    • 2.2 2026 人工智慧開放計算大會暨眾智 FlagOS 技術大會開啟報名:10 月 17-18 日北京(09-18)
    • 2.3 FlagOS × MiniCPM 模型推理吞吐效能最佳化挑戰賽:9 月 21 日開放提交(近期釋出)
  • 三、成員單位深挖
    • 3.1 崑崙芯:FlagGems 後端修復批次落地(09-20)
    • 3.2 摩爾執行緒:MUSA 線運算元與映象雙推進(09-20)
    • 3.3 海光:DCU Flash Attention 修復與 Qwen-Image 效能線(09-20)
    • 3.4 達摩院玄鐵:PPU 後端啟用 TLE,KernelGen 運算元入主線(09-19/09-20)
    • 3.5 沐曦:MACA 線 FlagSparse 適配與映象記錄(09-19/09-20)
    • 3.6 天數智芯:FlagDNN 測試面收斂(09-19/09-20)
    • 3.7 昇騰:映象重建、專用線性運算元與 kda_gate 運算元(09-20)
    • 3.8 摩爾執行緒 / 燧原 / 沐曦映象與工具面(09-20)
  • 四、總結與趨勢觀察
  • 附錄:信源核查表
  • 附錄:完整信源清單

今日重點:build-infra 全 20 後端 vLLM 映象批次授權重建,2.2 釋出件進入 rc2.post2 裝配

日期:2026-09-19、2026-09-20 來源build-infra #938build-infra #956build-infra #934

本視窗 build-infra 以 43 條提交成為 org 內最密的一條線,動作高度集中:為全部 20 個後端 vLLM 映象授權 2.2.0 / 外掛 post2 重建,並把重建結果逐一向後回寫。09-20 03:07 的 app changelogs: authorize the 2.2.0 / plugin-post2 rebuild for all 20 images(#938)是發令槍,隨後從 09-20 03:07 到 10:28 的一個多小時裡,機器人賬號按後端逐個記錄新映象 tag;09-20 09:43 又補一條 authorize the 2.2.0 / plugin-post2 rebuild for all 20 vllm 0.24.0 images,把這一輪重建的範圍與基線(vLLM 0.24.0)明確到標題裡。

記錄到的映象 tag 覆蓋 org 的全部後端矩陣:2.2.0-0.3.0rc2.post2 一檔落在昇騰(cann8.5.0、cann9.0.0 及兩個 910c 變體)、寒武紀(neuware4.4.3 / 4.7.2)、摩爾執行緒(musa4.3.6 / 5.2.0)、燧原(tops1.9.10 / 1.10.6)、沐曦(maca3.7.2.1 / 3.8.1.3)、海光(dtk26.04)、天數(corex4.5.0)、崑崙芯(xre5.37.1)、中昊芯英(tangrt1.2.0)與英偉達(cuda12.8 / 13.3);更早一檔 0.2.2rc2.post2(外掛版本)先行落過一批。單視窗內 20 個後端映象全部重新整理,是本視窗 org 內規模最大的一個動作。

與之配套的是外掛 wheel 的分發方式變更:09-19 23:34 的 vllm-plugin wheel: build once, publish to every vendor index(#934)把「每個廠商各構建一次」改為「一次構建、釋出到所有廠商索引」,隨後兩條提交把版本號改為從 git ref 推導(#932)、修復 runs-on 引數拆包問題(#935)。這條鏈把外掛分發從「N 次構建」壓成「1 次構建 + N 次釋出」,是釋出工程上的一次結構性最佳化。

另一條並行的收尾線是把「映象到底裝了什麼」變成可核對的事實:vllm app image: read the installed plugin version past the entrypoint(#937)讓映象自報外掛版本;docs: print TBD for an app image that was never built(#948)把從未構建過的映象在文件裡明確標為 TBD;changelogs: name the FlagTree each 2.2.0 vllm image actually builds on(#953)逐個映象標註實際編譯底座。三處都在減少「文件與製品不一致」的空間。

把視窗內的動作並排看:2.2 的釋出件裝配已經走到「全後端映象批次重建 + 版本可核對 + 分發通路合併」的階段,距釋出時間表上的 GA(2026-09-28)還剩 8 天,屬於測試與穩定期內的正常推進節奏。


一、開源專案進展(GitHub 動態)

視窗總覽:org 內 54 個倉庫中 20 個在本視窗有提交,合計 206 條(跨 48 小時、含週末),分佈為:build-infra 43、FlagSparse 39、FlagGems 38、FlagQuantum 23、FlagGems-sglang 10、FlagGems-Experimental 10、Torch-FL 9、FlagDNN 6、FlagFFT 5、docs 4、FlagTree 4、FlagGems-vllm 4、vllm-plugin-FL 2、FlagPrism 2、FlagBLAS 2、FlagCX 1、FlagAttention 1、FlagAudio 1、FlagScale-Agent 1、TransformerEngine-FL 1。

本視窗形態 = 「釋出件批次裝配」+ 「後端修復潮」兩條線:build-infra 拉動全後端映象重建與分發通路合併;應用側(FlagGems / FlagSparse / Torch-FL / FlagGems-vllm)出現多晶片後端的密集修復與效能調優,其中崑崙芯與海光 DCU 的修復量最為集中;治理側(FlagQuantum 演算法原語、FlagTree TLE)繼續按 2.2 路線圖鋪開。09-19(週六)各倉合計約 12 條提交,開發活動跨週末連續未斷。

1.1 build-infra:20 個後端 vLLM 映象授權重建,外掛 wheel 改「一次構建、全廠商分發」(09-19/09-20)

日期:2026-09-19、2026-09-20 來源build-infra #938build-infra #934build-infra #939

詳見「今日重點」。補充兩點:其一,cann9.0.0 後端在 09-20 04:00 增加了 cann-shmem 軟體包(#939),為昇騰 9.0 線的共享記憶體元件補齊依賴;其二,09-18 15:47 的 Runtime: fetch vendor deps from the vendor index(#930)開始把執行時依賴改從「廠商索引」獲取,配合 09-18 13:50 刪除舊容器檔案(#929),容器構建的來源與事實源開始收斂到統一索引。

1.2 build-infra:FlagTree 釘版策略收緊至 0.6.x,FlagTune 成本模型按釘版禁用(09-20)

日期:2026-09-20 來源build-infra #940build-infra #943build-infra #944build-infra #947

09-20 晨間連續三條「釘版」提交:nvidia-cuda13.3: hold flagtree at 0.6.1(#940)、metax: hold flagtree at 0.6.1 for both MACA backends(#943)、enflame-tops1.9.10: hold flagtree at 0.6.0(#944)——把三個後端的編譯器底座釘回 0.6.x 線(對應此前的抬版動作形成回擺);隨後 runtime: disable the FlagTune cost model where flagtree 0.6.x is pinned(#947)說明 FlagTune 成本模型與 0.6.x 釘版不相容,需按釘版狀態禁用。三條釘版 + 一條相容性處理構成一組完整的「回擺 + 適配」。

另有一條狀態矩陣修正:status matrix: drop the merged entries from megatron's prs(#933)、status matrix: prs = open PRs, md = recen…(#932 前部)把狀態矩陣的統計口徑寫死(PR 列=開放 PR、md 列=最近提交)。

1.3 FlagGems:KernelGen 持續入庫,崑崙芯後端單日批次修復約十項(09-20)

日期:2026-09-20 來源FlagGems #5917FlagGems #5878FlagGems #6317FlagGems #6476

FlagGems 本期 38 條提交仍以 KernelGen 產出為底色:Nvidia 側新增 _fused_adagrad_(#5917)與 _fused_sgd_(#5878)兩個最佳化器融合運算元;Experimental 倉庫(見 1.8)當日另有十個 Nvidia 運算元入庫。本期最集中的一條線是崑崙芯後端修復:binliu 連續落下約十筆提交,覆蓋 grouped_mm 大 M / 小 K 形狀的 persistent kernel 排程與按形狀自動調優、SDPA 注意力修復(保留 value-1 引數非特化、收斂自動調優)、mse_loss 階段一改全塊掩碼(#6476)、scatter / log_sigmoid_backward / amp_foreach、fill / add_relu / special_log1p / dequantize、pow / pdist / 勒讓德多項式、segment_reduce / arcsinh / cosh / acosh / log2 / log10、bessel_y1 / bernoulli、t_copy / selu / reflection_pad2d、log_softmax / logical_not 以及 lgamma 遷移誤刪修復等,幾乎把該後端近期運算元迴歸「清倉」。

工具側兩條:[KMCompiler] operator linalg_lstsq bug fix(#6499)、[KMCompiler] fix fp64 error(#6491)與 delete uint8 dtype(#6477);MThreads 側修復 feature_dropout_ 恢復與拆分(#6490、#6482)。基準與 CI 側:Fix(benchmark): align pytest markers and op_name with operator registry ids(#6489)、ci: run pre-check jobs on basic-runner-cpu(#6431)。

1.4 FlagGems:達摩院玄鐵 PPU 後端啟用 TLE,海光 DCU Flash Attention 修復(09-20)

日期:2026-09-20 來源FlagGems #6423FlagGems #5822FlagGems #6456

三筆重量級後端提交:[T-Head] Enable TLE for PPU backend(#6423)把 Triton 語言擴充套件(TLE)在達摩院玄鐵 PPU 後端開啟,與該方向在 2.2 多後端規劃中的位置對應;[Hygon] Fix Flash Attention forward/backward kernels on DCU(#5822)修復海光 DCU 上前反向 Flash Attention 核;[Ascend] Add specialized linear operator(#6456)為昇騰補一個專用線性運算元。另 [MetaX] Fix masked_fill broadcast OOB and illegal num_warps=16(#6480)修正沐曦線上一個越界與非法配置。

1.5 FlagSparse:MUSA / MACA / DCU 三後端適配密集推進(09-18~09-20)

日期:2026-09-18 ~ 2026-09-20 來源FlagSparse #73FlagSparse #71

FlagSparse 本期 39 條提交幾乎全部來自合作方的雙分支協作流(NCIC-AlphaSparse 的兩個賬號交替合併),動作主題是三後端適配:MUSA(摩爾執行緒)線落 musa updates;MACA(沐曦)線落 maca spsm debugmaca test commands;DCU(海光)線落 dcu updatesdcu sddmm testsci dcu 以及 dcu spgemm test fp32 fp64 sperated(把 spgemm 的單雙精度測試分開)。另有 cwrapper add(C 包裝層新增)與一次對「New update」的 revert(#63 回滾、#64 撤回),以及文件整理。整體是把稀疏運算元庫向國產三後端做實的過程。

1.6 FlagQuantum:演算法原語包大擴張——QFT、相位估計、Grover、QUBO 等十餘項(09-18~09-20)

日期:2026-09-18 ~ 2026-09-20 來源FlagQuantum #85FlagQuantum #91FlagQuantum #104

FlagQuantum 本期 23 條提交由單一貢獻者(Wei LIU)連續推進,主題是演算法原語包的系統性鋪設:從演算法原語包與量子傅立葉變換(#85)起步,接連落運算元協議與相位估計(#87)、態製備(#88)、多控 X 與可逆位串比較器(#89)、真值表預言機合成(#90)、Grover 搜尋(#91)、振幅估計(#92);隨後進入應用層——QUBO 到 Ising 對映(#86)、量子核估計與經典核嶺分類器(#100)、基於量子主成分分析的相位估計(#98)、Grover 量化 k-medians(#99)、QUBO 特徵選擇(#101)、振幅估計求頻繁項佔比(#102)、相位估計估計奇異值(#104)。工程質量兩條:覆蓋率與型別檢查等門禁延續近期的「嚴格化」路線;功能側一條是量子糾錯(QEC)記錄層的檢測器錯誤模型(#84,對應提案 048 的 stage 2a)。01-09 層之外,還有一條來自 build 治理側的操作:限制該倉庫佔用的 org 級 runner 份額(與近期 CI 資源治理同題)。

1.7 Torch-FL:Qwen-Image 2.1 / 2512 多晶片效能最佳化成線(09-18~09-20)

日期:2026-09-18 ~ 2026-09-20 來源Torch-FL #360Torch-FL #356Torch-FL #353

Torch-FL 本期 9 條提交由單一貢獻者(nate.river)圍繞 Qwen-Image 系列在多晶片上的效能成線:先用 test: add the Qwen-Image-2.1 manual test flow for chip bring-up(#342)建立手測流程,隨後連續最佳化——修復 DCU 的 SDPA 後端選擇與逐點路由(#345)、削減 DCU 側 FlagGems 排程 / 佈局 / 自動調優開銷(#352)、讓 GCU 的 Qwen-Image-2512 單步降到 7.1 s/it(#354,SDPA 路由 + GEMM 運算元處理)、把 Qwen-Image-2.1 的 key-valid 掩碼接入 FlagGems SDPA 路徑(#353)、把 DCU 的 FlagGems 排程開銷繼續壓低(#356)、最終給出 Qwen-Image-2.1 的吞吐曲線與尾延遲 / 算術強度測量(#360)。這是一條「從可跑到跑到好」的典型晶片 bring-up 效能線。

1.8 其餘動態:FlagTree、FlagGems-sglang、FlagGems-vllm、FlagFFT、FlagPrism 等(09-18~09-20)

日期:2026-09-18 ~ 2026-09-20 來源FlagTree #1084FlagGems-sglang #93FlagGems-Experimental #659FlagPrism #13

  • FlagTree(4)[KMCompiler][TLERaw] Optimize the sort operator based on tle_raw(#1084)繼續 TLE Raw 路線;[TLE][CommonIR] Added CommonIR conversion integration on Triton 3.6(#1160)把 CommonIR 轉換接入 Triton 3.6;[QC][TLE] Support cross-dtype Hopper WGMMA accumulator reuse(#1001);[XPU] Guard do_bench against estimate_ms==0(#1224)修除零。
  • FlagGems-sglang(10)moe_fused_mul_sum 競賽運算元入庫並註冊(#87);batch3 參考、測試、基準與文件一批(#93);do_bench 改為按廠商分派的單一幫助函式(#94);昇騰 fused router K 迴圈流水限制為 2 級(#96)。
  • FlagGems-Experimental(10):KernelGen Nvidia 線當日再落十個運算元——sparse_dim_has_same_storage_numel_dimV_valuescol_indicesadjointatleast_2ddetach_copyccol_indices_copycrow_indices_copy(#640~#659),多為稀疏與檢視類小運算元,從 Experimental 向主線擺渡的前置環節。
  • FlagGems-vllm(4):MUSA 側最佳化 deepseek_v4 的 fused_q_kv_rmsnorm(#825);沐曦線最佳化 varlen flash attention(#808);昇騰線新增 kda_gate_cumsum 運算元(#809);KMCompiler 線給 fused_moe 精度基準加廠商原生精度門(#824)。
  • FlagFFT(5):驗收框架連續重構——捕獲資料走管道流轉並壓平結果樹、運算元日誌以平臺可讀的裁決收尾、輸入寫入方不再等待讀方、捕獲輸入改為按需重新生成(不再駐留磁碟)。
  • FlagPrism(2):統一運算元驗收測試並退役舊批次套件(#13);新增燧原偵錯程式與 TOPSPTI 效能分析支援(#12)。
  • docs(4):線上實驗室幫助內容更新(#509、#510 兩輪)。
  • FlagCX(1):裝置 API 預設路徑增加天數(Iluvatar)支援(#608)。
  • vllm-plugin-FL(2):在加速器圖中捕獲常見注意力後設資料(#442);天數 BI-V150 適配 vLLM 0.24 線(#526)。
  • FlagDNN(6):ppu / mthreads / ascend / iluvatar 四平臺測試修正與 run_test.py 修復;昇騰平臺架構改進。
  • FlagBLAS(2):修正 thead 的 pyproject.toml。
  • FlagAttention(1):一處修復提交(#63)。
  • TransformerEngine-FL(1):從 main 線 cherry-pick(#124)。
  • FlagScale-Agent(1):加固 agent harness——REPL 提示看門狗、跨會話提案登錄檔等。
  • FlagAudio(1):CI 增加 Nexus 上傳通路(#8)。

二、新聞報道與生態

2.1 元件級檢索連續第十五個平靜視窗:48 小時零命中(09-18~09-20)

日期:2026-09-18 ~ 2026-09-20 來源:Google News RSS(中英文 24 組查詢詞,走代理)

以 FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen 元件名及智源研究院等組合詞檢索,48 小時視窗內零命中(gnews 指令碼實測 0 條),連續第十五個平靜視窗。元件級新聞側的靜默已成為常態,本報告的對外動態事實以 GitHub org 與社群渠道(智源社群/知乎機構號)為準。

2.2 2026 人工智慧開放計算大會暨眾智 FlagOS 技術大會開啟報名:10 月 17-18 日北京(09-18)

日期:2026-09-18(釋出) 來源知乎機構號釋出

眾智 FlagOS 社群聯合北京智源人工智慧研究院、北京量子資訊科學研究院、中關村人工智慧開源聯盟(籌)等機構,將於 2026 年 10 月 17-18 日在北京中關村國家自主創新示範區展示中心舉辦「2026 人工智慧開放計算大會暨眾智 FlagOS 技術大會」,主題「一棧貫通,智算無界」。大會圍繞異構算力底座、開源 AI 系統軟體棧、量智融合、車載智慧、具身智慧、AI 智慧體基礎設施等方向設定議程;實操工作坊覆蓋 KernelGen 高效能運算元自動生成工程、FlagOS 賦能大模型端側推理、Triton-TLE 新型 Attention kernel 最佳化、FlagScale-Agent 架構設計與實戰等完整鏈路。報名通道已開啟(早鳥票限時優惠)。這是近期 FlagOS 生態最重要的對外活動節點,其工作坊選題與本期工程側觀察(TLE、KernelGen、端側、Agent)高度對應。

2.3 FlagOS × MiniCPM 模型推理吞吐效能最佳化挑戰賽:9 月 21 日開放提交(近期釋出)

日期:近期釋出(提交階段 2026-09-21 起) 來源知乎機構號釋出

FlagOS 與 MiniCPM 聯合舉辦模型推理吞吐效能最佳化挑戰賽,開發與提交階段為 2026 年 9 月 21 日至 11 月 20 日(UTC+8),12 月初評審。賽題面向 FlagOS 棧上的推理吞吐最佳化,是繼 SGLang 跨晶片運算元最佳化賽(”運算元島”爭奪戰)之後社群賽事體系的延續。


三、成員單位深挖

3.1 崑崙芯:FlagGems 後端修復批次落地(09-20)

日期:2026-09-20 來源FlagGems #6317FlagGems #6476

崑崙芯線在本視窗落下約十筆修復(詳見 1.3),從基礎逐元素運算元到 grouped_mm / SDPA 這類核心運算元均有覆蓋,其中最實質的是 grouped_mm 的「大 M / 小 K」形狀專用 persistent kernel 與按形狀自動調優——針對 MoE 場景的典型形狀做特化。配合 SGLang 側的 moe_fused_mul_sum 競賽運算元入庫,崑崙芯方向的 MoE 推理路徑在持續做實。

3.2 摩爾執行緒:MUSA 線運算元與映象雙推進(09-20)

日期:2026-09-20 來源FlagGems-vllm #825FlagSparse #73

MUSA 線兩條:FlagGems-vllm 中 deepseek_v4 的 fused_q_kv_rmsnorm 針對摩爾執行緒最佳化(#825);FlagSparse 的 MUSA 適配更新。映象側 musa4.3.6 / musa5.2.0 兩個後端的 2.2.0 映象完成 rc2.post2 重建記錄。此外 FlagGems-eXperimental 的 MThreads KernelGen 運算元批次(#6458)於 09-19 從 Experimental 擺渡主線。

3.3 海光:DCU Flash Attention 修復與 Qwen-Image 效能線(09-20)

日期:2026-09-20 來源FlagGems #5822Torch-FL #356

海光方向本期兩條硬活:FlagGems 修復 DCU 上 Flash Attention 前反向核(#5822,歷經 5822 號 PR 的長週期成熟);Torch-FL 削減 DCU 上 Qwen-Image-2.1 的 FlagGems 排程開銷(#356)。映象側 hygon-dtk26.04 完成 2.2.0 rc2.post2 重建。

3.4 達摩院玄鐵:PPU 後端啟用 TLE,KernelGen 運算元入主線(09-19/09-20)

日期:2026-09-19、2026-09-20 來源FlagGems #6423FlagGems #6460

玄鐵方向兩筆:[T-Head] Enable TLE for PPU backend(#6423)在 PPU 後端開啟 Triton 語言擴充套件——TLE 是 2.2 多後端規劃中面向跨硬體族的統一最佳化語言,T-Head 進入該路線;09-19 的 KernelGen cherry-pick 把 T-Head 運算元從 Experimental 擺渡回主線(#6460)。這與 09-18 期觀察到的「T-Head 進入 FlagTree 2.2 多後端規劃」形成連續跟進。

3.5 沐曦:MACA 線 FlagSparse 適配與映象記錄(09-19/09-20)

日期:2026-09-19、2026-09-20 來源FlagSparse #71build-infra #943

MACA 線:FlagSparse 的 maca spsm debug 與測試命令推進;build-infra 把兩個 MACA 後端的 FlagTree 釘版統一在 0.6.1(#943);maca3.7.2.1 / 3.8.1.3 兩個映象完成 2.2.0 重建記錄。FlagGems-vllm 側沐曦的 varlen flash attention 最佳化同屬該線。

3.6 天數智芯:FlagDNN 測試面收斂(09-19/09-20)

日期:2026-09-19、2026-09-20 來源FlagDNN 提交

FlagDNN 本期六條提交以測試面收斂為主:iluvatar / ascend / mthreads / ppu 四平臺測試修正與 run_test.py 修復,另有一條昇騰平臺架構改進。corex4.5.0 映象完成 2.2.0 重建記錄。FlagCX 側天數(Iluvatar)的 Device API 預設路徑支援(#608)與 vllm-plugin-FL 的 BI-V150 vLLM 0.24 適配(#526)同視窗落地。

3.7 昇騰:映象重建、專用線性運算元與 kda_gate 運算元(09-20)

日期:2026-09-20 來源FlagGems #6456FlagGems-vllm #809build-infra #939

昇騰線:FlagGems 新增專用線性運算元(#6456);FlagGems-vllm 新增 kda_gate_cumsum Triton 運算元(#809);FlagGems-sglang 修復 fused router K 迴圈流水(#96);映象側四個昇騰變體(cann8.5.0 / cann9.0.0 × 910c 與非 910c)批次完成 rc2.post2 重建,並補入 cann-shmem 包(#939)。

3.8 燧原 / 中昊芯英 / 英偉達映象與工具面(09-20)

日期:2026-09-20 來源FlagPrism #12build-infra 提交

燧原線:FlagPrism 新增 Enflame 偵錯程式與 TOPSPTI 效能分析支援(#12);tops1.9.10 / 1.10.6 兩個映象完成重建,其中 tops1.9.10 的 FlagTree 釘版回擺至 0.6.0(#944)。中昊芯英 tangrt1.2.0、英偉達 cuda12.8 / 13.3 映象同步完成重建記錄;英偉達 cuda13.3 的 FlagTree 釘版回擺至 0.6.1(#940)。


四、總結與趨勢觀察

  • 釋出件進入全後端批次重建階段:20 個後端 vLLM 映象在一個視窗內全部重新整理到 rc2.post2,且映象自報版本、文件標 TBD、逐個標註編譯底座三件事同時落地——「釋出件可核對」成為本輪工程的重心,距 GA(09-28)8 天,節奏正常。
  • 外掛分發正規化變化值得記一筆:「一次構建、釋出到全廠商索引」(#934)把 N 次構建壓成 1 次構建 + N 次釋出,這類基礎設施級簡化會直接減少後續每個版本的釋出成本。
  • 多晶片後端修復密集期:崑崙芯(約十筆)、海光(Flash Attention + Qwen-Image)、沐曦(SDPA 修復)、昇騰(專用線性運算元)在同一視窗集中修復,反映 2.2 測試期(09-01 至 09-24)進入「按後端清賬」階段;崑崙芯處理 grouped_mm 大 M / 小 K 特化,是 MoE 場景針對性的最直接證據。
  • FlagQuantum 的擴張速度是全 org 最快的方向之一:單貢獻者 48 小時 23 筆,從原語(QFT、相位估計、Grover、振幅估計)到應用(QUBO 特徵選擇、量子 PCA、k-medians)成鏈鋪設,並同步做 QEC 記錄層——「量智融合」在程式碼層面的具象進度。
  • T-Head 雙線進入:PPU 後端啟用 TLE + KernelGen 運算元擺渡主線,與 2.2 多後端規劃中對 T-Head 的位置安排吻合,玄鐵方向在 FlagOS 棧內的參與度持續加深。
  • 生態活動進入大會週期:10 月 17-18 日 FlagOS 技術大會開啟報名,工作坊選題(KernelGen、端側、TLE Attention、FlagScale-Agent)與此前工程觀察一一對應;MiniCPM 挑戰賽 9/21 開閘——九月下旬起生態運營密度將顯著上升。

附錄:信源核查表

類別 信源 核查方式 結果
GitHub org: flagos-ai repos API 54 倉庫 pushed_at 全量核查 20 倉視窗內活躍
GitHub 各倉 commits API(since=09-18T10:18Z) 逐倉拉取、逐條核驗 206 條提交
新聞 Google News RSS(24 組查詢詞) gnews_topic.py,48h 視窗 0 命中(第 15 個平靜視窗)
社群 知乎機構號 / 智源社群 / CSDN 專欄 人工檢索複核 大會報名稿(09-18)、挑戰賽稿(近期)

附錄:完整信源清單