调研窗口:2026-09-18 10:18 ~ 2026-09-20 10:18(约 48 小时,含周末;承接 09-18 日报窗口,无空档) 信源:GitHub(org: flagos-ai,54 仓库 pushed_at 全量核查;窗口内 20 个仓库 206 条提交逐条核验)、Google News RSS(中英文 24 组查询词,走代理)、智源社区、知乎机构号、CSDN FlagOS 专栏等(详见附录信源清单)


本期索引

  • 今日重点:build-infra 全 20 后端 vLLM 镜像批量授权重建,2.2 发布件进入 rc2.post2 装配(09-19/09-20)
  • 一、开源项目进展(GitHub 动态)
    • 1.1 build-infra:20 个后端 vLLM 镜像授权重建,插件 wheel 改「一次构建、全厂商分发」(09-19/09-20)
    • 1.2 build-infra:FlagTree 钉版策略收紧至 0.6.x,FlagTune 成本模型按钉版禁用(09-20)
    • 1.3 FlagGems:KernelGen 持续入库,昆仑芯后端单日批量修复约十项(09-20)
    • 1.4 FlagGems:达摩院玄铁 PPU 后端启用 TLE,海光 DCU Flash Attention 修复(09-20)
    • 1.5 FlagSparse:MUSA / MACA / DCU 三后端适配密集推进(09-18~09-20)
    • 1.6 FlagQuantum:算法原语包大扩张——QFT、相位估计、Grover、QUBO 等十余项(09-18~09-20)
    • 1.7 Torch-FL:Qwen-Image 2.1 / 2512 多芯片性能优化成线(09-18~09-20)
    • 1.8 其余动态:FlagTree、FlagGems-sglang、FlagGems-vllm、FlagFFT、FlagPrism 等(09-18~09-20)
  • 二、新闻报道与生态
    • 2.1 组件级检索连续第十五个平静窗口:48 小时零命中(09-18~09-20)
    • 2.2 2026 人工智能开放计算大会暨众智 FlagOS 技术大会开启报名:10 月 17-18 日北京(09-18)
    • 2.3 FlagOS × MiniCPM 模型推理吞吐性能优化挑战赛:9 月 21 日开放提交(近期发布)
  • 三、成员单位深挖
    • 3.1 昆仑芯:FlagGems 后端修复批量落地(09-20)
    • 3.2 摩尔线程:MUSA 线算子与镜像双推进(09-20)
    • 3.3 海光:DCU Flash Attention 修复与 Qwen-Image 性能线(09-20)
    • 3.4 达摩院玄铁:PPU 后端启用 TLE,KernelGen 算子入主线(09-19/09-20)
    • 3.5 沐曦:MACA 线 FlagSparse 适配与镜像记录(09-19/09-20)
    • 3.6 天数智芯:FlagDNN 测试面收敛(09-19/09-20)
    • 3.7 昇腾:镜像重建、专用线性算子与 kda_gate 算子(09-20)
    • 3.8 摩尔线程 / 燧原 / 沐曦镜像与工具面(09-20)
  • 四、总结与趋势观察
  • 附录:信源核查表
  • 附录:完整信源清单

今日重点:build-infra 全 20 后端 vLLM 镜像批量授权重建,2.2 发布件进入 rc2.post2 装配

日期:2026-09-19、2026-09-20 来源build-infra #938build-infra #956build-infra #934

本窗口 build-infra 以 43 条提交成为 org 内最密的一条线,动作高度集中:为全部 20 个后端 vLLM 镜像授权 2.2.0 / 插件 post2 重建,并把重建结果逐一向后回写。09-20 03:07 的 app changelogs: authorize the 2.2.0 / plugin-post2 rebuild for all 20 images(#938)是发令枪,随后从 09-20 03:07 到 10:28 的一个多小时里,机器人账号按后端逐个记录新镜像 tag;09-20 09:43 又补一条 authorize the 2.2.0 / plugin-post2 rebuild for all 20 vllm 0.24.0 images,把这一轮重建的范围与基线(vLLM 0.24.0)明确到标题里。

记录到的镜像 tag 覆盖 org 的全部后端矩阵:2.2.0-0.3.0rc2.post2 一档落在昇腾(cann8.5.0、cann9.0.0 及两个 910c 变体)、寒武纪(neuware4.4.3 / 4.7.2)、摩尔线程(musa4.3.6 / 5.2.0)、燧原(tops1.9.10 / 1.10.6)、沐曦(maca3.7.2.1 / 3.8.1.3)、海光(dtk26.04)、天数(corex4.5.0)、昆仑芯(xre5.37.1)、中昊芯英(tangrt1.2.0)与英伟达(cuda12.8 / 13.3);更早一档 0.2.2rc2.post2(插件版本)先行落过一批。单窗口内 20 个后端镜像全部刷新,是本窗口 org 内规模最大的一个动作。

与之配套的是插件 wheel 的分发方式变更:09-19 23:34 的 vllm-plugin wheel: build once, publish to every vendor index(#934)把「每个厂商各构建一次」改为「一次构建、发布到所有厂商索引」,随后两条提交把版本号改为从 git ref 推导(#932)、修复 runs-on 参数拆包问题(#935)。这条链把插件分发从「N 次构建」压成「1 次构建 + N 次发布」,是发布工程上的一次结构性优化。

另一条并行的收尾线是把「镜像到底装了什么」变成可核对的事实:vllm app image: read the installed plugin version past the entrypoint(#937)让镜像自报插件版本;docs: print TBD for an app image that was never built(#948)把从未构建过的镜像在文档里明确标为 TBD;changelogs: name the FlagTree each 2.2.0 vllm image actually builds on(#953)逐个镜像标注实际编译底座。三处都在减少「文档与制品不一致」的空间。

把窗口内的动作并排看:2.2 的发布件装配已经走到「全后端镜像批量重建 + 版本可核对 + 分发通路合并」的阶段,距发布时间表上的 GA(2026-09-28)还剩 8 天,属于测试与稳定期内的正常推进节奏。


一、开源项目进展(GitHub 动态)

窗口总览:org 内 54 个仓库中 20 个在本窗口有提交,合计 206 条(跨 48 小时、含周末),分布为:build-infra 43、FlagSparse 39、FlagGems 38、FlagQuantum 23、FlagGems-sglang 10、FlagGems-Experimental 10、Torch-FL 9、FlagDNN 6、FlagFFT 5、docs 4、FlagTree 4、FlagGems-vllm 4、vllm-plugin-FL 2、FlagPrism 2、FlagBLAS 2、FlagCX 1、FlagAttention 1、FlagAudio 1、FlagScale-Agent 1、TransformerEngine-FL 1。

本窗口形态 = 「发布件批量装配」+ 「后端修复潮」两条线:build-infra 拉动全后端镜像重建与分发通路合并;应用侧(FlagGems / FlagSparse / Torch-FL / FlagGems-vllm)出现多芯片后端的密集修复与性能调优,其中昆仑芯与海光 DCU 的修复量最为集中;治理侧(FlagQuantum 算法原语、FlagTree TLE)继续按 2.2 路线图铺开。09-19(周六)各仓合计约 12 条提交,开发活动跨周末连续未断。

1.1 build-infra:20 个后端 vLLM 镜像授权重建,插件 wheel 改「一次构建、全厂商分发」(09-19/09-20)

日期:2026-09-19、2026-09-20 来源build-infra #938build-infra #934build-infra #939

详见「今日重点」。补充两点:其一,cann9.0.0 后端在 09-20 04:00 增加了 cann-shmem 软件包(#939),为昇腾 9.0 线的共享内存组件补齐依赖;其二,09-18 15:47 的 Runtime: fetch vendor deps from the vendor index(#930)开始把运行时依赖改从「厂商索引」获取,配合 09-18 13:50 删除旧容器文件(#929),容器构建的来源与事实源开始收敛到统一索引。

1.2 build-infra:FlagTree 钉版策略收紧至 0.6.x,FlagTune 成本模型按钉版禁用(09-20)

日期:2026-09-20 来源build-infra #940build-infra #943build-infra #944build-infra #947

09-20 晨间连续三条「钉版」提交:nvidia-cuda13.3: hold flagtree at 0.6.1(#940)、metax: hold flagtree at 0.6.1 for both MACA backends(#943)、enflame-tops1.9.10: hold flagtree at 0.6.0(#944)——把三个后端的编译器底座钉回 0.6.x 线(对应此前的抬版动作形成回摆);随后 runtime: disable the FlagTune cost model where flagtree 0.6.x is pinned(#947)说明 FlagTune 成本模型与 0.6.x 钉版不兼容,需按钉版状态禁用。三条钉版 + 一条相容性处理构成一组完整的「回摆 + 适配」。

另有一条状态矩阵修正:status matrix: drop the merged entries from megatron's prs(#933)、status matrix: prs = open PRs, md = recen…(#932 前部)把状态矩阵的统计口径写死(PR 列=开放 PR、md 列=最近提交)。

1.3 FlagGems:KernelGen 持续入库,昆仑芯后端单日批量修复约十项(09-20)

日期:2026-09-20 来源FlagGems #5917FlagGems #5878FlagGems #6317FlagGems #6476

FlagGems 本期 38 条提交仍以 KernelGen 产出为底色:Nvidia 侧新增 _fused_adagrad_(#5917)与 _fused_sgd_(#5878)两个优化器融合算子;Experimental 仓库(见 1.8)当日另有十个 Nvidia 算子入库。本期最集中的一条线是昆仑芯后端修复:binliu 连续落下约十笔提交,覆盖 grouped_mm 大 M / 小 K 形状的 persistent kernel 调度与按形状自动调优、SDPA 注意力修复(保留 value-1 参数非特化、收敛自动调优)、mse_loss 阶段一改全块掩码(#6476)、scatter / log_sigmoid_backward / amp_foreach、fill / add_relu / special_log1p / dequantize、pow / pdist / 勒让德多项式、segment_reduce / arcsinh / cosh / acosh / log2 / log10、bessel_y1 / bernoulli、t_copy / selu / reflection_pad2d、log_softmax / logical_not 以及 lgamma 迁移误删修复等,几乎把该后端近期算子回归「清仓」。

工具侧两条:[KMCompiler] operator linalg_lstsq bug fix(#6499)、[KMCompiler] fix fp64 error(#6491)与 delete uint8 dtype(#6477);MThreads 侧修复 feature_dropout_ 恢复与拆分(#6490、#6482)。基准与 CI 侧:Fix(benchmark): align pytest markers and op_name with operator registry ids(#6489)、ci: run pre-check jobs on basic-runner-cpu(#6431)。

1.4 FlagGems:达摩院玄铁 PPU 后端启用 TLE,海光 DCU Flash Attention 修复(09-20)

日期:2026-09-20 来源FlagGems #6423FlagGems #5822FlagGems #6456

三笔重量级后端提交:[T-Head] Enable TLE for PPU backend(#6423)把 Triton 语言扩展(TLE)在达摩院玄铁 PPU 后端打开,与该方向在 2.2 多后端规划中的位置对应;[Hygon] Fix Flash Attention forward/backward kernels on DCU(#5822)修复海光 DCU 上前反向 Flash Attention 核;[Ascend] Add specialized linear operator(#6456)为昇腾补一个专用线性算子。另 [MetaX] Fix masked_fill broadcast OOB and illegal num_warps=16(#6480)修正沐曦线上一个越界与非法配置。

1.5 FlagSparse:MUSA / MACA / DCU 三后端适配密集推进(09-18~09-20)

日期:2026-09-18 ~ 2026-09-20 来源FlagSparse #73FlagSparse #71

FlagSparse 本期 39 条提交几乎全部来自合作方的双分支协作流(NCIC-AlphaSparse 的两个账号交替合并),动作主题是三后端适配:MUSA(摩尔线程)线落 musa updates;MACA(沐曦)线落 maca spsm debugmaca test commands;DCU(海光)线落 dcu updatesdcu sddmm testsci dcu 以及 dcu spgemm test fp32 fp64 sperated(把 spgemm 的单双精度测试分开)。另有 cwrapper add(C 包装层新增)与一次对「New update」的 revert(#63 回滚、#64 撤回),以及文档整理。整体是把稀疏算子库向国产三后端做实的过程。

1.6 FlagQuantum:算法原语包大扩张——QFT、相位估计、Grover、QUBO 等十余项(09-18~09-20)

日期:2026-09-18 ~ 2026-09-20 来源FlagQuantum #85FlagQuantum #91FlagQuantum #104

FlagQuantum 本期 23 条提交由单一贡献者(Wei LIU)连续推进,主题是算法原语包的系统性铺设:从算法原语包与量子傅里叶变换(#85)起步,接连落算子协议与相位估计(#87)、态制备(#88)、多控 X 与可逆位串比较器(#89)、真值表预言机合成(#90)、Grover 搜索(#91)、振幅估计(#92);随后进入应用层——QUBO 到 Ising 映射(#86)、量子核估计与经典核岭分类器(#100)、基于量子主成分分析的相位估计(#98)、Grover 量化 k-medians(#99)、QUBO 特征选择(#101)、振幅估计求频繁项占比(#102)、相位估计估计奇异值(#104)。工程质量两条:覆盖率与类型检查等门禁延续近期的「严格化」路线;功能侧一条是量子纠错(QEC)记录层的检测器错误模型(#84,对应提案 048 的 stage 2a)。01-09 层之外,还有一条来自 build 治理侧的操作:限制该仓库占用的 org 级 runner 份额(与近期 CI 资源治理同题)。

1.7 Torch-FL:Qwen-Image 2.1 / 2512 多芯片性能优化成线(09-18~09-20)

日期:2026-09-18 ~ 2026-09-20 来源Torch-FL #360Torch-FL #356Torch-FL #353

Torch-FL 本期 9 条提交由单一贡献者(nate.river)围绕 Qwen-Image 系列在多芯片上的性能成线:先用 test: add the Qwen-Image-2.1 manual test flow for chip bring-up(#342)建立手测流程,随后连续优化——修复 DCU 的 SDPA 后端选择与逐点路由(#345)、削减 DCU 侧 FlagGems 调度 / 布局 / 自动调优开销(#352)、让 GCU 的 Qwen-Image-2512 单步降到 7.1 s/it(#354,SDPA 路由 + GEMM 操作数处理)、把 Qwen-Image-2.1 的 key-valid 掩码接入 FlagGems SDPA 路径(#353)、把 DCU 的 FlagGems 调度开销继续压低(#356)、最终给出 Qwen-Image-2.1 的吞吐曲线与尾延迟 / 算术强度测量(#360)。这是一条「从可跑到跑到好」的典型芯片 bring-up 性能线。

1.8 其余动态:FlagTree、FlagGems-sglang、FlagGems-vllm、FlagFFT、FlagPrism 等(09-18~09-20)

日期:2026-09-18 ~ 2026-09-20 来源FlagTree #1084FlagGems-sglang #93FlagGems-Experimental #659FlagPrism #13

  • FlagTree(4)[KMCompiler][TLERaw] Optimize the sort operator based on tle_raw(#1084)继续 TLE Raw 路线;[TLE][CommonIR] Added CommonIR conversion integration on Triton 3.6(#1160)把 CommonIR 转换接入 Triton 3.6;[QC][TLE] Support cross-dtype Hopper WGMMA accumulator reuse(#1001);[XPU] Guard do_bench against estimate_ms==0(#1224)修除零。
  • FlagGems-sglang(10)moe_fused_mul_sum 竞赛算子入库并注册(#87);batch3 参考、测试、基准与文档一批(#93);do_bench 改为按厂商分派的单一帮助函数(#94);昇腾 fused router K 循环流水限制为 2 级(#96)。
  • FlagGems-Experimental(10):KernelGen Nvidia 线当日再落十个算子——sparse_dim_has_same_storage_numel_dimV_valuescol_indicesadjointatleast_2ddetach_copyccol_indices_copycrow_indices_copy(#640~#659),多为稀疏与视图类小算子,从 Experimental 向主线摆渡的前置环节。
  • FlagGems-vllm(4):MUSA 侧优化 deepseek_v4 的 fused_q_kv_rmsnorm(#825);沐曦线优化 varlen flash attention(#808);昇腾线新增 kda_gate_cumsum 算子(#809);KMCompiler 线给 fused_moe 精度基准加厂商原生精度门(#824)。
  • FlagFFT(5):验收框架连续重构——捕获数据走管道流转并压平结果树、算子日志以平台可读的裁决收尾、输入写入方不再等待读方、捕获输入改为按需重新生成(不再驻留磁盘)。
  • FlagPrism(2):统一算子验收测试并退役旧批量套件(#13);新增燧原调试器与 TOPSPTI 性能分析支持(#12)。
  • docs(4):在线实验室帮助内容更新(#509、#510 两轮)。
  • FlagCX(1):设备 API 默认路径增加天数(Iluvatar)支持(#608)。
  • vllm-plugin-FL(2):在加速器图中捕获常见注意力元数据(#442);天数 BI-V150 适配 vLLM 0.24 线(#526)。
  • FlagDNN(6):ppu / mthreads / ascend / iluvatar 四平台测试修正与 run_test.py 修复;昇腾平台架构改进。
  • FlagBLAS(2):修正 thead 的 pyproject.toml。
  • FlagAttention(1):一处修复提交(#63)。
  • TransformerEngine-FL(1):从 main 线 cherry-pick(#124)。
  • FlagScale-Agent(1):加固 agent harness——REPL 提示看门狗、跨会话提案注册表等。
  • FlagAudio(1):CI 增加 Nexus 上传通路(#8)。

二、新闻报道与生态

2.1 组件级检索连续第十五个平静窗口:48 小时零命中(09-18~09-20)

日期:2026-09-18 ~ 2026-09-20 来源:Google News RSS(中英文 24 组查询词,走代理)

以 FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen 组件名及智源研究院等组合词检索,48 小时窗口内零命中(gnews 脚本实测 0 条),连续第十五个平静窗口。组件级新闻侧的静默已成为常态,本报告的对外动态事实以 GitHub org 与社区渠道(智源社区/知乎机构号)为准。

2.2 2026 人工智能开放计算大会暨众智 FlagOS 技术大会开启报名:10 月 17-18 日北京(09-18)

日期:2026-09-18(发布) 来源知乎机构号发布

众智 FlagOS 社区联合北京智源人工智能研究院、北京量子信息科学研究院、中关村人工智能开源联盟(筹)等机构,将于 2026 年 10 月 17-18 日在北京中关村国家自主创新示范区展示中心举办「2026 人工智能开放计算大会暨众智 FlagOS 技术大会」,主题「一栈贯通,智算无界」。大会围绕异构算力底座、开源 AI 系统软件栈、量智融合、车载智能、具身智能、AI 智能体基础设施等方向设置议程;实操工作坊覆盖 KernelGen 高性能算子自动生成工程、FlagOS 赋能大模型端侧推理、Triton-TLE 新型 Attention kernel 优化、FlagScale-Agent 架构设计与实战等完整链路。报名通道已开启(早鸟票限时优惠)。这是近期 FlagOS 生态最重要的对外活动节点,其工作坊选题与本期工程侧观察(TLE、KernelGen、端侧、Agent)高度对应。

2.3 FlagOS × MiniCPM 模型推理吞吐性能优化挑战赛:9 月 21 日开放提交(近期发布)

日期:近期发布(提交阶段 2026-09-21 起) 来源知乎机构号发布

FlagOS 与 MiniCPM 联合举办模型推理吞吐性能优化挑战赛,开发与提交阶段为 2026 年 9 月 21 日至 11 月 20 日(UTC+8),12 月初评审。赛题面向 FlagOS 栈上的推理吞吐优化,是继 SGLang 跨芯片算子优化赛(”算子岛”争夺战)之后社区赛事体系的延续。


三、成员单位深挖

3.1 昆仑芯:FlagGems 后端修复批量落地(09-20)

日期:2026-09-20 来源FlagGems #6317FlagGems #6476

昆仑芯线在本窗口落下约十笔修复(详见 1.3),从基础逐元素算子到 grouped_mm / SDPA 这类核心算子均有覆盖,其中最实质的是 grouped_mm 的「大 M / 小 K」形状专用 persistent kernel 与按形状自动调优——针对 MoE 场景的典型形状做特化。配合 SGLang 侧的 moe_fused_mul_sum 竞赛算子入库,昆仑芯方向的 MoE 推理路径在持续做实。

3.2 摩尔线程:MUSA 线算子与镜像双推进(09-20)

日期:2026-09-20 来源FlagGems-vllm #825FlagSparse #73

MUSA 线两条:FlagGems-vllm 中 deepseek_v4 的 fused_q_kv_rmsnorm 针对摩尔线程优化(#825);FlagSparse 的 MUSA 适配更新。镜像侧 musa4.3.6 / musa5.2.0 两个后端的 2.2.0 镜像完成 rc2.post2 重建记录。此外 FlagGems-eXperimental 的 MThreads KernelGen 算子批量(#6458)于 09-19 从 Experimental 摆渡主线。

3.3 海光:DCU Flash Attention 修复与 Qwen-Image 性能线(09-20)

日期:2026-09-20 来源FlagGems #5822Torch-FL #356

海光方向本期两条硬活:FlagGems 修复 DCU 上 Flash Attention 前反向核(#5822,历经 5822 号 PR 的长周期成熟);Torch-FL 削减 DCU 上 Qwen-Image-2.1 的 FlagGems 调度开销(#356)。镜像侧 hygon-dtk26.04 完成 2.2.0 rc2.post2 重建。

3.4 达摩院玄铁:PPU 后端启用 TLE,KernelGen 算子入主线(09-19/09-20)

日期:2026-09-19、2026-09-20 来源FlagGems #6423FlagGems #6460

玄铁方向两笔:[T-Head] Enable TLE for PPU backend(#6423)在 PPU 后端打开 Triton 语言扩展——TLE 是 2.2 多后端规划中面向跨硬件族的统一优化语言,T-Head 进入该路线;09-19 的 KernelGen cherry-pick 把 T-Head 算子从 Experimental 摆渡回主线(#6460)。这与 09-18 期观察到的「T-Head 进入 FlagTree 2.2 多后端规划」形成连续跟进。

3.5 沐曦:MACA 线 FlagSparse 适配与镜像记录(09-19/09-20)

日期:2026-09-19、2026-09-20 来源FlagSparse #71build-infra #943

MACA 线:FlagSparse 的 maca spsm debug 与测试命令推进;build-infra 把两个 MACA 后端的 FlagTree 钉版统一在 0.6.1(#943);maca3.7.2.1 / 3.8.1.3 两个镜像完成 2.2.0 重建记录。FlagGems-vllm 侧沐曦的 varlen flash attention 优化同属该线。

3.6 天数智芯:FlagDNN 测试面收敛(09-19/09-20)

日期:2026-09-19、2026-09-20 来源FlagDNN 提交

FlagDNN 本期六条提交以测试面收敛为主:iluvatar / ascend / mthreads / ppu 四平台测试修正与 run_test.py 修复,另有一条昇腾平台架构改进。corex4.5.0 镜像完成 2.2.0 重建记录。FlagCX 侧天数(Iluvatar)的 Device API 默认路径支持(#608)与 vllm-plugin-FL 的 BI-V150 vLLM 0.24 适配(#526)同窗口落地。

3.7 昇腾:镜像重建、专用线性算子与 kda_gate 算子(09-20)

日期:2026-09-20 来源FlagGems #6456FlagGems-vllm #809build-infra #939

昇腾线:FlagGems 新增专用线性算子(#6456);FlagGems-vllm 新增 kda_gate_cumsum Triton 算子(#809);FlagGems-sglang 修复 fused router K 循环流水(#96);镜像侧四个昇腾变体(cann8.5.0 / cann9.0.0 × 910c 与非 910c)批量完成 rc2.post2 重建,并补入 cann-shmem 包(#939)。

3.8 燧原 / 中昊芯英 / 英伟达镜像与工具面(09-20)

日期:2026-09-20 来源FlagPrism #12build-infra 提交

燧原线:FlagPrism 新增 Enflame 调试器与 TOPSPTI 性能分析支持(#12);tops1.9.10 / 1.10.6 两个镜像完成重建,其中 tops1.9.10 的 FlagTree 钉版回摆至 0.6.0(#944)。中昊芯英 tangrt1.2.0、英伟达 cuda12.8 / 13.3 镜像同步完成重建记录;英伟达 cuda13.3 的 FlagTree 钉版回摆至 0.6.1(#940)。


四、总结与趋势观察

  • 发布件进入全后端批量重建阶段:20 个后端 vLLM 镜像在一个窗口内全部刷新到 rc2.post2,且镜像自报版本、文档标 TBD、逐个标注编译底座三件事同时落地——「发布件可核对」成为本轮工程的重心,距 GA(09-28)8 天,节奏正常。
  • 插件分发范式变化值得记一笔:「一次构建、发布到全厂商索引」(#934)把 N 次构建压成 1 次构建 + N 次发布,这类基础设施级简化会直接减少后续每个版本的发布成本。
  • 多芯片后端修复密集期:昆仑芯(约十笔)、海光(Flash Attention + Qwen-Image)、沐曦(SDPA 修复)、昇腾(专用线性算子)在同一窗口集中修复,反映 2.2 测试期(09-01 至 09-24)进入「按后端清账」阶段;昆仑芯处理 grouped_mm 大 M / 小 K 特化,是 MoE 场景针对性的最直接证据。
  • FlagQuantum 的扩张速度是全 org 最快的方向之一:单贡献者 48 小时 23 笔,从原语(QFT、相位估计、Grover、振幅估计)到应用(QUBO 特征选择、量子 PCA、k-medians)成链铺设,并同步做 QEC 记录层——「量智融合」在代码层面的具象进度。
  • T-Head 双线进入:PPU 后端启用 TLE + KernelGen 算子摆渡主线,与 2.2 多后端规划中对 T-Head 的位置安排吻合,玄铁方向在 FlagOS 栈内的参与度持续加深。
  • 生态活动进入大会周期:10 月 17-18 日 FlagOS 技术大会开启报名,工作坊选题(KernelGen、端侧、TLE Attention、FlagScale-Agent)与此前工程观察一一对应;MiniCPM 挑战赛 9/21 开闸——九月下旬起生态运营密度将显著上升。

附录:信源核查表

类别 信源 核查方式 结果
GitHub org: flagos-ai repos API 54 仓库 pushed_at 全量核查 20 仓窗口内活跃
GitHub 各仓 commits API(since=09-18T10:18Z) 逐仓拉取、逐条核验 206 条提交
新闻 Google News RSS(24 组查询词) gnews_topic.py,48h 窗口 0 命中(第 15 个平静窗口)
社区 知乎机构号 / 智源社区 / CSDN 专栏 人工检索复核 大会报名稿(09-18)、挑战赛稿(近期)

附录:完整信源清单