调研窗口:2026-09-20 10:18 ~ 2026-09-21 10:18(约 24 小时;承接 09-20 日报窗口,无空档) 信源:GitHub(org: flagos-ai,54 仓库 pushed_at 全量核查,窗口内 22 个仓库有推送;提交搜索命中 163 条,另计 FlagTree 沐曦专门化分支 10 条)、Google News RSS(中英文 24 组查询词,走代理)、量子位、新浪财经(转界面新闻)、智源社区、CSDN FlagOS 专栏等(详见附录信源清单)


本期索引

  • 今日重点:2.2 发布件 0.20.2 线全后端快照完成——20 个后端镜像通过上机验证,三个后端 FlagTree 钉版原因公开(09-20)
  • 一、开源项目进展(GitHub 动态)
    • 1.1 build-infra:0.20.2 线镜像记录回写完毕,2.2.0 快照记录上机验证与钉版说明(09-20)
    • 1.2 FlagGems:TLE 路径连开两后端——昇腾 glu 适配、天数 Iluvatar 启用 TLE(09-20/09-21)
    • 1.3 FlagGems:KernelGen 再入库两算子;SiliconFlow 跨后端 FP8 grouped GEMM 修复合入(09-20/09-21)
    • 1.4 FlagTree:沐曦后端专有化重构过夜推进十笔;昇腾 910B FlagGems CI 工作流提交(09-20/09-21)
    • 1.5 FlagTree:AMD 后端两处编译器修复(W7900 精度测试暴露)(09-20)
    • 1.6 其余动态:libtriton_jit 多后端打包、KernelGen 收录清微、FlagQuantum 示例、Torch-FL 等(09-20/09-21)
  • 二、新闻报道与生态
    • 2.1 组件级检索连续第十六个平静窗口(09-20/09-21)
    • 2.2 中国电信 Xing4.0-29B-A4B 解读:国产算力部署基于智源 FlagOS 统一开源软件栈(09-20)
    • 2.3 FlagOS 发行版包通道:flagos-packaging 发布 v2026.09.20,apt/dnf 双格式(09-21)
    • 2.4 FlagOS × MiniCPM 挑战赛今日进入提交阶段(09-21)
  • 三、成员单位深挖
    • 3.1 沐曦:Qwen-Image-2.1 Day0 适配官宣,FlagTree 专有化重构连续推进(09-20/09-21)
    • 3.2 海光:fused_inv_rope_fp8_quant 算子合入,FP8 grouped GEMM 调参(09-21)
    • 3.3 昇腾:glu 算子 TLE 适配与 910B FlagGems 基线工作流(09-20/09-21)
    • 3.4 天数智芯:启用 TLE 路径,FP8 解码走独立内核(09-21)
    • 3.5 清微智能:KernelGen 2.2.0 收录为新增硬件(09-20)
    • 3.6 达摩院玄铁:T-Head ZW810E 成本模型包 1.1.0 进入 FlagTune 目录(在审)(09-20)
    • 3.7 摩尔线程 / 燧原:MUSA CI 与 GCU 性能优化(09-20)
  • 四、总结与趋势观察
  • 附录:信源核查表
  • 完整信源清单

今日重点:2.2 发布件 0.20.2 线全后端快照完成——20 个后端镜像通过上机验证,三个后端 FlagTree 钉版原因公开

日期:2026-09-20 来源build-infra #991build-infra #956

09-20 傍晚到晚间,build-infra 完成了 2.2 发布件的又一条完整线:0.20.2 线(vLLM 0.20.2)的镜像 tag 记录在上海时间 19:04–19:27 集中回写 14 条(覆盖英伟达 cuda12.8、昆仑芯、天数 iluvatar 两个版本、海光、摩尔线程两个版本、昇腾三个变体、寒武纪两个版本、清微、燧原等),加上此前 14:49–18:43 的 6 条,该线 20 个后端全部携带 2.2.0-0.2.2rc2.post2。19:40 合并的 #991 随即把这一轮重建记录成 0.20.2 线的 2.2.0 发布快照——每条记录在上机验证后才放行:包矩阵比对、vllm/vllm_fl 实际导入、真实 serve 出 token 三项全部通过。

与快照同时公开的还有一条此前只在提交标题里出现的线索——三个后端无法使用统一编译器底座:2.2.0 栈原计划全后端统一在 FlagTree 0.7.0rc2 上,但沐曦(tl.dot 在 BLOCK_SIZE_M=8 触发编译器 ICE)、燧原 tops1.9.10(enable_i64 被旧工具链拒绝)、英伟达 cuda13.3(TLE 依赖 libcudart.so.12)三者在 0.7.0rc2 上跑不起来,各自以上机复现 + 0.6.x 对照的形式提交上游,并在镜像记录中逐一标注各自的 FlagTree 钉版(对应昨日的三条 hold 提交)。这组「快照 + 钉版原因」的组合,把发布件的可核对程度又推进了一层:每个镜像装的是什么、验证过什么、为什么底座不同,都留在记录里。距 09-28 的 GA 还有 7 天,发布工程处于收口节奏。


一、开源项目进展(GitHub 动态)

窗口总览:org 内 54 个仓库中 22 个在本窗口有推送;提交搜索命中 163 条(跨 18 个仓库),另有 FlagTree 沐曦专门化分支 10 条(非默认分支,未计入搜索)与 FlagBLAS、docs 等仓库的分支推送。分布为:build-infra 52、FlagGems 34、FlagSparse 21、FlagGems-Experimental 10、FlagGems-vllm 6、Torch-FL 6、FlagQuantum 6、FlagGems-sglang 6、FlagDNN 5、docs 4、libtriton_jit 3、KernelGen 2、vllm-plugin-FL 2、FlagFFT 2,其余各 1。

本窗口形态 = 「发布件收尾」+ 「TLE 多后端铺开」:build-infra 把 0.20.2 线镜像记录与发布快照收完(详见「今日重点」);FlagGems 侧 TLE(Triton 语言扩展)连续进入两个新后端(昇腾、天数),与昨日达摩院玄铁 PPU 启用 TLE 形成三连;FlagTree 的沐曦专有化重构跨夜推进十笔,昇腾 CI 工作流也补上 910B 型号。

1.1 build-infra:0.20.2 线镜像记录回写完毕,2.2.0 快照记录上机验证与钉版说明(09-20)

日期:2026-09-20 来源build-infra #991build-infra #955

主线详见「今日重点」。补充三点:其一,0.24.0 线的 2.2.0-0.3.0rc2.post2 记录(#957–#975)于 18:04–18:42 先一步落账,两条线在本窗口内先后收完;其二,ci: add a deb release path for FlagGems(#955)为 FlagGems 增加 Debian 包发布通道,与发行版包体系(见 2.3)同题;其三,changelogs: name the FlagTree each 2.2.0 vllm image actually builds on(#953)逐个镜像标注实际编译底座——以上三处加上快照记录,构成发布件从「能构建」走向「可核对」的完整链条。

1.2 FlagGems:TLE 路径连开两后端——昇腾 glu 适配、天数 Iluvatar 启用 TLE(09-20/09-21)

日期:2026-09-20、2026-09-21 来源FlagGems #6522FlagTree #1238

09-20 晚间提交、09-21 上午合并的 #6522 一次打开两处 TLE:昇腾侧为 glu 算子增加 TLE 适配(使用 tle.dsa.extract_slice 原语),天数 Iluvatar 侧在 vendor descriptor 中把 tle_enabled 置为 True,正式导出 TLE 路径。这是 TLE 在 48 小时内进入的第三、第四个后端——上一窗口达摩院玄铁 PPU 刚启用 TLE,本窗口便延伸到昇腾与天数。配套地,FlagTree 在审 PR #1238 把昇腾 TLE 的 raw 原语命名从 tle.dsa.ascend.raw 统一为 tle.raw(09-20 提交)——TLE 跨后端的一致化正在命名层同步进行。

1.3 FlagGems:KernelGen 再入库两算子;SiliconFlow 跨后端 FP8 grouped GEMM 修复合入(09-20/09-21)

日期:2026-09-20、2026-09-21 来源FlagGems #5911FlagGems #6349FlagGems #5064

三条合入:其一,KernelGen 产出 inverse 算子(#6349,09-20 22:21)——按程序做部分选主元的高斯-约当消元,工作矩阵与逆矩阵累加器全部驻留寄存器,行交换用 tl.gather 精确追踪;寄存器放不下的大矩阵与复数输入回退厂商 cuSOLVER。其二,KernelGen 再入库 _gather_sparse_backward(#5911,09-21 09:25)——gather 的反向,产出稀疏 COO 梯度。其三,来自 硅基流动(SiliconFlow)的 _scaled_grouped_mm 跨后端修复与调优(#5064,09-21 09:49 合并,PR 开放近两个月后收口):没有原生 FP8 dot 路径的后端把 E4M3 解码为 FP16 再做矩阵乘(FP32 累加);新增 E4M3FN / E4M3FNUZ 的按字节解码;天数 Iluvatar 因 CoreX 4.4 会把融合进 dot 循环的解码编错,改用独立的设备端解码内核;并补上海光与沐曦的专属调参配置。

1.4 FlagTree:沐曦后端专有化重构过夜推进十笔;昇腾 910B FlagGems CI 工作流提交(09-20/09-21)

日期:2026-09-20、2026-09-21 来源FlagTree 分支 refactor/metax-swizzle-dump-utils-v2FlagTree #1247

沐曦(MetaX)后端专有化重构在窗口内新增 10 笔 [SPEC][METAX] 提交(09-20 16:02 ~ 09-21 10:18),从傍晚一路推到今晨:覆盖 TritonIR、TritonToTritonGPU、TritonGPUToLLVM 三层源码的专有化、统一 MetaX CMake 入口(先接线、后修复)、专有化 TritonGPU ops 的 TableGen 选择,直到今晨的 tensor pointer 重写与 Gluon 布局接口专有化。这条 refactor/metax-swizzle-dump-utils-v2 分支的工作方式,是把沐曦后端从「共用上游源码 + 条件编译」推向「源码级专有化编译路径」。同日,昇腾侧提交 Ascend 3.5-910B 的 FlagGems 基线与测试工作流(#1247,09-21 09:54 在审;内容先投 main 后改投 triton_v3.5.x 线)——承接 09-18 的 910C 版本(#1214),昇腾的 FlagGems 回归基建正按型号补齐。

1.5 FlagTree:AMD 后端两处编译器修复(W7900 精度测试暴露)(09-20)

日期:2026-09-20 来源FlagTree #1240

在审 PR #1240 落下两处 AMD 后端修复,来源是在 W7900(gfx1100)上运行 FlagGems 算子精度测试时暴露的问题:其一,CanonicalizePointers 对 scf.if 两臂的 fat-pointer 属性改为取交集(canNarrow 两臂一致才保留),不再断言两臂相等——FlagGems 的 cat / concatenate / div_tensor 核会合法产生两臂属性不同的 scf.if,此前在断言开启的 LLVM 构建上直接导致 pass 崩溃;其二,AtomicCAS 的非整数位转换处理。两处均为上游 Triton 对应处理的移植。AMD 消费级卡被纳入 FlagGems 精度测试面,是本窗口一个可留意的方向。

1.6 其余动态:libtriton_jit 多后端打包、KernelGen 收录清微、FlagQuantum 示例、Torch-FL 等(09-20/09-21)

日期:2026-09-20、2026-09-21 来源libtriton_jit #61KernelGen #89FlagQuantum 提交Torch-FL 提交

  • libtriton_jit(3):今晨连续三笔合并——多架构脚本目录修复(#58)、多后端打包(#61)、nlohmann-json 3.10.5 修复(#64),Triton JIT 运行时向多后端分发形态收敛。
  • KernelGen(2)Updated Tsingmicro as a new hardware 合并(#89)——KernelGen 2.2.0 文档把清微(Tsingmicro)列为新增硬件(详见 3.5)。
  • FlagQuantum(3):示例与工程面继续补齐——会话级九鼎 notebook 作业支持(#103)、算法单元的可运行示例 + 指南检查器(#105)、三处与运行结果不符的 docstring 更正(#106)。
  • Torch-FL(3):GCU 上 Qwen-Image-2.1 去无效掩码并分解 complex64 乘法(#363,09-20 23:58 合并);修复重置峰值内存统计时丢失现存分配(#364);清理不可达的 Python 层 FlagGems 注册代码(#361)。
  • FlagSparse(2)runner ci 与 #74 合并(09-20 19:29–19:33)。
  • vllm-plugin-FL(1):MUSA CI 适配 vLLM 0.24 线(#457)。

二、新闻报道与生态

2.1 组件级检索连续第十六个平静窗口(09-20/09-21)

日期:2026-09-20 ~ 2026-09-21 来源:Google News RSS(中英文 24 组查询词,走代理)

以 FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen 等组件名为关键词的中英文检索(when:7d 与 when:14d),24 小时窗口内继续零命中,构成为组件级检索连续第十六个平静窗口(上一窗口为第十五个)。本窗口的对外信息面由成员单位侧与生态侧提供(见 2.2、2.3):成员单位词命中中,沐曦的 Qwen-Image-2.1 Day0 适配为唯一强相关新闻(见 3.1),其余为股市行情与无关稿件,已按标题语义剔除。

2.2 中国电信 Xing4.0-29B-A4B 解读:国产算力部署基于智源 FlagOS 统一开源软件栈(09-20)

日期:2026-09-20 来源量子位

量子位 09-20 晚间发文解读中国电信 09-17 开源的轻量级智能体大模型 Xing4.0-29B-A4B(29B 总参 / 4B 激活、256K 上下文、昇腾 910C + MindSpore/MindFormers 训练、4-bit 量化后单张 3090 可运行)。文章在「让企业真正用上 AI」一节明确指出:对于采用国产算力的企业,该模型基于智源 FlagOS 统一开源 AI 软件栈打通了多家国产芯片的适配路径,以降低跨硬件平台迁移与部署成本。这是 FlagOS 作为「统一软件栈」定位再次出现在第三方主流技术媒体的产品解读中;模型的 Agent 框架适配清单(OpenCode / Claude Code / OpenClaw / Hermes)也与 FlagOS 生态的 Agent 方向同题。

2.3 FlagOS 发行版包通道:flagos-packaging 发布 v2026.09.20,apt/dnf 双格式(09-21)

日期:2026-09-21 来源flagos-packaging v2026.09.20包索引站点build-infra #955

发布工程仓库 flagos-packaging 于今日凌晨发布 v2026.09.20(周更节奏,此前为 09-06、09-13)。该仓库为 FlagOS 软件栈提供 APT(Debian/Ubuntu)与 YUM(Fedora/RHEL/OpenEuler/OpenCloudOS/OpenAnolis)双格式原生包,已提供 el8 / el9 / fedora43 / openanolis8 / opencloudos9 / openeuler2403 六种发行版的 repo 文件,包带 GPG 签名(示例:apt install libflagcx-nvidia python3-flagscale python3-flagtree-nvidia)。当前为沙箱端点与规划中的生产端点(flagos-ai.github.io)同套服务,处于迁移期。配套地,build-infra 为 FlagGems 增加 deb 发布路径(#955),FlagBLAS 侧三件打包 PR(Debian+RPM 打包、Nexus 发布、0.3.0-rc2 移植)在审——容器镜像之外,FlagOS 的发行版原生分发通道正在成形

2.4 FlagOS × MiniCPM 挑战赛今日进入提交阶段(09-21)

日期:2026-09-21 来源知乎机构号此前发布

按此前公布的赛程,FlagOS × MiniCPM 模型推理吞吐性能优化挑战赛的开发与提交阶段自 09-21 起开放(至 11-20,12 月评审)。赛题面向 FlagOS 栈上的推理吞吐优化(含 4k / 16k 两类评测场景),是继 SGLang 跨芯片算子优化赛之后社区赛事体系的延续。今日起进入实际提交窗口,后续窗口可关注首批提交动态。


三、成员单位深挖

3.1 沐曦:Qwen-Image-2.1 Day0 适配官宣,FlagTree 专有化重构连续推进(09-20/09-21)

日期:2026-09-20 来源新浪财经(转界面新闻)新浪财经(转观点网)

09-20 晚,阿里千问团队宣布开源图像生成模型 Qwen-Image-2.1 后,沐曦股份宣布完成对该模型的 Day0 适配,实现「上线即适配」(界面新闻、观点网、同花顺等多源报道)。代码侧同期两条:其一,FlagTree 的沐曦后端专有化重构在窗口内推进 10 笔(详见 1.4);其二,FlagSparse 的 MACA 线落 maca spsv coo and spmv csr test(09-20 17:18)。另可对照的是,FlagOS 栈内 Torch-FL 仓库的 Qwen-Image-2.1 多芯片性能优化线仍在延续(本期 GCU 侧 #363,见 3.7)——「大模型发布当日多芯片可用」这一模式,正在从通稿走进各家后端的实际代码路径

3.2 海光:fused_inv_rope_fp8_quant 算子合入,FP8 grouped GEMM 调参(09-21)

日期:2026-09-21 来源FlagGems-vllm #801FlagGems #5064

今晨合并的 #801 为海光 DCU(gfx936 / BW1000)加入 fused_inv_rope_fp8_quant 算子——面向 DeepSeek-V4 注意力路径的「逆 RoPE + 每 128 元素 FP8 E4M3FN 组量化」融合实现,走既有 vendor-override 机制(同名函数从 runtime/backend/_hygon/ 覆盖通用实现)。由于 gfx936 没有原生 FP8 转换指令,Triton 会把 .to(fp8) 展开为长模拟序列,该融合算子的性能意义即来自此处。另在 FlagGems #5064 中,海光与沐曦的 _scaled_grouped_mm 专属调参配置一并建立。

3.3 昇腾:glu 算子 TLE 适配与 910B FlagGems 基线工作流(09-20/09-21)

日期:2026-09-20、2026-09-21 来源FlagGems #6522FlagTree #1247FlagGems-vllm #810

昇腾线三条:glu 算子的 TLE 适配(#6522,用 tle.dsa.extract_slice,见 1.2);Ascend 3.5-910B 的 FlagGems 基线与测试工作流提交(#1247,在审,见 1.4);vllm 插件侧新增 kda_state_gather Triton 算子(#810,09-21 09:29)。加上上一窗口的专用线性算子(#6456)与 kda_gate_cumsum(#809),昇腾方向的算子与 CI 双线均保持密集。

3.4 天数智芯:启用 TLE 路径,FP8 解码走独立内核(09-21)

日期:2026-09-21 来源FlagGems #6522FlagGems #5064

天数(Iluvatar)线两条:其一,在 vendor descriptor 中启用 TLE 路径tle_enabled=True,#6522)——天数成为 TLE 多后端名单中的一员;其二,_scaled_grouped_mm 的 FP8 解码在 CoreX 4.4 上改用独立设备端内核(#5064)——因为该工具链会把融合进 dot 循环的解码序列错误编译,此项特化即是对具体版本缺陷的工程绕行。两处均为「按芯片实际能力做差异化路径」的典型样本。

3.5 清微智能:KernelGen 2.2.0 收录为新增硬件(09-20)

日期:2026-09-20 来源KernelGen #89

KernelGen 合并 Updated Tsingmicro as a new hardware(#89)——清微(Tsingmicro)被列为 KernelGen 2.2.0 的新增硬件。这与 build-infra 镜像矩阵中 tsingmicro-tsm260610 后端在两条 vLLM 线上均有记录(0.3.0 / 0.2.2 各一条)相互印证:清微在 FlagOS 2.2 的多芯片矩阵中已从「接入中」进入「随发布件走」的状态。

3.6 达摩院玄铁:T-Head ZW810E 成本模型包 1.1.0 进入 FlagTune 目录(在审)(09-20)

日期:2026-09-20 来源FlagTree #1236

在审 PR #1236 为 FlagTune 模型目录增加 T-Head ZW810E 的 MM/MV 成本模型包 v1.1.0:包含 8 个 BF16 flaggems/mm 变体(含与 mv 共用的 gemv_ppu)与 2 个沿用 1.0.0 包的 flaggems/mul 模型;模型契约新增「精确有序的 configs 列表」支持(逐项校验参数名与合法值并拒绝与 config_space 混用)。这是继上一窗口 PPU 启用 TLE 之后,玄铁方向在自动调优成本模型上的配套推进——TLE 负责「怎么写」,成本模型负责「选哪个配置」,两条线在 2.2 的多后端优化框架内合流。

3.7 摩尔线程 / 燧原:MUSA CI 与 GCU 性能优化(09-20)

日期:2026-09-20 来源vllm-plugin-FL #457Torch-FL #363FlagBLAS PR

摩尔线程线:vllm-plugin-FL 的 MUSA CI 适配 vLLM 0.24 线(#457);FlagSparse 的 musa updates(09-20 13:58);FlagBLAS 的 MUSA 二级支持分支(feat/mthreads-l2-support)在窗口起点有推送、对应 PR #112 在审。燧原线:Torch-FL 在 GCU 上的 Qwen-Image-2.1 优化——融合 SDPA 通道删去无效掩码、complex64 乘法改为分解式(#363,09-20 23:58 合并),余量以「已测量未追平」如实记录在 PR 中。


四、总结与趋势观察

  • 发布件完成「可验证」收尾:0.20.2 线 20/20 后端镜像完成上机验证(包矩阵比对 + 导入 + 真实 serve 出 token)并留档快照;三个后端不能上 0.7.0rc2 的原因(沐曦 ICE、燧原工具链、cuda13.3 依赖)逐一公开、带上游复现。距 GA(09-28)7 天,收口质量优先于速度。
  • TLE 跨后端三连:达摩院玄铁 PPU(09-20)→ 昇腾与天数 Iluvatar(09-21),48 小时内进入四个后端;命名(tle.raw 统一)、成本模型(T-Head 1.1.0)同步跟进。TLE 正从单点试验转为多后端统一优化路径,与 10 月大会「Triton-TLE Attention kernel」工作坊议程互相印证。
  • 芯片厂商深度参与编译器后端:沐曦专有化重构过夜十笔(源码级专有化 + 统一 CMake 入口),说明国产栈分工中,厂商工程师已在 FlagTree 这类编译器底座上做深水区改造,而非只做算子适配。
  • 分发方式多元化:容器镜像之外,apt/dnf 原生包通道(flagos-packaging 周更、build-infra deb 路径、FlagBLAS 打包三件套)开始成形;发布物从「镜像 + 文档」扩展到「发行版原生包」。
  • 平静的组件级新闻 vs 高位工程侧:本窗口 163 条提交 / 22 仓推送全部来自代码;对外传播由生态日程承接(挑战赛今日开赛、大会 10-17/18 报名中)。唯一第三方媒体层面的 FlagOS 提及来自量子位对中国电信 Xing4.0 的解读(部署路径基于 FlagOS 统一软件栈)。

附录:信源核查表

类别 信源 核查方式 结果
GitHub org: flagos-ai repos API 54 仓库 pushed_at 全量核查 22 仓窗口内活跃
GitHub 提交搜索 + 逐仓 commits API 窗口内逐条核验 163 条 + 特性分支 10 条
新闻 Google News RSS(中英文 24 组查询词,走代理) 24 小时窗口过滤 + 剔除 组件词零命中(第 16 个平静窗口)
媒体 量子位 / 新浪财经(转界面新闻、观点网) 原文抓取复核 Xing4.0 解读(含 FlagOS 表述)、沐曦 Day0 两条
社区/生态 知乎机构号、CSDN FlagOS 专栏、智源社区 人工检索复核 挑战赛赛程核对;CSDN 专栏窗口内无新稿
发行工程 flagos-packaging 仓库与包索引站点 发布页直接抓取 v2026.09.20 发布核对

完整信源清单