FlagOS周报(2026-09-14 ~ 2026-09-20)
报告周期:2026 年 9 月 14 日(周一)至 9 月 20 日(周日),共 7 个自然日 素材来源:本刊每日 FlagOS 动态报告(09-14、09-15、09-16、09-17、09-18 五期工作日刊,另含 09-20 周末补充期,共 6 期);全部条目来自当期已核验信源 编制说明:本周期覆盖发布治理(2.2 RC 节奏与 GA 定档)、组件与代码共建、成员单位与厂商适配、生态与社区四个维度;五期日报窗口内提交合计约 720 条,覆盖 org 内近 30 个仓库,技术事实均来自代码仓库与官方发布物料的实测核查
一、本周要闻
- FlagOS 2.2 RC2 全栈同步打标,全周期第二次候选快照(09-14):09-14 10:35,community 仓库合入 2.2 RC2 清单(release-2.2-rc2.yaml,新增 251 行);随后 10:45 至 10:54 的十分钟内,23 个组件仓库接连打出 rc2.post1 标签或 Release,全天共记录 26 次打标动作、覆盖 22 个仓库,FlagTree 的三个 Triton 变体与一个 xpu3.6 标签当日补齐。首发带发行说明的 Release 为 FlagGems v5.4.0 与 FlagSparse v0.3.0(均为 rc2.post1)。
- build-infra 版本字段抬到 2.2.0,全 20 后端镜像批量重建(09-17 ~ 09-20):09-17 08:49 的 #916 把 configs.yaml 的 version 由 2.1.2 抬到 2.2.0、flaggems 由 5.3.5 换到 5.4.0-rc2.post2,这是 2.2 GA 前 org 内唯一的全局开关;09-19 至 09-20 又为全部 20 个后端 vLLM 镜像授权 2.2.0 / 插件 post2 批量重建并逐条回写,是本周规模最大的工程动作。
- community 一次性合入 20 份 FEP,2.2 特性清单与发布边界落定(09-17):编号 0081 至 0100,分属算子、编译器、框架、训练、网络、端侧、科学智能等方向;每份均含「发布边界与证据」一节,同一批文档中既有标记为已实现的概念验证(FEP-0095 Common IR),也有主动停在草案的能力项(FEP-0100 KernelGen),不把路线图当交付。
- Torch-FL 六平台转向 FlagGems-first,分派层成为主战场(09-15/09-16):PPU 路由表由 11 条扩到 478 条后落定为 435 条,482 个被 FlagGems 覆盖的算子中 47 个留在厂商内核并逐条具名;CUDA、DCU、GCU、昇腾、MUSA 五个平台同向调整。这是「一套算子库跨芯片复用」这一命题在分派层的首次完整量化。
- Open3D-PIMC 从开源发布到代码落地(09-14 ~ 09-16):中国算力大会宣布开源约 44 小时后,仓库收到首个根提交,一次带进 662 个条目(raisa-inductor 编译层与 rcs2 C++ 运行时),面向 3D 算力芯片的编程模型与编译栈进入工程状态。
- 发布件工程全面收口:制品、打包、门禁三条线并行(09-15 ~ 09-20):昇腾 FlagTree wheel 上传通路首次走通(flagtree-0.7.0rc2+ascend3.5 等到达制品库);FlagTree 的 DEB 打包与 Nexus 发布并入共享工作流;插件 wheel 改为「一次构建、全厂商索引分发」;镜像开始自报插件版本并逐条标注编译底座;FlagQuantum 覆盖率下限抬到 75%。
- 生态进入大会与赛事周期(09-18 ~ 09-21):2026 人工智能开放计算大会暨众智 FlagOS 技术大会开启报名(10 月 17 至 18 日,北京);FlagOS 与 MiniCPM 联合举办的推理吞吐优化挑战赛 09-21 开放提交;SGLang 跨芯片算子优化赛的产出持续以 PR 形式进入主仓。
- 产业面:成员单位资本与融资事件密集(09-15 ~ 09-17):燧原科技上市后的解读持续发酵(首日涨幅 179.22%、市值 1708.5 亿元的公开口径被反复引用);地瓜机器人完成 4 亿美元 C 轮融资(未来资产领投);沐曦 09-17 大涨 14.44% 并有多家机构减持报道——资本面关注点继续从「做出来」转向规模交付与盈利兑现。
二、版本与发布动态
RC 节奏与 GA 里程碑
- 2.2 时间表:特性冻结 08-31,测试与稳定期 09-01 至 09-24,GA 定档 2026-09-28;milestone「FlagOS 2.2」的 7 个 issue 至 09-17 核查全部未关闭、到期日同为 09-28;毕业标准为「可执行的测试计划在测试期内通过」后 FEP 状态由可实现转为已实现,安全补丁与严重缺陷走需 TSC 批准的加急通道。
- RC1 到 RC2:RC1 为上一周期末产物,本周初仍在 rc1.postN 迭代位(FlagGems 到 rc1.post2);RC2 清单于 09-14 10:35 生成,覆盖基础设施、算子、推理插件、训练、发布与工具五组共 24 个模块条目,规则为「版本与 rc0/rc1 保持一致,只在 .postN 迭代位推进」。
- RC2 三次迭代:FlagGems 由 rc2.post1(09-14)经 rc2.post2(09-15 11:21,community #110,两处修复驱动:flash_attention_backward 的 Triton 3.5 兼容与 tl.map_elementwise 门控)到 rc2.post3(09-18 记录);FlagCX 推进到 rc2.post2;其余条目维持在 rc2.post1。
- 分支与打标自动化:09-17 23:29 至 23:33,十个模块仓库同步切出 rc2 集成分支并打标(git ls-remote 全量 ref 核验),由 release-branch-tag 工作流按清单调 manage-release.py 批量执行;社区侧的 2.2 项目同步工作流每 15 分钟运行,发布状态改由关联 PR 推导。
- GA 倒计时:从窗口首日(09-14)的 14 天收窄至窗口末(09-20)的 8 天,测试期进入「只收 bug 修复」的后半段。
组件 tag 与 Release 清单(窗口内)
- FlagGems:v5.4.0-rc2.post1(09-14,Release)到 v5.4.0-rc2.post2(09-15)到 rc2.post3(09-18 记录);稳定线维持 v5.3.6(09-11 前后)。
- FlagSparse:v0.3.0-rc2.post1(09-14,带发行说明的 Release)。
- FlagCX:v0.14.0-rc2.post1(09-14)到 rc2.post2(09-17/18 核验)。
- FlagTree:0.7.0rc2.post1 的 Triton 3.6 / 3.5 / 3.3 三条线与 0.7.0rc2+xpu3.6(09-14);09-17 增补 0.7.0rc2 的 metax、mthreads、enflame、tsingmicro 等后端标签;09-18 昆仑芯 xpu 线再迭代出 0.7.0rc3+xpu3.6(标签实测)。
- FlagAttention:v0.4.0-rc2.post1。
- 其余组件(09-14 集中打标,rc2.post1):FlagFFT v0.2.0、FlagDNN / FlagTensor / FlagAudio / FlagBLAS v0.3.0、FlagGems-vllm v0.2.0、FlagGems-sglang v0.1.0、Torch-FL v0.2.0、sglang-plugin-FL v0.2.0、TransformerEngine-FL / Megatron-LM-FL v0.3.0、FlagOS-Compressor v0.1.0、KernelGen v2.2.0、KernelGenBench v0.2.0、FlagRelease v0.3.0;FlagScale 为 v2.1.0-rc2.post1(已跳出 2.0 线);vllm-plugin-FL 走 0.3.0 与 0.2.2 两条版本线。
镜像与制品状态
- 全 20 后端重建:09-20 03:07 的授权提交(#938)发出后,机器人账号在一个多小时内按后端逐个记录新镜像 tag;记录到的
2.2.0-0.3.0rc2.post2一档覆盖昇腾(cann8.5.0、cann9.0.0 及 910c 变体)、寒武纪(neuware4.4.3 / 4.7.2)、摩尔线程(musa4.3.6 / 5.2.0)、燧原(tops1.9.10 / 1.10.6)、沐曦(maca3.7.2.1 / 3.8.1.3)、海光(dtk26.04)、天数(corex4.5.0)、昆仑芯(xre5.37.1)、中昊芯英(tangrt1.2.0)与英伟达(cuda12.8 / 13.3);插件版本线0.2.2rc2.post2另有一批先行落地。 - 分发通路合并:插件 wheel 改为一次构建、发布到全部厂商索引(#934),版本号改从 git ref 推导(#932);运行时依赖改从厂商索引获取(#930);昇腾线补齐 cann-shmem 软件包(#939)。
- 可核对化三件事:镜像自报实际安装的插件版本(#937)、从未构建过的镜像在文档中显式标注 TBD(#948)、逐个镜像标注实际编译的 FlagTree 底座(#953);状态矩阵统计口径同步写死(#932/#933)。
- 钉版回摆与相容处理:09-20 将英伟达 cuda13.3(#940)与沐曦两个 MACA 后端(#943)钉回 FlagTree 0.6.1、燧原 tops1.9.10 钉回 0.6.0(#944);配套按钉版状态禁用 FlagTune 成本模型(#947)——与本周前段的抬版动作形成一组完整的「回摆 + 适配」。
- 昇腾与发布件:FlagTree wheel 上传通路首次走通(flagtree-0.7.0rc2+ascend3.5 与 flagtree-0.6.0+ascend3.2 到达制品库,构建耗时 26 / 14 分钟);build-infra 仓库自身标签仍停在 v2.1.1,v2.2.0 标签在窗口内尚未落下。
三、组件与代码共建
本周 org 内五期窗口提交数为 98 / 119 / 150 / 147 / 206 条,合计约 720 条(09-17 与 09-18 两期窗口存在约 1.4 小时重叠,含少量重复计),以下按模块聚合。
算子与领域库(FlagGems 及各领域库)
- FlagGems(主线,本周第一条线):五期窗口提交 12 / 43 / 71 / 40 / 38 条,合计约 200 条。三条产能线并行:KernelGen 批量入库(一周注入 Nvidia 算子 50 个以上,覆盖线性代数、特殊函数、训练反向、池化采样四类,代表性条目含 nanquantile、logdet、linalg_polar、GRU 与 LSTM 反向核、Lanczos 上采样反向、fused_adagrad、fused_sgd);KMCompiler 逐算子补齐(昇腾 matrix_rank、igammac、gru、adaptive_max_pool3d、linalg_solve_triangular;海光与沐曦共用 linalg_lstsq 多后端实现);昆仑芯 TLE 改造(sum / sum_dim 迁往 tle.gpu,并完成约十项后端修复批次:grouped_mm 大 M 小 K 的 persistent kernel、SDPA 注意力、mse_loss 全块掩码等)。
- 量化主线:海光 W8A8 INT8 GEMM(#6185,长 K 规约溢出保护)与 TLE 启用(#6247);摩尔线程 W8A16 FP8 RMSNorm(#6210)与原生 FP8 W8A8 矩阵乘(#6211);沐曦 W8A16 RMSNorm(#6326);FP8 topk 选路(#4412)。量化覆盖正从矩阵乘一层向归一化与相邻算子扩散。
- 后端修复与扩容:海光 DCU FlashAttention 前反向修复(#5822)、融合 rrelu 后端核(#6379);达摩院玄铁 PPU 后端启用 TLE(#6423);沐曦 masked_fill 越界与非法配置修复(#6480);昇腾专用线性算子(#6456)、swiglu 与 grouped_matmul(#6324 / #6325)、Top-K(#6354);昆仑芯 FlagTree 依赖升到 0.6.1+xpu3.6(#6393)、主动回退 tle.raw 标量比较快路径(#6409)、修复 masked_fill / sinh / mish / hardswish / index_fill 五算子(#6328)。
- 工程质量:修掉 linalg_svd 的 16×16 挂死(#6301)、addmv 标量 bias 的 dtype 不匹配(#6149)、nansum 整型 dtype(#6351);七个后端子包的 init.py 补齐;算子导出检查、KernelGen 测试标记只扫新增行、基准 pytest 标记与算子登记对齐(#6489);AMD W7900D 进入周测矩阵(#6312)。
- FlagGems-Experimental(试验田):海光 17 个算子一小时内批量入库(含特殊函数、线性代数、数值与索引类,另附 _scaled 修复);摩尔线程补 cholesky_inverse、linalg_ldl_solve、ormqr 等;昆仑芯补 mvlgamma;09-17 修 MetaX index_select(#419)、补 conv_depthwise2d(#391)与 dense_dim(#639);09-20 再落十个 Nvidia 小算子(稀疏与视图类,从试验田向主线摆渡的前置环节)。
- FlagSparse:以合并提交引入外部协作分支(NCIC-AlphaSparse),并以 39 条提交推进 MUSA、MACA、DCU 三后端适配(含 spgemm 单双精度测试分离、C 包装层新增,期间有一次成批回滚后重新收敛)。
- FlagFFT:36 个 FFT 算子一次性转入验收态(+2151/-2298,配 NumPy 独立校验与运行时计划),随后把验收覆盖写成强制项;09-17 为 MUSA 与 MACA 各留三维转置验证记录并统一 Triton JIT 运行时依赖钉版;窗口末段连续重构验收框架(管道流转、日志裁决、按需重生成)。
- FlagDNN:重组天数智芯与海光两个平台的实现架构,新增文本求和算子,四平台(PPU / 摩尔线程 / 昇腾 / 天数)测试面收敛。
- FlagBLAS 与 FlagAudio:FlagBLAS 修正达摩院玄铁后端的打包配置;FlagAudio 合入首批三个 PR(频谱图 Triton 算子、增益恒等检查与延迟导入、打包收尾),均为外部贡献者分支,另加 CI 的上传通路。
编译器与通信库(FlagTree 与 FlagCX)
- FlagTree:发布件工程三条(DEB 打包矩阵补 ubuntu22.04 / python3.12、发布包改走共享工作流推 Nexus、剥掉 libtriton 与 libproton 调试信息),打包基线与 wheel 版本号打通;编译器侧推进 FlagTune 托管 Manifest 与运行时兼容处理、为天数智芯建 iluvatar3.6 基线与测试工作流、统一 FlagGems 测试模板的后端初始化接口、
tle.signal与tle.signal_wait前端把同步范围与内存序暴露为显式参数(对应 FEP-0096 分布式原语方向);另有 CommonIR 转换接入 Triton 3.6、tle_raw 优化 sort 算子、Hopper WGMMA 跨 dtype 累加器复用、XPU 侧 do_bench 除零修复。 - FlagCX:交付面把 libflagcx.so 打进 wheel、统一天数智芯构建键、Nexus 上传换成共享工作流、Fedora 43 进入英伟达 RPM 矩阵;接口面把 lane mask 由 32 位放宽到 64 位(为芯片规模扩大预留);工具面把 PTD 性能日志转换改为流式处理(避免大规模压测下内存耗尽)、修正 KV 等价吞吐口径;后端面接入达摩院玄铁 PPU(CI 与 torch 插件两步走)、补天数设备 API 默认路径。
推理与训练框架
- Torch-FL:六平台 FlagGems-first 落地后,一周内以其后的绕行、开关与门禁收尾——具名绕行(MetaX 切片算子、MUSA 复数旋转位置编码留设备侧)、显式开关(CI 钉回上一个可用 FlagGems 提交、USE_FLAGTUNE=0、构建期加速器配置写入 wheel)、门禁建设(PPU 探测、平台清单外置、全平台跟踪 FlagGems master);环境变量面统一收口为 FLAGOS 一套前缀;解耦的 DCU wheel 修复 torch.cuda 可用性;窗口末段围绕 Qwen-Image 2.1 与 2512 在多芯片上的性能成线(GCU 单步降至 7.1 s/it,DCU 调度开销连续压降,最终给出吞吐曲线与尾延迟测量)。
- FlagGems-vllm:海光与达摩院玄铁对照实现 moe_sum;摩尔线程 MTT S5000 加 persistent_topk;昇腾补 SparseAttnSharedKV(DeepSeek-V4 稀疏注意力结构,单笔 +9637,六个固定形状、以精度为验收口径)与 persistent_topk,并把厂商算子收纳到统一目录;融合 Marlin MoE(INT8 / FP8 两种 W8A16 权重)与 FP8 变长 FlashAttention-2 补上推理侧「变长批与 MoE 稀疏激活」两类真实形态;窗口末段继续补 MUSA 的 fused_q_kv_rmsnorm、沐曦 varlen 注意力、昇腾 kda_gate_cumsum。
- FlagGems-sglang:承担竞赛成果落地通道——09-14 单日 10 个竞赛分支 PR 合入主仓(bmm-chunk、decode-attention、fused-rmsnorm-warp2、task19 / task21-moe-sum-reduce 等);后续内置上游测试工具、导入多模态旋转位置编码融合算子、把 do_bench 改为按厂商分派的单一函数、登记 moe_fused_mul_sum 竞赛算子并给出 batch3 的参考、测试、基准与文档一批。
- vllm-plugin-FL 与 sglang-plugin-FL:前者开启海光 vLLM 0.24.0 工作流、接入 metax CI、把燧原 S60 与昆仑芯抬到 0.24 线、接入达摩院玄铁 PPU CI、修昆仑芯 FlashAttention 状态污染、适配天数 BI-V150;后者为海光 DCU 与燧原 GCU 各建 CI 管线(海光线以 AMD adaptor 构建 FlagCX v0.13.0),dispatch 单测与平台配置解耦并为预加载加基准。
- FlagScale 与训练内核线:FlagScale 把各加速器平台上互相耦合的 CI 依赖统一收口、修复 fork PR 依赖产物缓存隔离;TransformerEngine-FL 从主线 cherry-pick 修复;Megatron-LM-FL 把硬编码 CUDA 设备操作替换为平台感知 API(覆盖优化器、初始化、训练与工具路径);FlagScale-Agent 加固 agent harness;FlagPrism 统一算子验收测试、新增燧原调试器与 TOPSPTI 性能分析支持。
发布工程与治理(build-infra / community / docs)
- build-infra:除第二节的版本抬升与镜像线之外,本周还新增 FlagCX wheel 打包线(构建、校验、发布三步)、记录海光 rc2.post1 双镜像 tag 并复验、把海光的 gflags 头文件依赖坑记录成档、把镜像 tag 与版本标签成对记录成为各后端进入 2.2 交付范围的直接凭据。
- community:2.2 发布治理从人工看板搬进自动化(每 15 分钟同步 issue 到组织项目视图,发布状态由关联 PR 推导,RC 验证规则写入说明);20 份 FEP 与 RC2 清单维护均由发布经理线推进。
- docs:文档线并入本轮 CICD 改造(new/flagcicd 分支与 main 合并),在线实验室帮助内容两轮更新。
量子与新兴方向
- FlagQuantum(本周扩速最快的方向之一):09-14 一天内完成 Twin API 冻结与 QPU 数字孪生历史序列管理(校准与验证历史、候选比较、序列恢复成链);随后按电路拓扑定级 Twin 证据、接入 JAX 前端测试并把覆盖率下限写进合约文件(60% 到 75% 两级抬升)、包级严格类型检查、量子纠错记录层落地(与具体编码方案解耦);窗口末段由单一贡献者连续铺设算法原语包,从量子傅里叶变换、相位估计、Grover 搜索、振幅估计一路铺到 QUBO 到 Ising 映射、量子核方法、量子 PCA、k-medians 等应用层原语。
- FlagTrain:09-16 新仓库落位(占位建仓,规模 5 KB),训练侧又切出一块,代码落位待观察。
- Open3D-PIMC:09-14 开源发布、09-16 代码落地(662 个条目:编译层 raisa-inductor 的 pass 体系与编译缓存键、C++ 运行时 rcs2,README 把内存层级、分片拓扑、动态推理与编译产物复用四个待补缺口写明);与 FlagOS 的 3D 算力芯片方向直接相关,不进 2.2 验收范围。
- flir(FlagTree IR):对齐上游 bufferization 语义(去掉 tile.to_tensor 的 Pure 标记)、修内存效应标记、统一 triton 版本标识口径。
四、成员单位与厂商适配
- 海光:量化(W8A8 INT8 GEMM)、TLE 启用、融合 rrelu 后端核、DCU FlashAttention 前反向修复四条线并进;解耦 DCU wheel 修好 torch.cuda 与 Qwen-Image 流;FlagSparse DCU 线(sddmm 测试、spgemm 精度分离);为 vLLM 0.24.0 开启工作流;镜像 dtk26.04 完成 rc2.post1 复验与 post2 重建。
- 昇腾:MoE 与线性注意力所需算子最密的线——SparseAttnSharedKV、persistent_topk、kda_gate_cumsum、grouped_topk(走 TLE 的 DSA 原始接口)、专用线性算子、swiglu 与 grouped_matmul;CommonIR 概念验证在 FEP 中标记为已实现(限 910B / 910C 的 Triton 3.5 线);FlagTree wheel 上传通路走通;四个镜像变体(cann8.5.0 / cann9.0.0)完成重建并补 cann-shmem。
- 摩尔线程:原生 FP8 W8A8 矩阵乘与 W8A16 FP8 RMSNorm 两条量化路径落地;MTT S5000 的 persistent_topk 与 MUSA 旋转位置编码设备侧执行;FlagTree 跳级到 0.7.0rc2+mthreads3.6;首个带插件的 0.20.2 镜像落成;FlagPrism 的 profiler 与 debugger 集成进编译器链。
- 沐曦:W8A16 RMSNorm、FP8 topk 选路、varlen 注意力优化与 masked_fill 越界修复;为 vLLM 开启 metax CI 并抬到 0.24 线;FlagSparse MACA 线适配;产业侧完成上海人工智能实验室 ATRIA Dawn Preview 的 Day0 适配(公司口径累计 37 个旗舰模型),中报扭亏、09-17 解禁窗口与股价异动为资本面记录。
- 燧原:厂商分支成批同步回主线;S60 适配 vLLM 0.24 线、GCU CI 管线、GCU300 记录进 0.24.0 报告;FlagPrism 新增燧原调试器与 TOPSPTI 支持;两个 tops 镜像完成重建;融资与上市解读持续(09-11 登陆科创板)。
- 天数智芯:iluvatar 构建键统一、并入设备控制接口 /dev/itrctl、FlagTree 为其建 iluvatar3.6 基线与测试工作流;FlagDNN 平台架构重组与测试面收敛;适配 vLLM 0.24 线;corex4.5.0 镜像完成重建。
- 昆仑芯:单日约十项后端修复批次(grouped_mm persistent kernel、SDPA、mse_loss 等)把近期算子回归清仓;xCCL 装进基础镜像;sum 迁移 tle.gpu;修 FlashAttention 模块导入的状态污染;主动回退未获稳定收益的 tle.raw 快路径与 0.6.1+xpu3.6 钉版;xpu 标签迭代到 0.7.0rc3+xpu3.6。
- 达摩院玄铁:PPU 后端在 FlagGems 启用 TLE、在 FlagCX 与 vllm-plugin-FL 接入 CI(含 torch 插件)、在 Torch-FL 门禁中显式探测;补 moe_sum 变体并接收 KernelGen 算子摆渡;已在 FlagTree 2.2 多后端规划(FEP-0098)中占位,双线参与度持续加深。
- 清微智能:Open3D-PIMC 开源发布与代码落地(与智源联合开发);分布式原语在后端启用,与 2.2 的 TLE 分布式路线合流。
- 地平线:旗下地瓜机器人(D-Robotics)完成 4 亿美元 C 轮融资,为成员体系本周最重的产业事件。
- 智源(牵头方):主导 RC2 治理与 FEP 治理落地、20 份 FEP 的发布边界定义、Open3D-PIMC 联合开发与「定义硬件形态」方向的表述;发布件与治理节奏均围绕其牵头推进。
五、生态与社区
赛事与开放竞赛
- SGLang 跨芯片算子优化赛产出持续进入主仓:09-14 单日 10 个竞赛分支 PR 合入 FlagGems-sglang;窗口后段 moe_fused_mul_sum 等竞赛算子完成登记入库(#87),batch3 参考、测试、基准与文档一并落库。竞赛正在成为 FlagOS 的常态化外部算子供给线。
- FlagOS 与 MiniCPM 模型推理吞吐性能优化挑战赛:开发与提交阶段 2026 年 9 月 21 日至 11 月 20 日,12 月初评审;面向 FlagOS 栈上的推理吞吐优化,是继算子优化赛之后社区赛事体系的延续。
会议与开源发布
- 2026 人工智能开放计算大会暨众智 FlagOS 技术大会:10 月 17 至 18 日在北京中关村国家自主创新示范区展示中心举办,主题「一栈贯通,智算无界」,09-18 开启报名;工作坊选题(KernelGen、端侧、TLE Attention、FlagScale-Agent)与本周工程观察一一对应。
- Open3D-PIMC 开源发布:09-14 中国算力大会宣布、09-16 代码上线;由清微智能与智源联合开发,定位为 FlagOS 面向下一代 3D 算力芯片的主要解决方案之一,并预告四季度在全球科技顶会发布优化成果。
新闻面与外部渠道
- 组件级新闻检索连续第十一至第十五个平静窗口:整周 24 小时窗口内零有效命中,对外动态事实以 GitHub org 与社区渠道(智源社区、知乎机构号、CSDN 专栏)为准;成员单位侧可见报道集中在资本面与自有栈 Day0 适配。
- 收录边界说明:智源社区平台上与本栈无接口的第三方内容(如紫东太初模型开源稿)未计入;纯市场行情稿与股价异动仅作背景记录。
六、趋势观察
- 2.2 进入发布件冻结与装配阶段:全局开关(version 2.2.0)落下、全后端镜像批量重建、发布件可核对化三件事同步完成;测试期仅剩一周,剩余风险集中在「装得上、跑得对」而非功能缺口,Go/No-Go 依据正在从「人看清单」转向「状态可推导」。
- 分派层成为「一套算子库跨芯片复用」的兑现层:六平台 FlagGems-first 给出了首次完整量化(PPU 线落定为 435 条 FlagGems 路由对 1601 条厂商内核路由),绕行名单(PPU 47 项、MetaX 切片、MUSA 复数旋转位置编码、CUDA 侧 FlagTune 缺位)的长度就是跨芯片复用率的反向指标;「路由加绕行名单,加门禁」成为可复用的机制模板。
- 多后端适配形态分化:向上走与往回摆并存:摩尔线程拿到 FlagTree 跳级与首个带插件镜像、昇腾 wheel 上传走通属向上;英伟达 / 沐曦 / 燧原钉回 0.6.x 与昆仑芯回退 tle.raw 快路径属回摆——后者与「宁可不修,也不破坏已验证的格子」的 RC 纪律同源,是平台适配进入稳定期的信号。
- 算子扩容双主线清晰,瓶颈从写内核转向登记与验收:量化(W8A8 / W8A16 / FP8,从矩阵乘扩到归一化与采样)与 MoE / 线性注意力(分组矩阵乘、swiglu、稀疏共享 KV、门控 Delta 规则)直接对应当前推理模型的真实结构;随 KernelGen 批量入库而来的导出检查、测试标记、基准对齐与验收框架重构,说明扩容瓶颈已转向登记与验收。
- 测试与质量基建平台化:达摩院玄铁 PPU 接入多家 CI、天数智芯建立 iluvatar3.6 基线、FlagTree 抽统一后端初始化接口、FlagQuantum 覆盖率下限与类型检查收紧——不同形态的动作指向同一目标:让每个后端都在 CI 里被持续验证,而不是靠人工跑通。
- 下一版轮廓已在文档中成形,生态运营密度即将上升:RISC-V 实验性支持、端侧 SDK、操作系统打包、具身智能与科学智能工作组已出现在 FEP 规划中,T-Head、燧原、摩尔线程的新后端进入 FlagTree 2.2 规划;FlagTrain 建仓、FlagAudio 转实、Open3D-PIMC 落地显示新方向在持续开枝;10 月大会与 9 月下旬开赛的挑战赛将使生态运营密度显著上升,预计下一个报道高峰在 09-28 发布窗口。
附录:素材与核查
- 素材(共 6 期):09-14 期(窗口 09-11 10:18 至 09-14 10:18,周一三天窗口)、09-15 期(09-14 10:18 至 09-15 10:18)、09-16 期(09-15 10:18 至 09-16 10:18)、09-17 期(09-16 10:18 至 09-17 11:40)、09-18 期(09-17 10:18 至 09-18 10:18)、09-20 期(09-18 10:18 至 09-20 10:18,周末补充期,约 48 小时)。
- 核查方式:GitHub org flagos-ai 全量仓库 pushed_at 核查(54 个仓库)、单次 commit search 按 committer-date 全量核验(五期合计约 720 条)、重点仓库默认分支提交复核、git ls-remote 分支与标签核验、各组件 tags 与 releases 元数据实测;community 发布清单、FEP 目录与 2.2 发布时间表直取;新闻侧为 Google News RSS 中英文 33 组查询(周末 24 组)与社区渠道巡检。
- 口径说明:09-14 期窗口主要覆盖上一周期(09-11 至 09-13),本周报仅采用其 09-14 当日条目;09-17 与 09-18 两期窗口重叠约 1.4 小时,合计提交数含少量重复计;组件级新闻连续第十一至十五个窗口零命中,技术面结论以代码仓库为据,产业侧信息含厂商在会议场合的单方口径,均已在日报中标注来源。
- 主要引用(按名称可在对应仓库检索定位):
- 2.2 发布时间表 — https://github.com/flagos-ai/community/blob/main/release/2.2/schedule_CN.md
- 2.2 RC2 清单 — https://github.com/flagos-ai/community/blob/main/release/2.2/release-2.2-rc2.yaml
- FEP 目录 — https://github.com/flagos-ai/community/tree/main/fep
- FEP-0099 算子库 — https://github.com/flagos-ai/community/blob/main/fep/sig-operator/0099-operator-library-flagos-2.2.md
- build-infra configs.yaml — https://github.com/flagos-ai/build-infra/blob/main/configs.yaml
- build-infra 版本抬升 #916 — https://github.com/flagos-ai/build-infra/commit/dc947656038dab790fe9e107f06533a1bf05abdd
- build-infra 全后端重建授权 #938 — https://github.com/flagos-ai/build-infra/pull/938
- build-infra 插件 wheel 一次构建 #934 — https://github.com/flagos-ai/build-infra/pull/934
- FlagGems v5.4.0-rc2.post1 Release — https://github.com/flagos-ai/FlagGems/releases/tag/v5.4.0-rc2.post1
- FlagSparse v0.3.0-rc2.post1 Release — https://github.com/flagos-ai/FlagSparse/releases/tag/v0.3.0-rc2.post1
- Torch-FL PPU 路由 #290 — https://github.com/flagos-ai/Torch-FL/pull/290
- FlagGems PPU 启用 TLE #6423 — https://github.com/flagos-ai/FlagGems/pull/6423
- Open3D-PIMC 仓库 — https://github.com/flagos-ai/Open3D-PIMC
- 下一期区间:2026-09-21 至 09-27(2.2 GA 前最后一周,重点观察 Go/No-Go 结论、v2.2.0 标签落下时点与全后端验收收口)。