调研窗口:2026-09-21 10:18 ~ 2026-09-22 10:00(约 24 小时;承接 09-21 日报窗口,无空档) 信源:GitHub(org: flagos-ai,54 仓库 pushed_at 全量核查,窗口内 19 个仓库有推送;提交搜索命中 224 条,跨 15 个仓库)、Google News RSS(中英文 24 组查询词,走代理)、沐曦官网、界面新闻、观点网、智源社区等(详见附录信源清单)


本期索引

  • 今日重点:FlagFFT 补齐海光后端——BW1000(HCU)适配器进入 dev,单窗口 102 笔提交横跨 MACA/Ascend/HCU 三线(09-21/09-22)
  • 一、开源项目进展(GitHub 动态)
    • 1.1 FlagFFT:HCU 适配器落地,MACA/Ascend 性能与证据收口,打包三件套合入(09-21/09-22)
    • 1.2 build-infra:FlagCX wheel 通道六连合入、昆仑芯下发在审;纯 Python 组件统一发布通道(09-21/09-22)
    • 1.3 FlagCX:v0.14.0-rc2.post2 发布——清微 TSM torch 插件链接修复(09-21)
    • 1.4 FlagGems-vllm:壁仞 SUPA 后端合入;昇腾 XCS 算子批与六平台 topk 调优(09-21/09-22)
    • 1.5 FlagGems:KernelGen 再入库 Nvidia 算子;昆仑芯修复批;海光 W8A8 TLE 管线替换(09-21/09-22)
    • 1.6 FlagTree:天数 Iluvatar TLE 分布式与 TLE_RAW;NVIDIA TLE SMEM 子切片(09-21/09-22)
    • 1.7 其余动态:FlagTensor 0.3.0-rc2 打包线、FlagQuantum 互操作、FlagSparse、FlagAudio、FlagOS-Compressor 等(09-21)
  • 二、新闻报道与生态
    • 2.1 组件级检索连续第十七个平静窗口(09-21/09-22)
    • 2.2 沐曦 MXMACA 合入 LMCache 主线:成员单位软件栈「上游优先」融入全球推理生态(09-18/09-21)
    • 2.3 界面新闻盘点沐曦 39 个 Day 0 适配:国产 GPU「软硬一体」生态叙事(09-21)
  • 三、成员单位深挖
    • 3.1 沐曦:MACA 线三仓收口(FFT / 编译器 / 训练工具)(09-21/09-22)
    • 3.2 海光:FlagFFT HCU 适配器与 FlagGems W8A8 TLE 替换(09-21/09-22)
    • 3.3 昇腾:XCS 算子批与 NPU FFT 优化,910C vLLM 0.28 升级在审(09-21/09-22)
    • 3.4 天数智芯:Iluvatar TLE 分布式合入(09-22)
    • 3.5 摩尔线程:index_add/polar 优化合入,多条算子 PR 在审(09-21/09-22)
    • 3.6 燧原:FlagGems-sglang 注册 GCU vendor(09-21)
    • 3.7 清微智能:FlagCX rc2.post2 修复 TSM torch 插件(09-21)
    • 3.8 达摩院玄铁:PPU 融合算子合入与 PPU CI 校验(09-21)
  • 四、总结与趋势观察
  • 附录:信源核查表
  • 完整信源清单

今日重点:FlagFFT 补齐海光后端——BW1000(HCU)适配器进入 dev,单窗口 102 笔提交横跨三线

日期:2026-09-21 ~ 2026-09-22 来源FlagFFT 提交记录(dev)

09-21 深夜至 09-22 上午,FlagFFT(经 Triton/TLE 与 libtriton_jit 在运行时生成后端目标内核的 JIT 编译 FFT 库)把海光 BW1000(HCU)后端适配器合入 dev 分支:「Add HCU backend adaptor for BW1000」(09-21 22:39)起步,随后是 hipFFT 句柄转换修复(22:55)、独立 capture 链接 Torch HIP(23:01)、内存安全原策(09-22 00:11),并以「Hygon BW1000 HCU 环境搭建」「统一 HCU 测试构建」两篇文档(09-22 08:44 / 08:47)与上游打包合并(08:57)收尾。README 的 CMake 后端清单随之更新为 CUDA / MUSA / PPU / IX / MACA / NPU / HCU 七项——海光第一次进入 FFT 库的后端矩阵

同窗口 FlagFFT 单库提交数达 102 笔,另两条线各自成批:MACA(沐曦)的性能收口——FP64 寄存器交换实验当日试落又撤回(Revert)、pack8 按叶布局门控、四步与直连混合基的共享内存预算,以及一批带证据留档的验收工具;NPU(昇腾)合并单 CT 优化并落地 Stockham 批次(16 蝴蝶单元、打包实数 FFT、限定向量下行等约十笔同批)。打包方向三件套同步合入:Debian + RPM 打包(#12)、Nexus 发布通道(#19 / #20)、0.2.0-rc2 移植(#18),另放宽 nlohmann_json 下限(#22)——FFT 库本窗口同时完成了「新后端 + 性能收口 + 分发打包」三件事。


一、开源项目进展(GitHub 动态)

窗口总览:org 内 54 个仓库中 19 个在窗口有推送;提交搜索命中 224 条(跨 15 个仓库);另有 FlagCX(发布分支)、docs、vllm-plugin-FL 等仓库的 PR 与分支侧推送未计入搜索。分布为:FlagFFT 102、FlagGems 29、FlagTensor 23、FlagQuantum 19、FlagGems-vllm 14、FlagSparse 11、build-infra 7、FlagTree 5、FlagAudio 5、FlagOS-Compressor 3、FlagGems-sglang 2,FlagPrism / FlagDNN / FlagBLAS / FlagScale 各 1。

本窗口形态 = 「FFT 库多后端冲刺」+「发布工程收口」+「后端阵列扩员」:FlagFFT 占据近半提交量(见「今日重点」);build-infra 把 FlagCX wheel 与纯 Python 组件发行通道推到位;插件侧同日新增壁仞 SUPA 与燧原 GCU 两个后端点名。

1.1 FlagFFT:HCU 适配器落地,MACA/Ascend 性能与证据收口,打包三件套合入(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 来源FlagFFT #12#18#22

主线详见「今日重点」。补充三点:其一,MACA 线的验收工具批把装箱(pack8)门控、资源与证据记录、三进程双向小例固化成流程(15:39–16:17 集中十笔);其二,「docs: complete MACA IX and Ascend setup」(22:51)补齐三条后端的环境文档,与新后端的「环境文档 + 统一测试构建」做法相互呼应;其三,打包三件套(#12 / #18 / #19 / #20)于 09-21 午后集中合入,Nexus 上传复用 org 级共享工作流。

1.2 build-infra:FlagCX wheel 通道六连合入、昆仑芯下发在审;纯 Python 组件统一发布通道(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 来源build-infra #993#995#998#1000

FlagCX 的 wheel 分发线在本窗口连推七笔(六合入 + 一在审):#994 发布 wheel 线所需的构建工具链镜像(12:45)、#995 把各行的设备 bitcode 装进 wheel(13:59)、#996 让 FlagCX 自打包设备 bitcode(15:30)、#997 wheel 通道再开四行(19:07)、#999 重构 join 命名(21:12)、#998 在「该行设备所在处」构建 wheel(23:18);本晨在审的 #1000 把下发线延伸到昆仑芯(deliver the kunlunxin wheel)。这条线把跨芯片通信库的分发从「源码编译 + 镜像」推进到逐后端预编译 wheel

另一条是 noarch-deb 集中发布通道(#993):为纯 Python 组件建立单一工作流——一套逻辑覆盖 FlagAudio、FlagSparse、FlagAttention 三个组件(差异收敛到一个 case 块),构建前先按发布线打版本(组件打包元数据版本号与发布线此前存在漂移),配套 noarch-rpm.yml。「容器镜像之外」的原生包通道继续加固

1.3 FlagCX:v0.14.0-rc2.post2 发布——清微 TSM torch 插件链接修复(09-21)

日期:2026-09-21 来源FlagCX #617发布页

22:11 发布 v0.14.0-rc2.post2,内容为 #617:torch_txda(清微 TSM 的 Torch 插件)库目录解析修复——get_device_config() 的 txda 分支此前把库目录解析为 <package>/lib(该路径在包中不存在),链接期报 cannot find -ltorch_txda;修复后在 TSM 运行时镜像上实测通过。这是 rc2 线的第二个补丁版(继 post1),延续 2.2 发布件「逐后端逐个修补」的节奏(详见 3.7)。

1.4 FlagGems-vllm:壁仞 SUPA 后端合入;昇腾 XCS 算子批与六平台 topk 调优(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 来源FlagGems-vllm #794#816#830#828

壁仞 SUPA 后端:#794 合入(17:09),四个文件——runtime/backend/_biren/ 初始化、启发式配置、tune_configs 与 common.py;提交由壁仞工程师共同完成。又一家芯片厂商以「后端目录 + 调参配置」的标准形态接入统一插件

昇腾 XCS 线:窗口内五枚算子合入(#811 kda_state_scatter、#812 kda_conv_gather、#813 kda_conv_scatter、#814 paged_scatter、#815 indexer_epilogue、#816 slot_mapping),本晨 #828 跟进 pack_seq/unpack_seq 性能项。其中 #816 给出实测:把分页 KV 的槽位映射从「每请求单 program」改为按(请求,token 块)并行、int32 索引算术使除法降为移位——4 请求生产形态设备时间 69 → 13 μs(5.5 倍)、整轮服务每卡 1050.9 → 81.2 ms(12.9 倍),且与上游 kernel 逐位一致。另有 #818 group_list_cumsum、#819 indexer_gemm_score 在审。

调优与 CI:#830 为全局 topk 索引与长度算子(compute_global_topk)在六个平台(MetaX / Hygon / MThreads / Ascend 等)一并调参并补测试与基准;#780 让 top_k_per_row_prefill/decode 在 mctle 构建上走 TLE 路径;#829 新增手动算子测试工作流。在审池保持高位:MThreads #822 / #823、MetaX #826 / #785、Hygon #827 / #820 / #803、Ascend #744、TLE mhc #734 等。

1.5 FlagGems:KernelGen 再入库 Nvidia 算子;昆仑芯修复批;海光 W8A8 TLE 管线替换(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 来源FlagGems #6005#6264#6518#6346

KernelGen(Nvidia)13 枚:quantized_max_pool2d(#6005)、msort(#5844)、_standard_gamma(#6103)、masked_select_backward(#5824)、_thnn_differentiable_lstm_cell_backward(#5815)、row_stack(#6011)、batch_norm_gather_stats(#5747)、inner(#6320)、smm(#5964)、quantized_max_pool1d(#5938)、row_indices(#6012)、replication_pad1d_backward(#5922)、_lu_with_info(#5877)——自动生成管线持续为通用算子库补充长尾算子。

昆仑芯修复批:五笔合入——add/cat/div 点式与布局(#6264,add 快路径把单次调用宿主时间从约 36 μs 降到约 5.5 μs,P800 上为原生实现的 0.84–1.56 倍)、sort(#6263)、moe_align 宿主元数据与 padded fused-MoE 派发重构(#6398)、GEMM 运行维保持未特化以稳定内部参数布局(#6415)、special_bessel_y1 / softplus / weight_norm 批(#6426)。

海光 W8A8(#6518):因 HCU 的 TLE 白名单支持加载类原语但拒绝流水类原语,把 mm_w8a8_int8 的三处流水改写为分段 tl.range 循环(保留 TLE 加载),恢复被误删的 rms_norm_w8a16_fp8 公开导入,并把海光加入基准的 FP8 能力检查。

其他:#6346 为 copy 算子补低精度与 FP8 测试(NVIDIA / Ascend / Hygon / 玄铁 / MetaX / Iluvatar 六后端);upsample 三个反向 overloads(#6504 / #6505 / #6506);本晨合入 MTHREADS 的 index_add 与 index_add_(#6368)与 polar(#6026)优化;工程面有 RPM 打包回退(#6537)、CI 共享内存尺寸(#6541)、setup.sh 的 torch_npu 与 triton 导入修复(#6545)、基准零延迟守卫(#6540)、fused_moe INT8 W8A8 分类(#6081)。在审:#6513 rrelu_with_noise。

1.6 FlagTree:天数 Iluvatar TLE 分布式与 TLE_RAW;NVIDIA TLE SMEM 子切片(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 来源FlagTree #1184#1079#1252#1258

  • #1184(09-22 02:14,30 文件):Iluvatar 后端同步至 Triton v3.6.x 线并扩展 TLE——新增 TLE 分布式(n_pes / get_device_id / remote_pointers / distributed_barrier,由 FlagCX 支撑)与 TLE_RAW(CoreX clang JIT + 延迟 dsl_region 物化);Gluon 改为常开注册;把 nv_mma_shared_layout 重映射到 TCU swizzled shared,使 TLE GEMM 可走 SME G2S 流水。
  • #1079:NVIDIA TLE 新增 SMEM 子切片与多写者 TMA 管道。
  • AMD:#1252 AtomicCAS 张量操作数线程谓词(移植 triton #9605);#1240 CanonicalizePointers 的 scf.if fat-ptr 合并与非整数位转换修复。
  • 沐曦 / AABS:#1258 修复 metax dot m 的 block_size 限制;#1253 在审(MACA MMA 布局无法切分的 dot 保留在 blocked layout)。
  • CI / 打包:#1263 / #1264 把 GEMS 复用工作流纳入 CORE 变更检测;#1260 在审(rpm 安装 clang 并打包 flagtree);#1259 PPU CI 增加 pid.txt 校验在审。

1.7 其余动态:FlagTensor 0.3.0-rc2 打包线、FlagQuantum 互操作、FlagSparse、FlagAudio、FlagOS-Compressor 等(09-21)

日期:2026-09-21 来源FlagTensor #23FlagQuantumFlagOS-Compressor #9

  • FlagTensor(23):0.3.0-rc2 分支合入(#23,27 文件:deb/rpm 打包、CMake 查找 Torch、libflagtensor-nvidia-dev 拆分等)+ Nexus 上传工作流(#20)+ 打包脚手架(#4),版本对齐 0.3.0 发布线。FlagTensor 是 FlagOS 的 Triton 张量原语库(一元 28 算子、二元 4、收缩 6,对标 cuTensor 基线)——本窗口的实质动作是「进入打包与分发体系」。
  • FlagQuantum(19):互操作与一致性测试密集推进——Qiskit 差分一致性(#118)、PennyLane 差分一致性(#122)、Cirq 适配器契约(#125)、Qiskit 多量子位酉矩阵转换(#114)与算术参数表达式导入(#111)、区域孪生电路校验(#116 / #120),以及一批输入校验修复(#107 至 #127)。
  • FlagSparse(11):NCIC-AlphaSparse 协作分支连合三个 PR(#76 / #77 / #78)——MACA SpMV CSR 基线、XPU MACA 与 Ascend 测试等。
  • FlagAudio(5):pyproject.toml 缺逗号修复(#12)+ RPM 缺少 pyproject-rpm-macros 时的普通 pip 回退(#10)。
  • FlagOS-Compressor(3):面向 DeepSeek V4.1 与 MiMo V2.5 的线性 INT8 导出(#9——头扫描、矩形 FP8 块、保留索引器与 Engram 表等)16:08 合入、16:59 被 Revert 撤回(提交信息未说明原因),该能力暂回到合入前状态。
  • FlagGems-sglang(2):燧原 GCU vendor 注册(#99)。
  • 单笔:FlagBLAS mthreads L2 支持合入(#122)、FlagDNN 修复 ppu 测试、FlagPrism Nvidia dev 202609(#15)、FlagScale metax 参数修复(#1296)。

二、新闻报道与生态

2.1 组件级检索连续第十七个平静窗口(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 来源:Google News RSS(中英文 24 组查询词,走代理)

以 FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen 等组件名做中英文检索(when:7d 与 when:14d),24 小时窗口继续零命中,构成组件级检索连续第十七个平静窗口(上一窗口为第十六个)。剔除说明:「智源研究院」关键词命中以智谱 ZCode 数据风波系列与博彩 SEO 为主(与 FlagOS 无关,未收录);HN 对 FlagOS / FlagGems 的检索无相关命中。本窗口对外信息面由成员单位侧承接(2.2、2.3)。

2.2 沐曦 MXMACA 合入 LMCache 主线:成员单位软件栈「上游优先」融入全球推理生态(09-18/09-21)

日期:2026-09-18(官宣)/ 2026-09-21(媒体波) 来源沐曦官网观点网LMCache PR #4606

沐曦与国际开源 KV Cache 项目 LMCache 达成合作,自研软件栈 MXMACA 以「Upstream First」原则加入 LMCache 官方原生支持体系,代码合入主干并建立随版本迭代的 CI 验证机制(路线图见 LMCache #4833)。LMCache 由芝加哥大学团队发起,现有 220+ 贡献者、30+ 行业合作伙伴,是大模型推理 KV Cache 管理的主流开源项目。09-21 观点网、凤凰网等转发官宣稿。「上游优先」在本栈同样是一贯做法(向 PyTorch 与各上游社区贡献),这一案例是国产算力融入全球推理生态的可对照路径。

2.3 界面新闻盘点沐曦 39 个 Day 0 适配:国产 GPU「软硬一体」生态叙事(09-21)

日期:2026-09-21 来源界面新闻

13:52 发布的盘点文章:截至 09-20,沐曦自 2025 年 12 月以来完成 39 个主流旗舰模型的 Day 0 适配(覆盖智谱、阿里千问、MiniMax、DeepSeek、阶跃星辰、腾讯混元等);MXMACA 软件栈覆盖驱动、用户态接口、编译器、算子适配与训练/推理框架,支持 40+ AI 框架、1000+ 模型与 6000+ 开源项目测试,全量支持 PyTorch 2.8 的 2410 个 GPU 算子;并披露下一代曦云 C700 核心设计与功能验证大部分完成。「统一编译器 + 算子 + 框架多层覆盖」的叙事与本栈的多芯片统一路径互为镜像,是成员单位对外传播的主力素材。

三、成员单位深挖

3.1 沐曦:MACA 线三仓收口(FFT / 编译器 / 训练工具)(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 来源FlagFFT 提交FlagTree #1258FlagScale #1296

代码侧三条:FlagFFT 的 MACA 线约 17 笔(FP64 寄存器交换实验当日试落又撤回、pack8 按叶布局门控、四步与直连混合基的共享内存预算、验收工具与证据留档,含三进程双向小例结果);FlagTree 的 AABS 修复 metax dot m 块大小限制(#1258 合入;#1253 在审);FlagScale 修 metax 参数(#1296 合入)。新闻侧见 2.2 与 2.3——沐曦是本窗口对外与代码两侧同时最活跃的成员单位

3.2 海光:FlagFFT HCU 适配器与 FlagGems W8A8 TLE 替换(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 来源FlagFFT 提交FlagGems #6518FlagGems-vllm #803

  • FlagFFT:HCU(BW1000)后端适配器与配套修复、文档(详见「今日重点」与 1.1)——FFT 库第一次把海光平台纳入后端矩阵
  • FlagGems:#6518 用分段 tl.range 替换 HCU TLE 白名单不支持的流水原语,并恢复 rms_norm_w8a16_fp8 导入、把海光加入基准 FP8 能力检查。
  • 在审:FlagGems-vllm 三条海光线——#820 INT8 varlen flash attention、#803 INT8 块状 BMM 与 int8_einsum、#827 top_k_per_row_decode。

3.3 昇腾:XCS 算子批与 NPU FFT 优化,910C vLLM 0.28 升级在审(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 来源FlagGems-vllm #816#828vllm-plugin-FL #487

  • FlagGems-vllm:XCS 算子批(#811 至 #816,见 1.4 的性能数)、#828 pack_seq 与 unpack_seq 跟进、#821 TLE 优化 topk_softplus_sqrt、#744 fused_marlin_moe_w4a16_int4 在审。
  • FlagFFT:NPU 线合并单 CT 优化与 Stockham 批(约十笔)。
  • vllm-plugin-FL:#487「支持 vLLM 0.28(NVIDIA 与昇腾 910C)」在审;#484 NVIDIA 线 vLLM 0.28.0 已合入——vLLM 0.24 至 0.28 的升级线启动
  • FlagGems:#6545 修复 setup.sh 的 torch_npu 与 triton 导入错误。

3.4 天数智芯:Iluvatar TLE 分布式合入(09-22)

日期:2026-09-22 来源FlagTree #1184

凌晨合入的 30 文件大 PR:Iluvatar 后端同步至 Triton v3.6.x,并扩展 TLE 分布式与 TLE_RAW、Gluon 常开、nv_mma_shared_layout 重映射到 TCU swizzled shared(详见 1.6)。分布式原语由 FlagCX 支撑,是天数线在 FlagOS 内「编译器 + 通信」协同的一处体现;TLE_RAW 的 CoreX clang JIT 路径亦为按该工具链特性做的工程适配。

3.5 摩尔线程:index_add / polar 优化合入,多条算子 PR 在审(09-21/09-22)

日期:2026-09-21 ~ 2026-09-22 来源FlagGems #6368FlagGems-vllm #822FlagBLAS #122

  • FlagGems:本晨 10:01 合入 index_add 与 index_add_ 性能优化(#6368)与 polar(#6026)。
  • FlagGems-vllm 在审:#822 fused_inv_rope_fp8_quant 移植与优化、#823 flash_attn_varlen_func 的 W8A8 FP8 支持、#831 top_k 窄值带修复、#807 fp8_fp4_mqa_logits。
  • FlagTree:#1261 fmul_rn_fp32 libdevice 支持在审。
  • FlagBLAS:#122 mthreads L2 支持合入。

3.6 燧原:FlagGems-sglang 注册 GCU vendor(09-21)

日期:2026-09-21 来源FlagGems-sglang #99vllm-plugin-FL #556

#99 把 enflame(gcu)后端接入 vendor 管道:注册 vendors.ENFLAME、映射 torch 的 gcu 设备属性、标记缺少 fp64 / int64 支持、完成 VendorDescriptor(PrivateUse1 派发、TLE 启用)、设备查询命令定为 efsmi -L、补 CodeGenConfig 与 num_warps 启发式。vllm-plugin-FL 侧 #556「按 MUSA 矩阵对齐 e2e 覆盖」本晨更新——燧原线的插件化接入与测试对齐同步推进

3.7 清微智能:FlagCX rc2.post2 修复 TSM torch 插件(09-21)

日期:2026-09-21 来源FlagCX #617

v0.14.0-rc2.post2 的唯一内容:修复 TSM(清微,构建选项 USE_TSM)Torch 插件对 torch_txda 库目录的解析,解决 TSM 运行时镜像上链接失败(cannot find -ltorch_txda)。清微在本栈 2.2 线多点位出现(KernelGen 2.2.0 新增硬件、build-infra 镜像行 tsingmicro-tsm260610、FlagCX 后端文档),本次修复令其 torch 插件构建通路打通。

3.8 达摩院玄铁:PPU 融合算子合入与 PPU CI 校验(09-21)

日期:2026-09-21 来源FlagGems-vllm #796FlagTree #1259

  • FlagGems-vllm #796:PPU(thead)版「逆 RoPE 与 FP8 量化融合」与「按 token 分组 FP8 量化」两个算子——因 FlagTree PPU 暂不能降级原生 tl.float8e4nv 指针与转换,改用整数运算编码 E4M3FN 并通过 uint8 无拷贝视图写出,无 torch 计算回退。
  • FlagDNN:修复 ppu 测试。
  • FlagTree:#1259 PPU CI 增加 pid.txt 校验在审。

四、总结与趋势观察

  • 后端矩阵「逐库补齐」:FFT 库迎来海光 HCU;插件侧同日新增壁仞 SUPA 与燧原 GCU 两个后端点名。「厂商自建后端目录 + 调参配置」已是标准接入形态,多芯片覆盖从发布件矩阵延伸到每个基础库。
  • FFT 库一日吞吐 = 工具链成熟度信号:102 笔提交横跨 MACA / NPU / HCU 三线,性能改动普遍附带分配预算、门控与证据留档(含当日试落又撤回的实验)——开发流程从「能跑」转入「可复现地调优」。
  • 分发形态三轨化:FlagCX wheel 携带设备 bitcode(#995 至 #998,与在审的昆仑芯 #1000)、纯 Python 组件统一 noarch deb/rpm 通道(#993)、FlagFFT 与 FlagTensor 打包三件套——发布物从「镜像 + 文档」扩到「wheel / deb / rpm + 镜像」。
  • 2.2 收口与新版本线并行:六平台 topk 调参(#830)、六后端 FP8 测试(#6346)、昇腾 XCS 性能项(#816)属加固侧;vLLM 0.28 升级(#484 已合入、#487 在审)与 FlagTree packaging(#1260 在审)属下一版本侧。
  • 此前较静模块集体动作:FlagTensor(0.3.0-rc2 打包)、FlagAudio(打包修复)、FlagSparse(协作分支合并)与此前「待观察」清单正好呼应——rc2 线内这些模块进入了验收与分发动作。
  • 对外传播仍低位:组件级检索第十七个平静窗口 vs 224 笔提交;成员单位侧(沐曦 LMCache、39 个 Day 0)承担对外信息主力。待观察:FlagOS-Compressor 撤回后的后续动作、vLLM 0.28 线在各后端的落地速度。

附录:信源核查表

类别 信源 核查方式 结果
GitHub org: flagos-ai repos API 54 仓库 pushed_at 全量核查 19 仓窗口内活跃
GitHub 提交搜索 + 逐仓核对 窗口内逐条核验 224 条(15 仓库)+ 分支推送
GitHub releases.atom(24 仓扫描) 逐仓扫描 新增 FlagCX v0.14.0-rc2.post2
新闻 Google News RSS(中英文 24 组查询词,走代理) 24 小时窗口过滤 + 逐条剔除 组件词零命中(第 17 个平静窗口);成员词保留 2 条
媒体 沐曦官网 / 界面新闻 / 观点网 / 凤凰网 原文抓取复核 LMCache 合入、39 个 Day 0 盘点
社区 智源社区 / HN Algolia 检索复核 窗口内无 FlagOS 相关新稿
项目文档 FlagTensor / FlagFFT / FlagCX README 与 docs 原文抓取 后端清单与库定位核对

完整信源清单