Окно мониторинга: 2026-09-18 10:18 ~ 2026-09-20 10:18 (около 48 часов, включая выходные; продолжает окно ежедневного отчёта от 09-18, без пропусков) Источники: GitHub (org: flagos-ai, полная проверка pushed_at по 54 репозиториям; 206 коммитов в 20 репозиториях за окно проверены поштучно), Google News RSS (24 группы поисковых запросов на китайском и английском, через прокси), сообщество Zhiyuan, официальные аккаунты Zhihu, колонка FlagOS на CSDN и др. (подробности в приложении со списком источников)


Индекс выпуска

  • Главное за сегодня: массовая авторизованная пересборка образов vLLM для всех 20 бэкендов build-infra, релиз 2.2 входит в сборку rc2.post2 (09-19/09-20)
    1. Прогресс проектов с открытым исходным кодом (динамика GitHub)
      • 1.1 build-infra: авторизованная пересборка образов vLLM для 20 бэкендов, wheel плагинов переходит на «одна сборка, распространение на всех производителей» (09-19/09-20)
      • 1.2 build-infra: стратегия фиксации версий FlagTree ужесточена до 0.6.x, модель затрат FlagTune отключена при фиксации версии (09-20)
      • 1.3 FlagGems: KernelGen продолжает попадать в репозиторий, бэкенд Kunlunxin за один день массово исправляет около десяти пунктов (09-20)
      • 1.4 FlagGems: бэкенд PPU XuanTie от Damo Academy включает TLE, исправление Flash Attention для Hygon DCU (09-20)
      • 1.5 FlagSparse: интенсивное продвижение адаптации трёх бэкендов MUSA / MACA / DCU (09-18~09-20)
      • 1.6 FlagQuantum: большое расширение пакета алгоритмических примитивов — QFT, оценка фазы, Grover, QUBO и ещё более десяти пунктов (09-18~09-20)
      • 1.7 Torch-FL: оптимизация производительности Qwen-Image 2.1 / 2512 на множестве чипов выстроена в линию (09-18~09-20)
      • 1.8 Прочая динамика: FlagTree, FlagGems-sglang, FlagGems-vllm, FlagFFT, FlagPrism и др. (09-18~09-20)
    1. Новости и экосистема
      • 2.1 Компонентный поиск: пятнадцатое подряд спокойное окно — ноль попаданий за 48 часов (09-18~09-20)
      • 2.2 Конференция по открытым вычислениям в области искусственного интеллекта 2026 и техническая конференция Zhongzhi FlagOS открывают регистрацию: 17-18 октября, Пекин (09-18)
      • 2.3 Конкурс по оптимизации пропускной способности инференса моделей FlagOS × MiniCPM: подача заявок открывается 21 сентября (опубликовано недавно)
    1. Углублённое изучение организаций-участников
      • 3.1 Kunlunxin: массовое внедрение исправлений бэкенда FlagGems (09-20)
      • 3.2 Moore Threads: двойное продвижение операторов линии MUSA и образов (09-20)
      • 3.3 Hygon: исправление DCU Flash Attention и линия производительности Qwen-Image (09-20)
      • 3.4 XuanTie от Damo Academy: бэкенд PPU включает TLE, операторы KernelGen попадают в основную ветку (09-19/09-20)
      • 3.5 MetaX: адаптация FlagSparse линии MACA и записи об образах (09-19/09-20)
      • 3.6 Iluvatar CoreX: сужение фронта тестирования FlagDNN (09-19/09-20)
      • 3.7 Ascend: пересборка образов, специализированные линейные операторы и оператор kda_gate (09-20)
      • 3.8 Образы и инструментальная часть Moore Threads / Enflame / MetaX (09-20)
    1. Итоги и наблюдения за тенденциями
  • Приложение: таблица проверки источников
  • Приложение: полный список источников

Главное за сегодня: массовая авторизованная пересборка образов vLLM для всех 20 бэкендов build-infra, релиз 2.2 входит в сборку rc2.post2

Дата: 2026-09-19, 2026-09-20 Источник: build-infra #938, build-infra #956, build-infra #934

В данном окне build-infra с 43 коммитами стала самой плотной линией внутри org, действия предельно сконцентрированы: авторизация пересборки образов vLLM 2.2.0 / plugin post2 для всех 20 бэкендов с последующей записью результатов пересборки назад по каждому из них. Коммит app changelogs: authorize the 2.2.0 / plugin-post2 rebuild for all 20 images (#938) от 09-20 03:07 стал стартовым сигналом, после чего с 09-20 03:07 до 10:28 в течение более часа аккаунт-бот поочерёдно фиксировал новые теги образов по каждому бэкенду; 09-20 09:43 была добавлена ещё одна запись authorize the 2.2.0 / plugin-post2 rebuild for all 20 vllm 0.24.0 images, которая явно вынесла в заголовок охват и базовую версию этого раунда пересборки (vLLM 0.24.0).

Зафиксированные теги образов охватывают всю матрицу бэкендов org: 2.2.0-0.3.0rc2.post2 одним блоком охватывает Ascend (cann8.5.0, cann9.0.0 и два варианта 910c), Cambricon (neuware4.4.3 / 4.7.2), Moore Threads (musa4.3.6 / 5.2.0), Enflame (tops1.9.10 / 1.10.6), MetaX (maca3.7.2.1 / 3.8.1.3), Hygon (dtk26.04), Iluvatar CoreX (corex4.5.0), Kunlunxin (xre5.37.1), Zhonghao Xinying (tangrt1.2.0) и NVIDIA (cuda12.8 / 13.3); более ранний блок 0.2.2rc2.post2 (версия плагина) уже был выпущен ранее. Все 20 бэкенд-образов обновлены в одном окне — это самое масштабное действие внутри org за текущее окно.

В паре с этим идёт изменение способа распространения wheel-пакетов плагина: vllm-plugin wheel: build once, publish to every vendor index (#934) от 09-19 23:34 меняет схему «сборка отдельно для каждого вендора» на «одна сборка, публикация во все вендорские индексы», после чего два коммита переводят вывод номера версии на git ref (#932) и исправляют проблему разворачивания параметра runs-on (#935). Эта цепочка сжимает дистрибуцию плагина с «N сборок» до «1 сборка + N публикаций» — структурная оптимизация в релизной инженерии.

Другая параллельная линия завершения превращает «что именно установлено в образе» в проверяемый факт: vllm app image: read the installed plugin version past the entrypoint (#937) заставляет образ самостоятельно сообщать версию плагина; docs: print TBD for an app image that was never built (#948) явно помечает в документации никогда не собиравшиеся образы как TBD; changelogs: name the FlagTree each 2.2.0 vllm image actually builds on (#953) помечает для каждого образа фактическую базу сборки. Все три изменения сокращают пространство для «несоответствия документации и артефактов».

Если рассматривать действия в окне вместе: сборка релизных артефактов 2.2 уже дошла до стадии «массовая пересборка всех бэкенд-образов + проверяемость версий + объединение каналов распространения», до GA по графику релиза (2026-09-28) остаётся 8 дней — это нормальный темп продвижения в период тестирования и стабилизации.


1. Прогресс открытых проектов (динамика GitHub)

Обзор окна: из 54 репозиториев org 20 имеют коммиты в данном окне, всего 206 коммитов (за 48 часов, включая выходные), распределение: build-infra 43, FlagSparse 39, FlagGems 38, FlagQuantum 23, FlagGems-sglang 10, FlagGems-Experimental 10, Torch-FL 9, FlagDNN 6, FlagFFT 5, docs 4, FlagTree 4, FlagGems-vllm 4, vllm-plugin-FL 2, FlagPrism 2, FlagBLAS 2, FlagCX 1, FlagAttention 1, FlagAudio 1, FlagScale-Agent 1, TransformerEngine-FL 1.

Форма данного окна = «массовая сборка релизных артефактов» + «волна исправлений бэкендов»: build-infra тянет пересборку всех бэкенд-образов и объединение каналов распространения; на прикладной стороне (FlagGems / FlagSparse / Torch-FL / FlagGems-vllm) наблюдается плотный поток исправлений и оптимизации производительности для многочиповых бэкендов, причём наиболее сконцентрированы исправления для Kunlunxin и Hygon DCU; на стороне управления (алгоритмические примитивы FlagQuantum, TLE в FlagTree) работа продолжается согласно дорожной карте 2.2. 09-19 (суббота) суммарно по всем репозиториям около 12 коммитов — активность разработки не прерывалась через выходные.

1.1 build-infra: авторизованная пересборка 20 бэкенд-образов vLLM, wheel плагина переведён на «одну сборку, распространение по всем вендорам» (09-19/09-20)

Дата: 2026-09-19, 2026-09-20 Источник: build-infra #938, build-infra #934, build-infra #939

Подробности см. в «Главном за сегодня». Дополнительно два момента: во-первых, бэкенд cann9.0.0 в 09-20 04:00 получил добавление пакета cann-shmem (#939), что закрывает зависимость для компонента разделяемой памяти линии Ascend 9.0; во-вторых, Runtime: fetch vendor deps from the vendor index (#930) от 09-18 15:47 начинает получать зависимости времени выполнения из «вендорского индекса», а в сочетании с удалением старых файлов контейнера (#929) от 09-18 13:50 источники сборки контейнера и источник истины начинают сходиться к единому индексу.

1.2 build-infra: стратегия фиксации версий FlagTree ужесточена до 0.6.x, модель стоимости FlagTune отключена согласно зафиксированным версиям (09-20)

Дата: 2026-09-20 Источники: build-infra #940, build-infra #943, build-infra #944, build-infra #947

Утром 09-20 подряд три коммита «фиксации версий»: nvidia-cuda13.3: hold flagtree at 0.6.1 (#940), metax: hold flagtree at 0.6.1 for both MACA backends (#943), enflame-tops1.9.10: hold flagtree at 0.6.0 (#944) — возвращают компиляторную базу трёх бэкендов обратно на линию 0.6.x (формируя откат относительно предыдущих действий по повышению версии); затем runtime: disable the FlagTune cost model where flagtree 0.6.x is pinned (#947) показывает, что модель стоимости FlagTune несовместима с фиксацией версий 0.6.x и должна быть отключена в зависимости от состояния фиксации. Три фиксации версий + одна обработка совместимости образуют полный комплект «откат + адаптация».

Ещё одна корректировка матрицы состояний: status matrix: drop the merged entries from megatron's prs (#933), status matrix: prs = open PRs, md = recen… (начало #932) жёстко фиксируют критерии статистики матрицы состояний (столбец PR = открытые PR, столбец md = последние коммиты).

1.3 FlagGems: KernelGen продолжает поступать в репозиторий, бэкенд KunlunXin за один день массово исправляет около десяти пунктов (09-20)

Дата: 2026-09-20 Источники: FlagGems #5917, FlagGems #5878, FlagGems #6317, FlagGems #6476

38 коммитов FlagGems за этот период по-прежнему основаны на результатах KernelGen: на стороне Nvidia добавлены два оператора слияния оптимизаторов — _fused_adagrad_ (#5917) и _fused_sgd_ (#5878); в экспериментальный репозиторий (см. 1.8) в тот же день поступило ещё десять операторов Nvidia. Наиболее концентрированная линия этого периода — исправление бэкенда KunlunXin: binliu последовательно внёс около десяти коммитов, охватывающих планирование persistent kernel для форм grouped_mm с большим M / малым K и автоматическую настройку по формам, исправление внимания SDPA (сохранение неспециализированного параметра value-1, сходимость автоматической настройки), перевод первой фазы mse_loss на полноблочную маску (#6476), scatter / log_sigmoid_backward / amp_foreach, fill / add_relu / special_log1p / dequantize, pow / pdist / полиномы Лежандра, segment_reduce / arcsinh / cosh / acosh / log2 / log10, bessel_y1 / bernoulli, t_copy / selu / reflection_pad2d, log_softmax / logical_not, а также исправление ошибочного удаления при миграции lgamma — практически «полная зачистка» недавних регрессий операторов этого бэкенда.

Два пункта по инструментам: [KMCompiler] operator linalg_lstsq bug fix (#6499), [KMCompiler] fix fp64 error (#6491) и delete uint8 dtype (#6477); на стороне MThreads исправлено восстановление и разделение feature_dropout_ (#6490, #6482). По бенчмаркам и CI: Fix(benchmark): align pytest markers and op_name with operator registry ids (#6489), ci: run pre-check jobs on basic-runner-cpu (#6431).

1.4 FlagGems: включение TLE для PPU-бэкенда Damo Xuantie, исправление Flash Attention для Hygon DCU (09-20)

Дата: 2026-09-20 Источники: FlagGems #6423, FlagGems #5822, FlagGems #6456

Три крупных коммита по бэкендам: [T-Head] Enable TLE for PPU backend (#6423) включает расширение языка Triton (TLE) в бэкенде PPU Damo Xuantie, что соответствует позиции этого направления в плане мультибэкендности из раздела 2.2; [Hygon] Fix Flash Attention forward/backward kernels on DCU (#5822) исправляет ядра Flash Attention для прямого и обратного проходов на Hygon DCU; [Ascend] Add specialized linear operator (#6456) добавляет специализированный линейный оператор для Ascend. Кроме того, [MetaX] Fix masked_fill broadcast OOB and illegal num_warps=16 (#6480) устраняет выход за границы и недопустимую конфигурацию в продакшене MetaX.

1.5 FlagSparse: интенсивное продвижение адаптации трёх бэкендов MUSA / MACA / DCU (09-18~09-20)

Дата: 2026-09-18 ~ 2026-09-20 Источники: FlagSparse #73, FlagSparse #71

Почти все 39 коммитов FlagSparse за этот период пришли из совместного потока двух веток партнёров (два аккаунта NCIC-AlphaSparse поочерёдно выполняли слияния), а темой действий является адаптация трёх бэкендов: линия MUSA (Moore Threads) — musa updates; линия MACA (MetaX) — maca spsm debug и maca test commands; линия DCU (Hygon) — dcu updates, dcu sddmm tests, ci dcu, а также dcu spgemm test fp32 fp64 sperated (разделение тестов одиночной и двойной точности для spgemm). Также присутствуют cwrapper add (добавление слоя C-обёртки) и один revert для «New update» (откат #63, отмена #64), а также наведение порядка в документации. В целом это процесс превращения библиотеки разреженных операторов в реально работающую на трёх отечественных бэкендах.

1.6 FlagQuantum: масштабное расширение пакета алгоритмических примитивов — QFT, оценка фазы, Grover, QUBO и ещё более десяти (09-18~09-20)

Дата: 2026-09-18 ~ 2026-09-20 Источники: FlagQuantum #85, FlagQuantum #91, FlagQuantum #104

23 коммита FlagQuantum за этот период последовательно продвигались одним контрибьютором (Wei LIU), а темой является систематическая закладка пакета алгоритмических примитивов: начиная с пакета алгоритмических примитивов и квантового преобразования Фурье (#85), затем последовательно протоколы операторов и оценка фазы (#87), подготовка состояния (#88), многоконтрольный X и обратимый поразрядный компаратор (#89), синтез оракула таблицы истинности (#90), поиск Гровера (#91), оценка амплитуды (#92); далее переход на прикладной уровень — отображение QUBO в Ising (#86), квантовая оценка ядра и классический ядерный ридж-классификатор (#100), оценка фазы на основе квантового анализа главных компонент (#98), квантовые k-медианы по Гроверу (#99), отбор признаков QUBO (#101), оценка амплитуды для доли частых элементов (#102), оценка фазы для оценки сингулярных значений (#104). Два пункта по качеству инженерии: контроль покрытия и проверка типов продолжают недавнюю линию «ужесточения»; один пункт по функциональности — модель ошибок детектора на уровне записи квантовой коррекции ошибок (QEC) (#84, соответствует stage 2a предложения 048). Помимо слоя 01-09, есть ещё одна операция со стороны управления сборкой: ограничение доли org-level runner, занимаемой этим репозиторием (та же тема, что и недавнее управление ресурсами CI).

1.7 Torch-FL: оптимизация производительности Qwen-Image 2.1 / 2512 на множестве чипов становится основной линией (09-18~09-20)

Дата: 2026-09-18 ~ 2026-09-20 Источники: Torch-FL #360, Torch-FL #356, Torch-FL #353

9 коммитов Torch-FL в этом выпуске выстроены одним участником (nate.river) в линию вокруг производительности серии Qwen-Image на нескольких чипах: сначала с помощью test: add the Qwen-Image-2.1 manual test flow for chip bring-up (#342) создаётся процесс ручного тестирования, затем следуют последовательные оптимизации — исправление выбора бэкенда SDPA и поточечной маршрутизации для DCU (#345), сокращение накладных расходов на планирование / раскладку / автотюнинг FlagGems на стороне DCU (#352), снижение одиночного шага Qwen-Image-2512 на GCU до 7.1 s/it (#354, маршрутизация SDPA + обработка операндов GEMM), подключение маски key-valid для Qwen-Image-2.1 к пути SDPA в FlagGems (#353), дальнейшее снижение накладных расходов на планирование FlagGems для DCU (#356) и, наконец, построение кривой пропускной способности, хвостовой задержки / измерения арифметической интенсивности для Qwen-Image-2.1 (#360). Это типичная линия производительности chip bring-up «от запускаемости до хорошей работы».

1.8 Прочие обновления: FlagTree, FlagGems-sglang, FlagGems-vllm, FlagFFT, FlagPrism и другие (09-18~09-20)

Дата: 2026-09-18 ~ 2026-09-20 Источники: FlagTree #1084, FlagGems-sglang #93, FlagGems-Experimental #659, FlagPrism #13

  • FlagTree (4): [KMCompiler][TLERaw] Optimize the sort operator based on tle_raw (#1084) продолжает линию TLE Raw; [TLE][CommonIR] Added CommonIR conversion integration on Triton 3.6 (#1160) подключает преобразование CommonIR к Triton 3.6; [QC][TLE] Support cross-dtype Hopper WGMMA accumulator reuse (#1001); [XPU] Guard do_bench against estimate_ms==0 (#1224) исправляет деление на ноль.
  • FlagGems-sglang (10): конкурсный оператор moe_fused_mul_sum добавлен в репозиторий и зарегистрирован (#87); пакет референсов, тестов, бенчмарков и документации для batch3 (#93); do_bench преобразован в единую вспомогательную функцию с диспетчеризацией по производителю (#94); для Ascend ограничение конвейеризации K-цикла в fused router установлено на 2 уровня (#96).
  • FlagGems-Experimental (10): линия KernelGen Nvidia за день добавила ещё десять операторов — sparse_dim, _has_same_storage_numel, _dimV, _values, col_indices, adjoint, atleast_2d, detach_copy, ccol_indices_copy, crow_indices_copy (#640~#659), в основном небольшие операторы для разреженных структур и представлений — предварительное звено переправы из Experimental в основную линию.
  • FlagGems-vllm (4): на стороне MUSA оптимизирован fused_q_kv_rmsnorm для deepseek_v4 (#825); на линии MetaX оптимизирован varlen flash attention (#808); на линии Ascend добавлен оператор kda_gate_cumsum (#809); на линии KMCompiler в бенчмарк точности fused_moe добавлен шлюз нативной точности производителя (#824).
  • FlagFFT (5): непрерывный рефакторинг фреймворка приёмки — захваченные данные передаются по конвейеру с выравниванием дерева результатов, журналы операторов завершаются решением, читаемым платформой, записывающая сторона входных данных больше не ожидает читающую, захваченные входные данные перегенерируются по требованию (больше не хранятся на диске).
  • FlagPrism (2): унифицированы приёмочные тесты операторов и выведен из эксплуатации старый пакетный набор (#13); добавлена поддержка отладчика Enflame и профилирования TOPSPTI (#12).
  • docs (4): обновлено справочное содержимое онлайн-лаборатории (#509, #510 — два раунда).
  • FlagCX (1): в путь по умолчанию для device API добавлена поддержка Iluvatar (#608).
  • vllm-plugin-FL (2): захват распространённых метаданных внимания в графе ускорителя (#442); адаптация Iluvatar BI-V150 к линии vLLM 0.24 (#526).
  • FlagDNN (6): исправления тестов и run_test.py для четырёх платформ ppu / mthreads / ascend / iluvatar; улучшение архитектуры платформы Ascend.
  • FlagBLAS (2): исправлен pyproject.toml для thead.
  • FlagAttention (1): один исправляющий коммит (#63).
  • TransformerEngine-FL (1): cherry-pick из линии main (#124).
  • FlagScale-Agent (1): усилен agent harness — сторожевой таймер подсказок REPL, реестр предложений между сессиями и т. д.
  • FlagAudio (1): в CI добавлен канал загрузки Nexus (#8).

2. Новости и экосистема

2.1 Пятнадцатое подряд спокойное окно компонентного поиска: 48 часов без совпадений (09-18~09-20)

Дата: 2026-09-18 ~ 2026-09-20 Источники: Google News RSS (24 группы поисковых запросов на китайском и английском, через прокси)

По комбинациям названий компонентов FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen, а также Zhiyuan/BAAI и других, в 48-часовом окне совпадений нет (скрипт gnews показал 0 записей фактически) — пятнадцатое подряд спокойное окно. Молчание на стороне компонентных новостей стало нормой; фактические внешние события в настоящем отчёте приводятся по данным GitHub org и каналов сообщества (сообщество Zhiyuan / официальный аккаунт на Zhihu).

2.2 Конференция по открытым вычислениям в области искусственного интеллекта 2026 и техническая конференция Zhongzhi FlagOS открывают регистрацию: 17-18 октября, Пекин (09-18)

Дата: 2026-09-18 (публикация) Источники: публикация официального аккаунта на Zhihu

Сообщество Zhongzhi FlagOS совместно с Пекинским институтом искусственного интеллекта (BAAI), Пекинским институтом квантовой информатики и Китайской ассоциацией открытого исходного кода в области искусственного интеллекта Zhongguancun (в стадии формирования) и другими организациями проведёт 17-18 октября 2026 года в выставочном центре Национальной демонстрационной зоны независимых инноваций Чжунгуаньцунь в Пекине «Конференцию по открытым вычислениям в области искусственного интеллекта 2026 и Техническую конференцию Zhongzhi FlagOS» под девизом «Единый стек, безграничные интеллектуальные вычисления». Программа конференции охватывает направления гетерогенной вычислительной базы, открытого стека системного программного обеспечения AI, квантово-интеллектуальной интеграции, автомобильного интеллекта, воплощённого интеллекта, инфраструктуры AI-агентов; практические воркшопы охватывают полную цепочку: проект автоматической генерации высокопроизводительных операторов KernelGen, inferенс больших моделей на периферийных устройствах с помощью FlagOS, оптимизацию нового Attention kernel Triton-TLE, проектирование и практику архитектуры FlagScale-Agent. Регистрация уже открыта (ограниченное предложение ранних билетов). Это важнейшее внешнее событие экосистемы FlagOS в ближайшее время, тематика его воркшопов тесно коррелирует с инженерными наблюдениями данного выпуска (TLE, KernelGen, периферийные устройства, Agent).

2.3 Конкурс по оптимизации пропускной способности inferенса моделей FlagOS × MiniCPM: открытие подачи заявок 21 сентября (недавний анонс)

Дата: недавний анонс (этап подачи с 2026-09-21) Источник: Публикация на официальном аккаунте в Zhihu

FlagOS и MiniCPM совместно проводят конкурс по оптимизации пропускной способности inferенса моделей; этап разработки и подачи — с 21 сентября по 20 ноября 2026 года (UTC+8), оценка в начале декабря. Задача конкурса посвящена оптимизации пропускной способности inferенса на стеке FlagOS и продолжает серию общественных соревнований после конкурса по оптимизации операторов SGLang для кросс-чиповых решений («битва за острова операторов»).


3. Углублённое изучение организаций-участников

3.1 Kunlunxin: массовое внедрение исправлений бэкенда FlagGems (09-20)

Дата: 2026-09-20 Источник: FlagGems #6317, FlagGems #6476

Направление Kunlunxin в данном окне мониторинга внесло около десяти исправлений (подробнее см. 1.3), охватывающих от базовых поэлементных операторов до ключевых операторов типа grouped_mm / SDPA; наиболее существенным является специализированный persistent kernel для формы «большой M / малый K» в grouped_mm и автоматическая настройка по форме — специализация под типичные формы сценария MoE. Вместе с принятием в репозиторий конкурсного оператора moe_fused_mul_sum на стороне SGLang путь inferенса MoE в направлении Kunlunxin продолжает укрепляться.

3.2 Moore Threads: паралленое продвижение операторов и образов линии MUSA (09-20)

Дата: 2026-09-20 Источник: FlagGems-vllm #825, FlagSparse #73

Две линии MUSA: в FlagGems-vllm fused_q_kv_rmsnorm для deepseek_v4 оптимизирован под Moore Threads (#825); обновление адаптации MUSA в FlagSparse. На стороне образов зафиксирована пересборка rc2.post2 для образов 2.2.0 двух бэкендов musa4.3.6 / musa5.2.0. Кроме того, пакет операторов MThreads KernelGen (#6458) из FlagGems-eXperimental 09-19 переправлен из Experimental в основную ветку.

3.3 Hygon: исправление DCU Flash Attention и линия производительности Qwen-Image (09-20)

Дата: 2026-09-20 Источник: FlagGems #5822, Torch-FL #356

В направлении Hygon в данном выпуске две серьёзные задачи: FlagGems исправляет прямой и обратный проходы ядра Flash Attention на DCU (#5822, прошёл длительный цикл созревания в PR №5822); Torch-FL сокращает накладные расходы планирования FlagGems для Qwen-Image-2.1 на DCU (#356). На стороне образов hygon-dtk26.04 завершена пересборка rc2.post2 для 2.2.0.

3.4 Damo Academy XuanTie: включение TLE в бэкенд PPU, операторы KernelGen в основной ветке (09-19/09-20)

Дата: 2026-09-19, 2026-09-20 Источник: FlagGems #6423, FlagGems #6460

Два коммита в направлении XuanTie: [T-Head] Enable TLE for PPU backend (#6423) включает расширение языка Triton на бэкенде PPU — TLE — это унифицированный язык оптимизации для кросс-аппаратных семейств в плане мультибэкендности 2.2, и T-Head входит в это русло; KernelGen cherry-pick от 09-19 переводит операторы T-Head из Experimental обратно в основную ветку (#6460). Это образует непрерывное продолжение наблюдения из выпуска 09-18 о «вхождении T-Head в план мультибэкендности FlagTree 2.2».

3.5 MetaX: адаптация FlagSparse в линейке MACA и записи образов (09-19/09-20)

Дата: 2026-09-19, 2026-09-20 Источники: FlagSparse #71, build-infra #943

Линейка MACA: продвижение maca spsm debug в FlagSparse и тестовых команд; build-infra унифицирует закреплённые версии FlagTree для двух бэкендов MACA на 0.6.1 (#943); два образа maca3.7.2.1 / 3.8.1.3 завершили запись пересборки 2.2.0. Оптимизация varlen flash attention для MetaX на стороне FlagGems-vllm относится к той же линии.

3.6 Iluvatar CoreX: сходимость тестового контура FlagDNN (09-19/09-20)

Дата: 2026-09-19, 2026-09-20 Источники: коммиты FlagDNN

Шесть коммитов FlagDNN в этом выпуске посвящены преимущественно сходимости тестового контура: исправления тестов на четырёх платформах iluvatar / ascend / mthreads / ppu и исправление run_test.py, а также одно улучшение архитектуры платформы Ascend. Образ corex4.5.0 завершил запись пересборки 2.2.0. На стороне FlagCX в том же окне вышли поддержка пути по умолчанию Device API для Iluvatar (#608) и адаптация BI-V150 vLLM 0.24 в vllm-plugin-FL (#526).

3.7 Ascend: пересборка образов, специализированные линейные операторы и оператор kda_gate (09-20)

Дата: 2026-09-20 Источники: FlagGems #6456, FlagGems-vllm #809, build-infra #939

Линейка Ascend: FlagGems добавляет специализированные линейные операторы (#6456); FlagGems-vllm добавляет оператор kda_gate_cumsum на Triton (#809); FlagGems-sglang исправляет конвейеризацию цикла K в fused router (#96); на стороне образов четыре варианта Ascend (cann8.5.0 / cann9.0.0 × 910c и не-910c) массово завершили пересборку rc2.post2 и дополнительно включили пакет cann-shmem (#939).

3.8 Образы и инструментальная часть Enflame / Zhonghao Xinying / NVIDIA (09-20)

Дата: 2026-09-20 Источники: FlagPrism #12, коммиты build-infra

Линейка Enflame: FlagPrism добавляет отладчик Enflame и поддержку профилирования TOPSPTI (#12); два образа tops1.9.10 / 1.10.6 завершили пересборку, при этом закреплённая версия FlagTree для tops1.9.10 откатилась до 0.6.0 (#944). Образы Zhonghao Xinying tangrt1.2.0 и NVIDIA cuda12.8 / 13.3 синхронно завершили запись пересборки; закреплённая версия FlagTree для NVIDIA cuda13.3 откатилась до 0.6.1 (#940).


4. Итоги и наблюдения за тенденциями

  • Релизные артефакты переходят в этап массовой пересборки по всем бэкендам: 20 образов vLLM для бэкендов за одно окно полностью обновлены до rc2.post2, при этом одновременно выполнены три задачи — самоотчёт о версии образа, отметка TBD в документации и поштучная маркировка базы компиляции; «проверяемость релизных артефактов» становится центром тяжести текущего инженерного цикла, до GA (09-28) остаётся 8 дней, темп нормальный.
  • Смена парадигмы распространения плагинов заслуживает отдельной заметки: «одна сборка, публикация во все вендорские индексы» (#934) сжимает N сборок до 1 сборки + N публикаций; подобное упрощение инфраструктурного уровня напрямую снизит стоимость выпуска каждого последующего релиза.
  • Период интенсивных исправлений многопроцессорных бэкендов: Kunlunxin (около десяти коммитов), Hygon (Flash Attention + Qwen-Image), MetaX (исправление SDPA), Ascend (специализированные линейные операторы) сосредоточенно правились в одном окне, что отражает вступление тестового периода 2.2 (09-01 – 09-24) в фазу «закрытия счетов по бэкендам»; Kunlunxin занимается специализацией grouped_mm для больших M / малых K — это самое прямое доказательство целевой работы под сценарии MoE.
  • Скорость расширения FlagQuantum — одно из самых быстрых направлений во всей org: один контрибьютор за 48 часов сделал 23 коммита, выстраивая цепочку от примитивов (QFT, оценка фазы, Grover, оценка амплитуды) до приложений (отбор признаков QUBO, квантовый PCA, k-medians), параллельно ведя слой регистрации QEC — конкретный прогресс «слияния квантовых и интеллектуальных вычислений» на уровне кода.
  • T-Head выходит на два направления сразу: бэкенд PPU задействует магистраль TLE + KernelGen для операторов, что совпадает с позиционированием T-Head в многобэкендном планировании 2.2; участие направления XuanTie в стеке FlagOS продолжает углубляться.
  • Экосистемные мероприятия входят в цикл конференций: 17–18 октября открыта регистрация на технологическую конференцию FlagOS, темы воркшопов (KernelGen, edge-устройства, TLE Attention, FlagScale-Agent) один в один соответствуют предыдущим инженерным наблюдениям; конкурс MiniCPM Challenge стартует 9/21 — начиная со второй половины сентября плотность экосистемных операций заметно возрастёт.

Приложение: таблица проверки источников

Категория Источник Способ проверки Результат
GitHub org: flagos-ai repos API Полная проверка pushed_at по 54 репозиториям 20 репозиториев активны в окне
GitHub commits API по каждому репозиторию (since=09-18T10:18Z) Поштучная выборка по репозиториям, построчная верификация 206 коммитов
Новости Google News RSS (24 набора поисковых запросов) gnews_topic.py, окно 48 ч 0 совпадений (15-е спокойное окно)
Сообщество Официальные аккаунты Zhihu / сообщество Zhiyuan / блог-платформа CSDN Ручной поиск и перепроверка Заметка о регистрации на конференцию (09-18), заметка о конкурсе (недавно)

Приложение: полный список источников