Еженедельный отчёт FlagOS (2026-09-14 ~ 2026-09-20)
Период отчёта: с 14 сентября 2026 года (понедельник) по 20 сентября 2026 года (воскресенье), всего 7 календарных дней Источники материалов: ежедневные отчёты о динамике FlagOS данного издания (выпуски за рабочие дни 09-14, 09-15, 09-16, 09-17, 09-18, а также дополнительный выпуск за выходные 09-20, всего 6 выпусков); все пункты взяты из проверенных источников соответствующего периода Пояснение к составлению: данный период охватывает четыре измерения — управление релизами (ритм 2.2 RC и фиксация даты GA), совместное создание компонентов и кода, адаптация членов организации и производителей, экосистема и сообщество; в окне пяти ежедневных отчётов суммарно около 720 коммитов, охватывающих почти 30 репозиториев внутри org, технические факты основаны на фактической проверке репозиториев кода и официальных материалов о релизах
1. Главные новости недели
- FlagOS 2.2 RC2: синхронная маркировка всего стека, второй кандидатный снимок за весь цикл (09-14): 09-14 в 10:35 в репозиторий community был включён список 2.2 RC2 (release-2.2-rc2.yaml, добавлено 251 строка); затем в течение десяти минут с 10:45 до 10:54 23 репозитория компонентов последовательно получили метки rc2.post1 или Release, за весь день зафиксировано 26 действий маркировки, охвативших 22 репозитория, три варианта FlagTree на базе Triton и одна метка xpu3.6 были добавлены в тот же день. Первыми Release с примечаниями к выпуску стали FlagGems v5.4.0 и FlagSparse v0.3.0 (оба rc2.post1).
- build-infra: поле версии поднято до 2.2.0, массовая пересборка образов всех 20 бэкендов (09-17 ~ 09-20): 09-17 в 08:49 коммит #916 поднял version в configs.yaml с 2.1.2 до 2.2.0, а flaggems — с 5.3.5 до 5.4.0-rc2.post2, это единственный глобальный переключатель внутри org перед 2.2 GA; 09-19 и 09-20 для всех 20 бэкендов образов vLLM была авторизована массовая пересборка 2.2.0 / плагина post2 с построчной обратной записью — крупнейшее инженерное действие недели.
- community: единовременное включение 20 FEP, список возможностей 2.2 и границы релиза зафиксированы (09-17): номера с 0081 по 0100, охватывающие направления операторов, компиляторов, фреймворков, обучения, сетей, периферийных устройств, научного интеллекта и другие; каждая содержит раздел «Границы релиза и доказательства», в одной и той же партии документов есть как концептуальные проверки, помеченные как реализованные (FEP-0095 Common IR), так и возможности, намеренно остановленные на стадии черновика (FEP-0100 KernelGen), дорожная карта не выдаётся за поставку.
- Torch-FL: шесть платформ переходят на FlagGems-first, слой диспетчеризации становится главным полем битвы (09-15/09-16): таблица маршрутизации PPU расширена с 11 до 478 записей, после чего зафиксирована на 435 записях, из 482 операторов, покрытых FlagGems, 47 остаются в ядрах производителей с поименным указанием каждого; пять платформ CUDA, DCU, GCU, Ascend, MUSA скорректированы в одном направлении. Это первая полная количественная оценка тезиса «единая библиотека операторов, переиспользуемая на разных чипах» на уровне слоя диспетчеризации.
- Open3D-PIMC: от открытого релиза до приземления кода (09-14 ~ 09-16): примерно через 44 часа после объявления об открытии исходного кода на Китайской конференции по вычислительным мощностям репозиторий получил первый корневой коммит, единовременно внесший 662 записи (слой компиляции raisa-inductor и среда выполнения rcs2 на C++), модель программирования и стек компиляции для 3D-чипов вычислений перешли в инженерное состояние.
- Всестороннее завершение инженерии релизных артефактов: три линии — артефакты, упаковка, контроль доступа — параллельно (09-15 ~ 09-20): впервые прошёл канал загрузки wheel FlagTree для Ascend (flagtree-0.7.0rc2+ascend3.5 и другие достигли репозитория артефактов); упаковка DEB и публикация в Nexus для FlagTree включены в общий рабочий процесс; wheel плагинов переведены на «одна сборка, индексированное распространение для всех производителей»; образы начали самостоятельно сообщать версию плагина и построчно указывать основу компиляции; нижняя граница покрытия FlagQuantum поднята до 75%.
- Экосистема вступает в цикл конференций и соревнований (09-18 ~ 09-21): открыта регистрация на Конференцию открытых вычислений в области искусственного интеллекта 2026 и Техническую конференцию Zhongzhi FlagOS (17–18 октября, Пекин); открыт приём заявок на конкурс по оптимизации пропускной способности инференса, совместно организованный FlagOS и MiniCPM; результаты конкурса по оптимизации операторов SGLang на разных чипах продолжают поступать в основной репозиторий в виде PR.
- Промышленный аспект: высокая плотность событий по капиталу и финансированию членов организации (09-15 ~ 09-17): интерпретация выхода Enflame на биржу продолжает набирать обороты (публичные данные о росте на 179,22% в первый день и рыночной капитализации 170,85 млрд юаней неоднократно цитируются); Digua Robotics завершила раунд C на 400 млн долларов (во главе с Mirae Asset); акции MetaX 09-17 выросли на 14,44%, при этом появились сообщения о снижении доли несколькими институтами — фокус внимания на рынке капитала продолжает смещаться с «сделать» на масштабную поставку и реализацию прибыли.
2. Динамика версий и релизов
Ритм RC и вехи GA
- 2.2 График: заморозка функций 08-31, период тестирования и стабилизации с 09-01 по 09-24, GA назначен на 2026-09-28; в milestone «FlagOS 2.2» по состоянию на 09-17 проверены 7 issue — все не закрыты, крайний срок у всех 09-28; критерий выпуска — после того как «исполняемый план тестирования пройден в течение периода тестирования», статус FEP меняется с реализуемого на реализованный, патчи безопасности и серьёзные дефекты идут по ускоренному каналу, требующему одобрения TSC.
- От RC1 к RC2: RC1 — результат конца предыдущего цикла, в начале недели всё ещё находился в позиции итерации rc1.postN (FlagGems дошёл до rc1.post2); список RC2 сформирован 09-14 в 10:35, охватывает пять групп — инфраструктура, операторы, плагины инференса, обучение, релиз и инструменты — всего 24 записи модулей, правило — «версия сохраняется совместимой с rc0/rc1, продвижение только в позиции итерации .postN».
- Три итерации RC2: FlagGems от rc2.post1 (09-14) через rc2.post2 (09-15 11:21, community #110, два управляющих исправления: совместимость flash_attention_backward с Triton 3.5 и гейтинг tl.map_elementwise) до rc2.post3 (зафиксировано 09-18); FlagCX продвинулся до rc2.post2; остальные записи остаются на rc2.post1.
- Автоматизация ветвления и маркировки: с 09-17 23:29 по 23:33 десять репозиториев модулей синхронно отпочковали интеграционную ветку rc2 и были помечены тегами (полная проверка всех ref через git ls-remote), выполнено workflow release-branch-tag пакетным вызовом manage-release.py по списку; рабочий процесс синхронизации проекта 2.2 на стороне сообщества запускается каждые 15 минут, статус релиза теперь выводится из связанных PR.
- Обратный отсчёт до GA: сократился с 14 дней в первый день окна (09-14) до 8 дней к концу окна (09-20), период тестирования вступил во вторую половину — «принимаются только исправления багов».
Теги компонентов и список Release (в пределах окна)
- FlagGems: от v5.4.0-rc2.post1 (09-14, Release) до v5.4.0-rc2.post2 (09-15) до rc2.post3 (зафиксировано 09-18); стабильная линия сохраняется на v5.3.6 (около 09-11).
- FlagSparse: v0.3.0-rc2.post1 (09-14, Release с примечаниями к выпуску).
- FlagCX: от v0.14.0-rc2.post1 (09-14) до rc2.post2 (проверено 09-17/18).
- FlagTree: три линии 0.7.0rc2.post1 — Triton 3.6 / 3.5 / 3.3 — и 0.7.0rc2+xpu3.6 (09-14); 09-17 добавлены теги бэкендов metax, mthreads, enflame, tsingmicro для 0.7.0rc2; 09-18 линия xpu для Kunlunxin дополнительно итерирована до 0.7.0rc3+xpu3.6 (теги проверены фактически).
- FlagAttention: v0.4.0-rc2.post1.
- Остальные компоненты (централизованная маркировка 09-14, rc2.post1): FlagFFT v0.2.0, FlagDNN / FlagTensor / FlagAudio / FlagBLAS v0.3.0, FlagGems-vllm v0.2.0, FlagGems-sglang v0.1.0, Torch-FL v0.2.0, sglang-plugin-FL v0.2.0, TransformerEngine-FL / Megatron-LM-FL v0.3.0, FlagOS-Compressor v0.1.0, KernelGen v2.2.0, KernelGenBench v0.2.0, FlagRelease v0.3.0; FlagScale — v2.1.0-rc2.post1 (уже вышел из линии 2.0); vllm-plugin-FL идёт по двум линиям версий 0.3.0 и 0.2.2.
Состояние образов и артефактов
- Полная пересборка всех 20 бэкендов: после авторизованного коммита (#938) от 09-20 03:07 аккаунт-бот в течение часа с лишним фиксировал новые теги образов по каждому бэкенду; зафиксированный диапазон
2.2.0-0.3.0rc2.post2охватывает Ascend (cann8.5.0, cann9.0.0 и варианты 910c), Cambricon (neuware4.4.3 / 4.7.2), Moore Threads (musa4.3.6 / 5.2.0), Enflame (tops1.9.10 / 1.10.6), MetaX (maca3.7.2.1 / 3.8.1.3), Hygon (dtk26.04), Iluvatar CoreX (corex4.5.0), Kunlunxin (xre5.37.1), Zhonghao Xinying (tangrt1.2.0) и NVIDIA (cuda12.8 / 13.3); линейка версий плагина0.2.2rc2.post2также была частично выложена ранее. - Объединение каналов распространения: wheel плагина теперь собирается один раз и публикуется во все индексы вендоров (#934), номер версии выводится из git ref (#932); зависимости времени выполнения получаются из индексов вендоров (#930); в линейку Ascend добавлен пакет cann-shmem (#939).
- Три аспекта проверяемости: образы сами сообщают фактически установленную версию плагина (#937), образы, которые никогда не собирались, явно помечаются в документации как TBD (#948), для каждого образа указывается фактически скомпилированная база FlagTree (#953); методика подсчёта матрицы состояний также жёстко зафиксирована (#932/#933).
- Откат закреплённых версий и обработка совместимости: 09-20 NVIDIA cuda13.3 (#940) и два бэкенда MACA от MetaX (#943) были возвращены к FlagTree 0.6.1, Enflame tops1.9.10 возвращён к 0.6.0 (#944); вместе с этим в соответствии со статусом закреплённых версий отключена модель стоимости FlagTune (#947) — вместе с действиями по повышению версий в начале недели это образует завершённую пару «откат + адаптация».
- Ascend и артефакты релиза: впервые успешно пройден канал загрузки wheel FlagTree (flagtree-0.7.0rc2+ascend3.5 и flagtree-0.6.0+ascend3.2 достигли артефактного хранилища, время сборки 26 / 14 минут); собственный тег репозитория build-infra по-прежнему остаётся на v2.1.1, тег v2.2.0 в рамках окна ещё не выставлен.
3. Совместная разработка компонентов и кода
На этой неделе число коммитов в org за пять окон мониторинга составило 98 / 119 / 150 / 147 / 206, всего около 720 (окна 09-17 и 09-18 пересекаются примерно на 1,4 часа, что даёт небольшой повторный учёт); далее агрегировано по модулям.
Операторы и доменные библиотеки (FlagGems и различные доменные библиотеки)
- FlagGems (основная линия, первая линия недели): за пятипериодное окно зафиксировано 12 / 43 / 71 / 40 / 38 коммитов, всего около 200. Три производственные линии идут параллельно: массовая загрузка KernelGen (более 50 операторов Nvidia за неделю, охватывающих четыре категории: линейная алгебра, специальные функции, обратное распространение обучения, пулинг и сэмплирование; среди характерных записей — nanquantile, logdet, linalg_polar, обратные ядра GRU и LSTM, обратное ядро Lanczos-апсэмплинга, fused_adagrad, fused_sgd); поэтапное дополнение KMCompiler по операторам (Ascend: matrix_rank, igammac, gru, adaptive_max_pool3d, linalg_solve_triangular; Hygon и MetaX совместно используют многобэкендовую реализацию linalg_lstsq); переработка TLE для Kunlunxin (sum / sum_dim переведены на tle.gpu, а также завершён пакет исправлений примерно из десяти бэкендов: persistent kernel для grouped_mm с большим M и малым K, внимание SDPA, полные блочные маски mse_loss и т. д.).
- Линия квантования: Hygon W8A8 INT8 GEMM (#6185, защита от переполнения при длинной K-редукции) и включение TLE (#6247); Moore Threads W8A16 FP8 RMSNorm (#6210) и нативное FP8 W8A8 матричное умножение (#6211); MetaX W8A16 RMSNorm (#6326); выбор пути для FP8 topk (#4412). Покрытие квантованием распространяется от одного слоя матричного умножения к нормализации и смежным операторам.
- Исправления и расширение бэкендов: исправление прямого и обратного прохода FlashAttention для Hygon DCU (#5822), слитое ядро бэкенда rrelu (#6379); включение TLE для бэкенда PPU Damo XuanTie (#6423); исправление выхода за границы и недопустимых конфигураций masked_fill для MetaX (#6480); специализированные линейные операторы Ascend (#6456), swiglu и grouped_matmul (#6324 / #6325), Top-K (#6354); для Kunlunxin зависимость FlagTree обновлена до 0.6.1+xpu3.6 (#6393), проактивный откат быстрого пути скалярного сравнения tle.raw (#6409), исправление пяти операторов masked_fill / sinh / mish / hardswish / index_fill (#6328).
- Качество инженерии: устранено зависание linalg_svd на 16×16 (#6301), несоответствие dtype скалярного bias в addmv (#6149), целочисленный dtype nansum (#6351); дополнены init.py семи бэкендовых подпакетов; проверка экспорта операторов, маркеры тестов KernelGen сканируют только новые строки, маркеры pytest для эталонных тестов согласованы с реестром операторов (#6489); AMD W7900D включён в недельную матрицу тестирования (#6312).
- FlagGems-Experimental (экспериментальная площадка): массовая загрузка 17 операторов Hygon в течение часа (включая специальные функции, линейную алгебру, числовые и индексные категории, а также исправление _scaled); Moore Threads дополнен cholesky_inverse, linalg_ldl_solve, ormqr и др.; Kunlunxin дополнен mvlgamma; 09-17 исправлен MetaX index_select (#419), дополнены conv_depthwise2d (#391) и dense_dim (#639); 09-20 добавлено ещё десять малых операторов Nvidia (разреженные и view-операторы, предварительный этап перехода с экспериментальной площадки в основную линию).
- FlagSparse: через объединяющий коммит подключена внешняя ветка сотрудничества (NCIC-AlphaSparse), и 39 коммитами продвинута адаптация трёх бэкендов MUSA, MACA, DCU (включая разделение тестов spgemm одинарной и двойной точности, добавление слоя C-обёртки, в течение периода был один массовый откат с последующей повторной сходимостью).
- FlagFFT: 36 операторов FFT единовременно переведены в состояние приёмки (+2151/-2298, с независимой проверкой NumPy и планом времени выполнения), затем покрытие приёмки оформлено как обязательный пункт; 09-17 для MUSA и MACA оставлены записи проверки трёхмерного транспонирования и унифицировано закрепление версий зависимостей времени выполнения Triton JIT; в конце окна последовательный рефакторинг фреймворка приёмки (поток конвейера, вынесение решений по логам, перегенерация по требованию).
- FlagDNN: реорганизована архитектура реализаций для двух платформ Iluvatar CoreX и Hygon, добавлен оператор текстового суммирования, сведена поверхность тестирования четырёх платформ (PPU / Moore Threads / Ascend / Iluvatar).
- FlagBLAS и FlagAudio: в FlagBLAS исправлена конфигурация упаковки для бэкенда Damo XuanTie; в FlagAudio слиты первые три PR (спектрограммный оператор Triton, проверка тождества усиления и отложенный импорт, завершение упаковки), все — ветки внешних контрибьюторов, плюс добавлен путь загрузки в CI.
Компиляторы и коммуникационные библиотеки (FlagTree и FlagCX)
- FlagTree: в релизной инженерии — три пункта (в матрицу DEB-пакетирования добавлены ubuntu22.04 / python3.12, релизные пакеты переведены на отправку в Nexus через общий workflow, удалена отладочная информация из libtriton и libproton), обеспечена сквозная связка базовой линии пакетирования и номеров версий wheel; на стороне компилятора продвинуты хостируемый Manifest FlagTune и обработка совместимости времени выполнения, создана базовая линия iluvatar3.6 и тестовый workflow для Iluvatar CoreX, унифицирован интерфейс инициализации бэкенда в шаблоне тестов FlagGems, во фронтенде
tle.signalиtle.signal_waitобласть синхронизации и порядок памяти выведены в явные параметры (соответствует направлению распределённых примитивов FEP-0096); кроме того, подключено преобразование CommonIR к Triton 3.6, оптимизирован оператор sort в tle_raw, реализовано повторное использование аккумулятора через dtype в Hopper WGMMA, исправлено деление на ноль в do_bench на стороне XPU. - FlagCX: на стороне поставки libflagcx.so упакован в wheel, унифицированы ключи сборки для Iluvatar CoreX, загрузка в Nexus переведена на общий workflow, Fedora 43 включена в RPM-матрицу NVIDIA; на стороне интерфейсов lane mask расширен с 32 до 64 бит (задел на увеличение масштаба чипов); на стороне инструментов преобразование журналов производительности PTD переведено на потоковую обработку (во избежание исчерпания памяти при крупномасштабном стресс-тестировании), скорректирован критерий эквивалентной пропускной способности KV; на стороне бэкендов подключён PPU XuanTie от DAMO Academy (в два этапа: CI и плагин torch), добавлен путь по умолчанию для API устройств Iluvatar CoreX.
Фреймворки инференса и обучения
- Torch-FL: после внедрения подхода FlagGems-first на шести платформах за неделю выполнена завершающая работа по обходам, переключателям и контролю — именованные обходы (операторы срезов MetaX, комплексное rotary position embedding MUSA оставлено на стороне устройства), явные переключатели (CI привязан к последнему рабочему коммиту FlagGems, USE_FLAGTUNE=0, конфигурация ускорителя на этапе сборки записывается в wheel), построение контроля (обнаружение PPU, вынос списка платформ вовне, отслеживание FlagGems master на всех платформах); унификация пространства переменных окружения в единый префикс FLAGOS; развязанный wheel DCU исправляет доступность torch.cuda; в конце окна — выход на стабильную производительность Qwen-Image 2.1 и 2512 на разных чипах (одиночный шаг GCU снижен до 7.1 s/it, накладные расходы планирования DCU последовательно снижаются, в итоге представлены кривые пропускной способности и измерения хвостовой задержки).
- FlagGems-vllm: эталонные реализации moe_sum для Hygon и XuanTie от DAMO Academy; persistent_topk для Moore Threads MTT S5000; для Ascend добавлены SparseAttnSharedKV (структура разреженного внимания DeepSeek-V4, одна запись +9637, шесть фиксированных форм, критерий приёмки — точность) и persistent_topk, а также вендорские операторы собраны в единый каталог; объединены Marlin MoE (веса W8A16 в вариантах INT8 / FP8) и FP8 FlashAttention-2 с переменной длиной, что закрывает две реальные формы на стороне инференса — «переменная длина батча и разреженная активация MoE»; в конце окна продолжено добавление fused_q_kv_rmsnorm для MUSA, внимания с переменной длиной для MetaX, kda_gate_cumsum для Ascend.
- FlagGems-sglang: выполняется роль канала внедрения результатов соревнований — 09-14 за один день в основной репозиторий влито 10 PR из соревновательных веток (bmm-chunk, decode-attention, fused-rmsnorm-warp2, task19 / task21-moe-sum-reduce и др.); далее встроены инструменты тестирования из апстрима, импортирован оператор слияния мультимодального rotary position embedding, do_bench преобразован в единую функцию с диспетчеризацией по вендору, зарегистрирован соревновательный оператор moe_fused_mul_sum с эталоном для batch3, а также пакет тестов, бенчмарков и документации.
- vllm-plugin-FL и sglang-plugin-FL: первый запускает workflow vLLM 0.24.0 для Hygon, подключает CI metax, переводит Enflame S60 и Kunlunxin на линию 0.24, подключает CI PPU XuanTie от DAMO Academy, исправляет загрязнение состояния FlashAttention у Kunlunxin, адаптирует Iluvatar BI-V150; второй создаёт конвейеры CI для Hygon DCU и Enflame GCU (линия Hygon собирает FlagCX v0.13.0 на базе адаптера AMD), развязывает модульные тесты dispatch от конфигурации платформы и добавляет бенчмарк для предзагрузки.
- FlagScale и линия ядер обучения: FlagScale унифицирует взаимозависимые CI-зависимости на разных платформах ускорителей, исправляет изоляцию кэша артефактов зависимостей в fork PR; TransformerEngine-FL получает исправления через cherry-pick из основной линии; Megatron-LM-FL заменяет жёстко заданные операции с устройствами CUDA на платформенно-осведомлённые API (охватывая оптимизатор, инициализацию, обучение и служебные пути); FlagScale-Agent усиливает agent harness; FlagPrism унифицирует приёмочные тесты операторов, добавляет отладчик для Enflame и поддержку профилирования производительности TOPSPTI.
Релизная инженерия и управление (build-infra / community / docs)
- build-infra:Помимо повышения версий и линии образов, описанных во втором разделе, на этой неделе добавлена линия упаковки FlagCX wheel (три шага: сборка, проверка, публикация), зафиксированы двойные теги образов Hygon rc2.post1 и проведена их повторная проверка, задокументирована проблема зависимости от заголовочных файлов gflags у Hygon, а парная запись тегов образов и меток версий стала прямым свидетельством вхождения каждого бэкенда в объём поставки 2.2.
- community:Управление релизом 2.2 переведено с ручной панели на автоматизацию (синхронизация issue с организационным представлением проекта каждые 15 минут, статус релиза выводится из связанных PR, правила проверки RC записаны в описание); сопровождение 20 FEP и списка RC2 продвигается линией релиз-менеджера.
- docs:Линия документации включена в текущую реформу CICD (ветка new/flagcicd объединена с main), справочный контент онлайн-лаборатории обновлён в двух раундах.
Квантовые и новые направления
- FlagQuantum (одно из самых быстро расширяющихся направлений на этой неделе):09-14 за один день завершены заморозка Twin API и управление историческими последовательностями цифрового двойника QPU (история калибровки и проверки, сравнение кандидатов, восстановление последовательностей в цепочку); затем по топологии схем проведена классификация доказательств Twin, подключены тесты фронтенда JAX и нижняя граница покрытия записана в контрактный файл (двухуровневое повышение с 60% до 75%), выполнена строгая типизация на уровне пакета, внедрён слой записи квантовой коррекции ошибок (развязан от конкретной схемы кодирования); в конце окна один контрибьютор последовательно заложил пакеты алгоритмических примитивов — от квантового преобразования Фурье, оценки фазы, поиска Гровера, оценки амплитуды вплоть до отображения QUBO в Ising, квантовых ядерных методов, квантового PCA, k-medians и других примитивов прикладного уровня.
- FlagTrain:09-16 размещён новый репозиторий (создан как заглушка, размер 5 KB), на стороне обучения вырезан ещё один блок, размещение кода ожидает наблюдения.
- Open3D-PIMC:09-14 открытый релиз, 09-16 размещение кода (662 записи: система pass-ов компиляционного слоя raisa-inductor и ключи кэша компиляции, C++ рантайм rcs2, в README указаны четыре недостающих пробела: иерархия памяти, топология шардирования, динамический вывод и повторное использование артефактов компиляции); напрямую связано с направлением 3D вычислительных чипов FlagOS, не входит в объём приёмки 2.2.
- flir (FlagTree IR):Согласована семантика bufferization с upstream (удалён маркер Pure у tile.to_tensor), исправлены маркеры эффектов памяти, унифицирован формат идентификации версии triton.
4. Члены организации и адаптация производителей
- Hygon: параллельно развиваются четыре направления — квантизация (W8A8 INT8 GEMM), включение TLE, fused rrelu backend kernel, исправление прямого и обратного проходов DCU FlashAttention; развязка DCU wheel исправила torch.cuda и поток Qwen-Image; линия FlagSparse DCU (тесты sddmm, разделение точности spgemm); запущен workflow для vLLM 0.24.0; образ dtk26.04 прошёл повторную проверку rc2.post1 и пересборку post2.
- Ascend: наиболее насыщенная операторами линия для MoE и линейного внимания — SparseAttnSharedKV, persistent_topk, kda_gate_cumsum, grouped_topk (через исходный интерфейс DSA в TLE), специализированные линейные операторы, swiglu и grouped_matmul; концептуальная проверка CommonIR помечена как реализованная в FEP (линия Triton 3.5, только 910B / 910C); отлажен путь загрузки FlagTree wheel; четыре варианта образа (cann8.5.0 / cann9.0.0) пересобраны с добавлением cann-shmem.
- Moore Threads: реализованы два пути квантизации — нативное FP8 W8A8 матричное умножение и W8A16 FP8 RMSNorm; устройственное исполнение persistent_topk и MUSA rotary position embedding для MTT S5000; FlagTree переведён на 0.7.0rc2+mthreads3.6; создан первый образ 0.20.2 с плагинами; profiler и debugger из FlagPrism интегрированы в цепочку компилятора.
- MetaX: W8A16 RMSNorm, выбор пути FP8 topk, оптимизация varlen attention и исправление выхода за границы masked_fill; для vLLM включён metax CI и поднят до линии 0.24; адаптирована линия FlagSparse MACA; на отраслевой стороне выполнена Day0-адаптация ATRIA Dawn Preview от Шанхайской лаборатории искусственного интеллекта (по данным компании — в совокупности 37 флагманских моделей), выход из убытков по полугодовому отчёту, окно разблокировки 09-17 и аномальное движение акций зафиксированы как события на капитальной стороне.
- Enflame: ветки вендора пакетно синхронизированы обратно в основную линию; адаптация S60 к линии vLLM 0.24, конвейер GCU CI, GCU300 зафиксирован в отчёте 0.24.0; в FlagPrism добавлены отладчик Enflame и поддержка TOPSPTI; два образа tops пересобраны; продолжается освещение финансирования и выхода на биржу (09-11 — листинг на STAR Market).
- Iluvatar CoreX: унифицированы сборочные ключи iluvatar, добавлен интерфейс управления устройством /dev/itrctl, для FlagTree созданы базовая линия iluvatar3.6 и тестовый workflow; реорганизация архитектуры платформы FlagDNN и сужение тестовой поверхности; адаптация к линии vLLM 0.24; образ corex4.5.0 пересобран.
- Kunlunxin: пакет из примерно десяти исправлений бэкенда за один день (grouped_mm persistent kernel, SDPA, mse_loss и др.) закрыл недавние регрессии операторов; xCCL упакован в базовый образ; sum перенесён на tle.gpu; исправлено загрязнение состояния при импорте модуля FlashAttention; выполнен добровольный откат быстрого пути tle.raw и фиксации версии 0.6.1+xpu3.6, не давших стабильного выигрыша; тег xpu обновлён до 0.7.0rc3+xpu3.6.
- DAMO XuanTie: бэкенд PPU включил TLE в FlagGems, подключён к CI в FlagCX и vllm-plugin-FL (включая плагин torch), явно обнаружен в тормозах Torch-FL; добавлен вариант moe_sum и принята передача операторов KernelGen; уже зарезервировано место в планировании мультибэкендности FlagTree 2.2 (FEP-0098), участие по обеим линиям продолжает углубляться.
- Tsingmicro: открытый релиз и реализация кода Open3D-PIMC (совместная разработка с Zhiyuan/BAAI); распределённые примитивы включены в бэкенде и сливаются с распределённым маршрутом TLE в 2.2.
- Horizon Robotics: её дочерняя D-Robotics завершила раунд C на 400 млн долларов — самое значимое отраслевое событие недели в системе участников.
- Zhiyuan/BAAI (головной участник): руководит внедрением управления RC2 и FEP, определением границ выпуска 20 FEP, совместной разработкой Open3D-PIMC и формулировкой направления «определение форм-фактора аппаратуры»; релизы и ритм управления продвигаются вокруг её ведущей роли.
5. Экосистема и сообщество
Соревнования и открытые конкурсы
- Результаты соревнования по оптимизации операторов SGLang на разных чипах продолжают поступать в основной репозиторий: 09-14 за один день в FlagGems-sglang влито 10 PR из соревновательных веток; в конце окна соревновательные операторы, такие как moe_fused_mul_sum, зарегистрированы и добавлены в репозиторий (#87), эталонные материалы batch3, тесты, бенчмарки и документация также помещены в репозиторий. Соревнование становится постоянным каналом поставки внешних операторов для FlagOS.
- FlagOS и конкурс по оптимизации пропускной способности инференса моделей MiniCPM: этап разработки и подачи заявок с 21 сентября по 20 ноября 2026 года, оценка в начале декабря; конкурс ориентирован на оптимизацию пропускной способности инференса в стеке FlagOS и продолжает систему общественных соревнований после конкурса по оптимизации операторов.
Конференции и открытые релизы
- Конференция по открытым вычислениям в области ИИ 2026 и техническая конференция Zhongzhi FlagOS: пройдёт 17–18 октября в выставочном центре Национальной демонстрационной зоны независимых инноваций Чжунгуаньцунь в Пекине, тема «Единый стек, безграничные интеллектуальные вычисления», регистрация открывается 09-18; темы воркшопов (KernelGen, edge-side, TLE Attention, FlagScale-Agent) соответствуют инженерным наблюдениям этой недели один к одному.
- Открытый релиз Open3D-PIMC: объявлен 09-14 на Китайской конференции по вычислительным мощностям, код опубликован 09-16; совместная разработка Tsingmicro и Zhiyuan/BAAI, позиционируется как одно из основных решений FlagOS для 3D-вычислительных чипов следующего поколения, анонсирован выпуск результатов оптимизации в четвёртом квартале на ведущей мировой технологической конференции.
Новостной фон и внешние каналы
- Одиннадцатое–пятнадцатое подряд спокойное окно компонентного новостного поиска: в течение всей недели в 24-часовых окнах ноль значимых попаданий, внешние факты динамики определяются по GitHub org и каналам сообщества (сообщество Zhiyuan, корпоративный аккаунт на Zhihu, колонка на CSDN); сообщения со стороны членских организаций касаются преимущественно капитальной сферы и Day0-адаптации собственных стеков.
- Пояснение границ включения: сторонние материалы на платформе сообщества Zhiyuan, не имеющие интерфейса с данным стеком (например, релиз открытых моделей Zidong Tai Chu), не учитывались; чисто рыночные обзоры и аномалии котировок фиксируются только как фон.
6. Наблюдения за трендами
- 2.2 переходит в стадию заморозки и сборки релиза: глобальный переключатель (version 2.2.0) установлен, массовая пересборка образов всех бэкендов и проверяемость релиза выполнены синхронно; до конца тестового периода остаётся лишь неделя, оставшиеся риски сосредоточены в «устанавливается и работает правильно», а не в функциональных пробелах, основание для Go/No-Go смещается от «человек смотрит чек-лист» к «состояние выводимо».
- Слой диспетчеризации становится слоем реализации «многоразового использования одной библиотеки операторов на разных чипах»: FlagGems-first на шести платформах дал первую полную квантификацию (линия PPU зафиксирована как 435 маршрутов FlagGems против 1601 маршрута вендорных ядер), длина списка обходных путей (47 позиций PPU, срез MetaX, комплексное вращательное позиционное кодирование MUSA, отсутствие FlagTune на стороне CUDA) является обратным показателем уровня кросс-чипового переиспользования; «маршрутизация плюс список обходных путей плюс шлюз» становится многоразовым шаблоном механизма.
- Формы мультибэкендной адаптации дифференцируются: движение вверх сосуществует с откатом назад: Moore Threads получила пропуск уровня FlagTree и первый образ с плагином, загрузка wheel для Ascend прошла — это движение вверх; Nvidia / MetaX / Enflame закрепились на 0.6.x, а Kunlunxin откатился к быстрому пути tle.raw — это откат, последнее родственно RC-дисциплине «лучше не чинить, чем сломать проверенную клетку» и является сигналом вступления платформенной адаптации в стабильную фазу.
- Две главные линии расширения операторов чётко очерчены, узкое место смещается от написания ядер к регистрации и приёмке: квантизация (W8A8 / W8A16 / FP8, от матричного умножения до нормализации и сэмплирования) и MoE / линейное внимание (групповое матричное умножение, swiglu, разреженное разделяемое KV, gated Delta rule) напрямую соответствуют реальной структуре текущих инференс-моделей; сопровождающие массовое поступление в KernelGen проверки экспорта, маркеры тестов, выравнивание базовых показателей и перестройка фреймворка приёмки говорят о том, что узкое место расширения сместилось к регистрации и приёмке.
- Платформизация тестовой и качественной инфраструктуры: XuanTie PPU от DAMO Academy подключён к нескольким CI, Iluvatar CoreX установил базовую линию iluvatar3.6, FlagTree выделил унифицированный интерфейс инициализации бэкендов, FlagQuantum ужесточил нижнюю границу покрытия и проверку типов — действия разной формы указывают на одну цель: каждый бэкенд должен непрерывно проверяться в CI, а не проходить вручную.
- Контуры следующей версии уже формируются в документах, плотность экосистемных операций скоро возрастёт: экспериментальная поддержка RISC-V, edge-side SDK, пакетирование для операционных систем, рабочие группы по embodied intelligence и scientific intelligence уже появились в планах FEP, новые бэкенды T-Head, Enflame, Moore Threads вошли в планирование FlagTree 2.2; создание репозитория FlagTrain, переход FlagAudio в реальную работу, внедрение Open3D-PIMC показывают, что новые направления продолжают ветвиться; октябрьская конференция и челлендж, стартующий в конце сентября, существенно повысят плотность экосистемных операций, ожидаемый следующий пик освещения — в окне релиза 09-28.
Приложение: материалы и проверка
- Материалы (всего 6 выпусков): выпуск 09-14 (окно с 09-11 10:18 по 09-14 10:18, трёхдневное окно понедельника), выпуск 09-15 (с 09-14 10:18 по 09-15 10:18), выпуск 09-16 (с 09-15 10:18 по 09-16 10:18), выпуск 09-17 (с 09-16 10:18 по 09-17 11:40), выпуск 09-18 (с 09-17 10:18 по 09-18 10:18), выпуск 09-20 (с 09-18 10:18 по 09-20 10:18, дополнительный выпуск выходного дня, около 48 часов).
- Способ проверки: сплошная проверка pushed_at по всем репозиториям GitHub org flagos-ai (54 репозитория), сплошная верификация одиночным commit search по committer-date (в сумме по пяти выпускам около 720 записей), повторная проверка коммитов в ветках по умолчанию ключевых репозиториев, проверка веток и тегов через git ls-remote, фактическое измерение метаданных tags и releases по каждому компоненту; прямой сбор списка публикаций community, каталога FEP и графика выпуска 2.2; по новостной части — 33 группы запросов (24 группы в выходные) к Google News RSS на китайском и английском и обход каналов сообщества.
- Пояснение по методике: окно выпуска 09-14 в основном покрывает предыдущий период (09-11 – 09-13), в данном еженедельном отчёте используются только его записи за 09-14; окна выпусков 09-17 и 09-18 пересекаются примерно на 1,4 часа, суммарное число коммитов включает небольшой повторный учёт; по компонентным новостям — одиннадцатое–пятнадцатое окно подряд с нулевыми попаданиями, выводы по технической части основаны на репозиториях кода, информация по отраслевой стороне включает односторонние заявления производителей на конференциях, источники указаны в ежедневном отчёте.
- Основные ссылки (по названию можно найти в соответствующем репозитории):
- График выпуска 2.2 — https://github.com/flagos-ai/community/blob/main/release/2.2/schedule_CN.md
- Список 2.2 RC2 — https://github.com/flagos-ai/community/blob/main/release/2.2/release-2.2-rc2.yaml
- Каталог FEP — https://github.com/flagos-ai/community/tree/main/fep
- FEP-0099 библиотека операторов — https://github.com/flagos-ai/community/blob/main/fep/sig-operator/0099-operator-library-flagos-2.2.md
- build-infra configs.yaml — https://github.com/flagos-ai/build-infra/blob/main/configs.yaml
- Повышение версии build-infra #916 — https://github.com/flagos-ai/build-infra/commit/dc947656038dab790fe9e107f06533a1bf05abdd
- Авторизация полной пересборки всех бэкендов build-infra #938 — https://github.com/flagos-ai/build-infra/pull/938
- Однократная сборка wheel плагина build-infra #934 — https://github.com/flagos-ai/build-infra/pull/934
- FlagGems v5.4.0-rc2.post1 Release — https://github.com/flagos-ai/FlagGems/releases/tag/v5.4.0-rc2.post1
- FlagSparse v0.3.0-rc2.post1 Release — https://github.com/flagos-ai/FlagSparse/releases/tag/v0.3.0-rc2.post1
- Маршрутизация Torch-FL PPU #290 — https://github.com/flagos-ai/Torch-FL/pull/290
- Включение TLE в FlagGems PPU #6423 — https://github.com/flagos-ai/FlagGems/pull/6423
- Репозиторий Open3D-PIMC — https://github.com/flagos-ai/Open3D-PIMC
- Интервал следующего выпуска: 2026-09-21 – 09-27 (последняя неделя перед 2.2 GA, ключевое наблюдение — заключение Go/No-Go, момент установки тега v2.2.0 и завершение приёмки по всем бэкендам).