모니터링 기간: 2026-09-18 10:18 ~ 2026-09-20 10:18 (약 48시간, 주말 포함, 09-18 데일리 리포트 기간을 이어받아 공백 없음) 출처: GitHub (org: flagos-ai, 54개 저장소 pushed_at 전수 점검, 기간 내 20개 저장소 206개 커밋 건별 검증), Google News RSS (중영문 24개 쿼리어, 프록시 경유), Zhiyuan 커뮤니티, Zhihu 기관 계정, CSDN FlagOS 칼럼 등 (상세 내용은 부록 출처 목록 참조)


이번 호 인덱스

  • 오늘의 핵심: build-infra 전 20개 백엔드 vLLM 이미지 일괄 승인 재빌드, 2.2 릴리스물 rc2.post2 조립 진입 (09-19/09-20)
    1. 오픈소스 프로젝트 진행 상황 (GitHub 동향)
      • 1.1 build-infra: 20개 백엔드 vLLM 이미지 승인 재빌드, 플러그인 wheel 「1회 빌드, 전 벤더 배포」로 변경 (09-19/09-20)
      • 1.2 build-infra: FlagTree 핀 버전 정책 0.6.x로 강화, FlagTune 비용 모델 핀 버전에 따라 비활성화 (09-20)
      • 1.3 FlagGems: KernelGen 지속 반영, Kunlunxin 백엔드 하루 만에 약 10건 일괄 수정 (09-20)
      • 1.4 FlagGems: Damo Academy Xuantie PPU 백엔드 TLE 활성화, Hygon DCU Flash Attention 수정 (09-20)
      • 1.5 FlagSparse: MUSA / MACA / DCU 3개 백엔드 적응 집중 추진 (09-18~09-20)
      • 1.6 FlagQuantum: 알고리즘 원시 패키지 대폭 확장 — QFT, 위상 추정, Grover, QUBO 등 10여 항목 (09-18~09-20)
      • 1.7 Torch-FL: Qwen-Image 2.1 / 2512 멀티칩 성능 최적화 라인 구축 (09-18~09-20)
      • 1.8 기타 동향: FlagTree, FlagGems-sglang, FlagGems-vllm, FlagFFT, FlagPrism 등 (09-18~09-20)
    1. 뉴스 보도 및 생태계
      • 2.1 컴포넌트급 검색 15번째 연속 조용한 기간: 48시간 무적중 (09-18~09-20)
      • 2.2 2026 인공지능 오픈 컴퓨팅 콘퍼런스 겸 Zhongzhi FlagOS 기술 콘퍼런스 참가 신청 개시: 10월 17-18일 베이징 (09-18)
      • 2.3 FlagOS × MiniCPM 모델 추론 처리량 성능 최적화 챌린지: 9월 21일 제출 개시 (최근 발표)
    1. 회원사 심층 분석
      • 3.1 Kunlunxin: FlagGems 백엔드 수정 일괄 반영 (09-20)
      • 3.2 Moore Threads: MUSA 라인 연산자와 이미지 동시 추진 (09-20)
      • 3.3 Hygon: DCU Flash Attention 수정 및 Qwen-Image 성능 라인 (09-20)
      • 3.4 Damo Academy Xuantie: PPU 백엔드 TLE 활성화, KernelGen 연산자 메인라인 반영 (09-19/09-20)
      • 3.5 MetaX: MACA 라인 FlagSparse 적응 및 이미지 기록 (09-19/09-20)
      • 3.6 Iluvatar CoreX: FlagDNN 테스트 범위 수렴 (09-19/09-20)
      • 3.7 Ascend: 이미지 재빌드, 전용 선형 연산자 및 kda_gate 연산자 (09-20)
      • 3.8 Moore Threads / Enflame / MetaX 이미지 및 도구 라인 (09-20)
    1. 요약 및 트렌드 관찰
  • 부록: 출처 검증 표
  • 부록: 전체 출처 목록

오늘의 핵심: build-infra 전 20개 백엔드 vLLM 이미지 일괄 승인 재빌드, 2.2 릴리스물 rc2.post2 조립 진입

날짜: 2026-09-19, 2026-09-20 출처: build-infra #938, build-infra #956, build-infra #934

이번 기간 build-infra는 43개 커밋으로 org 내에서 가장 밀도 높은 라인이 되었으며, 움직임이 극도로 집중되었다: 전 20개 백엔드 vLLM 이미지에 대해 2.2.0 / 플러그인 post2 재빌드를 승인하고, 재빌드 결과를 하나씩 뒤로 기록했다. 09-20 03:07의 app changelogs: authorize the 2.2.0 / plugin-post2 rebuild for all 20 images(#938)가 신호탄이었고, 이어서 09-20 03:07부터 10:28까지 한 시간 남짓 동안 봇 계정이 백엔드별로 새 이미지 tag를 하나씩 기록했다. 09-20 09:43에는 authorize the 2.2.0 / plugin-post2 rebuild for all 20 vllm 0.24.0 images를 추가하여 이번 재빌드의 범위와 기준선(vLLM 0.24.0)을 제목에 명확히 했다.

기록된 미러 tag는 org의 전체 백엔드 매트릭스를 포괄한다: 2.2.0-0.3.0rc2.post2 한 단계는 Ascend(cann8.5.0, cann9.0.0 및 두 가지 910c 변형), Cambricon(neuware4.4.3 / 4.7.2), Moore Threads(musa4.3.6 / 5.2.0), Enflame(tops1.9.10 / 1.10.6), MetaX(maca3.7.2.1 / 3.8.1.3), Hygon(dtk26.04), Iluvatar CoreX(corex4.5.0), Kunlunxin(xre5.37.1), Zhonghao Xinying(tangrt1.2.0) 및 NVIDIA(cuda12.8 / 13.3)에 걸쳐 있다; 더 이른 단계인 0.2.2rc2.post2(플러그인 버전)가 먼저 한 묶음을 배치했다. 단일 모니터링 기간 내 20개 백엔드 미러가 전부 갱신되었으며, 이는 이번 기간 org 내에서 규모가 가장 큰 단일 작업이다.

이와 함께 플러그인 wheel의 배포 방식도 변경되었다: 09-19 23:34의 vllm-plugin wheel: build once, publish to every vendor index(#934)는 “각 벤더별로 한 번씩 빌드”를 “한 번 빌드, 모든 벤더 인덱스에 게시”로 바꾸었고, 이후 두 커밋은 버전 번호를 git ref에서 유도하도록 변경하고(#932), runs-on 파라미터 언패킹 문제를 수정했다(#935). 이 체인은 플러그인 배포를 “N회 빌드”에서 “1회 빌드 + N회 게시”로 압축한 릴리스 엔지니어링상의 구조적 최적화다.

또 다른 병행 마무리 라인은 “미러에 도대체 무엇이 설치되어 있는가”를 검증 가능한 사실로 만드는 것이다: vllm app image: read the installed plugin version past the entrypoint(#937)는 미러가 플러그인 버전을 스스로 보고하게 한다; docs: print TBD for an app image that was never built(#948)는 한 번도 빌드된 적 없는 미러를 문서에서 명확히 TBD로 표시한다; changelogs: name the FlagTree each 2.2.0 vllm image actually builds on(#953)는 미러별로 실제 컴파일 기반을 표기한다. 세 곳 모두 “문서와 아티팩트 불일치”의 여지를 줄이고 있다.

모니터링 기간 내 작업을 나란히 보면: 2.2 릴리스 아티팩트 조립은 이미 “전 백엔드 미러 일괄 재빌드 + 버전 검증 가능 + 배포 경로 통합” 단계에 도달했고, 릴리스 일정상 GA(2026-09-28)까지 8일이 남아 있어 테스트 및 안정화 기간 내 정상적인 진행 리듬에 해당한다.


1. 오픈소스 프로젝트 진행 상황(GitHub 동향)

모니터링 기간 총괄: org 내 54개 저장소 중 20개가 이번 모니터링 기간에 커밋이 있었고, 합계 206건(48시간에 걸쳐, 주말 포함)이며, 분포는 다음과 같다: build-infra 43, FlagSparse 39, FlagGems 38, FlagQuantum 23, FlagGems-sglang 10, FlagGems-Experimental 10, Torch-FL 9, FlagDNN 6, FlagFFT 5, docs 4, FlagTree 4, FlagGems-vllm 4, vllm-plugin-FL 2, FlagPrism 2, FlagBLAS 2, FlagCX 1, FlagAttention 1, FlagAudio 1, FlagScale-Agent 1, TransformerEngine-FL 1.

이번 모니터링 기간의 형태 = “릴리스 아티팩트 일괄 조립” + “백엔드 수정 러시” 두 라인: build-infra가 전 백엔드 미러 재빌드와 배포 경로 통합을 이끌고; 애플리케이션 측(FlagGems / FlagSparse / Torch-FL / FlagGems-vllm)에서 멀티칩 백엔드의 집중적인 수정과 성능 튜닝이 나타났으며, 그중 Kunlunxin과 Hygon DCU의 수정량이 가장 집중되었다; 거버넌스 측(FlagQuantum 알고리즘 원시 연산, FlagTree TLE)은 2.2 로드맵에 따라 계속 전개되고 있다. 09-19(토요일) 각 저장소 합계 약 12건의 커밋으로, 개발 활동은 주말을 넘어 연속적으로 이어졌다.

1.1 build-infra: 20개 백엔드 vLLM 미러 승인 재빌드, 플러그인 wheel “1회 빌드, 전 벤더 배포”로 변경(09-19/09-20)

날짜: 2026-09-19, 2026-09-20 출처: build-infra #938, build-infra #934, build-infra #939

자세한 내용은 “오늘의 중점” 참조. 두 가지 보충: 첫째, cann9.0.0 백엔드는 09-20 04:00에 cann-shmem 소프트웨어 패키지를 추가했으며(#939), Ascend 9.0 라인의 공유 메모리 컴포넌트 의존성을 보완했다; 둘째, 09-18 15:47의 Runtime: fetch vendor deps from the vendor index(#930)는 런타임 의존성을 “벤더 인덱스”에서 가져오도록 변경하기 시작했고, 09-18 13:50의 구 컨테이너 파일 삭제(#929)와 함께 컨테이너 빌드의 소스와 사실 소스가 통합 인덱스로 수렴하기 시작했다.

1.2 build-infra: FlagTree 핀 버전 정책이 0.6.x로 강화, FlagTune 비용 모델은 핀 버전에 따라 비활성화 (09-20)

날짜: 2026-09-20 출처: build-infra #940, build-infra #943, build-infra #944, build-infra #947

09-20 아침 연속 세 건의 “핀 버전” 커밋: nvidia-cuda13.3: hold flagtree at 0.6.1(#940), metax: hold flagtree at 0.6.1 for both MACA backends(#943), enflame-tops1.9.10: hold flagtree at 0.6.0(#944) — 세 백엔드의 컴파일러 기반을 0.6.x 라인으로 다시 고정한다(이전의 버전 상향 조치에 대한 반동을 형성). 이어서 runtime: disable the FlagTune cost model where flagtree 0.6.x is pinned(#947)는 FlagTune 비용 모델이 0.6.x 핀 버전과 호환되지 않으며, 핀 버전 상태에 따라 비활성화해야 함을 설명한다. 세 건의 핀 버전 + 한 건의 호환성 처리가 완전한 한 세트의 “반동 + 적응”을 구성한다.

또한 상태 매트릭스 수정 한 건: status matrix: drop the merged entries from megatron's prs(#933), status matrix: prs = open PRs, md = recen…(#932 전반부)는 상태 매트릭스의 통계 기준을 명확히 고정한다(PR 열=오픈 PR, md 열=최근 커밋).

1.3 FlagGems: KernelGen 지속 반영, Kunlunxin 백엔드 하루에 약 10건 일괄 수정 (09-20)

날짜: 2026-09-20 출처: FlagGems #5917, FlagGems #5878, FlagGems #6317, FlagGems #6476

FlagGems 이번 기간 38건의 커밋은 여전히 KernelGen 산출물을 기반으로 한다: Nvidia 측에 새로운 _fused_adagrad_(#5917)와 _fused_sgd_(#5878) 두 옵티마이저 융합 연산자가 추가되었고, Experimental 저장소(1.8 참조)에는 당일 10개의 Nvidia 연산자가 추가로 반영되었다. 이번 기간 가장 집중된 라인은 Kunlunxin 백엔드 수정이다: binliu가 연속으로 약 10건의 커밋을 남겼으며, grouped_mm 대형 M / 소형 K 형상의 persistent kernel 스케줄링과 형상별 자동 튜닝, SDPA 어텐션 수정(value-1 파라미터 비특수화 유지, 자동 튜닝 수렴), mse_loss 1단계 전블록 마스크로 변경(#6476), scatter / log_sigmoid_backward / amp_foreach, fill / add_relu / special_log1p / dequantize, pow / pdist / 르장드르 다항식, segment_reduce / arcsinh / cosh / acosh / log2 / log10, bessel_y1 / bernoulli, t_copy / selu / reflection_pad2d, log_softmax / logical_not 및 lgamma 마이그레이션 오삭제 수정 등을 포함하여, 해당 백엔드의 최근 연산자 회귀를 거의 “완전 정리”했다.

도구 측 두 건: [KMCompiler] operator linalg_lstsq bug fix(#6499), [KMCompiler] fix fp64 error(#6491)와 delete uint8 dtype(#6477); MThreads 측은 feature_dropout_ 복원과 분리 수정(#6490, #6482). 벤치마크 및 CI 측: Fix(benchmark): align pytest markers and op_name with operator registry ids(#6489), ci: run pre-check jobs on basic-runner-cpu(#6431).

1.4 FlagGems: 다모 아카데미 XuanTie PPU 백엔드에서 TLE 활성화, 하이광 DCU Flash Attention 수정 (09-20)

날짜: 2026-09-20 출처: FlagGems #6423, FlagGems #5822, FlagGems #6456

세 건의 중량급 백엔드 커밋: [T-Head] Enable TLE for PPU backend(#6423)는 Triton 언어 확장(TLE)을 다모 아카데미 XuanTie PPU 백엔드에서 활성화하며, 이 방향이 2.2 멀티 백엔드 계획에서 차지하는 위치에 대응한다. [Hygon] Fix Flash Attention forward/backward kernels on DCU(#5822)는 하이광 DCU에서의 순방향/역방향 Flash Attention 커널을 수정한다. [Ascend] Add specialized linear operator(#6456)는 Ascend를 위해 전용 선형 연산자를 추가한다. 또한 [MetaX] Fix masked_fill broadcast OOB and illegal num_warps=16(#6480)은 MetaX 온라인에서의 한 건의 범위 초과와 불법 설정을 수정한다.

1.5 FlagSparse: MUSA / MACA / DCU 세 백엔드 적응 집중 추진 (09-18~09-20)

날짜: 2026-09-18 ~ 2026-09-20 출처: FlagSparse #73, FlagSparse #71

FlagSparse 이번 기간 39건의 커밋은 거의 전부 협력사의 이중 브랜치 협업 흐름(NCIC-AlphaSparse의 두 계정이 교대로 병합)에서 나왔으며, 동작 주제는 세 백엔드 적응이다: MUSA(Moore Threads) 라인은 musa updates를 반영하고, MACA(MetaX) 라인은 maca spsm debugmaca test commands를 반영하며, DCU(하이광) 라인은 dcu updates, dcu sddmm tests, ci dcu 그리고 dcu spgemm test fp32 fp64 sperated(spgemm의 단정밀도/배정밀도 테스트를 분리)를 반영한다. 별도로 cwrapper add(C 래퍼 계층 추가)와 「New update」에 대한 revert 1회(#63 롤백, #64 철회), 그리고 문서 정리가 있다. 전체적으로는 희소 연산자 라이브러리를 국산 세 백엔드로 실체화하는 과정이다.

1.6 FlagQuantum: 알고리즘 원시 패키지 대확장——QFT, 위상 추정, Grover, QUBO 등 십여 항목 (09-18~09-20)

날짜: 2026-09-18 ~ 2026-09-20 출처: FlagQuantum #85, FlagQuantum #91, FlagQuantum #104

FlagQuantum 이번 기간 23건의 커밋은 단일 기여자(Wei LIU)가 연속적으로 추진했으며, 주제는 알고리즘 원시 패키지의 체계적 구축이다: 알고리즘 원시 패키지와 양자 푸리에 변환(#85)에서 시작하여 연이어 연산자 프로토콜과 위상 추정(#87), 상태 준비(#88), 다중 제어 X와 가역 비트열 비교기(#89), 진리표 오라클 합성(#90), Grover 검색(#91), 진폭 추정(#92)을 반영했다. 이어서 응용 계층으로 진입한다——QUBO에서 Ising 매핑(#86), 양자 커널 추정과 고전 커널 릿지 분류기(#100), 양자 주성분 분석 기반 위상 추정(#98), Grover 양자화 k-medians(#99), QUBO 특징 선택(#101), 진폭 추정으로 빈발 항목 비율 계산(#102), 위상 추정으로 특이값 추정(#104). 엔지니어링 품질 두 건: 커버리지와 타입 검사 등 게이트가 최근의 「엄격화」 노선을 이어간다. 기능 측 한 건은 양자 오류 정정(QEC) 기록 계층의 검출기 오류 모델(#84, 제안 048의 stage 2a에 대응)이다. 01-09 계층 외에도 build 거버넌스 측에서 온 작업 한 건이 있다: 해당 저장소가 점유하는 org급 runner 할당량 제한(최근 CI 리소스 거버넌스와 같은 주제).

1.7 Torch-FL: Qwen-Image 2.1 / 2512 멀티칩 성능 최적화가 하나의 흐름으로 (09-18~09-20)

날짜: 2026-09-18 ~ 2026-09-20 출처: Torch-FL #360, Torch-FL #356, Torch-FL #353

Torch-FL 이번 기간 9개의 커밋은 단일 기여자(nate.river)가 Qwen-Image 시리즈의 멀티칩 성능을 중심으로 하나의 흐름을 형성했다: 먼저 test: add the Qwen-Image-2.1 manual test flow for chip bring-up(#342)로 수동 테스트 흐름을 구축한 뒤 연속 최적화를 진행했다—DCU의 SDPA 백엔드 선택과 포인트별 라우팅 수정(#345), DCU 측 FlagGems 스케줄링 / 레이아웃 / 자동 튜닝 오버헤드 축소(#352), GCU의 Qwen-Image-2512 단일 스텝을 7.1 s/it로 단축(#354, SDPA 라우팅 + GEMM 오퍼랜드 처리), Qwen-Image-2.1의 key-valid 마스크를 FlagGems SDPA 경로에 연결(#353), DCU의 FlagGems 스케줄링 오버헤드를 추가로 축소(#356), 최종적으로 Qwen-Image-2.1의 처리량 곡선과 테일 레이턴시 / 산술 강도 측정 결과 제시(#360). 이는 “실행 가능에서 잘 실행됨으로” 나아가는 전형적인 칩 bring-up 성능 흐름이다.

1.8 기타 동향: FlagTree, FlagGems-sglang, FlagGems-vllm, FlagFFT, FlagPrism 등 (09-18~09-20)

날짜: 2026-09-18 ~ 2026-09-20 출처: FlagTree #1084, FlagGems-sglang #93, FlagGems-Experimental #659, FlagPrism #13

  • FlagTree(4): [KMCompiler][TLERaw] Optimize the sort operator based on tle_raw(#1084) TLE Raw 노선을 계속 이어감; [TLE][CommonIR] Added CommonIR conversion integration on Triton 3.6(#1160) CommonIR 변환을 Triton 3.6에 통합; [QC][TLE] Support cross-dtype Hopper WGMMA accumulator reuse(#1001); [XPU] Guard do_bench against estimate_ms==0(#1224) 0으로 나누기 수정.
  • FlagGems-sglang(10): moe_fused_mul_sum 경연 연산자 저장소에 등록 및 등록 완료(#87); batch3 참조, 테스트, 벤치마크, 문서 일괄(#93); do_bench를 벤더별 디스패치 단일 헬퍼 함수로 변경(#94); Ascend fused router K 루프 파이프라인을 2단계로 제한(#96).
  • FlagGems-Experimental(10): KernelGen Nvidia 라인 당일 추가로 연산자 10개 등록——sparse_dim, _has_same_storage_numel, _dimV, _values, col_indices, adjoint, atleast_2d, detach_copy, ccol_indices_copy, crow_indices_copy(#640~#659), 대부분 희소 및 뷰 계열 소형 연산자로, Experimental에서 메인라인으로 이관하는 전 단계.
  • FlagGems-vllm(4): MUSA 측 deepseek_v4의 fused_q_kv_rmsnorm 최적화(#825); MetaX 라인 varlen flash attention 최적화(#808); Ascend 라인 kda_gate_cumsum 연산자 신규 추가(#809); KMCompiler 라인 fused_moe 정밀도 벤치마크에 벤더 네이티브 정밀도 게이트 추가(#824).
  • FlagFFT(5): 검수 프레임워크 연속 리팩터링——캡처 데이터가 파이프라인을 통해 흐르고 결과 트리를 평탄화, 연산자 로그는 플랫폼이 읽을 수 있는 판정으로 마무리, 입력 쓰기 측이 읽기 측을 더 이상 기다리지 않음, 캡처 입력은 필요 시 재생성으로 변경(더 이상 디스크에 상주하지 않음).
  • FlagPrism(2): 연산자 검수 테스트 통합 및 구 배치 스위트 퇴역(#13); Enflame 디버거 및 TOPSPTI 성능 분석 지원 신규 추가(#12).
  • docs(4): 온라인 랩 도움말 콘텐츠 업데이트(#509, #510 두 차례).
  • FlagCX(1): 디바이스 API 기본 경로에 Iluvatar 지원 추가(#608).
  • vllm-plugin-FL(2): 가속기 그래프에서 일반적인 어텐션 메타데이터 캡처(#442); Iluvatar BI-V150 vLLM 0.24 라인 적응(#526).
  • FlagDNN(6): ppu / mthreads / ascend / iluvatar 4개 플랫폼 테스트 수정 및 run_test.py 수정; Ascend 플랫폼 아키텍처 개선.
  • FlagBLAS(2): thead의 pyproject.toml 수정.
  • FlagAttention(1): 수정 커밋 1건(#63).
  • TransformerEngine-FL(1): main 라인에서 cherry-pick(#124).
  • FlagScale-Agent(1): agent harness 강화——REPL 프롬프트 워치독, 세션 간 제안 레지스트리 등.
  • FlagAudio(1): CI에 Nexus 업로드 경로 추가(#8).

2. 뉴스 보도와 생태계

2.1 컴포넌트 수준 검색 연속 열다섯 번째 조용한 모니터링 기간: 48시간 무적중(09-18~09-20)

날짜: 2026-09-18 ~ 2026-09-20 출처: Google News RSS(중영문 24개 검색어 조합, 프록시 경유)

FlagOS / FlagGems / FlagScale / FlagTree / FlagPerf / FlagCX / KernelGen 컴포넌트명 및 Zhiyuan/BAAI 등 조합어로 검색한 결과, 48시간 모니터링 기간 내 무적중(gnews 스크립트 실측 0건)으로 연속 열다섯 번째 조용한 모니터링 기간. 컴포넌트 수준 뉴스 측의 침묵은 이미 상시화되었으며, 본 리포트의 대외 동향 사실은 GitHub org와 커뮤니티 채널(Zhiyuan 커뮤니티/zhihu 기관 계정)을 기준으로 한다.

2.2 2026 인공지능 오픈 컴퓨팅 대회 겸 Zhongzhi FlagOS 기술 대회 참가 접수 시작: 10월 17-18일 베이징(09-18)

날짜: 2026-09-18(발표) 출처: zhihu 기관 계정 발표

FlagOS 커뮤니티는 베이징 Zhiyuan 인공지능연구원, 베이징 양자정보과학연구원, 중관춘 인공지능 오픈소스 연맹(준비 중) 등 기관과 공동으로 2026년 10월 17-18일 베이징 중관춘 국가자주혁신시범구 전시센터에서 「2026 인공지능 개방컴퓨팅 대회 겸 FlagOS 기술 대회」를 개최하며, 주제는 「일체 스택 관통, 지능 컴퓨팅 무경계」이다. 대회는 이기종 컴퓨팅 파워 기반, 오픈소스 AI 시스템 소프트웨어 스택, 양자-지능 융합, 차량 지능, 임바디드 지능, AI 에이전트 인프라 등의 방향으로 의제를 구성한다. 실습 워크숍은 KernelGen 고성능 연산자 자동 생성 엔지니어링, FlagOS 기반 대규모 모델 온디바이스 추론, Triton-TLE 신형 Attention kernel 최적화, FlagScale-Agent 아키텍처 설계와 실전 등 전체 체인을 다룬다. 등록 채널이 이미 열렸다(얼리버드 티켓 한정 할인). 이는 최근 FlagOS 생태계의 가장 중요한 대외 활동 거점이며, 그 워크숍 주제는 이번 호 엔지니어링 측 관찰(TLE, KernelGen, 온디바이스, Agent)과 높은 대응성을 보인다.

2.3 FlagOS × MiniCPM 모델 추론 처리량 성능 최적화 챌린지: 9월 21일 제출 개시 (최근 발표)

날짜: 최근 발표 (제출 단계 2026-09-21부터) 출처: 즈후 기관 계정 발표

FlagOS와 MiniCPM이 공동으로 모델 추론 처리량 성능 최적화 챌린지를 개최하며, 개발 및 제출 단계는 2026년 9월 21일부터 11월 20일까지(UTC+8)이고 12월 초에 심사한다. 문제는 FlagOS 스택 상의 추론 처리량 최적화를 대상으로 하며, SGLang 크로스칩 연산자 최적화 대회(“연산자 아일랜드” 쟁탈전)에 이어 커뮤니티 대회 체계의 연장선이다.


3. 회원사 심층 분석

3.1 Kunlunxin: FlagGems 백엔드 수정 대량 반영 (09-20)

날짜: 2026-09-20 출처: FlagGems #6317, FlagGems #6476

Kunlunxin 라인은 이번 모니터링 기간에 약 열 건의 수정을 반영했으며(상세는 1.3 참조), 기초 원소별 연산자부터 grouped_mm / SDPA 같은 핵심 연산자까지 아우른다. 그중 가장 실질적인 것은 grouped_mm의 「큰 M / 작은 K」 형상 전용 persistent kernel과 형상별 자동 튜닝으로, MoE 시나리오의 전형적 형상에 특화한 것이다. SGLang 측의 moe_fused_mul_sum 경쟁 연산자 등록과 맞물려 Kunlunxin 방향의 MoE 추론 경로가 지속적으로 실체화되고 있다.

3.2 Moore Threads: MUSA 라인 연산자와 이미지 동시 추진 (09-20)

날짜: 2026-09-20 출처: FlagGems-vllm #825, FlagSparse #73

MUSA 라인 두 가지: FlagGems-vllm에서 deepseek_v4의 fused_q_kv_rmsnorm을 Moore Threads에 맞게 최적화(#825), FlagSparse의 MUSA 적응 업데이트. 이미지 측은 musa4.3.6 / musa5.2.0 두 백엔드의 2.2.0 이미지가 rc2.post2 재빌드 기록을 완료했다. 또한 FlagGems-eXperimental의 MThreads KernelGen 연산자 배치(#6458)가 09-19에 Experimental에서 메인라인으로 이관되었다.

3.3 Hygon: DCU Flash Attention 수정과 Qwen-Image 성능 라인 (09-20)

날짜: 2026-09-20 출처: FlagGems #5822, Torch-FL #356

Hygon 방향의 이번 호 두 가지 핵심 작업: FlagGems가 DCU 상의 Flash Attention 전방/역방향 커널을 수정(#5822, 5822번 PR을 거친 장기 성숙), Torch-FL이 DCU 상의 Qwen-Image-2.1에 대한 FlagGems 스케줄링 오버헤드를 절감(#356). 이미지 측은 hygon-dtk26.04가 2.2.0 rc2.post2 재빌드를 완료했다.

3.4 Damo Academy XuanTie: PPU 백엔드 TLE 활성화, KernelGen 연산자 메인라인 진입 (09-19/09-20)

날짜: 2026-09-19, 2026-09-20 출처: FlagGems #6423, FlagGems #6460

T-Head 방향 두 건: [T-Head] Enable TLE for PPU backend(#6423)는 PPU 백엔드에서 Triton 언어 확장을 활성화한다——TLE는 2.2 멀티 백엔드 계획에서 하드웨어 패밀리 간 통합 최적화 언어를 지향하며, T-Head가 이 노선에 진입했음을 의미한다. 09-19의 KernelGen cherry-pick은 T-Head 연산자를 Experimental에서 메인라인으로 복귀시켰다(#6460). 이는 09-18호에서 관찰된 “T-Head의 FlagTree 2.2 멀티 백엔드 계획 진입”과 연속적인 후속 흐름을 이룬다.

3.5 MetaX: MACA 라인 FlagSparse 적응 및 이미지 기록 (09-19/09-20)

날짜: 2026-09-19, 2026-09-20 출처: FlagSparse #71, build-infra #943

MACA 라인: FlagSparse의 maca spsm debug와 테스트 명령이 진전되었고, build-infra는 두 MACA 백엔드의 FlagTree 핀 버전을 0.6.1로 통일했으며(#943), maca3.7.2.1 / 3.8.1.3 두 이미지의 2.2.0 재빌드 기록을 완료했다. FlagGems-vllm 측의 MetaX varlen flash attention 최적화도 같은 라인에 속한다.

3.6 Iluvatar CoreX: FlagDNN 테스트 면 수렴 (09-19/09-20)

날짜: 2026-09-19, 2026-09-20 출처: FlagDNN 커밋

FlagDNN은 이번 기간 여섯 건의 커밋이 테스트 면 수렴을 중심으로 이루어졌다: iluvatar / ascend / mthreads / ppu 네 플랫폼 테스트 수정과 run_test.py 복구, 그리고 한 건의 Ascend 플랫폼 아키텍처 개선이 포함된다. corex4.5.0 이미지의 2.2.0 재빌드 기록을 완료했다. FlagCX 측 Iluvatar의 Device API 기본 경로 지원(#608)과 vllm-plugin-FL의 BI-V150 vLLM 0.24 적응(#526)이 같은 모니터링 기간에 반영되었다.

3.7 Ascend: 이미지 재빌드, 전용 선형 연산자 및 kda_gate 연산자 (09-20)

날짜: 2026-09-20 출처: FlagGems #6456, FlagGems-vllm #809, build-infra #939

Ascend 라인: FlagGems에 전용 선형 연산자 추가(#6456), FlagGems-vllm에 kda_gate_cumsum Triton 연산자 추가(#809), FlagGems-sglang의 fused router K 루프 파이프라인 수정(#96). 이미지 측에서는 네 가지 Ascend 변형(cann8.5.0 / cann9.0.0 × 910c 및 비 910c)이 일괄적으로 rc2.post2 재빌드를 완료하고 cann-shmem 패키지를 추가했다(#939).

3.8 Enflame / Zhonghao Xinying / NVIDIA 이미지 및 도구 면 (09-20)

날짜: 2026-09-20 출처: FlagPrism #12, build-infra 커밋

Enflame 라인: FlagPrism에 Enflame 디버거와 TOPSPTI 성능 분석 지원 추가(#12), tops1.9.10 / 1.10.6 두 이미지의 재빌드 완료, 그중 tops1.9.10의 FlagTree 핀 버전이 0.6.0으로 복귀했다(#944). Zhonghao Xinying tangrt1.2.0, NVIDIA cuda12.8 / 13.3 이미지의 재빌드 기록을 동기화해 완료했으며, NVIDIA cuda13.3의 FlagTree 핀 버전이 0.6.1로 복귀했다(#940).


4. 요약 및 트렌드 관찰

  • 릴리스 산출물이 전체 백엔드 일괄 재빌드 단계에 진입: 20개 백엔드 vLLM 이미지가 한 모니터링 기간 안에 전부 rc2.post2로 갱신되었고, 이미지 자체 보고 버전, 문서상 TBD 표기, 개별 컴파일 기반 명시라는 세 가지 작업이 동시에 완료되었다——「릴리스 산출물 검증 가능」이 이번 라운드 엔지니어링의 중심이 되었으며, GA(09-28)까지 8일 남아 속도는 정상이다.
  • 플러그인 배포 패러다임 변화는 기록할 만하다: 「한 번 빌드, 전체 벤더 인덱스에 배포」(#934)가 N회 빌드를 1회 빌드 + N회 배포로 압축했으며, 이런 인프라 수준의 단순화는 이후 모든 버전의 릴리스 비용을 직접 절감한다.
  • 멀티칩 백엔드 수정 집중기: Kunlunxin(약 10건), Hygon(Flash Attention + Qwen-Image), MetaX(SDPA 수정), Ascend(전용 선형 연산자)가 같은 모니터링 기간에 집중 수정되었으며, 이는 2.2 테스트 기간(09-01~09-24)이 「백엔드별 정산」 단계에 들어섰음을 반영한다. Kunlunxin이 grouped_mm 대형 M / 소형 K 특화를 처리한 것은 MoE 시나리오를 겨냥한 가장 직접적인 증거이다.
  • FlagQuantum의 확장 속도는 전체 org에서 가장 빠른 방향 중 하나: 단일 기여자가 48시간 동안 23건을 처리했으며, 원시 연산(QFT, 위상 추정, Grover, 진폭 추정)에서 응용(QUBO 특징 선택, 양자 PCA, k-medians)까지 사슬처럼 구축하고 동시에 QEC 기록 계층도 작업 중이다——「양자-지능 융합」의 코드 수준 구체적 진척.
  • T-Head 양 라인 진입: PPU 백엔드가 TLE + KernelGen 연산자 브리징 메인라인을 가동했으며, 이는 2.2 멀티백엔드 계획에서 T-Head의 위치 배치와 일치한다. XuanTie 방향의 FlagOS 스택 내 참여도가 지속적으로 심화되고 있다.
  • 생태계 활동이 콘퍼런스 주기 진입: 10월 17-18일 FlagOS 기술 콘퍼런스 등록이 시작되었고, 워크숍 주제(KernelGen, 온디바이스, TLE Attention, FlagScale-Agent)는 이전 엔지니어링 관찰과 하나씩 대응한다. MiniCPM 챌린지는 9/21에 시작된다——9월 하순부터 생태계 운영 밀도가 현저히 상승할 것이다.

부록: 출처 검증 표

분류 출처 검증 방식 결과
GitHub org: flagos-ai repos API 54개 저장소 pushed_at 전수 검증 20개 저장소가 모니터링 기간 내 활성
GitHub 각 저장소 commits API(since=09-18T10:18Z) 저장소별 수집, 항목별 검증 206건 커밋
뉴스 Google News RSS(24개 쿼리어) gnews_topic.py, 48h 모니터링 기간 0건 적중(15번째 조용한 모니터링 기간)
커뮤니티 Zhihu 기관 계정 / BAAI 커뮤니티 / CSDN 칼럼 수동 검색 재검토 콘퍼런스 등록 기사(09-18), 챌린지 기사(최근)

부록: 전체 출처 목록