보고 기간: 2026년 9월 14일(월) ~ 9월 20일(일), 총 7일 자료 출처: 본 간행물의 일일 FlagOS 동향 보고서(09-14, 09-15, 09-16, 09-17, 09-18 다섯 차례 평일호, 별도 09-20 주말 보충호 포함, 총 6회); 모든 항목은 해당 기간 검증된 출처에서 발췌 편성 설명: 이번 모니터링 기간은 릴리스 거버넌스(2.2 RC 리듬과 GA 일정 확정), 컴포넌트 및 코드 공동 기여, 멤버 기관 및 벤더 적응, 생태계와 커뮤니티 네 가지 차원을 다룹니다; 6회 데일리 리포트 모니터링 기간 내 커밋은 총 약 720건으로 org 내 약 30개 저장소를 포괄하며, 기술적 사실은 모두 코드 저장소와 공식 발표 자료의 실측 검증에서 비롯되었습니다


1. 이번 주 주요 뉴스

  • FlagOS 2.2 RC2 풀스택 동기 태깅, 전 기간 두 번째 후보 스냅샷(09-14): 09-14 10:35, community 저장소에 2.2 RC2 목록(release-2.2-rc2.yaml, 251행 추가)이 병합되었습니다; 이어 10:45부터 10:54까지 10분 동안 23개 컴포넌트 저장소가 연달아 rc2.post1 태그 또는 Release를 생성했고, 하루 동안 총 26회 태깅 동작이 기록되어 22개 저장소를 포괄했으며, FlagTree의 세 가지 Triton 변형과 하나의 xpu3.6 태그가 당일 보완되었습니다. 최초로 릴리스 노트를 포함한 Release는 FlagGems v5.4.0과 FlagSparse v0.3.0(모두 rc2.post1)입니다.
  • build-infra 버전 필드 2.2.0으로 상향, 전체 20개 백엔드 이미지 일괄 재빌드(09-17 ~ 09-20): 09-17 08:49의 #916이 configs.yaml의 version을 2.1.2에서 2.2.0으로, flaggems를 5.3.5에서 5.4.0-rc2.post2로 상향했습니다. 이는 2.2 GA 전 org 내 유일한 전역 스위치입니다; 09-19부터 09-20까지 다시 전체 20개 백엔드 vLLM 이미지에 2.2.0 / 플러그인 post2 일괄 재빌드를 승인하고 개별적으로 기록을 회신했으며, 이는 이번 주 최대 규모의 엔지니어링 작업입니다.
  • community 20건의 FEP 일괄 병합, 2.2 기능 목록과 릴리스 경계 확정(09-17): 번호 0081부터 0100까지, 연산자, 컴파일러, 프레임워크, 학습, 네트워크, 엣지, 과학 지능 등의 방향에 속합니다; 각 문서는 「릴리스 경계와 증거」 절을 포함하며, 동일 배치 문서 중에는 구현 완료로 표시된 개념 검증(FEP-0095 Common IR)도 있고, 의도적으로 초안에 머문 능력 항목(FEP-0100 KernelGen)도 있어 로드맵을 납품으로 간주하지 않습니다.
  • Torch-FL 6개 플랫폼 FlagGems-first로 전환, 디스패치 레이어가 주전장으로(09-15/09-16): PPU 라우팅 테이블이 11개에서 478개로 확장된 후 435개로 확정되었고, FlagGems가 커버하는 482개 연산자 중 47개가 벤더 커널에 남아 개별 명명되었습니다; CUDA, DCU, GCU, Ascend, MUSA 다섯 플랫폼이 동일 방향으로 조정되었습니다. 이는 「하나의 연산자 라이브러리로 칩 간 재사용」이라는 명제가 디스패치 레이어에서 최초로 완전히 정량화된 사례입니다.
  • Open3D-PIMC, 오픈소스 발표에서 코드 착지까지(09-14 ~ 09-16): 중국 컴퓨팅 파워 대회에서 오픈소스 발표 약 44시간 후, 저장소가 첫 루트 커밋을 받아 한 번에 662개 항목(raisa-inductor 컴파일 레이어와 rcs2 C++ 런타임)을 가져왔으며, 3D 컴퓨팅 파워 칩을 위한 프로그래밍 모델과 컴파일 스택이 엔지니어링 상태로 진입했습니다.
  • 릴리스 아티팩트 엔지니어링 전면 마무리: 아티팩트, 패키징, 게이트 세 라인 병행(09-15 ~ 09-20): Ascend FlagTree wheel 업로드 경로가 최초로 개통되었고(flagtree-0.7.0rc2+ascend3.5 등이 아티팩트 저장소에 도달); FlagTree의 DEB 패키징과 Nexus 릴리스가 공유 워크플로에 편입되었으며; 플러그인 wheel이 「한 번 빌드, 전 벤더 인덱스 배포」로 변경되었고; 이미지가 자체적으로 플러그인 버전을 보고하고 컴파일 기반을 개별 표기하기 시작했으며; FlagQuantum 커버리지 하한이 75%로 상향되었습니다.
  • 생태계, 대회와 이벤트 주기로 진입(09-18 ~ 09-21): 2026 인공지능 오픈 컴퓨팅 대회 겸 Zhongzhi FlagOS 기술 대회 참가 등록 시작(10월 17~18일, 베이징); FlagOS와 MiniCPM이 공동 주최하는 추론 처리량 최적화 챌린지가 09-21 제출 개시; SGLang 크로스 칩 연산자 최적화 대회의 성과가 계속 PR 형태로 메인 저장소에 진입하고 있습니다.
  • 산업면: 멤버 기관 자본 및 투자 유치 이벤트 밀집(09-15 ~ 09-17): Enflame 상장 후 해석이 지속적으로 확산(첫날 상승률 179.22%, 시가총액 1708.5억 위안의 공개 기준이 반복 인용); DGo Robotics가 4억 달러 C라운드 투자 유치 완료(미래에셋 주도); MetaX가 09-17 14.44% 급등하고 여러 기관의 지분 축소 보도가 있었습니다——자본면의 관심은 계속 「만들어내는 것」에서 규모 납품과 수익 실현으로 이동하고 있습니다.

2. 버전 및 릴리스 동향

RC 리듬과 GA 마일스톤

  • 2.2 일정: 기능 동결 08-31, 테스트 및 안정화 기간 09-01 ~ 09-24, GA 2026-09-28로 확정; 마일스톤 「FlagOS 2.2」의 이슈 7건은 09-17 기준 전부 미종료로 확인되었고 만료일도 모두 09-28; 졸업 기준은 「실행 가능한 테스트 계획이 테스트 기간 내에 통과」한 후 FEP 상태가 구현 가능에서 구현 완료로 전환되며, 보안 패치와 심각 결함은 TSC 승인이 필요한 긴급 채널로 처리된다.
  • RC1에서 RC2까지: RC1은 이전 주기 말 산출물로, 이번 주 초에도 여전히 rc1.postN 반복 위치에 있었다(FlagGems는 rc1.post2까지); RC2 목록은 09-14 10:35에 생성되었고, 인프라·연산자·추론 플러그인·학습·릴리스 및 도구 다섯 그룹 총 24개 모듈 항목을 포괄하며, 규칙은 「버전은 rc0/rc1과 일치하게 유지하고 .postN 반복 위치에서만 진행」이다.
  • RC2 세 차례 반복: FlagGems는 rc2.post1(09-14)에서 rc2.post2(09-15 11:21, community #110, 두 곳 수정이 동인: flash_attention_backward의 Triton 3.5 호환성과 tl.map_elementwise 게이팅)를 거쳐 rc2.post3(09-18 기록)로; FlagCX는 rc2.post2까지 진행; 나머지 항목은 rc2.post1에 유지.
  • 브랜치 및 태깅 자동화: 09-17 23:29 ~ 23:33, 열 개 모듈 저장소가 동기화되어 rc2 통합 브랜치를 분기하고 태깅했다(git ls-remote 전체 ref 검증). release-branch-tag 워크플로가 목록에 따라 manage-release.py를 일괄 호출해 실행; 커뮤니티 측의 2.2 프로젝트 동기화 워크플로는 15분마다 실행되며, 릴리스 상태는 연관 PR에서 파생되도록 변경되었다.
  • GA 카운트다운: 모니터링 기간 첫날(09-14)의 14일에서 기간 말(09-20)의 8일로 좁혀졌고, 테스트 기간은 「버그 수정만 받는」 후반부에 진입했다.

컴포넌트 tag 및 Release 목록(모니터링 기간 내)

  • FlagGems: v5.4.0-rc2.post1(09-14, Release)에서 v5.4.0-rc2.post2(09-15)를 거쳐 rc2.post3(09-18 기록)로; 안정 라인은 v5.3.6(09-11 전후) 유지.
  • FlagSparse: v0.3.0-rc2.post1(09-14, 릴리스 노트가 포함된 Release).
  • FlagCX: v0.14.0-rc2.post1(09-14)에서 rc2.post2(09-17/18 검증)로.
  • FlagTree: 0.7.0rc2.post1의 Triton 3.6 / 3.5 / 3.3 세 라인과 0.7.0rc2+xpu3.6(09-14); 09-17에는 0.7.0rc2의 metax, mthreads, enflame, tsingmicro 등 백엔드 태그를 추가; 09-18에는 Kunlunxin xpu 라인에서 0.7.0rc3+xpu3.6이 다시 반복 생성되었다(태그 실측).
  • FlagAttention: v0.4.0-rc2.post1.
  • 나머지 컴포넌트(09-14 집중 태깅, rc2.post1): FlagFFT v0.2.0, FlagDNN / FlagTensor / FlagAudio / FlagBLAS v0.3.0, FlagGems-vllm v0.2.0, FlagGems-sglang v0.1.0, Torch-FL v0.2.0, sglang-plugin-FL v0.2.0, TransformerEngine-FL / Megatron-LM-FL v0.3.0, FlagOS-Compressor v0.1.0, KernelGen v2.2.0, KernelGenBench v0.2.0, FlagRelease v0.3.0; FlagScale는 v2.1.0-rc2.post1(이미 2.0 라인을 벗어남); vllm-plugin-FL은 0.3.0과 0.2.2 두 가지 버전 라인으로 진행.

이미지 및 아티팩트 상태

  • 전체 20개 백엔드 재빌드: 09-20 03:07의 승인 커밋(#938)이 나간 후, 봇 계정이 한 시간 남짓 동안 백엔드별로 새 이미지 tag를 기록했다. 기록된 2.2.0-0.3.0rc2.post2 한 단계는 Ascend(cann8.5.0, cann9.0.0 및 910c 변형), Cambricon(neuware4.4.3 / 4.7.2), Moore Threads(musa4.3.6 / 5.2.0), Enflame(tops1.9.10 / 1.10.6), MetaX(maca3.7.2.1 / 3.8.1.3), Hygon(dtk26.04), Iluvatar CoreX(corex4.5.0), Kunlunxin(xre5.37.1), Zhonghao Xinying(tangrt1.2.0), NVIDIA(cuda12.8 / 13.3)를 포괄한다. 플러그인 버전 라인 0.2.2rc2.post2는 별도로 한 묶음이 먼저 반영되었다.
  • 배포 경로 병합: 플러그인 wheel을 한 번만 빌드하여 모든 벤더 인덱스에 게시하도록 변경하고(#934), 버전 번호는 git ref에서 유도하도록 변경했으며(#932), 런타임 의존성은 벤더 인덱스에서 가져오도록 변경했다(#930). Ascend 라인은 cann-shmem 소프트웨어 패키지를 보완했다(#939).
  • 검증 가능하게 만든 세 가지: 이미지가 실제로 설치한 플러그인 버전을 스스로 보고하고(#937), 한 번도 빌드된 적 없는 이미지는 문서에서 명시적으로 TBD로 표시하며(#948), 이미지별로 실제 컴파일된 FlagTree 베이스를 표시한다(#953). 상태 매트릭스 집계 기준도 함께 고정했다(#932/#933).
  • 버전 고정 롤백과 호환 처리: 09-20에 NVIDIA cuda13.3(#940)과 MetaX의 두 MACA 백엔드(#943)를 FlagTree 0.6.1로, Enflame tops1.9.10을 0.6.0으로 다시 고정했다(#944). 이에 맞춰 고정 버전 상태에 따라 FlagTune 비용 모델을 비활성화했으며(#947), 이는 이번 주 전반부의 버전 상향 조치와 함께 완전한 한 세트의 「롤백 + 적응」을 이룬다.
  • Ascend와 릴리스 산출물: FlagTree wheel 업로드 경로가 처음으로 통과했다(flagtree-0.7.0rc2+ascend3.5와 flagtree-0.6.0+ascend3.2가 아티팩트 저장소에 도달, 빌드 소요 시간 26 / 14분). build-infra 저장소 자체의 태그는 여전히 v2.1.1에 머물러 있고, v2.2.0 태그는 모니터링 기간 내에 아직 생성되지 않았다.

3. 컴포넌트 및 코드 공동 구축

이번 주 org 내 5개 기간의 커밋 수는 98 / 119 / 150 / 147 / 206건으로, 합계 약 720건이다(09-17과 09-18 두 기간은 약 1.4시간 겹쳐 일부 중복 집계 포함). 이하 모듈별로 집계한다.

연산자 및 도메인 라이브러리(FlagGems 및 각 도메인 라이브러리)

  • FlagGems(메인라인, 이번 주 첫 번째 라인): 5개 모니터링 기간 커밋 수는 12 / 43 / 71 / 40 / 38건으로 총 약 200건입니다. 세 개의 생산 라인이 병행됩니다: KernelGen 대량 등록(일주일간 Nvidia 연산자 50개 이상 주입, 선형대수, 특수 함수, 학습 역방향, 풀링 샘플링 네 범주를 포괄하며 대표 항목으로 nanquantile, logdet, linalg_polar, GRU 및 LSTM 역방향 커널, Lanczos 업샘플링 역방향, fused_adagrad, fused_sgd 포함); KMCompiler 연산자별 보완(Ascend matrix_rank, igammac, gru, adaptive_max_pool3d, linalg_solve_triangular; Hygon과 MetaX가 linalg_lstsq 다중 백엔드 구현을 공유); Kunlunxin TLE 개조(sum / sum_dim을 tle.gpu로 이전하고 약 10건의 백엔드 수정 배치 완료: grouped_mm 대형 M 소형 K의 persistent kernel, SDPA 어텐션, mse_loss 전블록 마스크 등).
  • 양자화 메인라인: Hygon W8A8 INT8 GEMM(#6185, 긴 K 리덕션 오버플로 보호)과 TLE 활성화(#6247); Moore Threads W8A16 FP8 RMSNorm(#6210)과 네이티브 FP8 W8A8 행렬곱(#6211); MetaX W8A16 RMSNorm(#6326); FP8 topk 경로 선택(#4412). 양자화 적용 범위가 행렬곱 한 계층에서 정규화 및 인접 연산자로 확산되는 중입니다.
  • 백엔드 수정 및 확장: Hygon DCU FlashAttention 순방향/역방향 수정(#5822), 융합 rrelu 백엔드 커널(#6379); Damo Academy XuanTie PPU 백엔드 TLE 활성화(#6423); MetaX masked_fill 경계 초과 및 잘못된 구성 수정(#6480); Ascend 전용 선형 연산자(#6456), swiglu와 grouped_matmul(#6324 / #6325), Top-K(#6354); Kunlunxin FlagTree 의존성 0.6.1+xpu3.6으로 상향(#6393), tle.raw 스칼라 비교 고속 경로를 주도적으로 롤백(#6409), masked_fill / sinh / mish / hardswish / index_fill 다섯 연산자 수정(#6328).
  • 엔지니어링 품질: linalg_svd의 16×16 행업 수정(#6301), addmv 스칼라 bias의 dtype 불일치(#6149), nansum 정수형 dtype(#6351); 일곱 개 백엔드 서브패키지의 init.py 보완; 연산자 익스포트 검사, KernelGen 테스트 마커가 신규 라인만 스캔하도록, 벤치마크 pytest 마커와 연산자 등록 정합화(#6489); AMD W7900D 주간 테스트 매트릭스 진입(#6312).
  • FlagGems-Experimental(실험 필드): Hygon 17개 연산자 한 시간 내 일괄 등록(특수 함수, 선형대수, 수치 및 인덱스 클래스 포함, _scaled 수정 별도); Moore Threads cholesky_inverse, linalg_ldl_solve, ormqr 등 보완; Kunlunxin mvlgamma 보완; 09-17 MetaX index_select 수정(#419), conv_depthwise2d(#391)와 dense_dim(#639) 보완; 09-20 다시 Nvidia 소형 연산자 열 개 등록(희소 및 뷰 클래스, 실험 필드에서 메인라인으로 이관하는 전 단계).
  • FlagSparse: 병합 커밋으로 외부 협업 브랜치(NCIC-AlphaSparse)를 도입하고 39건의 커밋으로 MUSA, MACA, DCU 세 백엔드 적응을 추진(spgemm 단정밀도/배정밀도 테스트 분리, C 래퍼 계층 추가 포함, 중간에 일괄 롤백 후 재수렴 한 차례).
  • FlagFFT: 36개 FFT 연산자가 한 번에 검수 상태로 전환(+2151/-2298, NumPy 독립 검증과 런타임 계획 포함), 이후 검수 커버리지를 필수 항목으로 작성; 09-17 MUSA와 MACA 각각에 3차원 전치 검증 기록을 남기고 Triton JIT 런타임 의존성을 통일해 버전 고정; 모니터링 기간 말미에 검수 프레임워크 연속 리팩터링(파이프라인 흐름, 로그 판정, 온디맨드 재생성).
  • FlagDNN: Iluvatar CoreX와 Hygon 두 플랫폼의 구현 아키텍처를 재편성하고 텍스트 합산 연산자를 신규 추가, 네 플랫폼(PPU / Moore Threads / Ascend / Iluvatar) 테스트 범위를 수렴.
  • FlagBLAS와 FlagAudio: FlagBLAS가 Damo Academy XuanTie 백엔드의 패키징 구성을 수정; FlagAudio가 첫 세 개 PR(스펙트로그램 Triton 연산자, 게인 항등 검사와 지연 임포트, 패키징 마무리)을 병합, 모두 외부 기여자 브랜치이며 CI 업로드 경로를 추가.

컴파일러와 통신 라이브러리(FlagTree와 FlagCX)

  • FlagTree: 릴리스 엔지니어링 3건(DEB 패키징 매트릭스에 ubuntu22.04 / python3.12 추가, 릴리스 패키지를 공유 워크플로로 Nexus에 푸시하도록 변경, libtriton 및 libproton 디버그 정보 제거), 패키징 베이스라인과 wheel 버전 번호 연결; 컴파일러 측에서는 FlagTune 호스팅 Manifest와 런타임 호환 처리 추진, Iluvatar CoreX용 iluvatar3.6 베이스라인과 테스트 워크플로 구축, FlagGems 테스트 템플릿의 백엔드 초기화 인터페이스 통일, tle.signaltle.signal_wait 프런트엔드에서 동기화 범위와 메모리 순서를 명시적 매개변수로 노출(FEP-0096 분산 프리미티브 방향에 대응); 그 외에 CommonIR 변환에 Triton 3.6 연동, tle_raw의 sort 연산자 최적화, Hopper WGMMA 크로스 dtype 누산기 재사용, XPU 측 do_bench 0으로 나누기 수정.
  • FlagCX: 전달 측면에서는 libflagcx.so를 wheel에 포함, Iluvatar CoreX 빌드 키 통일, Nexus 업로드를 공유 워크플로로 전환, Fedora 43을 NVIDIA RPM 매트릭스에 추가; 인터페이스 측면에서는 lane mask를 32비트에서 64비트로 확장(칩 규모 확대를 위한 사전 준비); 도구 측면에서는 PTD 성능 로그 변환을 스트리밍 처리로 변경(대규모 부하 테스트에서 메모리 고갈 방지), KV 등가 처리량 기준 수정; 백엔드 측면에서는 Damo Academy XuanTie PPU 연동(CI와 torch 플러그인 2단계 접근), Iluvatar 디바이스 API 기본 경로 보완.

추론 및 학습 프레임워크

  • Torch-FL: 6개 플랫폼의 FlagGems-first 적용 이후 일주일 동안 그 뒤를 잇는 우회, 스위치, 게이트 마무리——명명된 우회(MetaX 슬라이스 연산자, MUSA 복소수 회전 위치 인코딩은 디바이스 측에 유지), 명시적 스위치(CI를 마지막으로 사용 가능한 FlagGems 커밋으로 고정, USE_FLAGTUNE=0, 빌드 시 가속기 설정을 wheel에 기록), 게이트 구축(PPU 탐지, 플랫폼 목록 외부화, 전 플랫폼 FlagGems master 추적); 환경 변수 측면은 FLAGOS 단일 접두사로 통합; 분리된 DCU wheel은 torch.cuda 사용 가능성 수정; 모니터링 기간 말미에는 Qwen-Image 2.1과 2512의 다중 칩 성능 곡선 확보(GCU 단일 스텝 7.1 s/it로 감소, DCU 스케줄링 오버헤드 연속 감소, 최종적으로 처리량 곡선과 테일 레이턴시 측정 제시).
  • FlagGems-vllm: Hygon과 Damo Academy XuanTie 대조 구현 moe_sum; Moore Threads MTT S5000에 persistent_topk 추가; Ascend에 SparseAttnSharedKV(DeepSeek-V4 희소 어텐션 구조, 단일 +9637, 6개 고정 형상, 정밀도를 검수 기준으로)와 persistent_topk 보완, 그리고 벤더 연산자를 통합 디렉터리로 정리; Marlin MoE(INT8 / FP8 두 가지 W8A16 가중치)와 FP8 가변 길이 FlashAttention-2 융합으로 추론 측 “가변 길이 배치와 MoE 희소 활성화” 두 가지 실제 형태 보완; 모니터링 기간 말미에는 MUSA의 fused_q_kv_rmsnorm, MetaX varlen 어텐션, Ascend kda_gate_cumsum 계속 보완.
  • FlagGems-sglang: 경진대회 성과 적용 채널 담당——09-14 하루에 10개 경진대회 브랜치 PR을 메인 저장소에 머지(bmm-chunk, decode-attention, fused-rmsnorm-warp2, task19 / task21-moe-sum-reduce 등); 이후 업스트림 테스트 도구 내장, 멀티모달 회전 위치 인코딩 융합 연산자 도입, do_bench를 벤더별 디스패치 단일 함수로 변경, moe_fused_mul_sum 경진대회 연산자 등록 및 batch3 참조, 테스트, 벤치마크, 문서 일괄 제공.
  • vllm-plugin-FL과 sglang-plugin-FL: 전자는 Hygon vLLM 0.24.0 워크플로 활성화, metax CI 연동, Enflame S60과 Kunlunxin을 0.24 라인으로 상향, Damo Academy XuanTie PPU CI 연동, Kunlunxin FlashAttention 상태 오염 수정, Iluvatar BI-V150 적응; 후자는 Hygon DCU와 Enflame GCU 각각을 위한 CI 파이프라인 구축(Hygon 라인은 AMD adaptor로 FlagCX v0.13.0 빌드), dispatch 단위 테스트와 플랫폼 설정 분리 및 프리로드에 벤치마크 추가.
  • FlagScale과 학습 커널 라인: FlagScale은 각 가속기 플랫폼에서 서로 결합된 CI 의존성을 통합 정리, fork PR 의존성 산출물 캐시 격리 수정; TransformerEngine-FL은 메인라인에서 수정 사항 체리픽; Megatron-LM-FL은 하드코딩된 CUDA 디바이스 작업을 플랫폼 인식 API로 교체(옵티마이저, 초기화, 학습 및 도구 경로 포함); FlagScale-Agent는 agent harness 강화; FlagPrism은 연산자 검수 테스트 통일, Enflame 디버거와 TOPSPTI 성능 분석 지원 추가.

릴리스 엔지니어링과 거버넌스(build-infra / community / docs)

  • build-infra: 2절의 버전 상향과 이미지 라인 외에도, 이번 주에는 FlagCX wheel 패키징 라인(빌드, 검증, 릴리스 3단계)이 새로 추가되었고, Hygon rc2.post1 듀얼 이미지 tag를 기록하고 재검증했으며, Hygon의 gflags 헤더 파일 의존성 함정을 문서로 기록했고, 이미지 tag와 버전 라벨을 쌍으로 기록하는 것이 각 백엔드가 2.2 전달 범위에 진입하는 직접적인 증거가 되었다.
  • community: 2.2 릴리스 거버넌스가 수동 대시보드에서 자동화로 이전되었다(15분마다 issue를 조직 프로젝트 뷰에 동기화, 릴리스 상태는 연관 PR에서 도출, RC 검증 규칙을 설명에 기록); 20개의 FEP와 RC2 체크리스트 유지보수는 모두 릴리스 매니저 라인에서 추진되었다.
  • docs: 문서 라인이 이번 CICD 개편에 통합되었고(new/flagcicd 브랜치와 main 병합), 온라인 랩 도움말 콘텐츠가 두 차례 업데이트되었다.

양자와 신흥 방향

  • FlagQuantum(이번 주 가장 빠르게 확장된 방향 중 하나): 09-14 하루 만에 Twin API 동결과 QPU 디지털 트윈 이력 시퀀스 관리(교정 및 검증 이력, 후보 비교, 시퀀스 복원 체인)를 완료했고; 이후 회로 토폴로지에 따라 Twin 증거를 등급화하고, JAX 프론트엔드 테스트에 접속했으며, 커버리지 하한을 계약 파일에 명시했다(60%에서 75%로 두 단계 상향), 패키지 수준 엄격 타입 검사, 양자 오류 정정 기록 계층 구현(구체적 부호화 방식과 분리); 모니터링 기간 말미에는 단일 기여자가 알고리즘 원시 패키지를 연속으로 구축하여, 양자 푸리에 변환, 위상 추정, Grover 검색, 진폭 추정에서 시작해 QUBO에서 Ising 매핑, 양자 커널 방법, 양자 PCA, k-medians 등 응용 계층 원시 요소까지 구축했다.
  • FlagTrain: 09-16 새 저장소 자리 확보(자리표시자 저장소 생성, 규모 5 KB), 훈련 측에서 또 하나의 조각이 분리되었으며, 코드 자리 확보는 지켜봐야 한다.
  • Open3D-PIMC: 09-14 오픈소스 릴리스, 09-16 코드 구현(662개 항목: 컴파일 계층 raisa-inductor의 pass 체계와 컴파일 캐시 키, C++ 런타임 rcs2, README에 메모리 계층, 샤딩 토폴로지, 동적 추론 및 컴파일 산출물 재사용이라는 네 가지 보완 필요 사항을 명시); FlagOS의 3D 컴퓨팅 칩 방향과 직접 관련되며, 2.2 검수 범위에는 포함되지 않는다.
  • flir(FlagTree IR): 업스트림 bufferization 시맨틱 정렬(tile.to_tensor의 Pure 마킹 제거), 메모리 효과 마킹 수정, triton 버전 식별 기준 통일.

4. 회원 기관 및 제조사 적응

  • Hygon: 양자화(W8A8 INT8 GEMM), TLE 활성화, fused rrelu 백엔드 커널, DCU FlashAttention 전·역방향 수정의 네 라인을 병행 추진, DCU wheel 디커플링으로 torch.cuda 및 Qwen-Image 스트림 수정, FlagSparse DCU 라인(sddmm 테스트, spgemm 정밀도 분리), vLLM 0.24.0을 위한 워크플로 활성화, 이미지 dtk26.04의 rc2.post1 재검증과 post2 재빌드 완료.
  • Ascend: MoE와 선형 어텐션에 필요한 연산자가 가장 밀집된 라인 — SparseAttnSharedKV, persistent_topk, kda_gate_cumsum, grouped_topk(TLE를 통한 DSA 원시 인터페이스), 전용 선형 연산자, swiglu와 grouped_matmul, CommonIR 개념 검증이 FEP에서 구현 완료로 표시(910B / 910C의 Triton 3.5 라인 한정), FlagTree wheel 업로드 경로 개통, 네 가지 이미지 변형(cann8.5.0 / cann9.0.0) 재빌드 완료 및 cann-shmem 보충.
  • Moore Threads: 네이티브 FP8 W8A8 행렬 곱과 W8A16 FP8 RMSNorm 두 양자화 경로 구현, MTT S5000의 persistent_topk와 MUSA 회전 위치 인코딩 디바이스 측 실행, FlagTree 0.7.0rc2+mthreads3.6으로 건너뛰기, 플러그인 포함 최초 0.20.2 이미지 완성, FlagPrism의 profiler와 debugger를 컴파일러 체인에 통합.
  • MetaX: W8A16 RMSNorm, FP8 topk 경로 선택, varlen 어텐션 최적화와 masked_fill 범위 초과 수정, vLLM용 metax CI 활성화 및 0.24 라인으로 상향, FlagSparse MACA 라인 적응, 산업 측에서 Shanghai AI Laboratory ATRIA Dawn Preview의 Day0 적응 완료(회사 기준 누적 37개 플래그십 모델), 중간 보고 흑자 전환, 09-17 해제 창구와 주가 이상 변동은 자본 시장 기록.
  • Enflame: 벤더 브랜치 대량으로 메인라인에 동기화, S60 vLLM 0.24 라인 적응, GCU CI 파이프라인, GCU300을 0.24.0 보고서에 기록, FlagPrism에 Enflame 디버거와 TOPSPTI 지원 추가, 두 tops 이미지 재빌드 완료, 자금 조달과 상장 해석 지속(09-11 STAR Market 상장).
  • Iluvatar CoreX: iluvatar 빌드 키 통합, 디바이스 제어 인터페이스 /dev/itrctl 병합, FlagTree에 iluvatar3.6 기준선과 테스트 워크플로 구축, FlagDNN 플랫폼 아키텍처 재편과 테스트 범위 수렴, vLLM 0.24 라인 적응, corex4.5.0 이미지 재빌드 완료.
  • Kunlunxin: 하루 약 열 건의 백엔드 수정 배치(grouped_mm persistent kernel, SDPA, mse_loss 등)로 최근 연산자 회귀 정리, xCCL을 기본 이미지에 탑재, sum을 tle.gpu로 이전, FlashAttention 모듈 임포트 상태 오염 수정, 안정적 이익을 얻지 못한 tle.raw 빠른 경로와 0.6.1+xpu3.6 고정 버전 자진 롤백, xpu 태그 0.7.0rc3+xpu3.6으로 반복.
  • DAMO XuanTie: PPU 백엔드가 FlagGems에서 TLE 활성화, FlagCX와 vllm-plugin-FL에서 CI 연동(torch 플러그인 포함), Torch-FL 게이트에서 명시적 탐지, moe_sum 변형 보충 및 KernelGen 연산자 이관 수용, FlagTree 2.2 멀티 백엔드 계획(FEP-0098)에 자리 확보, 양 라인 참여도 지속 심화.
  • Qingwei Intelligent: Open3D-PIMC 오픈소스 공개와 코드 반영(BAAI와 공동 개발), 분산 프리미티브 백엔드 활성화, 2.2의 TLE 분산 로드맵과 합류.
  • Horizon Robotics: 산하 D-Robotics가 4억 달러 C라운드 투자 완료, 멤버 체계에서 이번 주 가장 큰 산업 이벤트.
  • Zhiyuan(BAAI, 주도자): RC2 거버넌스와 FEP 거버넌스 이행 주도, 20개 FEP의 릴리스 경계 정의, Open3D-PIMC 공동 개발과 「하드웨어 형태 정의」 방향성 표현, 릴리스와 거버넌스 리듬 모두 그 주도로 추진.

5. 생태계와 커뮤니티

대회와 오픈 경쟁

  • SGLang 크로스칩 연산자 최적화 대회 산출물 지속적으로 메인 저장소에 반영: 09-14 하루에 10개 경쟁 브랜치 PR이 FlagGems-sglang에 병합, 모니터링 기간 후반 moe_fused_mul_sum 등 경쟁 연산자 등록 완료(#87), batch3 참조, 테스트, 벤치마크와 문서 함께 저장소에 반영. 대회는 FlagOS의 상시적 외부 연산자 공급 라인으로 자리 잡는 중.
  • FlagOS와 MiniCPM 모델 추론 처리량 성능 최적화 챌린지: 개발 및 제출 단계 2026년 9월 21일~11월 20일, 12월 초 심사, FlagOS 스택 상의 추론 처리량 최적화를 대상으로 하며 연산자 최적화 대회에 이은 커뮤니티 대회 체계의 연장.

회의와 오픈소스 릴리스

  • 2026 인공지능 오픈 컴퓨팅 콘퍼런스 겸 Zhongzhi FlagOS 기술 콘퍼런스: 10월 17일부터 18일까지 베이징 중관춘 국가자주혁신시범구 전시센터에서 개최되며, 주제는 「일체형 스택, 지능 컴퓨팅의 무한 확장」이고 09-18에 등록이 시작됩니다. 워크숍 주제(KernelGen, 엣지 디바이스, TLE Attention, FlagScale-Agent)는 이번 주 엔지니어링 관찰과 일대일로 대응합니다.
  • Open3D-PIMC 오픈소스 공개: 09-14 중국 컴퓨팅 파워 콘퍼런스에서 발표되고 09-16에 코드가 공개되었습니다. Tsingmicro와 Zhiyuan이 공동 개발했으며, FlagOS가 차세대 3D 컴퓨팅 파워 칩을 겨냥한 주요 솔루션 중 하나로 자리매김하고, 4분기에 글로벌 기술 최상위 학회에서 최적화 성과를 발표할 예정이라고 예고했습니다.

뉴스 측면과 외부 채널

  • 컴포넌트 수준 뉴스 검색 기준 열한 번째에서 열다섯 번째까지의 조용한 모니터링 기간: 주 전체의 24시간 모니터링 기간 내 유효 적중이 전무했으며, 대외 동향 사실은 GitHub org와 커뮤니티 채널(Zhiyuan 커뮤니티, Zhihu 기관 계정, CSDN 칼럼)을 기준으로 합니다. 회원사 측에서 보이는 보도는 자본 측면과 자체 스택 Day0 적응에 집중되어 있습니다.
  • 수집 경계 설명: Zhiyuan 커뮤니티 플랫폼에서 이 스택과 인터페이스가 없는 제3자 콘텐츠(예: Zidong TaiChu 모델 오픈소스 글)는 집계하지 않았습니다. 순수 시장 시세 기사와 주가 변동은 배경 기록으로만 다룹니다.

6. 트렌드 관찰

  • 2.2 릴리스물 동결과 조립 단계 진입: 전역 스위치(version 2.2.0) 적용, 전체 백엔드 이미지 일괄 재빌드, 릴리스물 검증 가능화라는 세 가지가 동시에 완료되었습니다. 테스트 기간은 단 일주일만 남았고, 잔여 리스크는 기능 결손이 아니라 「설치되고 올바르게 실행되는가」에 집중되어 있으며, Go/No-Go 판단 근거가 「사람이 체크리스트를 보는 것」에서 「상태로부터 도출 가능한 것」으로 이동하고 있습니다.
  • 디스패치 계층이 「하나의 연산자 라이브러리로 칩 간 재사용」을 실현하는 계층이 되다: 6개 플랫폼 FlagGems-first가 최초의 완전한 정량화(PPU 라인은 435개 FlagGems 라우트 대 1601개 벤더 커널 라우트로 확정)를 제시했으며, 우회 목록(PPU 47항목, MetaX 슬라이스, MUSA 복소수 회전 위치 인코딩, CUDA 측 FlagTune 부재)의 길이가 곧 칩 간 재사용률의 역지표입니다. 「라우트 + 우회 목록 + 게이트」가 재사용 가능한 메커니즘 템플릿이 되었습니다.
  • 멀티 백엔드 적응 형태 분화: 상향 이동과 되돌림이 공존: Moore Threads가 FlagTree 도약과 최초의 플러그인 포함 이미지를 확보하고 Ascend wheel 업로드가 순조롭게 진행된 것은 상향이며, NVIDIA / MetaX / Enflame이 0.6.x로 복귀하고 Kunlunxin이 tle.raw 빠른 경로로 후퇴한 것은 되돌림입니다. 후자는 「고치지 않을지언정 검증된 격자는 깨지 않는다」는 RC 규율과 같은 뿌리에서 나온 것으로, 플랫폼 적응이 안정기에 들어섰다는 신호입니다.
  • 연산자 확장의 두 축이 명확해지고, 병목이 커널 작성에서 등록과 검수로 이동: 정량화(W8A8 / W8A16 / FP8, 행렬곱에서 정규화와 샘플링으로 확대)와 MoE / 선형 어텐션(그룹 행렬곱, swiglu, 희소 공유 KV, 게이팅 Delta 규칙)은 현재 추론 모델의 실제 구조에 직접 대응합니다. KernelGen 대량 입고와 함께 따라온 내보내기 검사, 테스트 마킹, 벤치마크 정렬, 검수 프레임워크 재구성은 확장 병목이 등록과 검수로 이동했음을 보여줍니다.
  • 테스트와 품질 인프라의 플랫폼화: Damo Academy XuanTie PPU가 여러 CI에 연동되고, Iluvatar CoreX가 iluvatar3.6 베이스라인을 수립하며, FlagTree가 통합 백엔드 초기화 인터페이스를 추출하고, FlagQuantum의 커버리지 하한과 타입 검사가 강화되었습니다. 서로 다른 형태의 움직임이 가리키는 목표는 동일합니다. 모든 백엔드가 수동으로 통과시키는 것이 아니라 CI에서 지속적으로 검증되게 하는 것입니다.
  • 다음 버전의 윤곽이 문서에서 형성되고, 생태 운영 밀도가 곧 상승할 예정: RISC-V 실험적 지원, 엣지 디바이스 SDK, 운영체제 패키징, 임베디드 인텔리전스와 과학 인텔리전스 워킹 그룹이 이미 FEP 계획에 등장했고, T-Head, Enflame, Moore Threads의 신규 백엔드가 FlagTree 2.2 계획에 들어갔습니다. FlagTrain 저장소 생성, FlagAudio 실체화, Open3D-PIMC 착지로 새로운 방향이 계속 뻗어나가고 있음을 보여줍니다. 10월 콘퍼런스와 9월 하순에 개막하는 챌린지 대회로 생태 운영 밀도가 현저히 상승할 것이며, 다음 보도 정점은 09-28 릴리스 윈도우가 될 것으로 예상됩니다.

부록: 자료와 검증