TileLang 위클리 리포트 (2026-09-13 ~ 2026-09-20)
보고 기간: 2026년 9월 13일(일요일) ~ 9월 20일(일요일), 총 7일, ISO 제38주에 해당 자료 출처: 본지의 일일 TileLang 동향 데일리 리포트 4회(09-17, 09-18, 09-19, 09-20); 09-14 ~ 09-16은 아직 데일리 리포트가 없으며(본지는 09-17부터 시험 발행), 해당 기간은 GitHub 조직 수준 모니터링(tile-ai 조직 28개 저장소, 168시간)과 저장소 커밋 메타데이터로 보완하였음. 자세한 내용은 부록 참조
1. 이번 주 주요 뉴스
- 메인 저장소에서 CUDA Tile IR 실행 백엔드 개설, 단일 커밋으로 134개 파일, 약 3.6만 줄 추가 (09-18): 새 백엔드는 TileLang 프로그램을 NVIDIA의 CUDA Tile IR로 내리고 cuTile 런타임을 통해 로드하며, 기존의 “CUDA 소스 코드를 생성해 nvcc에 전달”하는 경로와 병행한다. 이 변경은 JIT, 캐시, 자동 튜닝, 문서 2편, 전용 CI 작업을 동시에 포괄하며, 실험적 브랜치가 아닌 노선급 변화이다. 모니터링 기간 말에 이 PR은 초안 상태로 전환되었고 아직 병합되지 않았다 (tilelang #3247).
- 블록 양자화 GEMM이 언어 계층 연산자로 승격, “무음 다운그레이드” 경로 제거 (09-17): 메인 저장소에
T.gemm_blockscaled와 전용 백엔드 선택기가 추가되었고, 스케일 팩터가 연산자의 일급 입력이 되었다. 이 기능이 없는 백엔드는 “조밀 GEMM으로 무음 실행, 스케일 팩터 폐기”에서 컴파일 실패로 변경되었다. 문서 사이트에는 이어서 전체 시그니처, 동작 규약, 3개의 명령어 수준 명시적 변형이 보충되었다 (#3237, 문서 커밋). - ROCm 측 GLM-5.3 희소 어텐션 k 풀이 24시간 내에 체인 형성 (09-19 ~ 09-20): 동일 작성자가 연속으로 4개의 스택 PR을 열었으며, k 풀 압축과 캐시 기록 이후의 디코딩 꼬리 유지보수, 페이지드 logits, Top-K 변환, 융합 선택을 포괄한다. 총 약 9.8천 줄, 40개 파일이며, 이미 릴리스된 모델의 구성 계약(2048 token 예산, 512 풀)에 직접 바인딩된다. KDA 디코딩 예제와 DeepSeek V3.2의 FP8 희소 MLA 예제와 함께, AMD 경로는 “새 모델 네이티브 연산자 확보”를 기준으로 추진을 조직하고 있다 (#3251, #3253, #3254, #3255).
- TileOPs 성능 3연타: 배치 행렬 곱을 공유 템플릿으로 교체, FP8 전치 커널 약점 보완, MoE 소형 라우팅이 vLLM 대비 우위 (09-17 ~ 09-19): H200에서 배치 행렬 곱을 공유 GEMM 템플릿으로 변경한 후 최대 1.44배 속도 향상, 공식 라이브러리 대비 뒤지지 않음. FP8 배치 행렬 곱의 전치 약점은 병합 메모리 접근 커널로 보완되어 5개 사용 사례에서 2.30~4.66배 속도 향상. MoE 인덱스 소형 라우팅 경로는 GLM-4.5 4096 token 구간에서 vLLM 대비 25.85% 우위, DeepSeek-V3 구간에서 16.03% 우위 (#2148, #2153, #2141).
- 메인 저장소에서 “무음 오류 전진” 거버넌스 한 라운드 완료 (09-16 ~ 09-20): 원자 벡터 폭이 목적지 주소 계획에 따라 결정되도록 변경된 후, 임베딩 역방향 등 커널이 1.4~2.5배 속도 향상. 비연속 목적지 주소에서의 원자 추가는 스칼라로 후퇴하여 일종의 무음 오기와 정렬되지 않은 충돌을 수정. 난수 3곳의 무음 결함은 독립 PR로 분리. 지원되지 않는 GEMM 유형 조합은 코드 생성 전에 차단됨 (#3238, #3219, #3242, #3245).
- Ascend는 전 주간 높은 빈도를 유지하며 “일일 회귀 전부 통과”로 마무리 (09-15 ~ 09-20): NSA 순방향과 그 가변 길이 버전이 같은 날 입고(910B3에서 19.62 및 20.34 마이크로초), 동적 양자화, RMSNorm 융합, RoPE가 연산자 면을 보충. 일일 회귀 테스트 케이스 수는 1919 → 1925 → 1936 → 1936으로 연속 4일 실패 0건, 다중 장치 테스트 샤딩도 개설. 모니터링 기간 말에 mhc_pre 예제와 다수의 연산자 문서 세분화가 추가됨 (#1699, #1700, 회귀 보고서 #1814).
- **백엔드 구도에 “배포판
」형태: Sunrise S2/TANG 0.1.14 후보 진입(09-18)**:tile-ai 조직 아래 국산 GPGPU Sunrise S2를 겨냥한 백엔드 배포판 저장소가 발견되었으며, 독립 저장소, 독립 버전 번호(0.1.14+sunrise.1.1.0)와 독립 CI를 갖추고, Ascend 적응 저장소, Hygon 특성 브랜치, Moore Threads 백포트 브랜치와 함께 네 가지 적응 조직 형태를 구성한다(tilelang-sunrise).
- 채택자 침묵 종료: FlashQLA 같은 날 세 건 병합(09-18):Qwen 측의 TileLang 기반 게이트 선형 어텐션 구현이 한 번에 세 건을 마무리——SM120/SM121 역방향 융합 커널, SM100 KKT 해석 점유율, 가변 길이 테일 블록 비동기 파이프라인; 엔지니어링 중심이 신규 아키텍처 적응에서 점유율과 경계 정확성으로 전환(#34).
2. 핵심 프로젝트 진행
버전 및 릴리스
- 메인 저장소 최신 태그는 여전히
v0.1.14(09-02 릴리스)이며, 모니터링 기간 내 신규 태그 없음, 주기 말까지 18일간 미릴리스; 병합 리듬은 수렴하는 반면 리뷰 큐는 계속 누적되어 이번 주기의 가장 뚜렷한 리듬 특성. - 적응 저장소 태그는 모니터링 기간 내 모두 미갱신: Ascend
TileLang-ascend v0.1.2.000-release(09-09), Moore Threadsv0.1.14+musa.1(09-11), Sunrise 후보 브랜치0.1.14+sunrise.1.1.0; TileOPs는 아직 릴리스 기록이 없으며, 대외 상태는 문서 사이트와 야간 스냅샷이 담당.
언어 계층: 연산자 시맨틱 및 API
- 블록 양자화 GEMM(#3237, 09-17 병합):신규
GemmBlockScaledNode와 언어 측T.gemm_blockscaled추가, 디스패치는cuda.tcgen05.blockscaled(SM100 라인)와cuda.mma.blockscaled(SM120 라인) 두 구현으로 진행; SM100 단일 CTA가 SM120 명령 경로에 적중할 수 있는 문제, 그리고 미지원 백엔드가 묵묵히 밀집 GEMM으로 실행되는 두 가지 묵묵한 오류 가능성 수정(PR). - 복사 너비 클램핑(#3246, 09-18 신규 오픈):
T.copy와T.async_copy의 병합 너비 상한을 실제 도달 가능한 벡터 너비로 클램핑하도록 변경, 이전의 치명적 로그를 대체——「능력 제약」은 강등되어 계속되고、「사용자 시맨틱 오류」는 여전히 실패, 실패와 강등의 판단 기준이 명확히 기록됨. - 256비트 전역 메모리 접근 SM100 및 최신 아키텍처로 한정(#3248, 09-19 병합):SM100 및 최신 아키텍처, 그리고 CUDA 12.9 이상에서만 256비트 load/store 발행, 구형 아키텍처는 128비트 경로로 후퇴, pre-SM100 부정 테스트 보충.
- 비연속 목적 주소에서 원자적 추가가 스칼라 유지(#3219, 09-16 병합):신규
CanVectorizeAtomicTarget사전 판정 추가,address_of,tl.access_ptr,tvm_access_ptr세 가지 목적 주소 형태를 커버; 「모든 레인이 같은 셀에 쓰기」가 넓은 원자적 추가로 컴파일되어 묵묵히 손상되는 문제와 홀수 기저 주소 미정렬 충돌 수정. - 난수 삼중 결함 분할 수정(#3242 / #3243 / #3244, 09-17 신규 오픈, 미병합):기본 난수 시퀀스가 x 차원만으로 추론되어 2D 스레드 블록에서 데이터 중복, void 결과 바인딩, 초기화 누락이 오류를 보고하지 않음——세 곳 모두 「타입상 컴파일 가능, 시맨틱상 오류」인 묵묵한 문제.
모델 연산자 및 예제
- GLM-5.3 희소 어텐션 k 풀 체인(#3250 ~ #3255, 09-19 ~ 09-20, 미병합):네 건의 누적 PR이 총 약 9.8천 행, 40개 파일에 달하며, k 풀 압축과 캐시 쓰기, 디코딩 테일 유지, 페이지드 logits, Top-K 변환, 융합 선택 다섯 단계를 커버; 검증은 exact-head CI 기준(ROCm 7.2 / gfx942, #3251 2423건 통과 보고, #3255 2435건 통과 보고).
- KDA 디코딩 예제(#3249, 09-19 신규 오픈):안전 게이팅이 포함된 게이트 선형 어텐션 디코딩 상태 예제, 출력과 상태 일관성, 다단계, 빈 상태 인덱스, 비순차 슬롯 등 정확성 커버 포함.
- DeepSeek V3.2 FP8 희소 MLA 전방 예제(#3224, 09-16 병합):Hopper를 겨냥한 모델 커버리지 계열 기여, 모니터링 기간 전반부(데일리 리포트 창간 전)의 병합에 해당.
컴파일러 및 백엔드 경로
- 기호화 루프 레이아웃 단사성 증명 복원(#3233, 09-18 병합): v0.1.12와 메인라인 사이의 회귀를 수정 —
T.Parallel반복 공간이 정적과 동적 혼합(예:(16, n))일 때, 패딩 테일을 가진 레이아웃은 단사이지만 전사가 아니며, 메인라인은 이전에 곧바로 “사용 가능한 레이아웃을 찾을 수 없음”을 보고했음; 수정은 검사 대상 반복 매핑에서 역매핑을 구성하고 정의역에서 왕복 동등성을 증명함(관련 결함 단일 #2906). - CUDA Tile IR 실행 백엔드(#3247, 09-18 신규 오픈, 이후 초안으로 전환): 대상 툴체인은 CUDA Tile IR 13.4 바인딩, tileiras 13.4, cuTile 1.5; 타입 지정 IR, 하강 및 pass 핵심은
tilelang/tileir에 위치하며 JIT, 캐시, 자동 튜닝에 연결됨; 함께 pass 구성 항목이 추가되어 구체화 전(캐시에서 복원된 경로 포함)에도 소스 언어 의미 검사를 실행함. - ROCm CI에 이식 가능 예제 검증 연결(#3165, 09-19 병합): 화이트리스트는 Seer 어텐션, 범용 Top-K, 희소 MLA 포워드, 텐서 그룹화 행렬 곱 네 가지를 포함하며, 예제 자체가 회귀 자산이 됨 — AMD 경로가 수렴기에 진입했다는 방증.
- Metal 라인 보강: 32비트 정수 원자적 덧셈 지원(#3211, 09-19 병합, 경쟁 히스토그램 검증 포함), GEMM 버퍼 영역 오프셋 수정(#3209, 09-14 병합); “런타임 가변 GEMM 행 수”(#3215)는 9일간 리뷰 후 병합되지 않고 종료됨(09-20).
- 기타 수정: 불리언 비트 반전 코드 생성 수정(#3228, 09-16), 제약 집합 병합 시 선바인딩 후사용 순서 복원(#3221, 09-14), CPU 테스트에 CPU dialect 도입(#3236, 09-16).
런타임, 툴체인 및 테스트
- JIT에 uint64 매개변수 타입 매핑 추가(#3229, 09-17 병합), Cython과 NVRTC 두 호스트 래퍼 정렬.
- 런타임 라이브러리 로딩 수정(#3227, 09-15 병합): 심볼릭 링크 설치 형태에서의 라이브러리 로딩 문제.
- 프로파일러의 타이밍 헬퍼 분리 및 월클록 기준 추가(#3234, 09-16 병합).
- 테스트 자산 품질 향상(#3252, 09-20 병합, +20/-509): CPU와 LLVM 양쪽의 중복 코드 생성 스모크 테스트와 독립 고속 수학 테스트 모듈 삭제; “고속 수학 출력을 자기 자신과 비교”하는 가짜 단언 수정,
exp10,log2,log10,cos,sin,tan에 실제 참조 구현 추가.
성능
- 원자 벡터 폭을 목적 주소 기준으로 계획(#3238, 09-16 병합): 동적 형상이 이전에 int64 레인 오프셋을 도입할 때 전체 루프가 스칼라화되었음; 수정 후 임베딩 역방향 N=8192/H=4096/V=129280이 97.90마이크로초에서 56.01마이크로초로, N=196608/H=256/V=3000000이 146.87에서 82.70마이크로초로, 시퀀스 보조 카운트와 합계가 18.40에서 12.17마이크로초로 감소, 회귀 벤치마크
example_gqa_bwd_tma_reduce_varlen약 27% 상대 향상. 영향을 받은 임베딩 역방향과 가변 길이 어텐션 역방향은 대형 어휘 추론의 상주 커널임. - 연산자 라이브러리 측 성능(BMM / FP8 / MoE)은 4절 참조.
리뷰 큐 관찰
- ROCm 모델 연산자가 스택형 체인으로 진행(#3249 ~ #3255), 자체 설명 “각자의 병합까지 선행 커밋을 포함”하며 연쇄 리뷰가 필요하고, 어느 하나라도 막히면 전체 체인이 지연됨.
- 난수 세 결함(#3242 / #3243 / #3244)과 GEMM 타입 조합 차단(#3245)은 기간 내 지속 업데이트되었으나 아직 병합되지 않음; Tile IR 백엔드(#3247)는 초안으로 전환되어 정지.
- 병합과 큐의 격차: 메인 저장소 기본 브랜치 기간 내 16개 커밋, 후반부는 보충과 마무리 위주이며, 실질적 증분은 리뷰 큐에 집중됨.
3. 다중 백엔드 적응
Ascend
- 연산자 면: NSA 포워드(#1699)와 가변 길이 버전(#1700)이 같은 날 입고 — 골든 구성 19.62마이크로초, 27개 계층화 테스트 전부 통과, 가변 길이 버전은 910B3에서 20.34마이크로초, 21개 전부 통과; 동적 양자화(#1688, 정밀도 전부 통과, 평균 가속비 0.78배, 성능은 여전히 업체 기준선에 뒤처짐), RMSNorm 동적 양자화 융합(#1673), RoPE(#1580), CrossEntropy 브로드캐스트 최적화와 FP32 전용 경로(09-15), causal_conv1d_decode 디코드 분할 AIV 쌍(09-15).
- 품질과 회귀: 일일 회귀 케이스 수 1919 → 1925 → 1936 → 1936 연속 전부 통과; 비교 연산자 문서에 dtype 커버리지 보충(#1602), 벤치마크 스크립트 버퍼 토큰 수명 주기 수정(#1779); 다중 디바이스 테스트 샤딩 CI(#1812) 신규 오픈.
- 기간 말(09-20 오후): mhc_pre 예제 추가(#1621); 일괄
T.tile연산자 문서 세분화(sort / topk / transpose / max / min / add / sub / mul / div / select); 행 슬라이스 GM에서 UB 복사 stride 수정; block_sparse_mqa_attn 비동기 읽기/쓰기 타임아웃 수정. - 판독: Ascend는 “매일 가시적” 엔지니어링 리듬을 유지하는 유일한 백엔드이며, “능력 확장 후 품질과 유지보수성으로 전환” 단계에 진입함.
MetaX
- MACA 비동기 복사 GEMM(#156)과 테스트 수정(#157)이 09-17에 병합된 후 버전 및 테스트 유지보수로 전환되었고, 모니터링 기간 후반에는 새로운 커밋이 없어 네 곳 중 변동 폭이 가장 작았다.
하이공(Hygon)
- 다단계 스토리지(MLS) 주소 재기반화와 비동기 파이프라인 인수가 정식으로 메인 브랜치에 병합되었으며(#10, 19개 파일, +540/-31), v0.1.12 버전 브랜치로 백포트되었다(3D 슬라이스 스코프 레이아웃 수정도 함께 포함). 개발 브랜치에는 파이프라인 관리 마무리 커밋도 별도로 있다. 백엔드 코드 변경 폭은 네 곳 중 가장 크다.
무어 스레드(MUSA)
- 모니터링 기간 내 푸시는
v0.1.12+musa.1백포트 브랜치에 집중되었으며(MUSA 5.3.0 문서), 메인 브랜치는 09-11부터 정지 상태로 더 늦은 버전 라인을 아직 따라가지 못했다.
기타(Sunrise / tilelang-mlir-ascend)
- Sunrise(S2 / TANG): 백엔드 배포판 저장소에 모니터링 기간 내 푸시가 있었고, 후보 브랜치 버전은
0.1.14+sunrise.1.1.0이다. S2는 대규모 모델 추론을 위한 중국산 GPGPU이며, 예제 범위는 메인 저장소와 동형이다(행렬 곱, FlashAttention, 희소 어텐션 등). - tilelang-mlir-ascend: 모니터링 기간 내 7건의 커밋——CI를 Ascend A3 디바이스 runner로 전환(#176), 적응형 LayerNorm 커널(#183), 벤치마크 수정(#184), TileOPs 다중 헤드 어텐션 연산자 연동(#185), 연산자 리포트와 Mamba 연산자 최적화, 에이전트별 모델 선택(#187 / #188, 09-20).
4. 생태계와 채택자
TileOPs(연산자 라이브러리)
- 규모: 모니터링 기간 내 23건 병합. 야간 파이프라인의 세 스냅샷이 연속 온라인 상태였고, 벤치마크 1040개 항목과 정확성 1118개 항목이 09-18부터 연속 무실패를 기록했다.
- 성능: BMM 공유 템플릿 최대 1.44배(
torch-cublas대비 모두 뒤지지 않음). FP8 BMM 전치 커널 2.30~4.66배(MoE 프리필 0.8741→0.1874밀리초). MoE 인덱스 소형 라우팅이 vLLM을 앞섬(GLM-4.5 25.85%, DeepSeek-V3 16.03%, Kimi K2 8.65%). 그 외 모니터링 기간 전반부의 FP8 밀집 디코딩(#2132), GQA 디코딩 병렬도(#2136), W4A16 역양자화 크로스 채널 공유(#2139), GemmTemplate의 밀집 coop1/coop2로의 확장(#2126) 등도 병합되었다. - 계약과 구조: 매니페스트가 복합 연산자, 리소스, 널러블 출력을 지원(#2147). 디스패치와 튜닝이 분리(#2152). GEMM 커널이 서비스 영역별로 재명명되고 GEMV 두 밴드가 병합(#2156,
kernel_map구 키는 조용한 폴백에서 생성 시점 오류로 변경). 페이지드 KV 헬퍼가 그룹 쿼리 어텐션 모듈에서 분리(#2150). SM90 형상 보완(#2151). 희소 MLA 게더 경계 초과 문제 정리(#2149). 통합 Gated DeltaNet 연산자(#2135)와 밀집 GDN 프리필 이관(#2144). - 메트릭 거버넌스: 라우팅 전문가 과금 공식 수정——야간에 보고된 8행 대역폭 이상치(최대 132.4 TB/s, H200 물리 상한의 약 27배)가 「전체 전문가 기준 과금」에서 비롯된 것으로 확인(#2155). 바이트 감사는 읽기 측만 보도록 변경(#1996). 성능 이력 윈도우를 스냅샷 브랜치로 이전(#2154). 세 건이 같은 날 반영되어, 먼저 판정을 신뢰할 수 있게 하고 그다음에 빠르고 느림을 논하게 되었다.
- 신규 오픈: 그룹 GEMM 테일 블록 분할과 호출자의 패딩 행 레이아웃 선언 허용(#2157)으로 CUTLASS 그룹 커널을 정면으로 추격(이전에는 6.4% 차이).
채택자와 관련 저장소
- FlashQLA(Qwen): 세 건 병합(SM120/SM121 역방향 융합 커널, SM100 KKT 해석 점유율, 가변 길이 테일 블록 비동기 파이프라인), 이후 모니터링 기간 내 푸시 없음. 앞서 며칠간 정적이었던 것으로 보아 펄스형 리뷰 리듬에 해당한다.
- TileKernels(DeepSeek): 모니터링 기간 내 푸시 없음(최근 04-23). 미디어 측의 DeepSeek 엔지니어가 AI로 커널을 작성하는 것에 대한 평가 보도(09-16/17)가 TileKernels를 배경으로 삼았다(순수하게 TileLang으로 작성된 커널 라이브러리로, 게이팅, 혼합 전문가 라우팅, 양자화, 전치, 두 종류의 연결 연산자를 포괄).
- TileRT: 7주 연속 정지(최근 08-13)로, 현재 목록에서 가장 오래 조용한 항목이다.
- TileFoundry / DeepStack: 각각 두 건(파서와 코드 정리, 09-14/15)과 한 건(수정과 예제, 09-15)의 커밋이 있었다.
5. 커뮤니티, 튜토리얼 및 활동
- 문서 사이트: 메인 저장소 문서 사이트 봇 재생성(387개 파일, 09-17), 블록 양자화 GEMM의 전체 시그니처, 동작 규약 및 세 가지 명령어 수준 명시적 변형이 공개 API 페이지에 진입; TileOPs 문서 사이트는 두 차례 사이트 배포(내용 미변경)되었으며 통합 디스패치 및 컴파일 경계 업데이트를 따라갔음(중영문 두 세트 문서).
- 커뮤니티 도구: 서드파티 TileSight 성능 분석 문서 저장소 공개(09-17/18), TileLang 성능 분석을 TileSight의 캐시 및 파이프라인 분석 인터페이스에 연결, 성능 문제를 여섯 가지로 분류하고 「모델 예측 / 런타임 관측 / 증거 부족」 세 가지 결론 강도를 구분하도록 요구; 대응되는 arXiv 성능 모델 논문(07-24, 모니터링 기간 외 배경).
- 미디어: NeoTeo가 DeepSeek 엔지니어의 공개 판단을 보도——6~12개월 내 AI가 작성한 커널이 자신의 개인 수준에 도달하거나 초과할 수 있음(09-16/17); 화웨이 전커넥트 콘퍼런스 2026(09-17)에서 Ascend 960 조기 출시와 Atlas 960 슈퍼노드 로드맵을 발표, Ascend 적응 리듬의 산업 배경을 구성.
- 학술 및 커뮤니티: 모니터링 기간 내 arXiv와 Hacker News 모두 주제 신규 히트 없음; 가장 최근 주제 프리프린트는 07-24의 성능 모델링 논문.
- 버전 리듬: 메인 저장소 v0.1.14가 18일째 업데이트되지 않았고, 각 적응 저장소 태그도 움직이지 않음(제2절 참조).
6. 트렌드 관찰
- NVIDIA 측에 두 번째 실행 경로 등장: Tile IR 백엔드가 현행 CUDA 코드 생성 경로와 병행하며, TileLang의 추상화 계층이 NVIDIA 자체 타일 수준 추상화와 정면으로 접경하기 시작. 성숙하면 그 가치 제안은 부분적으로 「더 나은 코드 생성」에서 「더 완전한 프로그램 표현과 크로스 백엔드 일관성」으로 이동할 것이며, 스케줄링과 레이아웃 결정의 귀속이 장기 의제가 될 것.
- 「조용한 오류를 컴파일 시점 실패로 전진」이 프로젝트급 규율이 되었고, 판별 기준이 명확히 작성됨: 메인 저장소(원자 벡터화, 난수, GEMM 타입, 레이아웃 증명)와 TileOPs(잘못된 키 전달 시 오류, 디스패치와 튜닝 분리)가 동형; 메인 저장소는 동시에 「능력 제약」과 「사용자 의미 오류」 두 가지 실패를 구분——전자는 다운그레이드 후 계속(복사 폭 클램핑), 후자는 컴파일 실패.
- 백엔드 적응이 「새 모델 네이티브 연산자」와 깊이 결합: ROCm의 GLM-5.3 k 풀 체인과 KDA, Ascend의 NSA와 DeepSeek 계열 구조, 메인 저장소 Hopper 상의 DeepSeek V3.2 FP8 희소 MLA——모델 출시 후 그 특유 연산자가 특정 백엔드에 자리잡는 속도가 해당 백엔드 성숙도를 측정하는 직접적 지표가 되고 있음.
- TileOPs가 「계약, 재현 가능한 대조를 갖춘 연산자 계층」으로 진화: 성능, 계약, 측정 거버넌스 세 축 병행; 야간 스냅샷이 커밋 번호, 이미지 다이제스트, 클럭 및 전력 상한 등 재현 가능 요소를 완전하게 고정, 검수 기준이 프로덕션 사용 가능을 향해 수렴.
- 국산 백엔드 리듬 분화, 형태 다양화: Ascend는 일일 회귀 유지(유일하게 매일 가시), Hygon은 병합 가속 및 수렴, MetaX와 Moore Threads는 유지보수로 전환, Sunrise는 「백엔드 배포판」 형태로 후보 진입; 업스트림 최신 능력 위치까지 따라잡는 정도에서 각사가 이미 격차를 벌렸음.
- 리스크와 공백: 메인 저장소 릴리스 정체 18일과 리뷰 큐 적체(Tile IR 초안 전환, GLM-5.3 스택 체인 미병합, 9일간 운영된 Metal 제안 종료)가 병존; 성능 데이터는 모두 작성자 또는 제조사 자술이며 본지는 해당 하드웨어가 없어 독립 재현을 하지 않았음; 채택 측은 전반적으로 여전히 조용(FlashQLA 펄스 제외).
부록: 자료 및 검증 설명
- 자료: 본지 일일 TileLang 동향 데일리 리포트 4회(09-17, 09-18, 09-19, 09-20). 09-14~09-16은 데일리 리포트 없음(본지 09-17 창간), 해당 구간은 GitHub 조직 수준 모니터링 기간 검증과 커밋 메타데이터로 보완; 09-17 첫 회는 시범 운영(당일 저녁 실행)으로 09-18 회와 약 반나절 중복되며, 중복 부분은 09-18 회에서 상태 설명만 함.
- 추가 검증(168시간 모니터링 기간, 09-13 16:00 ~ 09-20 16:00): tile-ai 조직 28개 저장소 푸시 전수 검증——모니터링 기간 내 14개 저장소에 푸시 있음; 기본 브랜치 커밋 수: 메인 저장소 tilelang 16건, TileOPs 23건, Ascend 적응 저장소 19건(
ascendc_pto브랜치), tilelang-mlir-ascend 7건; 릴리스 상태는 저장소 릴리스 인터페이스로 재확인, 메인 저장소와 각 적응 저장소 모두 모니터링 기간 내 신규 버전 없음.
출처 검증표
| 출처 | 검증 결과 |
|---|---|
| tile-ai 조직 (28개 저장소) | 모니터링 기간 내 14개 저장소에 푸시 발생 |
| 메인 저장소 tilelang | 기본 브랜치 16개 커밋; 신규 PR은 Tile IR, ROCm 모델 연산자 체인, 난수 및 타입 차단 등 그룹을 포괄하며 대부분 미병합 |
| TileOPs | 23건 병합; 야간 스냅샷 벤치마크 1040건, 정확성 1118건 연속 무실패 |
| tilelang-ascend | ascendc_pto 브랜치 19개 커밋; 일일 회귀 4일 연속 전부 통과; 신규 태그 없음 |
| tilelang-mlir-ascend | 모니터링 기간 내 7개 커밋 |
| MetaX / Hygon / Moore Threads / Sunrise | 각 사 최근 푸시는 09-17 ~ 09-18; 모니터링 기간 후반부에는 모두 신규 커밋 없음 |
| 도입처 (FlashQLA / TileKernels) | FlashQLA 09-18 3건 병합; TileKernels 푸시 없음 |
| TileRT / 조직 기타 저장소 | TileRT 7주 연속 정지; TileFoundry와 DeepStack은 각각 1~2건 |
| 뉴스 및 학술 채널 | 뉴스 검색, 기술 커뮤니티 및 프리프린트 채널 모두 모니터링 기간 내 주제 신규 항목 없음; 유일한 미디어 항목은 DeepSeek 엔지니어 보도 |
| 버전 및 릴리스 | 메인 저장소 v0.1.14 (09-02) 이후 18일간 릴리스 없음; 각 어댑테이션 저장소 태그 변동 없음 |
- 검증 경계: Ascend와 MetaX의 실측 데이터는 커밋 설명과 PR 본문 자기 기술에 기반하며, 본지는 해당 하드웨어가 없어 독립적 재현을 수행하지 않았습니다; 산업 측 동향은 공개 보도에 기반합니다; 야간 벤치마크 수치는 모두 단일 파이프라인 기록이며 횡적 평가가 아닙니다.
- 다음 호 주기 제안: 2026-09-20 ~ 2026-09-27.