모니터링 기간: 지난 24시간(2026-09-19 07:00 ~ 2026-09-20 07:00, 베이징 시간). 이번 회차는 정기 데일리 업데이트 기간이며, 이전 회차와 중복되지 않습니다. 출처: GitHub(tile-ai 조직 28개 저장소 푸시 시간 전수 점검, 기간 내 3개 저장소에 푸시 발생; 메인 저장소 3건 머지 및 5개 신규 PR 개별 재검토, PR 본문, 변경 파일 수와 추가/삭제 라인 포함; TileOPs 5건 머지 및 1개 신규 PR; GLM-5.3 페이지드 k 풀 시리즈 4개 PR의 의존성 체인, 모델 계약과 검증 기록; TileOPs-nightly 스냅샷의 벤치마크와 정확성 결과 파일 전수 파싱 및 환경 메타데이터; Ascend 데일리 회귀 리포트; 각 적응 저장소와 채택자 저장소 푸시 점검), Google News RSS 중영문 다중 쿼리(프록시 경유), Hacker News, arXiv


이번 회차 인덱스

  • 오늘의 중점: ROCm 측 GLM-5.3 희소 어텐션 k 풀 전체 경로가 24시간 내에 체인 완성, 4건 합계 약 9.8천 라인 추가(09-19/09-20)
    1. 핵심 프로젝트 진행
      • 1.1 메인 저장소: Metal 백엔드에 32비트 정수 원자적 덧셈 추가, 카운터형 이식 가능 커널이 코드 생성에서 더 이상 막히지 않음(09-19)
      • 1.2 메인 저장소: 256비트 전역 메모리 접근을 SM100 및 이후 아키텍처로 제한, 구 아키텍처는 128비트로 회귀(09-19)
      • 1.3 메인 저장소: 테스트 스위트 한 번에 509라인 감량, 빠른 수학 단언을 실제 참조 구현으로 전환(09-20)
      • 1.4 메인 저장소 리뷰 큐: 데이터 타입 차단 PR 업데이트 있음, Metal 라인 수 PR은 머지 없이 닫힘, Tile IR 백엔드는 초안 상태이며 업데이트 없음(09-19/09-20)
      • 1.5 TileOPs: FP8 배치 행렬 곱 전치 커널 머지, H200에서 최대 4.66배 속도 향상(09-19)
      • 1.6 TileOPs: GEMM 커널을 서비스 영역 기준으로 이름 변경하고 GEMV 두 밴드 병합(09-19)
      • 1.7 TileOPs 신규 오픈: 그룹 GEMM 테일 블록 타일링, CUTLASS 그룹 커널을 정면 추격(09-19)
    1. 멀티 백엔드 적응(Ascend / Sunrise / MetaX / Hygon / Moore Threads)
      • 2.1 Ascend: 데일리 회귀 1936항목 전부 통과, 이틀 연속(09-20)
      • 2.2 MetaX, Hygon, Moore Threads, Sunrise: 기간 내 신규 커밋 없음(09-17/09-18)
    1. 생태계와 채택자
      • 3.1 야간 스냅샷: 벤치마크 1040항목과 정확성 1118항목 무실패(09-19)
      • 3.2 벤치마크 신뢰도 거버넌스: 8행 대역폭 이상과 같은 날 3건 수정(09-19/09-20)
      • 3.3 채택자: TileKernels와 FlashQLA 기간 내 푸시 없음(09-18)
      • 3.4 마이그레이션 라인: Dense Gated DeltaNet 프리필 마이그레이션 PR 업데이트(09-19)
    1. 커뮤니티, 튜토리얼과 이벤트
      • 4.1 문서 사이트: TileOPs 문서 사이트 1회 사이트 배포, 사이트 내용은 변경 없음(09-19)
      • 4.2 미디어와 학술 측: 기간 내 신규 없음(09-20)
      • 4.3 버전 리듬: 메인 저장소는 여전히 v0.1.14, 각 적응 저장소 태그는 변동 없음(09-02)
    1. 트렌드 관찰
      • 5.1 ROCm 라인: 「백엔드 사용 가능」에서 「신규 모델 네이티브 연산자 체인 완성」으로
      • 5.2 TileOPs가 하루를 측정 체계에 투자: 먼저 판정을 신뢰할 수 있게 만든 후, 빠르고 느림을 논하다
      • 5.3 메인 저장소 이번 기간의 3건 머지는 전부 보충형, 증분은 리뷰 큐에 있음
      • 5.4 백엔드 매트릭스의 침묵 면 확대: Ascend만 데일리 회귀 유지
      • 5.5 공백과 리스크 포인트
  • 부록: 자료와 점검 설명

오늘의 중점: ROCm 측 GLM-5.3 희소 어텐션 k 풀 전체 경로가 24시간 내에 체인 완성

날짜: 2026-09-19 ~ 2026-09-20 출처: tilelang #3251 GLM-5.3 k 풀 디코드 테일 유지보수#3253 페이지드 k 풀 logits#3254 k 풀 Top-K 변환#3255 페이지드 k 풀 융합 선택

이전 기간(09-18 저녁) ROCm 방향에서 #3250을 열어 GLM-5.3을 위한 k 풀 압축과 캐시 쓰기를 진행했으며, 이번 기간 같은 작성자가 같은 날 네 건을 연달아 열어 이 경로를 디코드 테일 유지보수부터 융합 선택까지 보충했고, 네 건 합계 약 9767라인 추가, 40개 파일 변경(개별 7, 9, 11, 13개 파일)입니다. 네 건 모두 스택 의존성(stacked)으로 표기되었으며, 그중 #3255는 「#3250부터 #3254까지의 커밋을 포함하며, 각각 머지될 때까지 유지」라고 자술했습니다 — 작성자는 하나의 완전한 전달 체인으로 리뷰를 구성한 것입니다. 기간 종료 시점까지 네 건 모두 머지되지 않았습니다.

이 체인은 이미 릴리스된 구성의 GLM-5.3-Flash를 대상으로 서비스합니다: index_kpool=4, index_topk=2048, index_head_dim=128, index_n_heads=32. 이 계약에 따라, 장행 경로는 512개의 4토큰 풀을 선택하고, 이를 2048개의 히스토리 토큰으로 전개한 뒤, 3개 토큰 미만의 꼬리를 보충합니다. 이것이 캐시 측에서 희소 어텐션 예산이 구체화된 형태입니다.

네 개의 PR 각각의 역할 분담:

  • #3251 (09-19 08:31 생성): 디코딩 꼬리 유지. 프리필 커널이 각 요청에 대해 롤링 BF16 꼬리를 시딩하고, 순서대로 배치 디코딩(일반 및 추측 디코딩 두 경로)하며, 풀은 마감 토큰이 도착할 때 압축하여 다시 씁니다. 꼬리 소속, 위치 순서, 패딩, 캐시 쓰기 유일성을 검증합니다.
  • #3253 (09-19 13:10 생성): 페이지드 logits. 압축된 k 풀 캐시에서 페이지드 FP8 MQA 스코어링을 수행합니다: 풀별로 스케일 적용, 쿼리 헤드별 ReLU, 호출자가 제공한 FP32 헤드 가중치로 리듀스; 요청별 풀 구간과 페이지 테이블 행 소속을 지원하며, 시작 전에 불법 형상, 타입, 구간, 페이지 행을 거부합니다.
  • #3254 (09-19 14:06 생성): Top-K 변환. ROCm 측 안전한 tl_topk 선택기를 재사용하여, 2048 토큰 예산에 따라 512개 풀을 선택하고 논리 토큰 인덱스로 전개합니다; 단행은 직접 열거, 장행은 기수 선택을 사용; 항등, 직접 토큰 테이블, 불규칙 오프셋 세 가지 출력 매핑을 지원합니다.
  • #3255 (09-20 00:21 생성): 융합 선택. 한 번의 시작으로 스코어링, 기수 선택, 토큰 인덱스 변환을 완료합니다; 생산 형태의 인터리브된 uint8 캐시 레이아웃(FP8 키 뒤에 FP32 스케일)을 직접 소비하며, 첫 번째 기수 히스토그램을 스코어링 단계에 접어 넣습니다; 그래프 재생의 안정성을 위해 호출자 소유의 FP32 임시 저장소와 INT32 출력 버퍼를 제공합니다.

검증은 exact-head CI를 기준으로 합니다: ROCm 7.2 gfx942에서, #3251은 2423개 통과, 1852개 스킵을 보고했으며, 6개의 디코딩 꼬리 집중 테스트 케이스가 모두 통과했습니다; #3255는 2435개 통과, 1816개 스킵을 보고했으며, 6개의 융합 선택기 테스트 케이스가 모두 통과했습니다. 테스트 범위는 장행과 단행, 릴리스된 2048 구조, 제로 히스토리, 4096개를 초과하는 등분 시나리오를 커버합니다.

판독: #3249 (KDA 디코딩 예제), #3250과 이 모니터링 기간의 네 개를 연결해 보면, AMD 측 진전은 “백엔드를 돌아가게 만들기”에서 “새 모델의 네이티브 연산자도 여기에 있어야 한다”로 전환되었으며, PR을 쌓아 올리는 조직 방식을 채택하여 전체 희소 어텐션 경로를 하나의 납품물로 추진하고 있습니다.


1. 핵심 프로젝트 진행 상황

모니터링 기간 개요: 메인 저장소 기본 브랜치에 3건 머지, 모두 보충형(능력 보충, 적용 범위 수정, 테스트 중복 감소); 리뷰 큐에 5개 PR 신규 오픈, 그중 4개가 오늘 중점인 ROCm 시리즈에 속합니다. TileOPs는 이틀 연속 하루 5건 머지했으며, 성능 PR 1개를 새로 열었습니다; 야간 벤치마크는 모니터링 기간 내에 스냅샷이 나왔습니다.

1.1 메인 저장소: Metal 백엔드에 32비트 정수 원자적 덧셈 추가 (09-19)

날짜: 2026-09-19 출처: tilelang #3211 Metal 32비트 정수 원자적 덧셈 지원

09-19 20:55 머지, 작성자 anerli, 2개 파일, +77/-0; 이 PR은 09-12에 리뷰에 들어가 모니터링 기간 내에 확정되었습니다.

수정한 것은 구체적인 능력 공백입니다: Metal은 스칼라 int32uint32T.atomic_add(이전 값 반환 형태 포함)를 내릴 수 없어, 정수 카운터나 슬롯 할당에 의존하는 이식 가능 커널이 코드 생성 단계에서 바로 실패합니다. 이 변경은 이러한 호출을 Metal의 atomic_fetch_add_explicit로 내립니다: 원자 포인터 변환에서 device와 threadgroup 주소 공간의 차이를 유지하고, relaxed 순서(이 연산의 기존 리듀스 의미와 일치)를 채택하며, 지원하지 않는 너비, 타입, 저장 영역을 명시적으로 거부하고, 소스 내리기와 Metal 실행 회귀(스레드 그룹 원자와 이전 값 반환 두 형태 커버)를 보충합니다.

검증에서 작성자는 Apple Metal에서 경쟁이 있는 스레드 그룹 히스토그램을 실행하여 최종 카운트와 반환된 이전 위치 집합을 확인했습니다; 로컬 Metal 스위트 20개 통과, 3개 스킵, 2개의 새 원자 테스트 통과.

판독: 원자적 덧셈은 카운터, 슬롯 할당, 히스토그램 같은 기본 패턴의 선행 능력이며, 이 건은 Metal 측 기본 원시 요소를 한 칸 보충합니다 — 계속 유지 관리하는 Metal 전용 테스트 면과 함께, Metal은 “이식 가능 커널의 두 번째 시금석”으로서 부족한 부분을 지속적으로 보완하고 있습니다.

1.2 메인 저장소: 256비트 전역 메모리 접근을 SM100 및 이후 아키텍처로 제한 (09-19)

날짜: 2026-09-19 출처: tilelang #3248 256비트 전역 메모리 접근을 SM100 및 이후 아키텍처로 제한

09-19 13:15 머지, 작성자 penguin-wwy, 3개 파일, +56/-7. 이 PR은 이전 모니터링 기간에 신규 항목으로 나타났으며, 이번 모니터링 기간에 머지가 완료되었습니다.

256비트 PTX 전역 load/store 경로를 SM100 및 최신 아키텍처로 제한하고, CUDA 12.9 이상에서만 발행하도록 변경. 구형 아키텍처는 128비트 경로로 폴백. pre-SM100 CUDA 테스트를 추가하여 T.ldg256/T.stg256과 벡터 store의 폴백 동작을 커버.

판독: 광폭 메모리 접근은 신규 아키텍처의 능력이며, “먼저 폭을 올리고, 나중에 종속 조건을 보완”하는 경로에서 폴백 면이 곧 회귀 리스크의 소재다. 이 수정은 “발행 가능하면 발행”을 “발행해야 할 때만 발행”으로 조이는 것으로, 1.3의 테스트 통합과 함께 역사적 부채를 청산하는 유형의 작업이다.

1.3 메인 저장소: 테스트 스위트 한 번에 509줄 감량, 빠른 수학 어서션을 실제 참조 구현으로 교체 (09-20)

날짜: 2026-09-20 출처: tilelang #3252 중복 코드 생성 스모크 테스트 삭제 및 빠른 수학 어서션 수정

09-20 01:44 머지, 작성자 penguin-wwy, 6개 파일, +20/-509. CPU와 LLVM 양측의 중복된 matmulT.gemm 코드 생성 스모크 테스트를 삭제하고, 독립적인 빠른 수학 CUDA 테스트 모듈 전체를 삭제. 또한 “빠른 수학 출력을 자기 자신과 비교”하는 어서션을 수정——exp10, log2, log10, cos, sin, tan에 실제 참조 구현을 보완하고, tan은 결정적 입력으로 전환하며 허용 오차를 rtol=atol=1e-2로 완화, 지원되지 않는 연산은 자기 비교 대신 명시적 어서션 실패로 변경.

판독: 삭제한 것은 중복 커버리지, 보완한 것은 실제 커버리지——자기 비교 어서션은 어서션이 없는 것과 같다. 이는 테스트 자산의 “품질 제고 및 중복 제거”에 해당하며, 메인 저장소가 품질 문제를 앞당기는 전반적 방향성과 일치한다.

1.4 메인 저장소 리뷰 큐: 데이터 타입 차단 PR 업데이트, Metal 행 수 PR 머지 없이 종료, Tile IR 백엔드 초안으로 전환 (09-19/09-20)

날짜: 2026-09-19 ~ 2026-09-20 출처: #3245 CUDA 코드 생성 전 지원되지 않는 GEMM 데이터 타입 조합 거부#3215 Metal 런타임 가변 GEMM 행 수#3247 CUDA Tile IR 실행 백엔드

기존 PR 세 건의 상태 동향:

  • #3245 (09-19 16:20 업데이트, 미머지): 지원되지 않는 GEMM 데이터 타입 조합을 CUDA 코드 생성 진입 전에 차단, “조용한 오류를 명시적 실패로 앞당긴다”는 방향성 연장.
  • #3215 (09-20 01:37 종료, 미머지): Metal 측 “런타임 가변 GEMM 행 수”가 리뷰 9일 만에 종료, 머지 미발생.
  • #3247 (지난 호 중점, CUDA Tile IR 실행 백엔드): 현재 초안 상태이며 모니터링 기간 내 업데이트 없음, 최근 활동은 09-18 저녁에 정지. 이번 호에서는 상태 설명만 하고 더 이상 다루지 않음.

판독: 메인 저장소 리뷰 큐의 실질적 증분은 이미 ROCm 모델 연산자가 이어받았으며(오늘 중점 참조), 기존 대규모 변경은 이번 모니터링 기간에 진전이 정체됨.

1.5 TileOPs: FP8 배치 행렬 곱 전치 커널 머지, H200에서 최대 4.66배 속도 향상 (09-19)

날짜: 2026-09-19 출처: TileOPs #2153 병합 메모리 접근 커널로 FP8 B 피연산자 전치

09-19 09:55 머지, 작성자 michaelwithu, 7개 파일, +308/-51, 2개 커밋. 이 PR은 이전 모니터링 기간에 신규 오픈 상태로 등장했으며(당시 5개 케이스 중 4개가 대조 구현에 패배, 최악 0.34배), 이번 모니터링 기간에 머지됨.

내용: FP8 B 피연산자의 [B, K, N] → [B, N, K] 구체화를 병합 메모리 접근 TileLang 전치 커널로 교체. 복사 경로는 b의 스트라이드로 결정하도록 변경(더 이상 trans_b만 보지 않음), K 최내곽 입력은 두 파라미터 모두에서 복사 건너뜀. 레이아웃 경고는 실제로 전치가 발생할 때만 발행. FP8 전치 커널의 직접 커버리지(타일 꼬리 포함) 추가, 선택적 대조 구현 벤치마크 행과 fp32 참조 정합성 검증.

결과(H200, CUDA 13.2, torch 2.13.0): 5개 케이스에서 메인라인 대비 2.30~4.66배 속도 향상——MoE 프리필 0.8741 → 0.1874밀리초(4.66배), MHA 디코드 PV 0.0605 → 0.0131밀리초(4.62배), 정방 행렬 4배치 1K 0.0355 → 0.0137밀리초(2.59배). 대조 구현 대비 비율은 열세에서 우위로 전환(예: 정방 행렬 8배치 2K 1.81배 → 4.16배). trans_b=True 경로는 불변, 1.03~1.20배 유지.

판독: 이는 #2130(GEMM 메타 태스크) 하위 브랜치의 마무리——배치 행렬 곱은 표준 형상에서 이미 자리 잡았고, FP8과 레이아웃 주변부가 마지막 약점이었는데, 이번 커밋이 그중 가장 큰 부분을 보완함.

1.6 TileOPs: GEMM 커널을 서비스 영역별로 이름 변경하고 GEMV 두 밴드 병합 (09-19)

날짜: 2026-09-19 출처: TileOPs #2156 커널을 서비스 영역별로 이름 변경, 두 GEMV 밴드 병합

09-19 23:11 병합, 작성자 lcy-seso, 19개 파일, +421/-274.

내용: 각 dense GEMM / BMM 커널 클래스를 「형제 클래스와의 차이점」에 따라 이름을 변경 — 메인 루프 구조(Tma, CpAsync, Persistent), 입력 형상(Gemv) 또는 스케일링 입도(TensorScale, BlockScale). SmallBatchGemmKernelGemvKernel에 병합: 둘은 원래 동일한 빌더를 공유했고 차이는 담당 영역과 설정 규칙뿐이었음; 병합 후 하나의 클래스가 세 개의 밴드를 가지며, 밴드는 band_for로 판정되어 생성자 파라미터, 캐시 식별자, 기본 설정 및 튜닝 그리드에 진입. 디스패치는 불변(세 밴드의 합집합이 기존 두 영역과 동일), 커널 본체, 설정 규칙 및 튜닝 그리드 모두 미변경; w4a16_decode.py는 클래스명을 따라 w4a16_gemv.py로 변경.

파괴적 변경: kernel_map=의 키가 클래스명을 따라 이전(7개 키, 예: gemm_kernel → gemm_tma_kernel, gemm_basic_kernel → gemm_cp_async_kernel); 이전 키는 이전까지 조용히 폐기되어 출하 구현으로 폴백되었으나, 이제 생성 단계에서 직접 오류 발생.

판단: 이름 변경은 미적 문제가 아님 — 커널 수가 증가한 후에는 이름이 「왜 이것을 선택해야 하는가」에 직접 답할 수 있어야 함; 아울러 「잘못된 키 전달 시 조용한 폴백」을 명시적 실패로 바꾼 것은 메인 저장소의 「조용한 오류 전방 이동」과 동일한 규율.

1.7 TileOPs 신규 오픈: 그룹 GEMM 잔여 블록 분할, CUTLASS 그룹 커널을 정면 추격 (09-19)

날짜: 2026-09-19 출처: TileOPs #2157 그룹 GEMM 잔여 블록 분할, 호출자가 패딩 행 레이아웃 선언 허용

09-19 22:12 신규 오픈(미병합), 작성자 michaelwithu, 10개 파일, +297/-110.

내용: 그룹 GEMM의 네 가지 워크로드 중 nt bf16만 실제 경쟁자가 있음(fp16에서 torch의 그룹 행렬 곱은 16회 개별 호출로 퇴화, bf16만 CUTLASS 그룹 커널에 도달), 그리고 그것이 6.4% 뒤처짐. 두 가지 근본 원인: 128x256 타일이 전체 출력 타일(64 KiB)을 공유 메모리에 배치하여 메인 루프가 3단 파이프라인만 수용(대조군은 4단); 해당 버퍼를 4번째 파이프라인 단계로 전환할 수 있는 epilogue_stage_n 메커니즘이 이전에는 dense 및 배치 행렬 곱에만 개방됨. 메커니즘을 조용히 개방하는 것도 불가: 타이트 그룹의 마지막 타일은 잔여 블록이며, 이 행들은 행 마스크로 저장되어 한 덩어리로 출력되지 않으므로 분할하면 오히려 한 라운드의 임시 저장 비용 추가 — MoE 실제 라우팅에서(그룹당 최소 1행, 최대 663행, 55% 타일이 잔여 블록) 비용 3%에서 5.5%. 잔여 블록 비율은 형상의 성질이 아닌 라우팅의 성질이며 선택기가 구분할 수 없으므로, 호출자가 「내가 가진 것이 어느 종류인지」를 선언할 수 있게 함.

판단: 「분할 여부」의 결정권을 형상 추론에서 호출자 선언으로 바꾼 것은 그룹 GEMM이 CUTLASS에 근접하는 핵심 단계; 기본 경로에 영향을 미치는지는 병합 후 야간 회귀에서 확인 예정.


2. 멀티 백엔드 어댑테이션 (Ascend / Sunrise / MetaX / Hygon / Moore Threads)

기간 개요: 기존 4개 백엔드에 Sunrise를 더해 모두 커밋 없음; 유일한 동향은 Ascend의 일일 회귀 리포트.

2.1 Ascend: 일일 회귀 1936개 전수 통과, 연속 2일째 (09-20)

날짜: 2026-09-20 출처: tilelang-ascend 일일 테스트 리포트 #1814

Ascend 측 일일 정기 테스트가 09-20 05:30(베이징 시간) 리포트를 발행: 1936개 전수 통과, 실패 0개, 통과율 100%. 전일(09-19의 1936개)과 대조하면, 케이스 수와 결과 모두 동일; 저장소 내 모니터링 기간에 새 커밋 없음.

판단: 메인 저장소의 이번 모니터링 기간 세 건의 병합은 각각 Metal, CUDA 및 테스트에 해당하며 Ascend 경로를 건드리지 않았으므로, 회귀가 동일한 것은 예상된 결과. 케이스 수가 이틀 연속 1936에 머문 것은 모니터링 기간에 업스트림이 Ascend 측에 새로운 케이스 표면을 제공하지 않았음을 의미; 멀티 디바이스 테스트 샤딩(#1812)은 모니터링 기간에 업데이트 없음.

2.2 MetaX, Hygon, Moore Threads, Sunrise: 모니터링 기간 내 신규 커밋 없음 (09-17/09-18)

날짜: 2026-09-17 ~ 2026-09-18 (각각 최근 1회 푸시) 출처: tilelang-metaxtilelang-hygontilelang-musatilelang-sunrise

4개 저장소 모두 24시간 모니터링 기간 내 커밋이 없다: MetaX와 Hygon의 최근 푸시는 09-17(17:38 및 20:25), Moore Threads는 09-17 오전, Sunrise는 09-18 오전——모두 이전 호에 이미 보고된 내용이다. 버전 상태: MetaX, Hygon은 릴리스가 없고, Moore Threads의 최신은 v0.1.14+musa.1(09-11), Sunrise 후보 브랜치는 0.1.14+sunrise.1.1.0에 머물러 있으며, 각 저장소의 태그는 모니터링 기간 내 모두 갱신되지 않았다.

판독: 이전 기간에 Sunrise가 후보에 진입한 활약이 이어지지 않았고, 4개 적응 저장소가 동시에 정적 상태에 들어갔다. 하루의 정적은 추세를 구성하지 않지만(채택자 측에 이전에 ‘펄스형 갱신’의 전례가 있었다), 관찰 포인트로 삼을 수 있다——다음 기간에도 정적이 계속된다면 각 제조사의 적응 리뷰가 모두 배치 리듬에 따라 진행되고 있음을 의미한다.


3. 생태계와 채택자

3.1 야간 스냅샷: 벤치마크 1040개 및 정확성 1118개 무실패 (09-19)

날짜: 2026-09-19 출처: TileOPs-nightly 스냅샷 브랜치스냅샷 환경 메타데이터

야간 파이프라인은 모니터링 기간 내 TileOPs의 917590ba(즉 #2154: 스냅샷 저장소에서 성능 이력 기간을 재구축하는 병합)에 대한 스냅샷을 생성했다(09-19 16:19 커밋). 벤치마크와 정확성 두 결과 파일을 파싱한 결과: 정확성 1118개, 실패 0, 건너뜀 2; 벤치마크 1040개 케이스, 실패 0, 건너뜀 3——이전 스냅샷의 케이스 수와 동일하며 전부 통과했다.

환경 메타데이터는 이전 호와 일치한다: H200, CUDA 13.2, 드라이버 595.71.05, 전력 상한 700와트, SM 클럭 1500메가헤르츠(상한 1980), 메모리 클럭 3201메가헤르츠, MIG 비활성화, 반복 시간 100밀리초, 워밍업 25밀리초, 이미지는 내용 식별자로 기록, TileLang 0.1.11 플러스 코드명 버전, PyTorch 2.13.0.

3.2 벤치마크 신뢰성 거버넌스: 8개 행 대역폭 이상 및 당일 3건의 수정 (09-19/09-20)

날짜: 2026-09-19 ~ 2026-09-20 출처: #2155 라우팅으로 선택된 전문가 청구#1996 바이트 감사는 읽기 측만 봄#2154 스냅샷 저장소에서 성능 이력 기간을 재구축

이번 모니터링 기간 TileOPs에서 가장 밀도 높은 엔지니어링 투입은 연산자가 아니라 ‘벤치마크 판정 자체를 신뢰할 수 있게 만드는’ 것이다. 하루 만에 3건:

  • #2155(09-19 21:24 병합): 3.1의 야간 실행에서 8줄의 대역폭 이상이 보고되었다(IndexedExpertMLPFwdOp의 모든 디코딩 워크로드, fp16과 bf16 각각 절반). 판독값은 최대 132.4 TB/s였으며, H200의 물리적 상한은 약 4.8이다. 원인은 수식 오류로 판명되었다. 바이트 수가 모든 전문가를 기준으로 계산되었으나, 라우팅형 MoE는 topk_ids에 선택된 전문가만 읽는다. 수정 후 판독값이 내려갔다. deepseek-v3-decode-1은 132.43에서 3.62로(활성 전문가 7/256), decode-32는 6.97에서 4.47로(164/256), decode-64는 5.06에서 4.47로(226/256), qwen3-235b-decode-32는 4.92에서 4.42로(115/128) 감소했다. 부수적으로 발견된 점: FusedMoEExpertsFwdOp는 같은 수식을 사용하면서도 계속 통과했는데, 이는 워크로드가 512 token에서 시작하여 모든 전문가가 활성 상태였기 때문이다. 즉 “정확성 기준 통과”가 아니라 “형상 기준 통과”였다. FusedMoeSharedExpertFwdOp는 공유 출력에 대한 쓰기를 계산에 포함한 적이 없었다.
  • #1996(09-20 06:50 병합): 바이트 감사의 판정 기준을 읽기 측만 보도록 변경했다. 더티 L2 라인은 커널 종료 후에야 기록되므로 프로파일링 구간 밖에 위치하며, 측정된 쓰기 바이트는 본질적으로 알고리즘 최소량보다 작을 수밖에 없다. 이를 근거로 실패를 판정하면 정상 줄을 오판하게 된다(첫 실행에서 즉시 3개 줄을 오판했다). 동시에 add_fwd/sub_fwd의 기본 alpha 곱셈에 대한 무조건적 계산(원소당 2 FLOP로 계산했으나 규격은 1)을 수정하고, 감사에 CI 진입점과 그룹별 실행 방식을 추가했다.
  • #2154(09-19 15:36 병합): 14일 성능 기준선 윈도우를 “가변 아티팩트”에서 스냅샷 브랜치로 이관했다(실행마다 커밋 하나, 영구 보존). 이전에는 각 실행이 직전 아티팩트를 읽고 덮어썼는데, 한 번의 API 502로 인해 한 실행이 자신의 레코드 하나만 게시한 적이 있었다(인접 항목의 14, 15, 19건과 대비됨).

판독: 세 건은 각각 “수식이 의미에 책임진다”, “측정이 물리 원리에 책임진다”, “데이터가 출처에 책임진다”를 해결한다. 연산자 라이브러리의 야간 기준선은 업스트림 의존성으로서의 신용 기반이며, 먼저 결론을 신뢰할 수 있게 만든 후에 빠르고 느림을 논한다.

3.3 채택자: TileKernels와 FlashQLA 모니터링 기간 내 푸시 없음(09-18)

날짜: 2026-09-18(최근 푸시) 출처: TileKernelsFlashQLA

모니터링 기간 내 두 채택자 모두 푸시가 없었다. TileKernels의 최근 푸시는 여전히 04-23에 멈춰 있고, FlashQLA의 최근 푸시는 09-18 15:53(이전 회차에 보고된 세 건의 병합)이다. 조직 내 TileRT 역시 푸시가 없다(최근 08-13, 7주 연속 정지).

3.4 이관 라인: Dense Gated DeltaNet 프리필 이관 PR 업데이트(09-19)

날짜: 2026-09-19 출처: TileOPs #2144 Dense Gated DeltaNet 프리필 이관

모니터링 기간 내 업데이트된 이관 계열 PR: Dense Gated DeltaNet 프리필을 기존 커널 조직으로 이관한다(09-16 생성, 09-19 23:11 업데이트, 미병합). 작성자는 커뮤니티 구성원이며, 이전 모니터링 기간에 보고된 TileSight 문서 저장소와 동일한 계정이다. 이 건은 1.6의 이름 변경, #2130의 GEMM 메타 태스크와 같은 배경에 속한다. 즉 연산자 라이브러리가 수량 증가 후 구조를 정리하는 과정으로, 선형 어텐션, GEMM, 페이지드 캐시 여러 라인이 통일된 클래스와 매니페스트 조직으로 수렴하고 있다.


4. 커뮤니티, 튜토리얼 및 활동

4.1 문서 사이트: TileOPs 문서 사이트 1회 사이트 배포, 사이트 내용 변화 없음(09-19)

날짜: 2026-09-19 출처: TileOPs.github.io 문서 사이트 저장소

TileOPs 문서 사이트는 모니터링 기간 내 1건의 사이트 배포 기록이 있다(gh-pages 브랜치 09-19 08:01의 배포 커밋, 09-17 메인 브랜치 내용에 대한 빌드에 해당). 기본 브랜치에는 새 커밋이 없다(최근 내용 업데이트는 여전히 09-17의 #51). 내용 업데이트가 아닌 배포 계열 작업이며, 메인 저장소 문서 사이트는 모니터링 기간 내 푸시가 없다.

4.2 미디어 및 학술 측: 모니터링 기간 내 신규 제로(09-20)

날짜: 2026-09-20 출처: Google News RSS(프록시 경유)/Hacker News/arXiv

주제의 Google News RSS 중영문 다중 쿼리(9그룹, 컴포넌트명, 국산 가속기 및 연산자 커널 조합어 포함)는 모니터링 기간 내 신규 제로였다. Hacker News는 최근 5일간 주제 적중이 없었고, arXiv 전문 검색의 9건 주제 결과는 모두 이번 모니터링 기간 이전이다(최신 1건은 07-24의 성능 모델링 논문으로 이전 회차에 보고됨). 조직은 신규 저장소가 없다.

4.3 버전 주기: 메인 저장소는 여전히 v0.1.14, 각 적응 저장소 태그 변동 없음(09-02)

날짜: 2026-09-02(최근 릴리스) 출처: 메인 저장소 v0.1.14 릴리스

메인 저장소의 최신 태그는 여전히 v0.1.14(09-02 릴리스)이며, 모니터링 기간 내 신규 태그는 없음. TileOPs는 릴리스 기록 없음. Ascend 저장소의 최신은 TileLang-ascend v0.1.2.000-release(09-09), Moore Threads는 v0.1.14+musa.1(09-11). 메인 저장소는 v0.1.14 이후 18일째 릴리스가 없으나 리뷰 큐와 병합은 계속 진행 중——릴리스 리듬과 개발 리듬의 격차가 벌어지고 있다.


5. 트렌드 관찰

5.1 ROCm 라인: 「백엔드 사용 가능」에서 「신규 모델 네이티브 연산자 체인화」로

지난 호의 판단 「AMD 측의 진전은 구체적 모델의 구체적 연산자로 전환되었다」는 이번 모니터링 기간에 더욱 강화되었다. 네 개의 PR이 스택형 체인 형태로 한 번에 제출되어 GLM-5.3 희소 어텐션 k 풀의 전 단계를 포괄하며, 이미 릴리스된 모델의 설정 계약(2048 token 예산, 512 풀, 4 token 풀 입자성)에 직접 결합되어 있다. 이는 ROCm 측의 작업면이 「백엔드 역량 보강」이 아니라 「모델 딜리버리」 기준으로 조직되었음을 보여준다——신규 모델 릴리스 후 해당 모델 고유의 연산자가 AMD 경로에서 갖춰지는 속도가 해당 백엔드의 성숙도를 가늠하는 직접적 지표가 되고 있다.

5.2 TileOPs가 하루를 측정 체계에 투입: 판정을 신뢰할 수 있게 한 뒤에야 빠르고 느림을 논하다

#2154, #2155, #1996 세 건 모두 벤치마크와 감사의 판정 로직에 집중되었고, 모니터링 기간 내 야간 스냅샷이 전부 녹색이라는 점을 더하면, 유지보수 계층이 「야간 결론이 올바른가」를 「커널이 더 빠른가」와 동등하게 중요시하고 있음을 보여준다. 이러한 거버넌스 신호의 가치는 측정 체계가 신뢰할 수 있을 때에만 성능 비교(예: 1.5의 4.66배, 1.7의 6.4% 격차)가 의사결정적 의미를 갖는다는 데 있다. 반대로 이번 모니터링 기간에 드러난 「동일한 오류 수식이 장시간 발견되지 않음」은 판정 로직의 커버리지에 여전히 사각지대가 있음을 시사한다.

5.3 메인 저장소의 이번 모니터링 기간 세 건의 병합은 전부 보완형이며, 증분은 리뷰 큐에 있다

역량 보강(Metal 원자적 덧셈), 적용 범위 수정(256비트 메모리 접근 폴백), 테스트 품질 향상(509줄 감축 및 참조 구현 보충)——세 건 모두 신규 역량 확장이 아니라 미결 과제 정리를 향한다. 진정한 신규 증분은 리뷰 큐에 있다. ROCm 모델 연산자 네 건이며, 지난 호의 대규모 변경(Tile IR 백엔드)은 초안 상태로 정체되었다. 메인 저장소는 현재 「병합은 신중하게, 탐색은 기록으로」의 이중 트랙을 보인다. 큰 노선급 변경은 초안 형태로 침전되고, 일상은 소규모 보완으로 진행된다.

5.4 백엔드 매트릭스의 침묵 면 확대: Ascend만 일일 회귀를 유지

지난 모니터링 기간에는 Sunrise의 후보 진입이라는 활동이 있었으나, 이번 기간에는 네 개 적응 저장소와 Sunrise가 전부 침묵했고, 유일한 동향은 Ascend의 일일 회귀(1936항목 전부 통과)뿐이다. 단일 일자의 침묵을 정체로 해석하는 것은 피해야 하지만(채택 측의 펄스형 리듬은 선례가 있다), 이 대비 자체가 하나의 판독값을 제공한다. 다중 백엔드 구도에서 「매일 가시적」인 엔지니어링 리듬을 유지하는 곳은 Ascend뿐이며, 나머지 각 사의 활성도는 주 단위 내지 월 단위로 관찰해야 한다.

5.5 공백과 위험 지점

세 가지를 표시할 필요가 있다. 첫째, 네 건의 GLM-5.3 PR이 전부 병합되지 않았고, 스택 의존은 연쇄 리뷰를 의미하므로 어느 한 건이라도 막히면 체인 전체의 착지가 지연된다. 둘째, 이번 모니터링 기간에 수정된 8줄 대역폭 이상과 바이트 감사 오탐(3.2)은 야간 판정 로직이 한동안 잘못 작동했음을 보여주며(이상 판독값은 최고로 물리적 상한의 27배까지 부풀려졌다), 수정 후 판정 기준의 안정성은 후속 스냅샷에서 지속 관찰이 필요하다. 셋째, 메인 저장소의 릴리스 정체가 18일에 달했고 리뷰 큐는 계속 누적되는데, 모니터링 기간에는 9일간 운영된 Metal PR(#3215) 한 건이 닫혔다——큐의 처리량과 적체 사이의 균형이 후속 관찰 지점이다.


부록: 자료와 검증 설명

출처 검증 표

출처 검증 결과
tile-ai 조직(28 저장소) 모니터링 기간 내 3개 저장소에 푸시: tilelang, TileOPs, TileOPs-nightly. TileOPs.github.io는 별도로 사이트 배포 커밋 1회
메인 저장소 tilelang 기본 브랜치 병합 3건(#3211, #3248, #3252), 모니터링 기간 내 신규 PR 5건(#3251~#3255), #3247은 초안 상태이며 업데이트 없음
TileOPs 병합 5건(#2153, #2154, #2155, #2156, #1996), 신규 1건(#2157), #2144 업데이트 있음
TileOPs-nightly 커밋 917590ba에 대한 스냅샷(벤치마크 및 정확성 결과 파일, 환경 메타데이터) 생성, 결과 전량 파싱 완료
Ascend 일일 회귀 보고서 1936항목 전부 통과(연속 두 번째 날), 저장소 내 모니터링 기간 커밋 없음
기타 국산 백엔드와 Sunrise MetaX, Hygon, Moore Threads, Sunrise 모두 모니터링 기간 내 커밋 없음, 태그 미갱신
채택 측 TileKernels, FlashQLA 모니터링 기간 내 푸시 없음, 조직 내 TileRT 역시 푸시 없음
Google News RSS(중영 다중 그룹, 프록시 경유) 모니터링 기간 내 신규 제로
Hacker News 최근 5일 주제 적중 없음
arXiv 주제 검색 최신 1편은 07-24, 모니터링 기간 내 신규 프리프린트 없음
문서 사이트 TileOPs 문서 사이트 사이트 배포 1회(내용 미변경), 메인 저장소 문서 사이트 푸시 없음

전체 출처 목록