Период отчёта: с 13 сентября 2026 года (воскресенье) по 20 сентября 2026 года (воскресенье), всего 7 календарных дней, соответствует 38-й неделе ISO Источники материалов: 4 выпуска ежедневного отчёта TileLang (09-17, 09-18, 09-19, 09-20); за 09-14 – 09-16 ежедневные отчёты отсутствуют (настоящее издание выходит в пробном режиме с 09-17), этот период дополнен проверкой окна на уровне организации GitHub (28 репозиториев организации tile-ai, 168 часов) и метаданными коммитов репозиториев, подробности см. в приложении


1. Главные новости недели

  1. Основной репозиторий открывает исполнительный бэкенд CUDA Tile IR, один коммит — 134 файла, около 36 тысяч добавленных строк (09-18): новый бэкенд опускает программы TileLang до CUDA Tile IR от NVIDIA, загружается через среду выполнения cuTile и идёт параллельно с текущим путём «генерация исходного кода CUDA и передача в nvcc»; изменения также охватывают JIT, кэш, автоматическую настройку, две документации и одну специализированную задачу CI, что является изменением на уровне маршрута, а не экспериментальной веткой; в конце окна мониторинга этот PR перешёл в состояние черновика и ещё не слит (tilelang #3247).
  2. Блочно-квантованный GEMM повышен до оператора языкового уровня, путь «тихой деградации» удалён (09-17): основной репозиторий добавил T.gemm_blockscaled и специализированный селектор бэкенда, масштабирующий множитель стал полноценным входом оператора; бэкенды, не обладающие этой возможностью, вместо «тихого выполнения как плотного GEMM с отбрасыванием масштабирующего множителя» теперь приводят к ошибке компиляции. Сайт документации затем дополнили полной сигнатурой, поведенческими соглашениями и тремя явными вариантами на уровне инструкций (#3237, коммит документации).
  3. На стороне ROCm k-пул разреженного внимания GLM-5.3 выстроился в цепочку за 24 часа (09-19 ~ 09-20): один и тот же автор подряд открыл четыре стекированных PR, охватывающих обслуживание хвоста декодирования после сжатия k-пула и записи в кэш, постраничные logits, преобразование Top-K и выбор слияния, в сумме около 9,8 тысячи строк, 40 файлов, напрямую привязанных к контракту конфигурации уже выпущенной модели (бюджет 2048 token, пул 512); вместе с примером декодирования KDA и примером FP8 разреженного MLA для DeepSeek V3.2 путь AMD продвигается по принципу «нативные операторы для новых моделей на месте» (#3251, #3253, #3254, #3255).
  4. Тройной успех производительности TileOPs: пакетное матричное умножение переходит на общий шаблон, ядро транспонирования FP8 закрывает слабое место, малый маршрутизатор MoE опережает vLLM (09-17 ~ 09-19): на H200 пакетное матричное умножение после перехода на общий шаблон GEMM ускорилось до 1,44 раза и не уступает официальной библиотеке; слабое место транспонирования пакетного матричного умножения FP8 закрыто ядром с объединённым доступом к памяти, пять случаев ускорились в 2,30–4,66 раза; путь малого маршрутизатора индекса MoE на уровне 4096 token для GLM-4.5 опережает vLLM на 25,85%, на уровне DeepSeek-V3 — на 16,03% (#2148, #2153, #2141).
  5. Основной репозиторий завершил цикл «вынесения тихих ошибок на ранний этап» (09-16 ~ 09-20): после того как ширина атомарного вектора стала определяться целевым адресом, ядра вроде обратного распространения эмбеддингов ускорились в 1,4–2,5 раза; атомарное сложение при несмежных целевых адресах откатывается к скалярному, что устраняет класс тихих ошибок записи и сбоев из-за выравнивания; три тихих дефекта генератора случайных чисел выделены в отдельные PR; неподдерживаемые комбинации типов GEMM перехватываются до генерации кода (#3238, #3219, #3242, #3245).
  6. Ascend сохраняет высокую частоту всю неделю и завершает её «ежедневной регрессией без единого сбоя» (09-15 ~ 09-20): прямой проход NSA и его версия с переменной длиной вошли в репозиторий в один день (19,62 и 20,34 микросекунды на 910B3), динамическое квантование, слияние RMSNorm и RoPE дополнили набор операторов; число ежедневных регрессионных случаев 1919 → 1925 → 1936 → 1936, четыре дня подряд без сбоев, а также открыто разделение тестирования по нескольким устройствам; в конце окна добавлены пример mhc_pre и уточнения документации по ряду операторов (#1699, #1700, отчёт о регрессии #1814).
  7. **В ландшафте бэкендов появляется «дистрибутив

Морфология: Sunrise S2/TANG выходит в кандидаты 0.1.14 (09-18): в организации tile-ai обнаружен репозиторий бэкенд-дистрибутива для отечественного GPGPU Sunrise S2 — отдельный репозиторий, отдельный номер версии (0.1.14+sunrise.1.1.0) и отдельный CI; вместе с репозиторием адаптации для Ascend, веткой функций Hygon и веткой обратного портирования Moore Threads он образует четыре типа организационной морфологии адаптации (tilelang-sunrise).

  1. Принимающая сторона завершает молчание: FlashQLA в тот же день вносит три коммита (09-18): на стороне Tongyi Qianwen реализация gated linear attention на базе TileLang одним сведением закрывает три коммита — обратное fused-ядро SM120/SM121, загрузка решателя KKT SM100, асинхронный конвейер переменной длины хвостового блока; инженерный центр тяжести смещается от адаптации к новой архитектуре к загрузке и корректности границ (#34).

2. Прогресс ключевых проектов

Версии и релизы

  • Последний тег основного репозитория по-прежнему v0.1.14 (выпущен 09-02), в окне новых тегов нет, к концу периода прошло 18 дней без релиза; темп внесения коммитов сходится, а очередь ревью продолжает накапливаться — наиболее заметная ритмическая характеристика этого периода.
  • Теги репозиториев адаптации в окне не обновлялись: Ascend TileLang-ascend v0.1.2.000-release (09-09), Moore Threads v0.1.14+musa.1 (09-11), кандидатная ветка Sunrise 0.1.14+sunrise.1.1.0; у TileOPs до сих пор нет записей о релизах, его внешний статус обеспечивают сайт документации и ночные снимки.

Языковой уровень: семантика операторов и API

  • Блочно-квантованный GEMM (#3237, внесён 09-17): добавлены GemmBlockScaledNode и языковой T.gemm_blockscaled, диспетчеризация идёт по двум реализациям — cuda.tcgen05.blockscaled (линия SM100) и cuda.mma.blockscaled (линия SM120); исправлены две проблемы, которые могли приводить к молчаливым ошибкам: возможное попадание одиночного CTA SM100 на путь инструкций SM120, а также молчаливое выполнение неподдерживаемым бэкендом как плотного GEMM (PR).
  • Ограничение ширины копирования (#3246, открыт 09-18): верхний предел объединённой ширины T.copy и T.async_copy теперь ограничивается фактически достижимой векторной шириной вместо прежнего фатального логирования — «ограничение возможностей» продолжает деградировать, «семантическая ошибка пользователя» по-прежнему приводит к сбою; критерии различения сбоя и деградации прописаны явно.
  • 256-битный глобальный доступ к памяти ограничен SM100 и новее (#3248, внесён 09-19): 256-битные load/store выдаются только на SM100 и новее при CUDA 12.9 и выше, старые архитектуры откатываются на 128-битный путь, добавлен негативный тест для pre-SM100.
  • Атомарное сложение сохраняет скалярность на несмежных адресах назначения (#3219, внесён 09-16): добавлен предварительный критерий CanVectorizeAtomicTarget, охватывающий три формы адреса назначения — address_of, tl.access_ptr, tvm_access_ptr; исправлены молчаливая порча данных, когда «все линии пишут в одну ячейку» компилировались в широкое атомарное сложение, и падение при невыровненном нечётном базовом адресе.
  • Раздельное исправление трёх дефектов генератора случайных чисел (#3242 / #3243 / #3244, открыты 09-17, не внесены): по умолчанию случайная последовательность выводилась только по измерению x, что приводило к дублированию выборок в двумерном блоке потоков; привязка результата void; отсутствие инициализации не вызывало ошибку — все три относятся к молчаливым проблемам, которые «компилируются по типам, но ошибочны по семантике».

Операторы моделей и примеры

  • Цепочка k-пула разреженного внимания GLM-5.3 (#3250 ~ #3255, 09-19 ~ 09-20, не внесены): четыре наложенных PR в сумме около 9,8 тысяч строк, 40 файлов, охватывают пять звеньев — сжатие k-пула и запись в кэш, обслуживание хвоста декодирования, постраничные logits, преобразование Top-K, fused-выбор; проверка ведётся по exact-head CI (ROCm 7.2 / gfx942, #3251 сообщает о 2423 пройденных, #3255 — о 2435 пройденных).
  • Пример декодирования KDA (#3249, открыт 09-19): пример состояния декодирования gated linear attention с безопасным гейтированием, включая покрытие корректности выходных данных и согласованности состояний, многошаговость, индексацию пустого состояния, неупорядоченные слоты.
  • Пример прямого прохода разреженного MLA FP8 для DeepSeek V3.2 (#3224, внесён 09-16): вклад класса покрытия моделей для Hopper, относится к внесениям первой половины окна (до запуска ежедневного отчёта).

Компилятор и бэкенд-пути

  • Восстановление доказательства инъективности для символической схемы циклов (#3233, влито 09-18): исправлена регрессия между v0.1.12 и основной веткой — когда пространство итераций T.Parallel является смешанным статическим и динамическим (например, (16, n)), схема с дополнением хвоста инъективна, но не биективна, и основная ветка ранее сразу сообщала «не найдена доступная схема»; исправление строит обратное отображение из проверяемого отображения итераций и доказывает равенство туда-обратно на области определения (связанный дефект №2906).
  • Бэкенд исполнения CUDA Tile IR (#3247, открыт 09-18, позже переведён в черновик): целевой инструментарий — привязки CUDA Tile IR 13.4, tileiras 13.4, cuTile 1.5; типизированный IR, понижение и ядро pass расположены в tilelang/tileir и подключены к JIT, кешу и автонастройке; дополнительно добавлены новые элементы конфигурации pass для запуска проверки семантики исходного языка до материализации (включая путь восстановления из кеша).
  • Подключение ROCm CI к проверке портируемых примеров (#3165, влито 09-19): белый список охватывает четыре категории — внимание Seer, обобщённый Top-K, прямой проход разреженного MLA, групповое матричное умножение тензоров; сами примеры становятся регрессионными активами — косвенное свидетельство вхождения пути AMD в фазу конвергенции.
  • Усиление линии Metal: поддержка 32-битного целочисленного атомарного сложения (#3211, влито 09-19, с проверкой конкурентной гистограммы), исправление смещения области буфера GEMM (#3209, влито 09-14); «изменяемое во время выполнения число строк GEMM» (#3215) закрыто без вливания после девяти дней рецензирования (09-20).
  • Прочие исправления: исправление кодогенерации побитовой инверсии булевых значений (#3228, 09-16), восстановление порядка «сначала привязка, затем использование» при объединении наборов ограничений (#3221, 09-14), введение CPU dialect в тесты CPU (#3236, 09-16).

Runtime, инструментарий и тесты

  • JIT дополнен отображением типов параметров uint64 (#3229, влито 09-17), обе обёртки хоста — Cython и NVRTC — приведены в соответствие.
  • Исправление загрузки библиотек runtime (#3227, влито 09-15): проблема загрузки библиотек при установке через симлинки.
  • Анализатор разделён на помощник хронометража и добавлен эталон по настенным часам (#3234, влито 09-16).
  • Повышение качества тестовых активов (#3252, влито 09-20, +20/-509): удалены дублирующиеся дымовые тесты кодогенерации на стороне CPU и LLVM и отдельный модуль тестов быстрой математики; исправлено ложное утверждение «сравнение вывода быстрой математики с самим собой», для exp10, log2, log10, cos, sin, tan добавлены настоящие эталонные реализации.

Производительность

  • Планирование ширины атомарных векторов по адресу назначения (#3238, влито 09-16): при динамических формах, ранее вводивших смещение полосы int64, весь цикл скаляризовался; после исправления обратное встраивание N=8192/H=4096/V=129280 снизилось с 97.90 микросекунд до 56.01 микросекунды, N=196608/H=256/V=3000000 — с 146.87 до 82.70 микросекунды, вспомогательный подсчёт и суммирование по последовательности — с 18.40 до 12.17 микросекунды, регрессионный эталон example_gqa_bwd_tma_reduce_varlen даёт около 27% относительного прироста. Затронутые обратное встраивание и обратное внимание переменной длины — это постоянные ядра вывода с большим словарём.
  • Производительность на стороне библиотеки операторов (BMM / FP8 / MoE) см. в разделе 4.

Наблюдение за очередью рецензирования

  • Операторы моделей ROCm продвигаются стековой цепочкой (#3249 ~ #3255), в описании указано «включает предыдущие коммиты вплоть до их вливания», требуется последовательное рецензирование: застревание любого из них задерживает всю цепочку.
  • Три дефекта генератора случайных чисел (#3242 / #3243 / #3244) и блокировка комбинаций типов GEMM (#3245) в течение окна продолжали обновляться, но пока не влиты; бэкенд Tile IR (#3247) переведён в черновик и заморожен.
  • Разрыв между вливаниями и очередью: в окне 16 коммитов в ветку по умолчанию основного репозитория, завершающий отрезок посвящён в основном дополнению и закрытию, а существенный прирост сосредоточен в очереди рецензирования.

3. Мультибэкендная адаптация

Ascend (Ascend)

  • Операторный уровень: прямой проход NSA (#1699) и версия переменной длины (#1700) вошли в репозиторий в один день — золотая конфигурация 19.62 микросекунды, все 27 многоуровневых тестов пройдены, версия переменной длины на 910B3 даёт 20.34 микросекунды, все 21 тест пройдены; динамическое квантование (#1688, точность полностью пройдена, среднее ускорение 0.78x, производительность всё ещё отстаёт от базовой линии вендора), слияние динамического квантования RMSNorm (#1673), RoPE (#1580), оптимизация широковещания CrossEntropy и специализированный путь FP32 (09-15), разделение декодирования causal_conv1d_decode на пары AIV (09-15).
  • Качество и регрессия: число ежедневных регрессионных примеров 1919 → 1925 → 1936 → 1936, непрерывно все проходят; в документацию сравнительных операторов добавлено покрытие dtype (#1602), исправлен жизненный цикл буферных токенов в эталонном скрипте (#1779); открыт CI с шардированием многопользовательских тестов (#1812).
  • Конец окна (вторая половина дня 09-20): добавлен пример mhc_pre (#1621); уточнена документация группы операторов T.tile (sort / topk / transpose / max / min / add / sub / mul / div / select); исправлен stride копирования среза строк GM в UB; исправлен тайм-аут асинхронного чтения-записи block_sparse_mqa_attn.
  • Оценка: Ascend — единственный бэкенд, сохраняющий инженерный ритм с «ежедневной видимостью», и вступающий в фазу «перехода от развёртывания возможностей к качеству и поддерживаемости».

MetaX (MetaX)

  • MACA асинхронное копирование GEMM (#156) и исправление тестов (#157) были влиты 17.09, после чего проект перешёл в режим поддержки версий и тестов; во второй половине окна новых коммитов не было — минимальная активность среди четырёх.

Hygon (Хайгуан)

  • Адресное перебазирование многоуровневой памяти (MLS) и подключение асинхронного конвейера официально влиты в основную ветку (#10, 19 файлов, +540/-31), а также обратно портированы в ветку версии v0.1.12 (вместе с исправлением трёхмерной области среза); в ветке разработки также есть завершающие коммиты по управлению конвейером. По объёму изменений в бэкенд-коде — наибольшие среди четырёх.

Moore Threads (MUSA)

  • В окне пуши попали в ветку обратного портирования v0.1.12+musa.1 (документация MUSA 5.3.0); основная ветка неподвижна с 11.09 и ещё не догнала более поздние линии версий.

Прочее (Sunrise / tilelang-mlir-ascend)

  • Sunrise (S2 / TANG): пуши в окне в репозиторий дистрибутива бэкенда, версия ветки-кандидата 0.1.14+sunrise.1.1.0; S2 — отечественный GPGPU для инференса больших моделей, набор примеров изоморфен основному репозиторию (матричное умножение, FlashAttention, разреженное внимание и т. д.).
  • tilelang-mlir-ascend: 7 коммитов в окне — переключение CI на runner с устройствами Ascend A3 (#176), ядро адаптивного LayerNorm (#183), исправление бенчмарков (#184), подключение оператора многоуровневого внимания TileOPs (#185), отчёт по операторам и оптимизация оператора Mamba, выбор модели per-agent (#187 / #188, 20.09).

4. Экосистема и потребители

TileOPs (библиотека операторов)

  • Масштаб: 23 влития в окне; три снимка ночного конвейера непрерывно онлайн, 1040 позиций бенчмарков и 1118 позиций корректности с 18.09 непрерывно без сбоев.
  • Производительность: BMM с общим шаблоном до 1.44x (нигде не уступает torch-cublas); транспонированное ядро FP8 BMM 2.30–4.66x (предзаполнение MoE с 0.8741 до 0.1874 мс); малая маршрутизация в индексе MoE опережает vLLM (GLM-4.5 на 25.85%, DeepSeek-V3 на 16.03%, Kimi K2 на 8.65%); также см. влития начала окна — плотное декодирование FP8 (#2132), параллелизм декодирования GQA (#2136), кросс-канальное разделение деквантизации W4A16 (#2139) и расширение GemmTemplate до плотных coop1/coop2 (#2126) и др.
  • Контракты и структура: манифест поддерживает составные операторы, ресурсы и nullable-выходы (#2147); диспетчеризация отделена от тюнинга (#2152); ядра GEMM переименованы по зонам обслуживания, две зоны GEMV объединены (#2156, старые ключи kernel_map вместо тихого запасного варианта теперь дают ошибку на этапе конструирования); помощник постраничного KV вынесен из модуля группового внимания с запросами (#2150); формы SM90 дополнены (#2151); выход за границы сбора разреженного MLA закрыт (#2149); унифицирован оператор Gated DeltaNet (#2135) и перенесено предзаполнение плотного GDN (#2144).
  • Управление метриками: исправлена формула тарификации экспертов маршрутизации — ночные 8 строк аномальной пропускной способности (пиковое значение 132.4 TB/s, примерно в 27 раз выше физического предела H200) происходили из «тарификации по всем экспертам» (#2155); аудит байтов переведён только на сторону чтения (#1996); окно истории производительности перенесено в ветку снимков (#2154). Три коммита в один день — сначала достоверность оценки, потом скорость.
  • Новое: групповой GEMM с разбиением хвостовых блоков и возможностью вызывающей стороны объявить layout строк заполнения (#2157), прямое догоняние групповых ядер CUTLASS (ранее отставание 6.4%).

Потребители и связанные репозитории

  • FlashQLA (Qwen): три влития (обратное слитое ядро SM120/SM121, загрузка решателя KKT SM100, асинхронный конвейер хвостовых блоков переменной длины), затем в окне пушей нет; ранее несколько дней тишины — пульсирующий ритм ревью.
  • TileKernels (DeepSeek): в окне пушей нет (последний 23.04); сообщения СМИ о том, что инженеры DeepSeek оценивают написание ядер с помощью AI (16–17.09), имеют фоном TileKernels (библиотека ядер, написанных исключительно на TileLang, покрывающая гейтирование, маршрутизацию смеси экспертов, квантизацию, транспонирование и два типа операторов соединения).
  • TileRT: неподвижен семь недель подряд (последний 13.08) — самый долгий период тишины в текущем списке.
  • TileFoundry / DeepStack: два (парсер и чистка кода, 14–15.09) и один (исправления и примеры, 15.09) коммит соответственно.

5. Сообщество, обучающие материалы и мероприятия

  • Сайт документации: бот сайта документации основного репозитория выполнил повторную генерацию (387 файлов, 09-17), в публичные страницы API вошли полная сигнатура блочно-квантованного GEMM, поведенческие соглашения и три инструкционно-уровневых явных варианта; сайт документации TileOPs дважды развёрнут (содержимое не изменилось) и уже обновлён вслед за унифицированной диспетчеризацией и границами компиляции (два набора документации — на китайском и английском).
  • Инструменты сообщества: сторонний репозиторий документации по профилированию производительности TileSight стал публичным (09-17/18), профилирование производительности TileLang подключено к интерфейсам кэша и конвейерного анализа TileSight, проблемы производительности разделены на шесть категорий с требованием различать три уровня силы выводов — «предсказание модели / наблюдение во время выполнения / недостаточно доказательств»; соответствует статье arXiv о модели производительности (07-24, фон вне окна мониторинга).
  • СМИ: NeoTeo сообщил о публичном суждении инженера DeepSeek — в течение 6–12 месяцев ядра, написанные AI, смогут достичь или превзойти его личный уровень (09-16/17); на Huawei Connect 2026 (09-17) объявлены досрочный выпуск Ascend 960 и дорожная карта суперузла Atlas 960, что формирует отраслевой фон темпов адаптации Ascend.
  • Академическая сфера и сообщество: в окне мониторинга ни в arXiv, ни в Hacker News не было новых тематических попаданий; ближайший тематический препринт — статья о моделировании производительности от 07-24.
  • Ритм версий: основной репозиторий v0.1.14 не обновлялся уже 18 дней, теги в адаптационных репозиториях не двигались (подробности во втором разделе).

6. Наблюдения за тенденциями

  1. На стороне NVIDIA появляется второй путь исполнения: бэкенд Tile IR идёт параллельно с текущим путём генерации кода CUDA, и уровень абстракции TileLang начинает напрямую соприкасаться с собственной тайловой абстракцией NVIDIA. Как только он созреет, его ценностное предложение частично сместится с «лучшей генерации кода» к «более полному выражению программы и межбэкендной согласованности», а вопрос о том, кому принадлежат решения по планированию и раскладке, станет долгосрочной темой.
  2. «Тихая ошибка, перенесённая в отказ на этапе компиляции» становится дисциплиной уровня проекта, и критерии уже прописаны: основной репозиторий (атомарная векторизация, генераторы случайных чисел, типы GEMM, доказательство раскладки) и TileOPs (ошибка при передаче неверного ключа, развязка диспетчеризации и тюнинга) изоморфны; основной репозиторий одновременно разделяет два класса отказов — «ограничение возможностей» и «семантическая ошибка пользователя»: первый деградирует и продолжает работу (ограничение ширины копирования), второй приводит к отказу компиляции.
  3. Адаптация бэкендов глубоко связана с «нативными операторами новых моделей»: цепочка k-пула GLM-5.3 и KDA в ROCm, NSA и структуры семейства DeepSeek в Ascend, разреженный MLA FP8 DeepSeek V3.2 на Hopper в основном репозитории — скорость появления характерных для модели операторов на том или ином бэкенде после её выпуска становится прямым показателем зрелости этого бэкенда.
  4. TileOPs эволюционирует в «слой операторов с контрактами и воспроизводимыми сравнениями»: три линии идут параллельно — производительность, контракты и управление метриками; ночные снимки фиксируют воспроизводимые факторы — номер коммита, дайджест образа, тактовую частоту и пределы энергопотребления — достаточно полно, и критерии приёмки движутся в сторону пригодности для производства.
  5. Ритмы отечественных бэкендов расходятся, формы становятся разнообразнее: Ascend сохраняет ежедневные регрессии (единственный, видимый каждый день), Hygon вошёл и закрывает цикл, MetaX и Moore Threads перешли в режим поддержки, Sunrise вошёл в число кандидатов в форме «дистрибутива бэкенда»; степень, в которой удаётся следовать за новейшими возможностями вышестоящего проекта, уже развела участников по дистанции.
  6. Риски и пробелы: застой релизов основного репозитория в течение 18 дней соседствует с накоплением очереди ревью (Tile IR переведён в черновик, цепочка стекирования GLM-5.3 не слита, предложение по Metal, работавшее девять дней, закрыто); данные о производительности являются самоотчётами авторов или вендоров, у нашего издания нет соответствующего оборудования для независимого воспроизведения; в целом среди принимающих сторон по-прежнему тихо (кроме импульса FlashQLA).

Приложение: материалы и пояснения по проверке

  • Материалы: 4 выпуска ежедневного отчёта TileLang за каждый день (09-17, 09-18, 09-19, 09-20). С 09-14 по 09-16 ежедневного отчёта не было (наше издание основано 09-17), этот отрезок восполнен проверкой на уровне организации GitHub и метаданными коммитов; первый выпуск 09-17 был пробным (выполнен вечером того же дня) и примерно на половину дня пересекается с выпуском 09-18, в пересекающейся части выпуск 09-18 даёт только описание состояния.
  • Дополнительная проверка (окно 168 часов, с 09-13 16:00 до 09-20 16:00): полная проверка push во всех 28 репозиториях организации tile-ai — в окне push были в 14 репозиториях; число коммитов в ветке по умолчанию: основной репозиторий tilelang — 16, TileOPs — 23, репозиторий адаптации под Ascend — 19 (ветка ascendc_pto), tilelang-mlir-ascend — 7; статус релизов повторно проверен через интерфейс релизов репозиториев, в окне ни в основном репозитории, ни в адаптационных репозиториях новых версий не было.

Таблица проверки источников

Источники Результаты проверки
Организация tile-ai (28 репозиториев) В окне мониторинга были пуши в 14 репозиториях
Основной репозиторий tilelang 16 коммитов в ветке по умолчанию; новые PR охватывают Tile IR, цепочку операторов моделей ROCm, случайные числа и перехват типов и другие группы, большинство не смержено
TileOPs 23 смерженных коммита; ночные эталонные тесты 1040 пунктов, корректность 1118 пунктов — непрерывно нулевых сбоев
tilelang-ascend 19 коммитов в ветке ascendc_pto; ежедневная регрессия непрерывно проходит четыре дня; новых тегов нет
tilelang-mlir-ascend 7 коммитов в окне мониторинга
MetaX / Hygon / Moore Threads / Sunrise Последние пуши каждой из сторон — с 09-17 по 09-18; во второй половине окна новых коммитов нет
Принимающие стороны (FlashQLA / TileKernels) FlashQLA 09-18 смержено три коммита; TileKernels без пушей
TileRT / другие репозитории организации TileRT статичен семь недель подряд; в TileFoundry и DeepStack по одному-двум коммитам
Новостные и академические каналы В новостных поисках, технических сообществах и каналах препринтов в окне новых тематических материалов нет; единственная медийная запись — репортаж об инженере DeepSeek
Версии и релизы После v0.1.14 основного репозитория (09-02) релиза не было 18 дней; теги в адаптационных репозиториях не менялись
  • Границы проверки: фактические данные по Ascend и MetaX взяты из описаний коммитов и текстов PR по самоотчётам, у данного издания нет соответствующего оборудования и независимого воспроизведения не проводилось; отраслевые новости взяты из публичных сообщений; ночные эталонные показатели — это записи единичного конвейера, а не сравнительное тестирование.
  • Рекомендуемый период следующего выпуска: 2026-09-20 ~ 2026-09-27.