НОВОСТЬ · RESEARCH · #284
Google Research описывает программные оптимизации смешанных входных матричных умножений для NVIDIA Ampere (CUTLASS)
В блоге Google Research (автор — Маниш Гупта) описаны программные приёмы для реализации смешанных входных матричных умножений (например, входы F16 × веса U8) на тензорных ядрах NVIDIA Ampere через преобразование типов данных и согласование макета; решения опубликованы в репозитории NVIDIA/CUTLASS и, по заявлению авторов, добавляют минимальные накладные расходы и близки к пиковой аппаратной производительности. Работа ориентирована на ресурсоёмкие LLM‑нагрузки и поддерживает схемы квантования только весов для уменьшения объёма памяти модели.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В блоге Google Research (автор — Маниш Гупта) описаны программные приёмы для реализации смешанных входных матричных умножений (например, входы F16 × веса U8) на тензорных ядрах NVIDIA Ampere через преобразование типов данных и согласование макета; решения опубликованы в репозитории NVIDIA/CUTLASS и, по заявлению авторов, добавляют минимальные накладные расходы и близки к пиковой аппаратной производительности.
- Работа ориентирована на ресурсоёмкие LLM‑нагрузки и поддерживает схемы квантования только весов для уменьшения объёма памяти модели.
- Эффективная программная реализация смешанных матричных умножений позволяет использовать 8‑битные форматы весов для крупных LLM на существующем GPU‑железе, повышая эффективность развёртывания без изменений аппаратуры.
ПОЧЕМУ ЭТО ВАЖНО
Эффективная программная реализация смешанных матричных умножений позволяет использовать 8‑битные форматы весов для крупных LLM на существующем GPU‑железе, повышая эффективность развёртывания без изменений аппаратуры.