НОВОСТЬ · RESEARCH · #366
Где должен храниться KV-кэш? Политики размещения между GPU, CPU и SSD
Этот препринт на arXiv моделирует многоуровневый KV-кэш между GPU HBM, CPU DRAM и SSD для чатов, агентных циклов и документного Q&A, калиброванный предиктором времени исполнения на основе случайного леса. Авторы показывают, что многоуровневое хранение обеспечивает примерно 73,02× больше одновременно активных сессий на GPU и снижает стоимость сессии в ~62,04×; размещение в основном влияет на трафик миграций по PCIe и время до первого токена (декодирование ограничено вычислениями при batch=1); recency лучше для чатов, reuse-frequency — для агентов и документного Q&A; реализованный «predicted reuse» равен recency, EWMA отличается, но уступает reuse-frequency, а предвыборка (prefetch) не окупает затраты на пропускную способность.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Этот препринт на arXiv моделирует многоуровневый KV-кэш между GPU HBM, CPU DRAM и SSD для чатов, агентных циклов и документного Q&A, калиброванный предиктором времени исполнения на основе случайного леса.
- Авторы показывают, что многоуровневое хранение обеспечивает примерно 73,02× больше одновременно активных сессий на GPU и снижает стоимость сессии в ~62,04×; размещение в основном влияет на трафик миграций по PCIe и время до первого токена (декодирование ограничено вычислениями при batch=1); recency лучше для чатов, reuse-frequency — для агентов и документного Q&A; реализованный «predicted reuse» равен recency, EWMA отличается, но уступает reuse-frequency, а предвыборка (prefetch) не окупает затраты на пропускную способность.
- Результаты помогают практическим решениям по многоуровневому кэшированию для масштабного обслуживания моделей — выявляя большие выгоды от tiering и опровергая некоторые рекомендации по predicted-reuse и prefetch.
ПОЧЕМУ ЭТО ВАЖНО
Результаты помогают практическим решениям по многоуровневому кэшированию для масштабного обслуживания моделей — выявляя большие выгоды от tiering и опровергая некоторые рекомендации по predicted-reuse и prefetch.