Tech Meridian ← К СУЩНОСТЯМ
EN

КОМПАНИЯ · ENTITY #714

KV cache

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

COMPANIES · 1 ИСТОЧН. · AWS Machine Learning

Amazon SageMaker Inference добавляет маршрутизацию по префиксу для снижения задержки LLM

Amazon SageMaker Inference теперь поддерживает маршрутизацию по префиксу — стратегия, которая направляет запросы с одинаковым префиксом подсказки на один и тот же экземпляр, чтобы KV-кеш оставался «тёплым». В бенчмарках на Llama 3.1 70B это снизило P50 time-to-first-token до 77% и увеличило попадания в KV-кеш примерно с 25% до более 80%.

7.0

MODELS · 1 ИСТОЧН. · DeepSeek

DeepSeek представляет DeepSeek‑V4.1‑Flash с новой причинно‑кодировочной архитектурой и снижением стоимости

DeepSeek объявила DeepSeek‑V4.1‑Flash — меньшую модель с нативным пониманием изображений на новой Causal Encoder–Decoder архитектуре (8B активных параметров для входа, 16B для выхода), обновлённой предобучением и более крупным RL‑посттренингом, а также компрессией KV‑кеша. Компания выводит из эксплуатации варианты V4‑Flash, перенаправит запросы deepseek-v4-pro на V4.1‑Flash с 04:00 UTC 14 сентября 2026 года и вводит новые тарифы с 04:00 UTC 10 сентября 2026 года; партнёры WorkBuddy, CodeBuddy и OpenCode уже поддерживают модель.

8.0