Tech Meridian ← К СУЩНОСТЯМ
EN

МОДЕЛЬ · ENTITY #3475

DeepSeek Sparse Attention (DSA)

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

MODELS · 1 ИСТОЧН. · DeepSeek

DeepSeek выпустила открытый превью DeepSeek‑V4 с контекстом на 1 млн токенов

DeepSeek опубликовала открытое превью DeepSeek‑V4 с двумя вариантами: DeepSeek‑V4‑Pro (1,6T общих / 49B активных параметров) и DeepSeek‑V4‑Flash (284B общих / 13B активных параметров). Компания заявляет, что обе модели по умолчанию поддерживают контекст на 1 млн токенов, используют токенно‑ориентированную компрессию и DSA (DeepSeek Sparse Attention), претендуют на SOTA в агентных и рассуждательных задачах (по утверждению компании уступают только Gemini‑3.1‑Pro), доступны на chat.deepseek.com и через обновлённые API с поддержкой OpenAI ChatCompletions и Anthropic; старые модели deepseek-chat и deepseek-reasoner будут удалены 24 июля 2026 года в 15:59 UTC.

8.0

MODELS · 1 ИСТОЧН. · DeepSeek

DeepSeek представила экспериментальную модель V3.2-Exp с разреженным вниманием и крупным снижением цен на API

DeepSeek представила DeepSeek-V3.2-Exp — экспериментальную модель на базе V3.1-Terminus, в которой используется DeepSeek Sparse Attention (DSA) для повышения эффективности при работе с длинными контекстами при минимальной потере качества; бенчмарки показывают паритет с V3.1-Terminus. Компания также снизила цены на API более чем на 50% с немедленным вступлением в силу, опубликовала GPU-ядра для TileLang и CUDA и временно оставляет V3.1-Terminus в API до 15 октября 2025 г., 15:59 UTC для сравнения.

7.0