Tech Meridian ← К СУЩНОСТЯМ
EN

МОДЕЛЬ · ENTITY #607

DeepSeek

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

8

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Характеристика веб-поиска в разговорных LLM-агентах на четырёх платформах

В препринте arXiv:2609.19244v1 представлено первое исследование агентного веб‑поиска на четырёх платформах (ChatGPT, Claude, Grok, DeepSeek) с сочетанием реальных пользовательских взаимодействий (in vivo) и контролируемых API‑экспериментов (in vitro). Авторы изучают решения об обращении к поиску, стратегии формирования запросов, доменные предпочтения в результатах и преобразование результатов в ответы, отмечая значительные различия между платформами, доменные смещения результатов и случаи ссылок на несконцентрированные/несцитируемые результаты.

7.0

MODELS · 1 ИСТОЧН. · The Decoder

OpenRouter показывает рост еженедельного потребления токенов на 25 000% с января 2025 года

The Decoder сообщает, что еженедельное потребление токенов на OpenRouter выросло с ~0,5 трлн токенов в январе 2025 года до ~126,2 трлн токенов, то есть более чем на 25 000%. Статья отмечает, что это в основном отражает раздутые метрики токенов — например, «мыслительные» токены от reasoning/agent-систем и то, что GPT-5.6 Luna генерирует много токенов на запрос — а не сопоставимый рост числа пользователей или экономической ценности; по доходам лидирует OpenAI Astra, а некоторые китайские модели (Kimi, GLM, DeepSeek) растут быстро с малой базы.

6.0

MODELS · 1 ИСТОЧН. · NVIDIA Developer

Ускорение обучения dropless MoE в JAX с помощью NVIDIA Transformer Engine

NVIDIA Developer рассказывает, как использовать NVIDIA Transformer Engine для ускорения обучения dropless архитектур Mixture‑of‑Experts (MoE) в JAX, приводя детали реализации и рекомендации по интеграции движка с MoE‑моделями. В материале также упоминаются современные MoE‑модели, такие как DeepSeek, Qwen и Mixtral, и рассматриваются практические шаги по повышению эффективности обучения.

6.0

MODELS · 1 ИСТОЧН. · DeepSeek

DeepSeek представляет DeepSeek‑V4.1‑Flash с новой причинно‑кодировочной архитектурой и снижением стоимости

DeepSeek объявила DeepSeek‑V4.1‑Flash — меньшую модель с нативным пониманием изображений на новой Causal Encoder–Decoder архитектуре (8B активных параметров для входа, 16B для выхода), обновлённой предобучением и более крупным RL‑посттренингом, а также компрессией KV‑кеша. Компания выводит из эксплуатации варианты V4‑Flash, перенаправит запросы deepseek-v4-pro на V4.1‑Flash с 04:00 UTC 14 сентября 2026 года и вводит новые тарифы с 04:00 UTC 10 сентября 2026 года; партнёры WorkBuddy, CodeBuddy и OpenCode уже поддерживают модель.

8.0

MODELS · 1 ИСТОЧН. · DeepSeek

DeepSeek выпустила открытый превью DeepSeek‑V4 с контекстом на 1 млн токенов

DeepSeek опубликовала открытое превью DeepSeek‑V4 с двумя вариантами: DeepSeek‑V4‑Pro (1,6T общих / 49B активных параметров) и DeepSeek‑V4‑Flash (284B общих / 13B активных параметров). Компания заявляет, что обе модели по умолчанию поддерживают контекст на 1 млн токенов, используют токенно‑ориентированную компрессию и DSA (DeepSeek Sparse Attention), претендуют на SOTA в агентных и рассуждательных задачах (по утверждению компании уступают только Gemini‑3.1‑Pro), доступны на chat.deepseek.com и через обновлённые API с поддержкой OpenAI ChatCompletions и Anthropic; старые модели deepseek-chat и deepseek-reasoner будут удалены 24 июля 2026 года в 15:59 UTC.

8.0

MODELS · 1 ИСТОЧН. · DeepSeek

DeepSeek представила экспериментальную модель V3.2-Exp с разреженным вниманием и крупным снижением цен на API

DeepSeek представила DeepSeek-V3.2-Exp — экспериментальную модель на базе V3.1-Terminus, в которой используется DeepSeek Sparse Attention (DSA) для повышения эффективности при работе с длинными контекстами при минимальной потере качества; бенчмарки показывают паритет с V3.1-Terminus. Компания также снизила цены на API более чем на 50% с немедленным вступлением в силу, опубликовала GPU-ядра для TileLang и CUDA и временно оставляет V3.1-Terminus в API до 15 октября 2025 г., 15:59 UTC для сравнения.

7.0

MODELS · 1 ИСТОЧН. · DeepSeek

DeepSeek‑V3.1 переименована и выпущена как DeepSeek‑V3.1‑Terminus

Команда DeepSeek выпустила DeepSeek‑V3.1‑Terminus — обновление на базе V3.1 с учётом отзывов пользователей. Обновление включает улучшенную языковую согласованность (меньше смешений CN/EN и отсутствие случайных символов), усиленные Code Agent и Search Agent, а также, по заявлению разработчиков, более стабильные и надёжные результаты в бенчмарках; веса с открытым исходным кодом доступны на Hugging Face.

6.0

MODELS · 1 ИСТОЧН. · DeepSeek

DeepSeek выпустил DeepSeek‑V3.1 с гибридным режимом «Think & Non‑Think» и открытыми весами

DeepSeek выпустил DeepSeek‑V3.1 с гибридным режимом вывода Think & Non‑Think (переключается кнопкой «DeepThink» на chat.deepseek.com), ускоренным «Think»-путём по сравнению с DeepSeek‑R1‑0528, улучшенной работой с инструментами и многошаговыми агентными задачами, поддержкой формата Anthropic API и бета‑версией Strict Function Calling. База V3.1 прошла продолжительную док‑тренировку на 840 млрд токенов для расширения длинного контекста; обновлены токенизатор и шаблон чата (tokenizer_config.json); веса DeepSeek‑V3.1 и DeepSeek‑V3.1‑Base опубликованы на Hugging Face, новые тарифы и окончание скидок по внепиковому времени вступают в силу 5 сен. 2025, 16:00 UTC.

7.0