Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #6721

Qwen3-VL-8B

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

COMPANIES · 1 ИСТОЧН. · AWS Machine Learning

Запуск пост‑обучения SkyRL (GRPO) для Qwen3‑VL‑8B на Amazon SageMaker HyperPod

Amazon показала запуск открытой библиотеки SkyRL на SageMaker HyperPod (EKS) для пост‑обучения визуально‑языковой модели Qwen3‑VL‑8B методом Group Relative Policy Optimization (GRPO). На HyperPod Ray‑кластере с общим хранилищем FSx решение повысило процент решения лабиринтов с 43,75% до более чем 95% на фиксированном наборе из 64 лабиринтов, сочетая vLLM‑инференс и FSDP‑шардинг политики с LoRA‑адаптерами.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

CounterCredit проверяет визуальные вызовы, снижая бесполезные просмотры и повышая качество VLM

В работе arXiv:2609.22910v1 предложен CounterCredit — метод, который для каждого возвращающего изображение вызова проверяет, был ли он действительно нужен и использован, вычисляя значение решения (ответ сразу vs. через визуальную ветку) и значение доказательства (сравнение возвращённой обрезки с случайными обрезками того же размера). При тех же исходных условиях CounterCredit обгоняет baseline с outcome-only GRPO: 89,5% на V*, 80,2% на HR-Bench-4K и 76,4% на HR-Bench-8K, снижает долю спurious-вызовов до ~31–36% и поднимает Qwen3-VL-8B с 75,4 до 80,8 в среднем.

7.0