Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИНВЕСТИЦИИ · COMPANIES · #1052

Запуск пост‑обучения SkyRL (GRPO) для Qwen3‑VL‑8B на Amazon SageMaker HyperPod

Amazon показала запуск открытой библиотеки SkyRL на SageMaker HyperPod (EKS) для пост‑обучения визуально‑языковой модели Qwen3‑VL‑8B методом Group Relative Policy Optimization (GRPO). На HyperPod Ray‑кластере с общим хранилищем FSx решение повысило процент решения лабиринтов с 43,75% до более чем 95% на фиксированном наборе из 64 лабиринтов, сочетая vLLM‑инференс и FSDP‑шардинг политики с LoRA‑адаптерами.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Amazon показала запуск открытой библиотеки SkyRL на SageMaker HyperPod (EKS) для пост‑обучения визуально‑языковой модели Qwen3‑VL‑8B методом Group Relative Policy Optimization (GRPO).
  2. На HyperPod Ray‑кластере с общим хранилищем FSx решение повысило процент решения лабиринтов с 43,75% до более чем 95% на фиксированном наборе из 64 лабиринтов, сочетая vLLM‑инференс и FSDP‑шардинг политики с LoRA‑адаптерами.
  3. Демонстрирует масштабируемую отказоустойчивую инфраструктуру для пост‑обучения мультимодальных RL‑агентов, которая существенно повышает качество и сохраняет прогресс долгих запусков благодаря чекпоинтам HyperPod и интеграции с Ray.

ПОЧЕМУ ЭТО ВАЖНО

Демонстрирует масштабируемую отказоустойчивую инфраструктуру для пост‑обучения мультимодальных RL‑агентов, которая существенно повышает качество и сохраняет прогресс долгих запусков благодаря чекпоинтам HyperPod и интеграции с Ray.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1