Запуск пост‑обучения SkyRL (GRPO) для Qwen3‑VL‑8B на Amazon SageMaker HyperPod
Amazon показала запуск открытой библиотеки SkyRL на SageMaker HyperPod (EKS) для пост‑обучения визуально‑языковой модели Qwen3‑VL‑8B методом Group Relative Policy Optimization (GRPO). На HyperPod Ray‑кластере с общим хранилищем FSx решение повысило процент решения лабиринтов с 43,75% до более чем 95% на фиксированном наборе из 64 лабиринтов, сочетая vLLM‑инференс и FSDP‑шардинг политики с LoRA‑адаптерами.