Amazon SageMaker HyperPod에서 SkyRL로 멀티모달 RL 훈련 가속화
오픈 소스 강화 학습 프레임워크인 SkyRL을 Amazon SageMaker HyperPod에서 실행하여 GRPO로 Qwen3-VL-8B 비전-언어 모델을 포스트 트레이닝하는 방법을 알아봅니다. 이 워크스루에서는 컨테이너 이미지 빌드, SageMaker Studio에서 Ray 클러스터 시작, 작업 제출 및 모니터링, 훈련된 LoRA 어댑터를 추론용으로 호스팅하는 과정을 다룹니다.


















