AWS Machine Learning

새로운 에이전트 스킬: 코딩 에이전트를 위한 Amazon SageMaker 최적화 생성형 AI 추론

Amazon SageMaker 최적화 생성형 AI 추론이 Agent Toolkit for AWS를 통해 aws-ai-ml 스킬을 도입하여, Kiro, Claude Code, Codex와 같은 코딩 에이전트에 추론 최적화 및 벤치마킹에 대한 전문 지식을 제공합니다. 원하는 내용을 설명하기만 하면, 에이전트가 배포를 벤치마킹하고, 추천하고, 비교하는 실행 가능한 SageMaker Python…

엔지니어들은 개발 워크플로를 가속화하기 위해 코딩 지원 도구를 점점 더 많이 사용하고 있습니다. 오늘, Amazon SageMaker AI 최적화 생성형 AI 추론 이 aws-ai-ml 스킬을 Agent Toolkit for AWS를 통해 공개합니다. 이 스킬은 Kiro, Claude Code, Codex와 같은 코딩 에이전트에 추론 최적화 및 벤치마킹에 대한 깊은 전문 지식을 제공합니다. 스킬을 설치하면 기존 에이전트가 여러분을 대신하여 엔드포인트를 벤치마킹하고, 배포 구성을 추천하고, 성능 실행 결과를 비교하고, 실행 가능한 SageMaker Python SDK v3 코드를 생성할 수 있습니다. 이 aws-ai-ml 스킬은 Model Context Protocol(MCP)을 지원하는 모든 코딩 에이전트에 연결되어 이를 SageMaker AI 추론 최적화 전문가로 탈바꿈시키는 툴킷입니다.

이 게시물에서는 이 스킬이 가능하게 하는 것, 설정 방법, 그리고 모델에서 프로덕션까지 더 빠르게 이동하도록 돕는 방법을 살펴봅니다.

과제: 의도와 인프라 사이의 간극 메우기

Amazon SageMaker AI는 실시간, 배치, 비동기 모드 전반에서 서버 기반 호스팅을 지원합니다. 온디맨드 및 예약 용량, 이기종 인스턴스, 가상 프라이빗 클라우드(VPC) 격리, 자동 확장, 그리고 모든 SageMaker AI 학습 경로와의 통합을 제공합니다. 그 범위는 방대하고 깊지만, 대부분의 엔지니어는 어떤 인스턴스 패밀리나 서빙 컨테이너가 자신의 필요에 가장 적합한지 알고 시작하지 않습니다. 이들은 사용 사례를 가지고 다가옵니다. 달성하고자 하는 성능 목표, 준수해야 하는 비용 한도, 또는 프로덕션에 투입하기 전에 평가해야 하는 모델을 가지고 옵니다.

SageMaker AI 최적화 생성형 AI 추론을 위한 에이전틱 경험이 이 간극을 메웁니다. 여러분이 에이전트에게 달성하고자 하는 것을 알리면, 에이전트는 여러분의 환경에서 검토하고, 수정하고, 실행할 수 있는 실행 가능한 SageMaker Python SDK v3 코드를 생성합니다. 에이전트는 목표에 맞는 명확화 질문을 하고, 실제 벤치마크와 측정된 성능 데이터에 기반한 코드를 생성하며, 솔루션 아키텍트처럼 비즈니스 제약 조건에 맞춰 조정합니다.

전 과정에서 여러분이 통제권을 유지합니다. 모든 단계는 실시간으로 표시되며 읽고 질문할 수 있는 코드로 표현됩니다. 불투명한 UI 뒤에서 일어나는 일은 없습니다.

시작하기

로컬 머신에서 aws-ai-ml 스킬을 Agent Toolkit for AWS 를 통해 설치하거나, Amazon SageMaker Studio JupyterLab 공간 내에서 사용할 수 있습니다. 어느 쪽이든 10분 만에 아무것도 없는 상태에서 동작하는 대화까지 진행할 수 있습니다.

옵션 A: 모든 코딩 에이전트와 함께 사용 (Kiro, Claude Code, Codex 또는 기타 MCP 호환 에이전트)

1단계: Agent Toolkit for AWS를 설치합니다. 아직 설정하지 않았다면 Agent Toolkit을 설정하세요. 이를 위해서는 AWS Command Line Interface(AWS CLI) 2.35+ 및 uv 설치가 필요합니다.

aws configure agent-toolkit

이 도구는 여러분의 에이전트를 자동으로 감지하고, 스킬을 설치하며, AWS MCP Server를 구성합니다. 에이전트별 설정(플러그인 설치 명령, MCP 구성)에 대해서는 Agent Toolkit for AWS 시작 가이드.

를 참조하세요. 2단계: aws-ai-ml 스킬을 설치합니다. SageMaker AI 최적화 생성형 AI 추론 스킬을 에이전트에 추가합니다:

npx skills add aws/agent-toolkit-for-aws/skills/aws-ai-ml

3단계: 확인 및 시작. 코딩 에이전트의 채팅 패널을 열고 “어떤 스킬을 사용할 수 있나요?”라고 물어보세요. aws-ai-ml 가 표시되어야 합니다. 확인한 후, 자연어로 의도를 설명하세요. 이제 코딩 에이전트에 SageMaker AI 추론 최적화 전문 지식이 내장되었습니다.

사전 요구 사항: AWS 자격 증명에 SageMaker AI API를 호출할 수 있는 권한(엔드포인트 생성, 벤치마크 및 추천 작업 실행)이 있어야 합니다. 이 스킬은 사용자의 자격 증명으로 실행되는 코드를 생성합니다. 스킬 자체에 대해서는 추가적인 AWS Identity and Access Management(IAM) 구성이 필요하지 않습니다.

참고: Kiro와 Claude Code의 경우, 에이전트가 런타임에 스킬을 발견할 수 있습니다. 에이전트는 AWS MCP Server를 통해 로컬 설치 없이 필요할 때 스킬을 검색하고 로드할 수 있습니다. 에이전트에게 “데이터베이스와 관련된 AWS 스킬을 검색해 줘.”라고 요청하세요. 런타임에 스킬을 발견하는 방법은 readme 를 참조하세요.

옵션 B: Amazon SageMaker Studio 내에서 사용

관리형 JupyterLab 환경에서 작업하는 것을 선호한다면, 사전 구성된 이미지를 사용하여 Amazon SageMaker Studio에서 이 스킬을 사용할 수 있습니다.

1단계: Amazon SageMaker Studio를 엽니다. 대상 AWS 계정 및 AWS 리전에서 Amazon SageMaker Studio로 이동합니다. Studio 도메인을 선택하고 사용자 프로필에서 Studio IDE를 시작합니다.

2단계: JupyterLab 공간을 생성합니다. Studio 랜딩 페이지에서 다음을 선택하세요 JupyterLab, 다음으로 선택하세요 JupyterLab 스페이스 생성. 공간 이름을 지정하세요(예: my-inference-opt) 및 공유 설정을 유지하세요 비공개 (스킬은 비공개 스페이스에서만 동기화됨). 아래 이미지 menu에서 SageMaker AI 최적화 생성형 AI 추론 스킬이 포함된 이미지를 선택합니다. 이 이미지에는 다음이 사전 구성되어 함께 제공됩니다. aws-ai-ml 에이전트 스킬과 필요한 모든 의존성을 설치합니다. Choose 실행 공간 부팅을 기다리세요(첫 부팅 시 5–10분 소요).

참고: 새로운 공간을 사용하십시오. 스킬 버전이 로컬에서 수정된 재사용 공간에서는 사전 구성된 이미지가 적용되지 않을 수 있습니다.

3단계: JupyterLab을 열고 터미널을 실행합니다. 우주 부츠(스페이스 부츠) 이후에는 JupyterLab을 열고 선택하세요 터미널.

Step 4: 코딩 에이전트를 승인하세요. 터미널에서 여러분의 코딩 에이전트를 ID 공급자로 인증하세요. 예를 들어, Kiro의 경우:

kiro-cli login --license pro --identity-provider <your-IdP-start-URL> --region us-east-1 --use-device-flow

5단계: 확인 후 시작합니다. 코딩 에이전트의 채팅 패널을 열고 이렇게 물어보세요: “어떤 스킬을 사용할 수 있나요?” 그러면 다음이 표시됩니다 aws-ai-ml 표시됩니다. 확인되면 자연어로 의도를 설명하세요.

문제 해결:

에이전트가 사용 가능한 스킬이 없다고 보고하면 스페이스가 비공개(Private)로 설정되어 있는지 확인하세요. 터미널에서도 확인할 수 있습니다:

ls ~/.kiro/skills/

해당 디렉터리가 비어 있지만 /etc/sagemaker/skills/ 에 스킬 파일이 있는 경우 restart-jupyter-server를 실행하고, 페이지를 새로 고친 후 다시 시도하세요.

할 수 있는 작업

에이전틱 경험은 추론 최적화 수명 주기 전반에 걸쳐 다음과 같은 기능들을 다룹니다. 어떤 기능을 호출해야 하는지 알 필요가 없습니다. 원하는 것을 설명하면 에이전트가 다음 단계를 파악하거나, 불명확한 부분이 있으면 명확히 하는 질문을 합니다.

기존 엔드포인트 벤치마크

이미 SageMaker AI 엔드포인트에 모델을 배포한 경우, 에이전트에게 벤치마크를 요청할 수 있습니다. 테스트하려는 엔드포인트를 에이전트에게 알려주면, SageMaker Python SDK의 Workload.synthetic() 및 start_benchmark() API를 사용하여 부하 테스트를 실행하는 Python 노트북을 생성합니다.

벤치마크를 실행하기 전에, 에이전트는 엔드포인트가 부하 테스트에 안전한지 확인합니다. 벤치마킹은 실제 트래픽을 라이브 엔드포인트로 전송하기 때문입니다.

벤치마크가 완료되면 다음 항목을 포함한 정량적 성능 보고서를 받게 됩니다:

  • 처리량: 초당 요청 수, 초당 출력 토큰 수.
  • 지연 시간: p50, p99, time-to-first-token, inter-token latency.
  • 동시성: 지원되는 동시 요청 수.

이는 추정치가 아니라 실제 인프라의 실제 부하에서 측정된 값입니다. 에이전트는 또한 성능을 향상시키기 위한 개선 메커니즘(예: prefill decoding)을 권장합니다.

예시 프롬프트: “SageMaker AI에서 내 Llama 엔드포인트를 벤치마크해줘.”

모델에 적합한 인스턴스 유형 찾기

모델이 있고 이를 SageMaker AI에 배포하기 위한 적절한 인스턴스 유형을 찾아야 하는 경우, 에이전트에게 알려주면 됩니다. 모델이 어디에 있고 어떻게 얻었는지는 중요하지 않습니다:

  • Amazon Simple Storage Service(Amazon S3)의 파인튜닝된 또는 커스텀 모델: 모델을 학습하거나 다운로드하여 S3에 저장한 경우입니다. S3 URI와 최적화 목표를 제공하세요. 예시 프롬프트: “파인튜닝한 모델을 SageMaker에 배포하기 위해 가장 저렴한 인스턴스 유형을 찾고 싶어.”
  • 다음에서 공개적으로 이용 가능한 파운데이션 모델: Amazon SageMaker JumpStart: JumpStart 카탈로그에서 파운데이션 모델(FM)을 배포하려는 경우 모델 ID를 제공하세요. 예시 프롬프트: “SageMaker AI에서 huggingface-reasoning-qwen3-8b 모델에 가장 적합한 인스턴스를 찾아줘.”
  • 다음에 있는 모델: Hugging Face Hub: Hugging Face에서 호스팅되는 모델을 사용하려는 경우 모델 이름을 제공하세요. 게이트 모델(예: Llama 변형)의 경우, 에이전트가 라이선스 조건을 표시하고 이를 수락하고 Hugging Face 토큰을 제공하도록 요청합니다. 예시 프롬프트: “Hugging Face Hub에서 Llama 모델을 배포하고 싶어. 가장 저렴한 옵션이 뭐야?”

모든 경우에 에이전트는 후보 인스턴스 및 구성에 대해 모델을 평가하는 코드를 생성한 다음, 처리량, 지연 시간 백분위수, time-to-first-token, 동시성 등 구체적인 성능 지표와 함께 순위가 매겨진 배포 옵션을 제시합니다. 비용 및 성능 요구 사항에 따라 선택하시면 됩니다.

벤치마크 실행 결과 비교

여러 벤치마크를 실행한 경우(예: 구성 변경 전후, 또는 두 인스턴스 유형 간), 에이전트에게 비교를 요청할 수 있습니다. 두 벤치마크 작업 이름을 제공하면 에이전트가 처리량, 지연 시간 백분위수, time-to-first-token 등 주요 지표의 델타를 계산하는 비교 결과를 생성합니다.

결과는 백분율 변화로 표시되며, 양수는 더 나음을 의미합니다. 이를 통해 변경 사항이 성능을 향상시켰는지, 저하시켰는지, 아니면 의미 있는 영향이 없었는지를 하나의 해석 가능한 요약으로 알려줍니다.

벤치마크 실행 중 하나가 존재하지 않으면, 에이전트는 비교를 진행하기 전에 먼저 해당 실행을 수행할 것을 제안합니다.

예시 프롬프트: “벤치마크 실행이 두 개 있는데 비교하고 싶습니다. 어느 쪽이 더 빠릅니까?”

벤치마크 결과

이 표는 동일한 벤치마크 워크로드(512/256 토큰, 동시성 4)에서 배포된 두 모델을 비교합니다. Δ% 열은 각 지표에서 Model B(Qwen3-8B)가 Model A(Qwen3-1.7B)보다 얼마나 빠른지를 보여줍니다. 양수 값은 Model B가 더 좋다는 의미입니다.

측정 지표 Qwen3-1.7B (모델 A) Qwen3-8B (모델 B) Δ%
출력 토큰 처리량 188.2 tokens/s 271.2 tokens/s +44.1%
사용자당 처리량 47.5 tokens/s 69.4 토큰/초 +45.9%
요청 처리량 0.736 req/s 1.08 req/s +46.7%
토큰 간 지연 시간 20.9 ms 14 ms +33.0%
요청 지연 시간 5,382 ms 3,658 ms +32.0%
첫 토큰 생성까지 걸리는 시간 67.5 ms 166.3 ms −146.5%

두 모델은 서로 다른 하드웨어에서 구동됩니다. Qwen3-8B는 4-GPU를 사용합니다. ml.g5.12xlarge (4x A10G), 반면 Qwen3-1.7B는 단일 L4 GPU를 사용합니다 (ml.g6.4xlarge). 이러한 성능 차이는 모델 자체가 아니라 약 4배의 컴퓨팅을 반영한 것입니다.

핵심 요약: Qwen3-8B는 약 44–47% 더 높은 처리량과 낮은 엔드투엔드 지연 시간을 제공하며, 이는 주로 추가적인 GPU 컴퓨팅 덕분입니다. Qwen3-1.7B는 첫 토큰 생성 시간(time-to-first-token)에서만 우세한데, 이는 단일 GPU에서 더 작은 모델이 기대되는 이점입니다.

모든 내용을 종합하기

기능 이름을 외우거나 어떤 워크플로우를 요청해야 하는지 알 필요가 없습니다. 다음 표는 일반적인 요청이 어떤 결과로 이어지는지 보여줍니다.

입력 내용 결과물
“이미 모델을 배포했고 속도가 얼마나 빠른지 알고 싶습니다.” 정량적 성능 보고서: 실제 부하에서 측정한 처리량, 지연 시간 백분위수, 동시성 지표.
"S3에 모델이 있는데 어떤 인스턴스에 배포해야 할지 모르겠어요." 각 후보 구성에 대한 비용, 처리량, 지연 시간이 포함된 순위별 배포 옵션.
"JumpStart 모델을 배포하고 가장 저렴한 인스턴스를 찾고 싶습니다. 모델 ID만 가지고 있습니다." 순위가 매겨진 배포 옵션, S3 스테이징 불필요. 필요한 경우 게이트 모델의 대안 제공.
"변경 전후로 벤치마크를 실행했습니다. 어느 쪽이 더 빠른가요?" 모든 메트릭에서 개선 또는 성능 저하를 나타내는 백분율 변화.
"Hugging Face Hub에서 Llama 모델을 최적화하고 싶습니다." 라이선스 제공, S3로 모델 스테이징, 이후 표준 권장 사항 출력.

요청이 여러 기능에 걸쳐 있는 경우(예: Hugging Face 모델을 스테이징한 후 배포 권장 사항 받기), 에이전트는 동일한 대화 내에서 이를 자연스럽게 연결하여 처리합니다.

에이전트에서 기대할 수 있는 것

에이전트는 aws-ai-ml 스킬을 갖추고 다음과 같은 몇 가지 동작을 따라 예측 가능하고 안전한 경험을 제공합니다:

  • 필요한 것을 요청합니다. 정보가 누락된 경우(엔드포인트 이름 또는 S3 URI 등), 에이전트는 추측하는 대신 해당 정보를 제공하도록 요청합니다.
  • 영향이 큰 작업 전에 확인을 요청합니다. 라이브 엔드포인트로 실제 트래픽을 유발하는 벤치마크를 실행하기 전에, 에이전트는 그 영향에 대해 경고하고 명시적인 확인을 요청합니다.
  • 범위를 벗어난 작업임을 알려줍니다. 에이전트가 할 수 없는 작업(예: 모델 배포)을 요청하면, 에이전트는 대신 제공할 수 있는 것(예: 필요한 배포 구성 생성)을 설명합니다.
  • SageMaker Python SDK v3 코드를 생성합니다. 모든 출력은 검사하고, 수정하고, 자신의 환경에서 실행할 수 있는 실행 가능한 코드입니다.

정리

지속적인 요금 청구를 피하려면 생성한 리소스를 삭제하세요:

결론

Amazon SageMaker AI 최적화 생성형 AI 추론용 aws-ai-ml 스킬은 기존 코딩 에이전트를 SageMaker AI 추론 최적화 전문가로 바꿔줍니다. 라이브 엔드포인트 벤치마킹, 모델에 가장 저렴한 인스턴스 찾기, 구성 비교, 평가용 Hugging Face 모델 스테이징 등 무엇이 필요하든 원하는 것을 설명하기만 하면 에이전트가 측정 가능한 결과를 제공합니다.

시작하려면 Agent Toolkit for AWS 를 통해 스킬을 설치하고 이미 사용 중인 코딩 에이전트에 추가하거나, Amazon SageMaker Studio에서 사전 구성된 JupyterLab 스페이스를 시작하세요. 자세한 내용은 다음을 참조하세요: Amazon SageMaker AI 설명서.


저자 소개

원문 출처

AWS Machine Learning

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요