エンジニアは開発ワークフローを加速するために、コーディング支援ツールをますます利用するようになっています。本日、 Amazon SageMaker AI 最適化生成 AI 推論 は、 aws-ai-ml スキルを Agent Toolkit for AWSを通じて提供開始しました。このスキルにより、 Kiro、Claude Code、Codex などのコーディングエージェントに、推論の最適化とベンチマークに関する深い専門知識が与えられます。スキルをインストールすれば、既存のエージェントがエンドポイントのベンチマーク、デプロイ構成の推奨、パフォーマンス実行の比較を行い、お客様に代わって実行可能な SageMaker Python SDK v3 コードを生成できます。 aws-ai-ml スキルは、Model Context Protocol (MCP) に対応するあらゆるコーディングエージェントにプラグインできるツールキットであり、エージェントを SageMaker AI 推論最適化のエキスパートに変えます。
この記事では、このスキルでできること、セットアップ方法、そしてモデルから本番環境への移行を加速する方法について解説します。
課題:意図とインフラの橋渡し
Amazon SageMaker AI は、リアルタイム、バッチ、非同期の各モードにわたるサーバーレスホスティングをサポートしています。オンデマンドおよび予約容量、異種インスタンス、Virtual Private Cloud (VPC) 分離、自動スケーリング、そしてすべての SageMaker AI トレーニングパスとの統合を提供します。その対応範囲は広く奥深いのですが、ほとんどのエンジニアは、どのインスタンスファミリーやサービングコンテナが自分のニーズに最適かを知った上で使い始めるわけではありません。彼らはユースケース、つまり達成したいパフォーマンス目標、守るべきコスト上限、あるいは本番投入前に評価すべきモデルを持ってやってきます。
SageMaker AI 最適化生成 AI 推論のエージェント体験は、このギャップを埋めます。達成したいことをエージェントに伝えると、レビュー、修正、自分の環境での実行が可能な実行可能な SageMaker Python SDK v3 コードが生成されます。エージェントは的確な確認質問を行い、実際のベンチマークと実測パフォーマンスデータに基づいたコードを生成し、ソリューションアーキテクトのようにビジネス上の制約に適応します。
その間ずっと、お客様がコントロールを握ります。すべてのステップはリアルタイムで可視化され、読んで確認できるコードとして表現されます。不透明な UI の背後で何かが行われることはありません。
はじめに
スキルを aws-ai-ml Agent Toolkit for AWS からローカルマシンにインストールすることも、Amazon SageMaker Studio JupyterLab スペース内で使用することもできます。どちらの場合でも、10 分でゼロから動作する会話まで進められます。 ローカルマシン上で使用するか、Amazon SageMaker Studio の JupyterLab スペース内で使用できます。どちらの場合でも、ゼロの状態から実際に動作する会話まで 10 分で到達できます。
ステップ 1:Agent Toolkit for AWS をインストールする。
ステップ 1: Agent Toolkit for AWS をインストールする。 まだの場合は、Agent Toolkit をセットアップしてください。これには AWS Command Line Interface (AWS CLI) 2.35+ と のインストールが必要です。 これにより、エージェントの自動検出、スキルのインストール、AWS MCP Server の構成が行われます。エージェント固有のセットアップ(プラグインインストールコマンド、MCP 設定)については、
aws configure agent-toolkit
Agent Toolkit for AWS スタートガイド を参照してください。.
ステップ 2: aws-ai-ml スキルをインストールする。 SageMaker AI 最適化生成 AI 推論スキルをエージェントに追加します:
npx skills add aws/agent-toolkit-for-aws/skills/aws-ai-ml
ステップ 3: 確認して開始する。 コーディングエージェントのチャットパネルを開き、「利用可能なスキルは何ですか?」と尋ねてください。 aws-ai-ml が表示されるはずです。確認できたら、意図を自然言語で記述してください。コーディングエージェントには、SageMaker AI の推論最適化に関する専門知識が組み込まれています。
前提条件: AWS 認証情報に、SageMaker AI API を呼び出す権限(エンドポイントの作成、ベンチマークおよびレコメンデーションジョブの実行)が必要です。このスキルは、お客様の認証情報のもとで実行されるコードを生成します。スキル自体に追加の AWS Identity and Access Management (IAM) 設定は必要ありません。
注: Kiro と Claude Code の場合、エージェントは実行時にスキルを検出できます。これらのエージェントは、ローカルにインストールすることなく、 AWS MCP Serverを通じて必要に応じてスキルを検索し、読み込むことができます。エージェントに「データベースに関連する AWS スキルを検索して」と尋ねてください。実行時のスキル検出については、 readme を参照してください。
オプション B: Amazon SageMaker Studio 内で使用する
マネージド JupyterLab 環境の中で作業することを好む場合は、事前設定済みのイメージを使用して、Amazon SageMaker Studio でこのスキルを使用できます。
ステップ 1: Amazon SageMaker Studio を開く。 ターゲットの AWS アカウントと AWS リージョンで Amazon SageMaker Studio に移動します。Studio ドメインを選択し、ユーザープロファイルから Studio IDE を起動します。
ステップ2:JupyterLabスペースを作成します。 Studioのランディングページから選択します JupyterLab「、次に選択します」 JupyterLabスペースを作成。スペースに名前を付けます(例えば、 my-inference-opt)し、共有設定を維持してください 非公開 (スキルはプライベートスペースでのみ同期されます)。以下の 画像 menuで、SageMaker AI最適化の生成AI推論スキルが含まれるイメージを選択します。このイメージには、あらかじめ設定された aws-ai-ml エージェントスキルと必要な依存関係すべて。Choose 実行スペース 起動するのを待ちます(初回は5~10分かかります)。
注: 新しいスペースを使用してください。ローカルで変更された skill バージョンがある再利用のスペースでは、事前設定されたイメージが反映されない場合があります。
ステップ 3: JupyterLabを開き、ターミナルを起動します。 スペースブーツの後、JupyterLabを開いて選択します ターミナル.
ステップ 4: コーディングエージェントを認可します。 ターミナルで、アイデンティティプロバイダーを使用してコーディングエージェントの認証を行います。例えば、Kiroの場合:
kiro-cli login --license pro --identity-provider <your-IdP-start-URL> --region us-east-1 --use-device-flow
ステップ5:確認して開始します。 コーディングエージェントのチャットパネルを開いて、「どんなスキルが利用可能ですか?」と尋ねてください。次のように表示されるはずです aws-ai-ml リストに表示されます。確認が取れたら、自然な言葉で意図を記述してください。
トラブルシューティング:
エージェントが利用可能なスキルがないと報告する場合は、スペースが以下に設定されているか確認してください。 非公開。ターミナルからも確認できます:
ls ~/.kiro/skills/
そのディレクトリが空であるのに
/etc/sagemaker/skills/スキルファイルが含まれており、実行しますrestart-jupyter-serverページを更新してから、再試行してください。
できること
エージェント型エクスペリエンスは、推論最適化のライフサイクル全体にわたって以下の機能をカバーします。どの機能を呼び出せばよいかを知る必要はありません。やりたいことを記述すれば、エージェントが次のステップを判断するか、不明な点があれば確認のための質問をします。
既存のエンドポイントをベンチマークする
既にSageMaker AIエンドポイントにモデルをデプロイしている場合は、エージェントにベンチマークを依頼できます。テストしたいエンドポイントをエージェントに伝えると、 を使用して負荷テストを実行するPythonノートブックを生成します。 Workload.synthetic() および start_benchmark() SageMaker Python SDK の API。
ベンチマークを実行する前に、エージェントはエンドポイントが負荷テストに耐えられるものであるかを確認します。ベンチマークでは実際のトラフィックが稼働中のエンドポイントに送られるためです。
ベンチマークが完了すると、以下を含む定量的なパフォーマンスレポートが得られます:
- スループット:1秒あたりのリクエスト数、1秒あたりの出力トークン数。
- レイテンシ「: p50、p99、time-to-first-token、inter-token latency。」
- 並行性:同時にサポートされるリクエスト数。
これらは実際のインフラ上の実際の負荷から測定された値であり、推定値ではありません。エージェントはまた、パフォーマンスを向上させるための改善メカニズム(prefill decodingなど)も推奨します。
プロンプトの例: 「SageMaker AI上の私のLlamaエンドポイントをベンチマークしてください。」
モデルに適したインスタンスタイプを見つけましょう
モデルをお持ちで、それを SageMaker AI にデプロイする適切なインスタンスタイプを見つける必要がある場合は、エージェントに伝えてください。モデルがどこにあるか、どうやって入手したかは問いません:
- 「Amazon Simple Storage Service (Amazon S3) 内のファインチューニング済みまたはカスタムモデル」提供されたモデルをS3に保存した後、S3のURIと最適化目標を指定するだけです。プロンプト例: 「SageMakerにファインチューニングしたモデルをデプロイするのに、最も安いインスタンスタイプを見つけたい。」
- 公開されている基盤モデルの出典は Amazon SageMaker JumpStart: JumpStart カタログから基盤モデル(FM)をデプロイし、モデル ID を指定します。プロンプトの例: 「SageMaker AI でモデル huggingface-reasoning-qwen3-8b に最適なインスタンスを見つけてください。」
- Model on the Hugging Face Hub: Hugging Face でホストされているモデルを使用したい場合を考えます。モデル名を指定してください。ゲート付きモデル(Llama 系など)の場合、エージェントはライセンス条項を提示し、同意と Hugging Face トークンの提供を求めます。プロンプトの例: 「Hugging Face HubからLlamaモデルをデプロイしたいのですが、一番安い選択肢は何ですか?」
どのような場合でも、エージェントは候補となるインスタンスや構成に対してモデルを評価するコードを生成し、その後、スループット、レイテンシのパーセンタイル、初回トークン生成時間、同時実行数といった具体的なパフォーマンス指標とともに、ランク付けされたデプロイメントの選択肢を提示します。ユーザーはコストとパフォーマンスの要件に基づいて選択します。
ベンチマーク実行を比較する
複数のベンチマークを実行した場合(たとえば設定変更の前後で、あるいは2つのインスタンスタイプ間で)、エージェントにそれらの比較を依頼できます。2つのベンチマークジョブ名を指定すると、エージェントはスループット、レイテンシのパーセンタイル、time-to-first-token といった主要メトリックの差分を算出する比較を生成します。
その結果は、正の値が良いことを意味するパーセンテージ変化として表示され、あなたの変更がパフォーマンスを改善したのか、低下させたのか、あるいは意味のある影響がなかったのかを、単一の解釈しやすい要約で示します。
ベンチマーク実行のいずれかが存在しない場合、エージェントは比較に進む前に、まずそれを実行することを提案します。
プロンプト例: 「2つのベンチマーク実行があり、それらを比較したいです。どちらが速いですか?」
ベンチマーク結果
この表は、同じベンチマークワークロード(512/256トークン、同時実行数4)における2つのデプロイ済みモデルを比較したものです。Δ%の列は、各メトリックにおいてModel B(Qwen3-8B)がModel A(Qwen3-1.7B)よりどれだけ速いかを示しています。正の値はModel Bの方が優れていることを意味します。
| 指標 | Qwen3-1.7B(モデルA) | Qwen3-8B(モデルB) | Δ% |
| 出力トークンのスループット | 188.2 tokens/s | 271.2トークン/秒 | +44.1% |
| ユーザーあたりのスループット | 47.5 tokens/s | 69.4トークン/秒 | +45.9% |
| リクエストスループット | 0.736 req/s | 1.08 req/s | +46.7% |
| トークン間レイテンシ | 20.9 ms | 14 ms | +33.0% |
| リクエストレイテンシ | 5,382 ms | 3,658 ms | +32.0% |
| 最初のトークンまでの時間 | 67.5 ms | 166.3 ms | −146.5% |
両モデルは異なるハードウェア上で動作する。Qwen3-8Bは4-GPUの ml.g5.12xlarge (A10G 4基)、一方 Qwen3-1.7B は L4 GPU 1基を使用します(ml.g6.4xlarge)。これらの差分は、モデル自体ではなく、約4倍の計算量を反映したものです。
要点:Qwen3-8Bは約44〜47%高いスループットと低いエンドツーエンドレイテンシを実現しており、その大部分は追加のGPUコンピュートの恩恵によるものです。Qwen3-1.7Bが優位に立つのは最初のトークンが出るまでの時間のみで、これは単一GPUにおいてより小さいモデルが持つ期待通りの利点です。
すべてをまとめる
ケイパビリティ名を暗記したり、どのワークフローを要求すればよいかを知っておく必要はありません。次の表は、よくあるリクエストがどの結果に対応するかを示しています。
| あなたは言う | 特典の内容 |
| 「すでにモデルをデプロイ済みで、その速度がどれほどかを知りたいんです。」 | 定量的パフォーマンスレポート:実負荷におけるスループット、レイテンシのパーセンタイル、同時実行数メトリクス。 |
| 「S3にモデルがあるのですが、どのインスタンスにデプロイすればよいかわかりません。」 | 各候補構成のコスト、スループット、レイテンシを示した、ランク付けされたデプロイオプション。 |
| 「JumpStartモデルをデプロイして、最も安いインスタンスを見つけたいです。モデルIDしか持っていません。」 | ランク付けされたデプロイオプション、S3ステージングは不要。必要に応じてゲート付きモデルの代替案が提示されます。 |
| 「変更前と変更後でベンチマークを実行しました。どちらが速いですか?」 | 改善または後退を示す全指標にわたる変化率。 |
| 「Hugging Face HubのLlamaモデルを最適化したい。」 | ライセンスを可視化し、モデルをS3へステージングした後、標準的なレコメンデーション出力を行います。 |
リクエストが複数の機能にまたがる場合(たとえば、Hugging Face モデルをステージングした後、デプロイの推奨を取得するような場合)、エージェントは同じ会話の中でそれらを自然につなげて処理します。
エージェントから期待できること
あなたのエージェントは、 aws-ai-ml スキルは、体験を予測可能で安全にするいくつかの振る舞いに従います:
- 必要なものを求めます。 情報(エンドポイント名やS3 URIなど)が不足している場合、エージェントは推測するのではなく、提供を求めてきます。
- 影響の大きいアクションの前に確認を行います。 本番稼働中のエンドポイントに実際のトラフィックを送るベンチマークを実行する前に、エージェントは影響について警告し、明示的な確認を求めます。
- 何かがスコープ外であるときにそれを教えてくれます。 エージェントにできないこと(モデルのデプロイなど)を依頼すると、代わりに、必要なデプロイ構成の生成といった、提供可能な内容を説明してくれます。
- SageMaker Python SDK v3 のコードを生成します。 出力はすべて実行可能なコードであり、各自の環境で確認、修正、実行できます。
クリーンアップ
継続的な課金を避けるため、作成したリソースを削除してください:
- SageMaker AIエンドポイントの削除 ベンチマークや推奨事項の作成中に生成されたものです。
- JupyterLabスペースの停止または削除 SageMaker Studio を使用した場合。
- S3オブジェクトを削除する SageMaker AI のデフォルトバケットにベンチマークおよびレコメンデーションジョブによって保存されます。
結論
この aws-ai-ml Amazon SageMaker AI 最適化生成 AI 推論向けスキルは、既存のコーディングエージェントを SageMaker AI 推論最適化のエキスパートに変えます。稼働中のエンドポイントのベンチマーク、モデルに最も安価なインスタンスの検索、構成の比較、評価のための Hugging Face モデルの準備など、やりたいことを記述すれば、エージェントが測定可能な結果を届けます。
始めるには、スキルを Agent Toolkit for AWS からインストールして、既に使用しているコーディングエージェントに追加するか、Amazon SageMaker Studio で事前構成済みの JupyterLab スペースを起動します。詳細については、以下を参照してください: Amazon SageMaker AI ドキュメント.