Les ingénieurs utilisent de plus en plus d'outils d'assistance au codage pour accélérer leurs flux de travail de développement. Aujourd'hui, Inférence d'IA générative optimisée par Amazon SageMaker AI présente le aws-ai-ml compétence, disponible via le Boîte à outils d'agent pour AWS« Cette compétence permet aux agents de codage comme Kiro, Claude Code, et Codex une expertise approfondie en optimisation d'inférence et en benchmarking. Installez la compétence, et votre agent existant pourra benchmarker des points de terminaison, recommander des configurations de déploiement, comparer des exécutions de performances et générer du code exécutable SageMaker Python SDK v3 en votre nom. La aws-ai-ml skill est une boîte à outils qui se connecte à n'importe quel agent de codage prenant en charge le Model Context Protocol (MCP), le transformant en un expert de l'optimisation de l'inférence SageMaker AI.
Dans cet article, nous expliquons ce que permet la compétence, comment la configurer et comment elle vous aide à passer plus rapidement du modèle à la production.
Le défi : relier l'intention et l'infrastructure
Amazon SageMaker AI prend en charge l'hébergement serverful selon les modes temps réel, par lots et asynchrone. Il offre une capacité à la demande et réservée, des instances hétérogènes, l'isolation dans un cloud privé virtuel (VPC), la mise à l'échelle automatique et l'intégration avec chaque parcours d'entraînement de SageMaker AI. La surface fonctionnelle est large et profonde, mais la plupart des ingénieurs n'arrivent pas en sachant quelle famille d'instances ou quel conteneur de service répondra le mieux à leurs besoins. Ils arrivent avec un cas d'utilisation : un objectif de performance à atteindre, une enveloppe de coûts à respecter, ou un modèle à évaluer avant de s'engager en production.
L'expérience agentique pour l'inférence d'IA générative optimisée par SageMaker AI comble cette lacune. Vous indiquez à l'agent ce que vous souhaitez accomplir, et il produit du code SageMaker Python SDK v3 exécutable que vous pouvez examiner, modifier et exécuter dans votre propre environnement. L'agent pose des questions ciblées de clarification, génère du code basé sur des benchmarks réels et des données de performance mesurées, et s'adapte à vos contraintes métier comme le ferait un architecte de solutions.
Tout au long du processus, vous gardez le contrôle. Chaque étape est visible en temps réel et exprimée sous forme de code que vous pouvez lire et contester. Rien ne se passe derrière une interface opaque.
Premiers pas
Vous pouvez installer le aws-ai-ml compétence à travers le Agent Toolkit pour AWS sur votre machine locale, ou utilisez-le dans un espace JupyterLab Amazon SageMaker Studio. Dans les deux cas, vous pouvez passer de zéro à une conversation fonctionnelle en 10 minutes.
Option A : à utiliser avec n'importe quel agent de codage (Kiro, Claude Code, Codex, ou tout agent compatible MCP)
Étape 1 : Installez la boîte à outils d'agent pour AWS. Si ce n'est pas déjà fait, configurez l'Agent Toolkit. Cela nécessite AWS Command Line Interface (AWS CLI) 2.35+ et uv installé.
aws configure agent-toolkit
Cela détecte automatiquement vos agents, installe les skills et configure le serveur MCP AWS. Pour une configuration spécifique à un agent (commandes d'installation de plugins, configuration MCP), consultez le Guide de démarrage de l'Agent Toolkit pour AWS.
Étape 2 : Installer aws-ai-ml compétence. Ajoutez la compétence d'inférence pour l'IA générative optimisée de SageMaker AI à votre agent :
npx skills add aws/agent-toolkit-for-aws/skills/aws-ai-ml
Étape 3 : Confirmer et commencer. Ouvrez le panneau de discussion de votre agent de codage et demandez : « Quelles compétences sont disponibles ? » Vous devriez voir aws-ai-ml listé. Après confirmation, décrivez votre intention en langage naturel. Votre agent de codage dispose désormais de l'expertise d'optimisation d'inférence SageMaker AI intégrée.
Prérequis : Vos identifiants AWS doivent disposer des autorisations nécessaires pour appeler les API SageMaker AI (création de points de terminaison, exécution de tâches de benchmark et de recommandation). La compétence génère du code qui s'exécute sous vos identifiants. Aucune configuration AWS Identity and Access Management (IAM) supplémentaire n'est nécessaire pour la compétence elle-même.
Remarque : Pour Kiro et Claude Code, les agents peuvent découvrir des compétences au moment de l'exécution. Ils peuvent rechercher et charger des compétences à la demande via le AWS MCP Server, sans aucune installation locale. Demandez à votre agent : « Recherche des compétences AWS liées aux bases de données. » Consultez le readme pour découvrir les compétences au moment de l'exécution.
Option B : Utiliser dans Amazon SageMaker Studio
Si vous préférez travailler dans un environnement JupyterLab géré, vous pouvez utiliser la compétence dans Amazon SageMaker Studio avec une image préconfigurée.
Étape 1 : Ouvrir Amazon SageMaker Studio. Accédez à Amazon SageMaker Studio dans votre compte AWS cible et votre Région AWS. Sélectionnez votre domaine Studio et lancez l'IDE Studio depuis votre profil utilisateur.
Étape 2 : Créer un espace JupyterLab. Depuis la page d'accueil de Studio, choisissez JupyterLab, puis choisissez Create JupyterLab space. Nommez l'espace (par exemple, my-inference-opt) et conservez le paramètre de partage Private (les skills ne se synchronisent que sur les espaces privés). Sous le menu Image , sélectionnez l'image qui inclut le skill d'inférence IA générative optimisé pour SageMaker AI. Cette image est livrée préconfigurée avec le aws-ai-ml agent skill et toutes les dépendances nécessaires. Choisissez Run space et attendez le démarrage (5–10 minutes la première fois).
Remarque : Utilisez un espace neuf. Un espace réutilisé avec une version de skill modifiée localement risque de ne pas prendre en compte l'image préconfigurée.
Étape 3 : Ouvrir JupyterLab et lancer un terminal. Une fois l'espace démarré, ouvrez JupyterLab et choisissez Terminal.
Étape 4 : Autoriser votre agent de codage. Dans le terminal, authentifiez-vous auprès de votre agent de codage en utilisant votre fournisseur d'identité. Par exemple, avec Kiro :
kiro-cli login --license pro --identity-provider <your-IdP-start-URL> --region us-east-1 --use-device-flow
Étape 5 : Confirmer et commencer. Ouvrez le panneau de discussion de votre agent de codage et demandez : « Quels skills sont disponibles ? » Vous devriez voir aws-ai-ml listé. Une fois confirmé, décrivez votre intention en langage naturel.
Dépannage :
Si l'agent signale qu'aucun skill n'est disponible, vérifiez que votre espace est défini sur Private. Vous pouvez également vérifier depuis le terminal :
ls ~/.kiro/skills/
Si ce répertoire est vide mais que
/etc/sagemaker/skills/contient les fichiers du skill, exécutezrestart-jupyter-server, actualisez la page et réessayez.
Ce que vous pouvez faire
L’expérience agentique couvre les capacités suivantes tout au long du cycle de vie de l’optimisation de l’inférence. Vous n’avez pas besoin de savoir quelle capacité invoquer. Décrivez ce que vous voulez, et votre agent détermine l’étape suivante ou pose des questions de clarification si quelque chose n’est pas clair.
Évaluer les performances d’un point de terminaison existant
Si vous avez déjà un modèle déployé sur un point de terminaison SageMaker AI, vous pouvez demander à l’agent d’en évaluer les performances. Indiquez à l’agent quel point de terminaison vous souhaitez tester, et il génère un notebook Python qui exécute un test de charge en utilisant les API Workload.synthetic() and start_benchmark() du SageMaker Python SDK.
Avant d’exécuter un benchmark, l’agent confirme que votre point de terminaison peut être soumis à un test de charge en toute sécurité, car l’évaluation des performances envoie du trafic réel vers un point de terminaison en production.
Lorsque le benchmark est terminé, vous obtenez un rapport de performances quantitatif contenant :
- Throughput: requêtes par seconde, tokens de sortie par seconde.
- Latency: p50, p99, time-to-first-token, latence inter-tokens.
- Concurrency: nombre de requêtes simultanées prises en charge.
Il s’agit de valeurs mesurées à partir d’une charge réelle sur une infrastructure réelle, et non d’estimations. L’agent recommande également des mécanismes d’amélioration (tels que le décodage de préfill) pour augmenter les performances.
Exemple de prompt : « Évalue les performances de mon point de terminaison Llama sur SageMaker AI. »
Trouver le type d’instance adapté à votre modèle
Si vous avez un modèle et devez trouver le bon type d’instance pour le déployer sur SageMaker AI, indiquez-le à votre agent. Peu importe où se trouve votre modèle ou comment vous l’avez obtenu :
- Modèle affiné ou personnalisé dans Amazon Simple Storage Service (Amazon S3): vous avez entraîné ou téléchargé un modèle et l’avez stocké dans S3. Fournissez l’URI S3 et votre objectif d’optimisation. Exemple de prompt : « Je veux trouver le type d’instance le moins cher pour déployer mon modèle affiné sur SageMaker. »
- Modèle de fondation publiquement disponible depuis Amazon SageMaker JumpStart: vous souhaitez déployer un modèle de fondation (FM) du catalogue JumpStart, puis fournir l’identifiant du modèle. Exemple de prompt : « Trouve la meilleure instance pour le modèle huggingface-reasoning-qwen3-8b sur SageMaker AI. »
- Modèle sur le Hugging Face Hub: vous souhaitez utiliser un modèle hébergé sur Hugging Face. Fournissez le nom du modèle. Pour les modèles à accès restreint (tels que les variantes Llama), votre agent affiche les termes de la licence et vous demande de les accepter et de fournir votre token Hugging Face. Exemple de prompt : « Je veux déployer un modèle Llama depuis Hugging Face Hub. Quelle est l’option la moins chère ? »
Dans tous les cas, votre agent génère du code qui évalue votre modèle par rapport à des instances et configurations candidates, puis présente des options de déploiement classées avec des métriques de performances concrètes : débit, centiles de latence, time-to-first-token et concurrence. Vous choisissez en fonction de vos exigences de coût et de performance.
Comparer des exécutions de benchmark
Si vous avez exécuté plusieurs benchmarks (par exemple, avant et après un changement de configuration, ou sur deux types d’instances), vous pouvez demander à l’agent de les comparer. Fournissez les noms des deux tâches de benchmark, et l’agent génère une comparaison qui calcule les écarts sur les métriques clés : débit, centiles de latence et time-to-first-token.
Les résultats affichent des variations en pourcentage où une valeur positive signifie une amélioration, vous donnant ainsi un résumé unique et interprétable indiquant si votre modification a amélioré les performances, les a dégradées ou n'a eu aucun effet notable.
Si l'une des exécutions de benchmark n'existe pas, l'agent propose de l'exécuter d'abord avant de procéder à la comparaison.
Exemple de prompt : « J'ai deux exécutions de benchmark et je veux les comparer. Laquelle est la plus rapide ? »
Résultats de benchmark
Ce tableau compare deux modèles déployés sur la même charge de travail de benchmark (512/256 tokens, concurrence 4). La colonne Δ% indique à quel point le modèle B (Qwen3-8B) est plus rapide que le modèle A (Qwen3-1.7B) pour chaque métrique. Une valeur positive signifie que le modèle B est meilleur.
| Métrique | Qwen3-1.7B (Modèle A) | Qwen3-8B (Modèle B) | Δ% |
| Débit de tokens en sortie | 188,2 tokens/s | 271,2 tokens/s | +44.1% |
| Débit par utilisateur | 47,5 tokens/s | 69,4 tokens/s | +45.9% |
| Débit de requêtes | 0,736 req/s | 1,08 req/s | +46.7% |
| Latence inter-token | 20,9 ms | 14 ms | +33.0% |
| Latence de requête | 5 382 ms | 3 658 ms | +32.0% |
| Temps jusqu'au premier token | 67,5 ms | 166,3 ms | −146.5% |
Les deux modèles tournent sur du matériel différent. Qwen3-8B utilise une configuration à 4 GPU ml.g5.12xlarge (4x A10G), tandis que Qwen3-1.7B utilise un seul GPU L4 (ml.g6.4xlarge). Les deltas reflètent environ 4x la puissance de calcul, et pas seulement les modèles eux-mêmes.
À retenir : Qwen3-8B offre un débit environ 44 à 47 pour cent supérieur et une latence de bout en bout plus faible, en grande partie grâce à la puissance de calcul GPU supplémentaire. Qwen3-1.7B ne l'emporte que sur le temps jusqu'au premier token, l'avantage attendu d'un modèle plus petit sur un seul GPU.
Tout mettre ensemble
Vous n'avez pas besoin de mémoriser les noms des capacités ni de savoir quel workflow demander. Le tableau suivant montre comment les demandes courantes correspondent aux résultats.
| Vous dites | Ce que vous obtenez |
| « J'ai déjà déployé un modèle et je veux savoir à quelle vitesse il est. » | Rapport de performance quantitatif : débit, percentiles de latence, métriques de concurrence issues d'une charge réelle. |
| « J'ai un modèle dans S3 et je ne sais pas sur quelle instance le déployer. » | Options de déploiement classées avec le coût, le débit et la latence pour chaque configuration candidate. |
| « Je veux déployer un modèle JumpStart et trouver l'instance la moins chère. Je n'ai que l'ID du modèle. » | Options de déploiement classées, sans nécessité de préparation S3 (staging). Alternative de modèle à accès restreint proposée si nécessaire. |
| « J'ai exécuté un benchmark avant et après une modification. Lequel est le plus rapide ? » | Pourcentage de changement sur toutes les métriques indiquant une amélioration ou une régression. |
| « Je veux optimiser un modèle Llama depuis Hugging Face Hub. » | Licence affichée, modèle préparé vers S3 (staging), puis sortie de recommandation standard. |
Si votre demande couvre plusieurs capacités (par exemple, préparer un modèle Hugging Face puis obtenir des recommandations de déploiement), l'agent les enchaîne naturellement au sein d'une même conversation.
À quoi s'attendre de l'agent
Votre agent, équipé de la aws-ai-ml compétence, suit quelques comportements qui rendent l'expérience prévisible et sûre :
- Il demande ce dont il a besoin. Si une information manque (comme un nom de point de terminaison ou un URI S3), l'agent vous demande de la fournir plutôt que de deviner.
- Il confirme avant les actions à fort impact. Avant d'exécuter un benchmark qui génère du trafic réel vers un point de terminaison actif, l'agent vous avertit de l'impact et demande une confirmation explicite.
- Il vous indique quand quelque chose sort du périmètre. Si vous demandez quelque chose que l'agent ne peut pas faire (comme déployer un modèle), il explique ce qu'il peut proposer à la place, par exemple générer la configuration de déploiement dont vous avez besoin.
- Il génère du code SageMaker Python SDK v3. Chaque sortie est un code exécutable que vous pouvez inspecter, modifier et exécuter dans votre propre environnement.
Nettoyage
Pour éviter des frais continus, supprimez les ressources que vous avez créées :
- Supprimez les points de terminaison SageMaker AI créés lors des benchmarks ou des recommandations.
- Arrêtez ou supprimez votre espace JupyterLab si vous avez utilisé SageMaker Studio.
- Supprimez les objets S3 stockés par les tâches de benchmark et de recommandation dans votre compartiment par défaut SageMaker AI.
Conclusion
La aws-ai-ml compétence pour Amazon SageMaker AI optimisée pour l'inférence d'IA générative transforme votre agent de codage existant en expert en optimisation d'inférence SageMaker AI. Que vous ayez besoin de benchmarker un point de terminaison actif, de trouver l'instance la moins chère pour votre modèle, de comparer des configurations ou de préparer un modèle Hugging Face pour évaluation, vous décrivez ce que vous voulez et votre agent fournit des résultats mesurables.
Pour commencer, installez la compétence via l' Agent Toolkit for AWS et ajoutez-la à l'agent de codage que vous utilisez déjà, ou lancez un espace JupyterLab préconfiguré dans Amazon SageMaker Studio. Pour plus d'informations, consultez le Documentation Amazon SageMaker AI.