AWS Machine Learning

Neue Agent-Fähigkeit: Amazon SageMaker optimierte Generative-KI-Inferenz für Ihren Coding-Agent

Amazon SageMaker optimierte Generative-KI-Inferenz führt das Skill „aws-ai-ml“ über das Agent Toolkit for AWS ein und verleiht Coding-Agenten wie Kiro, Claude Code und Codex tiefes Fachwissen in Inferenzoptimierung und…

Ingenieure nutzen zunehmend Coding-Assistenz-Tools, um ihre Entwicklungsworkflows zu beschleunigen. Heute Amazon SageMaker AI optimierte Inferenz für generative KI stellt die vor aws-ai-ml Fähigkeit, verfügbar über die Agent-Toolkit für AWS. Diese Fähigkeit ermöglicht es Coding-Agenten wie Kiro, Claude Code und Codex vertiefte Expertise in Inferenzoptimierung und Benchmarking. Installiere den Skill, und dein vorhandener Agent kann Endpunkte benchmarken, Deployment-Konfigurationen empfehlen, Performance-Läufe vergleichen und in deinem Auftrag ausführbaren SageMaker Python SDK v3 Code generieren. Die aws-ai-ml skill ist ein Toolkit, das sich in jeden Coding-Agenten, der das Model Context Protocol (MCP) unterstützt, einbinden lässt und ihn in einen Experten für SageMaker AI-Inferenzoptimierung verwandelt.

In diesem Beitrag zeigen wir, was die Skill ermöglicht, wie man sie einrichtet und wie sie Ihnen hilft, schneller vom Modell zur Produktion zu gelangen.

Die Herausforderung: Die Brücke zwischen Absicht und Infrastruktur schlagen

Amazon SageMaker AI unterstützt Serverful-Hosting in Echtzeit-, Batch- und asynchronen Modi. Es bietet bedarfsgesteuerte und reservierte Kapazitäten, heterogene Instanzen, Isolation in einer Virtual Private Cloud (VPC), automatische Skalierung sowie Integration mit jedem SageMaker AI-Trainingspfad. Die Funktionsfläche ist breit und tief, doch die meisten Ingenieure wissen bei ihrer Ankunft nicht, welche Instanzfamilie oder welcher Serving-Container ihre Anforderungen am besten erfüllt. Sie kommen mit einem Anwendungsfall: einem Leistungsziel, das sie erreichen wollen, einem Kostenrahmen, den sie einhalten müssen, oder einem Modell, das sie bewerten müssen, bevor sie den Sprung in die Produktion wagen.

Die agentenbasierte Erfahrung für generative KI-Inferenz, optimiert für SageMaker AI, schließt diese Lücke. Sie teilen dem Agenten mit, was Sie erreichen möchten, und er erzeugt ausführbaren SageMaker Python SDK v3-Code, den Sie prüfen, ändern und in Ihrer eigenen Umgebung ausführen können. Der Agent stellt gezielte Rückfragen, generiert Code auf Grundlage echter Benchmarks und gemessener Leistungsdaten und passt sich an Ihre geschäftlichen Rahmenbedingungen an – wie ein Solutions Architect.

Sie behalten während des gesamten Prozesses die Kontrolle. Jeder Schritt ist in Echtzeit sichtbar und wird als Code ausgedrückt, den Sie lesen und hinterfragen können. Nichts geschieht hinter einer intransparenten Benutzeroberfläche.

Erste Schritte

Sie können aws-ai-ml Fähigkeit durch die Agent Toolkit für AWS auf Ihrem lokalen Rechner oder verwenden Sie es innerhalb eines Amazon SageMaker Studio JupyterLab Spaces. So oder so können Sie in 10 Minuten von null zu einer funktionierenden Konversation gelangen.

Option A: Verwendung mit jedem Coding-Agent (Kiro, Claude Code, Codex oder einem beliebigen MCP-kompatiblen Agent)

Schritt 1: Installieren Sie das Agent Toolkit für AWS. Falls noch nicht geschehen, richten Sie das Agent Toolkit ein. Dies erfordert die AWS Command Line Interface (AWS CLI) 2.35+ und uv installiert.

aws configure agent-toolkit

Dies erkennt Ihre Agents automatisch, installiert Skills und konfiguriert den AWS MCP Server. Für agentenspezifische Einrichtungen (Plugin-Installationsbefehle, MCP-Konfiguration) siehe die Erste-Schritte-Anleitung für das Agent Toolkit für AWS.

Schritt 2: Installieren Sie aws-ai-ml Fähigkeit. Fügen Sie Ihrem Agenten die SageMaker AI-optimierte Fähigkeit für generative KI-Inferenz hinzu:

npx skills add aws/agent-toolkit-for-aws/skills/aws-ai-ml

Schritt 3: Bestätigen und beginnen. Öffnen Sie den Chat-Panel Ihres Coding-Agents und fragen Sie: „Welche Skills sind verfügbar?“ Sie sollten aws-ai-ml aufgelistet sehen. Nachdem Sie dies bestätigt haben, beschreiben Sie Ihre Absicht in natürlicher Sprache. Ihr Coding-Agent verfügt nun über integrierte Expertise zur Inferenzoptimierung von SageMaker AI.

Voraussetzungen: Ihre AWS-Anmeldeinformationen müssen Berechtigungen zum Aufrufen von SageMaker-AI-APIs besitzen (Erstellen von Endpunkten, Ausführen von Benchmark- und Empfehlungsaufträgen). Der Skill generiert Code, der unter Ihren Anmeldeinformationen ausgeführt wird. Für den Skill selbst ist keine zusätzliche AWS Identity and Access Management (IAM)-Konfiguration erforderlich.

Hinweis: Für Kiro und Claude Code können Agents Skills zur Laufzeit erkennen. Sie können Skills bei Bedarf über den AWS MCP Serversuchen und laden, ohne dass eine lokale Installation erforderlich ist. Fragen Sie Ihren Agenten: „Suche nach AWS-Skills im Zusammenhang mit Datenbanken.“ Siehe die readme zum Erkennen von Skills zur Laufzeit.

Option B: Verwendung innerhalb von Amazon SageMaker Studio

Wenn Sie bevorzugt in einer verwalteten JupyterLab-Umgebung arbeiten möchten, können Sie den Skill in Amazon SageMaker Studio mit einem vorkonfigurierten Image verwenden.

Schritt 1: Öffnen Sie Amazon SageMaker Studio. Navigieren Sie in Ihrem Ziel-AWS-Konto und Ihrer Ziel-AWS-Region zu Amazon SageMaker Studio. Wählen Sie Ihre Studio-Domain aus und starten Sie die Studio-IDE über Ihr Benutzerprofil.

Schritt 2: Erstellen Sie einen JupyterLab-Space. Wählen Sie auf der Studio-Startseite JupyterLabund dann Create JupyterLab space. Benennen Sie den Space (zum Beispiel, my-inference-opt) und belassen Sie die Freigabeeinstellung auf Private (Skills werden nur auf privaten Spaces synchronisiert). Wählen Sie im Menü Image das Image aus, das den von SageMaker AI optimierten Skill für generative KI-Inferenz enthält. Dieses Image wird vorkonfiguriert mit dem aws-ai-ml Agent-Skill und allen notwendigen Abhängigkeiten ausgeliefert. Wählen Sie Run space und warten Sie, bis er hochgefahren ist (beim ersten Mal 5–10 Minuten).

Hinweis: Verwenden Sie einen neuen Space. Ein wiederverwendeter Space mit einer lokal geänderten Skill-Version übernimmt das vorkonfigurierte Image möglicherweise nicht.

Schritt 3: Öffnen Sie JupyterLab und starten Sie ein Terminal. Nachdem der Space hochgefahren ist, öffnen Sie JupyterLab und wählen Terminal.

Schritt 4: Autorisieren Sie Ihren Coding-Agent. Authentifizieren Sie sich im Terminal bei Ihrem Coding-Agent über Ihren Identitätsanbieter. Zum Beispiel mit Kiro:

kiro-cli login --license pro --identity-provider <your-IdP-start-URL> --region us-east-1 --use-device-flow

Schritt 5: Bestätigen und beginnen. Öffnen Sie den Chat-Bereich Ihres Coding-Agents und fragen Sie: „Welche Skills sind verfügbar?“ Sie sollten aws-ai-ml aufgelistet sehen. Sobald dies bestätigt ist, beschreiben Sie Ihre Absicht in natürlicher Sprache.

Fehlerbehebung:

Wenn der Agent meldet, dass keine Skills verfügbar sind, überprüfen Sie, ob Ihr Space auf Privateeingestellt ist. Sie können dies auch über das Terminal prüfen:

ls ~/.kiro/skills/

Wenn dieses Verzeichnis leer ist, /etc/sagemaker/skills/ aber die Skill-Dateien enthält, führen Sie restart-jupyter-serveraus, aktualisieren Sie die Seite und versuchen Sie es erneut.

Was Sie tun können

Die agentenbasierte Erfahrung deckt die folgenden Fähigkeiten über den gesamten Lebenszyklus der Inferenzoptimierung ab. Sie müssen nicht wissen, welche Fähigkeit aufgerufen werden soll. Beschreiben Sie, was Sie möchten, und Ihr Agent ermittelt den nächsten Schritt oder stellt Klärungsfragen, falls etwas unklar ist.

Einen bestehenden Endpoint benchmarken

Wenn Sie bereits ein Modell auf einem SageMaker-AI-Endpoint bereitgestellt haben, können Sie den Agenten bitten, es zu benchmarken. Teilen Sie dem Agenten mit, welchen Endpoint Sie testen möchten, und er generiert ein Python-Notebook, das einen Lasttest mit den Workload.synthetic() - und start_benchmark() -APIs aus dem SageMaker Python SDK durchführt.

Bevor ein Benchmark ausgeführt wird, bestätigt der Agent, dass Ihr Endpoint sicher einem Lasttest unterzogen werden kann, da Benchmarking echten Traffic an einen live geschalteten Endpoint sendet.

Nach Abschluss des Benchmarks erhalten Sie einen quantitativen Leistungsbericht mit:

  • Durchsatz: Anfragen pro Sekunde, Ausgabe-Tokens pro Sekunde.
  • Latenz: p50, p99, Time-to-First-Token, Inter-Token-Latenz.
  • Parallelität: Anzahl der gleichzeitig unterstützten Anfragen.

Dies sind gemessene Werte aus echter Last auf echter Infrastruktur, keine Schätzungen. Der Agent empfiehlt außerdem Verbesserungsmechanismen (wie Prefill-Decoding) zur Leistungssteigerung.

Beispielprompt: „Benchmark my Llama endpoint on SageMaker AI.“

Den passenden Instanztyp für Ihr Modell finden

Wenn Sie ein Modell haben und den passenden Instanztyp finden müssen, um es auf SageMaker AI bereitzustellen, teilen Sie dies Ihrem Agenten mit. Es spielt keine Rolle, wo sich Ihr Modell befindet oder wie Sie es erhalten haben:

  • Feinabgestimmtes oder benutzerdefiniertes Modell in Amazon Simple Storage Service (Amazon S3): Sie haben ein Modell trainiert oder heruntergeladen und in S3 gespeichert. Geben Sie den S3-URI und Ihr Optimierungsziel an. Beispielprompt: „Ich möchte den günstigsten Instanztyp finden, um mein feinabgestimmtes Modell auf SageMaker bereitzustellen.“
  • Öffentlich verfügbares Foundation-Modell von Amazon SageMaker JumpStart: Sie möchten ein Foundation-Modell (FM) aus dem JumpStart-Katalog bereitstellen, geben Sie dann die Modell-ID an. Beispielprompt: „Find the best instance for model huggingface-reasoning-qwen3-8b on SageMaker AI.“
  • Modell im Hugging Face Hub: Sie möchten ein Modell verwenden, das auf Hugging Face gehostet ist. Geben Sie den Modellnamen an. Bei gated Modellen (wie Llama-Varianten) zeigt Ihr Agent die Lizenzbedingungen an und bittet Sie, diese zu akzeptieren und Ihr Hugging-Face-Token bereitzustellen. Beispielprompt: „Ich möchte ein Llama-Modell aus dem Hugging Face Hub bereitstellen. Was ist die günstigste Option?“

In jedem Fall generiert Ihr Agent Code, der Ihr Modell gegenüber Kandidaten-Instanzen und Konfigurationen bewertet, und präsentiert dann ranglisteartig Bereitstellungsoptionen mit konkreten Leistungskennzahlen: Durchsatz, Latenzperzentilen, Time-to-First-Token und Parallelität. Sie wählen anhand Ihrer Kosten- und Leistungsanforderungen.

Benchmark-Läufe vergleichen

Wenn Sie mehrere Benchmarks durchgeführt haben (zum Beispiel vor und nach einer Konfigurationsänderung oder über zwei Instanztypen hinweg), können Sie den Agenten bitten, sie zu vergleichen. Geben Sie die beiden Benchmark-Jobnamen an, und der Agent erstellt einen Vergleich, der Deltas über die wichtigsten Kennzahlen berechnet: Durchsatz, Latenzperzentile und Time-to-First-Token.

Die Ergebnisse zeigen prozentuale Veränderungen, wobei ein positiver Wert „besser“ bedeutet, und liefern Ihnen damit eine einzige, interpretierbare Zusammenfassung, ob Ihre Änderung die Leistung verbessert, verschlechtert oder keinen relevanten Effekt hatte.

Falls einer der Benchmark-Läufe nicht existiert, bietet der Agent an, ihn zuerst auszuführen, bevor mit dem Vergleich fortgefahren wird.

Beispiel-Prompt: „Ich habe zwei Benchmark-Läufe und möchte sie vergleichen. Welcher ist schneller?“

Benchmark-Ergebnisse

Diese Tabelle vergleicht zwei bereitgestellte Modelle auf derselben Benchmark-Workload (512/256 Tokens, Concurrency 4). Die Spalte Δ% zeigt, wie viel schneller Modell B (Qwen3-8B) als Modell A (Qwen3-1.7B) bei jeder Metrik ist. Ein positiver Wert bedeutet, dass Modell B besser ist.

Metrik Qwen3-1.7B (Modell A) Qwen3-8B (Modell B) Δ%
Output-Token-Durchsatz 188.2 Token/s 271.2 Token/s +44.1%
Durchsatz pro Benutzer 47.5 Token/s 69.4 Token/s +45.9%
Anfrage-Durchsatz 0.736 Anfragen/s 1.08 Anfragen/s +46.7%
Inter-Token-Latenz 20.9 ms 14 ms +33.0%
Anfrage-Latenz 5,382 ms 3,658 ms +32.0%
Zeit bis zum ersten Token 67.5 ms 166.3 ms −146.5%

Die beiden Modelle laufen auf unterschiedlicher Hardware. Qwen3-8B verwendet eine 4-GPU ml.g5.12xlarge (4x A10G), während Qwen3-1.7B eine einzelne L4 GPU verwendet (ml.g6.4xlarge). Die Deltas spiegeln approximately 4x die Rechenleistung wider, nicht nur die Modelle selbst.

Das Fazit: Qwen3-8B liefert approximately 44–47 Prozent höheren Durchsatz und niedrigere End-to-End-Latenz, vor allem dank der zusätzlichen GPU-Rechenleistung. Qwen3-1.7B gewinnt nur bei der Zeit bis zum ersten Token, der erwartete Vorteil eines kleineren Modells auf einer einzelnen GPU.

Alles zusammenfassen

Sie müssen sich keine Fähigkeitsnamen merken und müssen nicht wissen, welchen Workflow Sie anfordern sollen. Die folgende Tabelle zeigt, wie häufige Anfragen zu Ergebnissen führen.

Sie sagen Was Sie erhalten
„Ich habe bereits ein Modell bereitgestellt und möchte wissen, wie schnell es ist.“ Quantitativer Leistungsbericht: Durchsatz, Latenzperzentilen, Nebenläufigkeitsmetriken aus realer Last.
„Ich habe ein Modell in S3 und weiß nicht, auf welcher Instanz ich es deployen soll.” Sortierte Deployment-Optionen mit Kosten, Durchsatz und Latenz für jede Kandidatenkonfiguration.
„Ich möchte ein JumpStart-Modell deployen und die günstigste Instance finden. Ich habe nur die Modell-ID.“ Sortierte Deployment-Optionen, kein S3-Staging erforderlich. Falls benötigt, wird eine Alternative für ein gated model angezeigt.
„Ich habe vor und nach einer Änderung einen Benchmark ausgeführt. Welcher ist schneller?“ Prozentuale Änderung über alle Metriken, die Verbesserung oder Verschlechterung anzeigt.
„Ich möchte ein Llama-Modell vom Hugging Face Hub optimieren.“ Lizenz wird angezeigt, Modell wird zu S3 gestaged, danach die übliche Empfehlungsausgabe.

Wenn Ihre Anfrage mehrere Fähigkeiten umfasst (zum Beispiel das Staging eines Hugging Face-Modells und anschließend das Abrufen von Deployment-Empfehlungen), verkettet der Agent diese auf natürliche Weise innerhalb desselben Gesprächs.

Was Sie vom Agenten erwarten können

Ihr Agent, ausgestattet mit dem aws-ai-ml skill, folgt einigen Verhaltensweisen, die die Erfahrung vorhersehbar und sicher machen:

  • Er fragt nach dem, was er benötigt. Wenn Informationen fehlen (wie ein Endpunktname oder eine S3-URI), bittet der Agent Sie, diese bereitzustellen, statt zu raten.
  • Er bestätigt wirkungsvolle Aktionen vorher. Bevor er einen Benchmark ausführt, der echten Datenverkehr an einen Live-Endpunkt sends, warnt der Agent Sie vor den Auswirkungen und verlangt eine explizite Bestätigung.
  • Er teilt Ihnen mit, wenn etwas außerhalb seines Zuständigkeitsbereichs liegt. Wenn Sie etwas anfordern, das der Agent nicht kann (wie das Deployen eines Modells), erklärt er, was er stattdessen anbieten kann, z. B. das Generieren der von Ihnen benötigten Deployment-Konfiguration.
  • Er generiert SageMaker Python SDK v3-Code. Jede Ausgabe ist ausführbarer Code, den Sie einsehen, ändern und in Ihrer eigenen Umgebung ausführen können.

Aufräumen

Um laufende Kosten zu vermeiden, löschen Sie die von Ihnen erstellten Ressourcen:

Fazit

Der aws-ai-ml skill für Amazon SageMaker AI optimierte generative KI-Inferenz verwandelt Ihren vorhandenen Coding-Agenten in einen SageMaker AI-Inferenzoptimierungsexperten. Ob Sie einen Live-Endpunkt benchmarken, die günstigste Instance für Ihr Modell finden, Konfigurationen vergleichen oder ein Hugging Face-Modell zur Evaluierung stagen möchten – Sie beschreiben, was Sie wollen, und Ihr Agent liefert messbare Ergebnisse.

Um loszulegen, installieren Sie den skill über das Agent Toolkit for AWS und fügen Sie ihn dem Coding-Agenten hinzu, den Sie bereits verwenden, oder starten Sie einen vorkonfigurierten JupyterLab space in Amazon SageMaker Studio. Weitere Informationen finden Sie unter Amazon SageMaker AI Dokumentation.


Über die Autoren

Originalquelle

AWS Machine Learning

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten