AWS Machine Learning

Nueva habilidad de agente: inferencia de IA generativa optimizada de Amazon SageMaker para tu agente de programación

La inferencia de IA generativa optimizada de Amazon SageMaker presenta la habilidad aws-ai-ml a través del Agent Toolkit for AWS, brindando a los agentes de programación como Kiro, Claude Code y Codex una experiencia…

Los ingenieros utilizan cada vez más herramientas de asistencia de código para acelerar sus flujos de trabajo de desarrollo. Hoy, Amazon SageMaker AI optimiza la inferencia de IA generativa introduce el aws-ai-ml habilidad, disponible a través de la Kit de herramientas de agente para AWS. Esta habilidad da a los agentes de codificación como Kiro, Claude Code y Codex una profunda experiencia en optimización de inferencia y benchmarking. Instala la skill, y tu agente existente podrá hacer benchmarking de endpoints, recomendar configuraciones de despliegue, comparar ejecuciones de rendimiento y generar código ejecutable de SageMaker Python SDK v3 en tu nombre. El aws-ai-ml skill es un kit de herramientas que se conecta a cualquier agente de código que admita el Model Context Protocol (MCP), convirtiéndolo en un experto en optimización de inferencia de SageMaker AI.

En esta publicación, explicamos qué permite esta skill, cómo configurarla y cómo te ayuda a pasar más rápido del modelo a la producción.

El desafío: tender un puente entre la intención y la infraestructura

Amazon SageMaker AI admite el alojamiento con servidor en los modos en tiempo real, por lotes y asíncrono. Ofrece capacidad bajo demanda y reservada, instancias heterogéneas, aislamiento de nube privada virtual (VPC), escalado automático e integración con todas las rutas de entrenamiento de SageMaker AI. La superficie es amplia y profunda, pero la mayoría de los ingenieros no llegan sabiendo qué familia de instancias o contenedor de servicio se ajustará mejor a sus necesidades. Llegan con un caso de uso: un objetivo de rendimiento que quieren alcanzar, un límite de costos que deben respetar o un modelo que deben evaluar antes de comprometerse con producción.

La experiencia de agente para la inferencia de IA generativa optimizada de SageMaker AI cierra esta brecha. Le indica al agente lo que desea lograr, y este produce código ejecutable de SageMaker Python SDK v3 que puede revisar, modificar y ejecutar en su propio entorno. El agente hace preguntas aclaratorias específicas, genera código basado en benchmarks reales y datos de rendimiento medidos, y se adapta a sus restricciones comerciales como lo haría un arquitecto de soluciones.

En todo momento, tú mantienes el control. Cada paso es visible en tiempo real y se expresa como código que puedes leer y cuestionar. Nada sucede detrás de una interfaz opaca.

Primeros pasos

Puedes instalar el aws-ai-ml adquirir habilidad mediante el Kit de herramientas de agente para AWS en tu máquina local, o úsalo dentro de un espacio de Amazon SageMaker Studio JupyterLab. En cualquier caso, puedes pasar de cero a una conversación funcional en 10 minutos.

Opción A: Usar con cualquier agente de programación (Kiro, Claude Code, Codex o cualquier agente compatible con MCP)

Paso 1: Instale el Agent Toolkit para AWS. Si aún no lo ha hecho, configure el Agent Toolkit. Esto requiere la AWS Command Line Interface (AWS CLI) 2.35+ y uv instalado.

aws configure agent-toolkit

Esto detecta automáticamente tus agentes, instala las skills y configura el AWS MCP Server. Para la configuración específica de cada agente (comandos de instalación del plugin, configuración de MCP), consulta el Guía de inicio del Agent Toolkit para AWS.

Paso 2: Instale el aws-ai-ml habilidad. Añade la habilidad de inferencia de IA generativa optimizada de SageMaker AI a tu agente:

npx skills add aws/agent-toolkit-for-aws/skills/aws-ai-ml

Paso 3: Confirmar y comenzar. Abra el panel de chat de su agente de codificación y pregunte: “¿Qué skills están disponibles?” Debería ver aws-ai-ml listado. Después de confirmar, describa su intención en lenguaje natural. Su agente de codificación ahora tiene incorporada experiencia en optimización de inferencia de SageMaker AI.

Requisitos previos: Sus credenciales de AWS deben tener permisos para llamar a las API de SageMaker AI (crear endpoints, ejecutar trabajos de benchmark y de recomendaciones). La skill genera código que se ejecuta con sus credenciales. No se necesita ninguna configuración adicional de AWS Identity and Access Management (IAM) para la skill en sí.

Nota: Para Kiro y Claude Code, los agentes pueden descubrir skills en tiempo de ejecución. Pueden buscar y cargar skills a demanda a través del AWS MCP Server, sin ninguna instalación local. Pregunte a su agente: “Busca skills de AWS relacionadas con bases de datos”. Consulte el readme para descubrir skills en tiempo de ejecución.

Opción B: Usar dentro de Amazon SageMaker Studio

Si prefiere trabajar dentro de un entorno JupyterLab administrado, puede usar la skill en Amazon SageMaker Studio con una imagen preconfigurada.

Paso 1: Abrir Amazon SageMaker Studio. Vaya a Amazon SageMaker Studio en su cuenta de AWS y Región de AWS de destino. Seleccione su dominio de Studio e inicie el IDE de Studio desde su perfil de usuario.

Paso 2: Crear un espacio de JupyterLab. Desde la página de inicio de Studio, elija JupyterLaby, a continuación, elija Create JupyterLab space. Asigne un nombre al espacio (por ejemplo, my-inference-opt) y mantenga la configuración de compartición Private (las skills solo se sincronizan en espacios privados). En el menú Image , seleccione la imagen que incluye la skill de inferencia de IA generativa optimizada de SageMaker AI. Esta imagen viene preconfigurada con la aws-ai-ml agent skill y todas las dependencias necesarias. Elija Run space y espere a que arranque (5–10 minutos la primera vez).

Nota: Use un espacio nuevo. Un espacio reutilizado con una versión de la skill modificada localmente puede no detectar la imagen preconfigurada.

Paso 3: Abrir JupyterLab e iniciar una terminal. Una vez que el espacio arranque, abra JupyterLab y elija Terminal.

Paso 4: Autorizar su agente de codificación. En la terminal, autentíquese con su agente de codificación utilizando su proveedor de identidad. Por ejemplo, con Kiro:

kiro-cli login --license pro --identity-provider <your-IdP-start-URL> --region us-east-1 --use-device-flow

Paso 5: Confirmar y comenzar. Abra el panel de chat de su agente de codificación y pregunte: “¿Qué skills están disponibles?” Debería ver aws-ai-ml en la lista. Una vez confirmado, describa su intención en lenguaje natural.

Solución de problemas:

Si el agente informa que no hay skills disponibles, verifique que su espacio esté configurado como Private. También puede comprobarlo desde la terminal:

ls ~/.kiro/skills/

Si ese directorio está vacío pero /etc/sagemaker/skills/ contiene los archivos de la skill, ejecute restart-jupyter-server, actualice la página y reintente.

Lo que puede hacer

La experiencia agéntica cubre las siguientes capacidades a lo largo del ciclo de vida de la optimización de inferencia. No necesita saber qué capacidad invocar. Describa lo que desea, y su agente determina el siguiente paso o hace preguntas aclaratorias si algo no está claro.

Comparar el rendimiento (benchmark) de un endpoint existente

Si ya tiene un modelo desplegado en un endpoint de SageMaker AI, puede pedirle al agente que realice una prueba de rendimiento. Indique al agente qué endpoint desea probar, y este genera un notebook de Python que ejecuta una prueba de carga utilizando las API Workload.synthetic() y start_benchmark() del SageMaker Python SDK.

Antes de ejecutar cualquier prueba de rendimiento, el agente confirma que su endpoint es seguro para someterlo a prueba de carga, porque el benchmarking dirige tráfico real a un endpoint en vivo.

Cuando la prueba de rendimiento finaliza, obtiene un informe cuantitativo de rendimiento con:

  • Rendimiento (throughput): solicitudes por segundo, tokens de salida por segundo.
  • Latencia: p50, p99, time-to-first-token, latencia entre tokens.
  • Concurrencia: número de solicitudes simultáneas soportadas.

Estos son valores medidos a partir de carga real sobre infraestructura real, no estimaciones. El agente también recomienda mecanismos de mejora (como la decodificación prefill) para aumentar el rendimiento.

Ejemplo de prompt: «Realiza un benchmark de mi endpoint de Llama en SageMaker AI».

Encontrar el tipo de instancia adecuado para su modelo

Si tiene un modelo y necesita encontrar el tipo de instancia adecuado para desplegarlo en SageMaker AI, dígaselo a su agente. No importa dónde resida su modelo ni cómo lo obtuvo:

  • Modelo ajustado o personalizado en Amazon Simple Storage Service (Amazon S3): Usted entrenó o descargó un modelo y lo almacenó en S3. Proporcione el URI de S3 y su objetivo de optimización. Ejemplo de prompt: «Quiero encontrar el tipo de instancia más barato para desplegar mi modelo ajustado en SageMaker».
  • Modelo fundacional disponible públicamente de Amazon SageMaker JumpStart: Usted quiere desplegar un modelo fundacional (FM) del catálogo de JumpStart, entonces proporcione el ID del modelo. Ejemplo de prompt: «Encuentra la mejor instancia para el modelo huggingface-reasoning-qwen3-8b en SageMaker AI».
  • Modelo en el Hugging Face Hub: Usted quiere usar un modelo alojado en Hugging Face. Proporcione el nombre del modelo. Para modelos con acceso restringido (como las variantes de Llama), su agente muestra los términos de la licencia y le pide que los acepte y proporcione su token de Hugging Face. Ejemplo de prompt: «Quiero desplegar un modelo Llama desde Hugging Face Hub. ¿Cuál es la opción más barata?»

En todos los casos, su agente genera código que evalúa su modelo frente a instancias y configuraciones candidatas, y luego presenta opciones de despliegue clasificadas con métricas de rendimiento concretas: throughput, percentiles de latencia, time-to-first-token y concurrencia. Usted elige según sus requisitos de coste y rendimiento.

Comparar ejecuciones de benchmark

Si realizó varias pruebas de rendimiento (por ejemplo, antes y después de un cambio de configuración, o entre dos tipos de instancia), puede pedirle al agente que las compare. Proporcione los dos nombres de trabajos de benchmark, y el agente genera una comparación que calcula las diferencias en métricas clave: throughput, percentiles de latencia y time-to-first-token.

Los resultados muestran cambios porcentuales donde un valor positivo significa mejor, ofreciéndote un resumen único e interpretable de si tu cambio mejoró el rendimiento, lo degradó o no tuvo ningún efecto significativo.

Si una de las ejecuciones de benchmark no existe, el agente ofrece ejecutarla primero antes de proceder con la comparación.

Ejemplo de prompt: «Tengo dos ejecuciones de benchmark y quiero compararlas. ¿Cuál es más rápida?»

Resultados del benchmark

Esta tabla compara dos modelos desplegados en la misma carga de trabajo de benchmark (512/256 tokens, concurrencia 4). La columna Δ% muestra cuánto más rápido es el Modelo B (Qwen3-8B) que el Modelo A (Qwen3-1.7B) en cada métrica. Un valor positivo significa que el Modelo B es mejor.

Métrica Qwen3-1.7B (Modelo A) Qwen3-8B (Modelo B) Δ%
Rendimiento de tokens de salida 188.2 tokens/s 271.2 tokens/s +44.1%
Rendimiento por usuario 47.5 tokens/s 69.4 tokens/s +45.9%
Rendimiento de solicitudes 0.736 req/s 1.08 req/s +46.7%
Latencia entre tokens 20.9 ms 14 ms +33.0%
Latencia de las solicitudes 5,382 ms 3,658 ms +32.0%
Tiempo hasta el primer token 67.5 ms 166.3 ms −146.5%

Los dos modelos se ejecutan en hardware diferente. Qwen3-8B utiliza una 4-GPU ml.g5.12xlarge (4x A10G), mientras que Qwen3-1.7B utiliza una única GPU L4 (ml.g6.4xlarge). Las diferencias reflejan aproximadamente 4 veces la capacidad de cómputo, no solo los modelos en sí.

La conclusión: Qwen3-8B ofrece aproximadamente un 44–47 por ciento más de rendimiento y una latencia de extremo a extremo menor, en gran parte gracias al cómputo adicional de la GPU. Qwen3-1.7B solo gana en tiempo hasta el primer token, la ventaja esperada de un modelo más pequeño en una única GPU.

Poniendo todo junto

No necesitas memorizar los nombres de las capacidades ni saber qué flujo de trabajo solicitar. La siguiente tabla muestra cómo se corresponden las solicitudes comunes con los resultados.

Tú dices Lo que obtienes
«Ya desplegué un modelo y quiero saber qué tan rápido es.» Informe de rendimiento cuantitativo: rendimiento, percentiles de latencia, métricas de concurrencia de una carga real.
«Tengo un modelo en S3 y no sé en qué instancia implementarlo.» Opciones de implementación clasificadas con coste, rendimiento y latencia para cada configuración candidata.
“Quiero desplegar un modelo de JumpStart y encontrar la instancia más barata. Solo tengo el ID del modelo.” Opciones de despliegue clasificadas, sin necesidad de staging en S3. Se muestra una alternativa de modelo con acceso restringido si es necesaria.
“Ejecuté un benchmark antes y después de un cambio. ¿Cuál es más rápido?” Cambio porcentual en todas las métricas que indica mejora o regresión.
“Quiero optimizar un modelo Llama de Hugging Face Hub.” Se muestra la licencia, el modelo se almacena en S3 y luego se genera la salida estándar de recomendación.

Si tu solicitud abarca varias capacidades (por ejemplo, almacenar un modelo de Hugging Face y luego obtener recomendaciones de despliegue), el agente las encadena de forma natural dentro de la misma conversación.

Qué esperar del agente

Tu agente, equipado con la aws-ai-ml skill, sigue algunos comportamientos que hacen que la experiencia sea predecible y segura:

  • Pide lo que necesita. Si falta información (como el nombre de un endpoint o un URI de S3), el agente te pide que la proporciones en lugar de adivinarla.
  • Confirma antes de acciones de gran impacto. Antes de ejecutar un benchmark que genera tráfico real hacia un endpoint en producción, el agente te advierte sobre el impacto y solicita confirmación explícita.
  • Te indica cuando algo está fuera de su alcance. Si pides algo que el agente no puede hacer (como desplegar un modelo), explica lo que puede ofrecer en su lugar, como generar la configuración de despliegue que necesitas.
  • Genera código del SageMaker Python SDK v3. Cada resultado es código ejecutable que puedes inspeccionar, modificar y ejecutar en tu propio entorno.

Limpieza

Para evitar cargos continuos, elimina los recursos que creaste:

Conclusión

La aws-ai-ml skill para la inferencia de IA generativa optimizada de Amazon SageMaker AI convierte tu agente de programación existente en un experto en optimización de inferencia de SageMaker AI. Ya sea que necesites hacer un benchmark de un endpoint en producción, encontrar la instancia más barata para tu modelo, comparar configuraciones o almacenar un modelo de Hugging Face para evaluación, describes lo que quieres y tu agente ofrece resultados medibles.

Para comenzar, instala la skill a través del Agent Toolkit for AWS y agrégala al agente de programación que ya usas, o lanza un espacio de JupyterLab preconfigurado en Amazon SageMaker Studio. Para más información, consulta la Documentación de Amazon SageMaker AI.


Acerca de los autores

Fuente original

AWS Machine Learning

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original