AWS Machine Learningآخر تحديث

مهارة وكيل جديدة: استدلال الذكاء الاصطناعي التوليدي المحسَّن عبر Amazon SageMaker لوكيل البرمجة الخاص بك

يقدّم الاستدلال الأمثل للذكاء الاصطناعي التوليدي في Amazon SageMaker مهارة aws-ai-ml من خلال Agent Toolkit for AWS، ما يمنح وكلاء البرمجة مثل Kiro وClaude Code وCodex خبرة عميقة في تحسين الاستدلال وقياس الأداء. صِف ما…

يستخدم المهندسون على نحو متزايد أدوات المساعدة في البرمجة لتسريع سير عمل التطوير لديهم. واليوم، الاستدلال المحسّن للذكاء الاصطناعي التوليدي في Amazon SageMaker AI يقدم aws-ai-ml مهارة، متاحة عبر مجموعة أدوات الوكيل لـ AWS. تمنح هذه المهارة وكلاء البرمجة مثل كيرو, وClaude Code، وCodex خبرة عميقة في تحسين الاستدلال وقياس الأداء. ثبّت المهارة، وسيتمكن وكيلك الحالي من قياس أداء نقاط النهاية، وتوصية إعدادات النشر، ومقارنة تشغيلات الأداء، وتوليد كود SageMaker Python SDK v3 قابل للتنفيذ نيابةً عنك. ال aws-ai-ml skill هي مجموعة أدوات تتكامل مع أي وكيل برمجي يدعم بروتوكول سياق النموذج (MCP)، وتحوّله إلى خبير في تحسين استدلال SageMaker AI.

في هذا المنشور، نستعرض ما تتيحه هذه المهارة، وكيفية إعدادها، وكيف تساعدك على الانتقال بسرعة أكبر من النموذج إلى الإنتاج.

التحدي: سد الفجوة بين النية والبنية التحتية

يدعم Amazon SageMaker AI الاستضافة المُدارة بالخوادم عبر الأوضاع الفورية والدفعية وغير المتزامنة. فهو يوفر سعة عند الطلب وسعة محجوزة، وأنواع مثيلات غير متجانسة، وعزلاً عبر السحابة الخاصة الافتراضية (VPC)، وتوسيعاً تلقائياً، وتكاملاً مع كل مسارات التدريب في SageMaker AI. نطاق الوظائف واسع وعميق، لكن معظم المهندسين لا يأتون وهم يعرفون أي عائلة مثيلات أو أي حاوية خدمة ستلبي احتياجاتهم على أفضل وجه. بل يأتون بحالة استخدام محددة: هدف أداء يرغبون في تحقيقه، أو حدود تكلفة يلزمهم الالتزام بها، أو نموذج يحتاجون إلى تقييمه قبل اتخاذ قرار النشر في بيئة الإنتاج.

تُغلق التجربة الوكيلة (agentic) للاستدلال التوليدي المُحسَّن لـ SageMaker AI هذه الفجوة. تخبر الوكيل ما تريد إنجازه، فيُنتج كود SageMaker Python SDK v3 قابلًا للتنفيذ يمكنك مراجعته وتعديله وتشغيله في بيئتك الخاصة. يطرح الوكيل أسئلة توضيحية مستهدفة، ويُنشئ كودًا مبنيًا على معايير أداء حقيقية وبيانات أداء مقاسة، ويتكيف مع قيود عملك بالطريقة التي يتصرف بها مهندس الحلول.

في كل الوقت، تبقى أنت المتحكم. كل خطوة مرئية في الوقت الفعلي ومعبرًا عنها في شكل شيفرة يمكنك قراءتها ومناقشتها. لا يحدث أي شيء خلف واجهة مستخدم مبهمة.

البداية

يمكنك تثبيت aws-ai-ml المهارة من خلال مجموعة أدوات الوكيل لـ AWS على جهازك المحلي، أو استخدمه ضمن مساحة JupyterLab في Amazon SageMaker Studio. وفي كلتا الحالتين، يمكنك الانتقال من الصفر إلى محادثة عاملة خلال 10 دقائق.

الخيار A: الاستخدام مع أي وكيل برمجي (Kiro أو Claude Code أو Codex أو أي وكيل متوافق مع MCP)

الخطوة 1: تثبيت مجموعة أدوات الوكيل (Agent Toolkit) لخدمة AWS. إذا لم تقم بذلك بعد، فقم بإعداد Agent Toolkit. يتطلب هذا AWS Command Line Interface (AWS CLI) الإصدار 2.35 أو أحدث و uv مُثبَّت.

aws configure agent-toolkit

يقوم هذا باكتشاف وكلائك تلقائيًا، وتثبيت المهارات، وإعداد AWS MCP Server. للتعليمات الخاصة بكل وكيل (أوامر تثبيت الإضافات وإعداد MCP)، راجع دليل البدء لـ Agent Toolkit لخدمة AWS.

الخطوة 2: تثبيت aws-ai-ml مهارة. أضف مهارة الاستدلال للذكاء الاصطناعي التوليدي المحسّنة في SageMaker AI إلى وكيلك:

npx skills add aws/agent-toolkit-for-aws/skills/aws-ai-ml

الخطوة 3: التأكيد والبدء. افتح لوحة محادثة وكيل البرمجة الخاص بك واسأله: «ما المهارات المتاحة؟» ينبغي أن ترى aws-ai-ml مدرجة. بعد التأكيد، صِف هدفك باللغة الطبيعية. أصبح لدى وكيل البرمجة الآن خبرة مدمجة في تحسين الاستدلال في SageMaker AI.

المتطلبات الأساسية: يجب أن تمتلك بيانات اعتماد AWS لديك الأذونات اللازمة لاستدعاء واجهات برمجة تطبيقات SageMaker AI (إنشاء نقاط النهاية، وتشغيل مهام القياس المرجعي والتوصيات). تنشئ المهارة تعليمة برمجية تعمل ضمن بيانات اعتمادك. لا يلزم أي تكوين إضافي لخدمة AWS Identity and Access Management (IAM) بالنسبة للمهارة نفسها.

ملاحظة: بالنسبة إلى Kiro وClaude Code، يمكن للوكلاء اكتشاف المهارات في وقت التشغيل. يمكنهم البحث عن المهارات وتحميلها عند الطلب عبر AWS MCP Server، دون أي تثبيت محلي. اطلب من وكيلك: «ابحث عن مهارات AWS المتعلقة بقواعد البيانات.» راجع ملف readme لاكتشاف المهارات في وقت التشغيل.

الخيار ب: الاستخدام داخل Amazon SageMaker Studio

إذا كنت تفضل العمل داخل بيئة JupyterLab مُدارة، يمكنك استخدام المهارة في Amazon SageMaker Studio باستخدام صورة مهيأة مسبقًا.

الخطوة 1: فتح Amazon SageMaker Studio. انتقل إلى Amazon SageMaker Studio في حساب AWS المستهدف والمنطقة (AWS Region) المستهدفة. اختر نطاق Studio الخاص بك وشغّل بيئة التطوير المتكاملة Studio IDE من ملف تعريف المستخدم الخاص بك.

الخطوة 2: أنشئ مساحة JupyterLab. من الصفحة الرئيسية لـ Studio، اختر JupyterLab، ثم اختر Create JupyterLab space. سمِّ المساحة (على سبيل المثال، my-inference-opt) واحتفظ بإعداد المشاركة Private (تتم مزامنة المهارات فقط في المساحات الخاصة). ضمن قائمة Image ، اختر الصورة التي تتضمن مهارة الاستدلال للذكاء الاصطناعي التوليدي المحسَّنة من SageMaker AI. تأتي هذه الصورة مُهيأة مسبقًا مع مهارة aws-ai-ml وجميع التبعيات الضرورية. اختر Run space وانتظر حتى يتم تشغيلها (من 5 إلى 10 دقائق في المرة الأولى).

ملاحظة: استخدم مساحة جديدة. قد لا تلتقط المساحة المُعاد استخدامها والمعدَّلة محليًا بنسخة المهارة الصورة المُهيأة مسبقًا.

الخطوة 3: افتح JupyterLab وأطلق طرفية (terminal). بعد تشغيل المساحة، افتح JupyterLab واختر Terminal.

الخطوة 4: اعتمد وكيل البرمجة الخاص بك. في الطرفية، قم بالمصادقة مع وكيل البرمجة باستخدام مزود هويتك. على سبيل المثال، مع Kiro:

kiro-cli login --license pro --identity-provider <your-IdP-start-URL> --region us-east-1 --use-device-flow

الخطوة 5: أكّد وابدأ. افتح لوحة الدردشة الخاصة بوكيل البرمجة واسأل: “What skills are available?” يجب أن ترى aws-ai-ml مدرجة. بمجرد التأكيد، صِغ نيتك بلغة طبيعية.

استكشاف الأخطاء وإصلاحها:

إذا أفاد الوكيل بعدم توفر أي مهارات، تحقق من أن مساحتك مضبوطة على Private. يمكنك أيضًا التحقق من الطرفية:

ls ~/.kiro/skills/

إذا كان ذلك الدليل فارغًا لكن /etc/sagemaker/skills/ يحتوي على ملفات المهارة، نفّذ restart-jupyter-server، ثم حدِّث الصفحة وأعد المحاولة.

ما يمكنك فعله

تغطي التجربة الوكيلة (agentic) القدرات التالية على مدار دورة تحسين الاستدلال. لا تحتاج إلى معرفة القدرة التي يجب استدعاؤها. صِف ما تريده، وسيحدد الوكيل الخطوة التالية أو يطرح أسئلة توضيحية إذا كان هناك أي غموض.

قياس أداء نقطة نهاية موجودة

إذا كان لديك نموذج منشور بالفعل على نقطة نهاية SageMaker AI، يمكنك أن تطلب من الوكيل قياس أدائه. أخبر الوكيل بنقطة النهاية التي تريد اختبارها، وسيقوم بإنشاء دفتر ملاحظات Python يجري اختبار حمل باستخدام واجهتي Workload.synthetic() و start_benchmark() APIs من SageMaker Python SDK.

قبل تشغيل أي قياس أداء، يؤكد الوكيل أن نقطة النهاية لديك آمنة لإجراء اختبار الحمل عليها، لأن قياس الأداء يوجّه حركة مرور حقيقية إلى نقطة نهاية نشطة.

عند اكتمال قياس الأداء، تحصل على تقرير أداء كمي يتضمن:

  • الإنتاجية (Throughput): الطلبات في الثانية، والرموز الناتجة في الثانية.
  • زمن الاستجابة (Latency): p50 وp99 والزمن حتى أول رمز (time-to-first-token) وزمن الاستجابة بين الرموز (inter-token latency).
  • التزامن (Concurrency): عدد الطلبات المتزامنة المدعومة.

هذه قيم مقاسة من حمل حقيقي على بنية تحتية حقيقية، وليست تقديرات. كما يوصي الوكيل بآليات تحسين (مثل فك الترميز المسبق prefill decoding) لتعزيز الأداء.

مثال على المطالبة: «قم بقياس أداء نقطة نهاية Llama لدي على SageMaker AI.»

اعثر على نوع المثيل المناسب لنموذجك

إذا كان لديك نموذج وتحتاج إلى إيجاد نوع المثيل المناسب لنشره على SageMaker AI، فأخبر وكيلك بذلك. لا يهم أين يوجد نموذجك أو كيف حصلت عليه:

  • نموذج مضبوط دقيقاً أو مخصص في Amazon Simple Storage Service (Amazon S3): لقد درّبت أو نزّلت نموذجاً وخزّنته في S3. قدّم معرّف الموارد الموحد (URI) الخاص بـ S3 وهدفك من التحسين. مثال على المطالبة: «أريد إيجاد أرخص نوع مثيل لنشر نموذجي المضبوط دقيقاً على SageMaker.»
  • نموذج أساس متاح للعمومية من Amazon SageMaker JumpStart: تريد نشر نموذج أساس (FM) من كتالوج JumpStart، عندها قدّم معرّف النموذج. مثال على المطالبة: «اعثر على أفضل مثيل للنموذج huggingface-reasoning-qwen3-8b على SageMaker AI.»
  • نموذج على Hugging Face Hub: تريد استخدام نموذج مستضاف على Hugging Face. قدّم اسم النموذج. بالنسبة للنماذج المقيّدة (مثل إصدارات Llama)، يعرض لك الوكيل شروط الترخيص ويطلب منك قبولها وتقديم رمز Hugging Face الخاص بك. مثال على المطالبة: «أريد نشر نموذج Llama من Hugging Face Hub. ما الخيار الأرخص؟»

في كل الحالات، ينشئ وكيلك شيفرة برمجية تقيّم نموذجك مقابل المثيلات والتكوينات المرشحة، ثم يعرض خيارات نشر مرتبة بمقاييس أداء ملموسة: الإنتاجية، ونسب مئوية لزمن الاستجابة، والزمن حتى أول رمز، والتزامن. أنت تختار بناءً على متطلباتك من التكلفة والأداء.

مقارنة عمليات قياس الأداء

إذا أجريت عدة عمليات قياس أداء (على سبيل المثال، قبل تغيير تكوين ما وبعده، أو عبر نوعي مثيل مختلفين)، يمكنك أن تطلب من الوكيل مقارنتها. قدّم اسمي عمليتي قياس الأداء، وسيُنشئ الوكيل مقارنة تحسب الفروقات عبر المقاييس الرئيسية: الإنتاجية، ونسب مئوية لزمن الاستجابة، والزمن حتى أول رمز.

تُظهر النتائج تغيرات مئوية حيث تعني القيمة الموجبة أفضل أداءً، مما يمنحك ملخصًا واحدًا قابلًا للتفسير حول ما إذا كان التغيير قد حسّن الأداء أو خفّضه أو لم يكن له تأثير ذو معنى.

إذا لم يكن أحد تشغيلات المعيار المرجعي موجودًا، يقترح الوكيل تشغيله أولًا قبل المتابعة بالمقارنة.

مثال على توجيه: «لديّ تشغيلان للمعيار المرجعي وأريد مقارنتهما. أيّهما أسرع؟».

نتائج المعيار المرجعي

يقارن هذا الجدول نموذجين مُوزّعين على نفس عبء عمل المعيار المرجعي (512/256 tokens، تزامن 4). يُظهر عمود Δ% مقدار سرعة النموذج B (Qwen3-8B) مقارنة بالنموذج A (Qwen3-1.7B) في كل مقياس. القيمة الموجبة تعني أن النموذج B أفضل.

متري Qwen3-1.7B (النموذج A) Qwen3-8B (النموذج B) Δ%
إنتاجية رموز المخرجات 188.2 رمز/ثانية 271.2 رمز/ثانية +44.1%
الإنتاجية لكل مستخدم 47.5 رمز/ثانية 69.4 رمز/ثانية +45.9%
إنتاجية الطلبات 0.736 طلب/ثانية 1.08 طلب/ثانية +46.7%
زمن الوصول بين الرموز 20.9 مللي ثانية 14 ms +33.0%
زمن استجابة الطلب 5,382 ms 3,658 ميلي ثانية +32.0%
زمن ظهور أول رمز 67.5 ملّي ثانية 166.3 ملّي ثانية −146.5%

يعمل النموذجان على عتاد مختلف. يستخدم Qwen3-8B عنقودًا من 4 وحدات معالجة رسومية ml.g5.12xlarge (4x A10G)، بينما يستخدم Qwen3-1.7B وحدة معالجة رسومية واحدة من نوع L4 (ml.g6.4xlarge). تعكس الفروقات نحو 4 أضعاف القدرة الحاسوبية، وليس النموذجين وحدهما.

الخلاصة: يقدم Qwen3-8B إنتاجية أعلى بنحو 44–47 بالمئة وزمن استجابة من طرف إلى طرف أقل، ويعود ذلك في الغالب إلى القدرة الحاسوبية الإضافية للوحدات المعالجة الرسومية. يتفوق Qwen3-1.7B فقط في زمن ظهور أول رمز، وهي الميزة المتوقعة لنموذج أصغر على وحدة معالجة رسومية واحدة.

جمع كل شيء معًا

لست بحاجة إلى حفظ أسماء القدرات أو معرفة أي سير عمل يجب طلبه. يوضح الجدول التالي كيف تُترجم الطلبات الشائعة إلى نتائج.

ما تقوله ما تحصل عليه
«سبق أن نشرت نموذجًا وأريد معرفة مدى سرعته.» تقرير أداء كمي: الإنتاجية، ومئينات زمن الاستجابة، ومقاييس التزامن من حمل حقيقي.
«لديّ نموذج في S3 ولا أعرف على أي instance ينبغي نشره.» خيارات نشر مرتبة مع التكلفة ومعدل النقل وزمن الاستجابة لكل تكوين مرشح.
«أريد نشر نموذج JumpStart والعثور على أرخص instance. لا أملك سوى معرّف النموذج.» خيارات نشر مرتّبة، دون الحاجة إلى تجهيز مسبق على S3. ويُعرض بديل للنماذج المقيدة عند الحاجة.
«أجريت اختبار أداء قبل وبعد إجراء تغيير. أيّهما أسرع؟» نسبة التغير عبر جميع المؤشرات التي تشير إلى التحسن أو التراجع.
أريد تحسين نموذج Llama من Hugging Face Hub. تم إبراز الترخيص، وتم تجهيز النموذج وتحميله إلى S3، ثم إخراج التوصية القياسية.

إذا كان طلبك يمتد عبر قدرات متعددة (على سبيل المثال، إطلاق نموذج من Hugging Face ثم الحصول على توصيات النشر)، فإن الوكيل يربطها بشكل طبيعي ضمن المحادثة نفسها.

ما يمكن توقعه من الوكيل

وكيلك، المزوّد بـ aws-ai-ml مهارة، يتبع بضع سلوكيات تجعل التجربة قابلة للتنبؤ وآمنة:

  • إنه يطلب ما يحتاجه. إذا كانت المعلومات ناقصة (مثل اسم نقطة النهاية أو عنوان S3 URI)، يطلب منك الوكيل تقديمها بدلاً من التخمين.
  • إنه يؤكد قبل الإجراءات المؤثرة. قبل تشغيل اختبار قياس (benchmark) يوجّه حركة مرور حقيقية إلى نقطة نهاية نشطة، يحذّر الوكيل من التأثير ويطلب تأكيدًا صريحًا.
  • يخبرك متى يكون شيء ما خارج النطاق. إذا طلبت شيئًا لا يستطيع الوكيل القيام به (مثل نشر نموذج)، فهو يشرح ما يمكنه تقديمه بدلًا من ذلك، مثل توليد إعدادات النشر التي تحتاجها.
  • يقوم بتوليد كود SageMaker Python SDK الإصدار 3 (v3). كل مخرجاته هي كود قابل للتنفيذ يمكنك فحصه وتعديله وتشغيله في بيئتك الخاصة.

التنظيف

لتجنب الرسوم المستمرة، احذف الموارد التي أنشأتها:

الخلاصة

تعمل مهارة aws-ai-ml الخاصة بالاستدلال التوليدي المحسّن بالذكاء الاصطناعي في Amazon SageMaker AI على تحويل وكيل البرمجة الحالي لديك إلى خبير في تحسين استدلال SageMaker AI. سواء كنت بحاجة إلى إجراء قياس مرجعي لنقطة نهاية نشطة، أو العثور على أرخص مثيل لنموذجك، أو مقارنة الإعدادات، أو تجهيز نموذج Hugging Face للتقييم، فأنت تصف ما تريده ويقدم لك وكيلك نتائج قابلة للقياس.

للبدء، ثبّت المهارة من خلال Agent Toolkit for AWS وأضفها إلى وكيل البرمجة الذي تستخدمه بالفعل، أو أطلق مساحة JupyterLab مهيأة مسبقًا في Amazon SageMaker Studio. لمزيد من المعلومات، راجع توثيق Amazon SageMaker AI.


عن المؤلفين

المصدر الأصلي

AWS Machine Learning

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل