مع توسع أنظمة الذكاء الاصطناعي للمؤسسات للتعامل مع سير العمل المعقد، يواجه الممارسون التحدي المتمثل في توجيه المهام الفرعية إلى الأدوات والمهارات المناسبة. يمكن أن يمتلك الوكلاء المئات من الأدوات والمهارات، ولكنهم يشعرون بالحيرة بشأن أي منها يجب عليهم استخدامه في كل خطوة من خطوات سير العمل.

ولمواجهة هذا التحدي، قام الباحثون في شركة علي بابا بتطوير SkillWeaver، وهو إطار عمل يقوم بإنشاء رسم بياني لتنفيذ مهمة معينة ويختار المهارات المناسبة لكل عقدة. كما يقدمون التحليل المدرك للمهارات (SAD)، وهي تقنية جديدة تستخدم حلقة ردود الفعل لتمكين الوكيل من جلب مرشحي الأدوات ذات الصلة وفحصهم بشكل متكرر. يميز هذا النهج التركيبي وآلية حلقة التغذية الراجعة SkillWeaver عن أطر توجيه الأدوات الأخرى التي تختار الأدوات بطريقة طلقة واحدة.

ترتبط SkillWeaver بتطبيقات الذكاء الاصطناعي في العالم الحقيقي حيث يقوم الوكلاء بتنسيق الأنظمة البيئية متعددة الأدوات بشكل مستقل، مثل بروتوكول السياق النموذجي (MCP)، لتنفيذ عمليات تجارية متعددة الخطوات مثل تنزيل مجموعات البيانات، وتحويل المعلومات، وإنشاء التقارير المرئية.

من الناحية العملية، تُظهر تجارب الباحثين مع SkillWeaver أن تنفيذ نهج الاسترداد والتوجيه هذا يزيد بشكل كبير من الدقة مع تقليل استهلاك الرمز المميز بنسبة تزيد عن 99% مقارنةً بتعريض الوكلاء بشكل ساذج لمكتبة أدوات كاملة.

بالنسبة للممارسين الذين يقومون ببناء وكلاء الذكاء الاصطناعي، فإن الفكرة الرئيسية هي أن دقة تحليل المهام هي أكبر عنق الزجاجة أمام الاسترجاع الدقيق للأداة.

التحدي المتمثل في توجيه المهارات

المهارات هي نمط رئيسي في بنيات وكيل LLM الحديثة. المهارة عبارة عن مواصفات أداة معيارية وقابلة لإعادة الاستخدام تستخدم وثائق اللغة الطبيعية المنظمة.

نظرًا لتكامل وكلاء المؤسسات مع النظم البيئية للأدوات الضخمة، يصبح توجيه استعلامات المستخدم بدقة إلى المهارات المناسبة مهمة صعبة. إن تعريض مكتبة بأكملها لماجستير في القانون للعثور على الأداة المناسبة هو أمر غير فعال إلى حد كبير، وسرعان ما يطغى على حدود السياق، ويستهلك مئات الآلاف من الرموز المميزة.

تحاول معظم أطر استخدام الأدوات الحالية حل هذه المشكلة من خلال استرجاع واجهة برمجة التطبيقات (API)، أو مطابقة الوثائق، أو الهياكل الهرمية التي تتعامل مع التوجيه بشكل صارم باعتباره اختيارًا لمهارة واحدة أو مشكلة لكل خطوة.

ومع ذلك، فإن نموذج المهارة الواحدة هذا غير كافٍ لبيئات المؤسسات لأن الاستعلامات في العالم الحقيقي مركبة بطبيعتها. طلب عمل قياسي مثل "قم بتنزيل مجموعة البيانات وتحويلها وإنشاء تقارير مرئية" لا يمكن تحقيقها بأداة واحدة. يتطلب ذلك تقسيم الموجه وتسلسل عميل API ومعالج البيانات وأداة التصور إلى خطة تنفيذ متماسكة ومتعددة الخطوات.

كيف يعمل SkillWeaver وSAD

ولمعالجة ذلك، وضع الباحثون إطارًا لمشكلة التعامل مع المهام المعقدة التي تتطلب مهارات متعددة "توجيه المهارات التركيبية." نظرًا لمطالبة المستخدم المعقدة ومكتبة واسعة من الأدوات، يجب على الوكيل في الوقت نفسه معرفة كيفية تقسيم الطلب إلى سلسلة من المهام الفرعية الذرية، وكيفية تعيين كل مهمة فرعية لأفضل مهارة متاحة، وكيفية تكوين تلك المهارات في خطة قابلة للتنفيذ.

ينظم SkillWeaver هذه العملية من خلال ثلاث مراحل متميزة: التحلل والاسترداد والإنشاء. في المرحلة الأولى، تعمل شهادة LLM كمحلل للمهام، حيث تقوم بتقسيم استعلام المستخدم المعقد إلى سلسلة من المهام الفرعية التي تتطلب كل منها مهارة واحدة. بمجرد تحديد المهام الفرعية بوضوح، يستخدم النظام نموذج التضمين لمقارنة كل مهمة فرعية بمكتبة المهارات لسحب قائمة مختصرة من أفضل الأدوات المرشحة لكل خطوة.

في المرحلة النهائية، يقوم المخطط بتقييم المرشحين الذين تم استرجاعهم بناءً على مدى جودة عملهم معًا. فهو يتحقق من التوافق بين المهارات لضمان تدفق مخرجات إحدى الأدوات بشكل طبيعي إلى مدخلات الأداة التالية. ثم يقوم بعد ذلك بإنشاء خطة تنفيذ نهائية كرسم بياني دوري موجه (DAG) يحدد التبعيات بحيث يمكن تنفيذ المهام المستقلة بالتوازي.

على سبيل المثال، لنفترض أن مستخدمًا يطلب من وكيل الذكاء الاصطناعي القيام بذلك "قم بتنزيل مجموعة البيانات وتحويلها وإنشاء تقارير مرئية." في مرحلة التحلل، يقوم برنامج التحليل LLM بتقسيم ذلك إلى ثلاث مهام فرعية متميزة: تنزيل مجموعة البيانات، وتحويل البيانات، وإنشاء التقارير.

في مرحلة الاسترداد، يبحث النظام في المكتبة ويجد مرشحين مثل “api-client” أو “http-fetch” للمهمة الأولى، و”csv-parser” أو “etl-pipeline” للمهمة الثانية، وما إلى ذلك. أخيرًا، تقوم مرحلة الإنشاء بتقييم هذه الخيارات، وتحديد المجموعة المحددة من “api-client”، و”csv-parser”، و”chart-gen” الأكثر توافقًا، وربطها معًا في سير عمل نهائي جاهز للتنفيذ.

يتمثل التحدي الرئيسي في هذا المسار في أن ماجستير إدارة الأعمال غالبًا ما ينتج أوصافًا عامة للخطوات التي تفشل في مطابقة المفردات التقنية المحددة للمهارات الفعلية المتوفرة في المكتبة. لإصلاح هذه المشكلة، تقدم SkillWeaver تحليلًا تكراريًا مدركًا للمهارات (SAD)، وهي حلقة تعليقات جديدة. يعمل SAD من خلال جعل LLM يقوم بصياغة خطة أولية، وإجراء بحث أولي للعثور على المهارات المطابقة بشكل فضفاض، ثم تغذية تلك المهارات المستردة مرة أخرى إلى LLM كتلميحات. يتيح ذلك لـ LLM إعادة كتابة تحليلها بحيث تتماشى التفاصيل والمفردات تمامًا مع الأدوات الفعلية الموجودة.

SkillWeaver في العمل

لتقييم أداء SkillWeaver في سيناريوهات مؤسسية واقعية، أنشأ الباحثون معيارًا مخصصًا يسمى CompSkillBench. ويتكون من 300 استعلام متعدد الخطوات بمستويات صعوبة مختلفة. ولمحاكاة بيئات العالم الحقيقي، استخدموا مكتبة تضم 2,209 من مهارات العالم الحقيقي المستمدة من النظام البيئي العام لـ MCP، والتي تغطي 24 فئة وظيفية مثل البنية التحتية السحابية، والتمويل، وقواعد البيانات.

بالنسبة للمحرك الأساسي، استخدم الباحثون في المقام الأول نموذجًا خفيف الوزن يضم 7 مليارات معلمة (Qwen2.5-7B-Instruct) لتحليل المهام، مقترنًا بمسترجع البحث الدلالي القياسي (MiniLM مع مؤشر FAISS) للعثور على الأدوات. تم تقييم SkillWeaver مقابل ثلاثة إعدادات رئيسية: القوة الغاشمة "LLM-مباشر" حيث قاموا بحشو جميع أسماء الأدوات في موجه نموذج كبير، وتحليل قائم على LLM بدون SAD، وحلقة وكيل على نمط ReAct.

تشير التجارب إلى أن تحليل المهام هو عنق الزجاجة الرئيسي. يفشل سلوك LLM القياسي عند التعامل مع مكتبات الأدوات الكبيرة، لكن حلقة ردود الفعل SAD تحرك الإبرة بشكل كبير. في إعداد الفانيليا، حقق النموذج 7B دقة تحليل (أي التنبؤ بالعدد الصحيح للخطوات) بنسبة 51.0% فقط من الوقت. من خلال تفعيل حلقة ردود الفعل SAD، قفزت الدقة إلى 67.7% (مع نموذج Qwen-Max الأكبر، وصلت الدقة إلى 92%). على "صعب" المهام التي تتطلب أربع إلى خمس مهارات متميزة، أدى اضطراب SAD إلى تحسين الدقة بنسبة 50٪.

أحد الاكتشافات الرائعة هو أن النماذج الأكبر حجمًا يمكن أن تؤدي في الواقع أداءً أسوأ عندما تكون غير موجهة. عند اختباره في إعداد الفانيليا، شهد نموذج أكبر يضم 14 مليار معلمة انخفاضًا في دقته إلى ما دون دقة النموذج 7B لأنه يميل إلى الإفراط في تحليل المهام إلى خطوات مجهرية وغير ضرورية. بمجرد تقديم SAD، أعادت تلميحات الأداة المستردة النموذج إلى الواقع وزادت من دقته. يشير هذا إلى أن مواءمة الوكيل مع مفردات أدوات محددة غالبًا ما يكون أكثر تأثيرًا من الدفع مقابل ماجستير إدارة أعمال أكبر وأكثر تكلفة.

الوجبات الجاهزة المهمة الأخرى هي الادخار الرمزي. أظهر خط الأساس LLM-Direct، الذي استخدم نموذج Qwen-Max الكبير جدًا، أن إدخال جميع الأدوات في موجه النموذج الكبير يفشل. على الرغم من إمكانات تقسيم المهام شبه المثالية، لم يسترد النموذج الضخم فئة الأداة الصحيحة إلا بنسبة 21.1% من الوقت عندما غمرته خيارات الأداة. لقد تفوق أسلوب الاسترداد والتوجيه المستهدف الخاص بـ SkillWeaver على هذا الأداء بشكل كبير من حيث الدقة مع خفض استهلاك نافذة السياق من ما يقدر بـ 884000 رمزًا مميزًا إلى ما يقرب من 1160 رمزًا مميزًا لكل استعلام، وهو انخفاض بنسبة 99.9%. بالنسبة للممارسين، يُترجم هذا مباشرةً إلى انخفاض تكاليف واجهة برمجة التطبيقات (API) بشكل كبير وأوقات استجابة أسرع.

وأخيرًا، فشل خط الأساس التقليدي ReAct تمامًا، حيث حقق دقة تحلل تبلغ 0%. تعمل حلقتها بشكل طبيعي على تحويل الخطط متعددة الخطوات إلى إجراءات معزولة بدلاً من رسم تسلسل متماسك ومتعدد الأدوات بشكل واضح.

اعتبارات للمطورين

في حين أن الباحثين لم يصدروا بعد الكود المصدري لـ SkillWeaver، إلا أن عملهم مبني على أدوات جاهزة يمكن إعادة إنتاجها بسهولة.

إن التحليل المدرك للمهارة (SAD)، وهو الابتكار الرئيسي في قلب الإطار، عبارة عن حلقة ذكية للهندسة السريعة والاسترجاع. لقد شارك المؤلفون قوالب المطالبة في ورقتهم البحثية، ويمكن للمطورين تنفيذها بأنفسهم بسهولة تامة باستخدام مكتبات التنسيق القياسية مثل LangChain، أو LlamaIndex، أو حتى نصوص Python الأولية.

أما بالنسبة لعنصر الاسترجاع، فقد قام المؤلفون ببناء الإطار الأساسي باستخدام all-MiniLM-L6-v2، وهو نموذج تضمين مفتوح المصدر. ووجدوا أن التبديل باستخدام برنامج تشفير جاهز قليلًا وأقوى قليلاً (BGE-base-en-v1.5) عزز الدقة على الفور دون أي ضبط دقيق. في حين أن برنامج التشفير الثنائي الجاهز يعد أمرًا رائعًا في إدراج أداة ذات صلة ضمن أفضل 10 مرشحات في ما يقرب من 70% من الوقت، إلا أنه يكافح من أجل تصنيف الأداة المثالية باستمرار في المرتبة الأولى بالضبط، ويحقق ذلك في حوالي 37% فقط من الوقت. لسد هذه الفجوة، من المحتمل أن تحتاج الفرق إلى تنفيذ برنامج تشفير ثانوي أو أداة إعادة ترتيب قائمة على LLM لإعادة ترتيب المرشحين العشرة الأوائل.

أحد متطلبات الإعداد المسبق هو توجيه مكتبة الأدوات وإنشاء فهرس FAISS مسبقًا. ومن الناحية العملية، هذه عقبة لا تذكر. استغرق تضمين وفهرسة جميع المهارات البالغ عددها 2,209 في المعيار 15 ثانية فقط. بمجرد إنشائها، يضيف استرداد الأدوات من الفهرس أقل من 15 مللي ثانية من زمن الوصول لكل استعلام. بالنسبة لبيئات المؤسسات، تعد مزامنة فهرس الأدوات مهمة خلفية تافهة.

القيد الحالي في SkillWeaver هو عدم إمكانية استرداد الأخطاء. بينما نجحت SkillWeaver في رسم DAG متوافق للتنفيذ، كشفت الدراسة التجريبية التي أجراها المؤلفون عن تحديات سلاسل الأدوات متعددة الخطوات. على سبيل المثال، إذا فشل استدعاء واجهة برمجة التطبيقات (API) في الخطوة الثانية، فستنقطع السلسلة بأكملها. تقتصر المساهمة الأساسية لهذه الورقة على مرحلة التوجيه والتخطيط. من أجل نشر حقيقي للإنتاج، يجب على الممارسين إنشاء آليات خاصة بهم لاستعادة الأخطاء والرجوع وإعادة المحاولة أعلى مرحلة الإنشاء للتعامل مع مهلات واجهة برمجة التطبيقات (API) في العالم الحقيقي أو المخرجات المشوهة.

شاركها.
اترك تعليقاً