أصدر مختبر بول سايد للذكاء الاصطناعي في سان فرانسيسكو، الذي قضى معظم سنوات وجوده التي استمرت ثلاث سنوات في بيع نماذج التشفير للحكومات ووكالات الدفاع بهدوء، نموذجه الأكثر قدرة حتى الآن – وراهن بقوة على نحو غير عادي على أن الشفافية الجذرية، وليس الحجم الخام، هي الطريقة التي يتنافس بها مختبر أصغر على الحدود.

النموذج، Laguna S 2.1، عبارة عن نظام خليط من الخبراء (MoE) مكون من 118 مليار معلمة يقوم بتنشيط 8 مليار معلمة فقط لكل رمز مميز، ويدعم نافذة سياق تصل إلى مليون رمز مميز، و- وفقًا للمعايير التي نشرتها الشركة – يطابق أو يتفوق على النماذج المفتوحة عدة مرات حجمها في مهام الترميز الوكيل. الأوزان متاحة على الفور على Hugging Face بموجب ترخيص OpenMDW-1.1 المسموح به.

الأرقام الرئيسية ملفتة للنظر بالنسبة لنموذج بهذا الحجم الصغير. تشير تقارير Poolside إلى أن Laguna S 2.1 سجل 70.2% على Terminal-Bench 2.1، وهو معيار للمهام الطرفية طويلة المدى، مما يضعه في المرتبة 11 على لوحة المتصدرين المجمعة للشركة – متقدمًا على DeepSeek-V4-Pro-Max، وهو نموذج ذو 1.6 تريليون معلمة سجل 64.0؛ آلة التفكير التي تحتوي على 975 مليار معلمة، بمعدل 63.8؛ وNvidia Nemotron 3 Ultra الذي يحتوي على 550 مليار معلمة، بمعدل 56.4. في SWE-Bench Multilingual، يسجل 78.5%، وفي مجموعة البيانات العامة لـ SWE-Bench Pro، 59.4%.

ولعل الأمر الأكثر دلالة من أي نتيجة واحدة هو أن النموذج انتقل من بداية التدريب المسبق في 22 مايو إلى الإطلاق العام في أقل من تسعة أسابيع، وتم تدريبه على 4096 وحدة معالجة رسوميات Nvidia H200. في صناعة يتم فيها قياس دورات النماذج الرئيسية عادة على أساس أرباع أو سنوات، قامت شركة Poolside الآن بشحن ثلاثة نماذج في ثلاثة أشهر.

لماذا أصبحت فجوة الذكاء الاصطناعي المفتوحة في الغرب قضية في مجلس الإدارة؟

يقع الإصدار وسط نقاش حاد بشكل متزايد حول مصدر الذكاء الاصطناعي ذو الوزن المفتوح. خلال العام الماضي، تحول اعتماد المطورين بشكل حاسم نحو الأنظمة ذات الوزن المفتوح التي يمكن للشركات تنزيلها وفحصها وتشغيلها على بنيتها التحتية الخاصة – وجاءت الخيارات الرائدة في هذه الفئة بأغلبية ساحقة من المختبرات الصينية. تتميز خطوط DeepSeek وQwen وKimi وGLM وMiniMax وTencent’s Hunyuan جميعها بشكل بارز في جداول المقارنة الخاصة بـPoolside.

يصور البيان الصحفي المصاحب لـ Poolside Laguna S 2.1 بشكل صريح كرد، مع الإشارة إلى أن النموذج يحتل فئة حجم لم يصدر فيها أي مختبر غربي أوزان مفتوحة خلال 11 شهرًا – منذ gpt-oss-120b من OpenAI في أغسطس الماضي. "يحتاج الغرب إلى نماذج ذات وزن مفتوح يمكنه الوثوق بها وتشغيلها والبناء عليها." قال جيسون وارنر، الرئيس التنفيذي المشارك لشركة Poolside، في الإعلان.

جعل المؤسس المشارك والرئيس التنفيذي المشارك إيسو كانط المخاطر الفلسفية أكثر وضوحًا في منشور طويل على X. "أعتقد أن الذكاء يجب أن يصبح سلعة، وسوف يصبح كذلك،" كتب بحجة أن النظام البيئي مفتوح "لن يفوز بكونه الأفضل في فئته." وقال إن المستخدمين يريدون ببساطة أفضل المعلومات للمهمة التي يقومون بها – لذلك يجب أن تكون النماذج المفتوحة على قدم المساواة مع نظيراتها المغلقة، أو أفضل منها.

المنطق الاستراتيجي هنا ليس صدقة. يتمثل العمل الأساسي لشركة Poolside في نشر النماذج داخل الحدود الأمنية للحكومة والدفاع والمؤسسات الخاضعة للتنظيم – العملاء الذين غالبًا ما يكون الوصول المحدود لواجهة برمجة التطبيقات (API) غير مقبول لأسباب تتعلق بالامتثال والسيادة.

إن كل مؤسسة تقوم بتوحيد المعايير على النموذج الصيني المفتوح اليوم يصبح من الصعب الفوز بها غداً. يعد إطلاق الأوزان المفتوحة التنافسية بمثابة لعبة للنظام البيئي وإستراتيجية قمة المسار لأعمال النشر عالية الأمان الخاصة بالشركة. كما أنه يعيد صياغة سباق الذكاء الاصطناعي بعيدًا عن التضاريس التي لا تستطيع شركة Poolside المنافسة فيها – الإنفاق الرأسمالي على نطاق حدودي – ونحو التضاريس التي تعتقد أنها تستطيع المنافسة فيها: التكلفة لكل رمز مميز، والاستضافة الذاتية، وسرعة التكرار.

كيف تجعل البنية المتناثرة عملاء الذكاء الاصطناعي للمؤسسات في متناول الجميع للتشغيل

يعكس التصميم الفني أطروحة محددة حول الاتجاه الذي تتحرك فيه القيمة في برمجة الذكاء الاصطناعي. إن بنية MoE المتفرقة لـ Laguna S 2.1 – 256 خبيرًا موجهًا بالإضافة إلى خبير واحد مشترك، مع اهتمام بالاستعلام المجمع وطبقات النوافذ المنزلقة المتداخلة، وفقًا لبطاقة نموذج Hugging Face – تعني مقياس تكاليف الاستدلال مع 8 مليارات معلمة نشطة، وليس إجمالي 118 مليار. يؤكد Poolside على أن النموذج صغير بما يكفي لتشغيله على جهاز Nvidia DGX Spark واحد، وهو جهاز الذكاء الاصطناعي من فئة سطح المكتب.

وهذا مهم بالنسبة لما يسميه بول سايد الاقتصاد الرمزي. يعد وكلاء الترميز طويل المدى مستهلكين نهمين للرموز المميزة: تُظهر البيانات المنشورة للشركة أن النموذج يستهلك متوسطًا يبلغ حوالي 249000 رمزًا مميزًا للإكمال لكل مسار على أصعب معاييره عند تمكين وضع التفكير. وبأسعار محددة لواجهة برمجة التطبيقات (API)، تصبح أعباء عمل الوكلاء على نطاق المؤسسة بندًا ذا معنى في الميزانية. على OpenRouter، يقدم Poolside نقطة نهاية مجانية لسياق 256 ألفًا ونشرًا مخصصًا لسياق 1M بسعر 0.10 دولارًا أمريكيًا لكل مليون رمز إدخال و0.20 دولارًا أمريكيًا لكل مليون رمزًا مميزًا للمخرجات – وهو تسعير قوي يقوض معظم البدائل الحدودية بأمر من حيث الحجم.

دعم النظام البيئي واسع بشكل غير عادي في اليوم الأول. النموذج موجود حاليًا على مكتبة نماذج Baseten وVercel’s AI Gateway، مع عمليات تكامل عبر vLLM وSGLang وOllama وllama.cpp، بالإضافة إلى المتغيرات الكمية وصولاً إلى ملفات GGUF ذات 4 بت – 75 جيجابايت – للاستخدام المحلي. لكن ادعاء Poolside الأكثر إثارة للاهتمام هو سلوكي، وليس معماري. وقال بينجمينج وانج، الرئيس المشارك للأبحاث التطبيقية في بول سايد، إن المكاسب جاءت من تحسين عادات عمل النموذج: "مزيد من التحقق، وأقل اعتبار للأمور أمرا مفروغا منه، وعدم إعلان النصر مبكرا، وأكثر إصرارا." وتجادل الشركة بأن الذكاء الخام هو أحد محاور القدرة؛ تعد طريقة عمل النموذج محورًا ثانيًا له أهمية كبيرة بالنسبة للعملاء الذين يُتركون دون مراقبة لساعات.

نشر كل مسار مرجعي لمواجهة أزمة مصداقية الذكاء الاصطناعي

قد يكون الجزء الأكثر أهمية من الإصدار للمشترين من المؤسسات هو خطوة تقييم الشفافية مع سابقة قليلة بين المختبرات الكبرى: نشرت شركة Poolside المسار الكامل وغير المحرر لكل تجربة في عمليات التشغيل المعيارية النهائية – كل خطوة تفكير، واستدعاء أداة، وأمر الصدفة وراء كل نتيجة تم الإبلاغ عنها.

وهذا يعالج مشكلة المصداقية المتزايدة في قياس معايير الذكاء الاصطناعي. نظرًا لأن أعلى الدرجات في المعايير الناضجة تتجمع في نطاق 70-90٪، وكما "قرصنة المكافأة" – النماذج التي تجد الحلول عبر الإنترنت أو أدوات التحقق من الألعاب بدلا من حل المشكلات – أصبحت مستوطنة، وفقدت الأرقام المبلغ عنها ذاتيا الكثير من إشاراتها. كشف Poolside عن مواجهاته الخاصة مع المشكلة بصراحة: أثناء التدريب، تم وضع علامة على أكثر من نصف المسارات في بعض مهام SWE لأن النموذج قام ببساطة بالبحث في طلب سحب إصلاح الأخطاء الأصلي عبر الإنترنت وقام بتطبيقه. قامت الشركة بتوثيق عمليات التخفيف التي قامت بها، بما في ذلك الإضافات الفورية، ومعايرة التحكيم المستند إلى LLM وفقًا للتسميات البشرية، ومراجعة المعلقين الخبراء لعملية تشغيل Terminal-Bench عالية الدرجات.

توضح ثلاث دراسات حالة منشورة ما تعنيه الشركة بالمثابرة. في إحداها، قام النموذج ببناء محرك عرض HTML/CSS عامل من مجلد فارغ في جلسة غير مراقبة مكونة من 181 خطوة مدتها 50 دقيقة – ثم، بسبب افتقاره إلى إمكانات الرؤية، قام بتدوير Chromium بدون رأس لمقارنة مخرجات القماش الخاصة به رقميًا مع عرض المتصفح الحقيقي. في نموذج آخر، تم الإشارة إليه في أداة تسخير وكيل Poolside الخاصة في حلقة تحسين تلقائية، جعل النموذج قاعدة كود Go أسرع بنسبة 5.2% مع تخصيص ذاكرة أقل بنسبة 70% تقريبًا، مع العثور على خطأ في تسلسل سلسلة O(n²) على طول الطريق. وفي تجربة ثالثة، أثناء العمل في بيئة معزولة دون تثبيت بايثون، قام النموذج بتطبيق نظرية الأعداد الخاصة به بلغة بيرل وأعاد بشكل مستقل اشتقاق دليل على مشكلة إردو رقم 397 – وهي مسألة توافقية مفتوحة لمدة خمسة عقود حتى حلها GPT-5.2 Pro لأول مرة في يناير الماضي. تشير شركة Poolside إلى أن بناء نموذجها يختلف هيكليًا عن الحل المنشور مسبقًا، وأن قطع المعرفة في نوفمبر 2025 يسبق الدليل الأول.

ما تكشفه القيود التي تم الكشف عنها والمطبوعات الدقيقة المعيارية

يستحق Poolside الفضل في الكشف عن القيود التي تخفيها معظم المختبرات. يمكن أن يتناسب النموذج مع أدواته الأصلية ويتعثر في مخططات أدوات مختلفة قليلاً في وكلاء الطرف الثالث، ويشوه JSON في وسيطات الأداة المتداخلة، ويكون عرضة للتفكير الزائد في رياضيات المنافسة. لا يوجد حاليًا قرص لجهد التفكير قابل للتكوين من قبل المستخدم – فقط تشغيل أو إيقاف – والفجوة بين الأوضاع هائلة: يؤدي التفكير إلى رفع Terminal-Bench 2.1 من 60.4% إلى 70.2%، وDeepSWE من 16.5% إلى 40.4%، بتكلفة رمزية أعلى بكثير.

يجب على المشترين تطبيق الخصومات الخاصة بهم على جداول المقارنة. تأخذ منهجية Poolside الحد الأقصى من الدرجات التي أبلغ عنها البائعون ذاتيًا، ولوحات المتصدرين للمؤلفين المعياريين، وأرقام الجهات الخارجية للمنافسين – وهي اتفاقية معقولة، ولكنها تمزج بين الأدوات وظروف الاختبار. في DeepSWE، على وجه الخصوص، قامت Poolside بتشغيل أداة وكيلها الخاصة بدلاً من وكيل swe المصغر القياسي في لوحة المتصدرين، وهو فرق تعترف به الشركة يجعل النتائج أقل قابلية للمقارنة بشكل مباشر. ومن الواضح أن الحدود لا تزال بعيدة المنال: النماذج المغلقة مثل GPT-5.6 Sol، عند 88.8 على Terminal-Bench 2.1، وClaude Fable 5، عند 88.0، إلى جانب الوزن المفتوح البالغ 2.8 تريليون معلمة Kimi K3، عند 88.3، تجلس أعلى بكثير من Laguna S 2.1.

السؤال الهيكلي الأعمق هو ما إذا كان Poolside’s "مصنع الموديل" – يمكن للمنصة الداخلية التي تنسب إليها الشركة إيقاع إصدارها السريع – أن تحافظ على هذه الوتيرة مع توسع النماذج. المسار حتى الآن غير عادي حقًا: الإصدار المزدوج لشهر أبريل من Laguna M.1 وXS.2، وتحديث XS 2.1 في 2 يوليو، والآن S 2.1، والذي تقول الشركة إنه يتفوق على M.1 الرائد في أبريل بحوالي ثلث حجمه النشط. ومن اللافت للنظر أن S 2.1 استخدم نفس بيانات ما قبل التدريب تمامًا مثل XS 2.1، مما يعني أن كل التحسينات تقريبًا جاءت من الحجم وإصلاحات التدريب وما بعد التدريب عبر مجموعة الشركة المكونة من 409000 بيئة تدريب وكيل وغير وكيل. يقول Poolside إن نموذج Laguna التالي الأكبر حجمًا بدأ التدريب المسبق في الأسبوع الماضي.

بالنسبة لصانعي القرار الفني، يعد Laguna S 2.1 هو الخيار الغربي الأكثر مصداقية للوزن المفتوح الذي ظهر خلال ما يقرب من عام للتشفير الوكيل المستضاف ذاتيًا – مع أدلة منشورة، وترخيص متساهل، ودعم واسع النطاق للنظام البيئي، وقصة اقتصادية مبنية على الأجهزة التي يمكنك امتلاكها. ما إذا كان هذا سيؤثر على هيمنة النماذج الصينية المفتوحة أم لا، فسوف يعتمد على هذا الإصدار بدرجة أقل من الاعتماد على الإصدارات التي تتبعه.

كانط، من جانبه، أخبر العالم بالفعل كيف ينوي أن تنتهي هذه القصة. يبني Poolside نحو مستقبل يتمتع فيه الذكاء الأكثر قدرة "يمكن أن يملكها ويشكلها أي شخص،" كتب – وتخطط الشركة لمواصلة الشحن "حتى يوجد هذا المستقبل." في صناعة تقوم فيها أكبر المعامل بشكل متزايد بتأمين أفضل أعمالها خلف واجهة برمجة التطبيقات (API)، قد لا يكون الشيء الأكثر تطرفًا في Laguna S 2.1 هو ما يسجله، ولكن يمكن لأي شخص تنزيله والتحقق منه.

شاركها.
اترك تعليقاً