خلال العام الماضي، كان السر الغريب وراء طفرة النماذج ذات الوزن المفتوح هو أن العديد من أقوى الإصدارات الصينية كانت محظورة على شريحة كبيرة من الشركات الأكثر اهتمامًا بها. شروط الترخيص التي استبعدت الاتحاد الأوروبي والمملكة المتحدة وكوريا الجنوبية تعني أن الفرق القانونية أوقفت عمليات النشر قبل أن تنتهي الفرق الهندسية من تقييماتها – ليس فقط للشركات التي يقع مقرها الرئيسي هناك، ولكن لأي مؤسسة تخدم حركة المرور إلى تلك المناطق. بالنسبة لفرق تكنولوجيا المعلومات التي تدرس النماذج المفتوحة، تكون المقايضات واضحة بشكل غير عادي.

لقد أزالت Tencent هذه العقبة للتو. أصدر فريق Hunyuan التابع للشركة النسخة الكاملة من Hy3، نموذج مزيج من الخبراء (MoE) مكون من 295 مليار معلمة مع 21 مليار معلمة نشطة، و- في انعكاس لإصدار المعاينة في أبريل – تم شحنه بموجب السماح أباتشي 2.0 رخصة. كان رد الفعل من مجتمع النموذج المفتوح فوريًا، حيث أشار الباحثون في X إلى تغيير الترخيص باعتباره العنوان الرئيسي الحقيقي، وزعم أحد المنشورات التي تم نشرها على نطاق واسع أنه إذا صمدت النتائج، فقد أصبحت Tencent للتو واحدة من رواد المصادر المفتوحة. تقول Tencent أنها ستكون مجانية على OpenRouter لمدة أسبوعين.

تستحق النتائج التدقيق فيها، وهي لا تشير جميعها إلى نفس الاتجاه. لكن القصة الأكثر إثارة للاهتمام هي ما اختارت شركة تينسنت أن تقوده: مقاييس الموثوقية واقتصاديات النشر التي تستهدف بشكل مباشر استخدام الإنتاج.

من المعاينة إلى المنتج في عشرة أسابيع، تم تشكيلها بواسطة 50 فريقًا داخليًا

كانت معاينة Hy3 لشهر أبريل هي النموذج الأول للبنية التحتية للتدريب المسبق والتعلم المعزز المعاد بناؤها من Tencent، والتي تم شحنها بعد أقل من ثلاثة أشهر من إعادة البناء في فبراير. قام شونيو ياو، كبير علماء الذكاء الاصطناعي، بتأطير الإصدار المفتوح المبكر كخطوة متعمدة لجمع التعليقات من المطورين والمستخدمين قبل الإصدار الرسمي – وتقول Tencent أن هذا هو بالضبط ما حدث. وفقًا لبطاقة النموذج، جمع الفريق تعليقات من أكثر من 50 فريقًا للمنتجات بعد المعاينة في أواخر أبريل، وقام بإصلاح المشكلات في تنفيذ المهام والتفاعل، وقام بتوسيع نطاق خط أنابيب ما بعد التدريب.

لم تتغير البنية: إجمالي 295 بايت من المعلمات، و21 بايت نشط لكل تمريرة أمامية عبر توجيه أعلى 8 عبر 192 خبيرًا، وطبقة تنبؤ متعددة الرموز (MTP) ذات 3.8 بايت لفك تشفير المضاربة، ونافذة سياق 256 كيلو بايت. ما تغير هو السلوك. يتمثل موقف Tencent في أن الإصدار الكامل يتفوق بشكل كبير على النماذج ذات الحجم المماثل وينافس النماذج مفتوحة المصدر الرئيسية مع ضعفين إلى خمسة أضعاف المعلمات.

الذي – التي "مرتين إلى خمس مرات" يعتبر التأطير منطقيًا فيما يتعلق بالهدف الذي يستهدفه هذا النموذج، ويدعو إلى إجراء مقارنة مباشرة مع الرائد الحالي في مجال الترميز ذو الوزن المفتوح، GLM-5.2.

يفضل اختبار Tencent الأعمى Hy3 على GLM-5.1، لكن GLM-5.2 لا يزال يمتلك الترميز

التقييم الرئيسي لـ Tencent هو دراسة بشرية عمياء وليس لوحة متصدرين. بحجة أن المعايير العامة لا تحكي القصة كاملة، أجرت الشركة اختبارًا أعمى مع 270 خبيرًا عبر التخصصات التي تعمل على سير العمل في العالم الحقيقي، وجمعت 312 مقارنة صحيحة، حيث أفادت Tencent أن Hy3 سجلت 2.67 من 4 مقابل 2.51 لـ GLM-5.1 – مع أوضح المزايا في تطوير الواجهة الأمامية، وCI/CD، وأعمال البيانات والتخزين.

اختيار الخصم مهم. صدر Zhipu AI جي إل إم-5.2 في منتصف يونيو، يُظهر الملحق المعياري الخاص بشركة Tencent أن GLM-5.2 يتقدم على Hy3 عبر مجموعة الترميز الوكيل بأكملها: SWE-bench Verified (84.2 مقابل 78.0)، وSWE-bench Multilingual (83.0 مقابل 75.8)، وTerminal-Bench 2.1 (81 مقابل 71.7)، وDeepSWE بهامش واسع (46.2 مقابل 75.8). 28.0). استهدف الاختبار الأعمى النموذج الأقدم. الأحدث يحتفظ بتاج التطوير.

تعد مقدمة ترميز GLM-5.2 أقل إثارة للدهشة عندما تفكر في أن الأحجام جنبًا إلى جنب: GLM-5.2 عبارة عن MoE تحتوي على 744 مليار معلمة تقريبًا مع حوالي 40 مليار معلمة نشطة لكل رمز مميز، مقابل إجمالي 295 مليار معلمة Hy3 و21 مليار نشطة. تقوم Tencent بإرسال نموذج يحتوي على أقل من نصف المعلمات – وما يقرب من نصف حساب كل رمز مميز – للنموذج الذي يتبعه.

انتصارات Hy3 الحقيقية تكمن في مكان آخر. في البحث الوكيل، سجلت 84.2 على BrowseComp و91.0 على DeepSearchQA – متفوقة على كل نموذج مفتوح في جدول Tencent ومنافسة لـ Claude Opus 4.8 وGPT-5.5. وهو يقود المجال المفتوح في تنسيق الأدوات (79.1 في مجموعة MCP-Atlas العامة)، وفي تقييمات تسخير الوكلاء مثل ClawEval، وفي استرجاع السياق الطويل (73.4 في AA-LCR). بالقراءة معًا، يقترح الملحق نموذجًا يمكن القول إنه أفضل خيار مفتوح الوزن لأعباء عمل الوكلاء الثقيلة للبحث والأدوات، مع التنازل عن الترميز على نطاق المستودع إلى GLM-5.2.

هناك تحذير واحد ينطبق على كل من المكاسب والخسائر: جميع أرقام المنافسين تقريبًا في ملحق Tencent تم تمييزها على أنها قادمة من الاختبارات التجريبية الخاصة بـ Tencent. لا يزال التحقق المستقل، من مؤشرات مثل التحليل الاصطناعي، معلقًا حتى وقت النشر.

درجة الموثوقية: انخفضت معدلات الهلوسة إلى النصف

أكثر ما يثير اهتمام المشترين من المؤسسات هو مجموعة الأرقام التي اختارت Tencent التأكيد عليها بدلاً من المعايير. تبدو بطاقة النموذج أقل شبهاً بإعلان لوحة المتصدرين وأكثر شبهاً بتقرير موثوقية الإنتاج.

في التقييمات الداخلية لسيناريوهات العالم الحقيقي، تقول Tencent أن معدل الهلوسة في Hy3 انخفض مقارنة بإصدار المعاينة من 12.5% ​​إلى 5.4%، وانخفضت معدلات الخطأ المنطقي من 25.4% إلى 12.7% – وهي تحسينات تنسبها إلى تنظيف البيانات الدقيقة وقيود التدريب المبنية على نمط سلوك واضح: الإجابة عند التأريض، والذكر عندما تكون الأدلة مفقودة، ولا تخلط بين المصادر، ولا تقوم بتلفيق البيانات. ويحظى السلوك متعدد المنعطفات بنفس المعاملة: فقد انخفض معدل المشكلة في الاختبارات الداخلية متعددة المنعطفات من 17.4% إلى 7.9%، وأفادت شركة Tencent أن نتيجة النموذج في معيار الحوار الطويل المفتوح MRCR قفزت من 42.9% إلى 75.1%.

تؤكد Tencent أيضًا على الاتساق عبر سقالات الوكلاء – حيث يتم الإبلاغ عن تباين منصة SWE في بضع نقاط سواء كان النموذج يعمل داخل أحزمة نمط Claude Code، أو Cline أو KiloCode. هذه خاصية تم الاستخفاف بها: نادرًا ما تتحكم المؤسسات في إطار عمل الوكيل الذي تعمل فرقها على توحيد معاييره، والنموذج الذي يعمل فقط في أداة واحدة يمثل تكلفة تكامل مخفية. هذه قياسات داخلية يتم الإبلاغ عنها ذاتيًا، وتستحق نفس الشك الذي يحظى به أي معيار مرجعي للبائع. لكن خيار وضعهم في المقدمة يشير على الإطلاق إلى هوية تينسنت التي تعتقد أن عميلها هو: الفرق التي أحرقتها النماذج التي تقدم عروضاً جيدة وتصنع بثقة في الإنتاج.

رياضيات النشر: نموذج 295B في عالم 744B – على السيليكون المتوافق مع التصدير

ترتبط قصة الموثوقية مباشرة بالاقتصاد، وهذا هو المكان الذي تبدأ فيه فجوة ترميز Hy3 مقابل GLM-5.2 في الظهور وكأنها تجارة متعمدة وليست خسارة.

GLM-5.2 عبارة عن وزارة البيئة التي تحتوي على 744 مليار معلمة تقريبًا مع حوالي 40 مليار معلمة نشطة لكل رمز مميز؛ في FP8، تستهلك أوزانها وحدها ما يقرب من 744 جيجابايت، مما يجعل عقدة 8x H200 هي الحد الأدنى العملي لخدمة الإنتاج. يحمل Hy3، بإجمالي 295B من المعلمات، بصمة FP8 أقل من 300 جيجابايت – أقل من نصف الذاكرة، مع ما يقرب من نصف المعلمات النشطة لكل رمز مميز يؤدي إلى انخفاض الحوسبة لكل طلب. بالنسبة لمؤسسة تقرر ما ستستضيفه ذاتيًا، فهذا هو الفرق بين عقدة واحدة شديدة التحديد وعقدة أكثر قابلية للتحقيق، مع وجود مساحة متبقية لذاكرة التخزين المؤقت KV والتجميع.

هناك تجاعيد جيوسياسية في دليل النشر تستحق الملاحظة أيضًا: تكوينات الخدمة الموصى بها من Tencent تستهدف Nvidia H20-3e – الإصدار المعزز بالذاكرة من H20، وحدة معالجة الرسومات Nvidia المصممة خصيصًا للامتثال لقيود التصدير الأمريكية إلى الصين. على عكس GLM-5.2، لا يوجد ذكر لرقائق Huawei أو Ascend هنا. بمعنى آخر، تم تصميم النموذج بحيث يمكن لثمانية من الرقائق التي يمكن للشركات الصينية شراؤها بشكل قانوني أن تخدمه بدقة كاملة. هذا التصميم المقيد له تأثير جانبي مناسب لأي شخص آخر: النموذج الذي يعمل بشكل جيد على السيليكون المغطى بشكل متعمد يعمل بشكل أكثر راحة على H100s وH200s وB200s المتوفرة في مراكز البيانات الغربية، من خلال عمليات النشر القياسية vLLM وSGLang مع فك التشفير التأملي MTP.

أضف ترخيص Apache 2.0 — بدون استثناءات إقليمية، أو قيود على مجال الاستخدام — وستصبح معادلة المؤسسة واضحة. يظل GLM-5.2 خيار الوزن المفتوح عندما يكون أداء الترميز هو المعيار الوحيد وتتوفر ميزانية 8x H200. تطرح Hy3 قضيتها في كل مكان آخر: أعباء عمل البحث والوكلاء الثقيلة، والتطبيقات الحساسة للموثوقية، والمؤسسات التي تريد إمكانات متجاورة بدون بنية تحتية على مستوى الحدود. والسؤال المفتوح هو ما إذا كانت الشركات الغربية، بعد أن زال حاجز الترخيص، ستتعامل مع نموذج تينسنت باعتباره مرشحا جديا على الإطلاق ــ أو ما إذا كان تحديث التحليل الاصطناعي التالي يحسم المناقشة المعيارية قبل أن تتاح الفرصة للشراء.

شاركها.
اترك تعليقاً