تعد ذاكرة GPU أغلى مورد في إنتاج الذكاء الاصطناعي، وهي أيضًا المورد الأسرع نفادًا.
تجبر نوافذ السياق الطويلة والمحادثات متعددة المنعطفات نماذج الذكاء الاصطناعي على إعادة حساب المعلومات التي عالجتها بالفعل بشكل متكرر، مما يستهلك ذاكرة وحدة معالجة الرسومات والحوسبة التي يمكن أن تخدم مستخدمين إضافيين أو تولد استجابات جديدة.
بدلاً من التعامل مع ذاكرة وحدة معالجة الرسومات باعتبارها المورد المحدود، لماذا لا نقوم بتوسيعها باستخدام تقنيات تخزين أرخص بكثير؟
ويعتقد Weka، على سبيل المثال، أن وحدات تخزين الفلاش الرخيصة يمكن أن تسد هذه الفجوة. تعمل منصة برمجيات NeuralMesh 6 الخاصة بالشركة، والتي يتم إطلاقها جنبًا إلى جنب مع أول خط أجهزة مصمم ذاتيًا، Wekapod 3، على توسيع ما تسميه Weka شبكة الذاكرة المعززة، وهو نهج يجمع فلاش NAND ليتصرف مثل ذاكرة GPU بجزء بسيط من التكلفة.
هذه فئة نشطة ومزدحمة بشكل متزايد. قامت كل من Dell وNetApp وPure Storage وVAST بإعادة توجيه جميعها نحو البنية التحتية للذكاء الاصطناعي على مدار العامين الماضيين، وتعد Weka واحدة من العديد من البائعين الذين يجادلون بأنها مصممة لهذه اللحظة المحددة بدلاً من التكيف معها.
"ما نراه الآن مع العملاء هو أنهم يسعون وراء توفر الحوسبة، وبمجرد حصولهم على تخصيص جديد من أي شخص، يريدون أن يكونوا قادرين على الحصول عليه والبدء في التشغيل على الفور،" صرح ليران زفيبل، المؤسس المشارك والرئيس التنفيذي لشركة Weka، لـ VentureBeat.
إن المردود المحتمل واضح ومباشر: الاستخدام الأفضل لاستثمارات وحدة معالجة الرسومات الحالية، وانخفاض تكاليف الاستدلال والنشر الأسرع لأحمال عمل الذكاء الاصطناعي الجديدة دون الانتظار لأشهر للحصول على سعة إضافية لوحدة معالجة الرسومات.
تعتبر هذه التكنولوجيا أكثر ملاءمة للمؤسسات التي تعمل بالفعل على الذكاء الاصطناعي على نطاق واسع أو تتوقع نموًا سريعًا في الاستخدام، ولا سيما المؤسسات التي تقوم ببناء مساعدين داخليين أو وكلاء خدمة العملاء أو مساعدي هندسة البرمجيات أو أنظمة استرجاع ذات نوافذ سياقية طويلة. قد تشهد عمليات النشر الأصغر فائدة فورية أقل من المؤسسات التي أصبح فيها استخدام وحدة معالجة الرسومات عاملاً مقيدًا بالفعل.
داخل NeuralMesh 6 من Weka
يضيف NeuralMesh 6 أربع إمكانات تهدف مباشرة إلى سد الفجوة الوظيفية التي يقول Zvibel إنها تكلف صفقات Weka في التقييمات التنافسية.
إيجارات متعددة مركبة وافتراضية. تمنح المجموعات القابلة للتركيب المستأجرين الأساسيين عزلًا كاملاً على مستوى الأجهزة ووحدة المعالجة المركزية (CPU) المخصصة والذاكرة والتخزين. يتم تشغيل الإيجار المتعدد الافتراضي من خلال نسيج RDMA الخاص بـ Weka، مما يوفر عزلًا على مستوى الشبكة يتجاوز 1000 مستأجر لكل مجموعة، مع التزويد في أقل من 30 دقيقة. مجتمعة، يمكن لمجموعة واحدة تدير 50 مجموعة قابلة للتركيب أن تدعم ما يصل إلى 50000 مستأجر.
تخزين موحد للملفات والكائنات. تحتفظ معظم أنظمة التخزين بمسارين منفصلين: مسار قائم على الملف (الطريقة القياسية التي تقرأ بها الخوادم والتطبيقات الملفات وتكتبها، وتستخدم بكثرة في التدريب وضبط خطوط الأنابيب) ومسار قائم على الكائن (S3، وهو استنتاج التنسيق والأدوات السحابية الأصلية التي تتوقعها عادةً). عادةً ما تترجم البوابة بين الاثنين، مما يعني أن البيانات موجودة بشكل فعال مرتين. ادعاء Weka هو أن نفس البيانات الفعلية الموجودة على القرص يمكن قراءتها مباشرة من خلال أي من المسارين في وقت واحد، ولا توجد طبقة ترجمة، ولا نسخة ثانية. يستهدف Zvibel سحابات GPU غير التابعة لـ AWS على وجه التحديد، مع تسمية Lambda وNebius وG42 وCoreWeave، مع ما وصفه بأنه أداء أعلى بمرتين تقريبًا من S3 التقليدي ونموذج تسعير قائم على السعة بدلاً من رسوم واجهة برمجة التطبيقات.
البيانات الوصفية – النسخ المتماثل الأول. تصبح البيئات الوجهة قابلة للتصفح قبل وصول نسخة كاملة من البيانات، مع ترطيب البيانات فقط عند الوصول إليها.
"كان عليهم الانتظار حتى يصلوا إلى الجانب الآخر، وهذا يستغرق أيامًا أو أسابيع، وفي الحالات القصوى شهرًا." قال زفيبل. "نحن نسمح الآن لعملائنا بالحصول على بعض التخصيصات من وحدات معالجة الرسومات الجديدة والبدء في العمل في غضون ساعة."
AlloyFlash وتقليل البيانات دائمًا. TLC وQLC نوعان من ذاكرة فلاش NAND. يعتبر TLC أسرع وأكثر متانة ولكنه يكلف أكثر لكل تيرابايت، في حين أن QLC أرخص ويحمل المزيد من البيانات لكل شريحة ولكنه أبطأ. تدمج AlloyFlash كليهما ضمن مجموعة واحدة، حيث تقوم تلقائيًا بتوجيه العمل الحساس لزمن الاستجابة إلى TLC أثناء تشغيل أحمال العمل ذات السعة الكبيرة على QLC، مما يقلل التكلفة لكل تيرابايت دون فرض عقوبات على الأداء على العمل الذي يحتاج إلى السرعة. يتم الآن تشغيل تقليل البيانات بشكل افتراضي وليس كخيار.
حل مشكلة سياق الذكاء الاصطناعي
يحل تخزين العناصر والإيجار المتعدد كيفية تشغيل المؤسسات والسحابات الجديدة للمنصة يومًا بعد يوم. تكمن مشكلة أصعب في الأسفل: مع نمو نوافذ السياق والتفاعلات متعددة المنعطفات، تحسب وحدة معالجة الرسومات أيضًا العمل الضائع في إعادة الحساب الذي قام به النموذج بالفعل. شبكة الذاكرة المعززة، إحدى ميزات NeuralMesh 6 المصممة خصيصًا لهذا الغرض، هي إجابة Weka.
تؤدي كل مطالبة إلى مرحلتين. تحسب عملية التعبئة المسبقة الانتباه، وهي الآلية الأساسية وراء كيفية معالجة النماذج اللغوية الكبيرة للمدخلات، وهي مكلفة من الناحية الحسابية. يقوم Decode بتحويل هذا الحساب إلى مخرجات وهو خفيف الوزن نسبيًا.
تظهر التكلفة بشكل أكبر في الجلسات متعددة المنعطفات مثل الدردشة أو البرمجة، حيث يقوم كل دور جديد بإعادة التشغيل المسبق لكل ما سبقه، ما لم يتم تخزين هذا العمل مؤقتًا.
"إذا كان لديك 10 أدوار، فقد تبالغ في الحساب 100 مرة لأنك تعيدها كلها. إذا كان لديك 20، فسوف تبالغ في الحساب 400 مرة،" قال زفيبل. "يمكنك وضع أمرين من حجم NAND أكبر مما تستطيع تحمله في الذاكرة المشتركة، ويمكننا تخزين 100% من الرموز المميزة المحسوبة مسبقًا، لذلك لن تحتاج أبدًا إلى إعادتها."
حيث يجلس Weka بشكل تنافسي
لقد أمضى بائعو وحدات التخزين العام ونصف العام الماضيين في إعادة التموضع حول الذكاء الاصطناعي، وأصبح فصل القدرة الحقيقية عن المراسلة المعاد وضعها الآن مشكلة تقييم حقيقية للمشترين.
"يحول عالم التخزين تركيزه من تقديم البتات إلى أعباء العمل المؤسسية إلى إدارة البيانات بسرعة الذكاء الاصطناعي. لقد رأينا ذلك بوضوح أكبر خلال الـ 18 شهرًا الماضية من Dell وNetApp وPure،" صرح ستيف ماكدويل، كبير المحللين في NAND Research، لـ VentureBeat. "والشيء المثير للاهتمام هو أن شركات مثل Weka وVAST، هي شركات البيانات الأصلية المعتمدة على الذكاء الاصطناعي، حيث تعمل على حل هذه المشكلات منذ اليوم الأول."
خص ماكدويل شبكة الذاكرة المعززة بأنها أوضح تقدم تقني لشركة Weka.
"تواصل شركة Weka تطبيق ذاكرة التخزين المؤقت KV الأكثر قدرة من الناحية الفنية في السوق من خلال شبكة الذاكرة المعززة الخاصة بها،" قال. " لقد كانوا مبكرين مع هذه التكنولوجيا، ويستمرون في الابتكار. يعد هذا أمرًا بالغ الأهمية لاستدلال الذكاء الاصطناعي، لأنه يتيح مستوى من كفاءة وحدة معالجة الرسومات، مما يوفر بلا شك الأموال على وحدات معالجة الرسومات والذاكرة. هذا هو المفتاح للسوق المقيدة للذاكرة ووحدة معالجة الرسومات اليوم."
كما أشار أيضًا إلى الضمان التعاقدي الذي قدمته Weka بشأن مطالباتها المتعلقة بتخفيض البيانات على أنه لا يحظى بالتقدير الكافي.
"واحدة تحلق قليلاً تحت الرادار: تضع Weka أموالها في مكانها الصحيح من خلال ضماناتها التعاقدية لوعودها بتخفيض البيانات،" قال.
كانت نصيحة ماكدويل للمشترين الذين يقومون بتقييم المطالبات المتنافسة من Weka وVAST وPure وNetApp على حد سواء، تشير إلى أن المشترين من المؤسسات يجب أن ينظروا بجدية إلى ما يعد به البائعون مقابل ما يقدمونه بالفعل.
"سوف ينظر المشتري الذكي في كيفية حل البائعين المتنافسين لمشاكل العالم الحقيقي اليوم،" قال ماكدويل. " يفعلون ذلك من خلال التحدث إلى المنظمات التي تدير أعباء عمل مماثلة على نطاق مماثل. إذا لم يتمكن البائع من الإشارة إلى ذلك، فيجب أن تكون علامة تحذير."
