بعد أسبوعين من إطلاق نموذج الذكاء الاصطناعي الصوتي GPT-Live الأكثر طبيعية مع إمكانات الإرسال المزدوج الكامل (الاستماع والتحدث في نفس الوقت)، تعمل OpenAI على إدخاله مباشرةً في سير عمل المطورين.
أعلنت الشركة أن GPT-Live يقوم الآن بتشغيل تطبيق ChatGPT لسطح المكتب على نظامي التشغيل macOS وWindows، ويتكامل مباشرة مع الأنظمة الوكيلة مثل Codex وChatGPT Work (وهي تجارب منفصلة متوفرة في تطبيق ChatGPT لسطح المكتب).
عندما أطلقت OpenAI مبدئيًا GPT-Live في 8 يوليو 2026، قدمت نموذجًا صوتيًا مستمرًا قادرًا على الاستماع والتحدث في وقت واحد، مما أدى إلى التخلص من تبادل الأدوار الصارم مع تفويض التفكير المعقد إلى نماذج الخلفية مثل GPT-5.5.
يعمل إصدار اليوم على توسيع طبقة المحادثة هذه لتشمل المهام الفنية، مما يمكّن مهندسي البرمجيات من تنسيق مهام البرمجة متعددة الخيوط، ومراجعة طلبات السحب، وتصحيح أخطاء التطبيقات باستخدام الأوامر الصوتية الطبيعية.
وعلى هذا النحو، يمكن أن يكون إيذانا ببدء حقبة جديدة من "حر اليدين" تطوير البرمجيات وحتى حفلات الترميز الجماعية المباشرة والشخصية لأكثر من 5 ملايين مستخدم نشط أسبوعيًا في Codex. Codex، بالطبع، هو الاسم الذي يطلق على نماذج OpenAI وأدواتها التي تركز على البرمجة، ولكن الشركة قامت بتوسيعها هذا العام إلى منصة إنتاجية أكثر عمومية. صرح متحدث باسم OpenAI لموقع VentureBeat أن هذه هي المرة الأولى التي يتم فيها تضمين التنشيط الصوتي محليًا مع Codex على سطح المكتب.
نشرت OpenAI مقطع فيديو ترويجيًا يظهر بعض موظفيها، مهندس تجربة مطور Codex Jason Liu والموظف الفني في Codex Guinness Chen، يتحدثون إلى نفس جلسة تطبيق ChatGPT لسطح المكتب في نفس الغرفة، ويصدر كل منهم تعليمات مختلفة ويتحدثون مع نفس النموذج.
تم فتح قدرات جديدة
يعتمد هذا التكامل في جوهره على فصل طبقة الصوت في الوقت الفعلي عن محركات التنفيذ الأساسية.
بينما تحافظ GPT-Live على محادثة سلسة، حيث تقوم بإدخال اعترافات لفظية طبيعية مثل "فهمتها" دون مقاطعة المستخدم، حيث يقوم بتمرير أعباء العمل الحسابية الثقيلة إلى نماذج الاستدلال في الخلفية.
في نظام التشغيل macOS، يتضمن تطبيق سطح المكتب "لقطات التطبيق" وميزات سياق الشاشة، مما يسمح لـ ChatGPT Voice بتحليل النافذة الأمامية إلى جانب الملفات المحلية وهياكل قاعدة التعليمات البرمجية والمكونات الإضافية النشطة.
تنشئ هذه البنية ديناميكية برمجة زوجية حيث يتحدث المطورون عن المشكلات بشكل تحادثي بينما يقوم الوكلاء بتنفيذ المهام بشكل غير متزامن.
بدلاً من إيقاف جلسات البرمجة يدويًا لكتابة تعليمات مفصلة أو تبديل النوافذ، يقوم المطورون بتوجيه النظام دون استخدام اليدين.
يقرر محرك الإرسال المزدوج الكامل ديناميكيًا وقت التحدث أو الإيقاف المؤقت أو استدعاء الأدوات، مع الحفاظ على حالة المحادثة حتى عندما يقوم وكلاء الخلفية بمعالجة تعديلات التعليمات البرمجية المعقدة.
توجيه البرمجة والإنشاءات المعقدة بصوتك وحده
تركز القدرة التشغيلية المركزية في هذا التحديث على تنفيذ المهام المتعددة عبر بيئات عمل Codex وChatGPT.
يمكن لمهندسي البرمجيات بدء عدة سلاسل مهام متزامنة من خلال مطالبة منطوقة واحدة. على سبيل المثال، يمكن للمطور الذي يستعد لشحن إحدى الميزات توجيه النظام للتحقيق في خطأ مصادقة مفتوح، ومراجعة طلب سحب ترحيل واجهة برمجة التطبيقات المعلق، وإنشاء اختبارات الوحدة المفقودة في وقت واحد.
يقوم تطبيق سطح المكتب بتنسيق هذه الإجراءات عبر سياقات متباينة، وتتبع المشكلات من خلال محادثات Slack، ومستودعات GitHub، وقواعد التعليمات البرمجية المحلية.
يمكن للمطورين أيضًا تحويل نماذج التصميم بالحجم الطبيعي شفهيًا إلى كود عمل، وتقسيم المهام عبر طبقات الواجهة الأمامية والخلفية وطبقات الاختبار.
من خلال دعم المشروعات متعددة المجلدات (الإصدار 26.715) والتنفيذ عن بُعد عبر نظام التشغيل iOS، يمكن للمهندسين التحقق من تقدم المهام والإجابة على مطالبات الوكيل وإعادة توجيه المهام النشطة دون تبديل التطبيقات أو إدارة العمليات الفردية سطرًا تلو الآخر.
ترخيص الملكية
يعمل إصدار سطح المكتب الذي يدعم الصوت من OpenAI بموجب نموذج مؤسسة تجارية خاصة. يقتصر الوصول على المشتركين المدفوعين عبر خطط Plus وPro وBusiness وEnterprise وEducation.
بالنسبة للمطورين الأفراد وأقسام الهندسة في الشركات، يعني هذا الهيكل التجاري أن أوزان النماذج وخطوط معالجة الصوت وبنيات حالة الوكيل تظل مغلقة بالكامل.
لا يمكن للمؤسسات تعديل الأنظمة الأساسية أو استضافتها ذاتيًا. علاوة على ذلك، تستهلك المهام التي يتم بدؤها عبر ChatGPT Voice تخصيصات الاستخدام القياسية مباشرةً من حصص خطة عمل Codex وChatGPT الحالية، وتتعامل مع الإجراءات التي يتم تشغيلها بالصوت بشكل مماثل لأحمال عمل الوكيل القياسية.
ردود أفعال المجتمع
لاحظت مجتمعات المطورين على الفور الآثار المترتبة على جلب الصوت المزدوج الكامل المستمر إلى سير عمل الترميز المستقل.
ردًا على إعلان إصدار الإصدار 26.715 – الذي يوضح تفاصيل التكامل الصوتي ودعم المشروع متعدد المجلدات – أشار الصحفي في AI Insider @ChrisGPT إلى X: "ستصدر OpenAI اليوم توجيهًا صوتيًا وعن بعد للمخطوطة! خطوة واحدة أقرب إلى الذكاء الاصطناعي العام الشخصي".
تسلط التعليقات الفنية المبكرة الضوء على الحماس واسع النطاق لتنسيق مهام الوكيل المعقدة بدون استخدام اليدين، خاصة عند الابتعاد عن محطة العمل أو إدارة مسارات البناء عن بُعد.
