كيف يعلّم نظام ذكاء اصطناعي واحد الروبوتات البشرية تنسيق كل حركة من القدمين إلى أطراف الأصابع مع التفكير عبر مئات الخطوات والتعاون مع آلات أخرى؟
مصدر الصورة:
Gemini-robotics
معظم
الروبوتات اليوم مبرمجة مسبقًا لمهام ضيقة ومتكررة. تنفذ حركات محددة في تسلسل
ثابت ولا تستطيع التكيف عند حدوث شيء غير متوقع. حسّنت نماذج الذكاء الاصطناعي
السابقة للروبوتات التحكم بالجزء العلوي من الجسم لكنها تركت فجوة حرجة. استطاعت
الروبوتات تحريك أذرعها وقابضاتها، لكنها لم تستطع تنسيق تلك الحركات مع بقية
جسمها. المشي والانحناء والقرفصة ومعالجة شيء ما في الوقت نفسه بقي بعيد المنال.
أصدرت Google DeepMind، قسم أبحاث الذكاء الاصطناعي في Google،
نموذج Gemini Robotics 2 لسد تلك الفجوة. هو مجموعة من ثلاثة نماذج
ذكاء اصطناعي للروبوتات مصممة لمنح الروبوتات تحكمًا شاملًا بالجسم ومعالجة أدق
وقدرة على العمل معًا في مهام معقدة.
قدّم
النظام كارولينا بارادا وفريق الروبوتات في DeepMind. يتكون من ثلاثة نماذج: Gemini Robotics 2،
نموذج رؤية-لغة-فعل يعالج المدخلات البصرية والتعليمات ويحولها إلى أوامر حركية
لكامل الجسم؛ وGemini Robotics-ER 2، نموذج تفكير مجسّد مطوّر يصوغ خطط مهام
عالية المستوى ويتيح التواصل بلغة طبيعية بين البشر والروبوتات؛ وGemini Robotics On-Device 2،
النسخة الأكثر كفاءة، محسّنة للعمل محليًا على أجهزة الروبوت دون اتصال بالإنترنت.
الثلاثة جميعها متاحة في شكل وصول مبكر.
التقدم
المحدد في Gemini Robotics 2 هو الذكاء الشامل للجسم. ركزت النسخ السابقة
بشكل أساسي على مهام الجزء العلوي مثل التقاط الأشياء ووضعها. يمكّن Gemini Robotics 2
الروبوتات البشرية من تنسيق الحركات عبر جسمها بالكامل في وقت واحد. في عرض توضيحي
على روبوت Apollo 2 من Apptronik، تلقى الروبوت تعليمات منطوقة لوضع إبريق ري
في صندوق أخضر على رف سفلي. ثم مشى عبر الغرفة والتقط الشيء وانحنى ووضعه على الرف
الصحيح، كل ذلك بشكل مستقل دون أوامر خطوة بخطوة.
يستخدم
النظام مراقبة فيديو مستمرة لتتبع تقدمه. من خلال مشاهدة بث الكاميرا المباشر،
يكتشف الروبوت عندما يحدث خطأ أثناء المهمة ويكيّف نهجه ويحدد بالضبط متى ينتقل
إلى الخطوة التالية. وفقًا لـ Google DeepMind، يستطيع Gemini
Robotics 2
أتمتة مهام تتألف من مئات الخطوات المتتالية، وهو أبعد بكثير من تسلسلات المهام
القصيرة التي استطاعت النماذج السابقة التعامل معها.
قدرة
جديدة رئيسية هي التعاون بين روبوتات متعددة. يمكّن Gemini
Robotics 2 آلات
مستقلة متعددة من العمل معًا في مهمة مشتركة. بدلاً من العمل بشكل مستقل، يمكن
للروبوتات تقسيم المسؤوليات وتنسيق حركاتها وإنجاز عمل معقد كفريق. هذا مهم
للوجستيات المستودعات وخطوط التصنيع والبيئات التي لا يستطيع فيها روبوت واحد
التعامل مع سير عمل كامل بمفرده.
تحسنت
البراعة أيضًا. أظهرت الاختبارات أداءً أقوى مع القابضات ذات الإصبعين مقارنة
بالأيدي متعددة الأصابع، مما يشير إلى أن الذكاء الاصطناعي يستطيع استخلاص معالجة
أكثر دقة من أجهزة أبسط. تستطيع نسخة On-Device 2 التكيف مع تصاميم روبوتات ثنائية الذراع
جديدة كليًا بأقل من 200 مثال تدريبي، مما يجعلها عملية للنشر السريع على أجهزة لم
يُدرَّب عليها النموذج أصلًا. وقد بنت Apptronik منشأة مخصصة تُسمى Robot
Park حيث
تجمع روبوتات Apollo 2 البشرية بيانات واقعية تُستخدم لتدريب
وتحسين نماذج Gemini Robotics 2 باستمرار.
قدمت Google DeepMind
معيارًا جديدًا للسلامة إلى جانب Gemini Robotics 2 يُسمى ASIMOV-Agentic. يختبر هذا المعيار ما إذا كانت الروبوتات
تستطيع التعرف على الإجراءات غير الآمنة ورفض تنفيذها. كما يقيّم ما إذا كان
الروبوت يعرف متى يتوقف ويطلب مساعدة بشرية بدلاً من المضي في مهمة لا يستطيع
إكمالها بأمان. وفقًا لـ Google DeepMind، يمثل هذا تحولًا من الاعتماد فقط على أقفاص
السلامة المادية نحو دمج قرارات السلامة مباشرة في طبقة الذكاء الاصطناعي.
يجمع
نظام السلامة بين الضمانات الميكانيكية التقليدية والضوابط المدمجة في نماذج
الذكاء الاصطناعي نفسها. صرّحت Google DeepMind بأنها تعمل مع خبراء وصانعي سياسات ومجلس
المسؤولية والسلامة الخاص بها لضمان عمل Gemini Robotics 2 بأمان إلى جانب البشر في بيئات مشتركة.
النهج المزدوج، الحواجز الميكانيكية بالإضافة إلى حكم الذكاء الاصطناعي، يهدف إلى
جعل الروبوتات أكثر أمانًا في المساحات غير المنظمة مثل المنازل والمكاتب وبيئات
البيع بالتجزئة حيث لا تكون أقفاص السلامة التقليدية عملية.
يصل Gemini Robotics 2
خلال تسارع في الاستثمار والمنافسة في الذكاء الاصطناعي المجسّد. تبني شركات
متعددة أنظمة ذكاء اصطناعي متنافسة لتكون طبقة الذكاء للروبوتات البشرية
والصناعية. يعامل نهج Google DeepMind الروبوتات كسطح آخر لنفس نموذج Gemini
بدلاً من منتج متخصص منفصل. هذا يعني أن قدرات التفكير العامة التي يستخدمها Gemini
للنصوص والصور والأكواد تُمدّد مباشرة إلى التحكم المادي، بدلاً من بناء ذكاء
اصطناعي خاص بالروبوتات من الصفر.
لهذا
النهج تداعيات استراتيجية. إذا انتقل تفكير الذكاء الاصطناعي للأغراض العامة
بفعالية إلى تنسيق كامل الجسم للروبوتات، فقد يقلل من الميزة التي تحتفظ بها شركات
الروبوتات الناشئة المستقلة التي تعتمد قيمتها على امتلاك نموذج خاص بالروبوتات.
قائمة الشركاء الحالية، التي تشمل Apptronik وBoston Dynamics وAgile Robots وأكثر من 60 مختبرًا موثوقًا مثل Agility Robotics
وPAL Robotics
وUniversal Robots وRainbow Robotics، تشير إلى اهتمام صناعي كبير باختبار ما إذا
كان هذا النموذج يفي بقدراته خارج العروض التوضيحية المُتحكم فيها.
يرجى الاشتراك للحصول على وصول غير محدود إلى ابتكاراتنا.