آخر تحديث: يونيو 12، 2026
الذكاء الاصطناعي المجسد في الروبوتات الصناعية: كيف تُغير نماذج الرؤية واللغة والحركة برمجة الروبوتات
يشير الذكاء الاصطناعي المُجسّد إلى ذكاء الآلة الذي يُدرك بيئته من خلال أجهزة الاستشعار، ويُحلل ما يراه، ويُولد حركات مادية، كل ذلك ضمن نموذج موحد. في مجال الروبوتات الصناعية، يُعد هذا الأمر بالغ الأهمية، إذ يُمكن لنموذج الرؤية واللغة والحركة (VLA) تفسير التعليمات اللفظية، وتحديد الأجزاء غير المألوفة، وتنفيذ سلسلة من العمليات دون الحاجة إلى برمجة تفصيلية. وبحلول عام 2026، انتقلت العديد من منصات البحث من مرحلة التجارب المخبرية إلى التجارب الصناعية الأولية، مما أعاد تشكيل نظرة المهندسين إلى الأتمتة المرنة. للاطلاع على توجهات EVST على مستوى المنتج في مجالات الروبوتات الشبيهة بالبشر، والأيدي الماهرة، والروبوتات رباعية الأرجل، وجمع بيانات الذكاء الاصطناعي المُجسّد، يُرجى مراجعة حلول الذكاء الاصطناعي المجسد من EVST.
آخر تحديث: يونيو 12، 2026
-
تطور برمجة الروبوتات: من وحدة التحكم اليدوية إلى النماذج الأساسية
لقد مرّت برمجة الروبوتات في المصانع بأربعة أجيال يمكن تمييزها، حيث يستبدل كل جيل قيداً مختلفاً بقدرة مختلفة.
كان الجيل الأول يعمل بنظام وحدة التحكم اليدوية. يقوم مهندس بتحريك الروبوت محورًا تلو الآخر إلى كل نقطة مسار، ويسجل المواقع، ثم يجمعها في برنامج حركة مخزن على وحدة التحكم. كان تعديل المسار بعد تغيير خط الإنتاج يتطلب إعادة تعليم كل نقطة مسار يدويًا. بالنسبة للإنتاج بكميات كبيرة وبأشكال هندسية ثابتة (مثل لحام هياكل السيارات)، كان هذا الأسلوب فعالًا. أما بالنسبة لأي منتج يتطلب تغييرات متكررة، فقد كان مكلفًا.
ظهرت أدوات البرمجة غير المتصلة بالإنترنت (OLP) مثل RoboDK وKUKA.Sim وABB RobotStudio في التسعينيات، مما أتاح للمهندسين تحديد مسارات الروبوت في بيئة تصميم ثلاثي الأبعاد (CAD) ومعالجة الكود لاحقًا لأنواع مختلفة من وحدات التحكم. انخفض وقت الإعداد من أيام إلى ساعات، وأصبح تحسين المسار ممكنًا قبل بدء الدورة الفعلية الأولى. لا تزال الفجوة بين النموذج المُحاكى والتركيب الفعلي (خطأ المعايرة، انحناء الكابل، تفاوتات التثبيت) تشكل مشكلة مستمرة، لكن البرمجة غير المتصلة بالإنترنت لا تزال النهج القياسي لمعظم خلايا الإنتاج اليوم.
ظهرت مكتبات المهارات كموجة ثالثة. قام الموردون والمكاملون بتجميع نماذج حركة أولية قابلة لإعادة الاستخدام، مثل مهارة التقاط العناصر من الصناديق، ومهارة إدخال الأوتاد في الثقوب، ومهارة لحام التماس، والتي يمكن تهيئتها باستخدام معلمات بدلاً من إعادة برمجتها من الصفر. على سبيل المثال، تحولت عملية التقاط العناصر من الصناديق الموجهة بالرؤية من مشروع مخصص استغرق شهورًا إلى وحدة قابلة للتكوين. مع ذلك، كان لا بد من تصميم كل مهارة بشكل صريح، ولم تكن المهارات قابلة للتعميم: فمهارة التقاط العناصر المدربة على شكل هندسي معين ستفشل على شكل جزء مختلف تمامًا.
تمثل نماذج التعلم الآلي المرئي الموجة الرابعة. فبدلاً من ترميز السلوك كنقاط مسار صريحة أو عناصر أولية مُعَلمة، تتعلم هذه النماذج من مجموعات بيانات ضخمة لعروض الروبوتات وبيانات مرئية عامة كيفية ربط أزواج (صورة، تعليمات لغوية) مباشرةً بمخرجات (فعل الروبوت). ويُعمم النموذج على الكائنات وظروف الإضاءة وصياغة التعليمات بطرق لا تستطيع مكتبات المهارات القيام بها، لأن التعميم مُدمج في الأوزان بدلاً من برمجته يدويًا.
| الابعاد | تعليم قلادة | البرمجة دون اتصال بالإنترنت | مكتبات المهارات | نماذج VLA |
|---|---|---|---|---|
| وقت الإعداد (منتج جديد) | أيام-أسابيع | ساعات-أيام | عدد الساعات (لكل مهارة) | دقائق - ساعات (في حال التدريب المسبق) |
| المرونة في التعامل مع الأشياء الجديدة | مستوى منخفض (يتطلب إعادة تدريس) | منخفض-متوسط | متوسط (يجب أن تتناسب المهارة) | عالي (يعمم على جميع الكائنات) |
| متطلبات البيانات | لا شيء (يدوي) | نماذج كاد | عرض المهام | مجموعات بيانات تجريبية كبيرة |
| الحتمية | مرتفع | مرتفع | متوسطة-عالية | منخفض إلى متوسط (أخذ عينات عشوائية) |
| التصحيح | نقاط مسار عالية (صريحة) | مرتفع | متوسط | منخفض (التمثيلات الكامنة) |
| النضج الصناعي (2026) | ناضجة تماما | ناضجة تماما | ناضج | تجارب أولية؛ لم يتم التحقق من صحتها على نطاق واسع |
تُعدّ فجوة الحتمية ذات أهمية بالغة في البيئات الصناعية. فالبرنامج المُعلّم مسبقًا يُنفّذ المسار نفسه تمامًا في كل دورة، بينما يقوم نموذج VLA بأخذ عينات من توزيع الإجراءات في كل خطوة استدلال. بالنسبة للمهام التي يكون فيها التباين بين الدورات مقبولًا (مثل اختيار عناصر مُرتبة عشوائيًا)، يُمكن التعامل مع هذا الأمر. أما بالنسبة للمهام التي تتطلب تكرارًا دون المليمتر على مدى آلاف الدورات، فإنّ الطرق التقليدية تحتفظ بميزة هيكلية يسعى مطورو VLA جاهدين لسدّها.
-
ما هي نماذج VLA: الهندسة المعمارية بعبارات بسيطة
نموذج الرؤية واللغة والحركة هو شبكة عصبية تأخذ الملاحظات البصرية وتعليمات اللغة الطبيعية كمدخلات وتنتج تصرفات الروبوت كمخرجات، وهو نموذج واحد متكامل بدلاً من سلسلة من وحدات الرؤية والتخطيط والتحكم المنفصلة.
المكونات المعمارية الثلاثة هي:
جهاز تشفير الرؤية. يقوم مُحوِّل الرؤية المُدرَّب مُسبقًا (ViT)، أو ما يُعرف بالبنية الأساسية الالتفافية، بمعالجة صور الكاميرا وتشفيرها إلى تمثيلات ميزات كثيفة. في معظم تصميمات VLA الحالية، يتم تهيئة هذا المُشفِّر من نموذج رؤية-لغة (VLM) كبير، ثم يتم ضبطه بدقة على بيانات الروبوت. يُعد استخدام بنية أساسية مُدرَّبة مُسبقًا أمرًا بالغ الأهمية لأنه يُزوِّد النموذج بمعلومات بصرية عامة، مما يُتيح له فهم ماهية الصندوق، وشكل المقبض، قبل أن يشاهد أي عرض توضيحي للروبوت.
مُشفِّر اللغة. يقوم مُحوِّل النصوص بتشفير التعليمات ("اختر المكعب الأحمر وضعه في الصندوق على اليسار") إلى سلسلة من الرموز، ثم يتم ربطها بالخصائص البصرية. ويعني الربط هنا أن النموذج يستطيع تحديد أجزاء الصورة الأكثر صلةً بما تطلبه التعليمات، دون معالجة الرؤية واللغة بشكل منفصل.
رأس الحركة. يتم فك تشفير التمثيل المدمج إلى حركات الروبوت. يمكن تمثيل الحركات على شكل تغيرات في طرف الذراع (تحريك الذراع 2 سم إلى اليمين، إغلاق الذراع)، أو زوايا المفاصل، أو أجزاء الحركة المُجزأة. إن تجزئة الحركات، أي اعتبار كل خانة حركة منفصلة بمثابة رمز لغوي، هو ما سمح لأعمال VLA المبكرة بتحسين بنى LLM الحالية للروبوتات دون الحاجة إلى بناء وحدة فك تشفير حركة جديدة من الصفر. تستخدم التصاميم الأحدث رؤوس حركة قائمة على الانتشار، مما ينتج مسارات أكثر سلاسة واستمرارية، ويتعامل مع توزيعات الحركة متعددة الأنماط بشكل أفضل من تصنيف الرموز البحت.
يعتمد التدريب أساسًا على استنساخ السلوك: حيث يُدرَّب النموذج على محاكاة عروض الخبراء من خلال التعلم الخاضع للإشراف على أزواج (الملاحظة، الفعل). وتُضيف بعض الأنظمة طبقة من التعلم المعزز من خلال التغذية الراجعة البشرية (RLHF) أو التعلم المعزز الفوري في بيئة المحاكاة لتحسين المتانة بما يتجاوز ما يمكن تحقيقه بالمحاكاة وحدها. ولا تزال فجوة المحاكاة إلى الواقع، أي انخفاض الأداء عند نقل سياسة مُدرَّبة في بيئة المحاكاة إلى روبوت حقيقي، من أكثر المشكلات البحثية نشاطًا. ويُعدّ تغيير خصائص المجال عشوائيًا (تغيير الأنسجة والإضاءة وأوضاع الأجسام ومعايير الفيزياء عشوائيًا أثناء التدريب في بيئة المحاكاة) أكثر تقنيات التخفيف شيوعًا.
-
معالم البحث الرئيسية
شهد مجال الروبوتات ذات المصفوفات الكبيرة تطوراً سريعاً. يوضح الجدول التالي المنصات الأكثر استخداماً في مناقشات الروبوتات الصناعية حتى أوائل عام 2026.
| النموذج / المنصة | المطور | الإفراج عن | المعلمات التقريبية | نطاق المهمة | مفتوح / مغلق |
|---|---|---|---|---|---|
| RT-2 | جوجل DeepMind | 2023 | 55B | التلاعب بالطاولة؛ الاستدلال الناشئ | مغلق (لم يتم تحرير الأوزان) |
| RT-X / Open X-Embodiment | جوجل ديب مايند + 33 مختبرًا | 2023 | متنوع | التعميم بين الروبوتات؛ 22 نوعًا من الروبوتات | مجموعة البيانات مفتوحة؛ النماذج جزئية |
| OpenVLA | ستانفورد + جامعة كاليفورنيا في بيركلي | 2024 | 7B | معالجة عامة؛ قابلة للتعديل الدقيق | مفتوح (أباتشي 2.0) |
| π⁰ (باي صفر) | الذكاء الجسدي (π) | 2024 | لم يكشف | التلاعب الماهر؛ الطي، التجميع | مغلق (تجاري) |
| حلزون | الشكل AI | 2025 | لم يكشف | التحكم الكامل بالجسم في الروبوتات الشبيهة بالبشر؛ مهام ثنائية اليد | مغلق (خاص) |
| GR00T N1 / N1.5 | NVIDIA | 2025 | لم يكشف | نموذج أساسي للشخصيات الشبيهة بالبشر؛ من المحاكاة إلى الواقع | أوزان مفتوحة (GR00T N1) |
| روبوتات جيميني | جوجل DeepMind | 2025 | لم يكشف | التلاعب الماهر؛ التفكير المكاني ثلاثي الأبعاد | مغلق (الوصول عبر واجهة برمجة التطبيقات) |
| RFM-1 / متغير مشترك | المتغير | 2024 | لم يكشف | الخدمات اللوجستية وإدارة المستودعات | مغلق (تجاري) |
| مهارة الذكاء الاصطناعي | مهارة الذكاء الاصطناعي | 2024 | لم يكشف | دماغ روبوت متعدد المهام؛ | مغلق (تجاري) |
هناك بعض المعالم التي تستحق اهتماماً أكبر من قبل المهندسين الذين يقيمون مدى قابليتها للتطبيق الصناعي.
أظهر نموذج RT-2، الموصوف في ورقة بحثية نُشرت عام 2023 بعنوان "RT-2: نماذج الرؤية واللغة والحركة تنقل المعرفة من الويب إلى التحكم الروبوتي" (بروهان وآخرون، جوجل ديب مايند)، أن نموذجًا مُهيأً من بنية أساسية مُدربة مسبقًا للرؤية واللغة (PaLI-X، PaLM-E) قادر على إظهار قدرة على الاستدلال الناشئ، حيث يُنفذ مهامًا لم يُدرب عليها صراحةً من قبل، وذلك من خلال دمج مفاهيم من تدريب على نطاق واسع. وأوضحت الورقة البحثية أن حجم النموذج يرتبط بالتعميم، مما زاد من اهتمام الصناعة باستخدام نماذج أساسية ضخمة كبنى أساسية لسياسات الروبوت.
قدّم OpenVLA (كيم وآخرون، 2024) بديلاً مفتوح المصدر بالكامل بسبعة مليارات مُعامل، معتمداً على Prismatic VLM، مُظهراً أداءً تنافسياً مع RT-2 بتكلفة حسابية أقل بكثير، ومُمكّناً الباحثين الأكاديميين والصناعيين من ضبطه بدقة على بيانات مهام مُخصصة. ووفقاً لورقة بحثية منشورة حول OpenVLA (arxiv:2406.09246)، تفوّق OpenVLA على RT-2-7B في 73% من مهام تقييم BridgeV2 بعد الضبط الدقيق.
يُعدّ NVIDIA GR00T N1، الذي أُعلن عنه في مؤتمر GTC 2025، نموذجًا أساسيًا للروبوتات الشبيهة بالبشر، تم تدريبه باستخدام مزيج من بيانات التحكم عن بُعد، وبيانات الفيديو، والبيانات الاصطناعية من NVIDIA Cosmos وIsaac Lab. وقد أتاحت NVIDIA أوزان GR00T N1 للعموم، مما يجعله أحد أوائل النماذج الأساسية للروبوتات الشبيهة بالبشر المتاحة للتعديل الخارجي. ويربط نظام Isaac GR00T Sim2Real المصاحب التدريبَ التجريبي بالتطبيق الفعلي عبر عشوائية المجال في Isaac Lab.
يستخدم نظام π0 من Physical Intelligence رأس حركة مُطابقة للتدفق بدلاً من تصنيف الرموز المنفصلة، مما يُنتج مسارات أكثر سلاسة ويتعامل مع المهام متعددة المراحل مثل طي الملابس أو تجميع الأشياء بخطوات متسلسلة متعددة. يمزج هذا النظام بين بنية أساسية مُدرّبة مسبقًا لنمذجة اللغة المرئية (VLM) مع مُفكِّك حركة من نوع الانتشار، مُعتمد على رموز اللغة والرؤية.
يعتمد نظام Helix من شركة Figure AI، والمُثبّت على الروبوت البشري Figure 02، على نموذجين: نموذج VLM عالي المستوى يتولى فهم المشهد وتحليل التعليمات، بينما ينفذ نموذج حسي حركي منخفض المستوى الأوامر الحركية بتردد تحكم محدد. وقد أظهر النظام قدرة على التلاعب باليدين في الوقت الفعلي، وتصنيف العناصر إلى فئات بناءً على تعليمات صوتية، وذلك في مصنع BMW في سبارتانبرغ عام 2025.
يُعدّ نظام تسلا المتكامل بين القيادة الذاتية الكاملة (FSD) ونظام أوبتيموس (Optimus) جديرًا بالملاحظة كاستراتيجية فعّالة للاستفادة من البيانات على نطاق واسع في هذا القطاع. إذ يُولّد أسطول تسلا الحالي مليارات الأميال من البيانات المرئية الواقعية لنظام القيادة الذاتية الكاملة. وتتمثل الفرضية الداخلية في إمكانية نقل تمثيلات شبكة الإشغال وهياكل التنبؤ بالفيديو، المُطوّرة للقيادة الذاتية، إلى نظام أوبتيموس (Optimus) لتعلم الروبوت، على الرغم من أن التفاصيل التقنية المتاحة للجمهور لا تزال محدودة.
-
جاهزية حالات الاستخدام الصناعي
لا تتناسب جميع مهام المصانع بنفس القدر مع مناهج VLA. وتتمثل المتغيرات الرئيسية في: متطلبات التفاوت، وتنوع الأجزاء، وتكلفة الفشل، وما إذا كان من الممكن جمع بيانات تجريبية كافية للمهمة المستهدفة.
انتقاء المنتجات من الصناديق والتعامل مع وحدات التخزين المختلطة تُعدّ هذه الحلول الأنسب على المدى القريب. فوضعيات العناصر عشوائية، وأنواع الأجزاء متنوعة، وتكلفة أي خطأ في الالتقاط أو سقوط بسيط منخفضة. وقد تمّ نشر نظام RFM-1 من شركة Covariant في مراكز تلبية طلبات التجارة الإلكترونية خصيصًا لهذه المهمة. ووفقًا لملاحظات القطاع، فإنّ عملية انتقاء الحاويات ذات وحدات التخزين المختلطة باستخدام تقنية الرؤية ثلاثية الأبعاد التقليدية تتمّ عادةً بضبط كل نوع من أنواع وحدات التخزين، ويتطلب تغيير النظام ساعات من إعادة المعايرة. بينما يستطيع النموذج العام التعامل مع العناصر الجديدة دون الحاجة إلى ضبط كل عنصر على حدة، وهو ما يُمثّل قيمة اقتصادية حقيقية عند وتيرة تغيير النظام الشائعة في عمليات تلبية طلبات البيع بالتجزئة.
تجميع مرن يُعدّ هذا المجال أكثر تنافسية. تتطلب مهام التجميع غالبًا دقة إدخال تصل إلى أقل من ملليمتر وتطبيق قوة ثابتة. في هذه المجالات، تُحدث الطبيعة العشوائية لأخذ عينات حركة VLA الحالية تباينًا قد يتجاوز حدود التفاوت المسموح بها في العملية. تستهدف التجارب الأولية خطوات التجميع ذات التفاوت الأقل (توجيه الكابلات، مشابك التثبيت السريع) مع الحفاظ على حركة محددة لعمليات الإدخال ذات التفاوت الضيق.
فحص الجودة تُعد هذه مشكلة محلولة جزئيًا باستخدام أنظمة الرؤية ثنائية/ثلاثية الأبعاد الحالية، ولكن تتم إعادة النظر فيها باستخدام بنى VLA لأن النماذج المشروطة باللغة يمكن إعادة توجيهها لفحص أنواع مختلفة من العيوب من خلال تغييرات التعليمات بدلاً من إعادة تدريب مصنف مخصص.
تقليل عمليات التغيير تُعدّ هذه هي القيمة الرئيسية المقترحة. يتطلب خط إنتاج يُشغّل 50 وحدة تخزين (SKU) في كل وردية، وتتطلب كل منها نقاط التقاط وأهداف وضع مختلفة، إما روبوتات مخصصة لكل وحدة تخزين أو إعادة برمجة تستغرق وقتًا طويلاً. من الناحية النظرية، يمكن إعادة توجيه خلية قادرة على التعلم الآلي المتغير (VLA) عن طريق تغيير تعليمات اللغة. عمليًا، تتطلب النماذج الحالية ضبطًا دقيقًا على عروض توضيحية خاصة بالمهام حتى عند استخدام بنية أساسية قوية مُدرّبة مسبقًا. لا يزال التعميم بدون تدريب مسبق على مهام الدقة الصناعية نادرًا.
من الناحية العملية، عند تقييم الطيارين VLA، فإن المهندسين الذين يحققون أسرع النتائج هم أولئك الذين يستهدفون المهام التي تتضمن: (أ) تنوعًا كبيرًا في الأجزاء، (ب) تفاوتات فضفاضة (>0.5 مم)، (ج) بنية تحتية موجودة لجمع البيانات (أجهزة التشغيل عن بعد أو تسجيل العرض التوضيحي)، و (د) الاستعداد للتعامل مع مكون VLA كطبقة لاختيار المهام والحركة الخشنة مع وحدة تحكم كلاسيكية تتولى التصحيحات الدقيقة.
-
VLA في عام 2026: أين تقف حلقات الإنتاج التجريبية فعلياً
في منتصف عام 2026، لا تزال الفجوة بين عرضٍ مُقنعٍ لتقنية VLA ونشرها في الإنتاج هي السمة المميزة لهذا المجال. ويتسم النمط السائد في التجارب الصناعية بالاتساق: فالمهام الموجهة بالرؤية ذات نطاق الحركة المحدود، مثل انتقاء العناصر من الصناديق، وتجميعها، وفحصها، بدأت تتحول إلى استخدام روتيني، بينما لا تزال عمليات المناولة المفتوحة في خلية غير منظمة نشاطًا بحثيًا وتجريبيًا وليست قدرة جاهزة للاستخدام في خطوط الإنتاج.
بحسب ملاحظات القطاع، تحدد ثلاثة قيود عملية هذا النطاق. أولًا، البيانات: لا تزال سياسة VLA بحاجة إلى مئات العروض التوضيحية الخاصة بكل مهمة من الأجزاء والأدوات الحقيقية التي ستواجهها، وهذه البيانات غير متوفرة إلا بعد جمعها في المنشأة. ثانيًا، التحقق: تُعدّ السياسة المُتعلّمة التي تنجح بنسبة 95% مثيرة للإعجاب في المختبر، ولكنها غير مقبولة على خط إنتاج يُجري آلاف الدورات في كل وردية، لذا فإن معايير السلامة والقبول أعلى بكثير مما تُشير إليه مقاييس العروض التوضيحية. ثالثًا، التكامل: لا يكون النموذج مفيدًا إلا بعد دمجه في منطق سلامة الخلية، والتثبيت، واستعادة الأخطاء الذي توفره أنظمة الأتمتة التقليدية.
يعني هذا بالنسبة للمصنّع أن يتعامل مع تقنية الأتمتة المرئية (VLA) كامتداد لقاعدة الأتمتة الحالية، لا كبديل لها. وتتمثل الخطوة الأولى ذات العائد الأعلى في عام 2026 في مهمة جاهزة للإنتاج موجهة بالرؤية، والتي تجمع أيضًا بيانات مهمة قابلة للاستخدام، بحيث يرتكز الانتقال النهائي إلى مرونة أوسع مدفوعة بتقنية VLA على عملياتك الخاصة. للاطلاع على النسخة التشغيلية من هذا التسلسل، انظر الذكاء الاصطناعي المجسد مقابل الروبوتات الصناعية التقليدية أما بالنسبة لمكان التجربة أولاً، الذكاء الاصطناعي المُجسّد للمصنعين الصناعيين: حالات الاستخدام، والعائد على الاستثمار، ومجالات التجربة.
متطلبات البيانات: لماذا تُعدّ البيانات عنق الزجاجة
تتمثل مصادر البيانات الرئيسية الثلاثة لتدريب VLA في عروض التشغيل عن بعد، والبيانات الاصطناعية من المحاكاة، وفيديوهات الإنترنت.
تُعدّ عروض التشغيل عن بُعد، حيث يُشغّل الإنسان الروبوت عبر واجهة لمسية أو هيكل خارجي بينما يُسجّل النظام حالات المفاصل وتدفقات الكاميرا، مصدر البيانات الأعلى جودةً لأنها تُجسّد ديناميكيات الروبوت الحقيقية، وتفاعلاته مع الأجسام الحقيقية، وتشويش المستشعرات الحقيقي. إلا أنها مكلفة أيضًا: فبحسب ملاحظات الصناعة، يتطلب جمع مجموعة بيانات تجريبية قابلة للاستخدام لمهمة مناولة جديدة ما بين 10 إلى 100 ساعة عمل للمشغل لكل نوع من أنواع المهمة، بتكلفة ساعة واحدة تشمل أجور المشغل، ووقت الروبوت، ومعالجة البيانات. ولهذا السبب تحديدًا، أنشأت كل من شركتي Physical Intelligence وFigure AI فرقًا داخلية كبيرة للتشغيل عن بُعد.
تتيح البيانات الاصطناعية المُولَّدة في برامج محاكاة الفيزياء (مثل NVIDIA Isaac Lab وMuJoCo وSAPIEN) جمع البيانات بالتوازي على نطاق واسع، حيث تقوم مئات الروبوتات المُحاكاة بجمع البيانات في وقت واحد، إلا أنها تعاني من فجوة بين المحاكاة والواقع. يختلف المظهر المرئي للمشاهد المُصوَّرة عن صور الكاميرا الحقيقية، ونادرًا ما تتطابق فيزياء التلامس المُحاكاة مع الاحتكاك والتشوه والانزلاق في العالم الحقيقي. يُسهم التوزيع العشوائي للمجال جزئيًا في سد هذه الفجوة من خلال التدريب على اختلافات عشوائية في الأنسجة والإضاءة والكتل ومعاملات الاحتكاك، ولكنه لا يُزيلها تمامًا. صُمِّم NVIDIA Cosmos، وهو نموذج أساسي للعالم تم إصداره بالتزامن مع GR00T، لتوليد مقاطع فيديو تدريبية اصطناعية ذات واقعية فيزيائية أعلى من الواقعية الفوتوغرافية مقارنةً بالعرض التقليدي، ويجري تقييمه كأداة لزيادة البيانات.
تُعدّ مقاطع الفيديو على الإنترنت، والتي تضم مليارات الساعات من لقطات التفاعل البشري على يوتيوب ومنصات مماثلة، مصدر البيانات الذي حفّز في الأصل استخدام هياكل VLM الأساسية في مجال الروبوتات. وقد رصد نموذج مُدرّب مسبقًا على مقاطع الفيديو على الإنترنت أيادي تلتقط أشياءً، وتُركّب أثاثًا، وتطبخ، وتستخدم أدوات، على الرغم من أن هذه المقاطع لا تحتوي على أي تصنيفات لحركات الروبوت. وتفترض الفرضية أن هذه المعرفة العامة بالتفاعل تنتقل إلى التحكم في الروبوت من خلال الضبط الدقيق. وكان RT-2 أوضح دليل على صحة هذه الفرضية على نطاق واسع.
بحسب تقرير الاتحاد الدولي للروبوتات (IFR) لعام 2025، سجلت تركيبات الروبوتات الصناعية العالمية رقماً قياسياً جديداً في عام 2024، حيث تم تركيب أكثر من 590,000 وحدة. وتلبي شركة EVST متطلبات النشر الصناعي واسع النطاق من خلال مجموعة منتجاتها المتكاملة من حيث الحمولة، بدءاً من روبوتات XR التعاونية بوزن 3 كجم وصولاً إلى أذرع QJAR الصناعية الثقيلة بوزن 800 كجم، مما يوفر للمُكاملين منصة أجهزة قادرة على تشغيل كلٍ من وحدات التحكم التقليدية الحتمية، ومع تطورها، أهداف الحركة المولدة بتقنية VLA في بيئات إنتاج متنوعة.
-
الآثار المترتبة على الأجهزة
تشغيل استدلال VLA في بيئة إنتاجية يتطلب متطلبات أجهزة تختلف اختلافًا كبيرًا عن وحدات التحكم الروبوتية التقليدية.
ينفذ متحكم الروبوت الصناعي النموذجي حلقة تحكم في فضاء المفاصل بتردد 1 كيلوهرتز على نظام تشغيل حتمي في الوقت الحقيقي. تكون ميزانية الحوسبة محدودة والتوقيت دقيقًا للغاية. في المقابل، يعمل استدلال VLA على وحدة معالجة رسومية (GPU): يتطلب نموذج RT-2 (بمقياس 55 مليار مُعامل) عدة وحدات معالجة رسومية متطورة، وينتج حركات بتردد استدلال يتراوح بين 1 و3 هرتز. بينما يمكن لنموذج بـ7 مليارات مُعامل، مثل OpenVLA، أن يعمل على وحدة معالجة رسومية واحدة من الفئة الاستهلاكية بتردد يتراوح بين 6 و10 هرتز. بالنسبة للعديد من مهام المناولة، يكون معدل إخراج الحركة بتردد 10 هرتز كافيًا؛ أما بالنسبة للتجميع عالي السرعة أو الالتقاط الديناميكي، فهو غير كافٍ.
تعتمد معظم الفرق بنيةً هرميةً ثنائية المستوى: يعمل نموذج VLA على وحدة معالجة رسومية (مثبتة على مركبة AGV أو قاعدة روبوت أو خادم طرفي قريب) ويُخرج أهداف حركة عالية المستوى بتردد 5-15 هرتز. يقوم معالج مساعد تقليدي يعمل في الوقت الحقيقي، وهو وحدة التحكم الحالية في مفاصل الروبوت، باستيفاء هذه الأهداف بتردد 1 كيلوهرتز، ويفرض حدود عزم الدوران، وتجنب الاصطدام، وقيود مساحة المفاصل. يحافظ هذا الفصل على الحتمية والسلامة في طبقة التحكم، بينما يسمح لطبقة VLA بمعالجة الإدراك والاستدلال على مستوى المهمة.
تتغير متطلبات المستشعرات أيضًا. تستخدم نماذج VLA بشكل أساسي تدفقات كاميرات RGB، وتستخدم معظم الأبحاث الحالية كاميرا أو اثنتين للمعصم والقاعدة. تُحسّن مستشعرات العمق دقة المناورة، خاصةً في المشاهد المزدحمة، ولكن يجب إسقاط بيانات العمق في مساحة الصورة التي يفهمها النموذج. بالنسبة للتطبيقات الصناعية، يجب أن تستوفي الكاميرات معايير الحماية من دخول الماء والغبار لبيئة التشغيل: IP65 كحد أدنى للتصنيع العام، وIP68 للمناطق المعرضة للغسيل أو الأجواء القابلة للانفجار.
-
جانب المحاكاة
تُجرى معظم عمليات تطوير المصفوفات الصوتية فائقة السرعة (VLA) عبر المحاكاة قبل استخدام الأجهزة المادية. وتهيمن أربعة برامج محاكاة على المشهد البحثي الحالي.
تم تحسين بيئة NVIDIA Isaac Lab (المبنية على Isaac Sim، والمبنية بدورها على USD وPhysX) للتدريب المتوازي واسع النطاق على وحدات معالجة الرسومات من NVIDIA. يمكن تشغيل آلاف البيئات المحاكاة في وقت واحد على عقدة DGX واحدة، مما يجعل من العملي جمع ملايين مسارات العرض التوضيحي في غضون أيام بدلاً من شهور. تُعد Isaac Lab بيئة التدريب الأساسية لـ GR00T.
يُعدّ برنامج MuJoCo (الذي أصبح الآن مفتوح المصدر وتتولى صيانته شركة DeepMind) الأكثر استخدامًا في الأوساط الأكاديمية. وقد تمّ التحقق من صحة مُحلِّل التلامس الخاص به على نطاق واسع في مهام معالجة الروبوتات، كما تستخدمه معايير قياس الأداء مثل RoboSuite وAdroit. وتُشير معظم الأبحاث المنشورة حول VLA إلى نتائج مُقارنة بمعايير قياس الأداء القائمة على MuJoCo، مما يجعله المعيار الفعلي للمقارنة.
يُعدّ NVIDIA Cosmos نموذجًا جديدًا لمؤسسة العالم، يُولّد مقاطع فيديو واقعية من خلال نصوص أو صور. وبدلًا من كونه محاكاة تقليدية، يجري استكشافه كأداة لتوليد بيانات اصطناعية، حيث يُنتج مقاطع فيديو تدريبية تُظهر سيناريوهات معالجة الروبوتات التي يصعب جمعها فعليًا أو عرضها باستخدام الرسومات التقليدية.
يتميز برنامج SAPIEN، الذي طُوّر في جامعة كاليفورنيا في سان دييغو، بقدرته الفائقة على التعامل مع الأشياء المفصلية: فتح الأدراج، وتدوير الصمامات، وتشغيل الأجهزة. وقد استُخدمت مجموعة بياناته للأشياء المفصلية (PartNet-Mobility) على نطاق واسع لتدريب وتقييم سياسات التعامل مع الأشياء في المهام التي تتضمن خصائصها.
-
متى يُنصح بتجربة تقنية VLA مقابل الاستمرار في البرمجة التقليدية؟
هذا هو السؤال العملي الذي يواجهه معظم مهندسي التصنيع في عام 2026. والإجابة الصادقة هي أن أساليب VLA ليست الخيار الصحيح لمعظم بيئات الإنتاج حتى الآن، ولكن هناك سيناريوهات محددة يكون فيها إجراء تجربة تجريبية مبرراً.
ضع في اعتبارك مشروعًا تجريبيًا لـ VLA عندما:
- تتميز قطع الغيار بتنوعها الكبير (أكثر من 20 وحدة تخزين مميزة) ويتجاوز معدل التغيير أسبوعيًا
- متطلبات التفاوتات غير صارمة (دقة تحديد الموضع > 0.5 مم مقبولة)
- تتضمن المهمة إدخال بيانات غير منظمة أو مرتبة عشوائياً (مثل محتويات صندوق عشوائية).
- تتضمن العملية تعليمات على مستوى اللغة قد تتغير (اختر حسب اللون أو الفئة أو الملصق).
- هناك استعداد لتجهيز مرحلة جمع البيانات (جهاز تشغيل عن بعد، 50-200 ساعة من العروض التوضيحية)
- تكلفة الأعطال العرضية منخفضة، ويمكن للنظام تحمل التصحيح البشري في الحلقة.
استمر في استخدام البرامج الكلاسيكية عندما:
- التطبيق ذو هندسة ثابتة، وحجم كبير، وتشغيل طويل (لحام هياكل السيارات، وتشغيل مكابس التشكيل بالضغط).
- متطلبات التفاوت دقيقة للغاية (<0.1 مم) ويجب ضمانها في كل دورة
- بيئة وحدة التحكم مصنفة من حيث السلامة وفقًا لمعيار IEC 62061 أو ISO 13849، وإضافة طبقة استدلال GPU غير ممكنة.
- تُعد سجلات التدقيق وسجلات التنفيذ الحتمية مطلوبة للحصول على شهادات الجودة (IATF16949، والعمليات المجاورة لـ IATF16949).
- لا توجد بنية تحتية لجمع البيانات ولا توجد ميزانية لإنشائها.
تتمثل إحدى الاستراتيجيات الهجينة العملية، التي يتبناها العديد من الرواد الأوائل، في استخدام نظام VLA لاختيار المهام وتوليد الحركة التقريبية، مع استخدام وحدة تحكم تقليدية لتنفيذ الحركة الدقيقة والتحكم في القوة. يحدد نظام VLA ما يجب فعله والوجهة التقريبية، بينما تتولى الطبقة التقليدية التحكم الدقيق في التشغيل الذي يتطلب مراعاة معايير السلامة.
تُجري شركة EVST، بصفتها مُورِّدًا متكاملًا لأنظمة الروبوتات الصناعية التي تُقدِّم أذرعًا روبوتية صناعية بأحمال تتراوح من 3 إلى 800 كجم، تقييمًا نشطًا لأنظمة VLA لتطبيقات مُحدَّدة، لا سيما في مجال انتقاء المنتجات من الحاويات ذات التنوع العالي والتجميع المرن، حيث تبرز أهمية المرونة. يعتمد نهج EVST على اعتبار استدلال VLA طبقةً للإدراك والتخطيط تقع فوق وحدة التحكم المفصلية الحتمية، مما يحافظ على التحكم في الحركة الصناعية الذي تتطلبه الأنظمة الحاصلة على شهادات CE/SGS/TÜV. أما في البيئات ذات درجات الحرارة القصوى (من -30 درجة مئوية إلى 80 درجة مئوية) والخلايا المقاومة للانفجار الحاصلة على شهادات ATEX/IECEx، فتظل وحدات التحكم التقليدية هي النهج الوحيد المُعتمد في هذه المرحلة.
-
تحديات السلامة والتحقق
يجب أن تُظهر الروبوتات الصناعية العاملة وفقًا لمعياري ISO 10218-1 (تصميم الروبوت) وISO 10218-2 (تكامل الأنظمة) سلوكًا آمنًا قابلًا للتدقيق ومحددًا. كما تتطلب تطبيقات الروبوتات التعاونية تقييمًا للمخاطر وفقًا لمعيار ISO/TS 15066، الذي يحدد الحدود البيوميكانيكية لقوة التلامس والضغط حسب منطقة الجسم.
تُثير نماذج VLA تحديات في التحقق لم تُصمم هذه المعايير لمعالجتها. فسياسة الشبكة العصبية لا تملك مجموعة محدودة وقابلة للحصر من السلوكيات التي يمكن لمهندس السلامة تحليلها باستخدام تحليل أنماط الفشل وتأثيراتها التقليدي. وقد يتدهور أداء النموذج تدريجيًا أو يفشل فجأةً عند تعرضه لمدخلات خارجة عن نطاق التوزيع، أو جسم جديد، أو حالة إضاءة غير متوقعة، أو حجب جزئي، والتنبؤ بما سيحدث ليس بالأمر السهل.
لا يزال معيار ISO 22166 (المعيار الناشئ لمعايير أداء أنظمة الروبوتات القائمة على الذكاء الاصطناعي) قيد التطوير، ومن المتوقع أن يعالج بعض هذه الثغرات، ولكنه لم يُعتمد نهائيًا بعد. في غضون ذلك، يعكس النهج المسؤول منطق معيار SOTIF (سلامة الوظائف المقصودة، ISO 21448) في مجال صناعة السيارات: تحديد الظروف التي تفشل فيها الوظيفة المقصودة للنظام، وتحديد نطاق التصميم التشغيلي (ODD) الذي يُسمح للنظام بالعمل ضمنه، وتقييد التشغيل خارج هذا النطاق إلى حين تراكم أدلة إضافية للتحقق من صحته.
بحسب ملاحظات الصناعة حول عمليات نشر VLA المبكرة، فإن بنية السلامة الأكثر شيوعًا تُغلّف مخرجات استدلال VLA بمراقب سلامة تقليدي يفرض حدود مساحة العمل، وحدود السرعة القصوى، وعتبات القوة بغض النظر عن متطلبات سياسة VLA. يُولّد VLA أهداف الحركة، وتُقرر طبقة السلامة ما إذا كانت هذه الأهداف مسموحًا بها أم لا. تتيح هذه البنية استخدام وحدة تحكم سلامة متوافقة مع معيار ISO 10218 حتى عندما تكون سياسة المصدر عبارة عن شبكة عصبية.
في بيئات الإنتاج المعتمدة وفقًا لمعيار IATF16949، حيث يُعدّ تتبع العمليات وخطط التحكم المحددة أمرًا إلزاميًا، تواجه أنظمة الأتمتة القائمة على VLA عبئًا إضافيًا في التوثيق. إذ يتعين على المهندسين تحديد نطاق التوزيع (ODD)، وتسجيل مدخلات ومخرجات الاستدلال، ووضع إجراءات للكشف عن حالات الخروج عن التوزيع والتعافي منها. هذا ليس مستحيلاً، ولكنه يُضيف تكلفة تحقق لا تتحملها الأنظمة التقليدية المبرمجة خارج الخط.
بحسب تقرير الاتحاد الدولي للروبوتات لعام 2025، لا يزال الامتثال لمعايير السلامة أحد أهم ثلاثة عوائق أمام تسريع تبني الروبوتات في أسواق التصنيع النامية. تعالج شركة EVST هذا الأمر من خلال دمج شهادات CE وSGS وTÜV من جهات خارجية في خط إنتاجها من الروبوتات منذ مرحلة التصميم، بحيث يبدأ المكاملون الذين يستخدمون أجهزة EVST كطبقة مادية ضمن حزمة استدلال VLA من أساس ميكانيكي وكهربائي معتمد بدلاً من الاضطرار إلى اعتماد نظام مخصص من الصفر.
-
الأسئلة الشائعة
ما الفرق بين نموذج VLA ونظام رؤية الروبوت التقليدي؟
يُخرج نظام الرؤية الروبوتية التقليدي (كاميرا ثنائية الأبعاد + كشف الأجسام أو سحابة نقاط ثلاثية الأبعاد + تقدير الوضع) بيانات هندسية (موقع الجسم واتجاهه) تُغذى كمدخلات إلى مُخطط حركة منفصل. أما نموذج VLA فيأخذ صور الكاميرا وتعليمات لغوية كمدخلات، ويُخرج حركات الروبوت مباشرةً، دون الحاجة إلى وحدة تخطيط منفصلة. يتميز نهج VLA بمرونة أكبر في التعامل مع الأجسام الجديدة وتغييرات التعليمات؛ بينما يتميز النهج التقليدي بثبات أكبر وسهولة التحقق من صحته وفقًا لمعايير السلامة.
هل الذكاء الاصطناعي المجسد في التصنيع الصناعي جاهز للإنتاج بحلول عام 2026؟
لا تزال معظم التطبيقات في مراحلها المبكرة. وقد تجاوزت العديد من المنصات (مثل Covariant RFM-1 في مجال تلبية طلبات التجارة الإلكترونية، وFigure AI Helix في مشاريع تجميع السيارات التجريبية) مرحلة البحث النظري، إلا أن نشرها على نطاق واسع في الإنتاج بمستويات الموثوقية التي يتوقعها العملاء الصناعيون (وقت تشغيل يزيد عن 99%، ودقة تكرار أقل من ملليمتر، وسلامة معتمدة) لا يزال على بُعد سنة إلى ثلاث سنوات بالنسبة لمعظم فئات المهام. ويُعدّ نظام انتقاء المنتجات من الصناديق ذات التشكيلة المتنوعة الأقرب إلى مرحلة الإنتاج الجاهز.
كم عدد العروض التوضيحية التي يحتاجها نموذج VLA لتعلم مهمة صناعية جديدة؟
تختلف الإجابة اختلافًا كبيرًا باختلاف النموذج والمهمة. فمع بنية أساسية قوية مُدرَّبة مسبقًا مثل OpenVLA أو GR00T، يمكن تحقيق أداء مقبول في مهام التلاعب البسيطة على سطح الطاولة من خلال ضبط دقيق باستخدام 50 إلى 100 عرض توضيحي فقط. أما المهام الصناعية المعقدة أو التي تتطلب مهارة أو دقة عالية، فقد تحتاج إلى 500 إلى 2,000 عرض توضيحي لتحقيق معدلات نجاح مقبولة. ووفقًا لملاحظات الصناعة من البرامج التجريبية الأولية، فإن الحد الأدنى العملي لنشر تجاري مُجدٍ لمهام محددة هو عادةً 100 إلى 300 ساعة من بيانات التشغيل عن بُعد.
ما هي الفجوة بين المحاكاة والواقع، وكيف يعالجها مطورو VLA؟
تُعرف فجوة المحاكاة إلى الواقع بانخفاض أداء السياسات عند تطبيق نموذج مُدرَّب في بيئة محاكاة على روبوت حقيقي. لهذه الفجوة سببان رئيسيان: اختلاف المجال البصري (حيث تبدو الصور المُحاكاة مختلفة عن صور الكاميرا الحقيقية) واختلاف المجال الفيزيائي (حيث تختلف قوى التلامس والاحتكاك وتشوه الأجسام المُحاكاة عن سلوكها في العالم الحقيقي). يُعدّ تغيير خصائص المجال عشوائيًا، أي تغيير الخامات والإضاءة والكتل والمعلمات الفيزيائية عشوائيًا أثناء التدريب على المحاكاة، الحل الأكثر شيوعًا للتخفيف من هذه الفجوة. يُضيف برنامج NVIDIA Cosmos إمكانية توليد فيديوهات واقعية كمصدر بيانات إضافي. وتُكمّل معظم أنظمة VLA المُستخدمة بيانات المحاكاة بعروض توضيحية من روبوت حقيقي لسدّ الفجوة المتبقية.
هل يمكن للذكاء الاصطناعي المجسد أن يعمل مع أذرع الروبوتات الصناعية الموجودة، أم أنه يتطلب أجهزة جديدة؟
يمكن استخدام أذرع الروبوت الحالية كطبقة مادية لأهداف الحركة المُولَّدة بواسطة VLA، شريطة أن يكون جهاز التحكم قادرًا على استقبال أوامر الموضع أو السرعة الخارجية بتردد كافٍ (عادةً من 10 إلى 100 هرتز). يعمل نظام استدلال VLA على عقدة حسابية منفصلة لوحدة معالجة الرسومات (GPU) ويرسل وضعيات الهدف إلى جهاز تحكم الروبوت عبر واجهة قياسية (EtherCAT أو OPC UA أو واجهة برمجة تطبيقات خاصة بالشركة المصنعة). توفر أذرع سلسلة EVST QJAR الكاملة وسلسلة XR من الروبوتات التعاونية واجهات ناقل بيانات ميداني قياسية تسمح بهذا التصميم ثنائي الطبقات، لذا لا تحتاج المصانع إلى استبدال الأجهزة الحالية لتشغيل نماذج استدلال VLA.
-
القراءة ذات الصلة
- الروبوتات الشبيهة بالبشر في التصنيع الصناعي: أين ستكون في عام 2026مقالة شقيقة تتناول عمليات نشر برامج Figure وAgility وApptronik وBoston Dynamics في بيئات المصانع
- الروبوتات الشبيهة بالبشر مقابل أذرع الروبوتات الصناعية: أيهما يناسب مصنعك في عام 2026؟مقارنة بين براعة الروبوتات الشبيهة بالبشر وأداء الأذرع المفصلية، مهمة تلو الأخرى.
- دليل شامل للروبوتات التعاونية: أنواعها، واختيارها، وتطبيقاتها في عام 2026، ويغطي بنية الروبوتات التعاونية ومعايير السلامة وأطر الاختيار بشكل متعمق
- أفضل 10 شركات مصنعة للروبوتات الصناعية في الصين: إصدار 2026تغطي هذه الدراسة شركات ESTUN وSIASUN وGSK وEVST وغيرها من الشركات المصدرة، مع تفاصيل الحمولة والتطبيق.
- الذكاء الاصطناعي المُجسّد للمصنعين الصناعيين: حالات الاستخدام، والعائد على الاستثمار، ومجالات التجربةخريطة عملية للاستعداد ودليل لاختيار الطيارين لفرق الإنتاج
- أفضل شركات نماذج مؤسسة الروبوتات والذكاء الاصطناعي المجسد لعام 2026مشهد المنظمات التي تبني نماذج VLA وأساسيات الروبوتات
-
آخر تحديث: ١٢ يونيو ٢٠٢٦. البيانات المتعلقة بمعايير نماذج الروبوتات ذات المصفوفات الطويلة جدًا (VLA) وعمليات نشرها مستقاة من أوراق بحثية متاحة للعموم (بروهان وآخرون، ٢٠٢٣؛ كيم وآخرون، ٢٠٢٤) وإعلانات الشركات المصنعة. بيانات السوق مأخوذة من تقرير الاتحاد الدولي للروبوتات (IFR) العالمي للروبوتات لعام ٢٠٢٥. في حال عدم توفر أرقام محددة، يُستخدم مصطلح "وفقًا لملاحظات القطاع" بدلًا من الأرقام غير الموثقة.
ترى لدينا حلول الذكاء الاصطناعي المجسد →