اختبار قبول مسار سياسة Xiaomi-Robotics-1: نقل نقاط تحقق VLA إلى نشر آمن
يمثل Xiaomi-Robotics-1 أثرا روبوتيا مفتوحا كبيرا، لكن النجاح في الاختبارات المرجعية لا يعني الجاهزية للنشر. يحوله هذا الدليل إلى اختبار قبول عملي لمسار سياسة روبوتية للفرق التي تقيم نقاط التحقق، والمعايرة، والتوقيت، والسلامة، والتعافي، والتراجع.
يمكن لنقطة تحقق روبوتية أن تبدو قوية في اختبار مرجعي وأن تظل غير جاهزة لخلية عمل معايرة. يبدأ اختبار قبول مسار سياسة Xiaomi-Robotics-1 الحقيقي في اللحظات غير المريحة: تتحرك الكاميرا، أو يقع جسم خارج الوضعية المتوقعة، أو تفشل إعادة الضبط، أو ترتفع زمنية الاستدلال فجأة، أو يحتاج المشغل إلى إيقاف النظام قبل أن يتحول خطأ صغير إلى حادث سلامة.
هذه هي العدسة المناسبة لـ Xiaomi-Robotics-1. يصفه المشروع الرسمي بأنه نموذج أساس روبوتي للرؤية واللغة والفعل، مدرب على أكثر من 100,000 ساعة من مسارات تلاعب UMI في العالم الحقيقي، ثم خضع لتدريب لاحق على أكثر من 10,000 ساعة من بيانات عابرة للتجسيدات. تجعل المستودع، وصفحة المشروع، وتقرير arXiv، ومجموعة Hugging Face، وكود النشر، ومجلدات تقييم الاختبارات المرجعية هذا الإصدار أكثر فائدة من إصدار مخصص للعروض فقط. كما أنها توسع سطح التقييم.
السؤال المفيد ليس ما إذا كانت نقطة التحقق هذه تساوي استقلالية الروبوت. بل ما إذا كان يمكن أن تصبح نقطة التحقق هذه مسارا مرشحا: مسار سياسة محدود يمكن إعادة إنتاجه، وتثبيته، وتشغيله في وضع الظل، وإطلاقه تدريجيا، وتعطيله، والتراجع عنه. يسأل الاختبار المرجعي عما إذا كان النموذج قادرا على إكمال المهام ضمن إعداد محدد. أما اختبار قبول المسار فيسأل عما إذا كان بإمكان الفريق إعادة إنتاج الأثر، وربطه بتجسيد الروبوت لديه، وقياس حلقة الإدراك والسياسة والفعل كاملة، والإبقاء على سلطة الإنسان قائمة عندما يصبح السلوك غريبا.
تختلف هذه الزاوية عن أعمال روبوتات فيديو الطرف، حيث يكون سطح القرار الرئيسي هو إنتاجية المستشعرات، والمرمزات، وخطوط معالجة الفيديو على الجهاز. للسياق الأوسع حول بنية الروبوتات التحتية، راجع مقالة Optijara ذات الصلة عن JetPack 7.2.1 وروبوتات فيديو الطرف. يطرح Xiaomi-Robotics-1 سؤالا منفصلا: هل يمكن أن تصبح نقطة تحقق سياسة VLA مفتوحة مسارا محتويا لسياسة روبوت بعد بوابات المعايرة، والتوقيت، والسلامة، والتعافي؟ ولأنماط تقييم سياسات الروبوت المفتوحة المجاورة، قارن ذلك مع اختبار قبول LingBot-VLA 2.0 لكامل الجسم ومتعدد التجسيدات من Optijara.
لماذا يحتاج Xiaomi-Robotics-1 إلى بوابة نشر، وليس إلى ملخص آخر للاختبارات المرجعية
يقول README الرسمي إن Xiaomi-Robotics-1 يربط نموذج VLM مدربا مسبقا، Qwen3-VL، مع Diffusion-Transformer عبر تصميم Mixture-of-Transformers. ويذكر أكثر من 100,000 ساعة من مسارات UMI غير المرتبطة بتجسيد معين عبر أكثر من 1,700 سيناريو، ثم تدريبا لاحقا ببيانات عابرة للتجسيدات، بما يشمل بيانات روبوتات حقيقية داخلية، وبيانات روبوتات مفتوحة المصدر مرشحة، وبيانات UMI موسومة يدويا. تسرد مجموعة Hugging Face نقاط التحقق المنشورة، بما في ذلك Xiaomi-Robotics-1-5B ونقاط تحقق خاصة بالاختبارات المرجعية لـ RoboCasa وRoboCasa365 وVLABench.
تستحق هذه الآثار الانتباه. لكنها ليست دليلا على النشر. يذكر README درجات اختبار مرجعي على RoboCasa وRoboCasa365 وVLABench وRoboDojo، بما في ذلك 57.4 بالمئة على RoboCasa365 مقارنة بـ 46.6 بالمئة للمدخل الثاني الأفضل في الجدول. تعامل مع هذه الأرقام بوصفها ادعاءات اختبار مرجعي صادرة عن المشروع حتى يعيد الفريق إنتاجها بكود مثبت، وأوزان مثبتة، وإصدارات محاكاة مطابقة، وإعدادات تقييم مطابقة.
مشكلة النشر أكثر فوضوية من إكمال المهام في اختبار مرجعي. يجب أن يتحمل مسار الروبوت انحراف المعايرة، والإطارات القديمة، والحجب الجزئي، وتحرك الأجسام، وأخطاء إعادة الضبط، وحدود الشبكة، وأخطاء موائم الفعل، وتدخل الإنسان. إذا كانت السياسة تعمل عبر فصل عميل-خادم، كما تصف أدلة تقييم RoboCasa وVLABench، فيجب أن يقيس اختبار القبول أيضا جولات الاتصال عبر المقابس، وكلفة التسلسل، واستدلال النموذج، وإرسال الفعل، واستجابة المشغل، والتذبذب عبر حلقات متكررة. ينطبق انضباط الجاهزية نفسه خارج الروبوتات أيضا، كما يظهر في اختبار قبول جاهزية وكيل Cloudflare لـ AEO من Optijara.
خريطة الأثر: ما يجب على الفرق تثبيته قبل أن يتحرك أي روبوت
قبل أن يتحرك الروبوت، يحتاج الفريق إلى خريطة أثر يمكن إعادة بنائها لاحقا. ثبت التزام المستودع العام، ومراجعة نقطة التحقق الدقيقة في Hugging Face، وبصمات الملفات لآثار النموذج، ورخصة كود Apache-2.0، وشروط بطاقة النموذج، وملف قفل الاعتماديات، ومكدس CUDA وPyTorch، وإصدارات transformers، وإصدارات المحاكيات، وتكوينات الاختبارات المرجعية، وسكربتات النشر، وأي برنامج ثابت للروبوت أو بناء وحدة تحكم مستخدم في اختبارات العتاد.
يحمل كود خادم النشر AutoModel مع trust_remote_code، وflash attention، وbfloat16، وCUDA، ويعيد موترات فعل مخللة. يحدد README الخاص بتقييم RoboCasa إصدار RoboCasa v0.2، وPython 3.10، وtransformers 4.57.1، وفصل عميل-خادم عبر بيئتي conda. ويحدد README الخاص بتقييم VLABench بيئته الخاصة، وإصدارات MuJoCo وdm_control المثبتة، وشكل فعل خام [10, 60]، مع أول 7 أبعاد قابلة للتنفيذ لإزاحة الموضع، وإزاحة دوران Euler، والتحكم في القابض.
| الأثر | ما يجب تثبيته | لماذا يهم |
|---|---|---|
| المستودع | تجزئة الالتزام، الفرع، سكربتات النشر، مجلدات التقييم | يمنع اختبارات الرأس المتحرك من التغير أثناء المراجعة |
| نقطة التحقق | مراجعة Hugging Face، البصمات، شروط بطاقة النموذج | يفصل تغير النموذج عن تغير البيئة |
| وقت التشغيل | Python، CUDA، PyTorch، transformers، flash attention | يتجنب اختلافات صامتة في الاستدلال والمعالج |
| المحاكي | إصدار RoboCasa أو VLABench، الأصول، التكوينات | يجعل إعادة إنتاج الاختبار المرجعي قابلة للمقارنة |
| مسار الروبوت | معايرة الكاميرا، بناء وحدة التحكم، موائم الفعل | يربط خرج سياسة الاختبار المرجعي بالفعل الحقيقي |
| طبقة السلامة | دائرة الإيقاف، حدود مساحة العمل، وضع الرجوع | يبقي القبول مستقلا عن ثقة السياسة |
يحتاج عقد الإدخال والإخراج إلى جرد خاص به. سجل أسماء الكاميرات، ودقة الصورة، والمعالجة المسبقة، وصيغة التعليمة، وحقول الإحساس الذاتي إن استخدمت، وtask_id أو مفتاح الروبوت، وشكل موتر الفعل، وتحجيم الفعل، ودلالات القابض، وتردد الفعل، وسلوك التجميع، وبروتوكول نقطة النهاية، وطبقة الموائم الخاصة بالروبوت. إذا بقي حقل ضمنيا، فالفريق لا يقيم مسارا. بل يراهن. بالنسبة للفرق التي تضفي الطابع الرسمي على بوابات إصدار النماذج الأوسع، تقدم مقالة Optijara اختبار قبول نشر Motif 3 لنموذج sparse MoE موازاة مفيدة لفصل ادعاءات النموذج عن أدلة المسار.
إطار Optijara R-PATH لقبول مسار سياسة الروبوت
R-PATH هو إطار قبول عملي للانتقال من نقطة تحقق بحثية إلى مسار سياسة روبوت محتو. وهو يرمز إلى Reproduce وPin وAlign وTest وHold.
R: إعادة إنتاج المسار المنشور
ابدأ في المحاكاة، وليس على العتاد. أعد إنتاج مسار RoboCasa أو RoboCasa365 أو VLABench الموثق الذي يطابق نقطة التحقق التي تخطط لفحصها. تستخدم وثائق تقييم Xiaomi-Robotics-1 إعداد عميل-خادم حيث يحمل الخادم النموذج ويقدم الأفعال عبر مقبس، بينما يشغل العميل المحاكي، ويبني المدخلات باستخدام AutoProcessor، ويفك ترميز الأفعال. ذلك الحد هو المكان الذي تظهر فيه كثير من مشكلات النشر.
P: تثبيت السياسة والمنصة
بعد وجود تشغيل أساسي، جمد كل ما يمكن أن يتغير. ثبت الكود، ونقطة التحقق، والاعتماديات، وسلوك المعالج، وأصول المحاكي، وتعريفات المهام، وسكربتات الإطلاق، ومتغيرات البيئة، وتكوين العتاد. أضف مجاميع تحقق لملفات النموذج وملفات موائم المسار. خزن أوامر الإطلاق بجانب بيانات التشغيل الوصفية.
A: مواءمة الكاميرات والأفعال والتجسيد
التدريب المسبق غير المرتبط بتجسيد معين واعد لأنه يمكن أن يتعلم أنماط تلاعب واسعة قبل المواءمة الخاصة بالروبوت. لكنه لا يلغي الحاجة إلى ربط خاص بالروبوت. وائم المعاملات الداخلية والخارجية للكاميرات، واتفاقيات الإطارات، والإضاءة، واقتصاص الصورة، ومقياس الجسم، وحدود مساحة العمل، ووضعية القاعدة، وحركيات الذراع، وتحجيم الفعل، ودلالات فتح القابض وإغلاقه، ومواضع إعادة الضبط، وتعريفات المهام.
T: اختبار توقيت الحلقة المغلقة والتعافي
قس الحلقة الكاملة، وليس استدلال النموذج فقط. تشمل الحلقة التقاط الكاميرا، والمعالجة المسبقة، ونقل الشبكة إذا استخدم، واستدلال النموذج، وتسلسل الفعل، وتحويل موائم الفعل، وإرسال وحدة التحكم، واستجابة المشغل، وتحديث الملاحظة، وتقييم بوابة السلامة. سجل توزيعات الزمن والتذبذب، وليس المتوسطات فقط. ثم اختبر الحجب، والإطارات المتأخرة، والملاحظات القديمة، والتعليمات الملتبسة، والأجسام المزاحة، والإمساكات الفاشلة، والمسارات المحجوبة، وفشل إعادة الضبط، وأحداث الإيقاف الطارئ.
H: الحفاظ على سلطة الإنسان والتراجع
لا ينبغي لأي مسار VLA أن يتجاوز آلية الإيقاف. يجب أن توجد سلطة الإيقاف البشرية، وحدود مساحة العمل الفيزيائية، والرجوع إلى إيقاف آمن، والرجوع إلى وحدة تحكم أساسية، ووضع الظل، ووضع الإطلاق التدريجي، وقواعد التراجع قبل التوسع.
مصفوفة قرار المسار: متى يكون Xiaomi-Robotics-1 جاهزا، أو غير جاهز، أو جاهزا للصندوق الرملي فقط
| البوابة | رفض | محاكاة فقط | مسار ظل | مسار إطلاق تدريجي | مسار إنتاج محدود |
|---|---|---|---|---|---|
| نضج الأثر | المصادر أو الشروط غير واضحة | الكود والأوزان مرئية لكن غير مثبتة | آثار وبصمات مثبتة | مثبتة مع سجلات تشغيل قابلة لإعادة الإنتاج | حزمة إصدار مضبوطة التغيير |
| قابلية إعادة الإنتاج | لا يمكن تشغيل التقييم | يعمل التقييم مع انحراف غير مفسر | أعيد إنتاج خط أساس مع تحفظات | تتطابق التشغيلات المتكررة مع نطاق القبول | يعمل جناح الانحدار قبل التغييرات |
| ملاءمة التجسيد | ربط الروبوت غير معروف | صمم الموائم مبدئيا | تسجل مخارج الموائم بدون تشغيل فعلي | اختبر الموائم في مهام محتواة | يراقب الموائم في فئة مهام معتمدة |
| ثبات المعايرة | إطارات الكاميرا والفعل غير محلولة | معايرة يدوية فقط | يسجل معرف المعايرة لكل تشغيل | فحوص انحراف قبل الإطلاق التدريجي | إعادة معايرة وتنبيهات مجدولة |
| التوقيت | الحلقة بلا أجهزة قياس | يقاس الاستدلال وحده | تقاس الحلقة الكاملة في الظل | الزمن والتذبذب ضمن نطاقات الفريق | قياسات توقيت مستمرة |
| التعافي | الإيقاف بعد الفشل غير واضح | حالات الفشل مدرجة | حقن فشل في الظل | الرجوع الآمن يعمل في الإطلاق التدريجي | التعافي والتراجع خاضعان للتدقيق |
| سلطة الإنسان | يمكن للسياسة تجاوز الإيقاف | يوجد إيقاف لكنه غير مختبر | اختبر الإيقاف بدون تشغيل فعلي | اختبر الإيقاف أثناء الإطلاق التدريجي | الإيقاف مستقل ويختبر دوريا |
| الكلفة لكل ساعة مهمة مقبولة | غير مقاسة | المكونات التقريبية معروفة | تسجل كلفة الإشراف وإعادة الضبط | تتبع ساعة المهمة المقبولة | يراجع اتجاه الكلفة قبل التوسع |
هذه المصفوفة محافظة عمدا. يمكن لاجتياز اختبار مرجعي أن يبرر استمرار التقييم. ولا ينبغي أن يصرح بالتشغيل الفعلي في خلية عمل إنتاجية بمفرده. قد يكون Xiaomi-Robotics-1 المرشح المناسب لتقييم تلاعب واسع، لكن وحدة تحكم نصية أضيق، أو سياسة تعلم بالتقليد، أو سير عمل بمساعدة التشغيل عن بعد، أو مكدس روبوت خاص بمورد، قد يكون أفضل لمهمة محدودة ذات متطلبات تكرار صارمة. هذه هندسة عادية: استخدم النموذج حيث تهم القدرة على التكيف، واستخدم تحكما أبسط حيث تهم القابلية للتكرار أكثر.
قائمة تحقق التنفيذ: من نقطة التحقق إلى مسار روبوت معاير
| المرحلة | بنود قائمة التحقق | الدليل الواجب حفظه |
|---|---|---|
| قابلية إعادة الإنتاج قبل التشغيل | استنساخ المستودع المثبت، التحقق من الرخصة، تنزيل نقطة التحقق، حساب البصمات، قفل الاعتماديات | الالتزام، بيان البصمات، ملاحظة الرخصة، ملف البيئة |
| إعادة إنتاج المحاكاة | تشغيل التقييم الموثق، حفظ التكوينات، حفظ السجلات، تسجيل ملف الجهاز | أمر الإطلاق، المقاييس، الفيديوهات، ملاحظات الفشل |
| جرد العقد | توثيق المدخلات، تعليمة المهمة، مفتاح الروبوت، شكل الفعل، دلالات الموائم | مخطط الواجهة، تكوين المعالج، اختبارات الموائم |
| العتاد داخل الحلقة | معايرة الكاميرات، ومساحة العمل، والقابض، ووضعيات إعادة الضبط، والمناطق الآمنة | معرف المعايرة، تكوين المسار، سجل اختبار الإيقاف |
| حقن الفشل | حجب الكاميرا، تأخير الإطارات، إزاحة الأجسام، حظر المسارات، إفشال إعادة الضبط، تفعيل الإيقاف | سجل الأحداث، نتيجة التعافي، قرار التراجع |
| الطرح | تنبؤات ظل، مهام إطلاق تدريجي، رجوع، تراجع، مراجعة توسع | حالة المسار، توقيع المشغل، لوحة القياسات |
ابدأ بتنبؤات الظل حيث تراقب السياسة ولا تشغل العتاد. قارن الأفعال المقترحة بالأغلفة الآمنة المتوقعة. ثم انتقل إلى مهام إطلاق تدريجي محتواة مع إشراف بشري، وحدود فيزيائية، ورجوع إلى خط أساس. إذا فشل إطلاق تدريجي بسبب المعايرة، أو الزمن، أو إعادة الضبط، أو سلوك خارج التوزيع، فتراجع عن المسار بدلا من تعديل البيئة حتى يختفي الفشل.
ما تخطئ فيه الفرق عند تقييم سياسات روبوت VLA المفتوحة
الخطأ الأول هو الخلط بين تغطية الاختبار المرجعي والتغطية التشغيلية. RoboCasa وRoboCasa365 وVLABench قيّمة لأنها توفر بيئات منظمة للتقييم. تصف صفحة مشروع RoboCasa365 أنه يمتد على 365 مهمة وأكثر من 2,500 بيئة مطبخ، مع أكثر من 600 ساعة من بيانات العروض البشرية وأكثر من 1,600 ساعة من العروض المولدة اصطناعيا. لا يمكن لأي اختبار مرجعي أن يثبت أن خلية العمل المستهدفة، وتوزيع الأجسام، وإعداد الإضاءة، وروتين إعادة الضبط، وحدود السلامة مشمولة.
الخطأ الثاني هو تخطي ربط التجسيد. يمكن للتدريب غير المرتبط بتجسيد معين أو العابر للتجسيدات أن يساعد النموذج على تعلم أنماط تلاعب قابلة للنقل. لكنه لا يضمن أن وضعية الكاميرا، أو القابض، أو مقياس الفعل، أو إطار الإحداثيات، أو توقيت وحدة التحكم لديك يطابق افتراضات السياسة.
الخطأ الثالث هو قياس النجاح مع تجاهل التعافي. المسار الذي يكمل مهمة في ظروف نظيفة لكنه يتصرف على نحو سيئ بعد إمساك فاشل ليس جاهزا للتوسع. غالبا ما تكون سلوكيات التعافي، ومعالجة الحالات القريبة من الحوادث، وكشف الحالات خارج التوزيع، والإيقاف الآمن، وسياسة إعادة الضبط أكثر أهمية من مقاطع النجاح المعزولة.
الخطأ الرابع هو التعامل مع زمن التأخير كمتوسط. يمكن لمسار سياسة أن يملك متوسطا مقبولا ومع ذلك يفشل بسبب التذبذب، أو الملاحظات القديمة، أو تأخيرات الخادم المتقطعة. انظر إلى الأطراف، وليس إلى مركز التوزيع فقط.
خطة القياس: الأدلة الواجب جمعها قبل اعتماد المسار
ينبغي أن تجيب حزمة اعتماد المسار عن سؤال غير مريح: هل يمكن لفريق آخر فحص التشغيل نفسه وفهم ما حدث بدقة؟ التقط التزام المصدر، وبصمة نقطة التحقق، والتكوين، والبيئة، وتجسيد الروبوت، ومعرف معايرة الكاميرا، والمهمة، والبذرة إن وجدت، والتعليمة، ومكدس وقت التشغيل، ووقت البداية والنهاية، والمشغل، ووضع المسار. ثم التقط نتيجة المهمة، وسبب التدخل، والحالة القريبة من الحادث، والاصطدام، ومشغل خارج التوزيع، ونتيجة إعادة الضبط، وتفعيل الرجوع، وحدث التراجع، وتوزيع الزمن، والتذبذب، والملاحظات المسقطة، والملاحظات القديمة، ونمط الفشل المرصود.
الكلفة لكل ساعة مهمة مقبولة مفيدة إذا عوملت كمقياس داخلي، لا كوعد عام. يمكن أن تجمع وقت العتاد، وإشراف المشغل، وكلفة إعادة الضبط، وكلفة الحوسبة، والصيانة، والتشغيلات المرفوضة، ووقت المهمة الناجحة المقبولة. الهدف هو مقارنة المسارات دون إخفاء عمل إعادة الضبط وكلفة الإشراف.
| مجموعة المقاييس | الحقول | استخدام قرار المسار |
|---|---|---|
| الأثر | الالتزام، بصمة نقطة التحقق، التكوين، قفل الاعتماديات | إثبات ما اختبر |
| التوقيت | الالتقاط، المعالجة المسبقة، الاستدلال، الشبكة، الإرسال، استجابة المشغل | كشف الزمن والتذبذب |
| السلامة | حدث الإيقاف، حالة قريبة من الحادث، اصطدام، فعل محظور، إيقاف آمن | تحديد أهلية الإطلاق التدريجي |
| التعافي | إمساك فاشل، نتيجة إعادة الضبط، رجوع، تراجع | الحكم على مرونة الحلقة المغلقة |
| الكلفة | وقت المشغل، وقت إعادة الضبط، الحوسبة، وقت المهمة المقبولة | مقارنة المسارات بواقعية |
{
"route_status": "shadow",
"policy": "Xiaomi-Robotics-1 candidate route",
"required_pins": ["repo_commit", "checkpoint_hash", "dependency_lock", "calibration_id"],
"accepted_tasks": ["team_defined_after_canary"],
"excluded_tasks": ["uncalibrated_or_high_risk_tasks"],
"safety_gates": ["independent_human_stop", "workspace_limit", "fallback", "rollback"],
"rollback_condition": "timing, recovery, OOD, collision, or reset behavior outside acceptance band",
"unresolved_caveats": ["sim_to_real_gap", "benchmark_leakage", "calibration_drift", "model_weight_terms"]
}التحفظات والحدود والخطوة العملية التالية
يستحق Xiaomi-Robotics-1 التقييم لأنه يوفر كودا عاما، ومسارات نشر، وروابط نقاط تحقق، وأدلة اختبارات مرجعية، وصفحة مشروع، وتقريرا تقنيا. هذا يجعل إعادة الإنتاج الجادة ممكنة. لكنه لا يزيل الأجزاء الصعبة من نشر الروبوت.
تتمثل التحفظات الرئيسية في كلفة التنفيذ، وفجوات المحاكاة إلى الواقع، وتسرب الاختبار المرجعي أو تداخل مجموعة البيانات، وتباين النموذج والمورد، وخصوصية بيانات الكاميرا، وانحراف المعايرة، وشروط أصول الطرف الثالث، وحدود اعتماد السلامة، والمفاضلات التشغيلية. لا تنشر إذا تعذر تثبيت الآثار، أو تعذرت إعادة إنتاج التقييم، أو كانت التجسيدات المدعومة لا تطابق الروبوت، أو كان التوقيت غير مستقر، أو لم يكن إيقاف السلامة مستقلا، أو كان التعافي ضعيفا، أو كانت سياسة إعادة الضبط غير واضحة، أو كان التراجع يعتمد على بطولات يدوية.
الخطوة العملية التالية هي التعامل مع Xiaomi-Robotics-1 كمسار مرشح خلف R-PATH، لا كنشر تلقائي. أعد الإنتاج أولا، وثبت الآثار، ووائم التجسيد، واختبر توقيت الحلقة المغلقة والتعافي، وأبق سلطة الإنسان مرئية عبر ضوابط الإطلاق التدريجي والتراجع. إذا كان فريقك يقيم سياسات روبوتية أو مسارات أتمتة ذكاء اصطناعي أخرى، فيمكن لـ Optijara المساعدة في تصميم بوابات القبول، والقياسات، ومنصات التقييم، وخطط الطرح التي تربط الآثار البحثية بالأدلة التشغيلية.
النقاط الرئيسية
- 1ينبغي تقييم Xiaomi-Robotics-1 كمسار سياسة روبوت مرشح، لا كمسار نشر تلقائي.
- 2يمكن لنجاح الاختبار المرجعي أن يبرر مزيدا من التقييم، لكن جاهزية المسار تتطلب آثارا مثبتة، وربطا معايرا للتجسيد، وأدلة توقيت، وبوابات سلامة، وتراجعا.
- 3يوفر إطار Optijara R-PATH للفرق تسلسلا عمليا: Reproduce، وPin، وAlign، وTest، وHold.
- 4ينبغي للفرق قياس حلقة الإدراك والسياسة والفعل الكاملة، بما في ذلك الالتقاط، والمعالجة المسبقة، والاستدلال، وزمن الشبكة، والإرسال، واستجابة المشغل، والتذبذب، والملاحظات القديمة.
- 5يمثل تعافي الحلقة المغلقة، ومعالجة OOD، وسياسة إعادة الضبط، وسلطة الإيقاف البشرية، والرجوع، والتراجع معايير قبول مركزية.
الخلاصة
Xiaomi-Robotics-1 أثر كبير لنموذج أساس روبوتي. لا يزال النشر المسؤول يعتمد على أدلة مثبتة، وربط معاير للتجسيد، وبيانات توقيت للحلقة الكاملة، واختبارات تعاف، وسلطة إيقاف بشرية مستقلة، ورجوع، وتراجع.
الأسئلة الشائعة
ما هو Xiaomi-Robotics-1؟
Xiaomi-Robotics-1 هو مشروع نموذج أساس روبوتي للرؤية واللغة والفعل من Xiaomi Robotics. تصف مواده العامة تدريبا مسبقا على مسارات UMI غير مرتبطة بتجسيد معين، وتدريبا لاحقا عابرا للتجسيدات، وكودا منشورا، ومسارات نشر، ومجلدات تقييم للاختبارات المرجعية، ونقاط تحقق للنموذج.
هل يمكن نشر Xiaomi-Robotics-1 مباشرة على روبوت؟
ليس بأمان من دون اختبار قبول. يعتمد النشر على التجسيد المدعوم، ومعايرة الكاميرا والفعل، وعقود الإدخال والإخراج، والزمن والتذبذب، وسلوك التعافي، وسلطة الإيقاف البشرية، والرجوع، والتراجع، والنتائج المعاد إنتاجها.
ما هو اختبار قبول سياسة الروبوت؟
يتحقق اختبار قبول سياسة الروبوت من الآثار، وإعادة إنتاج البيئة، وملاءمة التجسيد، والتوقيت، والسلامة، والتعافي، والرجوع، والتراجع، وأدلة الكلفة قبل أن يتوسع مسار السياسة خارج المحاكاة، أو وضع الظل، أو مهام الإطلاق التدريجي المحتواة.
ما صلة RoboCasa وRoboCasa365 وVLABench؟
توفر هذه البيئات محاكاة منظمة وبيئات اختبار مرجعي لتقييم سياسات الروبوت. تساعد في إعادة الإنتاج والمقارنة، لكنها لا تستبدل التحقق في خلية العمل المستهدفة.
ما الذي ينبغي للفرق قياسه قبل السماح لسياسة VLA بتشغيل العتاد؟
ينبغي للفرق قياس نتائج المهام، وأسباب التدخل، والحالات القريبة من الحوادث، والاصطدامات، ومشغلات OOD، ونتائج إعادة الضبط، وتفعيلات الرجوع، وأحداث التراجع، وتوزيعات الزمن، والتذبذب، والملاحظات القديمة، والكلفة لكل ساعة مهمة مقبولة.
المصادر
- https://github.com/XiaomiRobotics/Xiaomi-Robotics-1
- https://raw.githubusercontent.com/XiaomiRobotics/Xiaomi-Robotics-1/main/README.md
- https://raw.githubusercontent.com/XiaomiRobotics/Xiaomi-Robotics-1/main/deploy/server.py
- https://raw.githubusercontent.com/XiaomiRobotics/Xiaomi-Robotics-1/main/eval_robocasa/README.md
- https://raw.githubusercontent.com/XiaomiRobotics/Xiaomi-Robotics-1/main/eval_vlabench/README.md
- https://raw.githubusercontent.com/XiaomiRobotics/Xiaomi-Robotics-1/main/LICENSE
- https://arxiv.org/abs/2607.15330
- https://robotics.xiaomi.com/xiaomi-robotics-1.html
- https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-1
- https://robocasa.ai/
- https://github.com/OpenMOSS/VLABench
بقلم
Hamza Diazحمزة دياز هو مؤسس Optijara، حيث يبني وكلاء ذكاء اصطناعي عمليين، وأنظمة أتمتة، وسير عمل Copilot للشركات الخدمية. يكتب عن تشغيل الذكاء الاصطناعي، واستراتيجية الوكلاء، والتطبيق الواقعي للفرق التي تريد أنظمة مفيدة بدلًا من الضجيج.
