NVIDIA Cosmos 3 Edge: اختبار قبول نموذج العالم شامل الأنماط لفرق الذكاء الاصطناعي الفيزيائي
يدفع NVIDIA Cosmos 3 Edge نمذجة العالم شاملة الأنماط إلى مسافة أقرب من الكاميرات الحية، والمستقبلات المحاكاة، وحلقات أفعال الروبوت. يجب على فرق الذكاء الاصطناعي الفيزيائي التعامل معه كمرشح نشر يحتاج إلى مراجعة الأثر، وعقود الأنماط، واختبارات التوقيت، وحدود السلامة، والتحقق من خدمة النموذج، وإثبات الرجوع قبل استخدامه في الإنتاج.
يغير NVIDIA Cosmos 3 Edge سؤال القبول لفرق الذكاء الاصطناعي الفيزيائي. قد يبدو بث الكاميرا الحي مستقرا، وقد يبدو المستقبل المتوقع معقولا، وقد يبدو فعل الروبوت واضحا على منصة عرض تجريبية. لا يمثل أي من ذلك دليلا إنتاجيا.
السؤال الأصعب هو ما إذا كان النظام الكامل يصمد تحت ضغط المستشعرات، والتوقيت، وحدود السلامة، وتحكم المشغل. يجب أن ينجو كل إطار، وطابع زمني، ومخرج نموذج، واقتراح فعل، ومسار احتياطي من ضغط النشر الحقيقي.
تصف NVIDIA نموذج Cosmos3-Edge بأنه جزء من عائلة نماذج العالم Cosmos 3 شاملة الأنماط. تقول بطاقة النموذج الرسمية على Hugging Face إن إصدار 20 يوليو 2026 موجه إلى الفهم متعدد الوسائط، ومحاكاة العالم، وتنبؤ المستقبل، واستدلال الأفعال، وتطبيقات الذكاء الاصطناعي الفيزيائي. درس النشر المفيد بسيط: جودة العرض التجريبي هي أضعف دليل ستجمعه.
يركز هذا المقال على ما يجب أن تثبته فرق الذكاء الاصطناعي الفيزيائي قبل أن يلمس الفيديو الحي، أو تنبؤ العالم، أو المحاكاة، أو استدلال أفعال الروبوت العتاد الطرفي. وهو يكمل عمل Optijara حول خيارات نشر بنية الذكاء الاصطناعي التحتية، وتقييم نماذج الروبوتات، وتقييم GEO لمحركات الإجابة. الاختبار هنا أضيق: الجاهزية من الفيديو الحي إلى الفعل.
عامل قدرات النموذج، ونتائج المعايير، وعدد المعاملات، وزمن الاستجابة، والجودة، والترخيص، وبيانات الاستخدام التجاري على أنها ادعاءات من NVIDIA أو المشروع إلى أن يعيد فريقك إنتاج السلوك ذي الصلة، ويراجع الترخيص الدقيق، ويتحقق من النظام الكامل في بيئته الخاصة.
لماذا يحتاج Cosmos 3 Edge إلى اختبار قبول
ما تقول NVIDIA إن Cosmos3-Edge مصمم للقيام به
تصف بطاقة النموذج على Hugging Face نموذج Cosmos3 بأنه نماذج عالم شاملة الأنماط يمكنها توليد فيديو ديناميكي، وصور، وصوت، وأوامر فعل من مدخلات نصية، وصورية، وفيديوية، ومسارات فعل. بالنسبة إلى Cosmos3-Edge، تقول NVIDIA إن النموذج يمكنه أخذ النصوص، والصور، والفيديو، ومسارات الأفعال، ثم توليد نصوص، وصور، وفيديو، ومخرجات فعل متماسكة لفهم العالم، ومحاكاة العالم، وتنبؤ المستقبل، واستدلال الأفعال، وتطبيقات الذكاء الاصطناعي الفيزيائي.
هذا أوسع من استدلال الرؤية العادي. فهو يعبر الإدراك، والمحاكاة، والتنبؤ، ودعم الأفعال. عندما تستقر هذه الوظائف قرب الكاميرات، والمستشعرات، وحوسبة الروبوت، يجب أن يغطي اختبار القبول سلامة التوقيت، وعدم اليقين، وحدود الأفعال، وسلوك الفشل الآمن. التنبؤ حسن المظهر ليس قرارا فيزيائيا آمنا.
لماذا يغير النشر على الطرفية ملف المخاطر
قد يقلل نقل نموذج عالم إلى الطرفية الاعتماد على مسارات الاستدلال البعيدة، لكن يجب التحقق من ذلك مقابل البنية المستهدفة. كما أنه ينقل مزيدا من الحكم إلى موضع أقرب من الأنظمة الفيزيائية. يحتاج المشغلون إلى أدلة حول الإطارات المسقطة، وانحراف الطوابع الزمنية، وعمق الطوابير، والخفض الحراري للأداء، وتزامن المستشعرات، وسلوك الرجوع، والمواعيد النهائية الفائتة.
أبق أربع مراجعات منفصلة: جاهزية أثر النموذج، وجاهزية خدمة النموذج، وجودة التنبؤ، وصلاحية الفعل. لا يمكن لنجاح واحد أن يحل محل النجاحات الأخرى.
خريطة متغيرات Cosmos 3: اختر الأثر أولا
Cosmos3-Edge مقابل Cosmos3-Edge-Policy-DROID
Cosmos3-Edge وCosmos3-Edge-Policy-DROID ليسا قابلين للتبادل. تضع بطاقة Cosmos3-Edge الأثر حول فهم العالم شامل الأنماط، والمحاكاة، وتنبؤ المستقبل، واستدلال الأفعال. وتضع بطاقة Cosmos3-Edge-Policy-DROID متغير سياسة DROID حول التعليمات اللغوية والملاحظات المرئية من منصة الروبوت DROID، مع توليد مسارات فعل روبوت لمهام المناولة والتحكم.
هذا الفرق مهم. لا تستنتج موثوقية فعل الروبوت من جودة الفيديو، ولا سلوك نموذج العالم العام من أثر سياسة روبوت مرتبط بمصدر بيانات محدد. قدمت ورقة DROID مجموعة بيانات كبيرة لمناولة الروبوت جُمعت عبر بيئات كثيرة، لكن الإعداد المستهدف لا يزال يحتاج إلى اختبارات التجسيد، وموضع الكاميرا، وسلوك القابض، وربط فضاء الأفعال، ونطاق المهمة.
تسرد بطاقة النموذج نفسها أيضا Cosmos3-Super-Image2Video-4Step وCosmos3-Super-Text2Image-4Step، بالإضافة إلى إصدارات Cosmos3-Nano وCosmos3-Super الأقدم من 31 مايو 2026. ثبت الأثر الدقيق، والإصدار، والملفات، والاعتماديات، وبيئة التشغيل، والترخيص. لا يوافق النجاح على متغير واحد من Cosmos 3 على متغير آخر.
| المتغير | سؤال التقييم الأنسب | المدخلات والمخرجات التي يجب التحقق منها | مسار الخدمة الذي يجب التحقق منه | لا تستخدمه عندما |
|---|---|---|---|---|
| Cosmos3-Edge | هل يمكن لنموذج عالم شامل الأنماط دعم الفيديو الحي، أو تنبؤ المستقبل، أو المحاكاة، أو استدلال الأفعال على الطرفية؟ | النص، والصورة، والفيديو، ومسارات الأفعال، والنصوص أو الصور أو الفيديو أو مخرجات الأفعال المولدة كما يذكرها أثر المصدر | بيئة التشغيل المدعومة بدقة، ومسار vLLM إن كان منطبقا، والذاكرة، وزمن الاستجابة، والمسار الاحتياطي | الترخيص غير مراجع، أو التوقيت ضعيف، أو عدم اليقين مخفي، أو مخرج الفعل يحصل على سلطة تحكم دون ضوابط حماية |
| Cosmos3-Edge-Policy-DROID | هل يستطيع أثر سياسة DROID إنتاج مسارات فعل صالحة داخل نطاق سياسة الروبوت المقصود؟ | التعليمات اللغوية، والملاحظات المرئية، ومسارات الأفعال، وربط فضاء أفعال الروبوت | بيئة تشغيل السياسة، وواجهة الروبوت، وغلاف السلامة، والتسجيل | يختلف التجسيد المستهدف أو المهمة ماديا عن النطاق المختبر |
| متغيرات Cosmos3-Super للصورة أو الفيديو | هل يمكن لتوليد الصور أو الفيديو دعم أصول المحاكاة أو استكشاف السيناريوهات؟ | الصور، والنص، وتسلسلات الفيديو، والالتزام بالموجه، والاتساق الزمني | خط توليد الوسائط، وسلوك الدفعات، والتخزين، وسير عمل المراجعة | تعامل الوسائط المولدة كدليل على الجدوى الفيزيائية |
| متغيرات Cosmos3 Nano أو Super الأقدم | هل يفيد أثر أقدم من العائلة في المقارنة، أو النمذجة الأولية، أو اختبارات خط الأساس؟ | عقد الأنماط الخاص بالمتغير الدقيق | الإصدار وبيئة التشغيل المثبتان | تستخدم النتائج للموافقة على أثر Cosmos 3 مختلف |
اختبار Optijara لقبول نموذج العالم شامل الأنماط على الطرفية
استخدم اختبار Optijara لقبول نموذج العالم شامل الأنماط على الطرفية كإطار من ست بوابات للطرح. يجب أن تنتهي كل بوابة بحالة نجاح، أو فشل، أو تحقيق، مع إرفاق الأدلة.
1. التحقق من الأثر والترخيص والمنشأ
ابدأ ببطاقة النموذج الرسمية، ومجموعة نماذج NVIDIA، ومستودع GitHub، والورقة البيضاء، وموقع NVIDIA Cosmos، ووثائق خدمة النموذج. سجل اسم النموذج الدقيق، والمراجعة، والملفات، والتجزئات حيثما توفرت، وإصدارات الاعتماديات، وصورة الحاوية، ونص الترخيص، وشروط الاستخدام المقبول، وبيانات الاستخدام التجاري. إذا لم تعتمد المراجعة القانونية أو الأمنية الأثر، فالاختبار التقني غير مكتمل.
2. عقد أنماط المدخلات والمخرجات
اكتب العقد قبل تشغيل العروض التجريبية. حدد كل تدفق إدخال، مثل فيديو الكاميرا، أو الصور، أو التعليمات النصية، أو حالة المستشعر، أو سجل الأفعال. حدد كل مخرج، مثل الإطارات المتنبأ بها، أو نص حالة العالم، أو اقتراحات مسار الفعل، أو أفعال السياسة. سم المالك، والمستهلك، ومستوى السلطة لكل مخرج.
3. إدخال الفيديو الحي وسلامة توقيت الإطارات
يجب أن تشمل اختبارات الفيديو الحي تزامن الكاميرا، ومحاذاة الطوابع الزمنية للمستشعرات، والإطارات المسقطة، وتأثيرات الغالق المتدحرج، وتغيرات التعريض، والأفعال المتأخرة، وتراكم الطوابير. يمكن أن يعمل النموذج جيدا على مقاطع مخزنة ثم يفشل عندما يتحول التوقيت تحت الحمل. التقط وقت وصول الإدخال، والمعالجة المسبقة، والاستدلال، والمعالجة اللاحقة، والموعد النهائي للفعل اللاحق في كل تشغيل.
4. الاتساق الزمني ومعايرة تنبؤ المستقبل
جودة تنبؤ المستقبل ليست النعومة البصرية. اختبر آفاق التنبؤ، وعدم اليقين، وثبات الكائنات، والاحتجاب، وأحداث التلامس، والتدهور تحت الفوضى أو تغيرات الإضاءة. قارن الحالة المتنبأ بها بالحالة المستقبلية المرصودة عند آفاق محددة. على سبيل المثال، قد يقارن اختبار ظل وضعية الكائن المتنبأ بها عند 250 ms، و500 ms، وثانية واحدة بسجل الكاميرا المرصود. إذا أنتج النظام مستقبلات واثقة لكنها غير متسقة فيزيائيا، فضعه في حالة تحقيق أو فشل.
5. صلاحية مسار الفعل ونطاق سياسة DROID
بالنسبة إلى مخرجات الأفعال، تحقق من نطاق السياسة بمعزل عن مخرج نموذج العالم. افحص ربط فضاء الأفعال، وحدود المفاصل، وحدود القابض، وحدود السرعة، ومناطق الاصطدام، وسلوك التعافي، وتجاوز الإنسان، واكتشاف الخروج عن التوزيع. راجع بطاقة نموذج سياسة DROID كأثر مستقل، لا كضمان شامل لكل روبوت.
6. حدود السلامة وعدم اليقين والامتناع
يحتاج كل مرشح نشر إلى مسار امتناع. إذا كانت الطوابع الزمنية قديمة، أو اختلفت المستشعرات، أو كانت الديناميكيات المتنبأ بها غير مؤكدة، أو انتهك اقتراح الفعل حدود السلامة، فيجب أن يرفض النظام، أو يطلب مراجعة، أو يبقي الوضعية، أو يعيد التحكم إلى مكدس مثبت. أثبت هذه الضوابط قبل رفع مستوى الاستقلالية.
| البوابة | نجاح | تحقيق | فشل |
|---|---|---|---|
| الأثر والترخيص | تمت الموافقة على الأثر الدقيق، والمراجعة، والترخيص، والاعتماديات | تجزئة مفقودة أو اعتمادية غير واضحة | مراجعة الترخيص أو المصدر أو الاستخدام المقبول غير محسومة |
| عقد الأنماط | وثقت المدخلات والمخرجات والمالكون ومستويات السلطة | أحد مستهلكي المخرجات غامض | يمكن لمخرج فعل التأثير في التحكم دون عقد |
| توقيت الفيديو الحي | يبقى انحراف الطوابع، والإسقاطات، والطوابير داخل الميزانية | انحراف عرضي غير مصنف | التوقيت غير مسجل أو تفويت المواعيد النهائية متجاهل |
| معايرة التنبؤ | تقاس الأخطاء وعدم اليقين حسب الأفق | مخرج معقول يفتقر إلى مقارنة الحالة | تصل ديناميكيات مهلوسة وواثقة إلى أنظمة لاحقة |
| صلاحية الفعل | تحترم المسارات حدود الروبوت والمهمة | تحتاج الحالات الطرفية إلى إعادة اختبار | تظهر أفعال غير آمنة أو غير مربوطة أو غير محدودة |
| السلامة والرجوع | اختبر الامتناع، والتجاوز، والرجوع | يوجد إجراء يدوي لكنه غير مجرب | لا يوجد مفتاح إيقاف أو بديل آمن |
خدمة النموذج على العتاد الطرفي: الذاكرة، وأطراف زمن الاستجابة، ودعم vLLM
تسرد وثائق النماذج المدعومة في vLLM نموذج Cosmos3EdgeForConditionalGeneration لـ Cosmos3-Edge، لذلك فهي مفيدة لفحص دعم خدمة النموذج. لكن جدول الدعم لا يزال ليس دليلا إنتاجيا. تحقق من متغير النموذج الدقيق، والمراجعة، والاعتماديات، ومسار التكميم إن استُخدم، ومعالجة أنماط الإدخال، وملف الذاكرة، وسلوك البث، وأنماط الفشل. إذا كان مسار خدمة Omni أو متعدد الوسائط جزءا من مسار الخدمة، فاختبر المسار متعدد الوسائط الكامل بدلا من الاعتماد على اسم نموذج في جدول.
قس تفويت المواعيد النهائية، لا متوسط زمن الاستجابة فقط. سجل زمن الاستجابة p95 وp99، والإطارات المسقطة، وعمق الطابور، وبدء التشغيل البارد، ووقت إعادة تحميل النموذج، وكلفة المعالجة المسبقة، وكلفة المعالجة اللاحقة، وتفويت المواعيد النهائية للأفعال. إذا حسنت الدفعات معدل الإنتاجية بينما خلقت إطارات قديمة أو أفعالا متأخرة، فالدفعات تضر حلقة التحكم.
تحتاج الأنظمة الطرفية أيضا إلى اختبارات تحمل للذاكرة والحرارة. شغل مدة كافية لرؤية ضغط الذاكرة، والتجزئة، واستخدام GPU، والخفض الحراري للأداء، والتعافي بعد إعادة توصيل الكاميرا أو إعادة تشغيل النموذج. يجب أن يكون الرجوع مملا: آثار مثبتة، وحاويات قابلة لإعادة الإنتاج، وطرح كناري، ومفتاح إيقاف، ومسار عودة إلى المكدس السابق.
النقل من المحاكاة إلى الواقع: أين تساعد نماذج العالم وأين تضلل
تعد DROID وأعمال تقييم سياسات الروبوت الأخرى تذكيرا مفيدا بأن أداء الروبوت يعتمد على توزيع البيانات، والتجسيد، وتنوع المشهد، وتعريف المهمة، وتصميم التقييم. قد يساعد نموذج في التنبؤ أو المحاكاة ومع ذلك يكون مصدر فعل مباشرا خاطئا في إعداد فيزيائي مختلف.
يمكن أن تبدو المستقبلات المولدة متسقة بينما تنتهك الفيزياء التي تهم الروبوت: التلامس، والاحتكاك، والاصطدام، وحدود القوة، والتشوه، واستخدام الأدوات، أو حالة الكائن المحتجب. عامل الديناميكيات المهلوسة كأحد أنماط الفشل القابلة للقياس. إذا أخفى مستقبل متنبأ به عدم اليقين، فوجهه إلى الامتناع أو بديل أكثر أمانا.
| المقياس | لماذا يهم | الدليل المطلوب التقاطه |
|---|---|---|
| خطأ التنبؤ حسب الأفق | يفصل المعقولية قصيرة الأجل عن الانحراف في الأفق الأطول | الحالة المستقبلية المرصودة مقابل الحالة المتنبأ بها عند آفاق متفق عليها |
| صلاحية الفعل | تؤكد أن الاقتراحات تناسب حدود الروبوت | قيود المفاصل، والقابض، والسرعة، والاصطدام، والمهمة |
| سجل شبه الحوادث | يكشف الاتجاهات غير الآمنة قبل الحوادث | تعليقات مشغلين بطوابع زمنية وسجلات مستشعرات |
| سلوك التعافي | يختبر ما إذا كان النظام يستطيع مغادرة الحالات السيئة | سجلات الإيقاف، أو إعادة المحاولة، أو تسليم الإنسان، أو الانسحاب الآمن |
| دقة الامتناع | تقلل الثقة الزائفة تحت عدم اليقين | حالات رفض فيها النموذج مقابل حالات كان يجب أن يرفض فيها |
| أسباب التدخل | تحول حكم المشغل إلى بيانات اختبار | تسميات منظمة للتجاوز، أو الإيقاف المؤقت، أو الرجوع، أو الرفض |
ما تخطئ فيه فرق الذكاء الاصطناعي الفيزيائي على الطرفية
الخطأ 1: التعامل مع جودة العرض التجريبي كدليل نشر
العرض التجريبي النظيف نقطة بداية، وليس اختبار قبول. استبدل المراجعة الذاتية بعقود الأنماط، وسجلات التوقيت، واختبارات التنبؤ المعايرة، وبوابات السلامة.
الخطأ 2: خلط متغيرات النموذج دون عقد أنماط
لدى Cosmos3-Edge وCosmos3-Edge-Policy-DROID ومتغيرات الصور والفيديو من Cosmos3-Super وآثار Nano أو Super الأقدم أدوار مختلفة. يخلق خلطها ثقة زائفة.
الخطأ 3: اختبار متوسط زمن الاستجابة بدلا من تفويت المواعيد النهائية
قد يبدو متوسط زمن الاستجابة مقبولا بينما يكسر زمن الاستجابة الطرفي حلقة الفعل. قس p95 وp99 وعمق الطابور ورفض الإطارات القديمة.
الخطأ 4: تخطي مسارات الامتناع والتجاوز والرجوع
إذا كان النموذج غير متأكد، يحتاج النظام إلى سلوك آمن. إذا أساء المكدس الجديد التصرف، يحتاج المشغلون إلى مسار رجوع مجرب.
الخطأ 5: افتراض أن المستقبلات المولدة قابلة للتنفيذ فيزيائيا
لا يثبت فيديو مستقبلي واقعي ديناميكيات التلامس، أو جدوى المشغل، أو سلامة الاصطدام، أو صحة السياسة. أبق المحاكاة، والتنبؤ، والتحقق من الأفعال منفصلة.
لا تنشر نماذج العالم الطرفية في استقلالية حرجة للسلامة دون ضوابط حماية مستقلة، أو في بيئات غير محكومة بقرب البشر، أو بتراخيص غير مراجعة، أو بتسجيل ضعيف، أو دون مسارات تجاوز، أو حيث يجعل عدم تطابق المستشعرات التحقق غير موثوق.
قائمة تنفيذ، ومخطط Mermaid، وملخص قابل للقراءة آليا
قائمة عملية لقرار المتابعة أو عدمها
| بند القائمة | المالك | الدليل المطلوب | الحالة |
|---|---|---|---|
| مراجعة الأثر والترخيص والمصدر | الهندسة والقانون | بطاقة النموذج، والترخيص، والمراجعة، والمستودع، والورقة البيضاء | نجاح، فشل، تحقيق |
| عقد الأنماط | المنتج وقائد الروبوتات | المدخلات، والمخرجات، ومستوى السلطة، والمستهلكون | نجاح، فشل، تحقيق |
| التقاط البيانات والمزامنة | فريق الإدراك | سجلات الكاميرا، والمستشعر، والطابع الزمني، والإسقاط | نجاح، فشل، تحقيق |
| اختبارات التنبؤ | قائد التقييم | مقاييس الأفق، وعدم اليقين، وحالات الاحتجاب | نجاح، فشل، تحقيق |
| اختبارات السياسة والأفعال | قائد الروبوتات | الحدود، وربط فضاء الأفعال، والتعافي، والتجاوز | نجاح، فشل، تحقيق |
| اختبارات الخدمة | قائد البنية التحتية | إثبات vLLM أو بيئة التشغيل، والذاكرة، وp95، وp99، والحرارة | نجاح، فشل، تحقيق |
| السلامة وقابلية الرصد | قائد العمليات | الامتناع، والتنبيهات، والتتبعات، ولوحات المعلومات | نجاح، فشل، تحقيق |
| الرجوع والاعتماد | مالك النشر | خطة كناري، ومفتاح الإيقاف، والعودة إلى المكدس السابق | نجاح، فشل، تحقيق |
مخطط Mermaid لاختبار القبول
ملخص نشر مضغوط بأسلوب JSON
{
"model_variant": "Cosmos3-Edge or Cosmos3-Edge-Policy-DROID, pinned by exact revision",
"intended_use": "live-video world prediction, simulation support, or gated action reasoning",
"required_sources": ["model_card", "license", "github", "white_paper", "serving_docs"],
"test_status": "pass | fail | investigate",
"serving_path": "validated edge runtime, vLLM only if exact path is proven",
"latency_budget": "defined by action deadline, not average throughput",
"safety_controls": ["abstention", "human override", "safe fallback", "observability"],
"rollback_plan": "pinned previous stack, canary stop, kill switch, operator signoff",
"do_not_deploy_if": ["license unreviewed", "timestamps unreliable", "uncertainty hidden", "action limits untested"]
}إذا كان فريقك يقيم سير عمل الذكاء الاصطناعي الطرفي، يمكن أن تساعد Optijara في تصميم اختبارات القبول، ولوحات أدلة، ومعايير طرح قبل ربط مخرجات نماذج العالم بأنظمة تشغيلية.
النقاط الرئيسية
- 1يجب تقييم Cosmos3-Edge كمرشح نشر لنموذج عالم طرفي، لا كملخص إطلاق.
- 2يجب على الفرق فصل جاهزية الأثر، وجاهزية خدمة النموذج، وجودة التنبؤ، وصلاحية الأفعال.
- 3يحتاج Cosmos3-Edge وCosmos3-Edge-Policy-DROID ومتغيرات Cosmos3-Super وآثار Nano أو Super الأقدم إلى تحقق منفصل.
- 4يجب أن تقيس اختبارات الفيديو الحي التوقيت، والتزامن، والإطارات المسقطة، وأطراف زمن الاستجابة، ورفض الإطارات القديمة.
- 5لا يثبت الفيديو المتنبأ به الواقعي سلامة فعل الروبوت أو الجدوى الفيزيائية.
- 6تتطلب الجاهزية للإنتاج الامتناع، وتجاوز الإنسان، وقابلية الرصد، والرجوع، ومراجعة الترخيص.
الخلاصة
يهم Cosmos 3 Edge لأنه يقرب نمذجة العالم شاملة الأنماط من الأنظمة الفيزيائية. وهذا بالضبط سبب وجوب رفع مستوى الأدلة. قبل الإنتاج، أثبت الأثر الدقيق، وعقد الأنماط، ومسار خدمة النموذج، ومعايرة التنبؤ، وصلاحية الأفعال، وحدود السلامة، وخطة الرجوع. انشر النظام المختبر، لا العرض التجريبي.
الأسئلة الشائعة
ما هو NVIDIA Cosmos 3 Edge؟
تصف NVIDIA نموذج Cosmos3-Edge بأنه جزء من عائلة نماذج العالم Cosmos 3 شاملة الأنماط للفهم متعدد الوسائط، ومحاكاة العالم، وتنبؤ المستقبل، واستدلال الأفعال، وتطبيقات الذكاء الاصطناعي الفيزيائي. يجب على الفرق التعامل مع هذه كادعاءات مصدر إلى أن تعيد إنتاج السلوك ذي الصلة، وتتحقق من الأثر الدقيق، وتراجع الترخيص.
كيف يختلف Cosmos3-Edge عن Cosmos3-Edge-Policy-DROID؟
يتم وضع Cosmos3-Edge حول قدرات نموذج عالم شامل الأنماط، بينما يتم وضع Cosmos3-Edge-Policy-DROID حول التعليمات اللغوية والملاحظات المرئية من منصة الروبوت DROID التي تنتج مسارات فعل روبوت. لا تنقل الاستنتاجات بين المتغيرات دون اختبار عقد الأنماط والأفعال الدقيق.
هل يمكن تقديم Cosmos 3 Edge باستخدام vLLM؟
تسرد وثائق النماذج المدعومة في vLLM نموذج Cosmos3EdgeForConditionalGeneration لـ Cosmos3-Edge، لكن يجب على الفرق التحقق من متغير النموذج الدقيق، والإصدار، والاعتماديات، واستخدام الذاكرة، ومسار الأنماط، وسلوك زمن الاستجابة قبل التعامل مع الدعم كجاهزية إنتاجية.
ما الذي يجب على الفرق اختباره قبل استخدام نموذج عالم مع فيديو حي؟
اختبر توقيت الإطارات، وتزامن الكاميرا والمستشعر، والإطارات المسقطة، وتأخير المعالجة المسبقة، والاتساق الزمني، ومعايرة تنبؤ المستقبل، وسلوك الاحتجاب، وعدم اليقين، وقابلية الرصد، ومسارات الرجوع.
هل يعني الفيديو المتنبأ به الواقعي أن فعل الروبوت آمن؟
لا. لا تثبت المعقولية البصرية الجدوى الفيزيائية، أو ديناميكيات التلامس، أو حدود المشغل، أو سلامة الاصطدام، أو تنفيذ السياسة الصحيح. يجب أن يبقى التنبؤ والتحقق من الأفعال منفصلين.
المصادر
- https://huggingface.co/nvidia/Cosmos3-Edge
- https://huggingface.co/collections/nvidia/cosmos3
- https://github.com/nvidia/cosmos
- https://research.nvidia.com/labs/cosmos-lab/cosmos3/technical-report.pdf
- https://research.nvidia.com/labs/cosmos-lab/cosmos3/
- https://huggingface.co/nvidia/Cosmos3-Edge-Policy-DROID
- https://docs.vllm.ai/en/latest/models/supported_models/
- https://arxiv.org/abs/2405.14867
- https://arxiv.org/abs/2307.15818
بقلم
Hamza Diazحمزة دياز هو مؤسس Optijara، حيث يبني وكلاء ذكاء اصطناعي عمليين، وأنظمة أتمتة، وسير عمل Copilot للشركات الخدمية. يكتب عن تشغيل الذكاء الاصطناعي، واستراتيجية الوكلاء، والتطبيق الواقعي للفرق التي تريد أنظمة مفيدة بدلًا من الضجيج.
