Ternary Bonsai 2 27B: تكافؤ WebGPU مع بيئات التشغيل الأصلية لاستدلال الذكاء الاصطناعي المحلي
يضع Ternary Bonsai 2 27B نقطة تحقق ثلاثية من فئة 27B ضمن نقاشات WebGPU في المتصفح وبيئات التشغيل الأصلية معا. يوضح هذا الدليل ما ينبغي للفرق مقارنته عبر التحميل البارد، والتحميل الدافئ، والتجميع، والتمهيد، وفك التوليد، والميزات، وسلوك الذاكرة المخبأة، وقابلية إعادة الإنتاج قبل اختيار WebGPU أو MLX أو CUDA.
لماذا يغير Ternary Bonsai 2 27B سؤال المتصفح مقابل الذكاء الاصطناعي المحلي الأصلي
Ternary Bonsai 2 27B مثير للاهتمام لأنه يظهر في أكثر من فئة من فئات بيئات التشغيل. يصف إصدار Prism ML في 17 سبتمبر نقطة تحقق ثلاثية من فئة 27B مبنية على Qwen3.8، وتنسيقا بفعالية 1.76 بت، وبصمة نموذج معلنة تبلغ 5.9GB. وتشير مجموعة Hugging Face المرتبطة إلى عناصر أصلية مثل GGUF وMLX. أما مساحة WebGPU فتضيف مسارا عبر المتصفح.
هذا المزيج يغير السؤال. لم يعد السؤال المفيد هو: "هل يستطيع هذا النموذج العمل محليا؟" بل هو: "أي أجزاء من التجربة المحلية تبقى عند الانتقال من بيئة تشغيل أصلية إلى بيئة تشغيل داخل المتصفح؟"
هذا معيار أضيق وأكثر فائدة. عرض المتصفح لا يثبت التكافؤ مع CUDA أو MLX في الإنتاجية، أو طول السياق، أو دعم الميزات، أو سلوك الذاكرة، أو التسجيل، أو قابلية التكرار. إنه يثبت أن هناك مساحة كافية من العناصر العامة لاختبار الحدود بشكل صحيح.
هذا المقال ليس إعادة لقطعة Optijara السابقة اختبار قبول Bonsai 1 على الجهاز. تناولت مقالة يوليو قبول الجيل الأول على الجهاز. يحتاج Bonsai 2 إلى عدسة تكافؤ بيئات التشغيل: التنزيل، والذاكرة المخبأة، وإعداد محول WebGPU، وتجميع برامج التظليل أو النوى، وتحميل النموذج، والتمهيد، وفك التوليد، وسلوك السياق، وحدود النص والصورة، وقابلية التكرار مقارنة بالمسارات الأصلية. بالنسبة للفرق التي تقارن سلوك الملفات المكممة عبر بيئات التشغيل، فإن دليل ترحيل تخطيط GGUF لكل موتر ووصفة التكميم هو الرفيق الأنسب.
WebGPU في المتصفح تجربة منتج قبل أن يكون قصة معيار أداء. يمكن أن يكون طريقة منخفضة الاحتكاك تتيح لصاحب مصلحة لمس نموذج محلي. ويمكنه أيضا إخفاء التفاصيل الدقيقة التي يحتاجها المقيم الجاد. عامله كبيئة تشغيل لها أنماط فشلها الخاصة، لا كغلاف أجمل حول الاستدلال الأصلي.
حاجز حماية إضافي. أرقام الأداء الأصلية من Prism، ومنشورات المجتمع، وردود الفعل السريعة على العروض مفيدة كإشارات اكتشاف. لكنها ليست أدلة معيارية قابلة للتبادل. لم تجر Optijara معيار أداء مستقلا لهذا المقال. أي اختبارات أدناه هي خطط قياس مقترحة، وليست نتائج مزعومة.
خريطة العناصر: ما الذي يمكن لكل مصدر إثباته
المهمة الأولى هي فصل الدليل عن الافتراض. يمكن لصفحة الإصدار إثبات الإعلان، وتموضع النموذج، وادعاءات الناشر. ويمكن لمجموعة Hugging Face إظهار تجميع العناصر العامة. ويمكن لبطاقات النماذج الفردية إظهار الملفات الخاصة ببيئة تشغيل معينة، والتراخيص، والمراجعات، وملاحظات الاستخدام. ويمكن لشجرة مساحة WebGPU وملف README إظهار ما يكشفه عنصر المتصفح في الكود أو الواجهة. لا يثبت أي من هذه المصادر، بمفرده، أن كل قدرة من قدرات النموذج تصل إلى المتصفح.
| عنصر المصدر | ما يمكنه إثباته | ما لا يثبته بمفرده |
|---|---|---|
| صفحة إصدار Prism ML | توقيت الإصدار، وادعاءات النموذج الرئيسية، والبصمة والأرقام الأصلية المعلنة من الناشر | أداء مستقل، أو إنتاجية المتصفح، أو الجاهزية للإنتاج |
| مجموعة Hugging Face | تجميع العناصر العامة وإدخالات النماذج المرتبطة | أن كل عنصر يملك ميزات متطابقة |
| بطاقة نموذج GGUF | توفر عنصر أصلي بنمط llama.cpp وتفاصيل الملف | سلوك المتصفح أو أداء MLX |
| بطاقة نموذج MLX 2-bit | توفر مسار أصلي على Apple Silicon | سلوك CUDA أو تكافؤ المتصفح |
| شجرة مساحة WebGPU و README | كود عنصر المتصفح، والملفات، وتلميحات الواجهة، ومسار العرض المدعوم | تكافؤ ميزات النموذج بالكامل ما لم يكن منفذا صراحة |
| وثائق Prism وعرض GitHub | إرشادات التكامل وسياق المشروع | أن تبويب متصفح معين يستطيع التعامل مع كل ادعاء على مستوى المعمارية |
| ملف PDF للورقة البيضاء | التصميم التقني وإطار التقييم المعلن | سلوك بلا خسارة في كل مهمة لاحقة |
| منشور Hugging Face عن نوى WebGPU | سياق نوى WebGPU واتجاه الاستدلال في المتصفح | نتائج معيار أداء شاملة ومحددة ل Bonsai 2 |
هذا مهم لأن بصمة أوزان 5.9GB ليست الذاكرة القصوى. وليست حجم ذاكرة المتصفح المخبأة. وليست تكلفة النقل، أو ذاكرة برامج التظليل المخبأة، أو تخصيص المخازن المؤقتة، أو بقاء التبويب تحت الضغط. قد يحتاج التنفيذ في المتصفح إلى ذاكرة عمل إضافية أثناء التنزيل، والتجميع، والتنفيذ، وإعادة ترطيب الذاكرة المخبأة. وغالبا ما تكشف بيئات التشغيل الأصلية تقارير ذاكرة أوضح، وضوابط تكميم، وسجلات.
ينطبق التحذير نفسه على ادعاءات السياق الطويل والقدرات متعددة الوسائط. إذا كانت عائلة نموذج أو معمارية تشير إلى سياق طويل أو رؤية، فهذا لا يعني أن عرض WebGPU يدعم إدخال الصور أو طول سياق عملي أقصى. حدود ذاكرة المتصفح، وسلوك محول GPU، وضغط الذاكرة المخبأة، وبناء الطلب كلها لها رأيها.
خريطة تكافؤ المتصفح مع البيئة الأصلية
تستخدم خريطة تكافؤ المتصفح مع البيئة الأصلية خمسة أبعاد: توفر العنصر، ومسار البدء، ومسار الرموز، وسطح الميزات، ونطاق التشغيل. الهدف ليس تتويج WebGPU أو MLX أو CUDA. الهدف هو التوقف عن معاملة عبارة "يعمل في المتصفح" كإجابة نعم أو لا.
| بعد التكافؤ | Browser WebGPU | Native MLX | Native CUDA أو GGUF |
|---|---|---|---|
| توفر العنصر | يعتمد على ملفات Space، وحزمة المتصفح، ومسار الجلب | يعتمد على عنصر MLX وإعداد Apple Silicon | يعتمد على ملف GGUF، وبناء بيئة التشغيل، ودعم GPU |
| مسار البدء | تنزيل، ذاكرة مخبأة، بدء المحول، تجميع برامج التظليل أو النوى، تحميل | تحميل ملف محلي، بدء بيئة MLX، تنفيذ الرسم البياني | تحميل ملف محلي، بدء خلفية CUDA أو CPU، معاملات بيئة التشغيل |
| مسار الرموز | تمهيد وفك توليد في المتصفح عبر نوى WebGPU | مسار تنفيذ أصلي على Apple Silicon | مسار تنفيذ أصلي على GPU أو CPU |
| سطح الميزات | يجب تأكيده من الواجهة والكود | غالبا أقرب إلى ادعاءات بطاقة النموذج، لكنه يبقى خاصا بالعنصر | غالبا أكثر قابلية للضبط، لكنه يبقى خاصا بالعنصر |
| نطاق التشغيل | ذاكرة المتصفح، وثبات التبويب، وسلوك الذاكرة المخبأة، وتحديثات المتصفح | إصدارات macOS وMLX، والحالة الحرارية، وضغط الذاكرة | برنامج التشغيل، وCUDA، وبناء llama.cpp، وملف التكميم، وVRAM، والحرارة |
يمكن أن يكون WebGPU كافيا لعرض توضيحي، أو مسار تعليمي، أو تقييم داخلي، أو طلب محلي خفيف عندما تكون سرعة الإعداد أهم من القياس العميق. وهو مفيد خصوصا عندما تريد الفرق أن يرى الناس مسارا لنموذج محلي دون تثبيت بيئات تشغيل أصلية.
تبقى المسارات الأصلية مهمة عندما يحتاج الفريق إلى معايير أداء قابلة للتكرار، وضوابط عتاد صريحة، وتحليلات أفضل، وأتمتة شبيهة بالخوادم، ومجموعات تقييم أطول، أو مقارنات دقيقة عبر ملفات التكميم. MLX هو المسار الطبيعي ل Apple Silicon. وCUDA وGGUF هما مسار التقييم لمحطات العمل والخوادم.
{
"framework": "Browser-to-Native Parity Map",
"dimensions": ["artifact_availability", "startup_path", "token_path", "feature_surface", "operating_envelope"],
"claim": "Parity is workload-specific and must be measured separately for browser WebGPU, MLX, and CUDA or GGUF paths.",
"benchmark_status": "proposed_test_plan_only"
}قياس البدء وتوليد الرموز بشكل منفصل
تبدأ مقارنة عادلة لبيئات تشغيل Bonsai 2 بفصل البدء عن التوليد. تنزيل الزيارة الأولى، وإعادة التحميل من الذاكرة المخبأة، وبدء محول WebGPU، وتجميع برامج التظليل، وتحميل النموذج، وزمن أول رمز، وسرعة التمهيد، وسرعة فك التوليد، وضغط الذاكرة، وثبات التبويب هي أحداث منفصلة. اجمعها في درجة واحدة مثل "بدا سريعا" وسيختفي عنق الزجاجة الحقيقي.
| حقل القياس | حقل Browser WebGPU | حقل Native MLX أو CUDA | لماذا يهم |
|---|---|---|---|
| تنزيل الزيارة الأولى | إجمالي البايتات المنقولة، ونقاط نهاية الجلب، وسلوك الانقطاع | طريقة تنزيل العنصر والمجموع الاختباري | يفصل تكلفة الشبكة عن سرعة بيئة التشغيل |
| إعادة تحميل دافئة | حالة إصابة الذاكرة المخبأة، وسلوك عامل الخدمة إن وجد | إعادة استخدام الملف المحلي | يوضح تجربة التكرار بعد التحميل الأول |
| بدء بيئة التشغيل | المتصفح، ومحول WebGPU، وبرنامج التشغيل، والأذونات | إصدار بيئة التشغيل، وبرنامج التشغيل، والتزام المكتبة | يلتقط تباين البيئة |
| التجميع | زمن تجميع برامج التظليل أو النوى | تسخين الرسم البياني أو النوى | يفسر تأخير التشغيل الأول |
| تحميل النموذج | الزمن حتى حالة الجاهزية وضغط الذاكرة | زمن التحميل والذاكرة أو VRAM | يحدد نطاق البدء العملي |
| التمهيد | رموز الطلب، وزمن أول رمز | الطلب نفسه وإعدادات السياق نفسها | الطلبات الطويلة تضغط على الانتباه والذاكرة |
| فك التوليد | رموز الإخراج في الثانية | إعدادات فك التوليد نفسها | يوضح سلوك التوليد المستقر |
| نمط الفشل | تعطل، إنهاء التبويب، متصفح غير مدعوم، جلب متوقف | نفاد الذاكرة، خطأ برنامج التشغيل، استثناء بيئة التشغيل | يساعد على تحديد حدود الطرح |
لا تقارن رقما أصليا من الناشر، وحكاية سرعة على وسائل التواصل، وانطباع عرض في المتصفح كما لو كانت معيار الأداء نفسه. قد تستخدم عتادا مختلفا، وأطوال طلب مختلفة، وإعدادات سياق مختلفة، وملفات تكميم مختلفة، وإصدارات متصفح مختلفة، وحالات تسخين مختلفة.
يجب أن يتضمن التقرير المفيد حزمة الطلبات الدقيقة، ومراجعة النموذج، والتزام بيئة التشغيل، ونظام التشغيل، ومحول GPU، وإصدار المتصفح، وملف التكميم، وطول السياق، ومعاملات فك التوليد. إذا غابت هذه التفاصيل، فقد تبقى النتيجة مثيرة للاهتمام، لكنها لا ينبغي أن تقود قرار اعتماد.
تكافؤ الميزات أكثر من إخراج النص
عادة ما يكون توليد النص أول هدف للتكافؤ لأنه مرئي وسهل الاختبار. لكن تكافؤ النص ليس تكافؤ النموذج بالكامل. يجب على الفرق أيضا فحص سلوك JSON المنظم، وإعادة استخدام السياق متعدد الأدوار، وتلخيص المستندات الطويلة، وسلوك الرفض إن كان ذا صلة، والتباين عبر عمليات تشغيل متكررة.
يحتاج دعم الرؤية إلى إثباته الخاص. إذا أشارت عائلة نموذج كاملة أو وثائق إلى قدرة متعددة الوسائط، فإن عنصر المتصفح لا يزال يحتاج إلى دليل من الواجهة والكود قبل أن يدعي أحد دعم إدخال الصور. التسميات المفيدة هي مدعوم، أو مدعوم جزئيا، أو غير مدعوم، أو غير معروف حتى يتم الاختبار.
يستحق السياق الطويل الانضباط نفسه. ادعاء على مستوى المعمارية بشأن السياق لا يعني أن تبويب متصفح يستطيع معالجة الحد الأقصى للسياق بذاكرة وزمن وثبات مقبولين. بالنسبة إلى Bonsai 2، سؤال التشغيل الأفضل ليس "ما السياق النظري؟" بل "أي أطوال طلب تبقى مستقرة ومفيدة في بيئة التشغيل هذه وعلى هذا الجهاز؟"
هذه الصياغة أقل درامية، لكنها تساعد الفرق على تجنب شحن افتراض عرض توضيحي بوصفه وعدا منتجيا.
مصفوفة عملية لاختبار الأجهزة وسير العمل
يجب على الفرق تقييم Bonsai 2 عبر الأجهزة وسير العمل، لا عبر طلب ودود واحد. المصفوفة أدناه خطة مقترحة، وليست نتيجة معيار أداء من Optijara.
| هدف بيئة التشغيل | مسار الجهاز | طلبات الاختبار | معايير النجاح |
|---|---|---|---|
| Chromium WebGPU | GPU مكتبي قادر | تعليمات قصيرة، استجابة JSON، ملخص طويل، إعادة تحميل الذاكرة المخبأة | يكتمل دون تعطل، ويسجل المحول، وإعادة تحميل دافئة مستقرة |
| متصفح على Apple Silicon | مسار متصفح Apple Silicon | تعليمات قصيرة، ملخص مستند، سياق متعدد الأدوار | زمن أول رمز مقبول لسير العمل المقصود، ولا توجد ميزة غير مدعومة بصمت |
| MLX | Apple Silicon أصلي | حزمة الطلبات نفسها، ومراجعة النموذج نفسها حيث أمكن | شكل إخراج قابل للتكرار، مع تسجيل ملاحظات بيئة التشغيل والذاكرة |
| CUDA أو GGUF | محطة عمل أو GPU خادم | حزمة الطلبات نفسها، وأطوال سياق متنوعة | إعدادات قابلة لإعادة الإنتاج، مع تسجيل VRAM والتزام بيئة التشغيل |
| رجوع CPU | حالة حدودية فقط إذا كانت موثقة | طلب صغير وسلوك الفشل | بيان واضح بأن هذا ليس مسار الأداء المفضل |
يجب أن تتضمن حزمة الطلبات تعليمة قصيرة، وملخص مستند طويل، وإخراج JSON منظم، واختبار إعادة استخدام سياق متعدد الأدوار، وفحص إدخال صورة فقط إذا كان العنصر يدعمه، وفحص إعادة تحميل الذاكرة المخبأة. سجل النجاح، أو التحذير، أو الفشل. "تحذير" مفيد عندما تعمل بيئة تشغيل مع نص قصير لكنها تفشل في السياق الطويل، أو تحتاج إلى علامة متصفح محددة، أو تتصرف بشكل مختلف بعد إعادة تحميل دافئة.
أخطاء شائعة عند اختبار الذكاء الاصطناعي المحلي في المتصفح مقابل بيئات التشغيل الأصلية
الخطأ الأول هو التعامل مع حجم التنزيل كأنه متطلب الذاكرة. بصمة الناشر حقيقة تخص عنصر النموذج، وليست نطاق بيئة التشغيل الكامل. قس الذاكرة القصوى، وحجم الذاكرة المخبأة، والمخازن المؤقتة المؤقتة، وسلوك الفشل.
الخطأ الثاني هو التعامل مع إنتاجية البيئة الأصلية كأنها إنتاجية المتصفح. لا تنتقل أرقام CUDA أو MLX الأصلية تلقائيا إلى WebGPU. قس كل بيئة تشغيل على مسارها الخاص.
الخطأ الثالث هو التعامل مع دعم العرض التوضيحي كأنه دعم كامل للنموذج. قد تكشف مساحة المتصفح توليد النص مع ترك إدخال الصور، أو السياق الكامل، أو الضوابط المتقدمة غير مدعومة. افحص الملفات، والواجهة، وسلوك الشبكة قبل تقديم ادعاءات.
الخطأ الرابع هو افتراض أن الذكاء الاصطناعي المحلي في المتصفح خاص بشكل افتراضي. لا يزال التنفيذ المحلي قد يتضمن نقاط نهاية جلب، وسلوك تخزين، وعمال خدمة، وقياسات استخدام، أو استدعاءات اعتماديات. افحص مسار الشبكة. افصل الشبكة بعد التحميل الدافئ وانظر ما الذي يبقى عاملا.
الخطأ الخامس هو استخدام طلب واحد كمعيار أداء. يمكن لتعليمة واحدة مهذبة أن تخفي مشكلات السياق، والبنية، وفك التوليد، والثبات. استخدم حزمة طلبات واحتفظ بالمدخلات الدقيقة تحت التحكم في الإصدارات.
التحفظات والمفاضلات التشغيلية
يمكن للذكاء الاصطناعي المحلي الموجه للمتصفح أولا أن يقلل احتكاك الإعداد، لكنه لا يزيل عمل التنفيذ. لا يزال الأمن والخصوصية يحتاجان إلى مراجعة كود، وفحص شبكة، ومراجعة ذاكرة مخبأة، ومراجعة اعتماديات، واختبار سلوك دون اتصال.
يتغير الأداء حسب المتصفح، وبرنامج التشغيل، ومحول GPU، وذاكرة الجهاز، والحالة الحرارية، وإيقاع تحديث بيئة التشغيل. تكون قابلية إعادة الإنتاج أصعب عندما يكون المتصفح جزءا من بيئة التشغيل. يمكن لتحديث متصفح، أو تحديث برنامج تشغيل، أو تغير في مترجم المظلات، أو إبطال الذاكرة المخبأة أن يغير التجربة.
تتطلب المسارات الأصلية إعدادا أكثر، لكنها غالبا تمنح الفرق تحكما أقوى في الإصدارات، والسجلات، والتحليل، والأتمتة. الصيانة هي التكلفة الخفية. إذا شحن فريق ذكاء اصطناعيا في المتصفح كأداة داخلية، فهناك من يملك توافق المتصفحات، وتحديثات عناصر النموذج، وإبطال الذاكرة المخبأة، وملاحظات الدعم للأجهزة غير المدعومة. وإذا شحن فريق سير عمل أصلية، فهناك من يملك تثبيت بيئة التشغيل، وبرامج التشغيل، وملفات التكميم، وقيود العتاد. لا يوجد مسار مجاني.
دليل القرار: WebGPU أو MLX أو CUDA أو مسار مختلط
اختر WebGPU في المتصفح عندما يكون الهدف عرضا منخفض الاحتكاك، أو جولة تعليمية، أو تجربة داخلية، أو مسار تقييم يستطيع فيه المستخدمون تحمل حدود ميزات صريحة. إنها تجربة أولى جيدة عندما يريد الفريق اختبار الاهتمام قبل تثبيت الحزم الأصلية.
اختر MLX عندما يكون جمهور التقييم في الغالب على Apple Silicon ويحتاج الفريق إلى تكامل أصلي، وقابلية تكرار، وتوصيف لأجهزة Apple. MLX مفيد أيضا عندما يعمل مسار المتصفح لكنه لا يكشف ما يكفي من قابلية الملاحظة لمقارنة جادة.
اختر CUDA أو GGUF عندما يحتاج الفريق إلى تقييم بنمط محطة عمل أو خادم، أو قياس أعمق، أو مقارنة تكميم، أو مجموعات طلبات أطول، أو اختبار أداء مضبوط. لهذا المسار تكلفة إعداد أكبر، لكنه عادة المسار الأقوى للقياس القابل للتكرار.
استخدم عدة بيئات تشغيل عندما سيظهر Bonsai 2 في أكثر من بيئة واحدة. يمكن لعرض المتصفح أن يساعد أصحاب المصلحة على فهم التجربة. ويمكن ل MLX دعم حواسيب مطوري Apple المحمولة. ويمكن ل CUDA أو GGUF إرساء تقييم مضبوط. هنا تكسب خريطة تكافؤ المتصفح مع البيئة الأصلية قيمتها: فهي تحول اختيار بيئة التشغيل إلى اختبار قبول موثق بدلا من نقاش حول عناوين الإطلاق.
بالنسبة للفرق التي تحتاج إلى خطة اختبار محايدة، يمكن ل Optijara المساعدة في تحديد حزمة الطلبات، ومصفوفة بيئات التشغيل، وحقول القياس، وملاحظات الاعتماد دون افتراض أن المتصفح أو MLX أو CUDA هو الإجابة الصحيحة مسبقا.
النقاط الرئيسية
- 1ينبغي تقييم Ternary Bonsai 2 27B كإصدار متعدد بيئات التشغيل، وليس فقط كإعلان نموذج.
- 2يجب قياس تكافؤ WebGPU في المتصفح عبر التنزيل، والذاكرة المخبأة، وبدء المحول، والتجميع، والتحميل، والتمهيد، وفك التوليد، والميزات، والإخفاقات.
- 3بصمة النموذج البالغة 5.9GB ليست هي نفسها ذروة ذاكرة المتصفح، أو ذاكرة القرص المخبأة، أو تكلفة النقل، أو ثبات بيئة التشغيل.
- 4لا ينبغي التعامل مع أرقام CUDA وMLX الأصلية كإنتاجية متصفح ما لم يتم قياس عبء العمل نفسه في مسار المتصفح.
- 5يتطلب إدخال الصور، والسياق الطويل، والقدرات المتقدمة الأخرى تحققا على مستوى عنصر المتصفح قبل ادعائها.
الخلاصة
تكافؤ بيئات التشغيل في Ternary Bonsai 2 27B مشكلة قياس، وليس عنوان إطلاق. يمنح الإصدار الفرق عناصر متصفح وعناصر أصلية للفحص، لكن القرار المفيد يأتي من اختبار البدء، والتمهيد، وفك التوليد، والسياق، ودعم الميزات، وسلوك الذاكرة المخبأة، وقابلية إعادة الإنتاج على الأجهزة المهمة. الفرق التي توثق هذه المفاضلات تستطيع اختيار WebGPU أو MLX أو CUDA أو مسارا مختلطا بقدر أقل من التخمين وافتراضات طرح غير مدعومة أقل.
الأسئلة الشائعة
ما هو Ternary Bonsai 2 27B؟
Ternary Bonsai 2 27B هو إصدار من Prism ML موصوف كنقطة تحقق ثلاثية من فئة 27B مبنية على Qwen3.8، مع ملاحظات إصدار عامة وعناصر Hugging Face مرتبطة لمسارات التشغيل في المتصفح والمسارات الأصلية.
هل يطابق عرض Ternary Bonsai 2 WebGPU أداء CUDA أو MLX الأصلي؟
ليس تلقائيا. يجب قياس تكافؤ المتصفح بشكل منفصل للتنزيل، والتحميل، وتجميع المظلات أو النوى، وزمن أول رمز، والتمهيد، وفك التوليد، وضغط الذاكرة، وسلوك الذاكرة المخبأة، والميزات المدعومة.
هل بصمة Bonsai 2 البالغة 5.9GB هي نفسها ذاكرة المتصفح المطلوبة؟
لا. تصف البصمة عنصر النموذج، لا نطاق بيئة التشغيل الكامل. يمكن أن تشمل ذاكرة المتصفح تكلفة النقل، والمخازن المؤقتة المؤقتة، وذاكرة المظلات المخبأة، وذاكرة النموذج المخبأة، وضغط ذاكرة التبويب.
هل تستطيع نسخة المتصفح استخدام إدخال الصور والسياق الطويل الكامل في Bonsai 2؟
فقط إذا كان عنصر المتصفح المحدد يدعم هذه الميزات. يجب على الفرق فحص واجهة مساحة WebGPU، والملفات، وسلوك الجلب، والكود قبل ادعاء دعم إدخال الصور أو دعم الحد الأقصى العملي للسياق في المتصفح.
متى ينبغي للفريق اختيار WebGPU بدلا من MLX أو CUDA لاستدلال الذكاء الاصطناعي المحلي؟
اختر WebGPU للعروض منخفضة الاحتكاك والتقييم القائم على المتصفح عندما تكون حدود الميزات مقبولة. اختر MLX لاختبار Apple Silicon الأصلي، واختر CUDA أو GGUF للقياس الأعمق، ومقارنة التكميم، والتقييم القابل للتكرار على محطات العمل أو الخوادم.
المصادر
- https://prismml.com/news/bonsai-2-27b
- https://huggingface.co/collections/prism-ml/bonsai-2
- https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf
- https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit
- https://huggingface.co/spaces/webml-community/ternary-bonsai-2-webgpu-kernels/tree/main
- https://huggingface.co/spaces/webml-community/ternary-bonsai-2-webgpu-kernels/blob/main/README.md
- https://github.com/PrismML-Eng/Bonsai-demo/
- https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-2-27b-whitepaper.pdf
- https://docs.prismml.com/get-started/introduction
- https://huggingface.co/blog/webgpu-kernels
بقلم
Hamza Diazحمزة دياز هو مؤسس Optijara، حيث يبني وكلاء ذكاء اصطناعي عمليين، وأنظمة أتمتة، وسير عمل Copilot للشركات الخدمية. يكتب عن تشغيل الذكاء الاصطناعي، واستراتيجية الوكلاء، والتطبيق الواقعي للفرق التي تريد أنظمة مفيدة بدلًا من الضجيج.
