→ العودة إلى المدونة
Open Source

Ternary Bonsai 2 27B: تكافؤ WebGPU مع بيئات التشغيل الأصلية لاستدلال الذكاء الاصطناعي المحلي

يضع Ternary Bonsai 2 27B نقطة تحقق ثلاثية من فئة 27B ضمن نقاشات WebGPU في المتصفح وبيئات التشغيل الأصلية معا. يوضح هذا الدليل ما ينبغي للفرق مقارنته عبر التحميل البارد، والتحميل الدافئ، والتجميع، والتمهيد، وفك التوليد، والميزات، وسلوك الذاكرة المخبأة، وقابلية إعادة الإنتاج قبل اختيار WebGPU أو MLX أو CUDA.

بقلم Hamza Diaz
20 سبتمبر 202610 دقيقة قراءة23 مشاهدة

لماذا يغير Ternary Bonsai 2 27B سؤال المتصفح مقابل الذكاء الاصطناعي المحلي الأصلي

Ternary Bonsai 2 27B مثير للاهتمام لأنه يظهر في أكثر من فئة من فئات بيئات التشغيل. يصف إصدار Prism ML في 17 سبتمبر نقطة تحقق ثلاثية من فئة 27B مبنية على Qwen3.8، وتنسيقا بفعالية 1.76 بت، وبصمة نموذج معلنة تبلغ 5.9GB. وتشير مجموعة Hugging Face المرتبطة إلى عناصر أصلية مثل GGUF وMLX. أما مساحة WebGPU فتضيف مسارا عبر المتصفح.

هذا المزيج يغير السؤال. لم يعد السؤال المفيد هو: "هل يستطيع هذا النموذج العمل محليا؟" بل هو: "أي أجزاء من التجربة المحلية تبقى عند الانتقال من بيئة تشغيل أصلية إلى بيئة تشغيل داخل المتصفح؟"

هذا معيار أضيق وأكثر فائدة. عرض المتصفح لا يثبت التكافؤ مع CUDA أو MLX في الإنتاجية، أو طول السياق، أو دعم الميزات، أو سلوك الذاكرة، أو التسجيل، أو قابلية التكرار. إنه يثبت أن هناك مساحة كافية من العناصر العامة لاختبار الحدود بشكل صحيح.

هذا المقال ليس إعادة لقطعة Optijara السابقة اختبار قبول Bonsai 1 على الجهاز. تناولت مقالة يوليو قبول الجيل الأول على الجهاز. يحتاج Bonsai 2 إلى عدسة تكافؤ بيئات التشغيل: التنزيل، والذاكرة المخبأة، وإعداد محول WebGPU، وتجميع برامج التظليل أو النوى، وتحميل النموذج، والتمهيد، وفك التوليد، وسلوك السياق، وحدود النص والصورة، وقابلية التكرار مقارنة بالمسارات الأصلية. بالنسبة للفرق التي تقارن سلوك الملفات المكممة عبر بيئات التشغيل، فإن دليل ترحيل تخطيط GGUF لكل موتر ووصفة التكميم هو الرفيق الأنسب.

WebGPU في المتصفح تجربة منتج قبل أن يكون قصة معيار أداء. يمكن أن يكون طريقة منخفضة الاحتكاك تتيح لصاحب مصلحة لمس نموذج محلي. ويمكنه أيضا إخفاء التفاصيل الدقيقة التي يحتاجها المقيم الجاد. عامله كبيئة تشغيل لها أنماط فشلها الخاصة، لا كغلاف أجمل حول الاستدلال الأصلي.

حاجز حماية إضافي. أرقام الأداء الأصلية من Prism، ومنشورات المجتمع، وردود الفعل السريعة على العروض مفيدة كإشارات اكتشاف. لكنها ليست أدلة معيارية قابلة للتبادل. لم تجر Optijara معيار أداء مستقلا لهذا المقال. أي اختبارات أدناه هي خطط قياس مقترحة، وليست نتائج مزعومة.

خريطة العناصر: ما الذي يمكن لكل مصدر إثباته

المهمة الأولى هي فصل الدليل عن الافتراض. يمكن لصفحة الإصدار إثبات الإعلان، وتموضع النموذج، وادعاءات الناشر. ويمكن لمجموعة Hugging Face إظهار تجميع العناصر العامة. ويمكن لبطاقات النماذج الفردية إظهار الملفات الخاصة ببيئة تشغيل معينة، والتراخيص، والمراجعات، وملاحظات الاستخدام. ويمكن لشجرة مساحة WebGPU وملف README إظهار ما يكشفه عنصر المتصفح في الكود أو الواجهة. لا يثبت أي من هذه المصادر، بمفرده، أن كل قدرة من قدرات النموذج تصل إلى المتصفح.

عنصر المصدرما يمكنه إثباتهما لا يثبته بمفرده
صفحة إصدار Prism MLتوقيت الإصدار، وادعاءات النموذج الرئيسية، والبصمة والأرقام الأصلية المعلنة من الناشرأداء مستقل، أو إنتاجية المتصفح، أو الجاهزية للإنتاج
مجموعة Hugging Faceتجميع العناصر العامة وإدخالات النماذج المرتبطةأن كل عنصر يملك ميزات متطابقة
بطاقة نموذج GGUFتوفر عنصر أصلي بنمط llama.cpp وتفاصيل الملفسلوك المتصفح أو أداء MLX
بطاقة نموذج MLX 2-bitتوفر مسار أصلي على Apple Siliconسلوك CUDA أو تكافؤ المتصفح
شجرة مساحة WebGPU و READMEكود عنصر المتصفح، والملفات، وتلميحات الواجهة، ومسار العرض المدعومتكافؤ ميزات النموذج بالكامل ما لم يكن منفذا صراحة
وثائق Prism وعرض GitHubإرشادات التكامل وسياق المشروعأن تبويب متصفح معين يستطيع التعامل مع كل ادعاء على مستوى المعمارية
ملف PDF للورقة البيضاءالتصميم التقني وإطار التقييم المعلنسلوك بلا خسارة في كل مهمة لاحقة
منشور Hugging Face عن نوى WebGPUسياق نوى WebGPU واتجاه الاستدلال في المتصفحنتائج معيار أداء شاملة ومحددة ل Bonsai 2

هذا مهم لأن بصمة أوزان 5.9GB ليست الذاكرة القصوى. وليست حجم ذاكرة المتصفح المخبأة. وليست تكلفة النقل، أو ذاكرة برامج التظليل المخبأة، أو تخصيص المخازن المؤقتة، أو بقاء التبويب تحت الضغط. قد يحتاج التنفيذ في المتصفح إلى ذاكرة عمل إضافية أثناء التنزيل، والتجميع، والتنفيذ، وإعادة ترطيب الذاكرة المخبأة. وغالبا ما تكشف بيئات التشغيل الأصلية تقارير ذاكرة أوضح، وضوابط تكميم، وسجلات.

ينطبق التحذير نفسه على ادعاءات السياق الطويل والقدرات متعددة الوسائط. إذا كانت عائلة نموذج أو معمارية تشير إلى سياق طويل أو رؤية، فهذا لا يعني أن عرض WebGPU يدعم إدخال الصور أو طول سياق عملي أقصى. حدود ذاكرة المتصفح، وسلوك محول GPU، وضغط الذاكرة المخبأة، وبناء الطلب كلها لها رأيها.

خريطة تكافؤ المتصفح مع البيئة الأصلية

تستخدم خريطة تكافؤ المتصفح مع البيئة الأصلية خمسة أبعاد: توفر العنصر، ومسار البدء، ومسار الرموز، وسطح الميزات، ونطاق التشغيل. الهدف ليس تتويج WebGPU أو MLX أو CUDA. الهدف هو التوقف عن معاملة عبارة "يعمل في المتصفح" كإجابة نعم أو لا.

بعد التكافؤBrowser WebGPUNative MLXNative CUDA أو GGUF
توفر العنصريعتمد على ملفات Space، وحزمة المتصفح، ومسار الجلبيعتمد على عنصر MLX وإعداد Apple Siliconيعتمد على ملف GGUF، وبناء بيئة التشغيل، ودعم GPU
مسار البدءتنزيل، ذاكرة مخبأة، بدء المحول، تجميع برامج التظليل أو النوى، تحميلتحميل ملف محلي، بدء بيئة MLX، تنفيذ الرسم البيانيتحميل ملف محلي، بدء خلفية CUDA أو CPU، معاملات بيئة التشغيل
مسار الرموزتمهيد وفك توليد في المتصفح عبر نوى WebGPUمسار تنفيذ أصلي على Apple Siliconمسار تنفيذ أصلي على GPU أو CPU
سطح الميزاتيجب تأكيده من الواجهة والكودغالبا أقرب إلى ادعاءات بطاقة النموذج، لكنه يبقى خاصا بالعنصرغالبا أكثر قابلية للضبط، لكنه يبقى خاصا بالعنصر
نطاق التشغيلذاكرة المتصفح، وثبات التبويب، وسلوك الذاكرة المخبأة، وتحديثات المتصفحإصدارات macOS وMLX، والحالة الحرارية، وضغط الذاكرةبرنامج التشغيل، وCUDA، وبناء llama.cpp، وملف التكميم، وVRAM، والحرارة

يمكن أن يكون WebGPU كافيا لعرض توضيحي، أو مسار تعليمي، أو تقييم داخلي، أو طلب محلي خفيف عندما تكون سرعة الإعداد أهم من القياس العميق. وهو مفيد خصوصا عندما تريد الفرق أن يرى الناس مسارا لنموذج محلي دون تثبيت بيئات تشغيل أصلية.

تبقى المسارات الأصلية مهمة عندما يحتاج الفريق إلى معايير أداء قابلة للتكرار، وضوابط عتاد صريحة، وتحليلات أفضل، وأتمتة شبيهة بالخوادم، ومجموعات تقييم أطول، أو مقارنات دقيقة عبر ملفات التكميم. MLX هو المسار الطبيعي ل Apple Silicon. وCUDA وGGUF هما مسار التقييم لمحطات العمل والخوادم.

flowchart LR A[اختيار عنصر Bonsai 2] --> B{مسار بيئة التشغيل} B --> C[Browser WebGPU] B --> D[Native MLX] B --> E[Native CUDA أو GGUF] C --> F[تنزيل وذاكرة مخبأة] C --> G[بدء المحول وتجميع برامج التظليل] D --> H[تحميل عنصر محلي] E --> H F --> I[اختبار التمهيد] G --> I H --> I I --> J[اختبار فك التوليد] J --> K[التحقق من الميزات] K --> L[قرار التكافؤ حسب عبء العمل]
{
  "framework": "Browser-to-Native Parity Map",
  "dimensions": ["artifact_availability", "startup_path", "token_path", "feature_surface", "operating_envelope"],
  "claim": "Parity is workload-specific and must be measured separately for browser WebGPU, MLX, and CUDA or GGUF paths.",
  "benchmark_status": "proposed_test_plan_only"
}

قياس البدء وتوليد الرموز بشكل منفصل

تبدأ مقارنة عادلة لبيئات تشغيل Bonsai 2 بفصل البدء عن التوليد. تنزيل الزيارة الأولى، وإعادة التحميل من الذاكرة المخبأة، وبدء محول WebGPU، وتجميع برامج التظليل، وتحميل النموذج، وزمن أول رمز، وسرعة التمهيد، وسرعة فك التوليد، وضغط الذاكرة، وثبات التبويب هي أحداث منفصلة. اجمعها في درجة واحدة مثل "بدا سريعا" وسيختفي عنق الزجاجة الحقيقي.

حقل القياسحقل Browser WebGPUحقل Native MLX أو CUDAلماذا يهم
تنزيل الزيارة الأولىإجمالي البايتات المنقولة، ونقاط نهاية الجلب، وسلوك الانقطاعطريقة تنزيل العنصر والمجموع الاختبارييفصل تكلفة الشبكة عن سرعة بيئة التشغيل
إعادة تحميل دافئةحالة إصابة الذاكرة المخبأة، وسلوك عامل الخدمة إن وجدإعادة استخدام الملف المحلييوضح تجربة التكرار بعد التحميل الأول
بدء بيئة التشغيلالمتصفح، ومحول WebGPU، وبرنامج التشغيل، والأذوناتإصدار بيئة التشغيل، وبرنامج التشغيل، والتزام المكتبةيلتقط تباين البيئة
التجميعزمن تجميع برامج التظليل أو النوىتسخين الرسم البياني أو النوىيفسر تأخير التشغيل الأول
تحميل النموذجالزمن حتى حالة الجاهزية وضغط الذاكرةزمن التحميل والذاكرة أو VRAMيحدد نطاق البدء العملي
التمهيدرموز الطلب، وزمن أول رمزالطلب نفسه وإعدادات السياق نفسهاالطلبات الطويلة تضغط على الانتباه والذاكرة
فك التوليدرموز الإخراج في الثانيةإعدادات فك التوليد نفسهايوضح سلوك التوليد المستقر
نمط الفشلتعطل، إنهاء التبويب، متصفح غير مدعوم، جلب متوقفنفاد الذاكرة، خطأ برنامج التشغيل، استثناء بيئة التشغيليساعد على تحديد حدود الطرح

لا تقارن رقما أصليا من الناشر، وحكاية سرعة على وسائل التواصل، وانطباع عرض في المتصفح كما لو كانت معيار الأداء نفسه. قد تستخدم عتادا مختلفا، وأطوال طلب مختلفة، وإعدادات سياق مختلفة، وملفات تكميم مختلفة، وإصدارات متصفح مختلفة، وحالات تسخين مختلفة.

يجب أن يتضمن التقرير المفيد حزمة الطلبات الدقيقة، ومراجعة النموذج، والتزام بيئة التشغيل، ونظام التشغيل، ومحول GPU، وإصدار المتصفح، وملف التكميم، وطول السياق، ومعاملات فك التوليد. إذا غابت هذه التفاصيل، فقد تبقى النتيجة مثيرة للاهتمام، لكنها لا ينبغي أن تقود قرار اعتماد.

تكافؤ الميزات أكثر من إخراج النص

عادة ما يكون توليد النص أول هدف للتكافؤ لأنه مرئي وسهل الاختبار. لكن تكافؤ النص ليس تكافؤ النموذج بالكامل. يجب على الفرق أيضا فحص سلوك JSON المنظم، وإعادة استخدام السياق متعدد الأدوار، وتلخيص المستندات الطويلة، وسلوك الرفض إن كان ذا صلة، والتباين عبر عمليات تشغيل متكررة.

يحتاج دعم الرؤية إلى إثباته الخاص. إذا أشارت عائلة نموذج كاملة أو وثائق إلى قدرة متعددة الوسائط، فإن عنصر المتصفح لا يزال يحتاج إلى دليل من الواجهة والكود قبل أن يدعي أحد دعم إدخال الصور. التسميات المفيدة هي مدعوم، أو مدعوم جزئيا، أو غير مدعوم، أو غير معروف حتى يتم الاختبار.

يستحق السياق الطويل الانضباط نفسه. ادعاء على مستوى المعمارية بشأن السياق لا يعني أن تبويب متصفح يستطيع معالجة الحد الأقصى للسياق بذاكرة وزمن وثبات مقبولين. بالنسبة إلى Bonsai 2، سؤال التشغيل الأفضل ليس "ما السياق النظري؟" بل "أي أطوال طلب تبقى مستقرة ومفيدة في بيئة التشغيل هذه وعلى هذا الجهاز؟"

هذه الصياغة أقل درامية، لكنها تساعد الفرق على تجنب شحن افتراض عرض توضيحي بوصفه وعدا منتجيا.

مصفوفة عملية لاختبار الأجهزة وسير العمل

يجب على الفرق تقييم Bonsai 2 عبر الأجهزة وسير العمل، لا عبر طلب ودود واحد. المصفوفة أدناه خطة مقترحة، وليست نتيجة معيار أداء من Optijara.

هدف بيئة التشغيلمسار الجهازطلبات الاختبارمعايير النجاح
Chromium WebGPUGPU مكتبي قادرتعليمات قصيرة، استجابة JSON، ملخص طويل، إعادة تحميل الذاكرة المخبأةيكتمل دون تعطل، ويسجل المحول، وإعادة تحميل دافئة مستقرة
متصفح على Apple Siliconمسار متصفح Apple Siliconتعليمات قصيرة، ملخص مستند، سياق متعدد الأدوارزمن أول رمز مقبول لسير العمل المقصود، ولا توجد ميزة غير مدعومة بصمت
MLXApple Silicon أصليحزمة الطلبات نفسها، ومراجعة النموذج نفسها حيث أمكنشكل إخراج قابل للتكرار، مع تسجيل ملاحظات بيئة التشغيل والذاكرة
CUDA أو GGUFمحطة عمل أو GPU خادمحزمة الطلبات نفسها، وأطوال سياق متنوعةإعدادات قابلة لإعادة الإنتاج، مع تسجيل VRAM والتزام بيئة التشغيل
رجوع CPUحالة حدودية فقط إذا كانت موثقةطلب صغير وسلوك الفشلبيان واضح بأن هذا ليس مسار الأداء المفضل

يجب أن تتضمن حزمة الطلبات تعليمة قصيرة، وملخص مستند طويل، وإخراج JSON منظم، واختبار إعادة استخدام سياق متعدد الأدوار، وفحص إدخال صورة فقط إذا كان العنصر يدعمه، وفحص إعادة تحميل الذاكرة المخبأة. سجل النجاح، أو التحذير، أو الفشل. "تحذير" مفيد عندما تعمل بيئة تشغيل مع نص قصير لكنها تفشل في السياق الطويل، أو تحتاج إلى علامة متصفح محددة، أو تتصرف بشكل مختلف بعد إعادة تحميل دافئة.

أخطاء شائعة عند اختبار الذكاء الاصطناعي المحلي في المتصفح مقابل بيئات التشغيل الأصلية

الخطأ الأول هو التعامل مع حجم التنزيل كأنه متطلب الذاكرة. بصمة الناشر حقيقة تخص عنصر النموذج، وليست نطاق بيئة التشغيل الكامل. قس الذاكرة القصوى، وحجم الذاكرة المخبأة، والمخازن المؤقتة المؤقتة، وسلوك الفشل.

الخطأ الثاني هو التعامل مع إنتاجية البيئة الأصلية كأنها إنتاجية المتصفح. لا تنتقل أرقام CUDA أو MLX الأصلية تلقائيا إلى WebGPU. قس كل بيئة تشغيل على مسارها الخاص.

الخطأ الثالث هو التعامل مع دعم العرض التوضيحي كأنه دعم كامل للنموذج. قد تكشف مساحة المتصفح توليد النص مع ترك إدخال الصور، أو السياق الكامل، أو الضوابط المتقدمة غير مدعومة. افحص الملفات، والواجهة، وسلوك الشبكة قبل تقديم ادعاءات.

الخطأ الرابع هو افتراض أن الذكاء الاصطناعي المحلي في المتصفح خاص بشكل افتراضي. لا يزال التنفيذ المحلي قد يتضمن نقاط نهاية جلب، وسلوك تخزين، وعمال خدمة، وقياسات استخدام، أو استدعاءات اعتماديات. افحص مسار الشبكة. افصل الشبكة بعد التحميل الدافئ وانظر ما الذي يبقى عاملا.

الخطأ الخامس هو استخدام طلب واحد كمعيار أداء. يمكن لتعليمة واحدة مهذبة أن تخفي مشكلات السياق، والبنية، وفك التوليد، والثبات. استخدم حزمة طلبات واحتفظ بالمدخلات الدقيقة تحت التحكم في الإصدارات.

التحفظات والمفاضلات التشغيلية

يمكن للذكاء الاصطناعي المحلي الموجه للمتصفح أولا أن يقلل احتكاك الإعداد، لكنه لا يزيل عمل التنفيذ. لا يزال الأمن والخصوصية يحتاجان إلى مراجعة كود، وفحص شبكة، ومراجعة ذاكرة مخبأة، ومراجعة اعتماديات، واختبار سلوك دون اتصال.

يتغير الأداء حسب المتصفح، وبرنامج التشغيل، ومحول GPU، وذاكرة الجهاز، والحالة الحرارية، وإيقاع تحديث بيئة التشغيل. تكون قابلية إعادة الإنتاج أصعب عندما يكون المتصفح جزءا من بيئة التشغيل. يمكن لتحديث متصفح، أو تحديث برنامج تشغيل، أو تغير في مترجم المظلات، أو إبطال الذاكرة المخبأة أن يغير التجربة.

تتطلب المسارات الأصلية إعدادا أكثر، لكنها غالبا تمنح الفرق تحكما أقوى في الإصدارات، والسجلات، والتحليل، والأتمتة. الصيانة هي التكلفة الخفية. إذا شحن فريق ذكاء اصطناعيا في المتصفح كأداة داخلية، فهناك من يملك توافق المتصفحات، وتحديثات عناصر النموذج، وإبطال الذاكرة المخبأة، وملاحظات الدعم للأجهزة غير المدعومة. وإذا شحن فريق سير عمل أصلية، فهناك من يملك تثبيت بيئة التشغيل، وبرامج التشغيل، وملفات التكميم، وقيود العتاد. لا يوجد مسار مجاني.

دليل القرار: WebGPU أو MLX أو CUDA أو مسار مختلط

اختر WebGPU في المتصفح عندما يكون الهدف عرضا منخفض الاحتكاك، أو جولة تعليمية، أو تجربة داخلية، أو مسار تقييم يستطيع فيه المستخدمون تحمل حدود ميزات صريحة. إنها تجربة أولى جيدة عندما يريد الفريق اختبار الاهتمام قبل تثبيت الحزم الأصلية.

اختر MLX عندما يكون جمهور التقييم في الغالب على Apple Silicon ويحتاج الفريق إلى تكامل أصلي، وقابلية تكرار، وتوصيف لأجهزة Apple. MLX مفيد أيضا عندما يعمل مسار المتصفح لكنه لا يكشف ما يكفي من قابلية الملاحظة لمقارنة جادة.

اختر CUDA أو GGUF عندما يحتاج الفريق إلى تقييم بنمط محطة عمل أو خادم، أو قياس أعمق، أو مقارنة تكميم، أو مجموعات طلبات أطول، أو اختبار أداء مضبوط. لهذا المسار تكلفة إعداد أكبر، لكنه عادة المسار الأقوى للقياس القابل للتكرار.

استخدم عدة بيئات تشغيل عندما سيظهر Bonsai 2 في أكثر من بيئة واحدة. يمكن لعرض المتصفح أن يساعد أصحاب المصلحة على فهم التجربة. ويمكن ل MLX دعم حواسيب مطوري Apple المحمولة. ويمكن ل CUDA أو GGUF إرساء تقييم مضبوط. هنا تكسب خريطة تكافؤ المتصفح مع البيئة الأصلية قيمتها: فهي تحول اختيار بيئة التشغيل إلى اختبار قبول موثق بدلا من نقاش حول عناوين الإطلاق.

بالنسبة للفرق التي تحتاج إلى خطة اختبار محايدة، يمكن ل Optijara المساعدة في تحديد حزمة الطلبات، ومصفوفة بيئات التشغيل، وحقول القياس، وملاحظات الاعتماد دون افتراض أن المتصفح أو MLX أو CUDA هو الإجابة الصحيحة مسبقا.

النقاط الرئيسية

  • 1ينبغي تقييم Ternary Bonsai 2 27B كإصدار متعدد بيئات التشغيل، وليس فقط كإعلان نموذج.
  • 2يجب قياس تكافؤ WebGPU في المتصفح عبر التنزيل، والذاكرة المخبأة، وبدء المحول، والتجميع، والتحميل، والتمهيد، وفك التوليد، والميزات، والإخفاقات.
  • 3بصمة النموذج البالغة 5.9GB ليست هي نفسها ذروة ذاكرة المتصفح، أو ذاكرة القرص المخبأة، أو تكلفة النقل، أو ثبات بيئة التشغيل.
  • 4لا ينبغي التعامل مع أرقام CUDA وMLX الأصلية كإنتاجية متصفح ما لم يتم قياس عبء العمل نفسه في مسار المتصفح.
  • 5يتطلب إدخال الصور، والسياق الطويل، والقدرات المتقدمة الأخرى تحققا على مستوى عنصر المتصفح قبل ادعائها.

الخلاصة

تكافؤ بيئات التشغيل في Ternary Bonsai 2 27B مشكلة قياس، وليس عنوان إطلاق. يمنح الإصدار الفرق عناصر متصفح وعناصر أصلية للفحص، لكن القرار المفيد يأتي من اختبار البدء، والتمهيد، وفك التوليد، والسياق، ودعم الميزات، وسلوك الذاكرة المخبأة، وقابلية إعادة الإنتاج على الأجهزة المهمة. الفرق التي توثق هذه المفاضلات تستطيع اختيار WebGPU أو MLX أو CUDA أو مسارا مختلطا بقدر أقل من التخمين وافتراضات طرح غير مدعومة أقل.

الأسئلة الشائعة

ما هو Ternary Bonsai 2 27B؟

Ternary Bonsai 2 27B هو إصدار من Prism ML موصوف كنقطة تحقق ثلاثية من فئة 27B مبنية على Qwen3.8، مع ملاحظات إصدار عامة وعناصر Hugging Face مرتبطة لمسارات التشغيل في المتصفح والمسارات الأصلية.

هل يطابق عرض Ternary Bonsai 2 WebGPU أداء CUDA أو MLX الأصلي؟

ليس تلقائيا. يجب قياس تكافؤ المتصفح بشكل منفصل للتنزيل، والتحميل، وتجميع المظلات أو النوى، وزمن أول رمز، والتمهيد، وفك التوليد، وضغط الذاكرة، وسلوك الذاكرة المخبأة، والميزات المدعومة.

هل بصمة Bonsai 2 البالغة 5.9GB هي نفسها ذاكرة المتصفح المطلوبة؟

لا. تصف البصمة عنصر النموذج، لا نطاق بيئة التشغيل الكامل. يمكن أن تشمل ذاكرة المتصفح تكلفة النقل، والمخازن المؤقتة المؤقتة، وذاكرة المظلات المخبأة، وذاكرة النموذج المخبأة، وضغط ذاكرة التبويب.

هل تستطيع نسخة المتصفح استخدام إدخال الصور والسياق الطويل الكامل في Bonsai 2؟

فقط إذا كان عنصر المتصفح المحدد يدعم هذه الميزات. يجب على الفرق فحص واجهة مساحة WebGPU، والملفات، وسلوك الجلب، والكود قبل ادعاء دعم إدخال الصور أو دعم الحد الأقصى العملي للسياق في المتصفح.

متى ينبغي للفريق اختيار WebGPU بدلا من MLX أو CUDA لاستدلال الذكاء الاصطناعي المحلي؟

اختر WebGPU للعروض منخفضة الاحتكاك والتقييم القائم على المتصفح عندما تكون حدود الميزات مقبولة. اختر MLX لاختبار Apple Silicon الأصلي، واختر CUDA أو GGUF للقياس الأعمق، ومقارنة التكميم، والتقييم القابل للتكرار على محطات العمل أو الخوادم.

المصادر

شارك هذا المقال

Hamza Diaz

بقلم

Hamza Diaz

حمزة دياز هو مؤسس Optijara، حيث يبني وكلاء ذكاء اصطناعي عمليين، وأنظمة أتمتة، وسير عمل Copilot للشركات الخدمية. يكتب عن تشغيل الذكاء الاصطناعي، واستراتيجية الوكلاء، والتطبيق الواقعي للفرق التي تريد أنظمة مفيدة بدلًا من الضجيج.