→ العودة إلى المدونة
Cloud & Infrastructure

درجات القياس تحتاج إلى بروتوكولات: كيف تجعل Evaluation Cards و Every Eval Ever نتائج الذكاء الاصطناعي قابلة للمقارنة

يشير إصدار UK AISI و EvalEval في 22 سبتمبر إلى طريقة أكثر فائدة لقراءة مقاييس الذكاء الاصطناعي: اربط الدرجة بالبروتوكول قبل مقارنة النماذج. يشرح هذا الدليل كيف يمكن أن تدعم Evaluation Cards و Every Eval Ever وسجلات التوسع الاستدلالي العامة مقارنة قابلة للتتبع من دون الادعاء بأن التحقق من المخطط يجعل التجارب متكافئة.

بقلم Hamza Diaz
23 سبتمبر 202610 دقيقة قراءة14 مشاهدة

لماذا تكون درجة القياس من دون بروتوكول مجرد عنوان فقط

تبدو درجة القياس مرتبة إلى أن تسأل كيف أُنتجت. يمكن أن تظهر نتيجتان لنموذجين جنبا إلى جنب في لوحة ترتيب بينما تستخدمان سياسات محاولات مختلفة، أو شروط تغذية راجعة مختلفة، أو ميزانيات رموز مختلفة، أو مقيمين مختلفين، أو لقطات نموذج مختلفة، أو مجموعات عينات مختلفة. عند تلك النقطة لا تكون المقارنة نموذجا مقابل نموذج. بل تكون إعدادا تجريبيا مقابل آخر، مضغوطا في رقم يبدو أكثر حسما مما هو عليه.

لهذا تستحق Evaluation Cards و Every Eval Ever الانتباه. فهي تدفع قابلية إعادة إنتاج مقاييس الذكاء الاصطناعي نحو سجلات قابلة للفحص بدلا من خلايا لوحات الترتيب. إصدار UK AISI و EvalEval في 22 سبتمبر مفيد لهذا السبب. فهو يربط Evaluation Cards و Every Eval Ever والسجلات العامة حول تجارب التوسع الاستدلالي. لا ينبغي أن يكون العنوان أي نموذج يبدو أعلى ترتيبا. السؤال الأفضل هو ما إذا كان يمكن ربط الدرجة بالبروتوكول والميزانية والمقياس وتغطية العينات والمصدر.

هناك ملاحظة زمنية أيضا. ظهرت الورقة الأساسية في وقت سابق، لذلك لا ينبغي وصف الحزمة العامة بأنها أُنشئت حديثا في يوم الإعلان. من الأفضل فهم 22 سبتمبر على أنه محطة في الإبلاغ وقابلية التشغيل البيني. فهو يمنح الفرق مسارا أوضح من الدرجة إلى السجل، لكنه لا يزيل عمل التحقق مما قيس، وكيف قيس، وأي أجزاء من السجل غائبة أو مشروطة.

رأيي: يجب التعامل مع سجلات القياس كبنية تحتية، لا كمادة للتعليق. يمكن لطبقة سجلات مفيدة أن تدعم مسارات التقييم، وقرارات توجيه النماذج، ومراجعات الشراء. أما الدرجة المجردة فتفعل العكس. فهي تخفي فروق البروتوكول التي تحدد عادة ما إذا كانت النتيجة تنطبق على عبء عملك.

ما الذي يربطه الإصدار: Evaluation Cards و Every Eval Ever وسجلات AISI

Evaluation Cards هي ملخصات منظمة لنتائج القياس. تجعل النتائج أسهل للفحص من خلال إبراز البيانات الوصفية وسياق البروتوكول حيثما يوجد ذلك السياق. هذا لا يعني أن كل مقارنة عادلة. يمكن للبطاقة أن تصف نتيجة بوضوح بينما تظل التشغيلات الأساسية مختلفة في تغطية العينات، أو الوصول إلى التغذية الراجعة، أو سياسة المحاولات، أو تفاصيل التصحيح.

Every Eval Ever هي طبقة التبادل حول تلك السجلات. يوفر المشروع مخططات وأدوات لسجلات التقييم الإجمالية وسجلات اختيارية على مستوى المثال. الانضباط في الإصدارات مهم هنا. عرضت صفحة المشروع العامة أمثلة أقدم، بينما يشير README في GitHub الآن إلى v0.3.0 وملفات عينات تستخدم اصطلاح *_samples.jsonl. يجب على الفرق تثبيت مراجعة المستودع، وإصدار المخطط، ولقطة المصدر التي تستخدمها. خلط أمثلة الموقع مع أدوات تحقق أحدث طريقة هادئة لصنع ارتباك يمكن تجنبه.

تجيب السجلات الإجمالية وسجلات العينات عن أسئلة مختلفة. تخبرك الصفوف الإجمالية بالنتيجة التي أُبلغ عنها، والإعداد الذي كان مرئيا، وحقول المصدر التي جاءت معها. ويمكن أن تخبرك صفوف الأمثلة بالعينات التي جرت محاولة حلها، وما الدليل المتاح، وما إذا كان يمكن التحقق من إجمالي مقابل سجل أكثر تفصيلا. لكن السجلات على مستوى العينة قد تكون اختيارية، أو غير مكتملة، أو مقيدة، أو غائبة لأسباب مشروعة. البنية العامة ليست هي نفسها أرشيفا عالميا للنصوص الكاملة.

حزمة AISI جزء آخر من سلسلة الأدلة. فهي توفر بيانات تجارب عامة حول عمل التوسع الاستدلالي، بما في ذلك السجلات والمواد المرتبطة. لم تعد Optijara تشغيل تلك المقاييس، ولم تتحقق من مخزن البيانات كاملا، ولم تنفذ استدلالا على تلك السجلات. التصرف المسؤول أضيق: فحص السجل العام، وإبقاء التحفظات ظاهرة، وتجنب تحويل مصطلحات الناشر مثل verified إلى ادعاءات بتكرار مستقل.

بالنسبة إلى الفرق التي تفكر بالفعل في حساب الرموز وانحراف المقام، فهذا قريب من الانضباط التشغيلي نفسه الذي نغطيه في دليلنا حول Hugging Face Tokenizers v1 and same-ID migration. وبالنسبة إلى سير عمل أدلة زمن الاستجابة، يتصل انضباط السجلات نفسه أيضا بتحليلنا لـ OpenVINO GenAI encode and decode timing، حيث تؤثر حدود القياس في كيفية تفسير الأنظمة اللاحقة للنتائج.

Score-to-Protocol Join: إطار عملي لمقارنة نتائج القياس

قاعدة Score-to-Protocol Join في Optijara بسيطة: لا تقارن درجات القياس حتى ترتبط الدرجة بحقول البروتوكول التي تمنحها معناها. لا يحتاج الربط إلى جعل كل سجل كاملا. بل يحتاج إلى جعل عدم اليقين مرئيا.

حقل المقارنةلماذا يغير التفسيرأين تبحث في السجلاتماذا تضع كغير معروف إذا كان مفقودا
النموذج والإصداريمكن لاسم العائلة أن يخفي لقطات أو محركات أو سلوك مزود مختلفاالبيانات الوصفية الإجمالية، حقل النموذج، ملاحظات المزودإصدار النموذج الدقيق أو محرك التقديم
القياس ومجموعة المهام الفرعيةقد يتضمن اسم القياس عدة مجموعات أو مجموعات فرعية مفلترةحقل القياس، حقل المهمة، سجلات العيناتأي عينات أُدرجت أو استُبعدت
المقياس والمقيمالدقة، والمهام التراكمية المحلولة، ومقاييس نمط النجاح تجيب عن أسئلة مختلفةالمقياس، المقيم، ملاحظات التصحيحقاعدة التصحيح أو إعدادات الحكم
ميزانية الرموز أو الحوسبةالحد نفسه لا يضمن التكلفة نفسها أو زمن الاستجابة نفسه أو مسار الاستدلال نفسهحقول الميزانية، ملاحظات البروتوكول، السجلاتالمجزئ، التسعير، وقت التشغيل، أو سياسة السياق
سياسة المحاولاتيمكن أن تغير المحاولات المتعددة النجاح المرصود مقارنة بالإبلاغ من محاولة واحدةعدد المحاولات، حقول الحقبة، سياسة التشغيلما إذا كانت إعادة المحاولة أو العينات المتكررة مسموحة
التغذية الراجعة والضغطتغذية oracle الراجعة وضغط السياق يغيران الشرط التجريبيحقول الشرط، بروتوكول الورقة، ملاحظات الحزمةما إذا كانت التغذية الراجعة أو الضغط نشطا
المزود والمحرك والتاريخيمكن أن تؤثر تغييرات التقديم في المخرجات وزمن الاستجابة مع الوقتبيانات المزود الوصفية، الطوابع الزمنية، مراجعة المصدرإصدار المحرك أو طابع وقت التقييم
تغطية العيناتيمكن أن تبقى الصفوف الإجمالية بعد تغيرات في توفر العيناتسجلات الأمثلة، البيانات التعريفية، فحوصات العدداكتمال التطابق بين الإجمالي والعينة

هذا الإطار مفيد خصوصا لمنحنيات الحوسبة الاستدلالية. قد يعرض المنحنى أول نجاح مرصود أو المهام التراكمية المحلولة مع تغير الميزانية. هذا ليس هو نفسه خلية pass@1 لمحاولة واحدة. كما أنه لا يترجم بسلاسة إلى دولارات أو زمن استجابة، لأن المجزئات ونوافذ السياق ومحركات المزود والتسعير والتوازي والمحاولات قد تختلف.

استخدم أسماء نماذج مثل Claude Opus أو إصدارات GPT كأمثلة على آليات المقارنة، لا كالقصة الرئيسية. السؤال العملي هو ما إذا كانت النتائج على مقاييس مثل HLE أو FrontierMath أو HealthBench قيسَت بمجموعات مهام فرعية ومقاييس وميزانيات رموز وشروط تغذية راجعة وتغطية عينات متوافقة. إذا كان مفتاح الربط غائبا، فاتركه غير معروف. لا تستنتج التكافؤ لأن صفين يعيشان في مجموعة البيانات نفسها.

ينطبق انضباط المقام نفسه على عمل وقت التشغيل. تطرح مقالتنا عن OpenVINO GenAI encode and decode timing نقطة مشابهة لزمن الاستجابة. رقم إنتاجية واحد دليل ضعيف ما لم تكن حدود التوقيت وإعداد القياس مرئية.

كيف يمكن للفرق استيعاب السجلات الإجمالية وسجلات الأمثلة من دون المبالغة في ادعاء قابلية إعادة الإنتاج

يبدأ سير عمل الاستيعاب المعقول قبل التحليل. ثبت مراجعة المستودع، وإصدار المخطط، ورابط المصدر أو لقطة الحزمة، ووقت الاسترجاع، وأي ورقة أو إصدار بروتوكول يجري تفسيره. ثم تحقق من البنية، واربط السجلات الإجمالية وسجلات العينات حيثما هو موثق، وصف المجموعات القابلة للمقارنة، وقارن المنحنيات فقط بعد الاحتفاظ بالمجهولات.

flowchart LR A[سجلات المصدر] --> B[تثبيت المخطط والمراجعة] B --> C[التحقق من السجلات الإجمالية] B --> D[التحقق من سجلات العينات] C --> E[المطابقة بالمفاتيح الموثقة] D --> E E --> F[تصفية المجموعات القابلة للمقارنة] F --> G[مقارنة منحنيات الميزانية مع إبقاء المجهولات مرئية]

التحقق من المخطط مفيد. يمكنه التقاط الحقول المطلوبة المفقودة، والقيم المشوهة، وأشكال السجلات غير المتوافقة. لا يمكنه أن يشهد بأن تجربة ما أُعيد إنتاجها بشكل مستقل. لا يمكنه إثبات أن العينات كاملة، أو أن تغذية oracle الراجعة كانت متاحة بالطريقة نفسها، أو أن النصوص الكاملة عامة، أو أن التراخيص تسمح بكل استخدام لاحق، أو أن حقيقة التصحيح صحيحة.

بالنسبة إلى تدقيق بأسلوب AISI، يجب التعامل مع ربط الإجمالي والعينة كهندسة أدلة. استخدم المعرفات الموثقة والمفاتيح الخاصة بالمصدر. تحقق من الأعداد قبل الربط وبعده. افحص البيانات التعريفية حيثما توفرت. في سياق الحزمة العامة، تشير ملاحظات البحث إلى أن بعض عمليات الربط تستخدم log_file و sample_id و original_epoch بدلا من حقبة معاد تعيينها. يجب أن تصبح الآباء المفقودون أو الرؤوس المتغيرة أو السجلات المشار إليها الغائبة نتائج تدقيق. الإصلاح الهادئ هو المكان الذي تبدأ فيه الثقة بالتسرب.

يمكن لملخص صغير قابل للقراءة آليا أن يحافظ على قابلية نقل هذا الانضباط:

{
  "framework": "Score-to-Protocol Join",
  "compare_only_after": [
    "model_version_pinned",
    "benchmark_subset_known",
    "metric_and_scorer_known",
    "budget_and_attempt_policy_known",
    "feedback_and_compaction_marked",
    "aggregate_sample_counts_checked"
  ],
  "do_not_claim": [
    "independent_replication",
    "complete_samples",
    "production_roi",
    "universal_model_rank"
  ]
}

قراءة منحنيات الحوسبة الاستدلالية كمشغل، لا كمراقب للوحة ترتيب

تكون منحنيات الحوسبة الاستدلالية مفيدة عندما تبين كيف يتغير الأداء مع تغير الميزانية أو البروتوكول. فهي تساعد المشغلين على السؤال عما إذا كانت ميزانية استدلال أكبر تستمر في كشف القدرة، وما إذا كانت عائلة مهام تصل إلى التشبع، وما إذا كانت المقارنة تعتمد على التغذية الراجعة أو المحاولات المتكررة.

تصبح دليلا ضعيفا عندما تعامل كترتيب عالمي. لا تثبت الميزانيات الأكبر وتفاعلات البروتوكول أداء مهمة مضمونا، أو عائد إنتاج، أو ترتيبا دائما للنماذج. المنحنى المبني بتغذية راجعة لصحة oracle ليس هو نفسه سير عمل إنتاجيا لا يعرف فيه المستخدمون ما إذا كانت الإجابة السابقة صحيحة. والمنحنى تحت حد رموز واحد ليس قابلا للمقارنة بالضرورة مع منحنى آخر إذا اختلف الترميز، أو التعامل مع السياق، أو سياسة المحاولات.

يبدو التدقيق العملي المصغر هكذا:

خطوة التدقيقالدليل المطلوب جمعهشرط التوقف
اختر مجموعة قياس فرعية واحدةمجموعة فرعية مسماة، قائمة عينات، استبعاداتلا يمكن تحديد المجموعة الفرعية
ثبت النماذجأسماء النماذج الدقيقة، الإصدارات، المزود أو المحركلا تتوفر إلا أسماء العائلات
أكد المقياسالمقيم، قاعدة التصحيح، تعريف المنحنىالمقياس ملتبس
أكد الميزانيةحد الرموز، سياسة المحاولات، التغذية الراجعة، الضغطتختلف الشروط من دون تسميات
صالح السجلاتأعداد الإجمالي، أعداد العينات، ملاحظات البيانات التعريفيةلا يمكن تفسير الأعداد
قارن المجموعات المتوافقةمنحنيات مع الاحتفاظ بالمجهولاتتتطلب المجموعات تكافؤا مفترضا

هذا سير عمل تدقيق مقترح، وليس ادعاء بأن Optijara أعادت إنتاج نتائج AISI. الهدف هو جعل المقارنة أكثر أمانا من خلال الحفاظ على عدم اليقين بدلا من تنعيمه وإخفائه.

ما الذي تخطئ فيه الفرق عند تشغيل سجلات القياس

الخطأ الأول هو التعامل مع البيانات الوصفية verified كتكرار مستقل. إذا قال ناشر إن سجلا verified وفق عمليته الخاصة، فلا ينبغي إعادة كتابة ذلك على أنه موثق من Optijara أو أُعيد إنتاجه بشكل مستقل. المصدر ليس هو نفسه إعادة تشغيل التجربة.

الخطأ الثاني هو مقارنة المنحنيات مع فروق بروتوكول مخفية. لا ينبغي مقارنة صف يتضمن تغذية oracle راجعة، أو ضغط سياق، أو محاولات متعددة، أو مجموعة عينات فرعية مختلفة كما لو أنه الشرط نفسه. إذا ترك README الخاص بالحزمة أو المخطط أو الورقة شرطا ملتبسا، فضعه كغير معروف إلى أن يحسمه البروتوكول.

الخطأ الثالث هو تجاهل تغطية العينات، والترخيص، وحدود الخصوصية. لا يتجاوز ترخيص مستودع عام تلقائيا شروط كل مجموعة بيانات، أو نص كامل، أو مخرج نموذج، أو حالة استخدام لاحقة. يجب على الفرق فصل التوفر التقني عن الملاءمة القانونية وملاءمة الخصوصية.

الخطأ الرابع هو تحويل تغذية oracle الراجعة التجريبية إلى افتراض إنتاجي. تغذية صحة oracle الراجعة معلومات تجريبية مميزة. يمكن أن تساعد الباحثين على دراسة سلوك التوسع، لكنها لا ينبغي أن تعامل كحلقة تغذية راجعة عادية للتطبيق.

مصفوفة قرار لاعتماد Evaluation Cards و Every Eval Ever في بنية الذكاء الاصطناعي التحتية

يمكن أن تكون Evaluation Cards و Every Eval Ever بنية تحتية قيمة عند استخدامهما للمهمة المناسبة. أقوى دور لهما هو طبقة سجلات، لا محرك قرار تلقائي.

موقف الاعتمادملاءمة جيدةنمط الاستخدامالتحفظ
جاهز للاستخدامفهرسة المقاييس الداخلية، مصدر النتائج، الإبلاغ المتوافق مع المخططتخزين الدرجات مع حقول البروتوكول ومراجعات المصدرما زال يتطلب مراجعة الحقول المفقودة
يستخدم مع تحفظاتتفسير لوحات الترتيب الخارجية، تحليل عبر المزودين، منحنيات الميزانيةقارن المجموعات المتوافقة فقط ووسم المجهولاتتحتاج التكلفة وزمن الاستجابة إلى قياس منفصل
غير كاف وحدهاختيار النموذج النهائي، ادعاءات السلامة، ادعاءات العائد، الاعتماد المنظمعامله كمدخل دليل واحديتطلب اختبارات ومراجعة خاصة بعبء العمل

قائمة التنفيذ واضحة:

الخطوةالإجراءالناتج
1ثبت المصدر والمخطط والمراجعةمرجع دليل غير قابل للتغيير
2تحقق من السجلات الإجماليةتقرير جودة بنيوية
3اربط سجلات العينات حيثما تتوفرتقرير تغطية وعدم تطابق
4ابن مجموعات قابلة للمقارنةسجل إدراج واستبعاد
5قارن منحنيات الميزانيةمخطط مع إظهار المجهولات
6راجع التحفظاتمذكرة قرار بحدود واضحة

بالنسبة إلى الفرق التي تبني توجيه النماذج، أو مسارات التقييم، أو طبقات أدلة القياس، ليس الهدف جعل كل قياس عام حاسما. الهدف هو تصميم بروتوكول مقارنة يحفظ ما هو معروف، ويكشف ما هو مفقود، ويمنع الدرجة من أن تصبح اختصارا شرائيا غير مدعوم. يمكن أن تساعد Optijara في تصميم طبقة السجلات تلك عندما تحتاج الفرق إلى بنية تقييم تحتية تستطيع الصمود أمام المراجعة.

قارن البروتوكولات قبل مقارنة النماذج

إصدار UK AISI و EvalEval في 22 سبتمبر قيم لأنه يجعل سجلات التقييم أسهل للفحص. لكنه لا يحول درجات القياس إلى حقيقة عالمية. تحتاج الدرجة إلى بروتوكول. وتحتاج السجلات الإجمالية إلى سياق عينات. ويحتاج التحقق من المخطط إلى تحفظات. وتحتاج منحنيات الحوسبة الاستدلالية إلى مجموعات متوافقة. يجب أن تبقى الحقول المفقودة مرئية بدلا من ملئها بالافتراض.

هذا هو درس المشغل: قارن البروتوكولات قبل مقارنة النماذج. إذا كان فريقك يستخدم المقاييس العامة لتوجيه توجيه النماذج، أو تخطيط البنية التحتية، أو تصميم التقييم، فابدأ ببناء Score-to-Protocol Join. النتيجة أبطأ من قراءة لوحة ترتيب، وهذا هو المقصود. القرارات التي تحتاج إلى الصمود أمام التدقيق تستحق دليلا يبين طريقة عمله.

النقاط الرئيسية

  • 1لا تكون درجات القياس مفيدة إلا عند ربطها بحقول البروتوكول مثل المقياس، ومجموعة العينات الفرعية، والميزانية، وسياسة المحاولات، والتغذية الراجعة، وتفاصيل المزود.
  • 2تحسن Evaluation Cards و Every Eval Ever تبادل بيانات التقييم، لكن السجلات المنظمة لا تثبت أن التجارب متكافئة.
  • 3تلخص السجلات الإجمالية النتائج، بينما يمكن أن تدعم سجلات الأمثلة فحوصات أعمق حيثما كانت متاحة ومسموحا بها.
  • 4يجب مقارنة منحنيات الحوسبة الاستدلالية فقط عبر مجموعات متوافقة مع الحفاظ على الحقول غير المعروفة.
  • 5يمكن للتحقق من المخطط تأكيد شكل السجل، لا إعادة الإنتاج المستقلة أو اكتمال العينات أو صلاحية oracle أو عائد الإنتاج.

الخلاصة

أفضل قراءة للإصدار هي أنه خطوة نحو بنية تحتية لتقييم الذكاء الاصطناعي أكثر قابلية للفحص. يجب على الفرق استخدام Evaluation Cards و Every Eval Ever والسجلات العامة لربط الدرجات بالبروتوكولات، وإبقاء عدم اليقين مرئيا، وبناء سير عمل مقارنة يساعد القرارات من دون المبالغة فيما تثبته السجلات.

الأسئلة الشائعة

ما هي Evaluation Cards؟

Evaluation Cards هي سجلات منظمة تجعل نتائج تقييم الذكاء الاصطناعي أسهل للفحص والمقارنة من خلال إبراز بيانات النتيجة الوصفية وسياق البروتوكول حيثما كان متاحا. وهي لا تثبت أن التجارب متكافئة.

ما هو Every Eval Ever؟

Every Eval Ever هو مشروع من EvalEval لتخزين سجلات تقييم الذكاء الاصطناعي والتحقق منها، بما في ذلك سجلات النتائج الإجمالية وسجلات اختيارية على مستوى العينة. يجب على الفرق تثبيت المخطط الحالي ومراجعة المستودع التي تستخدمها.

لماذا لا تكفي درجة القياس لمقارنة نماذج الذكاء الاصطناعي؟

يمكن أن يتغير معنى الدرجة بحسب إصدار النموذج، ومجموعة المهام الفرعية، والمقياس، والمقيم، وميزانية الرموز، وسياسة المحاولات، والتغذية الراجعة، والتعامل مع السياق، وتنفيذ المزود، وتاريخ التقييم.

هل تثبت سجلات التقييم المتحقق منها بالمخطط أن القياس أُعيد إنتاجه؟

لا. يتحقق التحقق من المخطط من بنية السجل، لكنه لا يعيد إنتاج التجربة بشكل مستقل، ولا يثبت اكتمال العينات، ولا يتحقق من تغذية oracle الراجعة، ولا يحل قيود الترخيص والخصوصية.

كيف يجب على الفرق مقارنة منحنيات الحوسبة الاستدلالية؟

قارن المنحنيات فقط بعد مواءمة مجموعة القياس الفرعية، والمقياس، وإصدار النموذج، والميزانية، وسياسة المحاولات، والتغذية الراجعة، والتعامل مع السياق، وتفاصيل المزود، وتغطية العينات. ضع علامة صريحة على الحقول غير المعروفة.

المصادر

شارك هذا المقال

Hamza Diaz

بقلم

Hamza Diaz

حمزة دياز هو مؤسس Optijara، حيث يبني وكلاء ذكاء اصطناعي عمليين، وأنظمة أتمتة، وسير عمل Copilot للشركات الخدمية. يكتب عن تشغيل الذكاء الاصطناعي، واستراتيجية الوكلاء، والتطبيق الواقعي للفرق التي تريد أنظمة مفيدة بدلًا من الضجيج.