→ العودة إلى المدونة
DevOps & Dev Workflows

تتبع OpenTelemetry GenAI: دليل عملي لمراقبة نماذج اللغة الكبيرة والوكلاء

يمنح تتبع OpenTelemetry GenAI فرق الهندسة طريقة عملية لفحص مسارات عمل نماذج اللغة الكبيرة والوكلاء بما يتجاوز سجلات الخدمات العادية. يشرح هذا الدليل ما الذي يجب قياسه، وما الذي يجب حجبه، وكيفية ربط التتبعات بالتقييمات، وكيف تبدأ من دون إنشاء قياسات مزعجة أو عالية المخاطر.

بقلم Hamza Diaz
4 أكتوبر 202610 دقيقة قراءة24 مشاهدة

لماذا يهم تتبع OpenTelemetry GenAI الآن

يمنح تتبع OpenTelemetry GenAI فرق الهندسة طريقة لفحص مسارات عمل نماذج اللغة الكبيرة والوكلاء من دون التعامل مع استدعاء النموذج كصندوق أسود. قد يبدو ذلك جافا إلى أن يتعطل شيء ما. تعيد واجهة API الحالة 200. التطبيق لا يتعطل. المستخدم يحصل على إجابة. ومع ذلك، قد تكون الإجابة ضعيفة، أو مكلفة أكثر من اللازم للمهمة، أو مبنية على سياق مسترجع خاطئ، أو متأثرة باستدعاء أداة لم ينتبه إليه أحد في المراجعة.

هذا هو الجزء المحرج في عمل الذكاء الاصطناعي في الإنتاج. تستطيع السجلات القياسية إثبات أن طلبا حدث. لكنها نادرا ما تشرح لماذا تصرف مسار عمل الذكاء الاصطناعي بالطريقة التي تصرف بها.

OpenTelemetry GenAI ليس منتج مراقبة آخر يجب شراؤه. إنه مجموعة من الاصطلاحات الدلالية لوصف عمليات الذكاء الاصطناعي التوليدي بتنسيق متسق. تغطي إرشادات OpenTelemetry الرسمية طلبات النماذج، والاستجابات، والأحداث، والمقاييس، والاستثناءات، وspans الوكلاء، والقياسات ذات الصلة. إذا وصفت الفرق المزودين، والنماذج، والمطالبات، والإكمالات، واستخدام الرموز، والأدوات، وخطوات الوكلاء باصطلاحات مشتركة، تصبح التتبعات أسهل في الاستعلام والمقارنة والنقل بين خلفيات المراقبة.

رأيي: تنتظر معظم فرق الذكاء الاصطناعي وقتا طويلا قبل توحيد هذا الأمر. تضيف التتبع بعد أول حادثة مؤلمة، عندما تكون إصدارات المطالبات، وقواعد التوجيه، وسلوك الأدوات موزعة بالفعل بين السجلات، والدفاتر، ولقطات لوحات المعلومات. الوقت الأفضل هو قبل أن يصبح مسار العمل مهما.

من سجلات التطبيق إلى تتبعات النموذج والأداة والوكيل

تراقب معظم فرق الإنتاج الأساسيات بالفعل: زمن استجابة HTTP، ورموز الحالة، واستدعاءات قواعد البيانات، وعمق الطوابير، وفشل الاعتماديات، ومعدلات الأخطاء. تفشل أنظمة نماذج اللغة الكبيرة بطرق أكثر هدوءا. قد تكون الإجابة المولدة ضعيفة لأن قالب مطالبة تغير، أو لأن الاسترجاع اختار مصادر ضعيفة، أو لأن النموذج وُجه إلى مزود مختلف، أو لأن أداة أعادت بيانات جزئية، أو لأن البث توقف مبكرا، أو لأن إعادة المحاولة غيرت السياق النهائي، أو لأن التحقق سمح بإجابة كان ينبغي حظرها.

يعطي التتبع هذه الخطوات شكلا. بدلا من عملية مبهمة واحدة اسمها توليد الإجابة، يمكن أن يعرض التتبع تجميع المطالبة، والاسترجاع، واستدعاء النموذج، واختيار الأداة، وتنفيذ الأداة، والتحقق، وتجميع الاستجابة كspans مترابطة. يصبح ذلك مهما عندما يتحول نموذج أولي إلى مسار عمل مدار. يحتاج التصحيح، ومراجعة الحوادث، وضوابط الخصوصية، ومراجعة التكلفة إلى أكثر من لقطات شاشة وسجلات JSON مرتجلة.

ما الذي تضيفه اصطلاحات GenAI الدلالية

تمنح اصطلاحات OpenTelemetry GenAI الفرق مفردات مشتركة لعمليات النماذج. يمكن أن يوجد استدعاء نموذج داخل التتبع الموزع نفسه مثل طلب الويب، وخدمة الاسترجاع، واستعلام قاعدة البيانات، والأداة اللاحقة. على مستوى عال، تغطي الاصطلاحات نظام GenAI أو المزود، وأسماء العمليات، ونماذج الطلب والاستجابة، واستخدام الرموز، والمطالبات والإكمالات كأحداث عند التقاطها، والاستثناءات، والمقاييس، وspans المرتبطة بالوكلاء.

القيد مهم بقدر الفائدة. يساعد التتبع الفرق على إعادة بناء ما حدث أثناء طلب ما. لكنه لا يثبت أن الإجابة النهائية كانت صحيحة أو آمنة أو مفيدة. ما زلت تحتاج إلى تقييمات، واختبار خصومي عند الاقتضاء، وضوابط وصول، وسجلات خاصة بالمزود، ومراجعة خصوصية، وحكم منتج.

فجوة المراقبة في تطبيقات ووكلاء نماذج اللغة الكبيرة

مراقبة أداء التطبيقات التقليدية قوية في صحة الخدمات. يمكنها إظهار أن نقطة نهاية كانت بطيئة، أو أن اعتمادا انتهت مهلته، أو أن استعلام قاعدة بيانات فشل. بالنسبة إلى تطبيقات نماذج اللغة الكبيرة، هذه الإشارات ضرورية لكنها غير مكتملة. غالبا ما يفوّت تتبع الخدمة العادي بناء المطالبة، وإصدار قالب المطالبة، ومعرفات المستندات المسترجعة، واختيار النموذج، وإعدادات أخذ العينات، وسبب التوقف، وتوجيه الأدوات، وسلوك إعادة المحاولة، وقرارات السلامة، ونتائج التقييم.

يوسع الوكلاء هذه الفجوة. قد يخططون، ويستدعون أدوات، ويفحصون النتائج، ويستدعون النموذج مرة أخرى، ويسترجعون الذاكرة، ويسلمون إلى مسار عمل آخر، ويشغلون عمليات تحقق، ويتوقفون وفق قاعدة إنهاء. قد تفشل بعض الخطوات بينما يظل المستخدم يتلقى إجابة نهائية. ينبغي للفرق التي تعمل على أنظمة وكيلة أن تقرأ أيضا على نطاق أوسع عن موثوقية وكلاء الذكاء الاصطناعي والإشراف عليهم، لأن التتبع يعرض المسار الذي سلكه الوكيل بينما يقرر الإشراف ما إذا كان ذلك المسار مقبولا.

يسجل الإصدار العملي الأول من مراقبة نماذج اللغة الكبيرة عادة النموذج والمزود، واسم العملية، ونموذج الطلب، ونموذج الاستجابة عند توفره، ومعلمات الطلب، وزمن الاستجابة، وعدد الرموز عند توفره، وسبب التوقف، واسم الأداة، وحالة نتيجة الأداة، ومعرفات مصادر الاسترجاع، وفئات الأخطاء، وأعلام السلامة، ونتائج التقييم. يحتاج التقاط المحتوى إلى سياسة أكثر صرامة. يمكن أن تحتوي المطالبات والإكمالات على بيانات مستخدمين، أو مستندات خاصة، أو أسرار، أو عقود، أو شفرة مصدرية، أو معلومات صحية، أو بيانات مالية، أو استراتيجية داخلية. ينبغي لكثير من الفرق أن تبدأ بالبيانات الوصفية، والمعرفات، والتجزئات، والمقتطفات المحجوبة بدلا من المحتوى الكامل.

ما الذي يوحده OpenTelemetry GenAI

تحدد اصطلاحات OpenTelemetry الدلالية لغة مشتركة للقياسات. في مجال GenAI، تصف سمات وأحداثا تجعل عمليات النماذج قابلة للتعرف عبر الخدمات والأدوات. يمكن لspan استدعاء نموذج أن يحدد مزود GenAI، واسم العملية، والنموذج المطلوب، ونموذج الاستجابة، ومعلمات الطلب، واستخدام الرموز، وبيانات الاستجابة الوصفية. ينبغي التحقق من أسماء السمات الدقيقة مقابل مستودع OpenTelemetry GenAI الحالي قبل التنفيذ لأن الاصطلاحات ما زالت تتغير.

الأحداث مفيدة لأن طلب النموذج لا يتم تمثيله دائما جيدا كسمات span ثابتة. قد يحتوي تفاعل محادثة على عدة رسائل. قد تنتج الاستجابة المتدفقة قطعا مع مرور الوقت. قد يرتبط استدعاء أداة برسالة مساعد وبنتيجة أداة لاحقة. يظل الأمان أولا. يمكن أن تحمل الأحداث نصا حساسا إذا كان التقاط المحتوى مفعلا. قد تجد الفرق التي تبني مسارات عمل المستندات دليل Optijara إلى مسارات document AI مفيدا، لأن أنظمة المستندات غالبا ما تجمع بين الاسترجاع، والاستخراج، والتوليد، وقيود الخصوصية.

يوفر OpenTelemetry Protocol، والذي يختصر عادة إلى OTLP، مسارا لإرسال القياسات إلى خلفيات مراقبة متوافقة. يختلف دعم الخلفيات. تعرض بعض الأدوات تتبعات GenAI بوضوح. تتعامل أدوات أخرى معها كspans عادية ذات سمات. قبل اعتبار هذا جاهزا للإنتاج، تحقق من قابلية الاستعلام، وتصور التتبع، وسلوك الاحتفاظ، وضبط الوصول في الخلفية التي يستخدمها فريقك فعلا.

خريطة Optijara لتتبع GenAI

خريطة Optijara لتتبع GenAI هي إطار يبدأ بالقرار لتصميم مراقبة نماذج اللغة الكبيرة والوكلاء. إنها تحول التتبع من عادة لجمع البيانات إلى نشاط تصميم إنتاجي. السؤال ليس ما الذي يمكننا تسجيله. السؤال الأفضل هو: ما القرار الذي ينبغي أن يساعدنا هذا التتبع على اتخاذه، وما هي spans التي تكشف ذلك القرار، وما المحتوى الذي يجب أن يبقى خارج القياسات.

flowchart TD A[طلب المستخدم] --> B[تجميع المطالبة] B --> C[الاسترجاع أو البحث في الذاكرة] C --> D[استدعاء النموذج] D --> E{هل الأداة مطلوبة؟} E -->|نعم| F[تنفيذ الأداة] F --> G[التحقق من مخرجات الأداة] G --> D E -->|لا| H[التحقق من الاستجابة] H --> I[تجميع الاستجابة] I --> J[إشارة تقييم اختيارية] J --> K[مراجعة الحوادث والمنتج والتكلفة]

ابدأ بالقرارات، لا بلوحات المعلومات. تشمل أسئلة التتبع المفيدة: أي استدعاء نموذج كان بطيئا، وأي مزود عالج الطلب، وأي إصدار من قالب المطالبة استُخدم، وأي مستندات استُرجعت، وأي أداة فشلت، وما إذا كانت إعادة المحاولة غيرت الإجابة النهائية، وما إذا كان التحقق قد نجح، وأي مسار عمل أنتج استخداما غير معتاد.

طبقة التتبعspan نموذجيةبيانات وصفية مفيدةتجنب افتراضيا
الدخولطلب المستخدممعرف التتبع، المسار، شريحة المستخدم، نوع الطلبرسالة المستخدم الكاملة من دون سياسة
المطالبةتجميع المطالبةمعرف القالب، الإصدار، معرفات السياق، حالة الحجبالسياق السري الخام
الاسترجاعالبحث أو إعادة الترتيباسم الفهرس، معرفات المستندات، نطاقات الدرجات، عدد النتائجالمستندات الخاصة الكاملة
النموذجاستدعاء GenAIالمزود، النموذج، المعلمات، زمن الاستجابة، استخدام الرموزالأسرار في المطالبات أو الإكمالات
الأداةتنفيذ الأداةاسم الأداة، الحالة، المدة، فئة الخطأبيانات اعتماد الأداة أو المخرجات الحساسة الخام
التحققفحص السلامة أو المخططنجاح أو فشل، معرف القاعدة، استخدام بديلنص السياسة الخاص إذا كان مقيدا
التقييمإشارة الجودةاسم التقييم، إصدار المعيار، نطاق الدرجةالتعامل مع التقييم كحقيقة مطلقة

يمكن أن تساعد سياسة مدمجة قابلة للقراءة آليا فرق الهندسة والحوكمة على التوافق قبل انتشار القياس:

{
  "framework": "Optijara GenAI Trace Map",
  "trace_goal": "debug and evaluate one production AI workflow",
  "required_spans": ["entry", "prompt_assembly", "retrieval", "model_call", "tool_call", "validation", "evaluation"],
  "content_policy": {
    "forbidden": ["secrets", "credentials", "unredacted private documents"],
    "redacted": ["user text", "tool output"],
    "sampled": ["prompt events", "completion events"],
    "retained": ["metadata", "trace ids", "template versions", "document ids"]
  }
}

أنماط التنفيذ، من استدعاء واحد لنموذج اللغة الكبير إلى الوكلاء

أبسط تنفيذ يتتبع طلب نموذج واحدا داخل تتبع تطبيق قائم. يكون span الأصل هو طلب المستخدم أو المهمة الخلفية. ويكون span الابن هو عملية GenAI. ينبغي أن يلتقط المزود أو النظام، والنموذج المطلوب، واسم العملية، والمعلمات ذات الصلة، وزمن الاستجابة، والحالة، واستخدام الرموز عند توفره، ونموذج الاستجابة عند توفره، وتفاصيل الاستثناء إذا فشل الاستدعاء.

يحتاج التوليد المعزز بالاسترجاع إلى أكثر من span للنموذج. يتضمن تتبع RAG المفيد عادة إعادة صياغة الاستعلام، والبحث بالتضمينات، وإعادة الترتيب، ومعرفات المستندات المختارة، وتجميع السياق، والتوليد النهائي، والتحقق من الاستشهادات، وتجميع الاستجابة. تهم معرفات المستندات لأنها تتيح للفرق تدقيق المصادر التي أثرت في الإجابة من دون وضع المستندات السرية الكاملة داخل القياسات.

بالنسبة إلى الوكلاء، مثل مسار العمل كشجرة. يكون span الجذر هو مهمة المستخدم. يمكن أن تشمل spans الأبناء التخطيط، واستدعاءات النموذج، واختيار الأدوات، وكل تنفيذ أداة، والتحقق من مخرجات الأداة، والتأمل، وقراءات الذاكرة، والتحقق من الاستجابة، والإنهاء. إذا استدعى الوكيل أدوات بالتوازي، ينبغي أن يكون كل استدعاء أداة مرئيا كspan شقيق مع الحالة والمدة.

user_task: investigate_invoice_question
  prompt_assembly: support_agent_v4
  model_call: plan_next_step
  tool_call: search_orders status=ok
  tool_call: fetch_invoice status=timeout
  model_call: revise_plan_after_timeout
  tool_call: fetch_invoice status=ok retry=1
  validation: policy_and_schema_check status=passed
  response_assembly: final_answer

توثق LangSmith دعم تتبع OpenTelemetry، وهو مثال مفيد على التكامل في المنظومة. يمكن لقياس الأطر أن يقلل عمل spans اليدوي، خصوصا عندما تستخدم الفرق بالفعل إطارا للسلاسل، أو الأدوات، أو الوكلاء. تعامل مع ذلك القياس كنقطة بداية، ثم افحص التتبعات المصدرة. يقترن هذا جيدا مع نظافة هندسية أوسع مثل استخدام uv لمسارات عمل مشاريع Python، حيث تجعل الأدوات القابلة للتكرار والبيئات المتسقة نشر المراقبة أسهل في الصيانة.

خطة التبني والتقييم

يبدأ النشر الآمن بمسار عمل واحد وقائمة تحقق اختبارية. تحقق من استمرارية التتبع عبر الخدمات. تأكد من أن أسماء سمات GenAI تطابق وثائق OpenTelemetry الحالية التي اختار فريقك اتباعها. افحص سلوك أخذ العينات. اختبر حجب المطالبات. افحص الاستجابات المتدفقة. تأكد مما إذا كان استخدام الرموز متاحا من مزودك وكيف يتم تمثيله. تأكد من التقاط أخطاء الأدوات كأخطاء أدوات، لا كاستثناءات عامة فقط. استعلم عن التتبعات في الخلفية وتأكد من أن مهندسي المناوبة يستطيعون العثور على ما يحتاجون إليه.

مجال الاختبارما يجب التحقق منهلماذا يهم
استمرارية التتبعيتبع تتبع واحد الطلب عبر التطبيق، والاسترجاع، والنموذج، والأدواتيمنع التشخيص المجزأ
تسمية السماتتتوافق الأسماء مع إصدار OpenTelemetry GenAI المختاريحسن قابلية النقل والاستعلامات
الحجبتتم تصفية المطالبات، والمستندات، ومخرجات الأدوات الحساسةيقلل مخاطر الخصوصية والأمان
أخذ العيناتلا تطغى مسارات العمل ذات الحجم العالي على التخزينيضبط تكلفة القياسات والضجيج
البثتمثل القطع، والاستجابة النهائية، وسبب التوقف بصورة متسقةيجعل أعطال البث قابلة للتشخيص
بيانات الرموز الوصفيةحقول الرموز موجودة حيث يكشفها المزودونيدعم مراجعة الاستخدام مع تحفظات
استعلامات الخلفيةيستطيع المهندسون البحث حسب معرف التتبع، والنموذج، ومسار العمل، ونوع الخطأيجعل القياسات قابلة للاستخدام أثناء الحوادث

تجنب التقاط المطالبات الكاملة افتراضيا. تجنب الاعتماد على لوحة معلومات واحدة كمصدر للحقيقة. تجنب التعامل مع عدد الرموز كرقم دقيق عبر كل مزود ومسار عمل. تجنب قياس كل دالة مساعدة. تجنب تجاهل سياسة الاحتفاظ والوصول. تجنب استخدام التتبعات كدليل على أن الإجابة كانت جيدة. تستمر اصطلاحات OpenTelemetry في التطور، لذلك ينبغي للفرق تثبيت إصدارات القياس، وتوثيق الافتراضات، ومراجعة تغييرات الاصطلاحات قبل النشر الواسع.

أخطاء شائعة ترتكبها الفرق

أسرع طريقة لإنشاء خطر في المراقبة هي تسجيل المطالبات والإكمالات أولا، ثم مناقشة السياسة لاحقا. يمكن أن تحتوي المطالبات على بيانات شخصية، أو مستندات سرية، أو بيانات اعتماد، أو شفرة مصدرية، أو خطط أعمال خاصة، أو معلومات منظمة. حدد الحقول المحظورة، والمحجوبة، والمأخوذة كعينات، والمحتفظ بها قبل القياس.

التتبع الخاص بالنموذج فقط ضيق جدا بالنسبة إلى الوكلاء. تحدث كثير من الإخفاقات خارج النموذج: يعيد الاسترجاع سياقا ضعيفا، أو تنتهي مهلة أداة، أو يتم تخطي التحقق، أو تحتوي الذاكرة على معلومات قديمة، أو يسقط تجميع الاستجابة تفصيلا مهما. إذا توقف التتبع عند span النموذج، فقد يلوم الفريق الطبقة الخطأ.

ينبغي أن تجيب كل سمة عن سؤال. من سيستخدم هذا الحقل، أثناء أي مسار عمل، وأي قرار سيدعمه؟ إذا لم يستطع أحد الإجابة، فربما يكون الحقل ضجيجا. التتبعات دليل على العملية. التقييمات دليل على جودة المخرجات، وحتى التقييمات تحتاج إلى تصميم معيار بعناية.

كيف تختار مشروع التتبع الأول

ليس أفضل مشروع أول دائما هو ميزة الذكاء الاصطناعي الأكثر تعقيدا. اختر مسار عمل ستغير فيه المراقبة القرارات قريبا.

المعيارإشارة أولوية منخفضةإشارة أولوية عاليةإرشاد المشروع الأول
الأهمية التجاريةتجربة داخليةمسار عمل موجه للمستخدم أو مهم تشغيليافضل الأثر العالي مع نطاق محدود
ألم التصحيحالإخفاقات نادرة أو واضحةالإخفاقات متكررة، أو غامضة، أو مكلفة في التحقيقمرشح قوي
حساسية الخصوصيةبيانات عامة أو اصطناعية في الغالببيانات مستخدمين أو مستندات حساسةابدأ فقط بسياسة حجب صارمة
تعقيد مسار العملاستدعاء نموذج واحداسترجاع، أدوات، تحقق، إعادة محاولات، أو وكلاءتضيف خريطة التتبع قيمة أكبر
نضج OpenTelemetryلا يوجد تتبع قائمتتبعات موزعة قائمة ومسار OTLPنشر أسهل
جاهزية الخلفيةلا يوجد نموذج استعلام أو وصولتتبعات قابلة للاستعلام مع ضوابط وصولتبن إنتاجي أكثر أمانا

المعلم الأول العملي هو طلب واحد من البداية إلى النهاية مع شجرة تتبع قابلة للقراءة. ينبغي أن يتصل التتبع بسجلات التطبيق عبر معرف التتبع. ينبغي أن يعرض تجميع المطالبة، والاسترجاع إن وجد، واستدعاء النموذج، ونتائج الأدوات إن وجدت، والتحقق من الاستجابة، وإشارة تقييم أو مراجعة واحدة. ينبغي التحقق من الحجب قبل أي نشر أوسع.

إذا كان فريقك ينتقل من النماذج الأولية إلى مسارات عمل ذكاء اصطناعي إنتاجية، يمكن أن تساعد Optijara في رسم التتبعات، والتقييمات، وفحوص الحوكمة قبل أن يصبح القياس مزعجا أو عالي المخاطر. ينبغي أن يكون الهدف مراقبة محايدة تجاه البائع تساعد الفرق على تصحيح أنظمة الذكاء الاصطناعي وتقييمها وتشغيلها بحدود واضحة.

يكون تتبع OpenTelemetry GenAI أكثر فائدة عندما توحد الفرق قبل التوسع، وتتتبع القرارات بدلا من كل استدعاء ممكن، وتحمي المحتوى الحساس، وتربط التتبعات بالتقييمات، وتبقي الاصطلاحات قيد المراجعة مع نضج المنظومة.

النقاط الرئيسية

  • 1يوحد تتبع OpenTelemetry GenAI طريقة وصف الفرق لاستدعاءات النماذج، والمطالبات، والإكمالات، والأدوات، والوكلاء، واستخدام الرموز، وبيانات المزودين الوصفية.
  • 2تكون التتبعات أكثر قيمة عندما تصمم حول قرارات التصحيح، والتقييم، ومراجعة التكلفة، والحوكمة، وتحليل الحوادث.
  • 3تحتاج مراقبة الوكلاء إلى spans أصل وابن للتخطيط، والاسترجاع، واستدعاءات الأدوات، والتحقق، وإعادة المحاولات، وتجميع الاستجابة، لا إلى استدعاءات النماذج فقط.
  • 4ينبغي أن يخضع التقاط المطالبات والإكمالات لسياسة، وحجب، وأخذ عينات، وحدود احتفاظ، وضوابط وصول.
  • 5تحسن اصطلاحات OpenTelemetry قابلية النقل، لكن الفرق ما زالت تحتاج إلى التحقق من دعم الخلفية، وقابلية الاستعلام، وجودة التصور.

الخلاصة

يمنح تتبع OpenTelemetry GenAI فرق الإنتاج لغة مشتركة لفحص مسارات عمل نماذج اللغة الكبيرة والوكلاء، لكن المعيار لا يساعد إلا عندما يطبق بانضباط. ابدأ بالقرارات التي يجب أن تدعمها تتبعاتك، وحدد حدود spans قبل كتابة القياس، واحم المحتوى الحساس افتراضيا، واربط التتبعات بالتقييمات، والحوادث، ومراجعات النشر. هذا يبقي المراقبة عملية بدلا من أن تكون مزعجة.

الأسئلة الشائعة

ما هو OpenTelemetry GenAI؟

OpenTelemetry GenAI هو مجموعة من الاصطلاحات الدلالية وأنماط القياسات لتتبع عمليات الذكاء الاصطناعي التوليدي مثل استدعاءات النماذج، والمطالبات، والإكمالات، واستخدام الرموز، واستدعاءات الأدوات، والاستثناءات، والمقاييس، وspans مسارات عمل الوكلاء.

كيف تختلف مراقبة نماذج اللغة الكبيرة عن مراقبة التطبيقات التقليدية؟

تتتبع المراقبة التقليدية صحة الخدمات، وزمن الاستجابة، والأخطاء. تحتاج مراقبة نماذج اللغة الكبيرة أيضا إلى رؤية في تجميع المطالبات، وسياق الاسترجاع، ومعلمات النموذج، واستدعاءات الأدوات، واستخدام الرموز، ونتائج التحقق، وإشارات الجودة.

هل ينبغي للفرق تخزين المطالبات والإكمالات في التتبعات؟

ليس افتراضيا. ينبغي للفرق تحديد السياسة أولا، ثم استخدام الحجب، وأخذ العينات، وحدود الاحتفاظ، وضوابط الوصول. غالبا ما تكون البيانات الوصفية، والمعرفات، والتجزئات، والمقتطفات المحجوبة أكثر أمانا من المحتوى الكامل.

هل يستطيع OpenTelemetry تتبع وكلاء ذكاء اصطناعي متعددة الخطوات؟

نعم. يمكن للفرق نمذجة مسارات عمل الوكلاء كspans أصل وابن للتخطيط، وتجميع المطالبات، واستدعاءات النماذج، والاسترجاع، وتنفيذ الأدوات، والتحقق، وإعادة المحاولات، وقراءات الذاكرة، وتجميع الاستجابة.

هل يستبدل OpenTelemetry أدوات التقييم لتطبيقات نماذج اللغة الكبيرة؟

لا. تشرح التتبعات ما حدث أثناء طلب ما. تساعد التقييمات في الحكم على ما إذا كانت المخرجات صحيحة، وآمنة، ومفيدة، ومتوافقة مع المهمة. تحتاج فرق الإنتاج عادة إلى الاثنين معا.

المصادر

شارك هذا المقال

Hamza Diaz

بقلم

Hamza Diaz

حمزة دياز هو مؤسس Optijara، حيث يبني وكلاء ذكاء اصطناعي عمليين، وأنظمة أتمتة، وسير عمل Copilot للشركات الخدمية. يكتب عن تشغيل الذكاء الاصطناعي، واستراتيجية الوكلاء، والتطبيق الواقعي للفرق التي تريد أنظمة مفيدة بدلًا من الضجيج.