تتبع OpenTelemetry GenAI: دليل عملي لمراقبة نماذج اللغة الكبيرة والوكلاء
يمنح تتبع OpenTelemetry GenAI فرق الهندسة طريقة عملية لفحص مسارات عمل نماذج اللغة الكبيرة والوكلاء بما يتجاوز سجلات الخدمات العادية. يشرح هذا الدليل ما الذي يجب قياسه، وما الذي يجب حجبه، وكيفية ربط التتبعات بالتقييمات، وكيف تبدأ من دون إنشاء قياسات مزعجة أو عالية المخاطر.
لماذا يهم تتبع OpenTelemetry GenAI الآن
يمنح تتبع OpenTelemetry GenAI فرق الهندسة طريقة لفحص مسارات عمل نماذج اللغة الكبيرة والوكلاء من دون التعامل مع استدعاء النموذج كصندوق أسود. قد يبدو ذلك جافا إلى أن يتعطل شيء ما. تعيد واجهة API الحالة 200. التطبيق لا يتعطل. المستخدم يحصل على إجابة. ومع ذلك، قد تكون الإجابة ضعيفة، أو مكلفة أكثر من اللازم للمهمة، أو مبنية على سياق مسترجع خاطئ، أو متأثرة باستدعاء أداة لم ينتبه إليه أحد في المراجعة.
هذا هو الجزء المحرج في عمل الذكاء الاصطناعي في الإنتاج. تستطيع السجلات القياسية إثبات أن طلبا حدث. لكنها نادرا ما تشرح لماذا تصرف مسار عمل الذكاء الاصطناعي بالطريقة التي تصرف بها.
OpenTelemetry GenAI ليس منتج مراقبة آخر يجب شراؤه. إنه مجموعة من الاصطلاحات الدلالية لوصف عمليات الذكاء الاصطناعي التوليدي بتنسيق متسق. تغطي إرشادات OpenTelemetry الرسمية طلبات النماذج، والاستجابات، والأحداث، والمقاييس، والاستثناءات، وspans الوكلاء، والقياسات ذات الصلة. إذا وصفت الفرق المزودين، والنماذج، والمطالبات، والإكمالات، واستخدام الرموز، والأدوات، وخطوات الوكلاء باصطلاحات مشتركة، تصبح التتبعات أسهل في الاستعلام والمقارنة والنقل بين خلفيات المراقبة.
رأيي: تنتظر معظم فرق الذكاء الاصطناعي وقتا طويلا قبل توحيد هذا الأمر. تضيف التتبع بعد أول حادثة مؤلمة، عندما تكون إصدارات المطالبات، وقواعد التوجيه، وسلوك الأدوات موزعة بالفعل بين السجلات، والدفاتر، ولقطات لوحات المعلومات. الوقت الأفضل هو قبل أن يصبح مسار العمل مهما.
من سجلات التطبيق إلى تتبعات النموذج والأداة والوكيل
تراقب معظم فرق الإنتاج الأساسيات بالفعل: زمن استجابة HTTP، ورموز الحالة، واستدعاءات قواعد البيانات، وعمق الطوابير، وفشل الاعتماديات، ومعدلات الأخطاء. تفشل أنظمة نماذج اللغة الكبيرة بطرق أكثر هدوءا. قد تكون الإجابة المولدة ضعيفة لأن قالب مطالبة تغير، أو لأن الاسترجاع اختار مصادر ضعيفة، أو لأن النموذج وُجه إلى مزود مختلف، أو لأن أداة أعادت بيانات جزئية، أو لأن البث توقف مبكرا، أو لأن إعادة المحاولة غيرت السياق النهائي، أو لأن التحقق سمح بإجابة كان ينبغي حظرها.
يعطي التتبع هذه الخطوات شكلا. بدلا من عملية مبهمة واحدة اسمها توليد الإجابة، يمكن أن يعرض التتبع تجميع المطالبة، والاسترجاع، واستدعاء النموذج، واختيار الأداة، وتنفيذ الأداة، والتحقق، وتجميع الاستجابة كspans مترابطة. يصبح ذلك مهما عندما يتحول نموذج أولي إلى مسار عمل مدار. يحتاج التصحيح، ومراجعة الحوادث، وضوابط الخصوصية، ومراجعة التكلفة إلى أكثر من لقطات شاشة وسجلات JSON مرتجلة.
ما الذي تضيفه اصطلاحات GenAI الدلالية
تمنح اصطلاحات OpenTelemetry GenAI الفرق مفردات مشتركة لعمليات النماذج. يمكن أن يوجد استدعاء نموذج داخل التتبع الموزع نفسه مثل طلب الويب، وخدمة الاسترجاع، واستعلام قاعدة البيانات، والأداة اللاحقة. على مستوى عال، تغطي الاصطلاحات نظام GenAI أو المزود، وأسماء العمليات، ونماذج الطلب والاستجابة، واستخدام الرموز، والمطالبات والإكمالات كأحداث عند التقاطها، والاستثناءات، والمقاييس، وspans المرتبطة بالوكلاء.
القيد مهم بقدر الفائدة. يساعد التتبع الفرق على إعادة بناء ما حدث أثناء طلب ما. لكنه لا يثبت أن الإجابة النهائية كانت صحيحة أو آمنة أو مفيدة. ما زلت تحتاج إلى تقييمات، واختبار خصومي عند الاقتضاء، وضوابط وصول، وسجلات خاصة بالمزود، ومراجعة خصوصية، وحكم منتج.
فجوة المراقبة في تطبيقات ووكلاء نماذج اللغة الكبيرة
مراقبة أداء التطبيقات التقليدية قوية في صحة الخدمات. يمكنها إظهار أن نقطة نهاية كانت بطيئة، أو أن اعتمادا انتهت مهلته، أو أن استعلام قاعدة بيانات فشل. بالنسبة إلى تطبيقات نماذج اللغة الكبيرة، هذه الإشارات ضرورية لكنها غير مكتملة. غالبا ما يفوّت تتبع الخدمة العادي بناء المطالبة، وإصدار قالب المطالبة، ومعرفات المستندات المسترجعة، واختيار النموذج، وإعدادات أخذ العينات، وسبب التوقف، وتوجيه الأدوات، وسلوك إعادة المحاولة، وقرارات السلامة، ونتائج التقييم.
يوسع الوكلاء هذه الفجوة. قد يخططون، ويستدعون أدوات، ويفحصون النتائج، ويستدعون النموذج مرة أخرى، ويسترجعون الذاكرة، ويسلمون إلى مسار عمل آخر، ويشغلون عمليات تحقق، ويتوقفون وفق قاعدة إنهاء. قد تفشل بعض الخطوات بينما يظل المستخدم يتلقى إجابة نهائية. ينبغي للفرق التي تعمل على أنظمة وكيلة أن تقرأ أيضا على نطاق أوسع عن موثوقية وكلاء الذكاء الاصطناعي والإشراف عليهم، لأن التتبع يعرض المسار الذي سلكه الوكيل بينما يقرر الإشراف ما إذا كان ذلك المسار مقبولا.
يسجل الإصدار العملي الأول من مراقبة نماذج اللغة الكبيرة عادة النموذج والمزود، واسم العملية، ونموذج الطلب، ونموذج الاستجابة عند توفره، ومعلمات الطلب، وزمن الاستجابة، وعدد الرموز عند توفره، وسبب التوقف، واسم الأداة، وحالة نتيجة الأداة، ومعرفات مصادر الاسترجاع، وفئات الأخطاء، وأعلام السلامة، ونتائج التقييم. يحتاج التقاط المحتوى إلى سياسة أكثر صرامة. يمكن أن تحتوي المطالبات والإكمالات على بيانات مستخدمين، أو مستندات خاصة، أو أسرار، أو عقود، أو شفرة مصدرية، أو معلومات صحية، أو بيانات مالية، أو استراتيجية داخلية. ينبغي لكثير من الفرق أن تبدأ بالبيانات الوصفية، والمعرفات، والتجزئات، والمقتطفات المحجوبة بدلا من المحتوى الكامل.
ما الذي يوحده OpenTelemetry GenAI
تحدد اصطلاحات OpenTelemetry الدلالية لغة مشتركة للقياسات. في مجال GenAI، تصف سمات وأحداثا تجعل عمليات النماذج قابلة للتعرف عبر الخدمات والأدوات. يمكن لspan استدعاء نموذج أن يحدد مزود GenAI، واسم العملية، والنموذج المطلوب، ونموذج الاستجابة، ومعلمات الطلب، واستخدام الرموز، وبيانات الاستجابة الوصفية. ينبغي التحقق من أسماء السمات الدقيقة مقابل مستودع OpenTelemetry GenAI الحالي قبل التنفيذ لأن الاصطلاحات ما زالت تتغير.
الأحداث مفيدة لأن طلب النموذج لا يتم تمثيله دائما جيدا كسمات span ثابتة. قد يحتوي تفاعل محادثة على عدة رسائل. قد تنتج الاستجابة المتدفقة قطعا مع مرور الوقت. قد يرتبط استدعاء أداة برسالة مساعد وبنتيجة أداة لاحقة. يظل الأمان أولا. يمكن أن تحمل الأحداث نصا حساسا إذا كان التقاط المحتوى مفعلا. قد تجد الفرق التي تبني مسارات عمل المستندات دليل Optijara إلى مسارات document AI مفيدا، لأن أنظمة المستندات غالبا ما تجمع بين الاسترجاع، والاستخراج، والتوليد، وقيود الخصوصية.
يوفر OpenTelemetry Protocol، والذي يختصر عادة إلى OTLP، مسارا لإرسال القياسات إلى خلفيات مراقبة متوافقة. يختلف دعم الخلفيات. تعرض بعض الأدوات تتبعات GenAI بوضوح. تتعامل أدوات أخرى معها كspans عادية ذات سمات. قبل اعتبار هذا جاهزا للإنتاج، تحقق من قابلية الاستعلام، وتصور التتبع، وسلوك الاحتفاظ، وضبط الوصول في الخلفية التي يستخدمها فريقك فعلا.
خريطة Optijara لتتبع GenAI
خريطة Optijara لتتبع GenAI هي إطار يبدأ بالقرار لتصميم مراقبة نماذج اللغة الكبيرة والوكلاء. إنها تحول التتبع من عادة لجمع البيانات إلى نشاط تصميم إنتاجي. السؤال ليس ما الذي يمكننا تسجيله. السؤال الأفضل هو: ما القرار الذي ينبغي أن يساعدنا هذا التتبع على اتخاذه، وما هي spans التي تكشف ذلك القرار، وما المحتوى الذي يجب أن يبقى خارج القياسات.
ابدأ بالقرارات، لا بلوحات المعلومات. تشمل أسئلة التتبع المفيدة: أي استدعاء نموذج كان بطيئا، وأي مزود عالج الطلب، وأي إصدار من قالب المطالبة استُخدم، وأي مستندات استُرجعت، وأي أداة فشلت، وما إذا كانت إعادة المحاولة غيرت الإجابة النهائية، وما إذا كان التحقق قد نجح، وأي مسار عمل أنتج استخداما غير معتاد.
| طبقة التتبع | span نموذجية | بيانات وصفية مفيدة | تجنب افتراضيا |
|---|---|---|---|
| الدخول | طلب المستخدم | معرف التتبع، المسار، شريحة المستخدم، نوع الطلب | رسالة المستخدم الكاملة من دون سياسة |
| المطالبة | تجميع المطالبة | معرف القالب، الإصدار، معرفات السياق، حالة الحجب | السياق السري الخام |
| الاسترجاع | البحث أو إعادة الترتيب | اسم الفهرس، معرفات المستندات، نطاقات الدرجات، عدد النتائج | المستندات الخاصة الكاملة |
| النموذج | استدعاء GenAI | المزود، النموذج، المعلمات، زمن الاستجابة، استخدام الرموز | الأسرار في المطالبات أو الإكمالات |
| الأداة | تنفيذ الأداة | اسم الأداة، الحالة، المدة، فئة الخطأ | بيانات اعتماد الأداة أو المخرجات الحساسة الخام |
| التحقق | فحص السلامة أو المخطط | نجاح أو فشل، معرف القاعدة، استخدام بديل | نص السياسة الخاص إذا كان مقيدا |
| التقييم | إشارة الجودة | اسم التقييم، إصدار المعيار، نطاق الدرجة | التعامل مع التقييم كحقيقة مطلقة |
يمكن أن تساعد سياسة مدمجة قابلة للقراءة آليا فرق الهندسة والحوكمة على التوافق قبل انتشار القياس:
{
"framework": "Optijara GenAI Trace Map",
"trace_goal": "debug and evaluate one production AI workflow",
"required_spans": ["entry", "prompt_assembly", "retrieval", "model_call", "tool_call", "validation", "evaluation"],
"content_policy": {
"forbidden": ["secrets", "credentials", "unredacted private documents"],
"redacted": ["user text", "tool output"],
"sampled": ["prompt events", "completion events"],
"retained": ["metadata", "trace ids", "template versions", "document ids"]
}
}أنماط التنفيذ، من استدعاء واحد لنموذج اللغة الكبير إلى الوكلاء
أبسط تنفيذ يتتبع طلب نموذج واحدا داخل تتبع تطبيق قائم. يكون span الأصل هو طلب المستخدم أو المهمة الخلفية. ويكون span الابن هو عملية GenAI. ينبغي أن يلتقط المزود أو النظام، والنموذج المطلوب، واسم العملية، والمعلمات ذات الصلة، وزمن الاستجابة، والحالة، واستخدام الرموز عند توفره، ونموذج الاستجابة عند توفره، وتفاصيل الاستثناء إذا فشل الاستدعاء.
يحتاج التوليد المعزز بالاسترجاع إلى أكثر من span للنموذج. يتضمن تتبع RAG المفيد عادة إعادة صياغة الاستعلام، والبحث بالتضمينات، وإعادة الترتيب، ومعرفات المستندات المختارة، وتجميع السياق، والتوليد النهائي، والتحقق من الاستشهادات، وتجميع الاستجابة. تهم معرفات المستندات لأنها تتيح للفرق تدقيق المصادر التي أثرت في الإجابة من دون وضع المستندات السرية الكاملة داخل القياسات.
بالنسبة إلى الوكلاء، مثل مسار العمل كشجرة. يكون span الجذر هو مهمة المستخدم. يمكن أن تشمل spans الأبناء التخطيط، واستدعاءات النموذج، واختيار الأدوات، وكل تنفيذ أداة، والتحقق من مخرجات الأداة، والتأمل، وقراءات الذاكرة، والتحقق من الاستجابة، والإنهاء. إذا استدعى الوكيل أدوات بالتوازي، ينبغي أن يكون كل استدعاء أداة مرئيا كspan شقيق مع الحالة والمدة.
user_task: investigate_invoice_question
prompt_assembly: support_agent_v4
model_call: plan_next_step
tool_call: search_orders status=ok
tool_call: fetch_invoice status=timeout
model_call: revise_plan_after_timeout
tool_call: fetch_invoice status=ok retry=1
validation: policy_and_schema_check status=passed
response_assembly: final_answerتوثق LangSmith دعم تتبع OpenTelemetry، وهو مثال مفيد على التكامل في المنظومة. يمكن لقياس الأطر أن يقلل عمل spans اليدوي، خصوصا عندما تستخدم الفرق بالفعل إطارا للسلاسل، أو الأدوات، أو الوكلاء. تعامل مع ذلك القياس كنقطة بداية، ثم افحص التتبعات المصدرة. يقترن هذا جيدا مع نظافة هندسية أوسع مثل استخدام uv لمسارات عمل مشاريع Python، حيث تجعل الأدوات القابلة للتكرار والبيئات المتسقة نشر المراقبة أسهل في الصيانة.
خطة التبني والتقييم
يبدأ النشر الآمن بمسار عمل واحد وقائمة تحقق اختبارية. تحقق من استمرارية التتبع عبر الخدمات. تأكد من أن أسماء سمات GenAI تطابق وثائق OpenTelemetry الحالية التي اختار فريقك اتباعها. افحص سلوك أخذ العينات. اختبر حجب المطالبات. افحص الاستجابات المتدفقة. تأكد مما إذا كان استخدام الرموز متاحا من مزودك وكيف يتم تمثيله. تأكد من التقاط أخطاء الأدوات كأخطاء أدوات، لا كاستثناءات عامة فقط. استعلم عن التتبعات في الخلفية وتأكد من أن مهندسي المناوبة يستطيعون العثور على ما يحتاجون إليه.
| مجال الاختبار | ما يجب التحقق منه | لماذا يهم |
|---|---|---|
| استمرارية التتبع | يتبع تتبع واحد الطلب عبر التطبيق، والاسترجاع، والنموذج، والأدوات | يمنع التشخيص المجزأ |
| تسمية السمات | تتوافق الأسماء مع إصدار OpenTelemetry GenAI المختار | يحسن قابلية النقل والاستعلامات |
| الحجب | تتم تصفية المطالبات، والمستندات، ومخرجات الأدوات الحساسة | يقلل مخاطر الخصوصية والأمان |
| أخذ العينات | لا تطغى مسارات العمل ذات الحجم العالي على التخزين | يضبط تكلفة القياسات والضجيج |
| البث | تمثل القطع، والاستجابة النهائية، وسبب التوقف بصورة متسقة | يجعل أعطال البث قابلة للتشخيص |
| بيانات الرموز الوصفية | حقول الرموز موجودة حيث يكشفها المزودون | يدعم مراجعة الاستخدام مع تحفظات |
| استعلامات الخلفية | يستطيع المهندسون البحث حسب معرف التتبع، والنموذج، ومسار العمل، ونوع الخطأ | يجعل القياسات قابلة للاستخدام أثناء الحوادث |
تجنب التقاط المطالبات الكاملة افتراضيا. تجنب الاعتماد على لوحة معلومات واحدة كمصدر للحقيقة. تجنب التعامل مع عدد الرموز كرقم دقيق عبر كل مزود ومسار عمل. تجنب قياس كل دالة مساعدة. تجنب تجاهل سياسة الاحتفاظ والوصول. تجنب استخدام التتبعات كدليل على أن الإجابة كانت جيدة. تستمر اصطلاحات OpenTelemetry في التطور، لذلك ينبغي للفرق تثبيت إصدارات القياس، وتوثيق الافتراضات، ومراجعة تغييرات الاصطلاحات قبل النشر الواسع.
أخطاء شائعة ترتكبها الفرق
أسرع طريقة لإنشاء خطر في المراقبة هي تسجيل المطالبات والإكمالات أولا، ثم مناقشة السياسة لاحقا. يمكن أن تحتوي المطالبات على بيانات شخصية، أو مستندات سرية، أو بيانات اعتماد، أو شفرة مصدرية، أو خطط أعمال خاصة، أو معلومات منظمة. حدد الحقول المحظورة، والمحجوبة، والمأخوذة كعينات، والمحتفظ بها قبل القياس.
التتبع الخاص بالنموذج فقط ضيق جدا بالنسبة إلى الوكلاء. تحدث كثير من الإخفاقات خارج النموذج: يعيد الاسترجاع سياقا ضعيفا، أو تنتهي مهلة أداة، أو يتم تخطي التحقق، أو تحتوي الذاكرة على معلومات قديمة، أو يسقط تجميع الاستجابة تفصيلا مهما. إذا توقف التتبع عند span النموذج، فقد يلوم الفريق الطبقة الخطأ.
ينبغي أن تجيب كل سمة عن سؤال. من سيستخدم هذا الحقل، أثناء أي مسار عمل، وأي قرار سيدعمه؟ إذا لم يستطع أحد الإجابة، فربما يكون الحقل ضجيجا. التتبعات دليل على العملية. التقييمات دليل على جودة المخرجات، وحتى التقييمات تحتاج إلى تصميم معيار بعناية.
كيف تختار مشروع التتبع الأول
ليس أفضل مشروع أول دائما هو ميزة الذكاء الاصطناعي الأكثر تعقيدا. اختر مسار عمل ستغير فيه المراقبة القرارات قريبا.
| المعيار | إشارة أولوية منخفضة | إشارة أولوية عالية | إرشاد المشروع الأول |
|---|---|---|---|
| الأهمية التجارية | تجربة داخلية | مسار عمل موجه للمستخدم أو مهم تشغيليا | فضل الأثر العالي مع نطاق محدود |
| ألم التصحيح | الإخفاقات نادرة أو واضحة | الإخفاقات متكررة، أو غامضة، أو مكلفة في التحقيق | مرشح قوي |
| حساسية الخصوصية | بيانات عامة أو اصطناعية في الغالب | بيانات مستخدمين أو مستندات حساسة | ابدأ فقط بسياسة حجب صارمة |
| تعقيد مسار العمل | استدعاء نموذج واحد | استرجاع، أدوات، تحقق، إعادة محاولات، أو وكلاء | تضيف خريطة التتبع قيمة أكبر |
| نضج OpenTelemetry | لا يوجد تتبع قائم | تتبعات موزعة قائمة ومسار OTLP | نشر أسهل |
| جاهزية الخلفية | لا يوجد نموذج استعلام أو وصول | تتبعات قابلة للاستعلام مع ضوابط وصول | تبن إنتاجي أكثر أمانا |
المعلم الأول العملي هو طلب واحد من البداية إلى النهاية مع شجرة تتبع قابلة للقراءة. ينبغي أن يتصل التتبع بسجلات التطبيق عبر معرف التتبع. ينبغي أن يعرض تجميع المطالبة، والاسترجاع إن وجد، واستدعاء النموذج، ونتائج الأدوات إن وجدت، والتحقق من الاستجابة، وإشارة تقييم أو مراجعة واحدة. ينبغي التحقق من الحجب قبل أي نشر أوسع.
إذا كان فريقك ينتقل من النماذج الأولية إلى مسارات عمل ذكاء اصطناعي إنتاجية، يمكن أن تساعد Optijara في رسم التتبعات، والتقييمات، وفحوص الحوكمة قبل أن يصبح القياس مزعجا أو عالي المخاطر. ينبغي أن يكون الهدف مراقبة محايدة تجاه البائع تساعد الفرق على تصحيح أنظمة الذكاء الاصطناعي وتقييمها وتشغيلها بحدود واضحة.
يكون تتبع OpenTelemetry GenAI أكثر فائدة عندما توحد الفرق قبل التوسع، وتتتبع القرارات بدلا من كل استدعاء ممكن، وتحمي المحتوى الحساس، وتربط التتبعات بالتقييمات، وتبقي الاصطلاحات قيد المراجعة مع نضج المنظومة.
النقاط الرئيسية
- 1يوحد تتبع OpenTelemetry GenAI طريقة وصف الفرق لاستدعاءات النماذج، والمطالبات، والإكمالات، والأدوات، والوكلاء، واستخدام الرموز، وبيانات المزودين الوصفية.
- 2تكون التتبعات أكثر قيمة عندما تصمم حول قرارات التصحيح، والتقييم، ومراجعة التكلفة، والحوكمة، وتحليل الحوادث.
- 3تحتاج مراقبة الوكلاء إلى spans أصل وابن للتخطيط، والاسترجاع، واستدعاءات الأدوات، والتحقق، وإعادة المحاولات، وتجميع الاستجابة، لا إلى استدعاءات النماذج فقط.
- 4ينبغي أن يخضع التقاط المطالبات والإكمالات لسياسة، وحجب، وأخذ عينات، وحدود احتفاظ، وضوابط وصول.
- 5تحسن اصطلاحات OpenTelemetry قابلية النقل، لكن الفرق ما زالت تحتاج إلى التحقق من دعم الخلفية، وقابلية الاستعلام، وجودة التصور.
الخلاصة
يمنح تتبع OpenTelemetry GenAI فرق الإنتاج لغة مشتركة لفحص مسارات عمل نماذج اللغة الكبيرة والوكلاء، لكن المعيار لا يساعد إلا عندما يطبق بانضباط. ابدأ بالقرارات التي يجب أن تدعمها تتبعاتك، وحدد حدود spans قبل كتابة القياس، واحم المحتوى الحساس افتراضيا، واربط التتبعات بالتقييمات، والحوادث، ومراجعات النشر. هذا يبقي المراقبة عملية بدلا من أن تكون مزعجة.
الأسئلة الشائعة
ما هو OpenTelemetry GenAI؟
OpenTelemetry GenAI هو مجموعة من الاصطلاحات الدلالية وأنماط القياسات لتتبع عمليات الذكاء الاصطناعي التوليدي مثل استدعاءات النماذج، والمطالبات، والإكمالات، واستخدام الرموز، واستدعاءات الأدوات، والاستثناءات، والمقاييس، وspans مسارات عمل الوكلاء.
كيف تختلف مراقبة نماذج اللغة الكبيرة عن مراقبة التطبيقات التقليدية؟
تتتبع المراقبة التقليدية صحة الخدمات، وزمن الاستجابة، والأخطاء. تحتاج مراقبة نماذج اللغة الكبيرة أيضا إلى رؤية في تجميع المطالبات، وسياق الاسترجاع، ومعلمات النموذج، واستدعاءات الأدوات، واستخدام الرموز، ونتائج التحقق، وإشارات الجودة.
هل ينبغي للفرق تخزين المطالبات والإكمالات في التتبعات؟
ليس افتراضيا. ينبغي للفرق تحديد السياسة أولا، ثم استخدام الحجب، وأخذ العينات، وحدود الاحتفاظ، وضوابط الوصول. غالبا ما تكون البيانات الوصفية، والمعرفات، والتجزئات، والمقتطفات المحجوبة أكثر أمانا من المحتوى الكامل.
هل يستطيع OpenTelemetry تتبع وكلاء ذكاء اصطناعي متعددة الخطوات؟
نعم. يمكن للفرق نمذجة مسارات عمل الوكلاء كspans أصل وابن للتخطيط، وتجميع المطالبات، واستدعاءات النماذج، والاسترجاع، وتنفيذ الأدوات، والتحقق، وإعادة المحاولات، وقراءات الذاكرة، وتجميع الاستجابة.
هل يستبدل OpenTelemetry أدوات التقييم لتطبيقات نماذج اللغة الكبيرة؟
لا. تشرح التتبعات ما حدث أثناء طلب ما. تساعد التقييمات في الحكم على ما إذا كانت المخرجات صحيحة، وآمنة، ومفيدة، ومتوافقة مع المهمة. تحتاج فرق الإنتاج عادة إلى الاثنين معا.
المصادر
- https://opentelemetry.io/docs/specs/semconv/gen-ai/
- https://github.com/open-telemetry/semantic-conventions/tree/main/docs/gen-ai
- https://github.com/open-telemetry/semantic-conventions/pull/3696
- https://opentelemetry.io/blog/2024/llm-observability/
- https://docs.langchain.com/langsmith/trace-with-opentelemetry
- https://github.com/open-telemetry/semantic-conventions/issues?q=is%3Aissue%20gen_ai
بقلم
Hamza Diazحمزة دياز هو مؤسس Optijara، حيث يبني وكلاء ذكاء اصطناعي عمليين، وأنظمة أتمتة، وسير عمل Copilot للشركات الخدمية. يكتب عن تشغيل الذكاء الاصطناعي، واستراتيجية الوكلاء، والتطبيق الواقعي للفرق التي تريد أنظمة مفيدة بدلًا من الضجيج.
