مجموعة بيانات Vaani للطوابع الزمنية لأحداث الضوضاء: خريطة عملية لتقييم الكلام
توفر توصيفات أحداث الضوضاء في Vaani نقطة انطلاق لتقييم الواجهات الصوتية في ظل ضوضاء حقيقية متزامنة. تفصل هذه الخريطة العملية بين فئات التوصيف، وتشرح التعارض بين أرقام محتويات المجموعة، وتوضح كيفية تصميم اختبارات تستخدم المقاطع نفسها وتراعي اختلاف اللغات دون المبالغة فيما تثبته الطوابع الزمنية.
ما مجموعة بيانات Vaani للطوابع الزمنية لأحداث الضوضاء؟
تضيف مجموعة بيانات Vaani للطوابع الزمنية لأحداث الضوضاء توصيفات لأحداث الضوضاء إلى تسجيلات الكلام من مشروع Vaani. وتتيح للفرق اختبار الواجهات الصوتية في مواجهة أصوات تتزامن في تسجيلات حقيقية. وتعتمد صلاحية الاختبارات على التوصيفات والنصوص المفرغة يدويا المتاحة. تحدد الطوابع الزمنية للضوضاء حدود الأحداث الصوتية، لكنها لا تحاذي الكلمات مع الصوت.
تخيل واجهة صوتية على هاتف تسجل طلبا بجانب طريق مزدحم. ينبح كلب في منتصف التسجيل. يكون النص المفرغ خاطئا، لكن النص وحده لا يكشف السبب. ربما أغفل نظام التعرف جزءا من الكلام. وربما أزالت مرحلة تحسين الصوت إشارة مفيدة. بل قد يكون مرجع التقييم نفسه هو السبب إذا تضمن تسمية للضوضاء كما لو أن شخصا نطق بها. هذا مثال افتراضي، لكنه يوضح سبب ضرورة فحص التوصيفات قبل مقارنة النماذج.
يصف الشرح التقني الذي نشرته ARTPARK-IISc في 7 سبتمبر نهج الجمع والتوصيف. وتسبق بطاقة مجموعة البيانات ذلك المقال، لذا ينبغي ألا يُقرأ الشرح بوصفه إعلانا عن الإطلاق. تغطي المجموعة لغات هندية. ويهم هذا النطاق عند تحديد المجالات التي قد تنطبق عليها النتائج، لكنه لا يثبت تمثيلا عالميا.
تربط خريطة تقييم تداخل الضوضاء التي تقترحها Optijara بين هذه التوصيفات والاختبارات التي يمكنها دعمها. ويمكن لهذا النهج أن يفيد تقييم الواجهات الصوتية في سياقات أخرى دون الإيحاء بأن مجموعة البيانات هذه تمثل جميع فئات المستخدمين. تكشف التسجيلات الطبيعية عن الأصوات المتزامنة، بينما يمكن للمزج الاصطناعي المضبوط عزل ظروف مختارة. ولكل منهما دور. ولا يحسم أي منهما بمفرده الأداء عند النشر.
لماذا يورد الشرح وبطاقة مجموعة البيانات إجماليات مختلفة؟
تورد المصادر حصيلتين مختلفتين لمحتويات المجموعة، ولا تفسر الأدلة المتاحة هذا الاختلاف بالكامل. أبق كل رقم منسوبا إلى مصدره.
| المصدر | المحتويات المعلنة | التفسير |
|---|---|---|
| شرح 7 سبتمبر | 106,892 حدثا؛ أكثر من 122 ساعة؛ 72,756 مقطعا كلاميا؛ 38,541 متحدثا؛ 58 لغة هندية | أرقام الشرح، ولا تمثل تلقائيا المحتويات الحالية للملفات |
| بطاقة مجموعة بيانات الضوضاء في البحث المقدم | 90,637 مقطعا؛ نحو 154.6 ساعة | محتويات البطاقة، مقسمة بحسب جودة التوصيف |
الحدث ليس مقطعا صوتيا. فقد تقع عدة أحداث داخل مقطع، ولا تضيف الأصوات المتزامنة وقتا إلى مدة التسجيل. وحتى استبعاد فئة no_timestamps من البطاقة لا يحل التباين في عدد المقاطع. ولا توجد تسوية مدعومة بالأدلة يمكن اعتمادها هنا.
قبل إجراء تجربة، سجل بطاقة مجموعة بيانات الضوضاء ومراجعة ثابتة من المستودع متى أمكن الحصول عليها. وأدرج تاريخ الوصول وحدد الفئات والتسجيلات المؤهلة للاستخدام. تساعد واجهة الملفات والإصدارات على تحديد الملفات، لكن محتويات رابط main قد تتغير. فهو لا يثبت مراجعة بعينها.
تشرح مجموعة بيانات Vaani الأصلية والورقة البحثية لمشروع VAANI الأصلي المشروع الأوسع. وينبغي ألا تحل أرقامهما محل أرقام محتويات إصدار الضوضاء.
إتاحة البطاقة للعامة لا تعني أن الملفات غير مقيدة
تصف البطاقة مجموعة تقييم إضافية مدتها 10 ساعات، جرى التحقق منها وفصل متحدثيها عن بقية البيانات. وهي محجوزة للتقييم وغير مضمنة في هذا الإصدار. ولا يمكن لخطة اختبار أن تفترض إتاحتها. يمكن قراءة البطاقة علنا، لكن ملفات مجموعة البيانات الفعلية تتطلب تسجيل الدخول والامتثال لشروط.
لم تُنزّل Optijara تسجيلات، ولم تقبل شروط مشاركة بيانات الاتصال، ولم تشغّل استدلالا أو تنفذ اختبارا معياريا لهذا المقال. ولا تُلغي الإشارة إلى CC-BY-4.0 في البيانات الوصفية شروط الوصول المعمول بها أو الالتزامات المتعلقة بالنسب والخصوصية والموافقة. راجع تلك الشروط قبل معالجة التسجيلات.
ثلاث فئات من التوصيفات والاختبارات التي يمكنها دعمها
تقسم بطاقة مجموعة البيانات المحتويات كما هو مبين أدناه. والاختبارات المقترحة إرشادات منهجية من Optijara، وليست وعودا من ناشر مجموعة البيانات.
| اسم الفئة كما هو | عدد المقاطع والمدة بحسب البطاقة | الاستخدام المقترح بعد فحوص الأهلية | استنتاج غير مدعوم |
|---|---|---|---|
| verified_timestamps | 11,111؛ نحو 21.8 ساعة | التقسيم الأساسي إلى شرائح بحسب تغطية الضوضاء بعد فحص الحدود والمراجع | كل حد جرى التحقق منه مثالي |
| unverified_timestamps | 61,642؛ نحو 100.3 ساعة | شرائح استكشافية وتدقيق موجه للتوصيفات، مع عرضها منفصلة | موثوقيتها تساوي موثوقية الفئة المتحقق منها |
| no_timestamps | 17,884؛ نحو 32.4 ساعة | تقييم على مستوى المقطع باستخدام مراجع يدوية مناسبة | غياب الطوابع الزمنية يعني خلو الصوت من الضوضاء |
ابدأ التحليل المعتمد على الحدود بالتوصيفات المتحقق منها، ثم افحص الحالات المشتبه بها بالاستماع. والتحقق إجراء لضمان الجودة أبلغ عنه مؤلفو البيانات. ولا يجعل كل حد صحيحا. احتفظ بمواضع الاختلاف كي يتمكن مراجع لاحق من معرفة أين تغير التفسير.
يجب أن تظل الفترات غير المتحقق منها قابلة للتمييز منذ أخذ العينات وحتى عرض النتائج. فقد يتبين أن إخفاقا قرب حد حدث ما ناتج عن مشكلة في التوصيف. دقق في هذا الاحتمال قبل إلقاء اللوم على النموذج، وأبق الفئات منفصلة في النتائج.
يمكن لفئة no_timestamps مع ذلك دعم اختبارات التفريغ على مستوى المقطع حيث تتوفر مراجع يدوية مناسبة. لكنها لا تتيح فئات ضوضاء مشتقة من الطوابع الزمنية دون توصيف إضافي. ولا يدل غياب التسمية على هدوء التسجيل أو ضجيجه.
تستخدم أمثلة تمثيل الطوابع الزمنية سلاسل نصية بوحدة الثواني، لذا يجب تحديد طريقة تحويلها صراحة. تخبرك المنازل العشرية بكيفية تمثيل القيمة. لكنها لا تثبت دقة الحدود على مستوى المللي ثانية، ولا توفر محاذاة للكلمات.
تطبيق خريطة تقييم تداخل الضوضاء
هذا سير عمل تقترحه Optijara، وليس معيارا معتمدا أو اختبارا معياريا منفذا. والغرض منه كشف القياسات التي لا تستطيع الأدلة دعمها قبل أن تؤثر تلك القياسات في قرار.
التحقق من الفترات وحماية مرجع الكلام
حوّل سلاسل الطوابع الزمنية إلى أرقام وارفض القيم غير المنتهية أو غير العددية. يجب ألا تكون أوقات البداية سالبة، وأن تأتي أوقات النهاية بعد البداية. افحص الحدود بمقارنتها بمدة المقطع حيث تكون متاحة. علّم الفترات غير السليمة للمراجعة بدلا من اقتطاعها بصمت، لأن ذلك يغير الأدلة.
ادمج فترات الأحداث المتداخلة قبل حساب مقدار التسجيل الذي يحتوي على ضوضاء. فجمع مدد الأحداث منفردة سيحتسب الأصوات المتزامنة أكثر من مرة. لكن احتفظ بتسمياتها منفصلة حتى لا يمحو الحساب الفرق بين أصوات المرور والحيوانات.
الناتج هو نسبة مدة المقطع التي تغطيها الضوضاء. أما قياس تداخل الكلام والضوضاء فيتطلب فترات كلام محددة بصورة مستقلة وحساب التقاطع معها. ولا تستطيع حدود الضوضاء وحدها أن تخبرك بدقة متى يتحدث شخص ما.
احم مرجع الكلام بالعناية نفسها. أبق وسوم الأحداث منفصلة عن النص المفرغ بعد توحيد صيغته، وأزل علامات التوصيف دون حذف المحتوى المنطوق، واحتفظ بالأصل للتدقيق. يتطلب معدل خطأ الكلمات WER أو معدل خطأ المحارف CER نصا مفرغا يدويا مناسبا. وتشرح وثائق استخدام JiWER التحويلات التي تُطبق على المرجع والنص الناتج. سجل التحويلات التي تستخدمها التجربة فعليا؛ فالإعداد الافتراضي غير الموضح يجعل النتيجة أصعب تفسيرا.
إثبات صلاحية التقسيم قبل إنشاء الشرائح
تفتقر الحقول المدرجة في البطاقة إلى معرّف للمتحدث. ولا يمكن ببساطة افتراض وجود عمود speaker_id. اطلب مفتاح ربط ثابتا وتحقق من صلاحيته قبل الادعاء بأن المتحدثين منفصلون بين أقسام البيانات. وإذا لم يتوفر، فاذكر أنه تعذر التحقق من فصل المتحدثين. ولا يحل التقسيم العشوائي للمقاطع هذا الغموض. كما أن تقسيم الناشر غير المتاح لا يثبت صلاحية تقسيم بديل.
حدد الشرائح بحسب اللغة ونوع الضوضاء، مع الاحتفاظ بفئة التوصيف والتغطية المتاحة. حدد حدود فئات التغطية قبل الاطلاع على نتائج المقارنة. وأظهر الخانات قليلة العينات والخانات الخالية، ووضح التسجيلات التي استُبعدت من مقامات حساب درجات التفريغ.
البيان أدناه قالب مقترح. وقيم null فيه مقصودة: فهذه الإعدادات غير معروفة، ولم تُنجز أي قياسات.
{
"framework": "Noise-Overlap Evaluation Map",
"dataset_url": "https://huggingface.co/datasets/ARTPARK-IISc/Vaani-Noise-Event-Dataset",
"dataset_revision": null,
"annotation_tier": "verified_timestamps",
"transcript_policy": "eligible manual references; event labels separate",
"speaker_split_status": "not_verified_join_key_required",
"overlap_definition": "union noise duration divided by clip duration; not speech overlap",
"asr_config": null,
"enhancement_config": null,
"execution_status": "not_run"
}مقارنة التعرف على الكلام الخام والمحسن باستخدام المقاطع نفسها
مرر التسجيلات الخام عبر إعداد ثابت لنظام التعرف على الكلام. ثم مرر التسجيلات نفسها عبر مرحلة التحسين المحددة ونظام التعرف نفسه. أبق إعدادات فك الترميز وتوحيد النص ثابتة، إلى جانب معالجة الصوت المقصودة. وسجل أي إعادة أخذ عينات أو تحويل للقنوات مطلوبين.
تحتاج سلسلة الأدوات القابلة لإعادة الإنتاج إلى تسجيل مراجعات مستودع Hugging Face ونقاط حفظ نموذج التعرف في بيانها، إلى جانب إعدادات التحسين وتحويلات JiWER. واحتفظ بالطلبات الفاشلة في السجل. فحذف إخفاق من مسار واحد فقط يغير المقارنة.
يقدم اختبار قبول مسار الكلام في SraVaani إرشادات ذات صلة بتقييم التعرف الآلي على الكلام متعدد اللغات. لكنه لا يثبت أن أي نظام تعرف بعينه قد اختُبر باستخدام توصيفات الضوضاء هذه.
استمع بحثا عن إشارات كلامية مفيدة فُقدت أثناء التحسين، حتى حين يبدو الناتج أنقى. ويجب أن يحدد أي ادعاء بالتحسن الشريحة المقيمة وإعداداتها، مع إرفاق سياسة المرجع. فالوصول إلى مجموعة بيانات ليس دليلا على أن نظاما يتعامل جيدا مع كل ظروف الضوضاء.
قياس الإخفاقات بحسب اللغة والضوضاء، لا الدقة الشاملة
يتطلب WER وCER قواعد صريحة لتوحيد النص
توثق JiWER معدل خطأ الكلمات ومعدل خطأ المحارف. يقارن WER عمليات الاستبدال والحذف والإدراج على مستوى الكلمات بطول المرجع. ويقيس CER التعديلات على مستوى المحارف. ويعتمد كلاهما على كيفية تمثيل المرجع والنص الناتج.
دوّن قواعد علامات الترقيم وحالة الأحرف، بما يشمل توحيد الصيغ الكتابية وتقسيم النص إلى وحدات. ولا تصبح درجات اللغات المختلفة قابلة للمقارنة لمجرد اشتراكها في اسم مقياس واحد. افحص عمليات الاستبدال والحذف إلى جانب المعدل الإجمالي؛ فقد تكون للأخطاء المختلفة تبعات مختلفة على الواجهة.
لكل شريحة تجمع بين لغة ونوع ضوضاء، اعرض الأعداد المؤهلة وتغطية المراجع مع فئة التوصيف. يمنح الملخص القائم على المتوسط المتساوي بين اللغات وزنا متساويا لكل لغة مشمولة. أما الترجيح بالمدة فيمنح وقت التسجيل تأثيرا أكبر. ولا يساوي أي منهما تلقائيا معدل WER المحسوب على كامل المتن المجمع. سمّ سياسة التجميع واعرض الشرائح التي يستند إليها.
يذكر الشرح نحو 84 ساعة باللغة الهندية. لذلك ينبغي ألا تُقرأ تغطية 58 لغة على أنها تقييم متوازن، فضلا عن كونها أداء متوازنا. وحيث تكون المراجع المؤهلة قليلة، يجب أن تعكس درجة الثقة في الادعاء هذه الندرة.
إقران درجات التعرف بأدلة الإخفاق ووقت التشغيل
| القياس المقترح | الأدلة المطلوبة | القيد الواجب الإفصاح عنه |
|---|---|---|
| WER وCER وعمليات الاستبدال والحذف | مراجع يدوية مناسبة وتحويلات ثابتة | التأثر باللغة وتقسيم النص إلى وحدات |
| تفريغ نصي غير مدعوم في مقاطع غير كلامية | أمثلة تأكد بصورة مستقلة خلوها من الكلام | حدث الضوضاء لا يثبت غياب الكلام |
| الإشارات اللغوية المحتفظ بها والتشوهات الناتجة عن التحسين | مراجعة بالاستماع أو توصيفات إضافية مناسبة | معايير المراجعة ومواضع الاختلاف |
| زمن الاستجابة والعبء الإضافي للتحسين | جهاز وبيئة تشغيل وطول صوت وظروف طلب محددة | نتائج خاصة بالإعداد المستخدم |
| السلوك من بداية الحدث حتى التعافي | محاذاة مستقلة للكلمات إلى جانب حدود الأحداث | الطوابع الزمنية للضوضاء وحدها غير كافية |
لا يمكن استنتاج نسبة الإشارة إلى الضوضاء من حدود الأحداث. فتقديرات SNR وقياسات التعافي المحددة على مستوى الكلمات تحتاج إلى أدلة إضافية موثقة مع النتيجة.
تقدم منهجية المقارنة العادلة مثالا موازيا مفيدا حول تثبيت ظروف المقارنة؛ لكنها لا تقدم دليلا على أداء أنظمة الكلام. ويظهر التمييز نفسه في الفصل بين المقاييس الوسيطة والنتائج من البداية إلى النهاية. فتحسن درجة التفريغ لا يعني تلقائيا أن المستخدم ينجز المهمة بنجاح أكبر.
خصص في ميزانية التقييم موارد لمراجعة التوصيفات وأعمال الدمج. ويضيف التحسين أيضا عبئا يحتاج إلى قياس. سجل إصدارات المزود والنموذج، وقيود الخصوصية عند معالجة الصوت، والظروف المستخدمة في اختبارات زمن الاستجابة. لا يقدم هذا المقال وفورات مقاسة أو تحسنا مقاسا في الدقة.
أخطاء شائعة وقائمة تحقق لقابلية إعادة الإنتاج
تبدأ معظم الأخطاء هنا بطلب إثباتات من التوصيفات تتجاوز ما تحتويه. يتحول عدد الأحداث إلى عدد مقاطع. ويصبح غياب الطوابع الزمنية ادعاء بأن الصوت خال من الضوضاء. وتُعامل الحدود المتحقق منها كأنها معصومة من الخطأ. ويخلق الجمع بين حصيلتين غير متوافقتين لمحتويات البيانات مشكلة أخرى قبل أن يبدأ التقييم أصلا، بينما يفسد احتساب وسوم الضوضاء المضمنة بوصفها كلاما مرجع التقييم.
عالج هذه المشكلات أثناء إدخال البيانات. فإضافة حاشية بعد اختيار الفائز تأتي متأخرة جدا لإصلاح المقارنة. احتفظ بالتوصيفات الأصلية واجعل كل تحويل واستبعاد قابلا للتتبع.
| الفحص | السجل المطلوب |
|---|---|
| المصدر والوصول | مراجعة ثابتة، وحصر للمحتويات، وموافقة الوصول، والفئات المختارة |
| سلامة التوصيف | فحوص التحويل، والتنبيهات المتعلقة بالفترات، وقرارات التدقيق |
| أهلية المرجع | توفر النص المفرغ يدويا وقواعد توحيده |
| صلاحية التقسيم | مفتاح ثابت للمتحدث أو تصريح واضح بتعذر التحقق من الفصل |
| المقارنة المتطابقة | مقاطع متطابقة، وإعدادات مثبتة، وإخفاقات ظاهرة |
| عرض النتائج | أعداد الشرائح، وسياسة التجميع، وظروف التشغيل، وعدم اليقين |
لا تستطيع قائمة التحقق توفير مجموعة التقييم المحجوزة غير المتاحة أو حل تفاوت التغطية اللغوية. وتظل الحدود غير المؤكدة قيدا، وكذلك احتمال تسرب المتحدثين بين الأقسام وقلة العينات في بعض الفئات. ولا توجد هنا نتائج أجرتها Optijara تحسم هذه المسائل.
إذا كانت النصوص المفرغة تغذي نظام استرجاع أو مساعدا، فقيّم التعرف وجودة الإجابات بصورة منفصلة. ففي تطبيق يستخدم Claude مع التوليد المعزز بالاسترجاع RAG، مثلا، ينبغي ألا يُعزى إخفاق الاسترجاع أو ضعف الإجابة تلقائيا إلى التعرف الآلي على الكلام. وبالمثل، لا يثبت انخفاض WER أن الإجابات أصبحت أفضل استنادا إلى المصادر. احتفظ بسجل منشأ النص المفرغ واختبر المهمة النهائية بصورة مستقلة.
ينبغي أن يثبت التحسين جدواه حتى يحتل مكانا في مسار المعالجة. عامله كخيار يُختبر، مع إظهار تشوهاته وتكلفة تشغيله إلى جانب درجات التعرف. استخدم المزج المضبوط حين يفيد عزل ظرف ضوضاء معين، والتسجيلات الطبيعية حين يكون تزامن الأصوات مهما. فالهدف قرار يمكن تبريره بشأن واجهة صوتية، تسنده توصيفات موجودة فعلا.
النقاط الرئيسية
- 1ثبّت حصر محتويات المصدر ومراجعة المستودع بدلا من دمج إجماليات الشرح وبطاقة مجموعة البيانات.
- 2أبق verified_timestamps وunverified_timestamps وno_timestamps منفصلة؛ فغياب الطوابع الزمنية لا يعني خلو الصوت من الضوضاء.
- 3تحقق من فترات الأحداث وأهلية المراجع اليدوية قبل حساب تغطية الضوضاء أو درجات التفريغ.
- 4قارن إعدادات التعرف على الكلام الخام والمحسن باستخدام المقاطع نفسها، مع سياسات صريحة للغة وتوحيد النص والتجميع.
- 5أفصح عن غياب الأدلة على فصل المتحدثين، وعدم إتاحة بيانات التقييم المحجوزة، وقلة العينات في الشرائح، وعدم اليقين في التوصيف.
الخلاصة
تمنح Vaani فرق أنظمة الكلام نقطة انطلاق مفيدة لاختبار ضوضاء حقيقية متزامنة. والخطوة التالية هي مواءمة التجربة مع فئة التوصيف، مع إبقاء منشأ البيانات والمراجع واضحا. اعرض الفجوات إلى جانب الدرجات. ويظل أي ادعاء بالتحسن بحاجة إلى مقارنة مقاسة. ولتحويل هذه الخيارات إلى خطة عملية لتقييم الكلام، ناقش مع Optijara نهجا يراعي التوصيفات.
الأسئلة الشائعة
فيم تفيد مجموعة بيانات Vaani للطوابع الزمنية لأحداث الضوضاء؟
تدعم تصميم تقييمات للكلام تراعي ضوضاء حقيقية متزامنة. وتعتمد صلاحية الاختبارات على فئة التوصيف والمراجع اليدوية المناسبة. ولا تمثل حدود أحداث الضوضاء فيها محاذاة للكلمات، ولم تُنزّل Optijara مجموعة البيانات أو تجر عليها اختبارا معياريا.
لماذا يورد شرح Vaani وبطاقة مجموعة البيانات إجماليات مختلفة؟
يوردان حصيلتين مختلفتين لمحتويات المجموعة، ولا توفق الأدلة المتاحة بينهما بالكامل. انسب كل رقم إلى مصدره وثبّت مراجعة المستودع. ولا تجمع أعداد الأحداث أو المقاطع أو المدد لاستنتاج إجمالي.
هل تعني no_timestamps أن الصوت لا يحتوي على ضوضاء؟
لا. تعني غياب توصيفات الطوابع الزمنية، ولا تعني خلو التسجيلات من الضوضاء. وقد تكون اختبارات التفريغ على مستوى المقطع ممكنة باستخدام مراجع يدوية مناسبة؛ أما التغطية المشتقة من الطوابع الزمنية فتتطلب توصيفا إضافيا.
هل يمكنني استخدام مجموعة التقييم المحجوزة ذات المتحدثين المنفصلين؟
تصف البطاقة مجموعة إضافية مدتها 10 ساعات، جرى التحقق منها وفصل متحدثيها عن بقية البيانات، وهي غير مضمنة في الإصدار. لا تفترض إتاحتها. ويتطلب إنشاء تقسيم بديل منفصل المتحدثين مفتاح ربط ثابتا للمتحدث جرى التحقق من صلاحيته، وهو ما لا توفره الحقول المدرجة في البطاقة.
هل توفر الطوابع الزمنية للضوضاء محاذاة للكلمات أو نسبة الإشارة إلى الضوضاء؟
لا. فحدود أحداث الضوضاء وحدها لا تثبت محاذاة الكلمات ولا نسبة الإشارة إلى الضوضاء SNR. كما أن الدقة العشرية لا تثبت دقة الحدود على مستوى المللي ثانية. وتتطلب قياسات التعافي محاذاة مستقلة، ويتطلب تداخل الكلام والضوضاء فترات كلام محددة بصورة مستقلة.
كيف ينبغي مقارنة WER وCER في الكلام متعدد اللغات المصحوب بالضوضاء؟
استخدم مراجع يدوية مناسبة، وافصل وسوم الأحداث عن الكلام، وثبّت قواعد توحيد النص وتقسيمه إلى وحدات. قارن المقاطع نفسها، واعرض شرائح بحسب اللغة والضوضاء مع الأعداد المؤهلة، وميّز بين التجميع بمتوسط متساو بين اللغات، والترجيح بالمدة، والحساب على كامل المتن المجمع.
المصادر
- https://huggingface.co/blog/ARTPARK-IISc/a-real-world-dataset-for-noise-robust-speech-ai
- https://huggingface.co/datasets/ARTPARK-IISc/Vaani-Noise-Event-Dataset
- https://huggingface.co/datasets/ARTPARK-IISc/Vaani-Noise-Event-Dataset/tree/main
- https://huggingface.co/datasets/ARTPARK-IISc/Vaani
- https://arxiv.org/abs/2603.28714
- https://jitsi.github.io/jiwer/
- https://jitsi.github.io/jiwer/usage/
بقلم
Hamza Diazحمزة دياز هو مؤسس Optijara، حيث يبني وكلاء ذكاء اصطناعي عمليين، وأنظمة أتمتة، وسير عمل Copilot للشركات الخدمية. يكتب عن تشغيل الذكاء الاصطناعي، واستراتيجية الوكلاء، والتطبيق الواقعي للفرق التي تريد أنظمة مفيدة بدلًا من الضجيج.
