دقة الشات بوت العربي هي السؤال الذي تطرحه معظم الشركات الخليجية في النهاية، بينما يجب طرحه في البداية. ليس السؤال هل يتحدث العربية — فالنماذج الحالية تتقنها لغوياً — بل كم مرة يعطي العميل إجابة صحيحة فعلاً، بالنبرة المتوقعة، ومن مصدر تتحكم أنت به. إليك كيف تقيسها بصدق وكيف تعالج الفجوات.

دقة الشات بوت العربي أربعة أرقام لا رقم واحد

تطلب الفرق نسبة واحدة. لكن المراجعة المفيدة تقسّم النظام إلى أربع مراحل، لأن كل مرحلة تفشل بطريقة مختلفة وتُعالج بطريقة مختلفة:

الفشل المكلف نادراً ما يكون في المرحلة الأولى؛ فالنماذج الحالية تفهم اللهجة الخليجية بما يكفي. الضرر الحقيقي هو جملة عربية واثقة وسليمة نحوياً تذكر سعراً توقفتم عن العمل به منذ أشهر. الطلاقة نفسها هي ما يجعل الإجابة العربية الخاطئة باهظة الثمن، لأن العميل يصدقها. إن كنت لا تزال في مرحلة البناء، فدليلنا حول بناء شات بوت عربي يشرح البنية التي تفترضها هذه الأرقام.

خمسة أسباب حقيقية لخطأ الإجابات العربية

انحراف النبرة. يكتب العميل بالكويتي فيجيب البوت بفصحى رسمية تشبه التعميم الحكومي، أو يبالغ في التقليد بلهجة يعرفها نصف معرفة. المسافة بين العربية المكتوبة والمنطوقة واسعة، واختيار النبرة قرار منتج مقصود نتناوله في لهجات الشات بوت العربي.

الأرقام والتواريخ والعملة. أرقام هندية مقابل لاتينية، دينار كويتي بثلاث خانات عشرية، تقويم هجري مقابل ميلادي، وأسعار مكتوبة أرقاماً في مستند وحروفاً في آخر. في المراجعات التي ننفذها، نسبة كبيرة من الإجابات الخاطئة سببها التنسيق لا الاستنتاج.

الأسماء والنقحرة. منتج واحد بخمس طرق كتابة بين العربية والإنجليزية. إذا لم يطابق البحث أياً منها فلن يعيد شيئاً، ويملأ النموذج الفراغ من معرفته العامة.

الكتابة المختلطة. عملاء الخليج يكتبون بالعربيزي ويبدّلون اللغة داخل الجملة ويتركون التشكيل. إذا كان فهرسك يحتوي عربية تحريرية نظيفة فقط، فستضيع هذه الاستفسارات.

مصادر قديمة. معظم ما يُسمى هلوسة في تحقيقاتنا كان البوت يقرأ بأمانة ملف PDF لم يحدّثه أحد منذ عام. الدقة مسألة تشغيل محتوى بقدر ما هي مسألة نموذج.

ابنِ مجموعة الاختبار العربية قبل الإطلاق

هذه هي الخطوة التي يتخطاها الجميع تقريباً، وهي التي تفصل العرض التجريبي عن النظام الحقيقي. قبل الإطلاق اجمع من 100 إلى 150 سؤالاً حقيقياً بالعربية من محادثات واتساب ورسائل إنستغرام وسجل المكالمات، لا أسئلة يخترعها الفريق. احتفظ بالأخطاء الإملائية والعربيزي والرسائل المكوّنة من كلمة واحدة.

اكتب لكل سؤال الإجابة الصحيحة والمستند الذي يجب أن تأتي منه. هذا الاقتران هو أداة التقييم لديك. شغّل المجموعة كاملة مع كل إصدار وسجّل أربعة أرقام: كم إجابة صحيحة، وكم صحيحة بنبرة خاطئة، وكم خاطئة، وكم مرة رفض البوت الإجابة عن حق. تقييم النماذج ممارسة معيارية بالإنجليزية، ولا أحد تقريباً يطبقها بالعربية، وهذا تحديداً سبب ضعف أداء التطبيقات العربية.

المساعد ثنائي اللغة المستند إلى بياناتك يحتاج الانضباط نفسه الذي يحتاجه منتج ثنائي اللغة. حين بنينا دوا، خدمة توصيل صيدلية في الكويت، كان على الجانبين العربي والإنجليزي الاتفاق على أسماء المنتجات والوحدات والتوافر قبل إطلاق أي واجهة للعميل. المساعد الجالس فوق بيانات متضاربة يرث كل تضارب فيها.

ما الشكل المقبول في التشغيل الفعلي

أهداف معقولة لأول إطلاق: من 85 إلى 90 بالمئة إجابات صحيحة على مجموعة اختبارك، وأقل من 2 بالمئة إجابات خاطئة بثقة، والباقي إما رفض واضح أو تحويل إلى موظف مع إرفاق المحادثة. الرفض ليس فشلاً؛ البوت الذي يقول سأتحقق مع زميل لا يكلفك شيئاً، أما الذي يخترع موعد توصيل فيكلفك عميلاً.

ثم استمر في القياس. اقرأ ثلاثين محادثة حقيقية أسبوعياً، وصنّف كل إجابة خاطئة حسب المرحلة، وأصلح المستند المصدر بدل ترقيع التعليمات. ترتفع الدقة لدى معظم الفرق خلال ثلاثة إلى أربعة أشهر بعد الإطلاق بفضل هذه الدورة وحدها، ولهذا يتفوق عقد الدعم الشهري للذكاء الاصطناعي على البناء لمرة واحدة. تفاصيل التكلفة والنطاق موضحة في تكلفة الشات بوت العربي، كما أن قناة النشر مهمة: أداة الموقع تتصرف بشكل مختلف عن الرسائل الخاصة، وهو ما نتناوله في شات بوت عربي للموقع.

إن أردت رأياً خارجياً حول أين يفقد مساعدك الحالي إجاباته، فإن قسم الذكاء الاصطناعي لدينا ينفذ هذا التدقيق بالضبط على محتواك أنت.