انتقل إلى المحتوى الرئيسي
EORBITT

الذكاء الاصطناعي

تطوير ذكاء اصطناعي يُقاس قبل أن يُطلَق.

مساعدون ووكلاء وتدفقات عمل مؤتمتة مبنية على محتواك أنت. استرجاع يذكر مصادره، وضوابط تصمد أمام مستخدم يحاول كسرها، ومجموعة تقييم تمنحك رقماً قبل الإطلاق بدل رأي بعده.

الفجوة

ما الذي يتغيّر بين النموذج الأولي والنظام.

النموذج الأولي عليه أن ينجح مرة واحدة، أمام شخص يريد له أن ينجح. أما النظام في الإنتاج فعليه أن ينجح أمام شخص يحاول كسره، في الثامنة صباحاً، وتحت حجم استخدام كبير، بينما يمرّ مزوّد النموذج بيوم سيّئ. أربعة أمور تتغيّر، وكلها مسائل هندسية لا مسائل تتعلق بالنموذج.

  1. المدخلات تتوقف عن كونها ودّية

    المستخدمون الحقيقيون يلصقون نصف مستند، ويسألون خارج النطاق، ويبدّلون اللغة في منتصف الجملة، ويحاولون إقناع النظام بتجاهل تعليماته. النموذج الأولي لا يرى شيئاً من ذلك.

  2. الخطأ يبدأ في أن يكلّف شيئاً

    إجابة خاطئة واثقة أمام عميل أو جهة تنظيمية أو فريق تشغيل شيء مختلف تماماً عن إجابة خاطئة واثقة في اجتماع. على النظام أن يعرف متى لا يعرف، وأن يمتنع.

  3. يصبح هناك مسؤول عن المخرجات

    بعد ثلاثة أسابيع يسأل أحدهم لماذا قال النظام ذلك. وبدون تسجيل المدخلات والمصادر المسترجعة وإصدار كل مكوّن، لا توجد إجابة تُقدَّم.

  4. النموذج نفسه يتحرّك

    المزوّدون يوقفون إصدارات ويغيّرون الأسعار ويعدّلون السلوك. وإن لم تستطع إعادة القياس، لن تستطيع الترقية بأمان، وتنتهي مقيّداً بنموذج يزداد كلفةً ويقلّ دعماً.

النطاق

ما الذي يشمله العمل.

معظم المشاريع واحد من هذه مع جزء من غيره. وسنخبرك أيّ الأجزاء لا تحتاجها مشكلتك.

  • المساعدون

    إجابة أسئلة من موادك أنت، مع إحالات إلى المستند المصدر، ومسار امتناع حين لا تحتوي المواد على الإجابة.

  • الوكلاء

    أنظمة تستخدم الأدوات وتتخذ إجراءات، مع حدّ مكتوب بين ما يقرره الوكيل وحده وما عليه إحالته إلى شخص، مع أثر تدقيق للحالتين.

  • أتمتة العمليات

    استخراج وتوجيه وتصنيف واعتماد لأعمال لم تُصمَّم يوماً لتقرأها آلة. مسارات الاستثناء تُصمَّم، لأن الاستثناءات في معظم العمليات التشغيلية هي العملية.

  • هندسة الاسترجاع

    الجزء الذي يحدّد ما إذا كان أيٌّ من هذا سينجح: كيف تُقسَّم المستندات، وما الذي يُفهرَس، وكيف يُوسَّع الاستعلام، وكيف تصل الفقرة الصحيحة إلى النموذج حين يُخطئها البحث المباشر.

  • هندسة النماذج

    الاختيار وفق مهمتك أنت لا وفق جدول تصنيف، وتصميم التعليمات والسياق، والضبط الدقيق حيث يستحق تكلفته فقط، واحتساب اقتصاديات الاستدلال قبل أول فاتورة.

  • التكامل

    وضع المخرجات حيث يجري العمل أصلاً، داخل الأنظمة المفتوحة أمام الناس فعلاً، لا خلف نافذة محادثة جديدة لا يفتحها أحد مرتين.

التقييم

رقم قبل الإطلاق.

معظم مشاريع الذكاء الاصطناعي ليس لديها تعريف مكتوب لمعنى «أن ينجح»، ولهذا تدور الخلافات حول ما إذا كان العمل قد انتهى. نحن نبني التعريف أولاً: مجموعة أسئلة حقيقية بإجابات متفق عليها، تُقيَّم آلياً، وتُشغَّل عند كل تغيير. إنه أقل أجزاء العمل بريقاً، وهو الذي يحدّد ما إذا كان الشيء سيُطلَق.

  1. الأسئلة تأتي من موادك

    أسئلة حقيقية يطرحها الناس فعلاً، تُجمَع من طوابير الدعم والبريد ومن يؤدّون العمل. الأسئلة التي يخترعها الفريق الهندسي تقيس الفريق الهندسي.

  2. يعتمد الإجابات من يعرفها

    خبير في المجال يعتمد شكل الإجابة الصحيحة، بما في ذلك الحالات التي تكون فيها الإجابة الصحيحة ألّا يجيب النظام أصلاً.

  3. التقييم على أكثر من التشابه

    الصحّة، وهل الإجابة مستندة إلى مصدر مسترجَع، وهل امتنع حين كان عليه الامتناع، وهل الصيغة صالحة لما سيستهلكها.

  4. يُشغَّل عند كل تغيير

    النموذج والتعليمات والتقسيم والاسترجاع والأدوات. لا يُطلَق شيء يخفض الرقم، ما يعني أيضاً أن الترقية تصبح قياساً لا قفزة في المجهول.

  5. يُسلَّم مع النظام

    تبقى المجموعة والنتيجة لديك. وإن استبدلتنا، تظل قادراً على معرفة ما إذا كان الفريق التالي قد حسّن الأمر أم أساءه.

بياناتك

إلى أين يذهب محتواك، وإلى أين لا يذهب.

هذا عادةً أول سؤال تطرحه المؤسسة، ويستحق تفاصيل محدّدة لا فقرة من الطمأنة. كل بند هنا قرار يُتخذ معك ويُكتب ويظهر في الإعدادات.

  • ما الذي يراه النموذج

    الفقرات التي يحتاجها الاستعلام فقط، لا المجموعة الكاملة. تضييق ذلك مسألة استرجاع، وحلّها جيداً يقلّل الانكشاف والتكلفة معاً.

  • التدريب

    تُضبط عمليات النشر بحيث لا يُستخدم محتواك في تدريب نموذج طرف ثالث، ونُريك الإعداد بدل أن نصفه.

  • مكان البيانات

    أين يجري الاستدلال وأين يعيش الفهرس. وإن وجب بقاء أيٍّ منهما في نطاق قضائي معيّن، فذلك يقيّد اختيار النموذج، ومعرفته وقت التصميم أفضل من معرفتها بعد مراجعة المشتريات.

  • الاحتفاظ

    ما الذي يُسجَّل، ولأي مدة، ومن يستطيع قراءته. سجلات الطلبات والردود هي وسيلتك للإجابة عن الأسئلة لاحقاً، وهذا نفسه ما يجعلها بحاجة إلى حوكمة.

  • الصلاحيات

    إذا كان المستند مقيّداً في أنظمتك، فعلى الاسترجاع أن يحترم ذلك. تُطبَّق الصلاحيات وقت الاستعلام لا تُفترَض وقت الفهرسة.

  • الحذف

    حذف مستند يعني حذفه من الفهرس والذاكرة المؤقتة كما من المخزن. التضمين المبني على محتوى محذوف يظل مشتقاً منه، وعلى التصميم أن يحسب حساب ذلك.

التنفيذ

كيف يسير المشروع.

خمس مراحل. مجموعة التقييم تُبنى في المرحلة الثانية، قبل النظام الذي ستحكم عليه.

  1. تحديد النطاق

    أي مهمة، ومحتوى من، ومن هم المستخدمون، وما الذي يجب أن يعنيه النجاح ليستحق هذا العمل أصلاً.

  2. خط الأساس

    مجموعة التقييم، متفق عليها ومُقاسة مقابل ما يحدث اليوم، ولو كان ما يحدث اليوم شخصاً يقرأ مستندات. بلا خط أساس لا يمكن ادّعاء تحسّن.

  3. البناء

    الاسترجاع والتعليمات والأدوات والضوابط، تُطوَّر مقابل المجموعة من اليوم الأول لا تُعرَض في النهاية.

  4. التقسية

    اختبار عدائي، وسلوك الامتناع، والفشل تحت الحِمل وعند تدهور خدمة المزوّد، وتكلفة الاستعلام عند الحجم الذي تتوقعه.

  5. التشغيل

    المراقبة والانحراف والتكلفة، وإعادة القياس كلما تغيّر النموذج أو المحتوى. نبقى على النظام، ولهذا تُبنى المجموعة لتعيش بعد الإطلاق.

أسئلة

الأسئلة التي تستحق أن تُطرح أولاً.

هل سيختلق إجابات؟

أي نموذج لغوي قادر على إنتاج إجابة خاطئة واثقة، ومن يقول لك إن نظامه لا يفعل ذلك فهو يبيعك شيئاً. ما يمكن هندسته هو معدّل حدوث ذلك وما يجري عنده: إجابات مستندة إلى فقرات مسترجَعة، وإحالات يمكنك فتحها، ومسار امتناع للأسئلة التي لا تغطيها المواد. ثم تقيس المعدّل بدل أن تدّعيه، وهذا هو دور مجموعة التقييم.

أي نموذج تستخدمون؟

النموذج الذي يُظهر أفضل قياس على مهمتك، ونبني بحيث يمكن تبديله. ربط التطبيق بمزوّد واحد هو ما يجعل الفرق عاجزة عن التحرّك حين يتغيّر السعر أو التوافر أو السلوك. اختيار النموذج قرار داخل المشروع يُعاد النظر فيه حين تقول الأرقام ذلك.

هل نحتاج إلى ضبط دقيق للنموذج؟

غالباً لا، ونادراً في البداية. معظم المشكلات التي تبدو وكأنها تحتاج نموذجاً مضبوطاً هي مشكلات استرجاع: الفقرة الصحيحة لم تُعرَض على النموذج أصلاً. الضبط الدقيق يستحق تكلفته في الصيغة والنبرة والتصنيف الضيّق، ويُجرى بعد وجود مجموعة تقييم تُثبت أنه أفاد.

هل يعمل بالعربية؟

نعم، وعليه أن يُبنى لها لا أن يُترجَم إليها. التقطيع اللغوي والتقسيم وتوسيع الاستعلام والتقييم كلها تتصرّف بشكل مختلف في العربية، ومسار استرجاع مضبوط على الإنجليزية سيتراجع أداؤه بصمت على محتوى عربي. تُبنى مجموعة التقييم باللغة التي سيكتب بها المستخدمون فعلاً، بما في ذلك حين تكون اللغتين معاً.

كم تبلغ تكلفة التشغيل؟

تعتمد على المهمة والمحتوى وحجم الاستخدام، ولذلك فأي رقم يُذكر قبل معرفة هذه الثلاثة هو تخمين. ما يمكننا فعله مبكراً هو نمذجتها: الرموز لكل استعلام، ونداءات الاسترجاع، وسلوك الذاكرة المؤقتة، والحجم المتوقّع، تُحسَب في مرحلة تحديد النطاق لتكون تكلفة التشغيل قراراً لا مفاجأة في أول فاتورة.

ماذا يحدث حين يغيّر المزوّد النموذج؟

تُعيد تشغيل المجموعة. هذا هو سبب وجودها كله. يتحوّل إيقاف إصدار إلى مقارنة مقيسة وقرار ترقية، بدل أسبوع يتجادل فيه الجميع حول ما إذا كان المساعد قد أصبح أسوأ.

أخبرنا بما تحاول بناءه.

صِف المهمة ومَن عليه أن يثق بالمخرجات. وإن كانت الإجابة الصادقة أن النموذج أداة خاطئة لها، فستسمع ذلك في المكالمة.

احجز مكالمة تقنية

info@eorbitt.com · نردّ خلال يوم عمل واحد.