EN FR ES PT DE AR 中文

تحيز القاضي الآلي يصمد أمام كل إصلاحات معايير التقييم التي يبيعها الموردون

منظومة الضمان لعام 2026 تُسنِد مهمة التقييم إلى نموذج مبني من المكونات نفسها التي يقيّمها. ضبط المعايير لا يعالج نقطة عمى مشتركة، ووثائق الموردين أنفسهم تعترف بذلك ضمنا.

اطلب من نموذج أن يقيّم عمله بنفسه، وسيمنحه الدرجة الكاملة. صنّف القطاع تحيز القاضي الآلي بوصفه مسألة ضبط: معايير أدق، تبديل مواضع الإجابات، لجنة من عدة مقيّمين، مجموعة معايرة. هذه المعالجات تنجح في تخفيف الأعراض التي صُممت من أجلها، لكنها تترك الجوهر كما هو، لأن القاضي والمُقاضى خرجا من المصنع نفسه.

تتبع سلسلة التوريد: مقيّم يعمل بالبنية المعمارية نفسها، مُدرَّب على بيانات متداخلة بحجم الويب، ويوجَّهه الفريق نفسه، ويُستضاف على البنية التحتية نفسها التي يقيّمها، يشترك معها في أكثر من مجرد الفاتورة. يشترك معها في الافتراضات المسبقة. حين يصف مخرجا بأنه سليم، فإن ما يبلغه هو اتفاق، والاتفاق رخيص بين الأقارب.

المهندسون يعرفون هذا الشكل جيدا. مضاعفة أجهزة الاستشعار تحسّن الموثوقية فقط حين تفشل الوحدتان لسببين مختلفين. نسختان من الجهاز المعيب نفسه تتفقان بانسجام تام ولا تخبرانك بشيء عن الدقة. أضف نموذجا ثانيا فوق الأول، وأنت لم تشترِ سوى شاهد يحمل العمى نفسه، مع رقم يبدو أنيقا على الشريحة.

من أين يأتي تحيز القاضي الآلي فعليا

أنماط الفشل المعروفة موثّقة جيدا داخل المجال، وهذا بالضبط سبب وجود المعالجات أصلا. القضاة الآليون يفضّلون نصا يشبه مخرجاتهم هم. الأحكام تتغيّر عند تبديل ترتيب عرض الإجابتين. الطول يُقرأ كدليل جودة. لكل واحدة من هذه المشكلات حل بديل، ويستحق كل حل بديل أن يُطبَّق.

الخطأ المترابط لا حل بديل له. اختلاق واثق يجتاز مرشح المعقولية لدى المولِّد سيجتاز غالبا مرشح القاضي أيضا، لأنه في جوهره المرشح نفسه تقريبا، مضبوط على المجموعة البيانية نفسها تقريبا. الإخفاقات التي يحتاج التقييم إلى رصدها أكثر من غيرها هي بالضبط ما يشترك فيه الطرفان. ثم يلتهم المنطق نفسه مجموعة الاختبار: إذا جاءت الحالات من مصادر عامة، فقد تكون موجودة أصلا داخل بيانات تدريب كل ما تختبره.

يفيد استطلاع أجراه أحد الموردين شمل أكثر من 1300 ممارس بأن الفرق التي تُجري تقييمات تمزج بين الحكم الآلي لتغطية الاتساع والمراجعة البشرية لتعميق الدقة، وهو نمط منطقي. اقرأه بوصفه صورة عن المشاركين في الاستطلاع لا مقياسا لضمان الجودة المؤسسي عموما. وراقب ما يحدث للنصف البشري بمجرد أن تتحول لوحات القيادة إلى اللون الأخضر: يتحول بهدوء إلى بند في الميزانية بدلا من أداة رقابة.

هل يمكن للذكاء الاصطناعي أن يقيّم نفسه بموثوقية؟

أكثر الإجابات فائدة تأتي ممن يبنون هذه الأدوات وينشرون حدودها. توثيق OpenAI لـمقيّمها الآلي لتقييم المهام المتخصصة يذكر أن المقيّم خضع لاختبار أعمى، وأنه يُعامَل بوصفه أقل موثوقية من المقيّمين الخبراء، وأنه لا يُستخدم بديلا عنهم. موقف صحيح، نشرته جهة تجارية لديها كل الدافع لتقول شيئا أكثر جرأة.

انظر إلى ما يقرّ به هذا فعليا. المقيّم الآلي تقدير لحكم الخبراء، معايَر عليه، وأضعف منه. لذلك لا يمكن استخدامه لإقصاء الخبراء دون أن يذيب الضمانة التي منحته المصداقية أصلا. توجد صيغة منطقية معروفة لهذه الفكرة، تلك المتعلقة بعجز أي نظام صوري عن إثبات اتساقه الداخلي من ذاته. يمكنك تجاوزها. حجة المقدِّر أصغر، وأصعب في التملص منها، وقابلة للاختبار هذا الفصل.

قابلة للاختبار، ونادرا ما تُختبر. أعد بناء مجموعة التقييم من الصفر، بحالات كُتبت بعد تاريخ إغلاق تدريب النموذج، ثم قارن النتائج بمجموعتك الحالية. أرقام تصمد تعني أن لديك مقيّما فعليا. أرقام تتراجع تعني أنك كنت تملك ذاكرة لا مقيّما. هذه التجربة معروفة تماما لكل من يبني أدوات تقييم باحترافية، ونادرا ما تُجرى على أداة تقييم المورّد قبل توقيع العقد.

الضرر الفعلي يقع غالبا في مرحلة لاحقة على أي حال. رقم مُقيَّد بتحفظات دقيقة يُنتزع من وثيقة تقنية ليُعرض على شريحة مجلس إدارة، والتحفظات لا ترافقه في تلك الرحلة.

الوكيل الذي يكتب دليله التشغيلي ثم يصحح نفسه

الأنظمة الوكيلة اليوم تصوغ مسارات عملها، وتولّد ضوابطها الخاصة، وتقترح معايير تقييمها بنفسها. كل واحدة من هذه القدرات مكسب إنتاجي حقيقي. وكل واحدة منها تُخرج أيضا طرفا من الغرفة. وكيل يؤلف سياسة، وينفذها، ثم يصحح امتثاله لها بنفسه ينتج مسار تدقيق أنيق المظهر تكون فيه كل وثيقة بمؤلف واحد: المُعِد والمراجِع والموقِّع كيان واحد. أي جهة تصمم أنظمة وكيلة يُفترض أن تصمد أمام الاحتكاك بمستخدمين حقيقيين ينبغي أن تعامل هذه الحلقة المغلقة عيبا في التصميم لا وسيلة راحة.

الضمان يصبح بندا مستقلا في الشراء

التقارير المالية حسمت هذا الأمر منذ زمن طويل. الجهة التي تُعِد الأرقام لا تصادق عليها بنفسها، ولا أحد يعتبر هذا الترتيب إهانة لمن أعدّها.

مشتريات الذكاء الاصطناعي لم تلحق بعد بهذا المنطق. المشترون يأخذون التنفيذ والمراقبة والضوابط والتقييم من مورّد واحد بشكل روتيني، ثم يقدّمون بطاقة تقييم ذلك المورّد نفسه بوصفها بيئة الرقابة الخاصة بهم. هذه إفادة غير موقّعة، وستُقرأ على هذا النحو أول مرة يسأل فيها حادث أو تدقيق: من الذي تحقق فعليا من أي شيء؟

التوجه التنظيمي يسير في الاتجاه نفسه، وإن كان أقل حدة مما توحي به العناوين. اللائحة الأوروبية (EU) 2024/1689، وهي قانون الذكاء الاصطناعي الأوروبي النافذ، تفرض واجبات إدارة المخاطر والتوثيق الفني وتقييم المطابقة وإدارة الجودة والمراقبة اللاحقة للطرح في السوق، مع تحديد بدء النفاذ والتطبيق التدريجي في المادة 113. هذه الواجبات مرتبطة بنطاق محدد لا تفويضا شاملا بتدقيق كل نظام، وينبغي مطابقة الالتزامات في دول الخليج والمنطقة العربية بما يقابلها من تشريعات محلية وقواعد جهات الرقابة في كل قطاع، إلى جانب أطر حماية البيانات القائمة مثل نظام حماية البيانات الشخصية السعودي، وبرامج التحول الرقمي الوطنية مثل رؤية السعودية 2030 واستراتيجية الإمارات للذكاء الاصطناعي. الأثر العملي يصل إلى النتيجة نفسها: يجب أن تستطيع جهة ما أن تقول من الذي تحقق، ومقابل أي معيار، وبأي درجة استقلالية.

لذلك الأسئلة الواجب طرحها قبل قبول أي رقم تقييم أسئلة غير براقة. من بنى المقيّم، وهل يشترك في الأوزان أو بيانات التدريب أو هيكلة التوجيه مع النظام الخاضع للاختبار؟ ما معدل اتفاقه مع المراجعين البشريين على مجموعة بيانات محجوزة، ومن يحتفظ بتلك المجموعة، وهل يمكنك إعادة تشغيلها بنفسك؟ ماذا يحدث للدرجة حين يُحدَّث النموذج الأساسي دون إشعار؟ هذه الأسئلة مكانها عمل الاستراتيجية التقنية الذي يسبق التوقيع لا مراجعة الحادث بعد وقوعه، وتتكامل بشكل طبيعي مع الإبقاء على إنسان ضمن مسار القرار حيثما تبرر المخاطر ذلك.

لا شيء من هذا يجعل الأدوات ضعيفة. فرز كميات هائلة من المواد ورصد ما إذا كانت حالة جديدة تطابق نمط الحالات السابقة عمل ذو قيمة حقيقية، والشركات التي تتقنه ستتفوق على من لا يتقنه. الخطأ هو شراء هذه القدرة وتصنيفها تحت بند الضمان. التوقيع لا يعني شيئا إلا حين يكون الموقِّع حرا في أن يقول لا.

أسئلة شائعة

هل يزيل استخدام نموذج مورّد مختلف كقاضٍ تحيز القاضي الآلي؟

يساعد، لكن أقل مما يفترضه كثيرون. تبديل المورّد يقلل من التحيز الذاتي، أي ميل القاضي إلى تفضيل نص يشبه مخرجاته هو. لكنه يفعل أقل بكثير تجاه الخطأ المترابط، لأن النماذج المتقدمة تُدرَّب على بيانات عامة متداخلة بشكل كبير وتشترك في كثير من نقاط الضعف نفسها. عامل مورّدا ثانيا بوصفه إزالة ترابط جزئية فقط، وسعّره على هذا الأساس. الاستقلالية التي تحتاجها فعلا تأتي من نوع مختلف تماما من الأدلة: مراجعة بشرية على مجموعة بيانات محجوزة، اختبارات حتمية، أو حقيقة ميدانية جُمعت خارج مسار النموذج نفسه.

كيف تتحقق من موثوقية قاضٍ آلي قبل الوثوق بدرجاته؟

ابنِ مجموعة حالات موسومة من قِبل خبراء مؤهلين واحتفظ بها بعيدا عن متناول المورّد. قِس مدى الاتفاق بين القاضي وتلك الموسومات، بما في ذلك في الحالات الصعبة والملتبسة لا الحالات الواضحة فقط. سجّل نمط الاختلاف إلى جانب رقم الدقة الإجمالي، لأن القضاة الآليين عادة ما يفشلون في اتجاه معين. ثم أعد التجربة بأكملها كلما تغيّر النموذج الأساسي، لأن تحديثا صامتا للإصدار قد يحرّك الدرجات دون أن يحرّك أي شيء تراقبه.

هل يفرض قانون الذكاء الاصطناعي الأوروبي تدقيقا مستقلا من طرف ثالث على أنظمة الذكاء الاصطناعي؟

ليس بشكل شامل. اللائحة الأوروبية (EU) 2024/1689 تفرض التزامات بإدارة المخاطر والتوثيق وتقييم المطابقة وإدارة الجودة والمراقبة اللاحقة للطرح في السوق على جهات فاعلة وفئات أنظمة محددة، مع تحديد التوقيت في المادة 113. أما إشراك جهة خارجية فيتوقف على تصنيف النظام ومسار تقييم المطابقة المطبق عليه. الافتراض العملي للتخطيط لمعظم المؤسسات، في المنطقة العربية كما في أوروبا، هو أنها ستحتاج إلى إثبات من تحقق من ماذا، وأن الدليل الذي تنتجه الجهة نفسها له وزن أقل من دليل يُنتَج خارج النظام الخاضع للتقييم.

مواضيع ذات صلة

كُتب بواسطة شخصية تحريرية بالذكاء الاصطناعي ضمن نظام التحرير الخاص بـ Abyshire وروجع من فريقنا.