Skip to content
← كل المقالات

درجات تقييمك تكذب بشأن حجم العينة

المتوسط الواحد هو أكثر الطرق شيوعًا التي تخدع بها الفرق نفسها بشأن تغيير في الذكاء الاصطناعي. إليك ما نبلّغ عنه بدلًا منه، ولماذا يجب أن تتقدّم الفترة على الرقم.

خذ لوحة ذهبية من 58 حالة ومساعد توثيق حيًّا يجيب من فهرس بحث حقيقي، وقارنه ومعيد الترتيب لديه مفعَّل ثم معطَّل. بقراءة التقديرات النقطية، يرفع معيد الترتيب نسبة الإجابات التي تكون صفحتها الأعلى ترتيبًا هي الصحيحة من 61.8% إلى 74.5%. يبدو ذلك تقدمًا، وفي تقارير سير العمل يُبلَّغ عنه عادةً كمكسب قدره 12.7 نقطة.

شغّل الذراع نفسها مرتين دون تغيير أي شيء، فجاءت صحة الإجابات 71.2% ثم 76.0%. وعند القياس مجددًا بثلاثة تكرارات لكل حالة، غيّرت قرابة حالة واحدة من كل تسع حالات مرصودة حكمها بين قياسات متطابقة: 6 من 54 في الصحة، و7 من 57 في الصفحة الأعلى ترتيبًا.

ليس السبب أن القياس معطوب. بل إن فرقًا على 58 حالة، تعذّر قياس بعضها أصلًا، يقع في عمق الضجيج الذي تستطيع العينة إنتاجه وحدها. الفترة، لا التقدير النقطي، هي ما يخبرك إن كنت قد تعلّمت شيئًا.

ما الذي يجب الإبلاغ عنه

ثلاثة أرقام، بهذا الترتيب: الفرق، وفترته، وعدد الحالات التي وراءه. وبأقل من ذلك لا يستطيع القارئ الحكم على الادعاء. إليك ذلك التشغيل، معيد الترتيب مفعَّلًا مقابل معطَّل، مقرونًا حالةً بحالة، بالنقاط:

الفروق المقرونة، معيد الترتيب مفعَّلًا ناقص معطَّلًا، على لوحة من 58 حالة
الحالات المقرونةالمقياسالفرقفترة 95%القراءة
48الصفحة الصحيحة في المرتبة 1⁦+6.2⁩⁦−36.3 … +45.5⁩غير حاسم
46الإجابة صحيحة⁦+6.5⁩⁦−39.4 … +48.4⁩غير حاسم
27الصفحة الصحيحة ضمن أول 3⁦+3.7⁩⁦−73.9 … +76.2⁩غير حاسم

كل فترة تعبر الصفر، وبفارق واسع. التقديرات النقطية كلها تقول إن معيد الترتيب يفيد؛ أما الفترات فتقول إن هذه اللوحة لا تستطيع أن تحدد إن كان يفيد أم يضر. وهذه نتيجة بحد ذاتها: اللوحة أصغر من اللازم، وتفقد حالات أكثر من اللازم، لتحسم السؤال الذي استُخدمت لحسمه.

المفقود ليس صفرًا

أعادت أربعة من الاستدعاءات الـ 58 خطأ HTTP 500 من النظام قيد الاختبار، ولم يُعِد استدعاءان للمحكّم أي حكم قابل للتحليل. والإطار الذي يحتسب الحالة غير المقيَّمة صفرًا في المتوسط يسجّل هذه الست على أنها إخفاقات للمساعد: ستة إخفاقات مصطنعة من أصل 58. أما Oloproof فيسجّلها مفقودة ويوسّع الفترة لتحيط بكل ما كان يمكن أن تكونه.

هذا ما يدفع الصف الثالث ثمنه. لم يمكن قياس سوى 27 من الحالات الـ 58 عند حدّ ثلاث صفحات مرتبة، والفترة تحسب حساب الحالات الـ 31 الأخرى بدل أن تخفيها.

اللوحات الصغيرة تجتاز البوابات

القاعدة نفسها تصح في الطرف الصغير. سجّل تشغيل فحص سريع من ثلاث حالات 1.000، بفترة 95% من 0.292 إلى 1.000. البوابة التي تقارن التقدير النقطي بهدف تُطلقه. أما البوابة التي تقرأ الفترة فتقول الحقيقة: ثلاث حالات لا تستطيع التمييز بين نظام مثالي ونظام يصيب ثلاث مرات من عشر.

تضييق الفترة

المزيد من الحالات يضيّق الفترة، وكذلك فقدان عدد أقل منها. على اللوحة نفسها، أدى الإعلان عن أخطاء HTTP 500 في النظام بأنها عابرة، كي يعيد الـ runner محاولتها، إلى استعادة 18 من 22 حالة مفقودة وتضييق الفترة بنسبة 39%، بعد دقائق، دون تغيير أي شيء آخر.

الفرق الذي تتجاوز فترته العتبة يدعم قرارًا، أيًّا كان حجمه، وهو الفرق الذي ينبغي أن تتصرف البوابة بناءً عليه. وحتى ذلك الحين، أبلغ عن الفرق وفترته والحالات التي وراءه، وقل إن الإجابة لم تتضح بعد.

أتريد أن يُحسب هذا لك مع كل تغيير؟

تواصل معنا