Skip to content

تقرير ميداني · تشغيلنا الخاص

بدا معيد الترتيب مكسبًا. ولم تستطع الأدلة الحسم.

شغّلنا Oloproof على مساعد توثيق يعمل فعليًا بالتوليد المعزز بالاسترجاع ولا نديره نحن: بمسترجِعه وفهرسه الخاصين، وتوليد حقيقي، ومحكّم LLM، ولوحة الأسئلة المرجعية لمالكيه المكوّنة من 58 سؤالًا، دون تغيير. لا يشارك أي عميل. هذا تشغيلنا، ونرويه كما دققناه.

58
سؤالًا في اللوحة المرجعية لمالكيه
0 من 76
مقارنات لأعلام الميزات حُسمت
1 من كل 9
من الحالات تغيّر حكمها بين تشغيلات متطابقة
15 من 23
من الإجابات الفاشلة استُعيدت بالمقطع الصحيح

إعادة الترتيب مفعّلة مقابل معطّلة، 22 سبتمبر 2026

مقارنة معيد الترتيب: معدل كل ذراع مع فترته عند 95% والعدد المرصود، والفرق المقترن
المقياسإعادة الترتيب مفعّلةإعادة الترتيب معطّلةالفرق المقترن، المفعّلة ناقص المعطّلة
الصفحة الصحيحة في المرتبة 1⁦0.745 [0.519, 0.875]⁩ · 51 من 58⁦0.618 [0.449, 0.760]⁩ · 55 من 58⁦+6.2⁩ نقطة ⁦[−36.3, +45.5]⁩ · 48 مقترنة
الصفحة الصحيحة ضمن أول 3⁦0.742 [0.270, 0.939]⁩ · 31 من 58⁦0.683 [0.350, 0.875]⁩ · 41 من 58⁦+3.7⁩ نقطة ⁦[−73.9, +76.2]⁩ · 27 مقترنة
الإجابة صحيحة (محكّم LLM)⁦0.760 [0.519, 0.888]⁩ · 50 من 58⁦0.685 [0.501, 0.819]⁩ · 54 من 58⁦+6.5⁩ نقطة ⁦[−39.4, +48.4]⁩ · 46 مقترنة

قبل

كان لدى المساعد بالفعل إطار اختبار متمكّن: لوحة مرجعية، ومحكّم LLM، وبوابة إصدار. كانت البوابة تقارن تقديرًا نقطيًا بهدف، أيًّا كان حجم اللوحة. وبهذه القراءة أضاف معيد الترتيب 12.7 نقطة إلى مقياس الصفحة الصحيحة في المرتبة 1 وكان سيُطلق. وفي درجة الأمانة التي كانت تحكم الإصدارات، كانت الإجابة التي يعجز المحكّم عن تقييمها تُحسب فشلًا كاملًا.

بعد

قرن Oloproof الذراعين على الأسئلة التي أجاب عنها كلاهما، وسجّل 4 أخطاء خادم و2 من الأحكام غير القابلة للتحليل كقيم مفقودة، ووسّع كل فترة لتحيط بها. الفروق الثلاثة كلها تعبر الصفر، وبفارق واسع: هذه اللوحة لا تستطيع أن تقول هل معيد الترتيب يفيد أم يضر.

أعادت إعادة تشغيل الإجابات الفاشلة الـ 23 بالمقطع الصحيح بدلًا من المقطع المسترجَع 15 منها، إلى جانب مجموعة ضابطة أعادت تشغيلها دون تغيير. وصنّف التشخيص 5 حالات إخفاقًا في الاسترجاع و7 إخفاقًا في التوليد، وترك 11 دون حسم، وسمّى عمق الاسترجاع وإعدادات الفهرس بوصفهما التجربتين التاليتين.

عند القياس ثلاث مرات، غيّرت حالة واحدة تقريبًا من كل تسع حكمها دون أن يتغير شيء، وأعاد 13.8% من الاستدعاءات خطأ خادم. وأدى إعلان تلك الأخطاء عابرة إلى استعادة 18 من 22 حالة مفقودة وتضييق الفترة بنسبة 39%. ثم أعطى مسحٌ لأعلام الميزات التسعة عشر لدى المساعد 76 مقارنة مقترنة، لم تُحسم أي منها، ونحو 40 سؤالًا إضافيًا كانت ستحسم الثلاث الأكثر وعدًا.

«مجموعة من 58 حالة، تجيب واحدة من كل تسع منها إجابة مختلفة في كل مرة تُسأل، لا تملك دقة أربع خانات عشرية.»
من تقرير Oloproof عن التشغيل، 23 سبتمبر 2026

نظرة سريعة

  • نفّذهOloproof، بمبادرة منه
  • النظام المقيَّممساعد توثيق RAG يعمل فعليًا ولا نديره نحن
  • اللوحة58 سؤالًا، أسئلة المالكين أنفسهم، دون تغيير
  • المحكّممحكّم LLM، لم يُتحقق منه بعد مقابل تصنيفات بشرية
  • تاريخ التشغيل22 و23 سبتمبر 2026
  • تشغيلات المتابعة19 علم ميزة؛ 24 محادثة

ما لا يُظهره

نظام واحد، ومدوّنة واحدة، ولوحة أصغر من أن تحسم سؤالها. المحكّم الذي يقف وراء كل درجة إجابة لم يُتحقق منه مقابل البشر، والتشخيص يقول ذلك. اللوحة أحادية الدور: وجد تشغيل متابعة من 24 محادثة إخفاقين قابلين للتكرار لا يمكن أن تُنتجهما لوحات أحادية الدور، منهما مساعد ينكر ما قاله قبل دور واحد. هذا ليس معيارًا مرجعيًا، وليس عميلًا.