Skip to content

من نحن

نحن نبني طبقة القياس.

تطلق الفرق تغييرات على أنظمة الذكاء الاصطناعي كل أسبوع دون أي وسيلة لمعرفة ما إذا كان التغيير الأخير قد حسّنها. Oloproof هو الجزء من حزمة الأدوات الذي يجيب عن هذا السؤال بالأدلة: تقدير، ومقدار عدم اليقين فيه، وقرار يمكنك التحقق منه.

كيف نقرر

على الفترة، لا على التقدير

تنجح القاعدة عندما تتجاوز الفترة كلها عتبتها، وتفشل عندما تقصر الفترة كلها عنها. وكل ما بين ذلك يُبلَّغ عنه على أنه أدلة غير كافية، ولا يُقرَّب أبدًا إلى نجاح.

ما ندّعيه

لا شيء لا نستطيع إعادة إنتاجه

تدخل الطريقة الإحصائية المنتج ومعها مذكرة مكتوبة وشبكة تغطية وتدقيق. وحتى ذلك الحين، تفشل القاعدة التي تحتاج إليها فشلًا آمنًا بدلًا من استعارتها.

أين توجد الأدلة

معك، افتراضيًا

التشغيلات المحلية لا تغادر جهازك أبدًا. يحمل الرفع المقاييس والفترات والقرارات، ويترك المدخلات الخام والمخرجات والتتبعات عندك ما لم ينص مشروعك على غير ذلك.

المحكّمون

يُقاسون قبل أن يتحكموا في الإصدار

يُتحقق من محكّم LLM مقابل تصنيفات بشرية، بناءً على الحد الأدنى لمدى اتفاقه، قبل أن يُسمح له بالبت في إصدار.

النماذج اللغوية

فوق الأدلة، لا داخلها

يمكن للنماذج أن تحكم وتشرح وتقترح التجربة التالية. لكنها لا تخترع طريقة إحصائية أبدًا ولا تتخذ قرار الإصدار.

التكلفة

لا تدفع مرتين أبدًا مقابل الأدلة نفسها

يُخزَّن كل تنفيذ وكل حكم مرة واحدة، بحسب محتواه. وإعادة تشغيل حزمة لم تتغير تعيد استخدام ما لديها بالفعل.

الغرض منه

هل يعمل؟ للسيناريوهات والمعايير التي أعلنتها، مع ذكر المقام.

أين يفشل؟ بما في ذلك الشرائح والمكوّنات التي يخفيها المعدل الإجمالي.

ما مدى يقيننا؟ كل رقم يقود قرارًا يحمل معه مقدار عدم اليقين فيه.

هل يمكن الدفاع عنه لاحقًا؟ يُحتفظ بالسجل الذي يقف وراء النتيجة، كي يتمكن شخص آخر من التحقق منه.

للتواصل