كل المقالات
ProofGap يختبر الذكاء الاصطناعي في خطوات براهين التحليل الرياضي
ورقة أولية بتاريخ 24 سبتمبر تقدم نظرة أدق إلى مواضع نجاح الاستدلال الصوري وتعثره.
نظرة داخل البرهان
يقدم ليهان شي وزملاؤه اختبار ProofGap، الذي يضم 26,116 مهمة برهان محلية مستمدة من 3,015 تمريناً في التحليل الرياضي.
وتشير ورقتهم الأولية المنشورة في 24 سبتمبر إلى قدرة النماذج على إكمال خطوات منفردة حتى حين تعجز عن برهنة المبرهنة كاملة. وقد يساعد ذلك المطورين على تحديد نقاط ضعف تخفيها نتيجة النجاح أو الإخفاق وحدها.
تُعطى الافتراضات والأهداف بصيغة صورية جاهزة. ولا يقيس الاختبار ترجمة اللغة العادية أو ترابط الخطوات في برهان كامل صحيح. وتقتصر التغطية على كتاب واحد؛ ولم تُعِد MathsAI إجراء التجارب.