تحديات دقة أدوات كشف النصوص المولدة بالذكاء الاصطناعي ومخاطر الاتهامات الخاطئة
3 أكتوبر 2026 · قراءة 2 دقيقة
تواجه أدوات كشف النصوص المولدة بالذكاء الاصطناعي صعوبات في التمييز الدقيق بين الكتابة البشرية والآلية، مما أدى إلى توجيه اتهامات غير مثبتة لآلاف الطلاب باستخدام الذكاء الاصطناعي في أعمالهم، بينما تم تصنيف نصوص بشرية بالكامل على أنها مولدة آلياً، بما في ذلك نصوص من الكتاب المقدس.
تعتمد هذه التقنيات بشكل أساسي على قياس معيارين: الحيرة، التي تحدد مدى إمكانية التنبؤ بالكلمة التالية في النص، والاندفاعية، التي تقيس التباين في طول الجمل وتعقيدها. تميل النصوص المولدة آلياً إلى امتلاك حيرة منخفضة وبنية جمل متجانسة تتراوح عادة بين 15 و25 كلمة، بينما يتميز النص البشري باستخدام تركيبات غير متوقعة وتفاوت كبير في طول الجمل.
تتفاوت كفاءة الخدمات المتاحة، حيث يمتلك GPTZero نحو 17 مليون مستخدم ويدعي دقة تصل إلى 99% للنصوص المولدة بالكامل و96.5% للنصوص المختلطة، مع خفض نسبة النتائج الإيجابية الكاذبة لغير الناطقين بالإنجليزية إلى 1%. في المقابل، يُعتبر Turnitin المعيار الذهبي لكونه مدرباً على مليارات الأعمال الطلابية، ويصنف النص كذكاء اصطناعي إذا كانت النتيجة بين 20% و100%.
تشير الدراسات المستقلة إلى فجوة كبيرة في الدقة، حيث وجد باحثون من جامعة ستانفورد أن هذه الأدوات تصنف نصوص غير الناطقين بالإنجليزية بشكل منهجي على أنها مولدة آلياً بسبب أسلوبهم الرسمي. وأظهر اختبار لستة كواشف أن متوسط الدقة كان 39.5% فقط، وانخفض إلى 17.4% عند إجراء تعديلات بسيطة على النصوص. وفي تجربة أخرى، صنف Turnitin نحو 95% من المقالات الطلابية كذكاء اصطناعي، رغم أن 45% منها فقط استخدمت التقنية فعلياً.
أدى استخدام نموذج Dipper من Google Research لإعادة الصياغة إلى خفض دقة كاشف DetectGPT من 70.3% إلى 4.6%. ويقر مطورو GPTZero بأن هذه الأدوات لا توفر دقة بنسبة 100% نظراً للتطور المستمر في تقنيات التوليد، مؤكدين أن نتائج البرامج لا يجب أن تُستخدم كدليل نهائي للعقاب، لأن الكواشف تعتمد على أنماط إحصائية هشة بدلاً من فهم المعنى.