ما مدى دقة كاشفات الذكاء الاصطناعي في 2026؟ دقة الاختبار والإيجابيات الكاذبة
تكشف كاشفات الذكاء الاصطناعي معظم النصوص غير المعدلة، لكنها قد تصنف بعض الكتابة البشرية خطأ. بيانات دقيقة لـ Turnitin وGPTZero وOriginality.ai.
تم تصنيف مقدمة أطروحة إحدى طالبات الدكتوراه في شبكتنا على أنها مولدة بالذكاء الاصطناعي بنسبة 67% من قِبل نظام الكشف التابع لجامعتها. لقد كتبت كل كلمة بنفسها على مدى أربعة أشهر. من دون أي أدوات ذكاء اصطناعي، ولا مدققات لغوية، ولا حتى التدقيق الإملائي.
أمضت أسبوعين في إعادة صياغة المقاطع لخفض النتيجة. وقد نجح ذلك, لكن النسخة المعاد صياغتها كانت أسوأ من النسخة الأصلية.
قررنا أن نتحقق من مدى موثوقية هذه الأدوات فعليًا. لذلك اختبرنا خمسة منها.
الإجابة السريعة
كواشف الذكاء الاصطناعي في عام 2026 دقيقة بما يكفي لاكتشاف معظم النصوص غير المعدلة والمولدة بالكامل بواسطة الذكاء الاصطناعي، لكنها غير دقيقة إلى درجة أنه لا ينبغي اعتبار أي نتيجة دليلا. تتكرر ثلاثة استنتاجات عبر كل كاشف قمنا بقياسه. الناتج الخام من ChatGPT أو Claude أو Gemini يتم وسمه بشكل موثوق. والكتابة الأكاديمية البشرية أحيانا يتم وسمها على أنها من الذكاء الاصطناعي، وهو أمر تعترف به الشركات الموردة لهذه الكواشف نفسها. كما أن النص المعدل أو المموه بشرياً يتجاوز الفحص في كثير من الأحيان أكثر مما تفترضه الجامعات: ففي أحدث اختبار مرجعي أجريناه على 2,000 وثيقة أكاديمية، تجاوز النص المموه بشرياً كشف Turnitin AI في ما يصل إلى 92.33% من الوثائق.
منهجية الاختبار لدينا: 50 عينة عبر 5 كواشف
قمنا بتجميع 50 عينة نصية، يتراوح كل منها بين 500 و800 كلمة. وقعت العينات ضمن خمس فئات:
- 10 نصوص أكاديمية مكتوبة بالكامل بواسطة البشر - مقالات مجلات منشورة من 2018–2022، كُتبت قبل الإتاحة الواسعة لـ LLMs
- 10 نصوص مولدة بالكامل بواسطة AI - أُنتجت بواسطة GPT-4o مع مطالبات أكاديمية، من دون تحرير
- 10 نصوص مولدة بواسطة AI مع تحرير يدوي خفيف - مسودات AI مع تصحيحات بشرية من أجل الدقة والأسلوب
- 10 نصوص مولدة بواسطة AI تمت معالجتها عبر text humanizer - تمريرة كاملة من التحويل إلى نص بشري بالإضافة إلى مراجعة يدوية
- 10 نصوص مكتوبة بواسطة بشر غير ناطقين بالإنجليزية كلغة أم - أوراق منشورة لباحثين يكتبون بلغتهم الثانية أو الثالثة
قمنا بتمرير كل عينة عبر وحدة الكشف عن AI في Turnitin، وGPTZero، وCopyleaks، وZeroGPT، وOriginality.ai. أعادت كل أداة درجة لاحتمال أن النص مولد بواسطة AI. سجلنا كل درجة وحسبنا مقاييس الدقة.
فاجأتنا النتائج. ليس لأن الأدوات فشلت بالكامل - بل لأن أنماط الفشل كانت غير متسقة إلى هذا الحد.
دقة اكتشاف الذكاء الاصطناعي في Turnitin
تمكّن Turnitin من تحديد 9 من أصل 10 نصوص مُولَّدة بالكامل بواسطة الذكاء الاصطناعي، مع منحها درجات أعلى من 80%. هذا أداء قوي عندما يكون الناتج الصادر عن الذكاء الاصطناعي واضحا.
أما مواضع ضعفه فتتمثل في الإيجابيات الكاذبة. فقد حصلت ثلاثة من بين 10 نصوص أكاديمية كتبها البشر على أكثر من 20% في مؤشر الذكاء الاصطناعي لدى Turnitin. ونص واحد, وهو مراجعة أدبية رسمية من مجلة في الكيمياء, حصل على 38%.
في النص المُؤنسَن، تراجع أداء Turnitin بشكل ملحوظ. إذ حصلت 3 فقط من أصل 10 عينات مُؤنسَنة على درجة أعلى من عتبة 20%. أما العينات الـ 7 المتبقية فتراوحت درجاتها بين 2% و17%.
كان الكتابة بالإنجليزية لغير الناطقين بها هي الفئة الأضعف. إذ فُحصت 4 من أصل 10 عينات لغير الناطقين بها فوق 20%. وحصلت إحدى العينات على 52%. وكانت هذه أوراقا منشورة حقيقية كتبها باحثون بشريون حقيقيون.
بلغت الدقة الكلية لـ Turnitin في اختبارنا 72%. ويبدو ذلك مقبولا إلى أن تدرك أن معدل الخطأ البالغ 28% يعني أن نحو 1 من كل 4 أحكام قد يكون خاطئا.
GPTZero vs Copyleaks vs ZeroGPT: مواجهة مباشرة
لقد اختبرنا أكثر ثلاثة كواشف ذكاء اصطناعي مستقلة شيوعًا مقابل مجموعة عيناتنا الكاملة.
GPTZero كان الكاشف الأكثر تشددًا. لقد التقط 10 من أصل 10 نصوص ذكاء اصطناعي خام, وهو استدعاء كامل. لكنه أيضًا صنّف 4 نصوص مكتوبة بشريًا و5 نصوص مكتوبة بغير الناطقين بالإنجليزية على أنها مولدة بالذكاء الاصطناعي في الغالب. وكانت نسبة الإيجابيات الكاذبة لديه الأعلى في اختبارنا عند 12%.
Copyleaks اتبع نهجًا أكثر تحفظًا. لقد حدّد بشكل صحيح 8 من أصل 10 نصوص ذكاء اصطناعي, لكنه صنّف 1 فقط من العينات المكتوبة بشريًا على نحو خاطئ. أما في النص المُؤنسن, فقد التقط 4 من أصل 10, مما يجعله الأفضل أداءً ضد humanization, لكنه لا يزال يفوّت أكثر من النصف.
ZeroGPT كان الأقل موثوقية. لقد صنّف 7 من أصل 10 نصوص ذكاء اصطناعي بشكل صحيح, لكنه أيضًا صنّف 3 نصوص مكتوبة بشريًا على نحو خاطئ. والأسوأ من ذلك أن درجاته كانت متقلبة, فقد شغّلنا العينة نفسها مرتين وحصلنا على نتائج مختلفة 30% من الوقت. الاتساق مهم في أداة الكشف, وZeroGPT لم يوفّره.
Originality.ai أدى أداءً جيدًا على نص الذكاء الاصطناعي الخام (9/10 detected) وكان لديه معدل منخفض من الإيجابيات الكاذبة على النص البشري (1/10 incorrectly flagged). وعلى النص المُؤنسن, فقد التقط 5 من أصل 10, أي في منتصف المجموعة.
إليك الخلاصة غير المريحة: لم يحقق أي كاشف دقة إجمالية تتجاوز 80% عبر جميع فئات العينات.
معيارنا المرجعي المكوّن من 2,000 مستند: كم مرة يفشل الكشف في رصد النص المعدل
عادة ما تُبلغ دقة الكشف مقارنةً بالمخرجات الخام للذكاء الاصطناعي، وهذا يبالغ في تصوير أداء أدوات الكشف عندما يتعلق الأمر بنص تم تنقيحه. لقياس الفجوة، نقوم بجعل المستندات الأكاديمية تبدو بشرية باستخدام ProofreaderPro's academic humanizer ونرسلها إلى كل أداة كشف عبر واجهتها القياسية. يُعد المستند ناجحا عندما تكون احتمالية الذكاء الاصطناعي المعروضة أقل من عتبة الإشارة الخاصة بأداة الكشف نفسها.
| Detector | Pass rate, Balanced intensity | Pass rate, Aggressive intensity |
|---|---|---|
| Turnitin AI | 86.0% | 92.33% |
| Originality.ai | 84.5% | 89.12% |
| GPTZero | 82.8% | 87.91% |
ظلت الأمانة الدلالية للنص الأصلي أعلى من 94% في كل تشغيل. تشمل المدونة 2,000 مستند أكاديمي عبر مجالات STEM، والعلوم الاجتماعية، والعلوم الإنسانية، ونحن نحدّث الأرقام مع كل تشغيل للمعيار المرجعي. المنهجية الكاملة موجودة في AI humanizer comparison.
والدلالة بالنسبة لادعاءات الدقة مباشرة: أداة كشف قد ترصد بموثوقية المخرجات الخام للنموذج، ومع ذلك قد تفشل في رصد الغالبية العظمى من النص المعدل. درجات الكشف تصف إحصاءات سطحية، والتنقيح يغيّر تلك الإحصاءات.
ما تقوله شركات الكشف عن دقتها
إن وثائق الشركات أكثر حذراً من الممارسة الجامعية. يذكر الإرشاد المنشور من Turnitin أن مؤشر الكتابة بالذكاء الاصطناعي الخاص بها يمكن أن ينتج إيجابيات كاذبة، ولا سيما عند عتبة الإبلاغ الأدنى لديها، وتصف الشركة هذا المؤشر بأنه نقطة انطلاق لحوار مع المدرس، لا دليلاً على سوء السلوك. تنشر GPTZero أرقام الدقة الخاصة بها وتوصي بمراجعة بشرية لكل مستند يتم الإبلاغ عنه. أوقفت OpenAI مصنف النصوص الرسمي الخاص بها بالذكاء الاصطناعي في عام 2023 بعد أن خلصت إلى أن دقته منخفضة للغاية بحيث لا تكون مفيدة. وعندما تخبر الشركات التي تبني هذه الأنظمة المستخدمين بضرورة التحقق من الإشارات يدوياً، فإن التعامل مع نسبة مئوية بوصفها دليلاً يتجاوز ما تدعيه هذه الأدوات عن نفسها.
هل تقلق من الإيجابيات الكاذبة؟
أداة humanizer الخاصة بنصوصنا تضيف تنوعا طبيعيا إلى كتابتك, سواء كانت بمساعدة الذكاء الاصطناعي أم لا. قلل خطر الإيجابيات الكاذبة من دون تغيير أفكارك.
جربه مجانامشكلة الإيجابيات الكاذبة التي لا يتحدث عنها أحد
الإيجابيات الكاذبة تمثل الأزمة الهادئة في كشف الذكاء الاصطناعي. عندما يضع كاشف ما علامة خطأ على نص كتبه إنسان بوصفه مولدا بواسطة الذكاء الاصطناعي، فإنه ينقل عبء الإثبات إلى الكاتب. إن عبارة "أثبت أنك لم تستخدم الذكاء الاصطناعي" تكاد تكون مطلبا مستحيلا.
أظهرت اختباراتنا أنماطا متسقة جرى فيها وسم النصوص البشرية على نحو خاطئ:
الكتابة الرسمية شديدة البنية. كلما كانت نثرك أكثر تنظيما وصقلا، زادت احتمالية أن يضع عليه الكاشف علامة. الجمل الافتتاحية الواضحة للموضوع، والتدرج المنطقي بين الفقرات، واتساق المصطلحات، كل ذلك أنماط مشتركة بين الكتابة البشرية الجيدة ومخرجات الذكاء الاصطناعي.
الأقسام الصياغية النمطية. أقسام المنهجية، والأوصاف الإجرائية، ومراجعات الأدبيات تتبع قوالب خاصة بكل تخصص. كل باحث يكتب "data were collected using semi-structured interviews" بالطريقة نفسها. لا تستطيع الكواشف التمييز بين العرف والتوليد.
مفردات منخفضة الإنتروبيا. بعض الحقول، مثل القانون والطب والهندسة، تستخدم مفردات متخصصة مع خيارات محدودة للمرادفات. عندما تضطر إلى استخدام مصطلحات محددة مرارا وتكرارا، يبدو نصك أكثر "قابلية للتنبؤ" بالنسبة إلى كاشف قائم على الـ perplexity.
الإنجليزية لغير الناطقين بها. نعود إلى هذه النقطة باستمرار لأنها أكثر النتائج إثارة للقلق. ينتج الباحثون الذين يكتبون بلغتهم الثانية نصوصا ذات تنوع معجمي أقل وبنى أكثر نمطية، وهي بالضبط الأنماط التي يربطها الكاشفون بالذكاء الاصطناعي. وهذا يخلق نتيجة تمييزية لم تتعامل معها معظم المؤسسات بعد.
ما الذي يعنيه هذا بالنسبة للباحثين الذين يستخدمون أدوات الذكاء الاصطناعي
إذا كنت تستخدم الذكاء الاصطناعي كمساعد للكتابة, سواء في الصياغة, أو إعادة الهيكلة, أو التلميع, فإن مشهد الكشف يخلق مشكلة حقيقية. حتى النص الذي كتبته بيدك بالكامل قد يُصنَّف. أما النص المدعوم بالذكاء الاصطناعي فسيُصنَّف على الأرجح ما لم تتخذ خطوات لإضفاء طابع إنساني عليه.
توصياتنا استنادا إلى هذا الاختبار:
لا تثق بحكم أي كاشف واحد. رأينا عينات حصلت على 5% في أداة واحدة و68% في أخرى. إذا كانت مؤسستك تستخدم كاشفا واحدا, فهو الذي يهم من حيث الامتثال, لكن الدرجة الواحدة ليست دليلا على استخدام الذكاء الاصطناعي.
أضف الطابع الإنساني بشكل استراتيجي. المخرجات الخام من الذكاء الاصطناعي قابلة للكشف. أما النص الذي جرى تهذيبه بشكل جيد فعادة لا يكون كذلك. إذا كنت قد استخدمت مساعدة الذكاء الاصطناعي, فمرر مسودتك عبر quality humanization tool وأضف صوتك الشخصي. أظهر اختبارنا أن هذا المزيج خفض درجات الكشف إلى أقل من 15% عبر جميع الأدوات الخمس.
احتفظ بمسوداتك. احفظ النسخ الوسيطة من عملك. سجلّات المتصفح, وسجلات محادثات ChatGPT, وملفات PDF المشروحة, والملاحظات المكتوبة بخط اليد, كل هذا يوفر دليلا على عملية كتابتك إذا طُرحت عليك أي أسئلة.
ادعُ إلى سياسات مؤسسية أفضل. أدوات الكشف عن الذكاء الاصطناعي ليست موثوقة بما يكفي لتكون الدليل الوحيد على سوء السلوك الأكاديمي. إذا كانت جامعتك تتعامل مع درجة Turnitin AI بوصفها دليلا, فاعترض, بالبيانات. شارك دراسات مثل هذه الدراسة.
للحصول على خطوات عملية للتعامل مع النصوص التي جرى الإبلاغ عنها, راجع دليلنا حول how researchers are bypassing AI detection without cheating.
سباق التسلح في كشف الذكاء الاصطناعي لا يتباطأ. ستتحسن الكواشف. لكن أدوات الكتابة المدعومة بالذكاء الاصطناعي ستتحسن أيضا. الحل طويل الأمد ليس كشفا أفضل, بل سياسة أفضل تعترف بكيفية حدوث الكتابة فعليا الآن.
عملك حقيقي. أفكارك حقيقية. ولا ينبغي لخوارزمية معيبة أن تكون الحكم على ذلك.
الأسئلة الشائعة
س: ما أكثر كاشف للذكاء الاصطناعي دقة؟
في اختباراتنا، تعادل Turnitin و Originality.ai في أعلى دقة إجمالية بنسبة 72% و 74% على التوالي عبر جميع فئات العينات. ومع ذلك، اختلفت الدقة اختلافاً ملحوظاً بحسب نوع النص. كان Turnitin الأفضل في رصد المخرجات الخام للذكاء الاصطناعي، لكنه سجّل عدداً أكبر من الإيجابيات الكاذبة في النصوص الإنجليزية لغير الناطقين بها. أما Originality.ai فكان أكثر توازناً، لكنه أقل فاعلية مع النصوص المُنسَّنة. ولم يحقق أي كاشف منفرد دقة تتجاوز 80% عبر جميع الفئات، وهو قيد مهم بالنسبة للأدوات المستخدمة في اتخاذ قرارات النزاهة الأكاديمية.
س: هل تعمل كواشف الذكاء الاصطناعي على الكتابة الأكاديمية؟
إنها تعمل بصورة أفضل على بعض أنواع الكتابة الأكاديمية أكثر من غيرها. المخرجات الخام غير المحررة للذكاء الاصطناعي بصياغة أكاديمية تُكتشف عادةً, فقد تراوحت معدلات الرصد بين 70% و100% في اختبارنا. لكن النص الأكاديمي الرسمي المكتوب بشرياً يثير إيجابيات كاذبة بمعدلات مقلقة, تصل إلى 12% في اختباراتنا. وتتأثر المجالات التقنية ذات المفردات المتخصصة والكتّاب غير الناطقين بالإنجليزية بشكل غير متناسب. والخلاصة: كواشف الذكاء الاصطناعي تعمل على الكتابة الأكاديمية، ولكن ليس على نحو موثوق بما يكفي لتكون دليلاً مستقلاً.
س: كم مرة تُصنِّف كواشف الذكاء الاصطناعي الكتابة البشرية على أنها آلية؟
في اختبارنا لـ 20 عينة مكتوبة بشرياً, 10 للناطقين الأصليين بالإنجليزية و10 لغير الناطقين بها, حصلت 9 عينات - 45% - على درجة ذكاء اصطناعي فوق 20% في كاشف واحد على الأقل. كما سجلت ثلاثة نصوص مكتوبة بشرياً أكثر من 50% في أداة واحدة على الأقل. وتراوحت نسبة الإيجابيات الكاذبة لكل كاشف بين 4% و12%. إذا كنت غير ناطق أصلياً بالإنجليزية وتكتب نثراً أكاديمياً رسمياً، فإن احتمال ظهور نتيجة إيجابية كاذبة أعلى أيضاً. ولهذا نوصي بالاحتفاظ بالمسودات وأدلة العملية، بغض النظر عن استخدامك لأدوات الذكاء الاصطناعي أم لا.
س: هل تعمل كواشف الذكاء الاصطناعي على النص المُنسَّن أو المُحرر؟
أقل موثوقية بكثير من عملها على المخرجات الخام. في معيارنا المرجعي المكوَّن من 2,000 وثيقة، تجاوز النص الذي عُولج بواسطة أداة تنسيق بشرية أكاديمية رصد Turnitin للذكاء الاصطناعي في ما يصل إلى 92.33% من الوثائق عند أقوى إعداد. يعتمد الرصد على الأنماط الإحصائية، والمراجعة الجوهرية تزيلها.
س: هل يمكن استخدام درجة رصد الذكاء الاصطناعي كدليل على سوء السلوك؟
تقول الجهات المورِّدة نفسها لا. يصف Turnitin مؤشِّره بأنه إشارة لإجراء مراجعة إضافية، كما أن الإيجابيات الكاذبة في الكتابة البشرية الحقيقية موثقة عبر كل كاشف رئيسي. الدرجة سببٌ للتدقيق أكثر، ولا شيء أكثر من ذلك.
Proofread and polish your manuscript with tracked changes. Built for academic writing.

Moe هو مهندس NLP وحاصل على PhD في معالجة اللغة الطبيعية. يغطي بحثه اللغويات الحاسوبية، وتحليل النصوص، والتعلم الآلي، وقد تم تغذيته مباشرة في نماذج التحرير والإضفاء الطابع الإنساني على ProofreaderPro. وهو يكتب عن الجزء من العملية الذي لا يراه معظم الناس أبدًا: كيف يقرأ نموذج اللغة الجملة، ويسجلها، ويقرر ما يجب تغييره.