ProofreaderPro.ai
انسانی سازی متن هوش مصنوعی

دقت آشکارسازهای هوش مصنوعی در 2026 چقدر است؟ دقت آزموده و مثبت‌های کاذب

آشکارسازهای هوش مصنوعی بیشتر متن‌های ویرایش‌نشده را شناسایی می‌کنند، اما گاهی نوشتار انسانی را نیز علامت می‌زنند.

Moe|Aug 10, 2026|10 زمان مطالعه, کوتاه
دقت آشکارسازهای هوش مصنوعی در 2026 چقدر است؟ دقت آزموده و مثبت‌های کاذب - ProofreaderPro.ai Blog

یک دانشجوی دکتری در شبکه ما، مقدمه پایان‌نامه‌اش توسط سامانه تشخیص دانشگاهش 67% AI-generated علامت‌گذاری شد. او تک‌تک واژه‌ها را خودش طی چهار ماه نوشته بود. هیچ ابزار AI، هیچ grammar checker و حتی spellcheck هم استفاده نکرده بود.

او دو هفته را صرف بازنویسی بخش‌هایی کرد تا امتیاز را پایین بیاورد. این کار جواب داد, اما نسخه بازنویسی‌شده از نسخه اصلی بدتر بود.

ما تصمیم گرفتیم دقیقاً بفهمیم این ابزارها واقعاً تا چه حد قابل اعتمادند. بنابراین پنج مورد از آن‌ها را آزمایش کردیم.

پاسخ کوتاه

آشکارسازهای هوش مصنوعی در 2026 به اندازه کافی دقیق هستند که بیشتر متن‌های ویرایش‌نشده و کاملاً تولیدشده توسط هوش مصنوعی را شناسایی کنند، و در عین حال به اندازه‌ای نادقیق هستند که هیچ نمره‌ای نباید به‌عنوان اثبات تلقی شود. سه یافته در تمام آشکارسازهایی که اندازه‌گیری کرده‌ایم تکرار می‌شوند. خروجی خام از ChatGPT، Claude یا Gemini به‌طور قابل‌اعتماد پرچم‌گذاری می‌شود. نوشتار آکادمیک انسانی گاهی به‌اشتباه به‌عنوان هوش مصنوعی پرچم‌گذاری می‌شود، چیزی که خودِ فروشندگان آشکارساز نیز آن را می‌پذیرند. و متن ویرایش‌شده یا انسانی‌سازی‌شده بسیار بیشتر از آنچه دانشگاه‌ها فرض می‌کنند از فیلتر عبور می‌کند، در آخرین بنچمارک ما روی 2,000 سند آکادمیک، متن انسانی‌سازی‌شده در Turnitin's AI detection برای حداکثر 92.33% از اسناد پذیرفته شد.

روش‌شناسی آزمون ما: 50 نمونه در 5 آشکارساز

ما 50 نمونه متن گردآوری کردیم که هر یک بین 500 و 800 کلمه داشتند. این نمونه‌ها در پنج دسته قرار گرفتند:

  • 10 متن کاملا انسانیِ آکادمیک - مقالات ژورنالی منتشرشده از 2018 تا 2022، نوشته‌شده پیش از دسترس‌پذیری گسترده LLM
  • 10 متن کاملا تولیدشده توسط AI - تولیدشده توسط GPT-4o با پرامپت‌های آکادمیک، بدون ویرایش
  • 10 متن تولیدشده توسط AI با ویرایش دستی سبک - پیش‌نویس‌های AI با اصلاحات انسانی برای دقت و لحن
  • 10 متن تولیدشده توسط AI که از طریق text humanizer ما پردازش شدند - یک مرحله کامل humanization به‌همراه بازبینی دستی
  • 10 متن انسانیِ نوشته‌شده توسط گویشوران غیربومی انگلیسی - مقالات منتشرشده توسط پژوهشگرانی که به زبان دوم یا سوم خود می‌نوشتند

ما هر نمونه را از طریق ماژول تشخیص AI در Turnitin، GPTZero، Copyleaks، ZeroGPT و Originality.ai اجرا کردیم. هر ابزار یک امتیاز احتمال AI ارائه داد. ما هر امتیاز را ثبت کردیم و شاخص‌های دقت را محاسبه نمودیم.

نتایج ما را شگفت‌زده کرد. نه به این دلیل که ابزارها کاملا شکست خوردند, بلکه چون الگوهای خطا تا این اندازه ناسازگار بودند.

دقت تشخیص هوش مصنوعی Turnitin: نتایج

Turnitin 9 مورد از 10 متن کاملا تولیدشده توسط هوش مصنوعی را به‌درستی شناسایی کرد و به آن‌ها امتیازی بالاتر از 80% داد. این عملکرد برای خروجی‌های واضح هوش مصنوعی، قوی است.

اما Turnitin در کجا دچار مشکل شد: مثبت‌های کاذب. سه مورد از 10 متن دانشگاهیِ نوشته‌شده توسط انسان، در نشانگر هوش مصنوعی Turnitin امتیازی بالاتر از 20% گرفتند. یکی از آن‌ها, یک مرور ادبیات رسمی از یک مجله شیمی, امتیاز 38% گرفت.

در متن انسانی‌سازی‌شده، عملکرد Turnitin به‌طور قابل‌توجهی افت کرد. فقط 3 مورد از 10 نمونه انسانی‌سازی‌شده از آستانه 20% بالاتر رفتند. 7 مورد باقی‌مانده بین 2% و 17% امتیاز گرفتند.

نوشتار انگلیسیِ غیربومی بدترین دسته بود. 4 مورد از 10 نمونه غیربومی بالاتر از 20% علامت‌گذاری شدند. یکی از آن‌ها امتیاز 52% گرفت. این‌ها مقاله‌های منتشرشده واقعی، از پژوهشگران انسانیِ واقعی بودند.

دقت کلی Turnitin در آزمون ما: 72%. این رقم تا زمانی که متوجه شوید نرخ خطای 28% یعنی حدود 1 مورد از هر 4 داوری ممکن است نادرست باشد، قابل‌قبول به نظر می‌رسد.

GPTZero vs Copyleaks vs ZeroGPT: head-to-head

ما این سه آشکارساز مستقلِ هوش مصنوعیِ پرکاربرد را در برابر مجموعه کامل نمونه‌های خود آزمایش کردیم.

GPTZero تهاجمی‌ترین آشکارساز بود. این ابزار 10 مورد از 10 متن خامِ هوش مصنوعی را شناسایی کرد, یعنی یادآوریِ کامل. اما در کنار آن 4 متنِ نوشته‌شده توسط انسان و 5 متنِ انگلیسیِ غیر بومی را نیز به‌اشتباه عمدتاً تولیدشده توسط هوش مصنوعی تشخیص داد. نرخ مثبتِ کاذب آن در آزمون ما با 12% بالاترین مقدار بود.

Copyleaks رویکردی محتاطانه‌تر داشت. این ابزار 8 مورد از 10 متنِ هوش مصنوعی را به‌درستی شناسایی کرد, اما تنها 1 نمونهٔ نوشته‌شده توسط انسان را به‌اشتباه علامت‌گذاری کرد. در متنِ انسانی‌سازی‌شده، 4 مورد از 10 را شناسایی کرد, که آن را به بهترین عملکرد در برابر انسانی‌سازی تبدیل می‌کند, هرچند هنوز بیش از نیمی را از دست می‌دهد.

ZeroGPT کم‌اعتمادترین ابزار بود. این ابزار 7 مورد از 10 متنِ هوش مصنوعی را به‌درستی علامت‌گذاری کرد, اما 3 متنِ نوشته‌شده توسط انسان را نیز به‌اشتباه علامت‌گذاری کرد. بدتر این‌که امتیازهای آن نوسان داشت, ما همان نمونه را دو بار اجرا کردیم و در 30% موارد به نتایج متفاوت رسیدیم. ثبات در یک ابزار تشخیص اهمیت دارد, و ZeroGPT آن را فراهم نکرد.

Originality.ai در متنِ خامِ هوش مصنوعی عملکرد خوبی داشت (9/10 detected) و نرخ مثبتِ کاذبِ پایینی روی متنِ انسانی داشت (1/10 incorrectly flagged). در متنِ انسانی‌سازی‌شده, 5 مورد از 10 را شناسایی کرد, که آن را در میانهٔ جدول قرار می‌دهد.

این خلاصهٔ ناخوشایند است: هیچ آشکارسازی در هیچ‌یک از دسته‌های نمونه به دقت کلیِ بالاتر از 80% نرسید.

معیار سنجش 2,000 سندی ما, هر چند وقت یک بار تشخیص متن ویرایش‌شده را از دست می‌دهد

دقت تشخیص معمولاً بر پایه خروجی خام AI گزارش می‌شود, و این امر عملکرد آشکارسازها را در برابر متنی که بازبینی شده است بیش از حد واقعی نشان می‌دهد. برای سنجش این شکاف, ما اسناد دانشگاهی را با ProofreaderPro's academic humanizer انسانی‌سازی می‌کنیم و از طریق رابط استاندارد هر آشکارساز آن‌ها را ارسال می‌کنیم. یک سند زمانی قبول می‌شود که احتمال AI بازگردانده‌شده پایین‌تر از آستانه علامت‌گذاری خودِ آشکارساز باشد.

DetectorPass rate, Balanced intensityPass rate, Aggressive intensity
Turnitin AI86.0%92.33%
Originality.ai84.5%89.12%
GPTZero82.8%87.91%

وفاداری معنایی به متن منبع در هر بار اجرا بالاتر از 94% باقی ماند. پیکره شامل 2,000 سند دانشگاهی در حوزه‌های STEM, علوم اجتماعی, و علوم انسانی است, و ما این ارقام را با هر اجرای معیار سنجش به‌روزرسانی می‌کنیم. روش‌شناسی کامل در AI humanizer comparison ما آمده است.

پیامد این موضوع برای ادعاهای مربوط به دقت روشن است: یک آشکارساز که خروجی خام مدل را با اطمینان شناسایی می‌کند, همچنان ممکن است اکثریت بزرگ متن ویرایش‌شده را از دست بدهد. نمره‌های تشخیص، آمارهای سطحی را توصیف می‌کنند, و بازبینی این آمارها را تغییر می‌دهد.

آنچه فروشندگانِ تشخیص درباره دقتِ خود می‌گویند

مستنداتِ فروشندگان محتاطانه‌تر از رویهٔ دانشگاهی است. راهنمای منتشرشدهٔ Turnitin بیان می‌کند که نشانگرِ نگارشِ هوش مصنوعیِ آن می‌تواند مثبتِ کاذب تولید کند، به‌ویژه در آستانهٔ گزارش‌دهیِ پایین‌ترِ آن، و شرکت این نشانگر را نقطهٔ آغازِ گفت‌وگوی مدرّس می‌داند، نه مدرکِ سوءرفتار. GPTZero ارقامِ دقتِ خود را منتشر می‌کند و بازبینیِ انسانیِ هر سندِ علامت‌گذاری‌شده را توصیه می‌کند. OpenAI در سال 2023 رده‌بندِ رسمیِ متنِ هوش مصنوعیِ خود را بازنشسته کرد، پس از آنکه به این نتیجه رسید دقتِ آن برای مفید بودن بسیار پایین است. وقتی شرکت‌هایی که این سامانه‌ها را می‌سازند به کاربران می‌گویند نشانه‌ها را به‌صورت دستی راستی‌آزمایی کنند، تلقی کردنِ یک درصد به‌عنوانِ اثبات، فراتر از آن چیزی است که خودِ ابزارها دربارهٔ خود ادعا می‌کنند.

نگران مثبت‌های کاذب هستید؟

ابزار humanizer ما به نوشته شما تنوع طبیعی می‌افزاید, چه با کمک AI نوشته شده باشد چه نه. بدون تغییر ایده‌هایتان, خطر مثبت کاذب را کاهش دهید.

رایگان امتحانش کنید

مشکل مثبت کاذبی که کسی درباره‌اش حرفی نمی‌زند

مثبت‌های کاذب بحران خاموش در تشخیص هوش مصنوعی هستند. وقتی یک آشکارساز به‌اشتباه متنی را که انسان نوشته است به‌عنوان تولیدشده توسط هوش مصنوعی علامت‌گذاری می‌کند، بار اثبات را بر دوش نویسنده می‌گذارد. "اثبات کن از AI استفاده نکرده‌ای" خواسته‌ای تقریباً ناممکن است.

آزمون‌های ما الگوهای ثابتی را یافتند که در آن‌ها متن‌های انسانی به‌اشتباه علامت‌گذاری می‌شدند:

نگارش رسمیِ بسیار ساختارمند. هرچه نثر شما منظم‌تر و صیقل‌خورده‌تر باشد، احتمال این‌که یک آشکارساز آن را علامت‌گذاری کند بیشتر است. جمله‌های روشنِ موضوعی، پیشروی منطقیِ بندها، و اصطلاح‌گذاریِ یکنواخت، همه این‌ها الگوهایی هستند که هم در نگارش خوب انسانی و هم در خروجی AI دیده می‌شوند.

بخش‌های قالبی. بخش‌های روش‌شناسی، توصیف‌های رویه‌ای، و مرورهای ادبیات از الگوهای ویژه هر رشته پیروی می‌کنند. هر پژوهشگر عبارت "data were collected using semi-structured interviews" را به یک شکل می‌نویسد. آشکارسازها نمی‌توانند بین هنجار و تولید تمایز قائل شوند.

واژگان با آنتروپی پایین. برخی حوزه‌ها, مانند حقوق، پزشکی، مهندسی، از واژگان تخصصی با گزینه‌های مترادف محدود استفاده می‌کنند. وقتی ناچارید واژه‌های مشخصی را بارها و بارها به کار ببرید، متن شما برای یک آشکارساز مبتنی بر perplexity قابل‌پیش‌بینی‌تر به نظر می‌رسد.

انگلیسیِ غیربومی. ما مدام به این موضوع بازمی‌گردیم، چون نگران‌کننده‌ترین یافته است. پژوهشگرانی که به زبان دوم خود می‌نویسند، متنی با تنوع واژگانی کمتر و ساختارهای قالبی‌تر تولید می‌کنند، دقیقاً همان الگوهایی که آشکارسازها با AI مرتبط می‌دانند. این امر به نتیجه‌ای تبعیض‌آمیز منجر می‌شود که بیشتر مؤسسات هنوز با آن به‌طور جدی درگیر نشده‌اند.

آنچه این برای پژوهشگرانی که از ابزارهای AI استفاده می‌کنند معنا دارد

اگر از AI به‌عنوان دستیار نویسندگی استفاده می‌کنید, برای پیش‌نویس, بازآرایی, ویرایش, منظره تشخیص یک مشکل واقعی ایجاد می‌کند. حتی متنی که کاملاً با دست خودتان نوشته‌اید هم ممکن است علامت‌گذاری شود. متنِ با کمک AI تقریباً به‌طور قطع علامت‌گذاری می‌شود, مگر این‌که برای انسانی‌سازی آن اقدام کنید.

توصیه‌های ما بر اساس این آزمون‌ها:

به داوری هیچ آشکارساز واحدی اعتماد نکنید. دیدیم نمونه‌هایی که در یک ابزار 5% امتیاز گرفتند و در ابزاری دیگر 68%. اگر مؤسسه شما از یک آشکارساز استفاده می‌کند, همان ابزار برای انطباق مهم است, اما یک امتیاز واحد, مدرکی بر استفاده از AI نیست.

به‌صورت راهبردی انسانی‌سازی کنید. خروجی خام AI قابل تشخیص است. متنِ به‌خوبی انسانی‌سازی‌شده, عمدتاً چنین نیست. اگر از کمک AI استفاده کرده‌اید, پیش‌نویس خود را از یک quality humanization tool عبور دهید و صدای شخصی خود را به آن بیفزایید. آزمون‌های ما نشان داد این ترکیب, امتیازهای تشخیص را در هر پنج ابزار به زیر 15% کاهش داد.

پیش‌نویس‌های خود را نگه دارید. نسخه‌های میانی کارتان را ذخیره کنید. تاریخچه مرورگر, لاگ‌های گفت‌وگوی ChatGPT, PDFهای حاشیه‌نویسی‌شده, یادداشت‌های دست‌نویس, همه این‌ها اگر زمانی مورد پرسش قرار بگیرید, برای فرایند نوشتن شما مدرک فراهم می‌کنند.

برای سیاست‌های نهادی بهتر advocacy کنید. ابزارهای تشخیص AI به اندازه کافی قابل اتکا نیستند که به‌عنوان تنها مدرکِ تخلف علمی به کار روند. اگر دانشگاه شما یک امتیاز AI در Turnitin را به‌عنوان اثبات می‌پذیرد, با داده‌ها مخالفت کنید. پژوهش‌هایی مانند همین مورد را به اشتراک بگذارید.

برای گام‌های عملی در مواجهه با متنِ علامت‌گذاری‌شده, راهنمای ما درباره how researchers are bypassing AI detection without cheating را ببینید.

رقابت تسلیحاتیِ تشخیص AI متوقف نمی‌شود. آشکارسازها بهتر خواهند شد. اما ابزارهای نویسندگیِ مبتنی بر AI هم بهتر خواهند شد. راه‌حل بلندمدت, تشخیص بهتر نیست, بلکه سیاست بهتر است, سیاستی که بپذیرد نوشتن در عمل امروز چگونه رخ می‌دهد.

کار شما واقعی است. ایده‌های شما واقعی‌اند. یک الگوریتم معیوب نباید داورِ این حقیقت باشد.

پرسش‌های متداول

Q: کدام AI detector دقیق‌تر است؟

در آزمون‌های ما، Turnitin و Originality.ai از نظر دقت کلی بالاتر، با 72% و 74% به‌ترتیب، در همه دسته‌های نمونه به تساوی رسیدند. با این حال، دقت بر حسب نوع متن تفاوت قابل‌توجهی داشت. Turnitin در شناسایی خروجی خام AI بهترین بود، اما روی متن انگلیسیِ غیربومی false positives بیشتری داشت. Originality.ai متعادل‌تر بود، اما روی متن humanized اثربخشی کمتری داشت. هیچ detectorی به دقت بالاتر از 80% در همه دسته‌ها نرسید، که برای ابزارهایی که برای تصمیم‌گیری درباره integrity آکادمیک به کار می‌روند، محدودیتی مهم است.

Q: آیا AI detectors روی writing آکادمیک کار می‌کنند؟

آن‌ها روی برخی انواع writing آکادمیک بهتر از انواع دیگر کار می‌کنند. خروجی خام و ویرایش‌نشده AI با سبک آکادمیک معمولاً شناسایی می‌شود, نرخ‌های detection در آزمون ما از 70% تا 100% متغیر بود. اما متن آکادمیکِ formal که انسان نوشته باشد، با نرخ‌های نگران‌کننده‌ای false positives ایجاد می‌کند, تا 12% در آزمون‌های ما. حوزه‌های فنی با واژگان تخصصی و نویسندگان غیربومی انگلیسی به‌طور نامتناسبی تحت تأثیر قرار می‌گیرند. پاسخ کوتاه این است: AI detectors روی writing آکادمیک کار می‌کنند، اما نه به اندازه‌ای قابل‌اعتماد که به‌تنهایی به‌عنوان evidence مورد استفاده قرار گیرند.

Q: AI detectors هر چند وقت یک‌بار writing انسانی را flag می‌کنند؟

در آزمون ما روی 20 نمونه نوشته‌شده توسط انسان (10 بومی انگلیسی، 10 غیربومی)، 9 نمونه, یعنی 45%, از دست‌کم یک detector نمره AI بالاتر از 20% دریافت کردند. سه متن نوشته‌شده توسط انسان از دست‌کم یک tool نمره‌ای بالاتر از 50% گرفتند. نرخ false positive برای هر detector از 4% تا 12% متغیر بود. اگر شما به‌عنوان یک انگلیسی‌زبان غیربومی در حال نوشتن نثر رسمی آکادمیک باشید، احتمال false positive حتی بیشتر است. به همین دلیل است که ما توصیه می‌کنیم پیش‌نویس‌ها و شواهد فرایند را، صرف‌نظر از این‌که از AI tools استفاده کرده‌اید یا نه، نگه دارید.

Q: آیا AI detectors روی متن humanized یا ویرایش‌شده کار می‌کنند؟

به‌مراتب کمتر از خروجی خام قابل‌اعتمادند. در benchmark 2,000-سندی ما، متنی که توسط یک humanizer آکادمیک پردازش شده بود، در قوی‌ترین تنظیم، از detection AI در Turnitin در حداکثر 92.33% اسناد عبور کرد. detection به الگوهای آماری وابسته است، و بازنگری ماهوی آن‌ها را حذف می‌کند.

Q: آیا نمره detection AI می‌تواند به‌عنوان proof of misconduct استفاده شود؟

خود فروشندگان می‌گویند خیر. Turnitin نشانگر خود را صرفاً به‌عنوان سیگنالی برای بررسی بیشتر معرفی می‌کند، و false positives روی writing انسانیِ واقعی در همه detectorهای اصلی مستند شده است. یک نمره، فقط دلیلی برای بررسی دقیق‌تر است و چیزی بیش از این نیست.

AI Proofreader for Research Papers

Proofread and polish your manuscript with tracked changes. Built for academic writing.

Moe - Author at ProofreaderPro.ai
MoePhD in Natural Language Processing

Moe یک مهندس NLP با PhD در پردازش زبان طبیعی است. تحقیقات او زبان‌شناسی محاسباتی، تجزیه و تحلیل متن و یادگیری ماشین را پوشش می‌دهد و مستقیماً به مدل‌های ویرایش و انسانی‌سازی پشت ProofreaderPro وارد می‌شود. او در مورد بخشی از فرآیند می نویسد که اکثر مردم هرگز نمی بینند: چگونه یک مدل زبان جمله ای را می خواند، آن را نمره می دهد و تصمیم می گیرد چه چیزی را تغییر دهد.

ادامه مطلب را بخوانید

Text Humanizer را رایگان امتحان کنید

شروع رایگان
Proofreader Pro AI
تحقیقات خود را با ProofreaderPro.ai بهبود بخشید، پیشرفته‌ترین ابزار تصحیح متنی مبتنی بر هوش مصنوعی در جهان که برای متون آکادمیک تنظیم شده است.
ProofreaderProAI, Greenleaf Ave, Staten Island, 10310 New York
ابزارهای رایگان
حذف ام‌داشتعداد کلماتبررسی‌گر دستور زبانتولیدکننده نقل قولبررسی خواناییپاک‌کننده هوشمند کلمات AIبررسی صدای مجهولتبدیل به عنوان‌نویسی با حروف بزرگ و کوچکگسترش‌دهنده انقباضاتبررسی رسمی بودنهمه ابزارهای رایگان
© 2026 ProofreaderPro.ai. یک ویراستار، ادیتور و انسانی ساز دانشگاهی پیشرو. ساخته شده با ❤️ و ساختار نحوی درست و از نظر زبانی صحیح 🌳s