DeepL vs GPT-5 vs Gemini 3 vs Claude (آزمون دانشگاهی ۲۰۲۶)
ترجمه دانشگاهی DeepL در برابر GPT-4؛ اکنون با GPT-5 (جانشین GPT-4)، بهعلاوه Gemini 3 و Claude Sonnet که توسط داوران دکتری ارزیابی شدهاند. ببینید برای مقاله شما کدام برنده است.
این پرسش را زیاد از پژوهشگرانی میشنویم که میخواهند پژوهش خود را به زبان انگلیسی ترجمه کنند. اما آن را در پنج زبان مختلف از ما میپرسند: «برای مقاله دانشگاهیام کدام مترجم هوش مصنوعی را استفاده کنم؟» بیشتر مقایسههای موجودِ DeepL در برابر GPT-4 برای ترجمه دانشگاهی، از نظر زمانی عقبافتادهاند؛ چون GPT-5 همان مدلی است که GPT-4 را جایگزین کرده و همینک پرچمدار فعلی ما برای بنچمارک اینجا است. متأسفانه پاسخ ساده در نیمهٔ میانی ۲۰۲۶ این است که یک پاسخ واحد وجود ندارد. هر چهار موتور ترجمه برتر (DeepL، GPT-5، Gemini 3 و Claude Sonnet) در چیزهای متفاوتی عالیاند و اینکه کدام را به کار بگیرید کاملاً به نیازهای شما بستگی دارد. تصمیم شما به ترکیب زبانی، طول متن، تعداد استنادات (سیتیشنها) و اینکه چقدر زمان میخواهید صرف اصلاح نسخهٔ ترجمهشده توسط ماشین کنید وابسته است. پاسخ، یک ماتریس تصمیم است، نه یک فهرست رتبهبندی.
ما هر چهار ابزار را گرفتیم و آنها را با مجموعهای ثابت از ۳۲ متنِ دانشگاهی تغذیه کردیم که از آرشیو محتوای در حال آمادهسازی سردبیریمان انتخاب شده بود؛ شامل ۸ متن از چینی به انگلیسی، ۸ متن از اسپانیایی به انگلیسی، ۸ متن از ژاپنی به انگلیسی و ۸ متن از عربی به انگلیسی، در حوزههای گوناگون (زیستپزشکی، علوم رایانه، علوم اجتماعی، علوم انسانی). هر متن باید دستکم سه استناد درونمتنی داشته باشد، یک عبارت آماری و یک اصطلاح تخصصیِ مرتبط با رشته که یک متخصص حوزه بتواند آن را بررسی کند. سپس هر ترجمه را در هفت محور ارزیابی کردیم و سه داور همتای سطح دکتری به کار گرفتیم (یک داروساز بالینی، یک دانشمند علوم رایانه، یک پژوهشگر ادبیات) تا «آمادگی متن انگلیسی» را روی یک مقیاس ۱ تا ۵ امتیاز دهند، بدون اینکه بدانند ترجمه مربوط به کدام سیستم است.
این پست نتیجهٔ کار است. چهار مدعی را پوشش میدهیم و نسخههایی را که آزمودیم، روش آزمون، جدول مقایسهٔ اصلی، یک بررسی عمیق در یک بخش جداگانه برای هر ابزار (شامل نقاط قوت و حالتهای شکست) و در نهایت یک ماتریس تصمیم برای انتخاب ابزار مناسب برای یک جفتزبان مشخص و نوع سند ارائه میکنیم. یافتهٔ اصلی: در ۲۰۲۶ یک «بهترین ابزار واحد» برای ترجمه دانشگاهی وجود ندارد، اما «بهترین جریان کاری» وجود دارد.
DeepL vs GPT-4 ترجمه دانشگاهی: کدام ابزار هوش مصنوعی در ۲۰۲۶ برنده است؟
هیچ ابزار واحدی بهترین نیست. DeepL در حفظ استنادات و جفتزبانهای اروپایی برتری دارد، ChatGPT (GPT-5، جانشین GPT-4) برای ثبتِ نوشتاری دانشگاهی در متنهای کوتاه بهتر است، Gemini 3 Pro در انسجامِ متنهای طولانی و پوشش جفتزبانها بهترین است و Claude Sonnet در آزمون داوران دکتری ما بالاترین امتیاز «قابلیت انتشار» را کسب میکند. برای یک نسخهٔ کاملِ آماده برای ارسال به یک ژورنال تراز اول، جریان کاری دو مرحلهای (ترجمه با یک ابزار، بهبود register با ابزار دیگر و سپس ویرایش نهایی) از هر رویکرد یکمرحلهای بهتر عمل میکند.
چهار مدعی و چیزهایی که آزمودیم
نسخههای موجود تا ژوئن ۲۰۲۶ همگی در تنظیمات پیشفرضشان آزمایش شدند (بدون فاینتیونینگ، بدون گلاسری سفارشی، بدون مهندسی پرامپت فراتر از یک دستور یکخطی به اینکه «این متن دانشگاهی را به انگلیسی ترجمه کن»).
DeepL. ابزار تخصصی ترجمه که از یک مدل عصبی طراحیشده بهطور ویژه برای ترجمه استفاده میکند (در مقابل تولید متن با کاربرد عمومی). در محصول مصرفکننده هیچ برندسازی خاصی ندارد. مدل همواره بهبود یافته است. قویترین سابقهٔ پیشین در جفتزبانهای اروپایی.
GPT-5. پرچمدار فعلی OpenAI که اواخر ۲۰۲۵ راهاندازی شد. در رابط کاربری مصرفکنندهٔ ChatGPT و نیز برای اسناد طولانیتر از طریق API آزمایش شد. پنجرهٔ کانتکست 128K به اندازهای بزرگ است که بیشتر مقالات ژورنالی را در یک پاس پوشش دهد؛ اما برای مقالات طولانی، تقسیمبندی (chunking) لازم خواهد شد.
Gemini 3 Pro. مدل تولیدی فعلی گوگل، همراه با اجرای Deep Think در فوریهٔ ۲۰۲۶ برای رشتههایی که به ریاضی سنگین وابستهاند. نسخهٔ استاندارد 3 Pro (نه Deep Think) آزمایش شد، چون بیشتر سناریوهای ترجمه به لایهٔ استدلالِ اضافی نیاز ندارند. در ارزیابی انسانی WMT25 در 14/16 جفتزبان برنده شد (پیشینی Gemini 2.5 Pro)، و معیار ۲۰۲۶ را بالا برد.
Claude Sonnet. مدل تولیدی فعلی Anthropic. Sonnet در مقایسه با Opus ترجیح داده شد، چون نسبت سرعت به کیفیت برای نحوهٔ استفادهٔ پژوهشگران (که معمولاً به دنبال انجام کارهای ترجمه با سرعت هستند) واقعبینانهتر است؛ Opus برای ترجمهٔ معمولی بیش از حد لازم است. پنجرهٔ کانتکست 200K بهراحتی کل پایاننامهها را در یک پاس پوشش میدهد.
اما چیزی که هنوز جای سؤال دارد «مواردی است که حذف شدهاند». من Google Translate را امتحان نکردم (کلاس متفاوتی دارد و در پستِ ما دربارهٔ AI translators vs Google Translate بسیار خوب پوشش داده شده است)، DeepSeek R1 را هم نه (برای چینی به انگلیسی خوب است، اما هنوز عملاً در گروه ما برای ترجمهٔ کامل دانشگاهی استفاده نشده) و نیز Llama 4 را (که منبعباز است و میتوانست کار کند، اما هزینهٔ راهاندازی باعث میشود برای بیشتر افراد انتخاب عملی نباشد).
روش آزمون: هفت بُعدی که برای ترجمه دانشگاهی مهماند
یک بنچمارک برای نثر دانشگاهی دقیقاً مثل بنچمارک برای متنهای بازاریابی یا مستندسازی فنی نیست. ابعادی که اهمیت دارند:
| بُعد | چه چیزی را بررسی کردیم | چرا اهمیت دارد |
|---|---|---|
| وفاداری به معنا | آیا انگلیسی همان ادعا را منتقل میکند که متن منبع منتقل میکند؟ | داوری که متن ترجمهشده را میخواند باید به همان نتیجههایی برسد که خوانندهٔ متن اصلی میرسد. |
| ثبتِ نوشتاری دانشگاهی | آیا نثر شبیه نوشتار دانشگاهیِ منتشرشده در حوزهٔ هدف است؟ | عدم تطابق register حتی وقتی دستور زبان درست باشد «نویسندهٔ غیرِ بومی» را لو میدهد. |
| اصطلاحات فنی | آیا اصطلاحات اختصاصی رشته با معادلهای قراردادی انگلیسی ارائه میشوند؟ | اصطلاحات اشتباه باعث میشود داور به این شک کند که نویسنده با حوزه آشنا نیست. |
| حفظ استنادات | آیا استنادهای درونمتنی دستنخورده میمانند، شامل قالببندی و علائم نگارشی؟ | استناداتِ دوبارهفرمتشده باعث ردّهای فنی-غربالگری میشوند. برای اینکه چرا این مسئله مهم است، یادداشتِ حفظ استنادات را ببینید (/blog/ai-paraphrasing-preserving-citations). |
| مدیریت عبارات آماری | آیا «p < 0.01»، «95% CI [0.34, 0.58]» و موارد مشابه حفظ میشوند؟ | ادعاهای آماری معمولاً مهمترین جملهها در بسیاری از مقالاتاند. |
| انسجام متنِ طولانی | آیا اصطلاحات در یک سند ۶۰ صفحهای ثابت میمانند؟ | «رَوَشزدگی» ترجمه در طول یک پایاننامه، گرانترین نوع خطا است. |
| پوشش جفتزبان | آیا در گسترهٔ اروپا-آسیا-عرب-هندی-اقبالی هم قوی است؟ | بسیاری از پژوهشگران برای جفتزبانهایی نیاز به ترجمه دارند که ابزارهای رایج در آنها ضعیفاند. |
سه داورِ دکتری قابلیت انتشار هر خروجی را روی مقیاس ۱ تا ۵ امتیاز دادند. امتیاز تجمیعی همان «عدد قابلیت انتشار» است که در جدول زیر گزارش شده است. امتیازهای اختصاصی هر بُعد (خارج از ۵) قضاوتهای سردبیری ما هستند که با استفاده از همان روبریک برای هر خروجی اعمال شدهاند.
نتایج: جدول مقایسهٔ اصلی
میانگین روی همهٔ ۳۲ متن، ژوئن ۲۰۲۶.
| بُعد (خارج از ۵) | DeepL | GPT-5 | Gemini 3 Pro | Claude Sonnet |
|---|---|---|---|---|
| وفاداری به معنا | 4.4 | 4.6 | 4.7 | 4.7 |
| ثبتِ نوشتاری دانشگاهی | 3.8 | 4.5 | 4.4 | 4.7 |
| اصطلاحات فنی | 4.2 | 4.4 | 4.5 | 4.5 |
| حفظ استنادات | 4.6 | 3.9 | 4.0 | 4.3 |
| عبارات آماری | 4.5 | 4.3 | 4.4 | 4.4 |
| انسجام متنِ طولانی | 3.5 (chunking لازم در حدود ~۵K کلمه) | 4.3 | 4.6 | 4.7 |
| پوشش جفتزبان | 4.2 (قوی در EU؛ ضعیفتر در ZH/JA/AR) | 4.5 | 4.6 | 4.5 |
| قابلیت انتشار (امتیاز داوری دکتری) | 4.0 | 4.4 | 4.4 | 4.6 |
از این جدول سه نکتهٔ مهم را باید به خاطر سپرد. نخست اینکه فاصلهٔ قابلیت انتشار از چیزی که هیچ طرح بازاریابیِ هیچ فروشندهای نشان میدهد کمتر است؛ حتی DeepL هم متنی تولید میکند که داور میتواند با تغییرات حداقلی آن را با رضایت بپذیرد. دوم اینکه DeepL در استنادات برنده میشود اما در ثبتِ نوشتاری دانشگاهی و انسجام متنِ طولانی بهطور جدی عقب میماند. سوم اینکه Claude Sonnet بهطور متوسط بالاترین امتیاز قابلیت انتشار را دارد؛ چون هم در ثبتِ نوشتاری دانشگاهی و هم در انسجام متنِ طولانی عملکرد خوبی نشان داده است. این موضوع با برداشت ما همخوان است که Claude بهترین نتیجه را برای کارهای ظریفتر و پرجزئیات میگیرد.
روایتِ «بُعد به بُعد» از عدد تیترمانده مفیدتر است. بررسی عمیقتر در ادامه.
DeepL: نقاط قوتِ مترجمِ تخصصی و جایی که کم میآورد
DeepL تنها ابزاری است در این بنچمارک که بهطور ویژه برای ترجمه ساخته شده، نه برای تولید متن با کاربرد عمومی. این trade-off در هر دو جهت دیده میشود.
DeepL در چه چیزهایی برنده است. حفظ استنادات در آزمون ما بالاترین نمره را دارد، یعنی 4.6. DeepL بهطور پیشفرض استنادهای داخل پرانتز را مثل توکنهای محافظتشده تلقی میکند؛ همانطور که عددها و اسامی خاص را نیز محافظت میکند. استناد معمولاً حتی وقتی متن اطراف بهشدت بازسازی میشود، دستنخورده باقی میماند. جفتزبانهای اروپایی (اسپانیایی، فرانسوی، آلمانی، ایتالیایی، پرتغالی، هلندی به انگلیسی) بهطور پیوسته 0.3 تا 0.5 بالاتر از ابزارهای دیگر در وفاداری به معنا برای این جفتزبانها امتیاز میگیرند. برای یک مقالهٔ کارآزمایی بالینی به زبان اسپانیایی که به انگلیسی برای ارسال به ژورنال Elsevier ترجمه میشود، DeepL در آزمون ما قویترین گزینهٔ «یکپاس» است.
DeepL در چه چیزهایی کم میآورد. ثبتِ نوشتاری دانشگاهی با نمرهٔ 3.8 پایینترین امتیاز را در بُعدی دارد که مهمترینِ داورها برای نسخههای کاملشدهٔ مقاله است. DeepL انگلیسی درست و روان تولید میکند؛ اما انگلیسیای تولید نمیکند که مثل متنِ آموزشدیده در یک رشته به نظر برسد. خروجی بیشتر شبیه یک ترجمهٔ حرفهایِ قابلقبول است تا شبیه مقالهای که توسط یک متخصص حوزه نوشته شده. راهحل، ویرایشِ پس از ترجمه توسط یک ویراستار آگاه به حوزه است. DeepL بهتنهایی برای ارسال به ژورنال تراز اول بدون انجام این «پاس دوم» کافی نیست.
محدودیت دیگر هم همان constraint مربوط به chunking است. رابط کاربری DeepL برای بیشتر کاربران، اسناد را در حدود ۵۰۰۰ کلمه chunk میکند و همین باعث میشود یک پایاننامه یا بازنگری طولانی در چند نشست انجام شود. انسجام اصطلاحات در بین نشستها افت میکند؛ ما دیدیم که همان اصطلاح در همان سند، در نشستهای متفاوت به سه روش مختلف ترجمه شده است. Pro API امکان آپلودهای طولانیتر در یک پاس را میدهد، اما جریانِ کارِ نسخهٔ مصرفکننده این امکان را ندارد.
برای مقالات زبانهای اروپاییِ کمتر از ۵۰۰۰ کلمه که به ژورنالهایی با pipelineهای قویِ copy-editing ارسال میشوند، توصیه همچنان DeepL است. برای اسناد طولانیتر یا جفتزبانهای غیراروپایی، محاسبات تغییر میکند.
ترجمه آکادمیک با حفظ استناد که به صورت داخلی تعبیه شده است
مترجم ما پیش از بازنویسی، استنادات، عبارتهای آماری و برچسبهای معادله را استخراج میکند، سپس آنها را دقیق و کلمه به کلمه دوباره درج مینماید. از بیش از 50 جفتزبانی انتخاب کنید. پلن رایگان، شامل یک مقاله کامل است.
رایگان امتحان کنیدGPT-5 (ChatGPT): جایی که DeepL vs ChatGPT برای ترجمه دانشگاهی میایستد
GPT-5 مترجمِ تخصصی نیست؛ یک مدل با کاربرد عمومی است که اتفاقاً ترجمهٔ خوبی هم انجام میدهد. پیامدهای آن در هر دو جهت دیده میشود.
GPT-5 در چه چیزهایی برنده است. register دانشگاهی با نمرهٔ 4.5 بهطور معناداری بالاتر از DeepL است. این مدل الگوهای بلاغیِ انگلیسی دانشگاهی را از دادههای آموزشی که شامل بیشتر مقالات منتشرشده از حدود ۲۰۱۰ به بعد است درونی کرده. وقتی از آن خواسته میشود بخش روشها را ترجمه کند، انگلیسیِ مربوط به بخش روشها تولید میکند. وقتی خواسته میشود بحث را ترجمه کند، انگلیسیِ مربوط به بحث تولید میکند. تغییر register از قویترین ویژگیهای هر ابزار در بنچمارک ما است؛ با فاصلهای اندک فقط پشت Claude Sonnet.
GPT-5 همچنین در اصطلاحات تخصصی رشته در حوزههایی که دادهٔ آموزشی متراکم است قویترین است: یادگیری ماشین، پزشکی بالینی، فیزیک نظری. مدل میداند «transformer» در یک مقالهٔ ML از سال ۲۰۲۴ به دستگاه الکتریکی اشاره ندارد. این ابهامزدایی تقریباً همیشه درست رخ میدهد.
GPT-5 در چه چیزهایی کم میآورد. حفظ استنادات با نمرهٔ 3.9 ضعیفترین امتیاز در بنچمارک است. GPT-5 استنادهای درونمتنی را به شکل روایی بازنویسی میکند («Smith در سال ۲۰۲۴ نشان داد» بهجای «(Smith, 2024)») در حدود ۳۰ درصد از متنهای آزمون ما و ورودیهای فهرست منابع را نیز بازفرمت میکند (حذف ایتالیکها، نرمالسازی ampersandها) در حدود ۲۰ درصد. حالت شکست همان است که الگوهای جملهٔ شکنجهشده را به وجود میآورد و باعث میشود paper-mill screeners flag؛ یعنی یک پاس تولیدی که نمیداند استناد چیست، گرایش دارد آن را بازنویسی کند.
کاهش این مشکل در سطح پرامپت است: دستور دادن به GPT-5 بهصورت صریح برای حفظ همهٔ استنادهای درونمتنی و قالببندی فهرست منابع، نرخ بازنویسی را به حدود ۱۰ درصد کاهش میدهد. البته همچنان بالاتر از DeepL است، اما قابل انجام و قابل اتکا. هزینهٔ این کار «هزینهٔ پرامپت» است.
Gemini 3 Pro: بهترین گزینه برای ترجمه دانشگاهی عربی به انگلیسی و اسناد طولانی
Gemini 3 Pro در بنچمارک، در انسجام متنِ طولانی (4.6) قویترین ابزار است و از نظر پوشش جفتزبانها نیز با نمرهٔ 4.6 همامتیازِ بهترین است. هر دو نتیجه نشان میدهند که انتخابهای معماری و آموزش به شکل خاص برای ترجمه دانشگاهی مؤثر واقع شدهاند.
Gemini 3 در چه چیزهایی برنده است. بُعدی که برای پایاننامهها، کتابها و مقالههای مروری طولانی مهمترین است، انسجام متنِ طولانی با نمرهٔ 4.6 است. ما ترجمهٔ یک فصل پایاننامهٔ دکتری 38,000 کلمهای را در یک پاسِ Gemini 3 آزمودیم. این آزمون بیشترین انسجامِ اصطلاحات را از صفحهٔ ۱ تا صفحهٔ ۹۰ در میان تمام ابزارهای تستشده نشان داد. هم اثر chunking (DeepL) و هم مشکلات حافظهٔ کاری (GPT-5 در اسناد بزرگتر از حدود ۲۰,۰۰۰ کلمه) بسیار کمتر بود.
پوشش جفتزبان شامل جفتزبانهای کمکاربردی هم میشد که ما آزمودیم. عربی به انگلیسی بهخصوص در وفاداری به معنا نمرهٔ 4.7 گرفت که بهترین امتیاز بنچمارک برای این جفتزبان بود. همین جفتزبان توسط Gemini 2.5 در پیروزیِ ارزیابی انسانی WMT25 استفاده شد (۱۴ از ۱۶ جفتزبان).
Gemini 3 در چه چیزهایی کم میآورد. حفظ استنادات با نمرهٔ 4.0 کمی بهتر از GPT-5 است، اما بهطور معنیدار پایینتر از DeepL. مشکل همان پاس تولیدی است و همان mitigation (دستور صریح در سطح پرامپت). register دانشگاهی با نمرهٔ 4.4 کمی پایینتر از هر دو GPT-5 و Claude است و تقریباً. گاهی تلاش میکند تا کمی بیشتر شبیه انگلیسی دانشگاهیِ منتشرشده به نظر برسد تا آنچه واقعاً انجام میدهد؛ بنابراین خیلی شایسته و حرفهای به نظر میرسد، اما نه آنقدر «کاملاً بومیِ دانشگاهی».
نسخهٔ Deep Think (اجرای فوریهٔ ۲۰۲۶) ارزش امتحان دارد، بهویژه برای رشتههایی که ریاضی سنگین دارند. ما در آزمونمان متون مربوط به فیزیک یا قطعاتی با ریاضی سنگین را قرار ندادیم. بهبود لایهٔ استدلال ممکن است برای این جفتزبانها امتیازهای این بُعد را تغییر دهد. وقتی تعداد کافی مثالها را داشته باشیم تا تمیز آزمون کنیم دوباره بررسی میکنیم.
Claude Sonnet: بالاترین قابلیت انتشار بهطور میانگین
Claude Sonnet برای قابلیت انتشار (4.6) بالاترین امتیاز کلی را میگیرد؛ به دلیل ثبتِ نوشتاری دانشگاهی بالا (4.7) و انسجام متنِ طولانی (4.7). اجزایی که برای ارسالِ نسخهٔ آمادهٔ چاپ در ژورنالها برنده میشوند همانهایی هستند که Claude در آنها برتری دارد.
Claude در چه چیزهایی برنده است. register دانشگاهی با نمرهٔ 4.7 بالاترین امتیاز در بنچمارک است. نثر تولیدشده توسط این مدل مثل متنی است که یک متخصص حوزه نوشته باشد، نه مثل ترجمه. من همان متنی را دیدم که DeepL برای آن «The results indicate» تولید کرده بود و GPT-5 «The findings suggest»؛ اما Claude «These data support the inference that» تولید کرد. این همان لحن است که داور ژورنال انتظار دارد و بدون مهندسی پرامپت به شکل طبیعی ارائه شد.
انسجام متنِ طولانی با نمرهٔ 4.7 با Gemini 3 Pro در جایگاه نخست همامتیاز است و پنجرهٔ کانتکست 200K کل پایاننامهها را بهراحتی پوشش میدهد. حفظ استنادات با نمرهٔ 4.3 بهترین عملکرد بین ابزارهای مبتنی بر LLM است (هنوز پشت 4.6 DeepL است، اما بهطور معنیدار بهتر از GPT-5 یا Gemini). Claude در تغییر دادن ارجاعات داخل پرانتز نسبت به دیگر مدلهای تولیدی کمتر تهاجمی است.
Claude در چه چیزهایی کم میآورد. در حوزههایی که ادبیات بهسرعت در حال تغییر است، اصطلاحات فنی ممکن است از وضعیت فعلیِ مطلق عقب بمانند. آموزش مدل یک نقطهٔ توقف دارد؛ بنابراین گاهی مدل اصطلاحاتی را ترجمه میکند که بعد از نقطهٔ توقف به استاندارد تبدیل شدهاند، اما آنها را با اصطلاح قدیمی ترجمه میکند. در مرحلهٔ proof این موضوع بهراحتی اصلاح میشود، اما یک گامِ راستیآزمایی هم به فرایند اضافه میکند. داروساز بالینیِ داور ما دو نمونه از این مسئله را در متون پزشکی اشاره کرد. این مورد مانعِ جدی نیست، اما برای ترجمه در زیرحوزههای فعال ارزش دارد پرچم شود.
موضوع دیگر سرعت است. Sonnet برای ترجمهٔ معمولی سریع است، اما Opus در اسناد طولانی بهطور محسوسی کندتر است. از نظر کیفیت تفاوت چندان مهم نیست، اما اگر کسی بخواهد یک پایاننامهٔ ۶۰,۰۰۰ کلمهای را با عجله انجام دهد، اینکه Sonnet سریعتر از Opus است برای جریان کاری عملی او مرتبط خواهد بود.
ماتریس تصمیم: کدام ابزار برای چه کاری
جدول هفتبُعدی ورودیِ ما است. ماتریس تصمیم زیر چیزی است که ما واقعاً برای انتخاب ابزار در هر مورد از آن استفاده میکنیم.
| مورد استفادهٔ شما | ابزار پیشنهادی | چرا |
|---|---|---|
| مقالهٔ اسپانیایی، فرانسوی، آلمانی، ایتالیایی، پرتغالی یا هلندی با کمتر از ۵,۰۰۰ کلمه برای ژورنال Elsevier در سطح میانی | DeepL + ویرایش سبک | بهترین حفظ استنادات، بهترین وفاداری در جفتزبانهای اروپایی، سریع |
| مقالهٔ چینی، ژاپنی یا کرهای، هر طولی، برای ژورنال تراز اول | Claude Sonnet | بهترین ثبتِ نوشتاری دانشگاهی + انسجام متنِ طولانی؛ قوی در جفتزبانهای شرق آسیا |
| مقالهٔ عربی، هندی یا زبانهای هندی-اقبالی | Gemini 3 Pro | قویترین پوشش جفتزبان برای این جفتهای مشخص در تبار WMT25 |
| پایاننامه یا سند به طول کتاب (بیش از ۲۵,۰۰۰ کلمه) | Claude Sonnet یا Gemini 3 Pro | انسجام متنِ طولانی از رَوَشزدگی اصطلاحات بین chunkها جلوگیری میکند |
| بخش روششناسی با تراکم بالای استناد، هر جفتزبان | DeepL بهعنوان پاس اول + Claude Sonnet بهعنوان پاس دوم | ترکیب ترجمهٔ حفظکنندهٔ استنادات با بازنویسیِ بهبوددهندهٔ register |
| مقاله با تمرکز سنگین بر ریاضی یا فیزیک | Gemini 3 Pro (نسخهٔ Deep Think) | بهبود لایهٔ استدلال برای ترجمهٔ مبتنی بر معادله اهمیت دارد |
| ترجمه با حساسیت به هزینه و کیفیت در حد پیشنویس | GPT-5 از طریق ChatGPT رایگان | کمترین مانع ورود؛ کیفیت قابل قبول برای پیشنویسهایی که قرار است بهشدت ویرایش شوند |
الگو در سراسر ماتریس این است: هیچ ابزار واحدی غالب نیست و بهترین جریان کاری برای یک ارسال جدی تقریباً همیشه دو پاس است. ترجمه با یک ابزار، بهبود register با ابزار دیگر، سپس پیش از ارسال proofread. برای مرحلهٔ proofread بهطور مشخص، پست ما دربارهٔ proofreading research papers جریان کاریای را پوشش میدهد که با هر یک از این ابزارهای ترجمه به خوبی جفت میشود.
ما مترجم دانشگاهی خودمان را ساختیم تا مشکل حفظ استنادات را که DeepL حل میکند و ثبتِ نوشتاری دانشگاهی را که Claude در آن برنده است، در یک پاس و بدون محدودیت chunking مدیریت کند. بنچمارک داخلی خود را جداگانه منتشر میکنیم و توصیه میکنیم تست ۵ دقیقهایِ حفظ استنادات را روی هر ابزاری، حتی ابزار خودمان، پیش از اعتماد کردن به آن برای یک نسخهٔ خطی اجرا کنید. بنچمارک بالا ابزار ما را شامل نمیشود چون یک تعارض منافع آشکار خواهد بود.
پرسشهای پرتکرار
س: کدام مترجم هوش مصنوعی برای مقالات دانشگاهی در ۲۰۲۶ بهترین است؟
هیچ ابزار واحدی بهترین نیست. DeepL در حفظ استنادات و جفتزبانهای اروپایی برنده است؛ GPT-5 در register دانشگاهی برای متنهای کوتاه برتری دارد؛ Gemini 3 Pro در انسجام متنِ طولانی و پوشش جفتزبانها برنده است؛ Claude Sonnet در register دانشگاهی برای ارسالِ کلِ سند و همچنین بالاترین امتیاز قابلیت انتشار را در آزمون داوران دکتری ما کسب میکند. برای یک نسخهٔ کامل که به ژورنال تراز اول ارسال میشود، جریان کاری دو مرحلهای (ترجمه با یک ابزار و بهبود register با ابزار دیگر) از هر رویکرد یکمرحلهای بهتر عمل میکند.
س: آیا DeepL میتواند ترجمهٔ چینی به انگلیسی دانشگاهی را انجام دهد؟
DeepL از سال ۲۰۲۳ روی ترجمهٔ چینی به انگلیسی بهبود داشته، اما همچنان در بنچمارک ما نسبت به Claude Sonnet و Gemini 3 Pro در این جفتزبان عقبتر است. فاصله در متنهای علوم انسانی و علوم اجتماعی بزرگترین است؛ جایی که قراردادهای آکادمیکِ محاورهوار چینی از طریق معماری عصبی DeepL بهدرستی منتقل نمیشود. DeepL برای پاس اول قابل قبول است، البته با ویرایش برای ترجمهٔ تخصصی و زیستپزشکی از چینی به انگلیسی. Claude Sonnet گزینهٔ قویتری برای ترجمهٔ کلِ نسخهٔ خطی است.
س: آیا این ابزارها معادلات LaTeX و ارجاعات شکلها را حفظ میکنند؟
بهصورت متفاوت. DeepL در آزمون ما بهترین عملکرد را با LaTeX درونخطی دارد، چون نمادگذاری ریاضی را بهعنوان توکنهای محافظتشده در نظر میگیرد. GPT-5، Gemini 3 و Claude همه گاهی برچسبهای معادله را به نثر بازنویسی میکنند («Equation 3» تبدیل میشود به «the third equation») یا ریاضی درونخطی را میشکنند. برای اسناد سنگین از نظر LaTeX، جریان کاری پیشنهادی این است که قبل از ترجمه، معادلات استخراج شوند، نثر ترجمه شود و سپس دوباره درج شوند. مترجم ما این کار را بهصورت خودکار برای هر سندِ منبعی انجام میدهد.
س: ترجمهٔ یک مقالهٔ پژوهشی کامل با این ابزارها چقدر زمان میبرد؟
یک مقالهٔ معمول ۶,۰۰۰ کلمهای با هر یک از چهار ابزار، حدود ۲ تا ۵ دقیقه زمان ترجمه میبرد و سپس ۳۰ دقیقه تا ۲ ساعت زمان برای بررسی و ویرایش پس از ترجمه نیاز است؛ بسته به جفتزبان و ژورنال هدف شما. DeepL در مرحلهٔ ترجمه سریعترین است؛ Claude در اسناد طولانی کندترین است (trade-off برای انسجام متنِ طولانی). گلوگاهِ همهٔ ابزارها مرحلهٔ بررسی انسانی است، نه استنتاجِ مدل.
س: آیا باید از این ابزارها بهجای یک مترجم حرفهای استفاده کنم؟
بستگی به میزان ریسک دارد. برای ارسال به Nature، Science، Cell یا یک ژورنال بالینی در بین پنج ژورنال برتر، هنوز ارزش دارد برای بخش مقدمه و بحث از ترجمهٔ انسانی حرفهای (یا ویرایش انسانی بر پایهٔ ترجمهٔ هوش مصنوعی) هزینه کنید. برای ارسال به ژورنالهای میانی، ژورنالهای منطقهای و بیشتر مقالات کنفرانسی، ترجمهٔ هوش مصنوعی با جریان کاری دو مرحلهای و سپس یک proofread نهایی از نظر انتشار قابل قبول است و بهطور چشمگیری ارزانتر تمام میشود. در آزمون ما، جریان کاری دو مرحلهایِ هوش مصنوعی حدود ۴.۳ تا ۴.۶ روی مقیاس قابلیت انتشار امتیاز میگیرد، در حالی که ترجمهٔ انسانیِ حرفهای معمولاً ۴.۶ تا ۴.۹ امتیاز میگیرد. این اختلاف واقعی است، اما کمتر از چیزی است که بیشتر پژوهشگران تصور میکنند.
بیش از 50 جفتزبانی. استخراج استناد قبل از بازنویسی، درج مجدد دقیقاً به صورت کلمه به کلمه پس از آن. لحن آکادمیک متناسب با نوع هر بخش تنظیم شده است.

لیزا دارای PhD در زبان شناسی از NYU است و همیشه کنجکاو بوده است که چگونه کامپیوترها می توانند از زبان شناسی کاربردی برای درک و برقراری ارتباط به زبان انسانی استفاده کنند و به ویرایش محتوای نوشته شده انسان کمک کنند. او در حال حاضر مدیر ارشد بازاریابی در ProofreaderPro است، جایی که بازاریابی را در سراسر کپی، رسانه های اجتماعی، ایمیل و کانال های آفلاین هدایت می کند.