DeepL vs GPT-5 vs Gemini 3 vs Claude (একাডেমিক টেস্ট ২০২৬)
DeepL বনাম GPT-4 একাডেমিক অনুবাদ, এখন GPT-5 (GPT-4-এর উত্তরসূরি), এছাড়া Gemini 3 এবং Claude Sonnet-ও আছে; এগুলো PhD রিভিউয়ারদের দ্বারা পরীক্ষা করা হয়েছে। আপনার গবেষণাপত্রের জন্য কে এগিয়ে, তা দেখুন।
আমরা গবেষকদের কাছ থেকে এই প্রশ্নটা খুবই বেশি পাই, যারা তাদের গবেষণাকে ইংরেজিতে অনুবাদ করতে চান। তবে তারা আমাদের কাছে পাঁচটি ভিন্ন ভাষায় জানতে চান: আমার একাডেমিক পেপারের জন্য কোন AI অনুবাদক ব্যবহার করব? বিদ্যমান অনেক DeepL বনাম GPT-4 একাডেমিক অনুবাদ তুলনাই ইতোমধ্যে পুরোনো হয়ে গেছে, কারণ GPT-5 হলো সেই মডেল যেটি GPT-4-কে প্রতিস্থাপন করেছে, আর এখানেই আমরা যে বেঞ্চমার্ক করেছি, সেটাই বর্তমান ফ্ল্যাগশিপ। দুর্ভাগ্যজনকভাবে, ২০২৬ সালের মাঝামাঝি সরল উত্তর হলো, একটা একক উত্তর নেই। চারটি শীর্ষ অনুবাদ ইঞ্জিন (DeepL, GPT-5, Gemini 3 এবং Claude Sonnet) ভিন্ন ভিন্ন কাজে সবচেয়ে ভালো, এবং কারও প্রয়োজন অনুযায়ী এগুলোর মধ্যে কোনটি ব্যবহার করা যৌক্তিক তা নির্ধারিত হয়। সিদ্ধান্ত নির্ভর করে ভাষা-কম্বিনেশনের ওপর, টেক্সটের দৈর্ঘ্যের ওপর, আপনার কতগুলো citation আছে তার ওপর, এবং মেশিন-অনুবাদের সংস্করণ ঠিক করতে আপনি কতটা সময় ব্যয় করতে চান তার ওপর। উত্তর হলো একটি সিদ্ধান্তমূলক ম্যাট্রিক্স, এটা কোনো “টার লিস্ট” (tier list) নয়।
আমরা চারটি টুলই নিয়েছি এবং আমাদের সম্পাদকীয় ব্যাকলগ থেকে নির্দিষ্ট ৩২টি একাডেমিক অনুচ্ছেদে প্রয়োগ করেছি। এর মধ্যে চীনা-থেকে-ইংরেজি থেকে ৮টি, স্প্যানিশ-থেকে-ইংরেজি থেকে ৮টি, জাপানি-থেকে-ইংরেজি থেকে ৮টি, এবং আরবি-থেকে-ইংরেজি থেকে ৮টি, মোট ৩২টি। বিভিন্ন শাখা ছিল (বায়োমেডিক্যাল, কম্পিউটার সায়েন্স, সোশ্যাল সায়েন্স, হিউম্যানিটিজ)। প্রতিটি টেক্সটে অন্তত তিনটি ইন-টেক্সট citation থাকতে হয়েছে, একটি পরিসংখ্যানগত অভিব্যক্তি (statistical expression) এবং এমন একটি শাখাভিত্তিক শব্দ থাকতে হয়েছে যেটা ডোমেইন বিশেষজ্ঞ যাচাই করতে পারবেন। আমরা প্রতিটি অনুবাদকে সাতটি মাত্রায় (axes) মূল্যায়ন করেছি এবং অন্ধভাবে, কোন সিস্টেম থেকে অনুবাদ এসেছে তা না জেনে, তিনজন PhD-স্তরের peer reviewer (একজন clinical pharmacologist, একজন computer scientist, একজন literature scholar) ইংরেজি প্রস্তুতিমানের (English readiness) স্কোর দিয়েছেন ১ থেকে ৫ স্কেলে।
এই পোস্টটাই তার ফলাফল। এখানে আমরা চারটি প্রতিদ্বন্দ্বীকে কভার করেছি, যে সংস্করণগুলো পরীক্ষা করা হয়েছে, টেস্ট মেথড, প্রধান তুলনামূলক টেবিল, প্রতিটি টুলের জন্য এক-সেকশনের গভীর বিশ্লেষণ (strengths এবং failure modes সহ), এবং একটি সিদ্ধান্তমূলক ম্যাট্রিক্স আছে, যে ভাষা-পেয়ার ও ডকুমেন্ট টাইপের জন্য কোন টুল ঠিক হবে। সারকথা: ২০২৬ সালে একক “সেরা” অনুবাদ টুল নেই, তবে এক ধরনের “সেরা ওয়ার্কফ্লো” আছে।
DeepL vs GPT-4 একাডেমিক অনুবাদ: ২০২৬ সালে কোন AI টুল জেতে?
এককভাবে সেরা টুল নেই। citation সংরক্ষণে DeepL এগিয়ে, এবং ইউরোপীয় ভাষা-পেয়ারগুলোতে এটি শক্তিশালী। ChatGPT (GPT-5, GPT-4-এর উত্তরসূরি) ছোট অনুচ্ছেদে scholarly register-এ জেতে; Gemini 3 Pro লম্বা-কনটেক্সটের coherence এবং language pair coverage-এ এগিয়ে; আর Claude Sonnet আমাদের PhD-রিভিউয়ার টেস্টে সর্বোচ্চ publishability স্কোর পোস্ট করেছে। শীর্ষ-স্তরের জার্নালে পাঠানোর মতো একটি পূর্ণ পাণ্ডুলিপির জন্য, দুই-পাসের ওয়ার্কফ্লো (এক টুল দিয়ে অনুবাদ, অন্য টুল দিয়ে register উন্নত করা, তারপর proofread) যেকোনো এক-পাস পদ্ধতিকে ছাড়িয়ে যায়।
চারটি প্রতিদ্বন্দ্বী ও আমরা কী পরীক্ষা করেছি
জুন ২০২৬ পর্যন্ত বর্তমান থাকা সংস্করণগুলো সবই তাদের ডিফল্ট সেটিংসে পরীক্ষা করা হয়েছে (কোনো fine-tuning নেই, কাস্টম গ্লসারি নেই, এবং এক-লাইনের নির্দেশ ছাড়া prompt engineering নেই: "translate this academic passage into English")।
DeepL. অনুবাদের জন্য বিশেষায়িত একটি টুল, যা একটি neural model ব্যবহার করে, যেটি নির্দিষ্টভাবে অনুবাদের জন্য ডিজাইন করা (জেনারেল-পারপাস জেনারেশনের বিপরীতে)। কনজিউমার প্রোডাক্টে কোনো ব্র্যান্ডিং নেই। মডেল ক্রমাগত উন্নত হচ্ছে। ইউরোপীয় ভাষা-পেয়ারগুলোর ক্ষেত্রে আগের খ্যাতি সবচেয়ে শক্তিশালী।
GPT-5. OpenAI-এর বর্তমান ফ্ল্যাগশিপ, ২০২৫ সালের শেষ দিকে চালু। ChatGPT কনজিউমার ইন্টারফেসের মাধ্যমে এবং দীর্ঘ ডকুমেন্টের জন্য API-এর মাধ্যমে পরীক্ষা করা হয়েছে। ১২৮K কনটেক্সট উইন্ডো এক পাসে বেশিরভাগ জার্নাল-দৈর্ঘ্যের পেপার কভার করার জন্য যথেষ্ট; কিন্তু দীর্ঘ পেপারে chunking লাগবে।
Gemini 3 Pro. গুগলের বর্তমান প্রোডাকশন মডেল; গণিত-ভারী ডিসিপ্লিনের জন্য ফেব্রুয়ারি ২০২৬-এর Deep Think রোলআউট রয়েছে। স্ট্যান্ডার্ড 3 Pro (Deep Think নয়) পরীক্ষা করা হয়েছে, কারণ অধিকাংশ অনুবাদ ব্যবহার-কেসে অতিরিক্ত reasoning layer দরকার হয় না। Gemini 2.5 Pro-এর উত্তরসূরি হিসেবে ১৬টির মধ্যে ১৪টি ভাষা-পেয়ারে WMT25 মানব মূল্যায়নে জিতেছে, ফলে ২০২৬ সালের জন্য মানদণ্ডটা অনেক উঁচুতে সেট হয়।
Claude Sonnet. Anthropic-এর বর্তমান প্রোডাকশন মডেল। Opus-এর চেয়ে Sonnet-কে পছন্দ করা হয়েছিল, কারণ গতি-থেকে-মানের (speed-to-quality) অনুপাত গবেষকদের বাস্তব ব্যবহারধারার সাথে বেশি বাস্তবসম্মত; নিয়মিত অনুবাদের ক্ষেত্রে Opus অতিরিক্ত (overkill)। ২০০K কনটেক্সট উইন্ডো এক পাসেই পুরো থিসিস সহজে কভার করে।
যা অনুপস্থিত, সেটা এখনো উন্মুক্ত প্রশ্ন। আমি Google Translate ট্রাই করিনি (ক্লাস আলাদা; আমাদের AI translators vs Google Translate পোস্টে এটি খুব ভালোভাবে কভার করা আছে), DeepSeek R1 (চীনা-থেকে-ইংরেজিতে ভালো, কিন্তু এখনো আমাদের দলে পূর্ণাঙ্গ একাডেমিক অনুবাদের জন্য সত্যিই ব্যবহৃত হচ্ছে না) কিংবা Llama 4 (এটি ওপেন সোর্স এবং কাজ করতে পারত, কিন্তু সেটআপের খরচ হওয়ায় বেশিরভাগ মানুষের জন্য এটি বাস্তবসম্মত পছন্দ নয়)।
টেস্ট মেথডোলজি: একাডেমিক অনুবাদে যে সাতটি মাত্রা সবচেয়ে গুরুত্বপূর্ণ
একাডেমিক গদ্যের জন্য অনুবাদ বেঞ্চমার্ক, মার্কেটিং কপির বা টেকনিক্যাল ডকুমেন্টেশনের বেঞ্চমার্কের মতো নয়। যে মাত্রাগুলো গুরুত্বপূর্ণ তা হলো:
| মাত্রা | আমরা কী যাচাই করেছি | কেন তা গুরুত্বপূর্ণ |
|---|---|---|
| অর্থের বিশ্বস্ততা (Meaning fidelity) | উৎসের দাবিটা ইংরেজিতে একইভাবে প্রকাশ পাচ্ছে কি? | অনুবাদিত টেক্সট পড়া একজন রিভিউয়ারকে উৎস পড়া পাঠকের মতোই একই সিদ্ধান্তে পৌঁছাতে হবে। |
| scholarly register | টার্গেট ফিল্ডে প্রকাশিত একাডেমিক লেখার মতো শোনাচ্ছে কি? | register ঠিক না হলে, ব্যাকরণ সঠিক হলেও "non-native author"-এর সংকেত পাওয়া যায়। |
| টেকনিক্যাল পরিভাষা | ফিল্ড-নির্দিষ্ট শব্দগুলো তাদের প্রচলিত ইংরেজি সমতুল্য রূপে অনুবাদ হচ্ছে কি? | ভুল পরিভাষা রিভিউয়ারের মনে সন্দেহ তৈরি করে যে লেখক ওই ফিল্ড জানেন না। |
| citation সংরক্ষণ | ইন-টেক্সট citation অক্ষত থাকে কি, format এবং punctuation সহ? | citation নতুনভাবে সাজালে টেকনিক্যাল-স্ক্রিন রিজেকশনের ঝুঁকি তৈরি হয়। কেন এটি গুরুত্বপূর্ণ তা দেখতে আমাদের citation-preservation নোটটি দেখুন (/blog/ai-paraphrasing-preserving-citations)। |
| পরিসংখ্যানগত অভিব্যক্তি পরিচালনা | কি "p < 0.01", "95% CI [0.34, 0.58]" এবং অনুরূপগুলো টিকে থাকে? | পরিসংখ্যানগত দাবি অনেক পেপারে সবচেয়ে তাৎপর্যপূর্ণ বাক্য। |
| লং-কনটেক্সট coherence | ৬০ পৃষ্ঠার ডকুমেন্ট জুড়ে পরিভাষা কি সামঞ্জস্যপূর্ণ থাকে? | একটি থিসিসজুড়ে অনুবাদ-ড্রিফট (translation drift) হলো সবচেয়ে ব্যয়বহুল ধরনের ত্রুটি। |
| language pair coverage | ইউরোপীয়-এশীয়-আরবি-ইন্ডিক বিস্তার জুড়ে শক্তিশালী? | প্রধানধারার অনেক টুল দুর্বল যেখানে, সেখানেও বহু গবেষকের অনুবাদ প্রয়োজন হয়। |
তিনজন PhD রিভিউয়ার প্রতিটি আউটপুটের publishability স্কোর ১ থেকে ৫ স্কেলে দেন। সামগ্রিক স্কোরটি নিচের টেবিলে রিপোর্ট করা publishability সংখ্যা। মাত্রাভিত্তিক স্কোরগুলো (৫-এর মধ্যে) হলো, একই রুব্রিক প্রয়োগ করার পর সম্পাদকীয় বিচার (editorial judgments)।
ফলাফল: প্রধান তুলনামূলক টেবিল
সব ৩২টি অনুচ্ছেদ জুড়ে গড়, জুন ২০২৬।
| মাত্রা (৫-এর মধ্যে) | DeepL | GPT-5 | Gemini 3 Pro | Claude Sonnet |
|---|---|---|---|---|
| অর্থের বিশ্বস্ততা (Meaning fidelity) | 4.4 | 4.6 | 4.7 | 4.7 |
| scholarly register | 3.8 | 4.5 | 4.4 | 4.7 |
| টেকনিক্যাল পরিভাষা | 4.2 | 4.4 | 4.5 | 4.5 |
| citation সংরক্ষণ | 4.6 | 3.9 | 4.0 | 4.3 |
| পরিসংখ্যানগত অভিব্যক্তি | 4.5 | 4.3 | 4.4 | 4.4 |
| লং-কনটেক্সট coherence | 3.5 (প্রায় ~5K শব্দে chunking দরকার) | 4.3 | 4.6 | 4.7 |
| language pair coverage | 4.2 (শক্তিশালী EU; ZH/JA/AR-এ দুর্বল) | 4.5 | 4.6 | 4.5 |
| Publishability (PhD-রেটেড) | 4.0 | 4.4 | 4.4 | 4.6 |
এই টেবিল থেকে নেওয়ার মতো তিনটি গুরুত্বপূর্ণ কথা আছে। প্রথমটি হলো, publishability-এর ব্যবধান (gap) কোনো ভেন্ডরের মার্কেটিং পিচে যতটা দেখানো হয়, ততটা বেশি নয়; এমনকি DeepL-ও এমন টেক্সট তৈরি করে যেটা একজন রিভিউয়ার ন্যূনতম পরিবর্তনেই গ্রহণ করতে পারেন। দ্বিতীয় কথা: DeepL citation-এ জেতে, কিন্তু scholarly register এবং long-context coherence-এ বেশ খারাপ করে। তৃতীয় কথা: Claude Sonnet গড়ে সর্বোচ্চ publishability স্কোর পায়, কারণ scholarly register এবং long-context coherence-এ এর পারফরম্যান্স খুব ভালো। আমাদের ধারণার সাথেও এটি মেলে যে nuance-heavy কাজের ক্ষেত্রে Claude সবচেয়ে ভালো করে।
হেডলাইন নাম্বারের চেয়ে মাত্রা ধরে ধরে ব্যাখ্যাটা বেশি কার্যকর। নিচে গভীর বিশ্লেষণ।
DeepL: অনুবাদ-বিশেষজ্ঞ হিসেবে শক্তি কোথায় এবং সীমাবদ্ধতা কোথায়
এই বেঞ্চমার্কে DeepL হলো একমাত্র টুল, যেটি জেনারেল জেনারেশনের বদলে বিশেষভাবে অনুবাদের জন্য নির্মিত। এর ট্রেড-অফ দুই দিকেই স্পষ্ট।
DeepL কোথায় জেতে। citation সংরক্ষণে আমাদের টেস্টে সর্বোচ্চ, ৪.৬। DeepL parenthetical citations-কে ডিফল্টভাবে protected tokens হিসেবে ধরে; সংখ্যা (numbers) এবং proper nouns-এর মতোই। আশপাশের গদ্য যখন গভীরভাবে পুনর্গঠিত হয়, তখনও citation সাধারণত অক্ষত থাকে। ইউরোপীয় ভাষা-পেয়ারগুলোতে (স্প্যানিশ, ফরাসি, জার্মান, ইতালিয়ান, পর্তুগিজ, ডাচ, ইংরেজিতে) বিশেষ করে meaning fidelity-তে অন্য টুলগুলোর তুলনায় ধারাবাহিকভাবে ০.৩ থেকে ০.৫ পয়েন্ট বেশি স্কোর করেছে। আমাদের টেস্টে Elsevier জার্নালে সাবমিশনের জন্য ইংরেজিতে অনুবাদের উদ্দেশ্যে স্প্যানিশ ভাষার একটি ক্লিনিক্যাল ট্রায়াল পেপারে DeepL সবচেয়ে শক্তিশালী এক-পাস অপশন।
DeepL কোথায় দুর্বল। গুরুত্বপূর্ণ মাত্রাটিতে, যেটা সম্পূর্ণ পাণ্ডুলিপির রিভিউয়ারদের কাছে সবচেয়ে গুরুত্বপূর্ণ, scholarly register-এর স্কোর ৩.৮, যা এখানে সবচেয়ে কম। DeepL সঠিক, সাবলীল ইংরেজি তৈরি করে; কিন্তু এমন ইংরেজি তৈরি করে না যেটা ফিল্ড-ট্রেইন্ড লেখকের মতো লাগে। আউটপুটটি ডোমেইন বিশেষজ্ঞের লেখা পেপারের মতো নয়; বরং এটি একজন দক্ষ পেশাদার অনুবাদক তৈরি করেছে মনে হয়। সমাধান হলো ডোমেইন-সচেতন proofreader দিয়ে post-translation editing করা। শীর্ষ-স্তরের জার্নালে সাবমিশনের জন্য সেই দ্বিতীয় পাস ছাড়া কেবল DeepL যথেষ্ট নয়।
আরেকটি সীমাবদ্ধতা হলো chunking কনস্ট্রেইন্ট। DeepL-এর ইন্টারফেস বেশিরভাগ ব্যবহারকারীর জন্য প্রায় ৫,০০০ শব্দে ডকুমেন্ট chunk করে; ফলে থিসিস বা লম্বা রিভিউ একাধিক সেশনে করতে বাধ্য করে। সেশনগুলোর মধ্যে terminology consistency খারাপ হয়; আমরা একই ডকুমেন্টে আলাদা আলাদা সেশনে একই term তিনভাবে অনুবাদ হতে দেখেছি। Pro API দীর্ঘ single-pass আপলোড অনুমোদন করে, কিন্তু কনজিউমার ফ্লো তা করে না।
৫,০০০ শব্দের কম ইউরোপীয় ভাষায় লেখা পেপার, যেসব জার্নালে শক্তিশালী copy-editing pipeline আছে, সেখানে DeepL-কে সুপারিশ করা হয়। কিন্তু দীর্ঘ ডকুমেন্ট বা নন-ইউরোপীয় জোড়াগুলোর ক্ষেত্রে গণিতটা বদলে যায়।
উদ্ধৃতি সংরক্ষণসহ একাডেমিক অনুবাদ, অন্তর্নির্মিত
Our translator extracts citations, statistical expressions, and equation labels before the rewrite, then re-inserts them verbatim. Pick from 50-plus language pairs. Free tier covers a full paper.
ফ্রি তে চেষ্টা করুনGPT-5 (ChatGPT): DeepL বনাম ChatGPT: একাডেমিক অনুবাদে কোথায় অবস্থান
GPT-5 হলো অনুবাদ-বিশেষজ্ঞ নয়; এটি একটি জেনারেল-পারপাস মডেল, তবে ঘটনাক্রমে অনুবাদও ভালো করতে পারে। এর প্রভাব দুই দিকেই দেখা যায়।
GPT-5 কোথায় জেতে। scholarly register ৪.৫, যা DeepL-এর তুলনায় অর্থের বিশ্বস্ততা নয়, বরং অর্থবহভাবে বেশি। এটিকে প্রশিক্ষণ ডেটা হিসেবে প্রায় ২০১০ সালের পর থেকে প্রকাশিত অধিকাংশ পেপার অন্তর্ভুক্ত ছিল; সেখান থেকে এটি একাডেমিক ইংরেজির rhetorical patterns আয়ত্ত করেছে। একটি methods section অনুবাদ করতে বললে এটি methods-section ইংরেজি তৈরি করে। একটি discussion অনুবাদ করতে বললে এটি discussion ইংরেজি তৈরি করে। রেজিস্টার-সুইচিং (register-switching) বেঞ্চমার্কের যে কোনো টুলের মধ্যে সবচেয়ে শক্তিশালী, কেবল Claude Sonnet-এর সামান্যই পেছনে।
যেসব ডিসিপ্লিনে training data ঘন (dense), যেমন মেশিন লার্নিং, ক্লিনিক্যাল মেডিসিন, তাত্ত্বিক পদার্থবিজ্ঞান, সেসব ক্ষেত্রে field-specific terminology-তেও GPT-5 সবচেয়ে শক্তিশালী। মডেলটি জানে যে ২০২৪ সালের একটি ML পেপারে "transformer" বলতে বৈদ্যুতিক ডিভাইস বোঝায় না। disambiguation প্রায় সব সময়ই সঠিকভাবে ঘটে।
GPT-5 কোথায় দুর্বল। citation সংরক্ষণে (৩.৯) বেঞ্চমার্কে এটি সবচেয়ে দুর্বল স্কোর। GPT-5 ইন-টেক্সট citation-কে narrative ফর্মে rewriting করে (যেমন "(Smith, 2024)" এর বদলে "Smith showed in 2024"), আমাদের টেস্ট প্যাসেজগুলোর প্রায় ৩০ শতাংশে। আবার reference list entries-ও প্রায় ২০ শতাংশ ক্ষেত্রে নতুনভাবে ফরম্যাট করে (italics বাদ পড়ে, এবং ampersand স্বাভাবিক (normalized) হয়)। ব্যর্থতার ধরনটি একই, যেটি torture-phrase প্যাটার্নগুলোর ক্ষেত্রে কাজ করে, যেমন paper-mill screeners flag: একটি generative pass যদি না জানে citation কী, তাহলে সেটি সাধারণত সেটিকে rewrite করার প্রবণতা দেখাবে।
নিবারণ (mitigation) হলো prompt-লেভেলে: GPT-5-কে স্পষ্টভাবে নির্দেশ দিলে, সব ইন-টেক্সট citation এবং reference list formatting অক্ষত রাখতে, rewrite হার প্রায় ১০ শতাংশে নেমে আসে। তবু এটি DeepL-এর তুলনায় বেশি, কিন্তু কার্যকরভাবে কাজ করার মতো। এই prompt overhead-টাই খরচ।
Gemini 3 Pro: আরবি-থেকে-ইংরেজি একাডেমিক অনুবাদ এবং দীর্ঘ ডকুমেন্টে সেরা AI
লং-কনটেক্সট coherence (৪.৬) এবং language pair coverage, দুটিতেই Gemini 3 Pro বেঞ্চমার্কে সবচেয়ে শক্তিশালী (৪.৬)। উভয় ক্ষেত্রেই দেখা যায় যে architectural এবং training পছন্দগুলো বিশেষভাবে একাডেমিক অনুবাদে লাভ এনে দেয়।
Gemini 3 কোথায় জেতে। থিসিস, বই এবং লম্বা রিভিউ আর্টিকেলের ক্ষেত্রে যেটা সবচেয়ে গুরুত্বপূর্ণ মাত্রা, সেটি হলো long-context coherence, স্কোর ৪.৬। আমরা ৩৮,০০০ শব্দের একটি PhD থিসিস অধ্যায় (chapter) একক Gemini 3 পাসে অনুবাদ করে দেখেছি। আমাদের পরীক্ষা করা সব টুলের মধ্যে পৃষ্ঠা ১ থেকে পৃষ্ঠা ৯০ পর্যন্ত পরিভাষার সামঞ্জস্য (terminology consistency) সবচেয়ে শক্তিশালী। chunking প্রভাব (DeepL) এবং working memory সমস্যা (GPT-5-এর ক্ষেত্রে প্রায় ২০,০০০ শব্দের বেশি ডকুমেন্টে) দুটোই তুলনামূলকভাবে অনেক কম।
language pair coverage-এ এমন কিছু কমন-নন পেয়ারও আছে যেগুলো আমরা পরীক্ষা করেছি। আরবি-থেকে-ইংরেজি পেয়ারটি বিশেষভাবে meaning fidelity-তে ৪.৭ স্কোর করেছে, এই পেয়ারটির জন্য বেঞ্চমার্কে সেরা। Gemini 2.5 তাদের WMT25 human evaluation জয়ে (১৬টির মধ্যে ১৪টি পেয়ার) যে পেয়ারটি ব্যবহার করেছিল, এই পেয়ারই ছিল।
Gemini 3 কোথায় দুর্বল। citation সংরক্ষণে ৪.০ স্কোরটি GPT-5-এর চেয়ে কিছুটা ভালো, কিন্তু DeepL-এর তুলনায় উল্লেখযোগ্যভাবে কম। একই generative pass সমস্যা এবং একই mitigation (স্পষ্ট prompt-লেভেল নির্দেশ) আছে। scholarly register ৪.৪, উভয়ই GPT-5 এবং Claude-এর চেয়ে সামান্য নিচে, প্রায়। এটি কখনও কখনও আসলে যতটা পারে তার চেয়েও একটু বেশি প্রকাশিত একাডেমিক ইংরেজির মতো শোনাতে চেষ্টা করে; ফলে এটি অত্যন্ত সক্ষম দেখায়, কিন্তু পুরোপুরি native-academic মনে হয় না।
Deep Think ভ্যারিয়েন্টটি (ফেব্রুয়ারি ২০২৬-এর রোলআউট) বিশেষ করে গণিত-ভারী ডিসিপ্লিনের ক্ষেত্রে চেষ্টা করে দেখা উচিত। আমাদের টেস্টে পদার্থবিজ্ঞান বা গণিত-ভারী প্যাসেজ অন্তর্ভুক্ত ছিল না। reasoning layer উন্নতি এই পেয়ারগুলোর মাত্রা-স্কোর বদলে দিতে পারে। পরিষ্কারভাবে পরীক্ষা করার মতো পর্যাপ্ত কেস হলে আমরা আবার দেখব।
Claude Sonnet: গড়ভাবে সর্বোচ্চ publishability
Claude Sonnet মোটের ওপর publishability-এ সর্বোচ্চ স্কোর করেছে (৪.৬), কারণ এর উচ্চ scholarly register (৪.৭) এবং long-context coherence (৪.৭)। প্রকাশিত পাণ্ডুলিপি সাবমিশনে যে উপাদানগুলো এগিয়ে দেয়, সেগুলোর দিকেই Claude-এর দক্ষতা সবচেয়ে বেশি।
Claude কোথায় জেতে। বেঞ্চমার্কে scholarly register ৪.৭ সর্বোচ্চ। মডেল দ্বারা তৈরি গদ্য একটি ডোমেইন বিশেষজ্ঞের লেখা পেপারের মতো পড়ে, অনুবাদের মতো নয়। আমি একই প্যাসেজ দেখেছি যেখানে DeepL তৈরি করেছে "The results indicate" এবং GPT-5 তৈরি করেছে "The findings suggest," আর Claude তৈরি করেছে "These data support the inference that." জার্নাল রিভিউয়ার যে টোন আশা করবেন, সেটাই এখানে এসেছে, এবং সেটি prompt engineering ছাড়াই স্বাভাবিকভাবেই তৈরি হয়েছে।
লং-কনটেক্সট coherence-এ ৪.৭ স্কোর Gemini 3 Pro-এর সাথে প্রথম স্থানে টাই, এবং ২০০K কনটেক্সট উইন্ডো পুরো থিসিসকে স্বাচ্ছন্দ্যে কভার করে। citation সংরক্ষণে ৪.৩ হলো LLM-ভিত্তিক টুলগুলোর মধ্যে সেরা (তবু DeepL-এর ৪.৬-এর পিছনে; কিন্তু GPT-5 বা Gemini-এর তুলনায় উল্লেখযোগ্যভাবে ভালো)। parenthetical references বদলাতে Claude অন্য generative মডেলগুলোর তুলনায় কম আগ্রাসী।
Claude কোথায় দুর্বল। দ্রুত বদলাতে থাকা ফিল্ডগুলোর টেকনিক্যাল পরিভাষা সাহিত্য (literature)-এর একদম বর্তমান অবস্থার তুলনায় পিছিয়ে থাকতে পারে। প্রশিক্ষণে একটি cutoff থাকে, তাই কখনও কখনও cutoff-এর পর স্ট্যান্ডার্ড হয়ে ওঠা টার্মগুলোকে মডেল আগের টার্ম দিয়েই অনুবাদ করবে। proof-এর সময় এটা সহজে ঠিক করা যেত, কিন্তু এতে একটি verification ধাপ যুক্ত হয়। আমাদের clinical pharmacologist রিভিউয়ার মেডিক্যাল প্যাসেজগুলোতে এই ধরনের দুইটি উদাহরণ তুলে ধরেছেন। এটা বড় কোনো সমস্যা (deal-breaker) নয়, তবে অ্যাক্টিভ সাবফিল্ডগুলোর অনুবাদের ক্ষেত্রে এটি উল্লেখ করার মতো।
আরেকটি বিষয় হলো গতি। Sonnet নিয়মিত অনুবাদে দ্রুত, কিন্তু Opus লম্বা ডকুমেন্টে লক্ষণীয়ভাবে ধীর। গুণমানের দিক থেকে এটি তেমন গুরুত্ব পায় না, কিন্তু যদি কেউ তাড়াহুড়ো করে ৬০,০০০ শব্দের থিসিস করে, তাহলে Sonnet-এর Opus থেকে দ্রুত হওয়াটা তার ব্যবহারিক ওয়ার্কফ্লোতে প্রাসঙ্গিক।
সিদ্ধান্তমূলক ম্যাট্রিক্স: কোন কাজের জন্য কোন টুল
সাত-মাত্রার টেবিলটাই ইনপুট। নিচের সিদ্ধান্তমূলক ম্যাট্রিক্সটাই হলো, কোন কেসে আমরা বাস্তবে কীভাবে টুল বেছে নিই।
| আপনার ব্যবহার-কেস | সুপারিশকৃত টুল | কেন |
|---|---|---|
| স্প্যানিশ, ফরাসি, জার্মান, ইতালিয়ান, পর্তুগিজ, বা ডাচ, ৫,০০০ শব্দের কম পেপার, mid-tier Elsevier জার্নালের জন্য | DeepL + হালকা এডিটিং | সর্বোত্তম citation preservation, ইউরোপীয় পেয়ারগুলোর মধ্যে সেরা ফিডেলিটি, দ্রুত |
| চীনা, জাপানি, বা কোরিয়ান, যেকোনো দৈর্ঘ্য, টপ-টায়ার জার্নালের জন্য | Claude Sonnet | সেরা scholarly register + long-context coherence; পূর্ব এশীয় পেয়ারগুলোতে শক্তিশালী |
| আরবি, হিন্দি, বা ইন্ডিক-ভাষার পেপার | Gemini 3 Pro | WMT25 lineage ধারায় এই নির্দিষ্ট পেয়ারগুলোর জন্য সর্বোচ্চ language-pair coverage |
| থিসিস বা বই-দৈর্ঘ্যের ডকুমেন্ট (২৫,০০০ শব্দের বেশি) | Claude Sonnet বা Gemini 3 Pro | long-context coherence chunk-এর পারস্পরিক টার্ম-ড্রিফট (cross-chunk terminology drift) এড়ায় |
| citation-ঘন methodology সেকশন, যে কোনো ভাষা-পেয়ার | DeepL প্রথম পাস + Claude Sonnet দ্বিতীয় পাস | citation-preserving অনুবাদকে register-improving rewrite-এর ওপর লেয়ার করুন |
| গণিত বা পদার্থবিজ্ঞান-ভারী পেপার | Gemini 3 Pro (Deep Think ভ্যারিয়েন্ট) | সমীকরণ-ঘন অনুবাদে reasoning-layer enhancement গুরুত্বপূর্ণ |
| খরচ-সংবেদনশীল, ড্রাফট-মানের অনুবাদ | ফ্রি ChatGPT-এর মাধ্যমে GPT-5 | প্রবেশের বাধা সবচেয়ে কম; প্রথম ড্রাফটের জন্য গুণমান যথেষ্ট, যা পরে ভারীভাবে এডিট করা হবে |
ম্যাট্রিক্স জুড়ে প্যাটার্নটা এমন: একটিমাত্র টুল সবকিছুর ওপর আধিপত্য করে না, এবং একটি серьёз জমার (serious submission) জন্য সেরা ওয়ার্কফ্লো প্রায় সবসময় দুই-পাস। একটি টুল দিয়ে অনুবাদ, অন্য একটি টুল দিয়ে register উন্নতি, তারপর সাবমিশনের আগে proofread। proofread ধাপটির ক্ষেত্রে বিশেষভাবে আমাদের proofreading research papers পোস্টে এমন ওয়ার্কফ্লো আছে যা এই যেকোনো অনুবাদ টুলের সাথে ভালোভাবে জোড়া লাগে।
আমরা আমাদের নিজস্ব একাডেমিক অনুবাদক বানিয়েছি, DeepL যে citation preservation সমস্যা সমাধান করে এবং Claude যে scholarly register-এ সবচেয়ে ভালো, সেগুলো এক পাসে করতে, chunking কনস্ট্রেইন্ট ছাড়া। আমাদের internal benchmark আমরা আলাদাভাবে প্রকাশ করি এবং কোনো টুলে (আমাদেরটাও সহ) একটি পাণ্ডুলিপি ভরসা করার আগে ৫-মিনিটের citation-preservation টেস্ট চালানোর পরামর্শ দিই। উপরের বেঞ্চমার্কে আমাদের টুল নেই, কারণ সেটা একটি স্পষ্ট conflict-of-interest এন্ট্রি হয়ে যেত।
প্রায়শই জিজ্ঞাসিত প্রশ্ন
প্রশ্ন: ২০২৬ সালে একাডেমিক পেপারের জন্য কোন AI অনুবাদকটি সেরা?
এককভাবে সেরা টুল নেই। citation সংরক্ষণ এবং ইউরোপীয় ভাষা-পেয়ারগুলোতে DeepL এগিয়ে; ছোট অনুচ্ছেদে scholarly register-এ GPT-5 জেতে; long-context coherence এবং language pair coverage-এ Gemini 3 Pro জেতে; এবং full-document সাবমিশনের জন্য scholarly register-এ Claude Sonnet জেতে এবং আমাদের PhD-reviewer টেস্টে সর্বোচ্চ publishability স্কোর পোস্ট করে। শীর্ষ-স্তরের জার্নালে পাঠানোর জন্য সম্পূর্ণ পাণ্ডুলিপির ক্ষেত্রে, দুই-পাস ওয়ার্কফ্লো (এক টুল দিয়ে অনুবাদ, অন্য টুল দিয়ে register উন্নতি) যেকোনো এক-পাস পদ্ধতিকে ছাড়িয়ে যায়।
প্রশ্ন: DeepL কি চীনা-থেকে-ইংরেজি একাডেমিক অনুবাদ করতে পারে?
DeepL ২০২৩ সাল থেকে চীনা-থেকে-ইংরেজিতে উন্নতি করেছে, তবে আমাদের টেস্টে এই জোড়ায় Claude Sonnet এবং Gemini 3 Pro এখনও এগিয়ে। ব্যবধানটি সবচেয়ে বড় হয় হিউম্যানিটিজ এবং সোশ্যাল সায়েন্স প্যাসেজগুলোতে, যেখানে চীনা ভাষার idiomatic একাডেমিক কনভেনশনগুলো DeepL-এর neural architecture দিয়ে খারাপভাবে অনুবাদ হয়। প্রযুক্তিগত এবং বায়োমেডিক্যাল চীনা-থেকে-ইংরেজি অনুবাদের ক্ষেত্রে এডিটিংসহ DeepL প্রথম পাস হিসেবে গ্রহণযোগ্য। পূর্ণ-পাণ্ডুলিপি অনুবাদের ক্ষেত্রে Claude Sonnet হলো বেশি শক্তিশালী পছন্দ।
প্রশ্ন: এই টুলগুলো কি LaTeX সমীকরণ এবং figure reference সংরক্ষণ করে?
ভ্যারিয়েবল। আমাদের টেস্টে DeepL ইনলাইন LaTeX সবচেয়ে ভালোভাবে হ্যান্ডেল করে, কারণ এটি গাণিতিক নোটেশনকে protected tokens হিসেবে ধরে। GPT-5, Gemini 3 এবং Claude, তিনটিই কখনও কখনও equation labels-কে prose-তে rewrite করে ("Equation 3" becomes "the third equation") বা ইনলাইন গণিত ভেঙে দেয়। LaTeX-ভারী ডকুমেন্টের জন্য সুপারিশকৃত ওয়ার্কফ্লো হলো: অনুবাদের আগে সমীকরণগুলো আলাদা করা, তারপর prose অনুবাদ করা, এরপর আবার সেগুলো re-insert করা। আমাদের অনুবাদক যেকোনো উৎস ডকুমেন্টের জন্য এটি স্বয়ংক্রিয়ভাবে করে।
প্রশ্ন: এই টুলগুলোর মাধ্যমে একটি পূর্ণ গবেষণা পেপার অনুবাদ করতে কতক্ষণ লাগে?
সাধারণভাবে ৬,০০০ শব্দের একটি পেপার চারটি টুলের যে কোনো একটির মাধ্যমে অনুবাদে প্রায় ২-৫ মিনিট সময় লাগে, আর রিভিউ ও post-translation editing করতে ভাষা-পেয়ার এবং লক্ষ্যমাত্রা জার্নাল অনুযায়ী ৩০ মিনিট থেকে ২ ঘণ্টা পর্যন্ত সময় লাগে। অনুবাদ ধাপে DeepL সবচেয়ে দ্রুত; লম্বা ডকুমেন্টে (long-context coherence-এর ট্রেড-অফ) Claude সবচেয়ে ধীর। সব টুলের মধ্যে bottleneck হলো মানব রিভিউ ধাপ, মডেল ইনফারেন্স নয়।
প্রশ্ন: আমি কি এই টুলগুলো পেশাদার অনুবাদক-এর বদলে ব্যবহার করব?
এটা নির্ভর করে ঝুঁকির মাত্রার ওপর। Nature, Science, Cell, বা টপ-ফাইভ ক্লিনিক্যাল জার্নালে সাবমিশনের ক্ষেত্রে পেশাদার মানব অনুবাদ (বা AI অনুবাদের ওপর মানব সম্পাদনা) এখনও মূল্যবান, বিশেষ করে introduction এবং discussion সেকশনগুলোর জন্য। mid-tier জার্নাল সাবমিশন, রিজিওনাল জার্নাল এবং বেশিরভাগ কনফারেন্স পেপারে দুই-পাস ওয়ার্কফ্লোসহ AI অনুবাদ এবং শেষে একটি final proofread প্রকাশযোগ্য মানের (publication-acceptable) হতে পারে, এবং খরচ নাটকীয়ভাবে কম। আমাদের টেস্টে দুই-পাস AI ওয়ার্কফ্লো publishability-এ আনুমানিক ৪.৩ থেকে ৪.৬ স্কোর পেয়েছে; আর পেশাদার মানব অনুবাদ সাধারণত ৪.৬ থেকে ৪.৯ পায়। ব্যবধানটি বাস্তব, তবে অধিকাংশ গবেষক যে ধারণা করেন তার তুলনায় তা কম।
50-plus language pairs. Citation extraction before the rewrite, verbatim re-insertion afterward. Scholarly register tuned per section type.

লিসা NYU থেকে ভাষাবিজ্ঞানে একটি PhD ধারণ করেছে, এবং সর্বদাই কৌতূহলী ছিল কিভাবে কম্পিউটারগুলি মানুষের ভাষায় বোঝা ও যোগাযোগ করতে এবং মানুষের লিখিত বিষয়বস্তু সম্পাদনা করতে সহায়তা করতে প্রয়োগিত ভাষাতত্ত্বের সুবিধা নিতে পারে। তিনি বর্তমানে ProofreaderPro-এ চিফ মার্কেটিং অফিসার, যেখানে তিনি কপি, সোশ্যাল মিডিয়া, ইমেল এবং অফলাইন চ্যানেল জুড়ে বিপণনের নেতৃত্ব দেন৷