২০২৬ সালে AI টেক্সট ওয়াটারমার্কিং: OpenAI, Google ও Anthropic কীভাবে আলাদা
OpenAI টেক্সট ওয়াটারমার্ক বানিয়েও কখনো প্রকাশ করেনি। Google SynthID প্রকাশ করে ওপেন সোর্স করেছে। Anthropic করেছে Claude-এর ওয়াটারমার্ক বাধ্যতামূলক। প্রতিটি ব্যবস্থা কী করে, কী প্রমাণ করে, আর আপনার লেখার জন্য এর অর্থ কী।
OpenAI, Google আর Anthropic তিনটি প্রতিষ্ঠানই একই প্রযুক্তি তৈরি করেছে: AI-উৎপন্ন টেক্সটের জন্য একটি পরিসংখ্যানগত ওয়াটারমার্ক। OpenAI নিজের সংস্করণ কখনো প্রকাশ করেনি। Google Gemini-র ভেতরে SynthID চালু করে পদ্ধতিটি সম্পূর্ণ প্রকাশ করেছে। আর Anthropic ২০২৬ সালের আগস্টে Claude-এর ওয়াটারমার্ককে বিশ্বের প্রতিটি ব্যবহারকারীর জন্য বাধ্যতামূলক করেছে। আপনি যদি যেকোনো রকমের AI সহায়তায় লেখেন, এই তিনটি সিদ্ধান্তই এখন নির্ধারণ করে আপনার নথিপত্র কীভাবে বিচার করা হবে।
২০২৬ সালের ১১ আগস্ট ওয়াটারমার্কিং গবেষণার বিষয় থেকে প্রধান খবরে পরিণত হয়, যখন Anthropic ঘোষণা করে প্রতিটি নতুন Claude মডেল তার টেক্সট আউটপুটে চিহ্ন বসায়। সেই ঘোষণাটি আমরা বিস্তারিত আলোচনা করেছি Claude ওয়াটারমার্ক গাইডে। এই লেখাটি পূর্ণ চিত্র দেয়: টেক্সট ওয়াটারমার্ক কী, বড় তিন AI ল্যাব কীভাবে তা বাস্তবায়ন করেছে বা আটকে রেখেছে, আর প্রতিটি ব্যবস্থা একটি লেখা সম্পর্কে কী প্রমাণ করে।
AI টেক্সট ওয়াটারমার্ক কী?
AI টেক্সট ওয়াটারমার্ক হলো উৎপন্ন টেক্সটের শব্দ বাছাইয়ে লুকানো একটি পরিসংখ্যানগত নকশা, যা তৈরির মুহূর্তেই বসানো হয়, যাতে সঠিক চাবি হাতে থাকা শনাক্তকারী পরে যাচাই করতে পারে টেক্সটটি নির্দিষ্ট কোনো AI ব্যবস্থা থেকে এসেছে। এটি দৃশ্যমান কোনো লেবেল নয়, লুকানো অক্ষর নয়, ফাইলে জোড়া মেটাডেটাও নয়। চিহ্নটি বাস করে শব্দের ভেতরেই।
এই পার্থক্যটি জরুরি, কারণ "ওয়াটারমার্ক" শব্দটি ঢিলেঢালাভাবে তিনটি আলাদা জিনিস বোঝাতে ব্যবহৃত হয়:
| এটি কী | কোথায় থাকে | কপি-পেস্টে টিকে থাকে? | |
|---|---|---|---|
| পরিসংখ্যানগত ওয়াটারমার্ক | মডেল কোন শব্দ বাছে তাতে একটি ঝোঁক | টেক্সটের ভেতরেই | হ্যাঁ |
| ফাইল মেটাডেটা (C2PA) | স্বাক্ষরিত উৎস-লেবেল | ফাইলের খোলে | না, সরল টেক্সট কপি করলেই মুছে যায় |
| শূন্য-প্রস্থ অক্ষর | টেক্সটে ঢোকানো অদৃশ্য Unicode | দৃশ্যমান অক্ষরের ফাঁকে | না, খুব সহজে মুছে ফেলা যায় |
তিনটির মধ্যে কেবল পরিসংখ্যানগত ওয়াটারমার্কই কপি, পেস্ট, নতুন নথিতে আবার টাইপ আর ফরম্যাট বদলের পরও টিকে থাকে। এ কারণেই তিন বড় ল্যাব টেক্সটের জন্য এটিতেই মিলেছে, আর এ কারণেই অদৃশ্য অক্ষর মুছে দেওয়া "ওয়াটারমার্ক রিমুভার"গুলো এর সামনে সম্পূর্ণ অকার্যকর। আমাদের বিনামূল্যের Claude ওয়াটারমার্ক রিমুভার পাতা সূত্রসহ এই ব্যর্থতা নথিভুক্ত করেছে।
পরিসংখ্যানগত ওয়াটারমার্কিং আসলে কীভাবে কাজ করে?
বাক্য লেখার প্রতিটি ধাপে ভাষা মডেল প্রায় সমতুল্য কয়েকটি শব্দের মধ্যে বেছে নেয়, আর ওয়াটারমার্ক নিঃশব্দে সেই পাশা ভারী করে দেয়। মৌলিক সূত্রটি ২০২৩ সালের জানুয়ারিতে University of Maryland-এর Kirchenbauer ও সহকর্মীরা প্রকাশ করেন A Watermark for Large Language Models-এ (ICML 2023)। এটি কাজ করে এভাবে:
- প্রতিটি শব্দ বাছার আগে, আগের শব্দগুলো থেকে বের করা এক গোপন চাবি শব্দভান্ডারকে পছন্দের সেট ও নিরপেক্ষ সেটে ভাগ করে।
- মডেল বাছাইকে পছন্দের সেটের দিকে হেলিয়ে দেয়। "indicate"-এর বদলে "suggest", "among"-এর বদলে "across"। প্রতিটি একক বাছাই সম্পূর্ণ স্বাভাবিক দেখায়।
- চাবি হাতে থাকা শনাক্তকারী গোনে টেক্সট কতবার পছন্দের সেটে পড়ছে। মানুষের লেখা কাকতালীয়ভাবে প্রত্যাশিত হারে পড়ে। ওয়াটারমার্কযুক্ত টেক্সট পড়ে তার চেয়ে অনেক বেশি, আর একটি পরিসংখ্যানগত পরীক্ষা সেই অসঙ্গতি ধরে ফেলে।
একটি শব্দ কোনো কিছুরই প্রমাণ নয়। সংকেত ফোটে কেবল কয়েক ডজন থেকে কয়েকশ বাছাইয়ের মধ্যে, তাই লম্বা অংশ ছোটর চেয়ে সহজে পরীক্ষা করা যায়, আর শনাক্তকরণ সবসময় সম্ভাবনানির্ভর, হ্যাঁ/না সিলমোহর নয়।
Google DeepMind-এর চালু ব্যবস্থাটি ২০২৪ সালের অক্টোবরে Nature-এ Scalable watermarking for identifying large language model outputs নামে প্রকাশিত হয়; টুর্নামেন্ট স্যাম্পলিং নামের কৌশলে একে শাণিত করা হয়েছে, যা টেক্সটের মান এতটা রক্ষা করে যে বড় মাপের ভোক্তা পণ্যের ভেতরে নিঃশব্দে চলতে পারে। গবেষণাপত্রটির গুরুত্ব Google ছাড়িয়ে যায়: Claude-এর বাস্তবায়নের ভিত্তি হিসেবে Anthropic এই প্রকাশিত কাজটিকেই উল্লেখ করে।
মূল দুর্বলতাটি বেশিরভাগ চালুর আগেই প্রকাশিত হয়েছিল। ২০২৩ সালের মার্চে Krishna ও সহকর্মীরা Paraphrasing evades detectors of AI-generated text-এ (NeurIPS 2023) দেখান, কোনো অংশের শব্দবিন্যাস নতুন করে লিখলে সব পদ্ধতির শনাক্তকরণই ভেঙে পড়ে, ওয়াটারমার্কসহ। সংকেত বাস করে টোকেনের নিখুঁত ক্রমে, আর কোথাও নয়; তাই যা-ই সেই ক্রম নতুন করে লেখে, মানব সম্পাদকসহ, তা প্রমাণটুকুও নতুন করে লিখে ফেলে। আজ ওয়াটারমার্ক চালু করা প্রতিটি প্রতিষ্ঠান নিজেদের নথিতেই এই সীমাবদ্ধতা লিখে রেখেছে।
OpenAI: যে প্রতিষ্ঠান এটি উদ্ভাবন করেও কখনো প্রকাশ করেনি
OpenAI-এর হাতে কার্যকর টেক্সট ওয়াটারমার্ক আছে বহু বছর ধরে, আর এখন পর্যন্ত তারা তা প্রকাশ না করাই বেছে নিয়েছে। ধারণাটি প্রথম প্রকাশ্যে বর্ণনা করেন Scott Aaronson, তখন তিনি OpenAI-তে নিরাপত্তা নিয়ে কাজ করছিলেন, ২০২২ সালের নভেম্বরের এক বক্তৃতায়: প্রায় সমতুল্য শব্দগুলোর মধ্যে মডেলের বাছাই এক গোপন ক্রিপ্টোগ্রাফিক ফাংশনে হেলিয়ে দাও, যাতে টেক্সট নিজেই প্রমাণ করে সে কোথা থেকে এসেছে। সেই বক্তৃতা চালু হওয়া সব ব্যবস্থার আগের, আর এই ক্ষেত্রটির প্রতিষ্ঠাদলিল।
২০২৪ সালের মে মাসে OpenAI প্রকল্পের অবস্থা জানায় তাদের উৎস-প্রতিবেদন Understanding the source of what we see and hear online-এ। প্রতিষ্ঠানটি বলে, তাদের টেক্সট ওয়াটারমার্কিং পদ্ধতি নির্ভুল, ছোটখাটো সম্পাদনার বিরুদ্ধেও কার্যকর, কিন্তু ঝুঁকি মাপতে মাপতে প্রকাশ স্থগিত রাখা হয়েছে। OpenAI যেসব ঝুঁকির কথা বলেছে, তার দুটি একাডেমিক লেখকদের সরাসরি স্পর্শ করে:
- সহজে এড়ানো যায়। টেক্সট প্যারাফ্রেজ বা অনুবাদ করলেই চিহ্ন মুছে যায়, ঠিক যেমনটা ২০২৩ সালের গবেষণা আগেই বলেছিল। যে ওয়াটারমার্ক মূলত তাদেরই ধরে যারা এর অস্তিত্ব জানে না, তা প্রয়োগের দুর্বল হাতিয়ার।
- অ-নেটিভ ইংরেজি লেখকদের ওপর অসম প্রভাব। OpenAI স্পষ্ট বলেছে, দ্বিতীয় ভাষায় লেখা মানুষদের জন্য AI-কে লেখার সহায়ক হিসেবে ব্যবহারের বৈধ চর্চাকে ওয়াটারমার্কিং কলঙ্কিত করতে পারে। আমাদের লেখা AI শনাক্তকারীরা কেন অ-নেটিভ লেখকদের চিহ্নিত করে একই সমস্যা শনাক্তকারীর দিক থেকে দেখেছে।

OpenAI-এর নিজস্ব উৎস-প্রতিবেদন: পদ্ধতি কাজ করে, আর প্রকাশ না করার কারণগুলো প্রতিষ্ঠানটি নিজেই গুনে দিয়েছে।
ছবি আর অডিওর জন্য OpenAI অন্য পথ ধরেছে: DALL-E ও Sora-র আউটপুটে C2PA উৎস-মেটাডেটা, যা কনটেন্টের ভেতরের চিহ্ন নয়, ফাইল-স্তরের লেবেল। আর টেক্সট? ২০২৬ সালের আগস্টের শেষ পর্যন্ত ChatGPT-র আউটপুটে কোনো ওয়াটারমার্ক নেই। যে প্রতিষ্ঠান প্রযুক্তিটি প্রস্তাব করেছিল, তিনটির মধ্যে তারাই একমাত্র যারা কখনো তা চালু করেনি।
Google: প্রথম চালু করল, তারপর সূত্রটাই বিলিয়ে দিল
Google DeepMind প্রথমে চালু করেছে, সম্পূর্ণ প্রকাশ করেছে, তারপর পদ্ধতি খুলে দিয়েছে। তাদের ব্যবস্থা SynthID ২০২৩ সালে ছবির ওয়াটারমার্ক হিসেবে শুরু হয়ে ২০২৪ সালে টেক্সটে বিস্তৃত হয়। ২০২৪ সালের অক্টোবরে Nature-এর গবেষণাপত্র বেরোনোর সময় SynthID-Text ইতিমধ্যে Gemini-র ভেতরে চালু ছিল, ফলে সেটিই হয়ে ওঠে ভোক্তা-মাপে চালু হওয়া প্রথম পরিসংখ্যানগত টেক্সট ওয়াটারমার্ক।

SynthID টেক্সট, ছবি, অডিও ও ভিডিও জুড়ে কাজ করে, আর ২০২৪ সালের অক্টোবর থেকে Gemini-র টেক্সট আউটপুটে সক্রিয়।
এরপর Google বাস্তবায়নটি Hugging Face-এ ওপেন সোর্স হিসেবে প্রকাশ করে, যাতে যেকোনো ডেভেলপার একই ওয়াটারমার্কিং নকশা নিজের মডেলে বসাতে পারে। ২০২৫ সালের মে মাসে তারা ঘোষণা করে SynthID Detector, একটি যাচাই পোর্টাল যেখানে টেক্সট, ছবি, অডিও ও ভিডিওতে SynthID চিহ্ন পরীক্ষা করা যায়।
পরিধির একটি সীমা মনে রাখা জরুরি: SynthID কেবল Google-এর নিজের মডেলের কনটেন্টেই চিহ্ন বসায় ও শনাক্ত করে। ChatGPT বা Claude-এর আউটপুট নিয়ে সে কিছুই বলে না, আর পরিষ্কার SynthID স্ক্যানের মানে এই নয় যে টেক্সটটি মানুষের লেখা। মানে কেবল এটুকুই, Google-এর মডেল তা লেখেনি; অনেক সংকীর্ণ একটি দাবি।
Anthropic: সবার শেষে নড়ল, নীতি সবচেয়ে কড়া
Anthropic চালু করেছে সবার শেষে, বাধ্যতামূলক পরিধি সবচেয়ে চওড়া রেখে। ২০২৬ সালের ২ আগস্ট বা তার পরে প্রকাশিত প্রতিটি Claude মডেল টেক্সট আউটপুটে পরিসংখ্যানগত ওয়াটারমার্ক বসায়: বিশ্বজুড়ে, সব প্ল্যানে, বেরোনোর কোনো পথ ছাড়া। প্রতিষ্ঠানটি কার্যপ্রণালি ব্যাখ্যা করেছে How Claude's text watermark works নিবন্ধে, আর নীতির পরিধি হেল্প-সেন্টার নিবন্ধ How Claude marks AI-generated content-এ: Claude API, claude.ai, Claude Code, Claude Cowork ও Claude Tag সবই এর আওতায়। কাট-অফের আগে প্রকাশিত মডেলগুলো পরিবর্তনকালীন পর্যায়ে আছে, আর Anthropic বলছে সেগুলোতেও চিহ্ন যোগ করা হচ্ছে। পরিসংখ্যানগত চিহ্নের পাশাপাশি Claude-উৎপন্ন ফাইলে C2PA মেটাডেটাও থাকে; দ্বিতীয় ও পৃথক এক ব্যবস্থা, যা সরল টেক্সট কপিতেই খসে পড়ে।

নীতিটি Anthropic-এর নিজের ভাষায়: প্রতিটি নতুন মডেল, প্রতিটি প্ল্যাটফর্ম, বিশ্বজুড়ে, আর পুরনো মডেলও যুক্ত হচ্ছে।
Anthropic-এর নথি সীমাগুলো সোজাসাপ্টা বলে। শনাক্তকরণ সম্ভাবনানির্ভর। Claude-এর লেখা নথি আর মানুষের লেখা ও Claude-এর হালকা সম্পাদনা করা নথির মধ্যে চিহ্নটি ফারাক করতে পারে না। পুরোপুরি নতুন করে লিখলে তা মুছে যায়। এসবই, ইতিবাচক শনাক্তকরণ আসলে কী প্রমাণ করে আর নিজের লেখা চিহ্নিত হলে কী করবেন সহ, আমরা বিশদে লিখেছি Claude ওয়াটারমার্কের বিশেষ গাইডে।
সময়টা নিয়ন্ত্রণবিধিরই অনুগামী। Anthropic সই করেছে EU AI Act-এর অনুচ্ছেদ 50(2)-এর অধীন AI-উৎপন্ন কনটেন্টের স্বচ্ছতার আচরণবিধিতে, যা জেনারেটিভ AI ব্যবস্থার সরবরাহকারীদের নিশ্চিত করতে বলে আউটপুট যেন "যন্ত্রপাঠ্য বিন্যাসে চিহ্নিত ও কৃত্রিমভাবে উৎপন্ন বলে শনাক্তযোগ্য" হয়। স্বচ্ছতার এই দায় কার্যকর হয়েছে ২০২৬ সালের ২ আগস্ট: Anthropic-এর মডেল নীতির হুবহু সেই কাট-অফ তারিখ, প্রকাশ্য ঘোষণার নয় দিন আগে। EU ট্র্যাফিকের জন্য আলাদা আচরণ না রেখে Anthropic বেছে নিয়েছে বৈশ্বিক অনুবর্তন। Google নকশাতেই আগে থেকে অনুবর্তী ছিল। OpenAI-এর চিহ্নহীন টেক্সট আউটপুটই ২০২৭ সালের খোলা অনুবর্তন-প্রশ্ন।
তিন পন্থা, পাশাপাশি
| OpenAI | Google DeepMind | Anthropic | |
|---|---|---|---|
| টেক্সট ওয়াটারমার্ক চালু? | না | হ্যাঁ (Gemini, অক্টোবর ২০২৪ থেকে) | হ্যাঁ (২ আগস্ট ২০২৬ থেকে Claude মডেল) |
| কৌশল | ক্রিপ্টোগ্রাফিক স্যাম্পলিং ঝোঁক (তৈরি, অপ্রকাশিত) | SynthID-Text টুর্নামেন্ট স্যাম্পলিং | SynthID ধাঁচের পরিসংখ্যানগত স্যাম্পলিং চিহ্ন |
| পরিধি | টেক্সটে কিছুই না | কেবল Google-এর মডেল | সব নতুন Claude মডেল; পুরনোগুলো পরিবর্তনকালে |
| বেরোনোর পথ | প্রযোজ্য নয় | নেই | নেই |
| প্রকাশ্য শনাক্তকারী | নেই | SynthID Detector পোর্টাল (২০২৫) | পরিকল্পনায়, এখনো প্রকাশিত নয় |
| নকশা প্রকাশিত? | কেবল ধারণামূলক বক্তৃতা | Nature গবেষণাপত্র + ওপেন সোর্স | প্রকাশিত গবেষণাভিত্তিক ব্যাখ্যা-নিবন্ধ |
| ফাইল মেটাডেটা (C2PA) | হ্যাঁ, ছবি ও অডিও | হ্যাঁ, সব মাধ্যমে | হ্যাঁ, উৎপন্ন ফাইলে |
| স্বীকৃত সীমা | এড়ানো, ESL কলঙ্ক | পরিধি নিজেদের মডেলে সীমিত | সম্ভাবনানির্ভর, সম্পাদনায় লেখকত্ব ঝাপসা |
কলামগুলোর সামগ্রিক ছবি: OpenAI টেক্সট ওয়াটারমার্কিংকে দেখে অমীমাংসিত নীতি-সমস্যা হিসেবে, Google দেখে মানকরণযোগ্য অবকাঠামো হিসেবে, আর Anthropic দেখে পুরোপুরি পালনীয় অনুবর্তন-দায় হিসেবে।
গবেষক ও একাডেমিক লেখকদের জন্য এর অর্থ কী
বাস্তব ফলাফল পুরোটাই নির্ভর করে কোন টুল আপনার টেক্সট স্পর্শ করছে তার ওপর। ChatGPT দিয়ে খসড়া করলে আপনার টেক্সটে আজ কোনো ওয়াটারমার্ক নেই। Gemini দিয়ে করলে তাতে SynthID চিহ্ন আছে, যা কেবল Google-এর শনাক্তকারী পড়তে পারে। বর্তমান কোনো Claude মডেল দিয়ে খসড়া বা সম্পাদনা করলে তাতে Anthropic-এর চিহ্ন আছে, আর কোনো সেটিং তা বন্ধ করে না।
একাডেমিক লেখকদের তিনটি বিষয় মনে রাখা দরকার:
ওয়াটারমার্ক টুল শনাক্ত করে, লেখক নয়। প্রতিটি প্রতিষ্ঠান নিজেদের নথিতে এ কথা বলে, আর বারবার বলা দরকার, কারণ প্রাতিষ্ঠানিক নীতিমালা সবসময় এই ফারাক টানে না। টেক্সট চিহ্নিত হতে পারে কারণ AI তা খসড়া করেছে, কারণ AI তার দুটি বাক্য শুধরেছে, কিংবা কারণ চিহ্নযুক্ত কোনো অনুচ্ছেদ উদ্ধৃত হয়েছে। আপনার প্রতিষ্ঠান ওয়াটারমার্ক পরীক্ষা চালালে, পরীক্ষাটি প্রমাণ করে কেবল এটুকু: কোনো এক সময়ে নির্দিষ্ট একটি মডেল টেক্সটটি স্পর্শ করেছিল, এর বেশি কিছু নয়। প্রয়োজনে সেই যুক্তি কীভাবে সাজাবেন তা দেখিয়েছে আমাদের ভুল AI শনাক্তকরণ পতাকার আপিল গাইড।
ওয়াটারমার্ক আর AI শনাক্তকারী আলাদা প্রযুক্তি, ব্যর্থতার ধরনও আলাদা। Turnitin বা GPTZero-র মতো শনাক্তকারীরা পরিসংখ্যানগত শৈলী থেকে অনুমান করে, যার নির্ভুলতার সমস্যা আমরা নথিভুক্ত করেছি। ওয়াটারমার্ক শনাক্তকরণ চাবিভিত্তিক পরীক্ষা, চিহ্নহীন মানব-টেক্সটে যার মিথ্যা-ইতিবাচক হার খুবই কম। অসামঞ্জস্যটা উল্টে যায় মিথ্যা-নেতিবাচকে: ওয়াটারমার্ক পরীক্ষা চিহ্ন-না-বসানো মডেলের কোনো AI টেক্সটই ধরে না, যার মধ্যে আজ গোটা ChatGPT পড়ে।
প্রকাশই আপনার সবচেয়ে শক্ত অবস্থান। ওয়াটারমার্কিং নীরব AI ব্যবহারকে ঝুঁকিপূর্ণ আর ঘোষিত ব্যবহারকে নিরাপদ করে, কারণ ঘোষিত কর্মপ্রবাহের ইতিবাচক চিহ্নে ভয়ের কিছু নেই। বেশিরভাগ জার্নাল ও বিশ্ববিদ্যালয়ের এখন স্পষ্ট AI-ব্যবহার নীতি আছে; আমাদের AI ব্যবহার নীতি ব্যাখ্যা করে নিজেদের টুলগুলোতে আমরা এই রেখা কীভাবে টানি, আর স্বচ্ছ ব্যবহারের চেহারা কেমন তার একটি যুক্তিসঙ্গত নমুনাও বটে।
টেক্সট ওয়াটারমার্ক কী মুছে দেয়, কী দেয় না
নতুন করে লেখা মুছে দেয়; ফরম্যাট বদল দেয় না। কপি, পেস্ট, ফন্ট বদল, ফাইল ফরম্যাট রূপান্তর আর অদৃশ্য অক্ষর মোছা, সবই পরিসংখ্যানগত ওয়াটারমার্ককে সম্পূর্ণ অটুট রাখে, কারণ চিহ্নটি শব্দ বাছাইয়ে। মুছে দেয় কেবল তা-ই, যা শব্দবিন্যাস নতুন করে গড়ে: গভীর মানবিক সম্পাদনা, অনুবাদ, কিংবা প্রকৃত প্যারাফ্রেজ; যেমনটা NeurIPS 2023-এর সহনশীলতা গবেষণা এই ব্যবস্থাগুলো চালুর আগেই প্রতিষ্ঠা করেছিল।
এখানে দুই দিকই গুরুত্বপূর্ণ। চিহ্ন মুছে গেলে টেক্সট আপনার হয়ে যায় না, চিহ্ন টিকে থাকলেও তা আপনার নয় হয়ে যায় না। নতুন করে লেখা AI খসড়া এখনো AI-সহায়তায় তৈরি নথি, যার ওপর আপনার প্রতিষ্ঠানের প্রকাশ-নিয়ম প্রযোজ্য। আমাদের AI text humanizer AI-সহায়তার খসড়াকে স্বাভাবিক একাডেমিক ভঙ্গিতে নতুন করে লেখে, আর সেই প্রক্রিয়া টোকেন-ক্রম নতুন করে গড়ে বলে পরিসংখ্যানগত চিহ্ন তাতে টেকে না। বিশেষত Claude টেক্সটের জন্য বিনামূল্যের Claude ওয়াটারমার্ক রিমুভার প্রতিটি বাক্য নতুন শব্দে প্রকাশ করে, তথ্য, সংখ্যা ও উদ্ধৃতি হুবহু রেখে। কোনো টুল যা বদলাতে পারে না তা হলো পাঠকের কাছে আপনার দায়: নথিটি কীভাবে তৈরি হয়েছে সে বিষয়ে স্বচ্ছতা।

নতুন করে লেখাই একমাত্র কাজ যা পরিসংখ্যানগত চিহ্ন মুছে দেয়, আর এই টুল ঠিক তা-ই করে, বাক্যের পর বাক্য।
এরপর কী
২০২৭ সাল পর্যন্ত তিনটি বিষয়ে নজর রাখুন। প্রথমত, OpenAI প্রকাশ করে কি না: EU-র অনুচ্ছেদ 50 প্রয়োগ টেক্সটের বেলায় "তৈরি কিন্তু অপ্রকাশিত" অবস্থানকে ক্রমেই ব্যয়বহুল করে তুলছে। দ্বিতীয়ত, পরীক্ষাগুলো এক বিন্দুতে মেলে কি না: প্রতিটি বড় ল্যাব প্রকাশিত নকশায় চিহ্ন বসালে বিশ্ববিদ্যালয়গুলো শৈলী অনুমানের বদলে চাবি যাচাই করবে, যা আজকের মিথ্যা-ইতিবাচকে ভরা শনাক্তকরণের তুলনায় প্রকৃত অগ্রগতি হবে। তৃতীয়ত, আন্তঃকার্যযোগ্যতা আসে কি না: আজ তিন ল্যাব মানে তিনটি অসামঞ্জস্যপূর্ণ চিহ্ন আর কোনো সর্বজনীন যাচাই নেই। ফাইলের জন্য সেই ফাঁক ভরাট করে C2PA; নিছক টেক্সটের জন্য এখনো কিছুই করে না।
ChatGPT কি তার টেক্সটে ওয়াটারমার্ক দেয়?
না। ২০২৬ সালের আগস্ট পর্যন্ত OpenAI টেক্সট ওয়াটারমার্কিং পদ্ধতি বানিয়েছে কিন্তু চালু করেনি; অবস্থানটি প্রতিষ্ঠানটি ব্যাখ্যা করেছে ২০২৪ সালের মে মাসের উৎস-প্রতিবেদনে। ChatGPT-র টেক্সট আউটপুটে পরিসংখ্যানগত ওয়াটারমার্কও নেই, লুকানো অক্ষরও নেই। OpenAI অবশ্য DALL-E ও Sora-র মিডিয়া ফাইলে C2PA উৎস-মেটাডেটা বসায়, তবে সেটি আলাদা, ফাইল-স্তরের ব্যবস্থা।
Google Gemini কি তার টেক্সটে ওয়াটারমার্ক দেয়?
হ্যাঁ। ২০২৪ সালের অক্টোবর থেকে Gemini-র আউটপুটে Google DeepMind-এর SynthID-Text ওয়াটারমার্ক আছে। এটি শব্দ বাছাইয়ে লুকানো পরিসংখ্যানগত চিহ্ন, পাঠকের চোখে অদৃশ্য, আর Google-এর SynthID Detector দিয়ে যাচাইযোগ্য। এটি কেবল Google-এর নিজের মডেলে প্রযোজ্য, তাই নেতিবাচক SynthID ফলাফল অন্য AI ব্যবস্থার টেক্সট সম্পর্কে কিছুই বলে না।
Claude কি তার টেক্সটে ওয়াটারমার্ক দেয়?
হ্যাঁ। ২০২৬ সালের ২ আগস্ট বা তার পরে প্রকাশিত প্রতিটি Claude মডেল সব প্ল্যাটফর্ম ও প্ল্যানে, বেরোনোর পথ ছাড়া, টেক্সট আউটপুটে পরিসংখ্যানগত ওয়াটারমার্ক বসায়, আর Claude-উৎপন্ন ফাইলে বাড়তি C2PA মেটাডেটাও থাকে। সেই তারিখের আগের মডেলগুলো এখনো আউটপুটে চিহ্ন বসায় না; Anthropic বলছে পরিবর্তনকালীন পর্যায়ে সেগুলোতেও চিহ্ন যোগ হচ্ছে। পূর্ণ বিবরণ আমাদের Claude ওয়াটারমার্ক গাইডে।
বিশ্ববিদ্যালয়গুলো কি AI ওয়াটারমার্ক শনাক্ত করতে পারে?
কেবল নির্মাতার সহযোগিতায়, কারণ শনাক্তকরণে লাগে নির্মাতার চাবি। Google SynthID কনটেন্টের জন্য প্রকাশ্য শনাক্তকরণ পোর্টাল দেয়। Anthropic বলছে ব্যবহারকারী ও তৃতীয় পক্ষের জন্য শনাক্তকরণ সহায়তার পরিকল্পনা আছে, তবে প্রকাশ্য শনাক্তকারী এখনো ছাড়েনি। মূলধারার কোনো চুরি-শনাক্তকরণ সফটওয়্যার এখন কোনো ল্যাবের পরিসংখ্যানগত ওয়াটারমার্ক যাচাই করতে পারে না, তাই প্রাতিষ্ঠানিক "AI শনাক্তকরণ" আজও শৈলীভিত্তিক অনুমান, ওয়াটারমার্ক যাচাই নয়।
AI ওয়াটারমার্কিং কি আইনে বাধ্যতামূলক?
EU-তে কার্যত হ্যাঁ। EU AI Act-এর অনুচ্ছেদ 50(2) জেনারেটিভ AI সরবরাহকারীদের নিশ্চিত করতে বলে আউটপুট যন্ত্রপাঠ্য বিন্যাসে চিহ্নিত ও কৃত্রিমভাবে উৎপন্ন বলে শনাক্তযোগ্য হবে, আর স্বচ্ছতার দায় কার্যকর ২০২৬ সালের ২ আগস্ট থেকে। Anthropic সংশ্লিষ্ট আচরণবিধিতে সই করে বৈশ্বিক অনুবর্তন বেছে নিয়েছে। OpenAI-এর অপ্রকাশিত টেক্সট ওয়াটারমার্ক নিয়ে নিয়ন্ত্রকরা কী করেন, সেটিই ২০২৭ সালে দেখার বিষয়।
AI ওয়াটারমার্ক কি অনুবাদে টিকে থাকে?
না। পরিসংখ্যানগত ওয়াটারমার্ক বাস করে মডেলের বাছাই করা শব্দের নিখুঁত ক্রমে, আর অনুবাদ প্রতিটি শব্দই বদলে দেয়। গভীর প্যারাফ্রেজ ও ভারী মানবিক সম্পাদনার বেলাতেও তা-ই। এই সীমাবদ্ধতা সমকক্ষ-পর্যালোচিত সাহিত্যে নথিভুক্ত, আর ওয়াটারমার্ক চালু করা প্রতিটি প্রতিষ্ঠান তা স্বীকার করে।
সূত্র
- Anthropic, How Claude's text watermark works, আগস্ট ২০২৬
- Anthropic Help Center, How Claude marks AI-generated content, 2026
- OpenAI, Understanding the source of what we see and hear online, মে ২০২৪
- Google DeepMind, SynthID
- Dathathri et al., Scalable watermarking for identifying large language model outputs, Nature, অক্টোবর ২০২৪
- Google, SynthID Detector announcement, মে ২০২৫
- Hugging Face, Introducing SynthID Text, অক্টোবর ২০২৪
- Kirchenbauer et al., A Watermark for Large Language Models, ICML 2023
- Krishna et al., Paraphrasing evades detectors of AI-generated text, NeurIPS 2023
- Scott Aaronson, My AI Safety Lecture for UT Effective Altruism, নভেম্বর ২০২২
- European Union, AI Act, Article 50
- C2PA, Coalition for Content Provenance and Authenticity

ডানা ProofreaderPro-এর একজন বিষয়বস্তু নির্মাতা, যেখানে তিনি দৈনিক ব্লগ এবং লেখার কাজ চালান। অনলাইন এডিটিং প্ল্যাটফর্ম কীভাবে কাজ করে সে বিষয়ে তিনি নিবন্ধগুলি লেখেন এবং তিনি প্রতিদিন গ্রাহকের বার্তাগুলি পরিচালনা করেন, এটি দেখানোর জন্য একটি ফাইভ-স্টার সন্তুষ্টি স্কোর সহ।