वह AI Humanizer जो अकादमिक उद्धरणों को सुरक्षित रखता है
अकादमिक उद्धरणों को सुरक्षित रखने वाला AI humanizer आपके APA, MLA, और IEEE संदर्भों को अक्षुण्ण बनाए रखता है, और यह भी बताता है कि किसी भी humanizer की 5 मिनट में कैसे जाँच करें।
हमें हमारी बीटा कोहोर्ट में एक पोस्टडॉक से एक स्क्रीनशॉट मिला, जो एक ओपन-एक्सेस इम्यूनोलॉजी जर्नल में सबमिशन तैयार कर रही थीं, और यह वही तरह का केस है जो स्पष्ट करता है कि अकादमिक उद्धरणों को सुरक्षित रखने वाला AI humanizer सामान्य प्रयोजन (general-purpose) वाले humanizer से अलग उत्पाद क्यों है। उन्हें रिजेक्शन ईमेल में निम्नलिखित कारण के साथ डेस्क रीजेक्शन मिला था: non-compliant reference formatting. हमने उनकी रेफरेंस सूची देखी, वह ठीक थी। उन्होंने एब्स्ट्रैक्ट खोला ताकि समझ सकें कि समस्या क्या है, और वहाँ असल दिक्कत मिली। मानवीकरण (humanization) से पहले एब्स्ट्रैक्ट में एक इन-टेक्स्ट APA उद्धरण था, जो पढ़ता था "(Nakamura et al., 2024)"; लेकिन जिस popular humanizer को उन्होंने आज़माया था, उसने इसे बदलकर "as Nakamura and colleagues showed in their 2024 study." कर दिया। यह खूबसूरत गद्य (prose) है, लेकिन यह अलग उद्धरण है। संपादक (editor) के स्क्रीनिंग टूल ने नोट किया कि एब्स्ट्रैक्ट में मौजूद कहानी कहने वाला रेफरेंस, पेपर के बाकी हिस्सों में दिए गए पैरेंथेटिकल (parenthetical) रेफरेंस से मेल नहीं खा रहा था। क्या इसका नतीजा यह हुआ कि स्टाइलिस्टिक सब्स्टीट्यूशन, जिसे humanizer ने सुधार समझा, की वजह से एब्स्ट्रैक्ट सबमिट करने में दो हफ्ते की देरी हुई, यह सवाल अब भी खुला है।
हम 2025 की शुरुआत से इस मुद्दे पर नज़र रख रहे हैं। 200 humanized अकादमिक पैराग्राफ़ों पर किए गए एक नियंत्रित परीक्षण में, जिनमें इन-टेक्स्ट citations थे, Phrasly ने 47% मामलों में citation formatting बदल दी, Undetectable.ai ने 53% मामलों में, और Quillbot के humanizer ने 38% मामलों में। इससे भी अधिक, टूल अक्सर ऐसे तत्वों को छूते हैं जिन्हें अकादमिक पेपर के सबसे महत्वपूर्ण हिस्सों में गिना जा सकता है: रेफरेंस लिस्ट एंट्रीज़ जिनमें italics और DOIs होते हैं, जिनकी जाँच ज्यादातर लेखक तो करते ही नहीं। अधिकांश humanizer कंटेंट मार्केटर्स के लिए बने हैं, जो ब्लॉग पोस्ट और SEO प्रोडक्ट डिस्क्रिप्शन लिखते हैं। लेकिन अकादमिक गद्य में एक संरचनात्मक आवश्यकता होती है, जिसका सम्मान किसी marketing-focused टूल को नहीं करना पड़ा: rewrite के दौरान citation को अक्षुण्ण बचना ही है।
यह पोस्ट बताती है कि अकादमिक उद्धरणों को सुरक्षित रखने वाला ai humanizer general-purpose humanizer से अर्थपूर्ण रूप से कैसे अलग उत्पाद है, citation-aware preservation वास्तव में “अंदर से” कैसा दिखता है, जब यह गलत हो जाता है तो शोधकर्ताओं के चार संभावित परिणाम क्या होते हैं, और किसी भी humanizer के साथ भरोसा करने से पहले 5 मिनट में चलने वाला टेस्ट क्या है।
अकादमिक उद्धरणों को सुरक्षित रखने वाला AI Humanizer क्या है?
अकादमिक उद्धरणों को सुरक्षित रखने वाला AI humanizer rewrite से पहले in-text citations, reference list entries, सांख्यिकीय अभिव्यक्तियाँ (statistical expressions), और equation labels को निकालता (extract) है; फिर उन्हें verbatim रूप में वापस डालता है, ताकि APA, MLA और IEEE संदर्भ अक्षुण्ण बने रहें। सामान्य (generic) humanizers इस चरण को छोड़ देते हैं और citations को साधारण tokens की तरह मानते हैं, यही वजह है कि Phrasly, Undetectable.ai और Quillbot जैसे टूल्स ने उन अकादमिक पैराग्राफ़ों में 38% से 53% तक citation formatting बदल दी, जिन्हें हमने टेस्ट किया। किसी भी टूल के बारे में यह सुनिश्चित करने के लिए कि वह सच में citation-aware है या नहीं, उसके फ्री टियर पर 5 मिनट का टेस्ट करें।
आपके citations को अक्षुण्ण रखने के लिए citation-aware AI humanizer क्या करता है?
सामान्य humanizer आपके टेक्स्ट को tokens की एक श्रृंखला की तरह मानता है, जिसे वह सतह पर कुछ अलग दिखाने के लिए कई तरीकों से rewrite करेगा। इसका अर्थ है कि वहाँ मौजूद कुछ भी, चाहे वह parenthetical हो (जैसे reference), italicized हो (जैसे journal title), acronym हो (जैसे DOI), या फिर equation label या statistical expression हो, rewrite के लिए “खेल का मैदान” है।
citation-aware humanizer कुछ चीज़ों को बिना छुए छोड़ता है। वे उसके आसपास काम करते हैं। ठोस तौर पर, वे पहचानते हैं:
- इन-टेक्स्ट पैरेंथेटिकल citations. "(Smith, 2024)", "(Smith & Jones, 2024)", "(Smith et al., 2024, p. 47)", "[12]", और APA, MLA, Chicago, IEEE, Harvard, Vancouver, Turabian, तथा AMA में मौजूद फॉर्मैट के दर्जनों वैरिएंट।
- रेफरेंस लिस्ट एंट्रीज़. Italicized journal titles, volume और issue के बीच का punctuation, "and" बनाम ampersand (&) का अंतर, sentence-case बनाम title-case लेख शीर्षक (article titles), और कोई भी ऐसी पंक्ति जो DOI पर समाप्त होती हो।
- सांख्यिकीय अभिव्यक्तियाँ. "p < 0.01," "95% CI [0.34, 0.58]," "n = 1,247," तथा confidence intervals, odds ratios और effect sizes रिपोर्ट करने की परंपराएँ।
- तकनीकी notation. Equation labels (Eq. 3), figure references (Fig. 2a), table references (Table 1), और आपके मैन्युस्क्रिप्ट में उनके बीच नेविगेट करने के लिए उपयोग होने वाले cross-reference markers।
- डिसिप्लिन-विशिष्ट शब्दावली. Method names ("PRISMA"), instrument names ("CRISPR-Cas9"), trial registries ("ClinicalTrials.gov NCT03945383"), और वे proper nouns जिन्हें rewrite को नहीं छूना चाहिए।
ये कोई किनारे के (edge) केस नहीं हैं। हमारे editorial dataset में, औसतन 6,000-word का मैन्युस्क्रिप्ट 47 in-text citations, 11 statistical expressions और 6 equation या figure references रखता है। जो humanizer इनमें से भी 10% को छू देता है, वह प्रति पेपर 6 से 7 त्रुटियाँ पैदा करेगा, जिन्हें submission से पहले खोजकर मैन्युअली ठीक करना पड़ेगा।
AI humanizers APA, MLA, और IEEE citations को कैसे तोड़ते हैं?
हमारे परीक्षण में, citation-blind humanizers हर बार तीन तरीकों से टूटते हैं।
Failure mode 1: in-text citations का narrative रूप में rewrite होना. इस लेख के शीर्ष पर दिया Nakamura केस। "(Smith, 2024)" बदलकर "as Smith demonstrated in 2024" या "Smith's 2024 study suggested" हो जाता है। नया गद्य (prose) humanizer के training distribution के हिसाब से अधिक “natural” लगता है। यह citation के प्रकार को बदल देता है (parenthetical से narrative) और इसलिए अधिकांश जर्नल्स के निर्देशों के अनुसार उसी पैराग्राफ़ या सेक्शन में पूरे समय लगातार उपयोग की जरूरत पड़ती है; साथ ही यह implied authorial voice को भी बदल देता है। Editors इसे नोटिस कर लेते हैं।
Failure mode 2: reference list reformatting. रेफरेंस एंट्री "Smith, J. (2024). The structure of Cell, 187(5), 945-961. Https://doi.org/10.1016/j.cell.2024.05.012" को ऐसे rewrite कर दिया जाता है कि journal title से italics हट जाएँ, volume number अपना जोर (emphasis) खो दे, DOI prefix बदल जाए, या लेखक-इनिशियल्स और वर्ष के बीच का punctuation किसी अलग स्टाइल में normalize हो जाए। तकनीकी रूप से, रेफरेंस अभी भी resolve हो जाता है, लेकिन वह अब APA 7 टेम्पलेट से मेल नहीं खाता। Copy editors इसे flag कर देते हैं।
Failure mode 3: संरक्षित सामग्री के आसपास “tortured phrases”. Cabanac Problematic Paper Screener ने उन 19,000 से अधिक पेपर्स को flag किया है जिनमें synonym-substitution patterns मौजूद हैं, जो paraphrase-based humanizers उत्पन्न करते हैं। Joined Together States for United States. Bosom peril for breast cancer. Renal disappointment for kidney failure. इन tortured phrases के साथ citations हमारा test data घेर लेते हैं, जिससे editors को उस citation पर भरोसा करना कठिन हो जाता है, यहाँ तक कि जब citation स्वयं अक्षुण्ण बच गया हो। Problematic Paper Screener (Cabanac, Labbe, and Magazinov) अब peer review से पहले कई publishers द्वारा editorial review हेतु पेपर्स flag करने के लिए इस्तेमाल किया जा रहा है।
तीनों failures मिलकर असर करते हैं। generic humanizer द्वारा लौटाया गया पेपर narrative-rewritten in-text citations (mode 1), reformatted reference entries (mode 2), और tortured surrounding prose (mode 3) से भरा होता है। और इसे मानव-परिवर्तन (pre-humanization) की मूल स्थिति में वापस लाने में शोधकर्ता को 90 मिनट लगते हैं। क्या यह सब “काबिल-ए-तारीफ” है, यह सवाल अब भी खुला है।
उद्धरणों को सुरक्षित रखना AI humanizer के लिए मुश्किल क्यों है?
अधिकांश humanizers citations को ठीक तरह से ट्रीट नहीं करते, क्योंकि underlying language model को नहीं पता होता कि citation क्या है। वह उन्हें किसी भी अन्य tokens की तरह देखता है (यानी "(Smith, 2024)")। यदि आप अपने tokenizer से कहें कि "citations को preserve करें", तो वह इसे कुछ हद तक करेगा... लेकिन underlying model को fluent prose बनाने के लिए trained किया गया है। जब इन लक्ष्यों में टकराव होता है, तो मॉडल आम तौर पर fluent prose को प्राथमिकता देता है।
इस समस्या को citation-aware humanizer हल कर सकता है। rewrite से पहले हम एक extraction phase चलाते हैं, जहाँ हम citation spans, statistical expressions, equation labels, और reference list entries को पहचानते हैं; उन्हें humanization pass में placeholders से बदल देते हैं; और फिर बाद में मूल spans को verbatim रूप में वापस डाल देते हैं। इस तरह, हमारा मॉडल किसी citation को उस रूप में कभी “देख” ही नहीं पाएगा, जिसे वह rewrite कर सके।
यह वही आर्किटेक्चर है जो हमें machine translation में सही उत्तर पाने देता है, जब वाक्य में किसी व्यक्ति का नाम, कोई brand name, या कोई संख्या हो। मानव-परिवर्तन (humanization) में भी यही तर्क लागू होता है: यदि आप किसी चीज़ को generative pass से सुरक्षित रखते हैं, तो उसे जनरेटिव pass से सावधानी बरतने को कहने की कोशिश करने की तुलना में आप बेहतर स्थिति में होते हैं।
अपने पांडुलिपि को उसकी उद्धरण-सामग्री बदले बिना मानवीय बनाएं
हमारा Humanizer पुनर्लेखन से पहले इन-टेक्स्ट उद्धरण, संदर्भ प्रविष्टियां, सांख्यिकीय अभिव्यक्तियां, और समीकरण लेबल निकालता है, फिर उन्हें शब्दशः पुन: स्थापित करता है। फ्री टियर में एक पूरी पांडुलिपि शामिल है।
इसे निःशुल्क आज़माइएजब यह गलत हो जाए तो शोधकर्ताओं के चार परिणाम क्या होते हैं?
citation-blind humanizer की लागत शोधकर्ता के लिए चार प्रकार से सामने आती है। हमने पिछले 18 महीनों में हर एक को देखा है।
परिणाम 1: तकनीकी स्क्रीनिंग में रिजेक्शन. किसी जर्नल की automated screening को reformatted abstract citations और reference list के बीच असंगति (inconsistency) दिख जाती है। पेपर peer review से पहले लेखकों को वापस भेज दिया जाता है। सबसे अच्छा मामला: दो हफ्ते की देरी। सबसे बुरा मामला: यह समस्या अन्य संशोधनों के साथ बढ़ती जाती है और मैन्युस्क्रिप्ट publishing window से बाहर हो जाती है।
परिणाम 2: fabrication के प्रति reviewer की आशंका. reviewer को एक इन-टेक्स्ट citation दिखाई देता है जो reference list entry से अलग है, या parenthetical citation जिसे टेक्स्ट के हिस्से के रूप में rewrite कर दिया गया है। स्वाभाविक रूप से वह मान लेता/लेती है कि लेखक ने स्रोत (source) पढ़ा नहीं। हमारे audited मैन्युस्क्रिप्ट्स में "major revisions" या "reject" के निर्णय तक पहुँचने का यह अब सबसे आम रास्ता है।
परिणाम 3: tortured-phrase screener द्वारा integrity flag. citation के आसपास synonym substitution patterns को Cabanac screener या किसी publisher के internal version द्वारा detect किया जाता है। फिर पेपर research integrity review के लिए भेजा जाता है। underlying paper अच्छा होने पर भी यह कई हफ्तों की देरी जोड़ देगा। यह लेखक के नाम पर भी एक निशान छोड़ देगा।
परिणाम 4: publication के बाद retraction. दुर्लभ है, लेकिन सैद्धांतिक नहीं। Post-publication audit में ऐसे पेपर देखे गए जहाँ tortured phrases या humanizers द्वारा introduced citation rewrites editorial प्रक्रिया के दौरान पकड़े नहीं गए, और परिणामस्वरूप retractions हुए। अब तक, Problematic Paper Screener ने 1,000 से अधिक retractions में मदद की है; इनमें से एक अंश उन patterns से जुड़ा है जो humanizer-जनित थे।
पक्ष-भार (balance) असंतुलित है। fluent rewrite में लाभ कम है: यह AI detection में थोड़ी कमी ला सकता है, जो कई मामलों में हानिरहित रहेगी। citation breakage से जुड़ी हानि अधिक है: देरी, आशंका, integrity flag, या उससे भी बदतर retraction। citation-aware humanizer नुकसान से बचाता है और लाभ बनाए रखता है।
5 मिनट में किसी भी humanizer का citation preservation के लिए परीक्षण कैसे करें
यह वही टेस्ट है जो हम बाजार में आने वाले हर नए humanizer पर करते हैं। इसमें पाँच मिनट लगते हैं, और इसे लगभग किसी भी टूल के फ्री टियर पर निःशुल्क किया जा सकता है।
स्टेप 1. निम्नलिखित पैराग्राफ़ को अपनी पसंद के humanizer में कॉपी करें। इसमें citations के चार सबसे आम फॉर्मैट और एक सांख्यिकीय अभिव्यक्ति शामिल है।
The intervention reduced symptoms in 64% of participants (Smith, 2024). Other studies (Jones & Lee, 2023; Patel et al., 2024, p. 47) reported comparable effects. A recent meta-analysis [12] confirmed the pattern across populations (n = 1,247, p < 0.01). The mechanism remains debated; see Reference 14 for a competing interpretation.
स्टेप 2. humanized output पढ़ें। जाँचें कि इन पाँचों में से प्रत्येक बचा है या नहीं:
- parenthetical "(Smith, 2024)" बिल्कुल वही.
- multi-author "(Jones & Lee, 2023; Patel et al., 2024, p. 47)" बिल्कुल वही, जिसमें ampersand, semicolon, और page number शामिल हैं.
- numbered reference "[12]" बिल्कुल वही.
- statistical expression "n = 1,247, p < 0.01" बिल्कुल वही.
- cross-reference "Reference 14" को "the fourteenth reference" या ऐसी किसी समान चीज़ में paraphrase किए बिना.
स्टेप 3. यदि इन पाँच तत्वों में से किसी में भी बदलाव होता है, तो वह humanizer उस अर्थ में citation-aware नहीं है जो अकादमिक लेखन के लिए महत्वपूर्ण है। उसे marketing copy पर इस्तेमाल करें, मैन्युस्क्रिप्ट पर नहीं।
स्टेप 4. एक दूसरा पैराग्राफ़ चलाएँ जिसमें italics और DOI के साथ एक reference list entry हो:
Smith, J., & Jones, K. (2024). The structure of cellular respiration in mitochondrial disease. Nature Reviews Molecular Cell Biology, 25(3), 187-203. https://doi.org/10.1038/s41580-024-00712-3
जाँचें कि italics, ampersand, volume-issue format, और DOI URL, सब कुछ अक्षुण्ण रहा या नहीं। जो humanizer in-text citations तो संभाल सकता है लेकिन reference entries नहीं, वह “आधा-सुरक्षित” है। आपके मैन्युस्क्रिप्ट को पूर्ण (full) गारंटी चाहिए।
स्टेप 5. अपने मैन्युस्क्रिप्ट के किसी पैराग्राफ़ पर अंतिम टेस्ट चलाएँ। कृत्रिम (artificial) इनपुट पर काम करने वाले टूल, citation patterns अधिक घने (denser) वास्तविक गद्य (real prose) पर विफल हो सकते हैं। बिना अपने टेक्स्ट के खिलाफ सत्यापन किए, किसी deadline के लिए किसी भी humanizer पर भरोसा न करें।
हम इस टेस्ट के विरुद्ध अपने own humanizer को humanizer rankings page पर दर्ज प्रतिस्पर्धियों के खिलाफ, और Phrasly vs Undetectable.ai comparison में नामित competitors के खिलाफ भी दस्तावेज़ करते हैं। हमारे आँकड़े (numbers) टूल्स के बीच तुलनीय हैं, क्योंकि दोनों पोस्ट ऊपर वर्णित वही test method उपयोग करती हैं। यदि आप यह देखना चाहते हैं कि paraphrasing tools (एक अलग category) citations को सुरक्षित रखने की समान चुनौती को संभालने में कैसा प्रदर्शन करती हैं, तो paraphrasing पर हमारी उस नोट को देखें जो preserves citations बताती है, जिसमें उसी वास्तु-स्तरीय (architectural) पैटर्न के paraphrasing पक्ष को कवर किया गया है।
अक्सर पूछे जाने वाले प्रश्न
प्र. 1: अधिकांश AI humanizers अकादमिक citations को क्यों तोड़ देते हैं?
उन्हें कंटेंट मार्केटर्स के लिए बनाया गया था, शोधकर्ताओं के लिए नहीं। Generic humanizers सभी tokens को rewrite के संभावित उम्मीदवार की तरह ट्रीट करते हैं, इसलिए इन-टेक्स्ट citations को narrative text में बदल दिया जाता है; reference list entries से italics हट जाते हैं और punctuation normalize हो जाता है; तथा tortured phrases के लिए synonyms को citation के आसपास क्लस्टर कर दिया जाता है। यह समस्या citation-aware humanizer द्वारा हल होती है, जो rewrite से पहले citations को extract करके बाद में उन्हें वापस insert करता है।
प्र. 2: क्या citation-aware humanizer होना ही मेरी पेपर को undetectable बनाने के लिए पर्याप्त है?
Citation preservation और detection bypass अलग-अलग समस्याएँ हैं। citation-aware humanizer का लक्ष्य citations को सुरक्षित रखना है, लेकिन फिर भी वे सतह (surface) विविधताएँ (variations) पेश करना है जिन्हें detectors ढूँढते हैं। जिस स्तर की aggressiveness से humanizer आसपास के टेक्स्ट को rewrite करता है, वह detected citation के स्कोर को तय करता है, पर यह इस बात पर असर नहीं डालता कि citations को संभालने की दर (rate) कितनी है। अधिकांश citation-aware humanizers detection bypass में अच्छा प्रदर्शन करते हैं। जिस टूल का उपयोग हो रहा है, उसके benchmark detection scores देखें (ये प्रकाशित होने चाहिए) और साथ में यह भी देखें कि वह citations को कितनी दर से संभालता है।
प्र. 3: क्या मैं बस humanize करने से पहले अपने citations को मैन्युअली extract कर दूँ?
हाँ, कुछ शोधकर्ता ऐसा करते हैं। प्रक्रिया यह है: संबंधित मैन्युस्क्रिप्ट को किसी दस्तावेज़ में कॉपी करें और हर citation को मैन्युअली placeholder ("[CITE_001]") से बदल दें; फिर humanize करें; उसके बाद मूल citations को फिर से insert कर दें। यह कम मात्रा के टेक्स्ट में काम करता है। पूरे मैन्युस्क्रिप्ट के मामले में, मैन्युअल काम humanization चरण से अधिक समय ले सकता है। humanize करते समय placeholders गलती से छोड़ देना बहुत आसान है। यदि काम कुछ मिनटों से ज्यादा समय लेता है, तो इसे किसी टूल से automate करने पर विचार करें। 1,500 शब्दों से लंबा कोई भी दस्तावेज़ यहाँ वर्णित pipeline को automate करने हेतु टूल का उपयोग करके लाभ उठा सकता है।
प्र. 4: मैं कैसे पहचानूँ कि कोई humanizer वास्तव में citation-aware है, या सिर्फ दावा करता है?
ऊपर दिए गए सेक्शन में वर्णित पाँच मिनट वाला टेस्ट करें। mixed APA, numbered, और statistical citations वाला एक पैराग्राफ़ कॉपी करें और उसे टूल से चलाएँ। यदि सभी तत्व इनपुट की तरह बिल्कुल वैसे ही दिखाई दें, तो वह humanizer citation-aware है। यदि किसी भी तरह से कुछ बदला गया है, तो "citation-aware" लेबल केवल मार्केटिंग है। जो अधिकतर टूल अपने मार्केटिंग टेक्स्ट में citations preservation के सक्षम होने का दावा करते हैं, उन्होंने वास्तव में pipeline के extraction हिस्से को लागू नहीं किया होता; इस टेस्ट को चलाने से आप जान सकते हैं कि कौन-कौन से टूल असल में सक्षम हैं।
प्र. 5: क्या यह मेरे supervisor को सबमिट किए जाने वाले thesis chapters के लिए भी मायने रखता है, या सिर्फ journal manuscripts के लिए?
दोनों के लिए मायने रखता है, लेकिन अलग-अलग कारणों से। journal manuscripts में असंगत citations तकनीकी स्क्रीनिंग में रिजेक्शन का कारण बन सकते हैं। thesis chapters में नतीजा यह होता है कि आपका supervisor या समिति citations में बदलाव (drift) देखती है, उसे या तो AI उपयोग का प्रमाण या लापरवाही का संकेत समझती है, और integrity पर चिंता जताती है या chapter को फिर से काम करने (rework) को कह देती है। यह drift इतना मामूली लगता है कि दुर्घटना (accident) जैसा प्रतीत हो सकता है, लेकिन एक सावधान पाठक के लिए यह इतना स्थिर और पर्याप्त रूप से दिखाई देने वाला होता है। citation-aware humanizer दोनों संदर्भों में failure mode को हटाता है।
पुनर्लेखन से पहले हर APA, MLA, Chicago, IEEE, Harvard, Vancouver, Turabian, और AMA उद्धरण निकालें। इसके बाद शब्दशः पुन: स्थापित करता है। 200 शैक्षणिक अनुच्छेदों पर परीक्षण किया गया।

मो प्राकृतिक भाषा प्रसंस्करण में PhD वाला एक NLP इंजीनियर है। उनके शोध में कम्प्यूटेशनल भाषाविज्ञान, पाठ विश्लेषण और मशीन लर्निंग शामिल है, और यह सीधे ProofreaderPro के पीछे संपादन और मानवीकरण मॉडल में शामिल है। वह प्रक्रिया के उस हिस्से के बारे में लिखते हैं जिसे ज्यादातर लोग कभी नहीं देखते हैं: कैसे एक भाषा मॉडल एक वाक्य को पढ़ता है, उसे स्कोर करता है, और निर्णय लेता है कि क्या बदलना है।