ChatGPT vs Claude untuk Penelitian: GPT-6 vs Claude Opus 5.5
ChatGPT vs Claude untuk penelitian pada Oktober 2026: GPT-6 Astra, Sol, dan Luna vs Claude Opus 5.5, Fable 5.1, dan Sonnet 5.5, lengkap dengan harga serta pilihan untuk setiap tugas.
Claude Opus 5.5 adalah pilihan default yang lebih baik untuk penulisan riset akademik pada Oktober 2026. GPT-6 Astra adalah pilihan yang lebih kuat untuk pekerjaan sains yang bersifat agen, seperti analisis data dan simulasi. Uji 25 tugas kami sebelumnya pada model-model terdahulu, Claude Opus 5 vs GPT-5.4 Sol, juga menemukan pembagian yang sama:
| Tugas penelitian | Pemenang |
|---|---|
| Sintesis literatur dari banyak artikel | Claude |
| Penyusunan draf panjang dan kepatuhan instruksi | Claude |
| Kode statistik dalam R dan Python, sekitar akurasi 95% vs 85% | Claude |
| Pelestarian nuansa dalam prosa akademik | Claude |
| Penelusuran web, agen, dan tiruan tata letak gambar | ChatGPT |
| GPTs kustom dan ekosistem alat | ChatGPT |
| Kelayakan terbit secara keseluruhan pada uji 25 tugas kami | Claude, 4.5 vs 4.2 |
Kami menguji keduanya pada tingkat produksi saat ini (Claude Opus 5 melalui Claude Pro dengan biaya US$20 per bulan, GPT-5.4 Sol melalui ChatGPT Plus dengan biaya US$20 per bulan) pada sampel terkontrol sebanyak 25 tugas riset akademik yang diambil dari antrian editorial kami: 10 prompt sintesis literatur dari korpus 30 hingga 50 artikel, 5 prompt penyusunan bab berdasarkan kerangka tulisan tangan, 5 prompt kode analisis statistik, dan 5 prompt penyuntingan naskah pada draf jurnal yang nyaris final. Kami menilai setiap keluaran pada delapan dimensi yang paling penting untuk riset akademik, dan tiga penilai tingkat PhD menilai kelayakan terbit secara buta tanpa mengetahui nama model.
Tulisan ini adalah hasilnya. (Jika Anda sudah beralih ke keluarga GPT-5.6 yang lebih baru, lihat panduan kami tentang menggunakan GPT-5.6 untuk penulisan riset.) Profil ChatGPT (GPT-5.4 Sol), profil Claude (Opus 5), tabel perbandingan langsung head-to-head, putusan tahap demi tahap di seluruh alur kerja riset, pola hibrida yang memakai keduanya, serta hal yang tidak diperbaiki oleh kedua model itu, apa pun seberapa bagus pun nantinya. Judul utama: pilih Claude sebagai default jika Anda harus memilih satu, pilih ChatGPT untuk pekerjaan yang bersifat agentic dan visual, dan asumsikan Anda akan membutuhkan keduanya sebelum tesis Anda selesai.
Model baru: GPT-6 dan Claude 5.5 sekilas
OpenAI dan Anthropic sama-sama mengganti model utama mereka pada September 2026. OpenAI meluncurkan GPT-6 Astra pada 3 September, menambahkan GPT-6 Sol dan GPT-6 Luna pada 22 September, serta merilis GPT-6.1 Sol sebagai pembaruan dari GPT-6 Sol pada 29 September. Anthropic merilis Claude Fable 5.1 pada awal September, Claude Opus 5.5 pada 22 September, dan Claude Sonnet 5.5 pada 28 September.
Berikut model saat ini, beserta harga API dan batas yang masing-masing perusahaan cantumkan di halaman model OpenAI dan halaman model Anthropic:
| Model | Perusahaan | Dirilis | Kegunaan yang diklaim perusahaan | Harga API per satu juta token (input / output) | Jendela konteks | Batas pengetahuan |
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | 3 September 2026 | Model paling mumpuni mereka, untuk penalaran dan pemrograman yang kompleks | US$10 / US$50 | 1.05M token | 30 April 2026 |
| GPT-6.1 Sol | OpenAI | 29 September 2026 | Performa mendekati Astra dengan biaya lebih rendah | US$2 / US$10 | 1.05M token | 30 April 2026 |
| GPT-6 Luna | OpenAI | 22 September 2026 | Pekerjaan yang hemat biaya, volume tinggi | US$0.10 / US$0.50 | 1,05 juta token | 18 Mei 2026 |
| Claude Fable 5.1 | Anthropic | September 2026 | Membutuhkan penalaran yang mendalam dan pekerjaan agenik jangka panjang | US$10 / US$50 | 1 juta token | Juni 2026 |
| Claude Opus 5.5 | Anthropic | 22 September 2026 | Pekerjaan pengkodean agenik yang berjalan lama dan kerja pengetahuan | US$4 / US$20 | 1 juta token | Juni 2026 |
| Claude Sonnet 5.5 | Anthropic | 28 September 2026 | Kombinasi terbaik antara kecepatan dan kecerdasan | US$2 / US$10 | 1 juta token | Juni 2026 |
| Claude Haiku 4.5 | Anthropic | Rilis lebih awal | Model Claude tercepat | US$1 / US$5 | 200 ribu token | Februari 2025 |
Harga disusun berpasangan. Claude Fable 5.1 harganya sama dengan GPT-6 Astra, Claude Sonnet 5.5 harganya sama dengan GPT-6.1 Sol, dan Claude Opus 5.5 berharga US$4 dan US$20, di antara keduanya. Setiap model baru kecuali Haiku 4.5 dapat memuat sekitar satu juta token konteks, yang cukup untuk puluhan makalah lengkap dalam satu percakapan.
Beberapa nama lain juga muncul dalam penelusuran. Claude Mythos 5.1 adalah model yang sama dengan Fable 5.1 dengan sistem pengaman yang berbeda, dan Anthropic menawarkannya hanya melalui program akses tepercaya untuk keamanan siber dan ilmu hayat. Anthropic mengatakan Claude Haiku 5.5 akan menyusul dalam beberapa minggu mendatang. Dari pihak OpenAI, GPT-Rosalind adalah model untuk ilmu hayat bagi organisasi yang disetujui.
ChatGPT vs Claude untuk riset pada Oktober 2026: mana yang lebih baik?
Untuk penulisan riset akademik, Claude Opus 5.5 adalah pilihan default yang lebih baik pada Oktober 2026. GPT-6 Astra adalah pilihan yang lebih kuat untuk pekerjaan sains yang berorientasi agen, seperti analisis data, simulasi, dan penyesuaian model. Setiap perusahaan memublikasikan hasil pengujian mereka sendiri, dan hasil tersebut menunjukkan pembagian yang sama.
Di pengumuman Opus 5.5 dari Anthropic, Opus 5.5 memimpin GDPval-AA, sebuah uji pekerjaan dunia nyata lintas banyak profesi, dengan skor 1846 dibanding 1542 untuk GPT-6 Astra. Ia juga memperoleh 67,7% pada Humanity's Last Exam dengan tools, dibanding 57,2% untuk Astra. Untuk alur kerja ilmiah berbasis kode, GPT-6 Astra memiliki skor teratas di kedua tabel perusahaan: 64,6% pada Terminal-Bench Science, dibanding 58,7% untuk Opus 5.5 dan 52,6% untuk Fable 5.1.
Hasil yang dilaporkan masing-masing perusahaan, per Oktober 2026:
| Benchmark | Apa yang diuji | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra | Dilaporkan oleh |
|---|---|---|---|---|---|
| GDPval-AA v2.1 | Tugas kerja dunia nyata lintas profesi, sebagai penilaian | 1846 | 1735 | 1542 | Anthropic |
| Humanity's Last Exam, dengan tools | Pertanyaan sulit lintas banyak mata pelajaran akademik | 67.7% | 65.6% | 57.2% | Anthropic |
| Terminal-Bench Science 0.1 | Alur kerja ilmiah: analisis data, simulasi, penyesuaian model | 58.7% | 52.6% | 64.6% | Anthropic dan OpenAI |
| AutomationBench | Alur kerja bisnis bertahap lintas aplikasi | 40.0% | 31.4% | 41.4% | Anthropic |
| Terminal-Bench 4.0 | Tugas pemrograman di terminal | 66.4% | 55.8% | 57.9% | Anthropic |
Bacalah ini sebagai panduan kekuatan. Anthropic mengatakan bahwa pada tingkat kemampuan ini, margin pada benchmark "telah menjadi panduan yang kurang dapat diandalkan untuk perbedaan dunia nyata". Pembagian tersebut tetap berguna: Claude untuk membaca, penalaran, dan menulis tentang riset, serta ChatGPT untuk menjalankan sisi komputasional di dalamnya.
Kedua perusahaan juga mengatakan model baru mereka menulis dengan lebih baik. Anthropic menyatakan Opus 5.5 menulis lebih jelas dibanding model-model sebelumnya dan menempatkan informasi yang paling penting di urutan pertama. OpenAI menyatakan model GPT-6 memiliki komunikasi yang lebih jelas, dengan lebih sedikit jargon, lebih sedikit belokan kalimat yang ganjil, dan jawaban yang sedikit lebih singkat.
GPT-6 Astra, Sol, dan Luna untuk riset akademik
GPT-6 Astra adalah model OpenAI untuk pekerjaan paling berat, dan OpenAI mengatakan seharusnya digunakan untuk tugas riset ilmiah paling sulit. Di halaman GPT-6 Astra milik OpenAI, ia memiliki tingkat halusinasi internal 4,2% untuk Astra, dibanding 12,2% untuk GPT-5.6 Sol, dengan nilai lebih rendah yang lebih baik. OpenAI juga mengatakan Astra mengikuti templat dokumen dan slide dengan baik serta dapat bekerja langsung di perangkat lunak ilmiah untuk memeriksa data. Di ChatGPT, Astra mengaktifkan mode penalaran Pro pada paket Pro.
GPT-6.1 Sol adalah model yang paling sering digunakan peneliti setiap hari. OpenAI mengatakan model ini hampir menyamai Astra dalam hal pemrograman, penggunaan komputer, dan pekerjaan profesional dengan biaya token yang seperlima dari Astra. Pada Terminal-Bench Science dengan upaya maksimum, OpenAI melaporkan rata-rata biaya US$5,47 per tugas untuk GPT-6.1 Sol, dibanding US$23,21 untuk Opus 5.5 dan US$23,80 untuk Astra. OpenAI juga melaporkan bahwa GPT-6.1 Sol mencetak skor lebih tinggi daripada Opus 5.5 pada GDP.pdf, yaitu uji untuk menjawab pertanyaan tentang dokumen PDF kompleks.
Akurasi faktual juga membaik. Pada prompt factuality tersulit milik OpenAI, GPT-6.1 Sol menurunkan bagian jawaban yang mengandung kesalahan faktual dari 11,4% menjadi 7,7% pada upaya rendah, dibanding GPT-6 Sol. Namun ini masih berarti satu jawaban keliru dari tiga belas untuk pertanyaan sulit, jadi setiap angka dan sitasi perlu dicek.
GPT-6 Luna adalah model berbiaya rendah. Pengguna Gratis dan Go dapat menggunakan GPT-6 Luna di aplikasi desktop ChatGPT, dan paket gratis mencakup obrolan teks tanpa batas dengan GPT-5.6 Luna.
Apa saja yang disertakan dalam setiap paket ChatGPT untuk riset, per Oktober 2026:
| Paket ChatGPT | Model dan fitur riset |
|---|---|
| Gratis | Obrolan teks tanpa batas dengan GPT-5.6 Luna, unggahan terbatas dan riset mendalam terbatas |
| Go | Lebih banyak pesan, unggahan, dan memori dibanding Gratis |
| Plus | Penalaran lanjutan dengan GPT-6, riset mendalam yang diperluas, proyek, dan GPTs khusus |
| Pro | Penalaran Pro yang didukung oleh GPT-6 Astra, riset mendalam maksimum, dan sesi terpanjang |
Saat diluncurkan, GPT-6 Sol, GPT-6.1 Sol, dan GPT-6 Luna tersedia di ChatGPT Work dan Codex untuk pengguna Plus, Pro, Business, Enterprise, dan Edu. Model-model ini belum ada di obrolan reguler.
Fable 5.1 Claude, Opus 5.5, dan Sonnet 5.5 untuk riset akademik
Claude Opus 5.5 adalah model yang sebaiknya mulai digunakan. Anthropic mengatakan ia bekerja pada tingkat yang sama seperti Claude Fable 5.1 pada sebagian besar pekerjaan dan biayanya 40% lebih rendah untuk dijalankan dibanding Opus 5. Ia juga menulis keluaran lebih dari 30% lebih cepat daripada Opus 5, dan Anthropic menaikkan batas penggunaan lima jam pada paket Pro, Max, dan Team saat meluncurkannya.
Claude Fable 5.1 ditujukan untuk penalaran paling sulit dan tugas paling panjang, seperti peninjauan sistematis di banyak kumpulan paper. Anthropic mengatakan biayanya sekitar 25% lebih rendah daripada Fable 5 untuk pekerjaan tipikal, dan secara default diatur ke upaya Medium di Claude.ai. Untuk riset dan pengembangan ilmu kehidupan, Anthropic mengarahkan kueri ke model Opus mereka, dan organisasi yang telah diverifikasi dapat mengajukan Mythos 5.1 melalui Life Sciences Verification Program.
Claude Sonnet 5.5 adalah opsi yang lebih cepat dan lebih murah. Anthropic mengatakan model ini berjalan lebih dari 30% lebih cepat daripada Sonnet 5 dan biayanya hingga 30% lebih rendah per tugas. Pada GDPval-AA, ia mencetak skor 1844, dua poin di bawah Opus 5.5, dengan harga API setengahnya. Anthropic mengatakan kekuatannya ada pada tugas sehari-hari yang ruang lingkupnya jelas dan dokumen, slide, serta spreadsheet yang rapi, dan bahwa Opus 5.5 masih jelas lebih kuat untuk pekerjaan terbuka yang membutuhkan penilaian saksama.
Paket Claude, sebagaimana tercantum di halaman harga Claude pada Oktober 2026:
| Paket Claude | Harga | Tambahan untuk riset |
|---|---|---|
| Gratis | US$0 | Obrolan, pencarian web, pembuatan file, dan memori di seluruh percakapan |
| Pro | US$20 per bulan, atau US$17 per bulan jika ditagih tahunan | Lebih banyak penggunaan, lebih banyak model Claude, proyek, dan Claude Science |
| Maks | Dari US$100 per bulan | 5x atau 20x penggunaan Pro dan batas keluaran yang lebih tinggi |
| Paket tim untuk para ilmuwan | Kursi Standar gratis selama 12 bulan | Untuk grup riset terverifikasi di bidang sains, matematika, ilmu komputer, dan teknik |
Panduan kami untuk menggunakan Claude untuk penulisan riset akademik mencakup program ilmuwan dan cara memilih tingkat usaha untuk sesi panjang.
Model baru mana yang digunakan di setiap tahap proyek riset
Model terbaik berubah sesuai tahap proyek Anda. Tabel ini memasangkan setiap tahap dengan pilihan Claude dan pilihan ChatGPT, berdasarkan apa yang dilaporkan masing-masing perusahaan:
| Tahap riset | Pilihan Claude | Pilihan ChatGPT | Alasan |
|---|---|---|---|
| Tinjauan literatur dan sintesis | Opus 5.5, atau Fable 5.1 untuk tinjauan yang sangat besar | GPT-6 Astra | Opus 5.5 memimpin hasil kerja pengetahuan Anthropic dan Humanity's Last Exam, dan kedua pihak membaca sekitar satu juta token sekaligus |
| Membaca dan menelusuri PDF panjang | Opus 5.5 | GPT-6.1 Sol | OpenAI melaporkan GPT-6.1 Sol unggul dari Opus 5.5 di GDP.pdf dengan biaya per tugas yang kurang dari setengahnya |
| Menyusun bab dan makalah | Opus 5.5 | GPT-6 Astra | Kedua perusahaan mengatakan model terbaru mereka menulis dengan lebih jelas; Anthropic menyatakan Opus 5.5 menempatkan informasi kunci di awal |
| Analisis data, kode simulasi, dan statistik | Opus 5.5 | GPT-6 Astra | Astra memiliki skor Terminal-Bench Science tertinggi di kedua tabel perusahaan tersebut |
| Riset akademik dengan anggaran terbatas | Sonnet 5.5 | GPT-6.1 Sol | Keduanya berbiaya US$2 dan US$10 per juta token |
| Slide dan poster untuk konferensi | Sonnet 5.5 | GPT-6 Astra | Anthropic mengatakan Sonnet 5.5 membuat slide yang rapi; OpenAI mengatakan Astra mengikuti templat slide dengan baik |
| Edit cepat, pemformatan, dan pertanyaan singkat | Haiku 4.5 | GPT-6 Luna | Model tercepat dan termurah, meski pengetahuan Haiku berhenti pada Februari 2025 |
Tidak ada satu pun dari model ini yang menghilangkan kebutuhan untuk memeriksa sumber Anda. GPT-6.1 Sol tetap bisa membuat kesalahan faktual pada instruksi yang sulit, dan setiap model dapat menghasilkan referensi yang terlihat nyata padahal tidak. Jalankan daftar referensi Anda melalui pemeriksa sitasi AI gratis kami, dan gunakan proofreader AI untuk tinjauan akhir bahasa yang mempertahankan sitasi seperti yang Anda tulis.
Model baru, watermark, dan deteksi AI
Teks dari model terbaru dari kedua perusahaan dapat memuat watermark yang tidak terlihat. Anthropic mencantumkan Claude Fable 5.1, Opus 5.5, dan Sonnet 5.5 di antara model-model yang teksnya memiliki watermark di aplikasi mandiri dan API mereka. OpenAI mulai meluncurkan watermark teks miliknya sendiri, textGrain, pada 5 Oktober 2026, untuk ChatGPT dan Codex di Uni Eropa, dengan opsi ikut serta untuk pelanggan API di wilayah lain.
Belum ada perusahaan yang menawarkan pemeriksa teks publik, dan keduanya membatasi detektor teks mereka pada organisasi yang disetujui. Detektor AI seperti Turnitin bekerja terpisah dan memperkirakan penulisan AI dari teks itu sendiri.
Untuk pekerjaan Anda sendiri, ini berarti mengikuti kebijakan AI sekolah Anda dan menyatakan bagaimana Anda menggunakan AI saat diminta. Panduan kami tentang watermark Claude dan tentang watermark teks AI di OpenAI, Google, dan Anthropic menjelaskan cara setiap tanda bekerja dan apa yang bisa dan tidak bisa ditunjukkan oleh hasil deteksi.
Uji kami sebelumnya: Claude Opus 5 vs GPT-5.4 Sol
Untuk sebagian besar penulisan riset akademik, Claude Opus 5 adalah pilihan awal yang lebih baik: unggul dalam sintesis format panjang, mengikuti instruksi, menjaga kehati-hatian bahasa, serta akurasi kode statistik (sekitar 95 persen dibanding 85 persen untuk GPT-5.4 Sol). ChatGPT (GPT-5.4 Sol) memenangkan pekerjaan yang bersifat agen dan visual, penelusuran web, tiruan figur DALL-E, dan GPTs khusus, serta sedikit mengungguli Claude pada GPQA Diamond di kisaran 91 persen. Kedua model berada pada level yang setara pada tolok ukur unggulan 2026, sehingga sebagian besar klien doktoral kami menjalankan pola hibrida: Claude sebagai utama untuk sintesis dan penulisan, ChatGPT sebagai sekunder untuk tugas agen dan visual.
ChatGPT (GPT-5.4 Sol) sekilas untuk riset akademik
ChatGPT adalah unggulan produk konsumen OpenAI; GPT-5.4 Sol adalah model produksi terkini yang mendukung paket Plus mulai pertengahan 2026. Produknya lebih luas daripada modelnya; integrasi dan sistem GPTs khusus adalah bagian dari apa yang Anda bayar.
Harga. ChatGPT Plus seharga $20 per bulan memberi satu akses ke GPT-5.4 Sol, unggah berkas, pembuatan gambar melalui DALL-E, penelusuran, GPTs khusus, serta fitur Code Interpreter / Advanced Data Analysis. Paket gratis memang ada, tetapi membatasi penggunaan GPT-5.4 Sol; untuk riset serius, cepat beralih ke Plus.
Jendela konteks. 128K token pada antarmuka Plus standar. Nyaman untuk menampung artikel jurnal tipikal dalam satu kali proses; ketat untuk dokumen setingkat tesis (60.000+ kata) tanpa pemecahan (chunking).
Kekuatan untuk riset. GPT-5.4 Sol unggul pada tiga alur kerja terutama. Pertama, tugas berbasis agen yang terintegrasi alat: model ini menangani penelusuran, eksekusi kode, analisis berkas, dan pembuatan gambar dalam satu percakapan tanpa beban menyiasati konteks yang lebih berat dibanding alur setara milik Claude. Kedua, alur kerja visual: integrasi DALL-E menghasilkan mockup gambar, draf diagram, dan visual presentasi secara alami tanpa perlu keluar dari percakapan. Ketiga, ekosistem GPT khusus: GPT khusus yang spesifik bidangnya (Scholar GPT, Paper Interpreter, penasihat metode statistik) sudah disiapkan untuk alur kerja riset dan mengurangi waktu penyiapan untuk tugas berulang.
Kelemahan untuk riset. GPT-5.4 Sol kadang melepas atau menulis ulang sitasi in-text pada sekitar 35 persen kutipan akademik dalam pengujian kami (sejalan dengan benchmark ringkasan yang lebih luas yang kami jalankan di Ringkasan AI Terbaik untuk Makalah Penelitian pada 2026 (Diuji) post). Ketahanan terhadap pengawetan hedge lebih lemah daripada Claude; model sesekali mengubah "may suggest" menjadi "demonstrates" tanpa diminta. Sintesis lintas banyak makalah pada korpus 30 hingga 50 makalah dibatasi oleh jendela konteks 128K dan secara bermakna tertinggal dibanding padanan 200K versi Claude.
Patokan benchmark. GPT-5.4 Sol (varian GPT-5.4 produksi saat ini) sedikit mengungguli Claude pada set uji kami, mencapai kisaran 91 persen pada GPQA Diamond (pertanyaan sains level PhD). Selisihnya tidak besar, tetapi bertambah jika dihitung dari akumulasi. Kami menemukan GPT-5.4 Sol memakai sekitar 47 persen lebih sedikit token pada tugas berbasis alat yang setara, sehingga keunggulannya makin terasa pada alur kerja agen yang membutuhkan iterasi tinggi.
Edit Dokumen Makalah Akademik Tanpa Mengulang Prompt Claude atau ChatGPT
Proofreader AI kami menjalankan pelestarian hedge, rantai sitasi, dan penyuntingan ragam akademik dalam satu kali putaran tanpa rekayasa prompt. Paket gratis mencakup satu bab tesis penuh.
Coba SekarangClaude (Opus 5) sekilas untuk riset akademik

Claude adalah andalan konsumen milik Anthropic, dan Claude Opus 5 adalah model produksi saat ini yang menjalankan paket Pro. Ini adalah produk yang lebih sempit dibanding ChatGPT (tidak ada pembuatan gambar bawaan, tidak ada sistem GPT khusus), tetapi kami merasa kualitas bahasa dan penalarannya lebih diatur untuk kebutuhan pemakaian akademik, terlihat pada alur kerja yang lebih panjang.
Harga. Claude Pro berharga US$20 per bulan untuk akses Claude Opus 5, unggah berkas, Projects (ruang kerja multi-dokumen), dan akses ke beta Computer Use. Tingkat gratis mencakup Claude Haiku dan penggunaan terbatas Opus 5; untuk riset serius, beralih ke paket Pro dalam minggu pertama.
Jendela konteks. 200K token pada antarmuka Pro standar, dengan akses beta 1M token untuk Projects pada 2026. Ini cukup untuk mencakup tesis hingga sekitar 60.000 kata dalam satu percakapan; beta 1M mencakup disertasi doktoral penuh dan korpus multi-dokumen tanpa perlu membaginya menjadi potongan.
Kekuatan untuk riset. Claude unggul pada empat alur kerja terutama. Pertama, penulisan akademik berdurasi panjang: prosa disetel agar sesuai dengan ragam yang tetap bertahan saat melewati peer review tanpa kosakata klise yang memicu sinyal deteksi AI di Turnitin Clarity, GPTZero, dan alat serupa. Kedua, sintesis multi-dokumen: pada korpus 30 hingga 50 makalah, Claude membangun keterkaitan yang koheren lintas sumber dengan atribusi yang lebih tepat dibanding GPT-5. Ketiga, kepatuhan instruksi dalam skala panjang: prompt sistem 2.000 kata dengan 15 kendala tetap konsisten di seluruh percakapan; GPT dan Gemini rutin mengabaikan kendala pada prompt yang kompleks.
Kelemahan untuk riset. Tidak ada generasi gambar bawaan. Claude perlu alat lain untuk menghasilkan figur atau diagram. Polesannya lebih rendah daripada ChatGPT dalam hal alur kerja yang berorientasi agen dan terintegrasi alat. Computer Use versi beta bisa dipakai, tetapi lebih lambat daripada alur yang setara di ChatGPT. Projects lebih baik untuk alur kerja multi-dokumen, tetapi penyiapan per proyek lebih tinggi.
Patokan benchmark. Pada tugas yang menguji kepatuhan instruksi, Claude unggul jauh untuk alur kerja riset produksi. Untuk akurasi kode, Claude kira-kira akurat secara fungsional 95 persen dibanding kira-kira 85 persen untuk GPT-5.4 Sol pada set pengujian yang sama. Ini penting untuk kode analisis statistik di R atau Python. Kinerja Claude Opus 5 berada di kisaran 91 persen pada GPQA Diamond, setara posisi pertama di level judul bersama GPT-5.
Kompetisi sebelumnya: tier GPT-5.6 dan keluarga Claude 5
Kedua vendor sudah merilis jajaran baru sejak kami menjalankan benchmark ini, dan nama tier sekarang penting karena kedua antarmuka meminta Anda memilih model.
OpenAI: GPT-5.6 sebagai Sol, Terra, dan Luna. Sol adalah tier cepat dengan biaya rendah yang ada di balik antarmuka ChatGPT gratis. Terra berada di tengah. Luna adalah tier yang berfokus pada penalaran untuk pekerjaan teknis yang panjang seperti sintesis literatur dan argumen terstruktur, serta tier yang memetakan ke hasil GPT-5.4 Sol di tabel kami. Tier-tier ini berbagi satu tujuan pelatihan, sehingga pembagian peran tidak bergeser: pekerjaan berbasis agen, terintegrasi alat, dan visual tetap berada di sisi ChatGPT dari pemisahan ini. Panduan kami tentang menggunakan GPT-5.6 untuk penulisan riset membahas pilihan tier dengan lebih detail.
Anthropic: keluarga Claude 5. Jajaran saat ini adalah Opus 5 5, tier andalan di Claude Pro; Opus 5, peningkatan dalam kedalaman penalaran; dan Fable 5, unggulan dari kelas Mythos baru Anthropic yang berada di atas Opus. Haiku 4.5 tetap menjadi opsi cepat dengan biaya rendah, dan Opus 4.8, unggulan sebelumnya, masih tersedia di sebagian paket. Fable 5 adalah yang terkuat dalam keluarga ini pada dimensi yang sama persis dengan yang sudah dipimpin Claude di tabel kami: sintesis konteks panjang, kepatuhan instruksi dalam jangka panjang, dan kontrol register. Pemisahan yang masuk akal dari sisi biaya adalah Opus 5 5 untuk draf dan sintesis sehari-hari, dengan Fable 5 atau Opus 5 dikhususkan untuk sintesis paling sulit dan tahap ulasan yang paling ketat. Untuk melihat cara menghumanisasi output Claude sebelum diserahkan, lihat cara menghumanize draf Claude.
Yang tidak berubah dari tier baru ini. Pola putusan tetap sama: Claude untuk sintesis, penulisan, dan akurasi kode; ChatGPT untuk kerja berbasis agen dan pekerjaan visual. Dan tidak ada peningkatan tier di sisi mana pun yang mengubah seberapa terdeteksi output, karena detektor membaca pola statistik, bukan kualitas penulisan. Apa pun model yang menyusun draf teks Anda, langkah langkah humanizer sebelum diserahkan tetap menjadi bagian dari alur kerja.
Uji langsung berhadapan pada dimensi yang paling penting
Kami menilai kedua alat pada delapan dimensi yang penting untuk riset akademik, dengan rata-rata dari set pengujian 25 tugas.
| Dimensi (dari 5) | ChatGPT (GPT-5.4 Sol) | Claude (Opus 5) |
|---|---|---|
| Jendela konteks untuk dokumen panjang | 4.0 (128K) | 4.7 (200K, 1M beta) |
| Sintesis multi-makalah | 4.0 | 4.7 |
| Penulisan akademik bentuk panjang | 4.2 | 4.7 |
| Kepatuhan instruksi dalam jangka panjang | 4.0 | 4.8 |
| Pelestarian gaya ungkap | 3.8 | 4.6 |
| Akurasi kode (R, Python, LaTeX) | 4.0 | 4.7 |
| Alat berbasis agen + alur kerja visual | 4.8 | 3.9 |
| Ekosistem Custom-GPT / Projects | 4.6 | 4.2 |
| Kemampu-terbit riset secara keseluruhan | 4.2 | 4.5 |
Tiga pola dari tabel. Pertama, Claude unggul pada dimensi yang paling penting untuk pekerjaan tahap penulisan tesis dan pengiriman jurnal. Kesenjangan 0,3 pada publishability itu bermakna tetapi tidak berlebihan. Kedua, ChatGPT unggul pada dimensi yang paling penting untuk eksplorasi tahap awal, riset web yang bersifat agentic, serta pekerjaan pembuatan gambar atau presentasi. Ketiga, kesenjangan pada kemampuan mengikuti instruksi (4,0 dibanding 4,8) adalah yang terbesar dalam tabel; untuk alur kerja apa pun dengan banyak batasan atau prompt sistem yang panjang, Claude jauh lebih andal.
ChatGPT atau Claude mana yang lebih baik untuk telaah literatur, penulisan draf, dan kode statistik?
Tabel benchmark adalah inputnya. Keputusan bertahap yang benar-benar membentuk alur kerja sehari-hari.
Telaah literatur dan sintesis multi-karya tulis ilmiah. Claude menang. Jendela konteks 200K (atau beta 1 juta token) menampung kumpulan 30 sampai 50 makalah dalam satu sesi dan menghasilkan prosa sintesis dengan keterkaitan lintas dokumen yang koheren. GPT-5.4 Sol memotong pada batas 128K dan kehilangan konteks antar-dokumen pada pemecahannya. Dari dua LLM ini, Claude adalah pilihan yang jelas. Untuk pekerjaan lit-review khususnya, NotebookLM tetap menjadi rekomendasi yang berpijak pada sumber (lihat Ringkasan AI Terbaik untuk Makalah Penelitian pada 2026 (Diuji) benchmark).
Penyusunan bab dan penyuntingan dengan gaya akademik. Claude menang. Pelestarian hedge saja sudah menjadi faktor penentu untuk pekerjaan pengiriman jurnal; ragam prosa disetel agar sesuai dengan forum/publikasinya. GPT-5.4 Sol menghasilkan prosa yang lancar, tetapi memerlukan prompt pelestarian hedge yang eksplisit pada setiap putaran agar tidak membesar-besarkan kepastian.
Kode analisis statistik (R, Python, LaTeX). Claude menang dengan selisih (95 persen akurasi fungsional dibanding 85 persen pada set uji kami). Keunggulan dalam mengikuti instruksi berlipat di sini; alur kerja statistik yang kompleks dengan banyak batasan (versi paket tertentu, format output, pustaka untuk plotting) tetap berjalan dalam sesi panjang di Claude, sementara GPT-5.4 Sol secara rutin menjatuhkan batasan pada iterasi ketiga atau keempat.
Pemindaian cepat literatur, membaca abstrak, Q&A untuk satu makalah. Hasil seri fungsional. Kedua alat menangani interaksi satu makalah selama 5 sampai 10 menit dengan cukup baik; pilihannya adalah yang mana pun yang sudah Anda buka.
Riset agentic (menjelajah web, mengorek data, membuat gambar, menyusun slide). ChatGPT menang. Integrasi DALL-E dan Code Interpreter dengan penjelajahan dalam satu percakapan jauh lebih produktif dibanding alur setara Claude; Computer Use terus membaik, tetapi masih tertinggal dari pengalaman agentic ChatGPT untuk tugas riset tipikal.
Alur kerja khusus untuk tugas yang berulang (misalnya selalu mengekstrak IMRaD dari makalah dalam format ini). Seri dengan bentuk yang berbeda. Model GPT kustom ChatGPT lebih cepat untuk disiapkan dan dibagikan kepada kolaborator; model Projects Claude lebih kuat untuk alur kerja multi-dokumen, tetapi biaya penyiapannya per proyek lebih tinggi. Panduan kami Ekstrak Temuan Utama dari Artikel Penelitian dengan AI (IMRaD) mencakup template prompt yang bekerja di salah satu platform.
Simulasi latihan sidang dan Q&A. Seri. Kedua model mensimulasikan pertanyaan bergaya komite dengan berguna, berdasarkan bab tesis dan prompt latihan pembelaan. Pilih model mana pun yang sudah memiliki konteks paling banyak yang Anda muat sebelumnya.
Ringkasan visual cepat: mockup gambar, diagram presentasi, tata letak poster. ChatGPT menang secara default. DALL-E yang digunakan di dalam percakapan adalah jalur yang paling minim gesekan. Tidak ada satu pun model yang menjadi alat final untuk gambar berkualitas publikasi. Keduanya menghasilkan draf yang kemudian Anda selesaikan di matplotlib, R ggplot, atau editor vektor.
Apakah sebaiknya menggunakan ChatGPT dan Claude sekaligus, atau pilih salah satu?
Pola dalam contoh editorial kami konsisten: langganan Claude Pro sebagai alat utama untuk riset dan penulisan, serta langganan ChatGPT Plus sebagai alat sekunder untuk kerja yang bersifat agentic dan visual. Keduanya berharga $20 per bulan di tier konsumen; total $40 per bulan secara signifikan lebih murah daripada satu bab yang diedit oleh manusia, dan ini adalah paket standar untuk alur kerja doktoral yang serius pada 2026.
Pembagian peran yang bertahan dalam jangka panjang:
Claude (utama): sintesis literatur, penyusunan bab, penyuntingan dengan register akademik, kode analisis statistik, persiapan untuk presentasi pembelaan, apa pun yang membutuhkan kemampuan memegang dokumen panjang dalam konteks, apa pun dengan prompt multi-kendala.
ChatGPT (sekunder): riset web cepat dengan tautan sitasi, mockup gambar dan diagram, draf presentasi, GPTs khusus untuk tugas yang berulang, alur kerja agentic yang memerlukan penelusuran + kode + gambar dalam satu sesi.
Keduanya (dialihkan ke alat khusus):
- Sintesis batch tinjauan literatur: NotebookLM
- Ekstraksi IMRaD yang terstruktur: alur kerja empat-prompt kami pada model apa pun, dengan proofreader khusus untuk langkah validasi rantai sitasi
- Penyuntingan akademik final: AI proofreader kami untuk validasi rantai sitasi, pelestarian hedge, dan pelaporan integritas AI
- Penyuntingan pengembangan oleh manusia: Scribbr atau Wordvice (lihat perbandingan kami Scribbr vs Wordvice Editing Akademik (Uji Jujur 2026))
Alur kerja hibrida totalnya kira-kira $40 per bulan untuk biaya LLM, ditambah proofreader khusus di atasnya. Untuk alur kerja PhD selama setahun, ini jauh di bawah 5 persen dari anggaran pengeditan manusia yang setara untuk tesis tipikal. Kami membahas pilihan LLM dalam posting kami tentang Alur Kerja AI untuk Tesis PhD.
Apa yang tidak diperbaiki oleh kedua model, apa pun model yang Anda pilih
ProofreaderPro.ai adalah paket penyuntingan akademik berbasis AI yang mengoreksi, humanizes, memparafrase, merangkum, dan menerjemahkan tulisan riset, dengan ekspor track-changes ke Word.
Ada tiga mode kegagalan, yang bersifat struktural bagi LLM tujuan umum dan tetap terjadi apa pun apakah Anda memakai GPT-5.4 Sol atau Claude Opus 5.
Sitasi yang dihaluskan (halucinated citations). Kedua model akan menghasilkan referensi yang tampak meyakinkan tetapi tidak benar. Tingkat Claude lebih rendah daripada GPT-5.4 Sol (sekitar 3 persen vs 8 persen dalam set uji kami), tetapi tidak ada yang nol, dan tingkat mana pun terlalu tinggi untuk pengiriman jurnal. Prompt yang lebih baik tidak mengatasinya; audit rantai sitasi khusus yang melakukannya. Audit Sitasi Halusinasi kami mencakup mode kegagalan dan pemeriksaan dua arah antara teks dalam naskah dan daftar referensi yang mendeteksinya.
Hedge hilang saat prompt terlalu agresif. Bahkan Claude, yang lebih baik di antara dua, sesekali akan mengubah "may suggest" menjadi "demonstrates" jika prompt meminta "prosa yang lebih ketat" tanpa menentukan pelestarian hedge. Ini penting untuk pengiriman jurnal. Gunakan proofreader akademik khusus yang menjaga hedge sebagai properti bawaan, bukan instruksi per-prompt.
Pelaporan integritas AI untuk pengajuan skripsi. Baik Sol GPT-5.4 maupun Claude tidak menghasilkan log penggunaan AI terstruktur yang kini dibutuhkan oleh McGill, Princeton, Johns Hopkins, dan sebagian besar universitas besar saat pengajuan skripsi. Pada akhirnya, salah satu model harus merekonstruksi pengungkapan tersebut dari ingatan. Proofreader khusus yang mencatat setiap sesi AI secara native akan mengurangi pekerjaan itu.
Kepincangan ketiga ini bukan masalah "ChatGPT itu buruk" atau "Claude itu buruk". Ini adalah masalah LLM tujuan-umum yang memerlukan alat khusus untuk menutup celah, apa pun flagship yang Anda pilih sebagai model riset utama.
Pertanyaan yang sering diajukan
Q: Apakah ChatGPT atau Claude lebih baik untuk riset akademik pada tahun 2026?
Claude, rata-rata, untuk alur kerja yang paling penting dalam riset akademik: penulisan panjang, sintesis multi-karya, mengikuti instruksi dalam waktu yang panjang, pelestarian hedge, dan kode statistik. ChatGPT unggul pada alur kerja agen dan visual: penelusuran, pembuatan gambar, membangun GPT khusus, serta tugas yang terintegrasi ke alat. Kedua model bersaing ketat pada tolok ukur headline generasi 2026 (rentang 91 persen pada GPQA Diamond), sehingga perbedaannya dibagi menurut jenis alur kerja, bukan kualitas keseluruhan. Sebagian besar klien doktoral kami menjalankan pola hibrida (Claude sebagai utama, ChatGPT sebagai pendukung).
Q: Bisakah saya menggunakan ChatGPT atau Claude untuk menulis skripsi PhD saya?
Dalam sebagian besar kebijakan AI universitas pada tahun 2026 (McGill, Princeton, Johns Hopkins, Imperial College, serta mayoritas institusi US R1), pembuatan prosa substantif tidak diizinkan. Umpan balik struktural untuk kerangka yang ditulis tangan, penyuntingan tingkat kalimat dalam register akademik, kode analisis statistik, dan prompt sintesis literatur pada korpus terverifikasi diperbolehkan, dengan pengungkapan. Versi singkatnya adalah AI adalah alat bantu riset, bukan penulis. Alur kerja AI kami untuk skripsi PhD mencakup alur lima tahap dan templat pernyataan pengungkapan.
Q: Manakah AI yang memiliki jendela konteks lebih panjang untuk paper riset, ChatGPT atau Claude?
Claude, dengan selisih yang berarti. Claude Opus 5 memiliki jendela konteks 200K token pada antarmuka Pro standar dan akses beta 1M token di Projects untuk 2026; Sol GPT-5.4 memiliki 128K token melalui ChatGPT Plus. Untuk satu artikel jurnal, kedua jendela cukup; untuk dokumen sepanjang skripsi, korpus multi-karya, atau alur kerja apa pun yang memerlukan penalaran lintas dokumen dalam satu sesi, jendela Claude menjadi faktor penentu.
Q: Apakah ChatGPT atau Claude lebih sedikit melakukan halusinasi sitasi?
Claude, dengan selisih yang memang penting untuk kerja akademik. Kami menemukan Claude menghalusinasikan sitasi dalam teks pada sekitar 3 persen dari materi akademik kami, sedangkan Sol GPT-5.4 menghalusinasikan sekitar 8 persen. Keduanya tetap tingkat yang tidak dapat diterima untuk paper yang akan diajukan ke jurnal tanpa proses verifikasi. Audit Audit Sitasi Halusinasi kami mencakup pemeriksaan dua arah yang menangkap halusinasi apa pun model yang menghasilkannya.
Q: Haruskah saya berlangganan ChatGPT dan Claude sekaligus, atau pilih salah satu?
Untuk alur kerja doktoral atau riset yang serius di tahun 2026, keduanya. Total US$40 per bulan mencakup skenario penggunaan yang saling melengkapi (Claude untuk sintesis dan penulisan, ChatGPT untuk kerja berbasis agen dan visual) dan masih jauh lebih murah dibandingkan satu kali putaran penyuntingan akademik manusia. Untuk pengguna kasual atau yang hanya mengerjakan satu tugas, pilih Claude sebagai default jika pekerjaan Anda lebih banyak berupa teks dan berfokus pada penulisan. Pilih ChatGPT jika pekerjaan Anda lebih berat pada gambar atau terintegrasi dengan penjelajahan. Biaya untuk “mengunci” diri pada satu platform lebih tinggi daripada biaya menjalankan keduanya.
Q: Apakah model-model baru (GPT-6 dan Claude 5.5) mengubah mana yang lebih baik?
Model-model baru mempertahankan pembagian yang sama. Claude Opus 5.5 memimpin pada hasil kerja pengetahuan dan penalaran dari Anthropic, sehingga Claude tetap menjadi default yang lebih baik untuk penulisan riset. GPT-6 Astra mendapat skor tertinggi untuk alur kerja ilmiah dengan kode di tabel milik kedua perusahaan, sehingga ChatGPT tetap kuat untuk pekerjaan berbasis data yang padat dan kerja berbasis agen.
Q: Apakah GPT-6 lebih baik daripada Claude Opus 5.5 untuk riset?
GPT-6 Astra lebih baik untuk kerja sains berbasis agen, seperti analisis data dan simulasi, menurut hasil yang dipublikasikan oleh kedua perusahaan. Claude Opus 5.5 lebih baik untuk penulisan riset dan kerja pengetahuan. Opus 5.5 juga lebih murah melalui API: US$4 dan US$20 per satu juta token masukan dan keluaran, dibanding US$10 dan US$50 untuk Astra.
Q: Apa perbedaan GPT-6 Astra, Sol, dan Luna?
GPT-6 Astra adalah model GPT-6 paling cakap dari OpenAI, Sol menyeimbangkan kecerdasan dan biaya, dan Luna adalah model termurah untuk pekerjaan volume tinggi. GPT-6.1 Sol, yang dirilis pada 29 September 2026, adalah Sol versi terbaru saat ini dan harganya seperlima dari harga token Astra. Ketiganya memiliki jendela konteks 1,05 juta token di API.
Q: Apa itu GPT-6.1 Sol?
GPT-6.1 Sol adalah peningkatan dari GPT-6 Sol milik OpenAI, yang dirilis pada 29 September 2026. OpenAI mengatakan model ini hampir menyamai GPT-6 Astra pada pemrograman, penggunaan komputer, dan pekerjaan profesional dengan harga seperlima dari Astra. Pada peluncurannya, GPT-6.1 Sol tersedia di ChatGPT Work dan Codex pada paket berbayar, serta di API sebagai gpt-6.1-sol.
Q: Apakah Claude Fable 5.1 sepadan dibanding Opus 5.5 untuk pekerjaan akademik?
Untuk sebagian besar pekerjaan akademik, Opus 5.5 sudah cukup, karena Anthropic mengatakan kinerjanya berada pada level Fable 5.1 untuk sebagian besar pekerjaan serta biayanya lebih rendah. Fable 5.1 cocok untuk penalaran yang paling sulit dan tugas riset jangka panjang yang terdiri dari banyak langkah. Melalui API, Fable 5.1 dikenakan biaya US$10 dan US$50 per satu juta token, dibanding US$4 dan US$20 untuk Opus 5.5.
Q: Bisakah saya menggunakan GPT-6 atau Claude Opus 5.5 secara gratis?
Paket ChatGPT gratis mencakup obrolan teks tanpa batas dengan GPT-5.6 Luna, dan pengguna Free serta Go dapat menggunakan GPT-6 Luna di aplikasi desktop ChatGPT. Paket Claude gratis mencakup obrolan, penelusuran web, dan pembuatan file, sedangkan Claude Pro menambahkan lebih banyak model Claude seharga US$20 per bulan. Kelompok riset terverifikasi di bidang sains dapat memperoleh kursi gratis Claude Team melalui program ilmuwan dari Anthropic.
Q: Apa itu Claude Mythos 5.1?
Claude Mythos 5.1 adalah model yang sama seperti Claude Fable 5.1 dengan perlindungan yang berbeda, dan model ini hanya tersedia melalui program akses tepercaya Anthropic. Program-program tersebut mencakup keamanan siber dan ilmu hayat, termasuk Life Sciences Verification Program untuk organisasi yang sudah disaring. Sebagian besar peneliti menggunakan Fable 5.1 atau Opus 5.5 sebagai gantinya.
Q: Apakah Claude Sonnet 5.5 cukup baik untuk tesis?
Claude Sonnet 5.5 cocok untuk tugas tesis yang ruang lingkupnya jelas, seperti menyusun satu bagian dari kerangka Anda atau merapikan satu bab. Anthropic melaporkan skor kerja pengetahuan berada dua poin di bawah Opus 5.5, dengan harga API setengahnya. Untuk pekerjaan yang terbuka dan membutuhkan penilaian yang cermat, Anthropic mengatakan Opus 5.5 tetap jauh lebih kuat.
Validasi rantai sitasi, pelestarian hedge secara bawaan, pembersihan setelah humanizer AI, dan laporan integritas AI yang langsung masuk ke pernyataan pengungkapan skripsi Anda.

Dana adalah pembuat konten di ProofreaderPro, tempat dia menjalankan blog harian dan operasi penulisan. Dia menulis artikel tentang cara kerja platform pengeditan online, dan dia menangani pesan pelanggan setiap hari, dengan skor kepuasan bintang lima untuk menunjukkannya.