Bulatan Times – Menulis sendiri dari awal ternyata belum menjamin sebuah teks akan lolos dari label buatan AI.
Tulisan manusia dapat memperoleh skor AI tinggi ketika diperiksa menggunakan AI detector. Sebaliknya, hasil dari satu alat belum tentu sama dengan detector lainnya.
Masalah ini makin relevan di sekolah, kampus, penerbitan, dan dunia kerja. Artificial intelligence detector mulai digunakan untuk memeriksa tugas atau dokumen, sementara kemampuan alat tersebut membedakan tulisan manusia dan mesin belum sempurna.
Riset terbaru menunjukkan gaya penulisan dan proses editing dapat ikut memengaruhi hasil pemeriksaan.
AI detector tidak mengetahui siapa yang menulis
AI detector pada dasarnya tidak menyaksikan proses sebuah tulisan dibuat. Alat tersebut menganalisis teks yang sudah jadi, kemudian menggunakan model statistik atau pembelajaran mesin untuk memperkirakan apakah karakteristiknya lebih dekat dengan tulisan manusia atau teks yang dihasilkan AI.
Ciri linguistik yang dianggap berkaitan dengan AI ternyata juga bisa ditemukan dalam tulisan manusia.
Studi Park, Jeong, dan Kim yang dipublikasikan pada Agustus 2026 menguji 13 AI text detector terhadap 135.389 pasangan manuskrip berbahasa Inggris. Setiap pasangan terdiri atas naskah yang ditulis penutur non-native dan versi yang sudah diedit secara profesional.
Penulisnya tetap manusia dan isi dokumennya sama, tetapi proses editing bisa mengubah penilaian detector. Pada sejumlah alat, skor AI meningkat setelah editing. Detector lain justru memberikan skor lebih rendah. Tingkat false positive juga berbeda lebar di antara alat yang diuji.
Temuan tersebut tidak mendukung anggapan bahwa tulisan yang sangat rapi otomatis akan dinilai sebagai buatan AI.
Gaya bahasa dan editing dapat memengaruhi hasil
Artikel IDN Times yang menjadi titik awal pembahasan menyebut struktur kalimat terlalu rapi, pemilihan kata yang formal dan monoton, serta minimnya sentuhan personal sebagai beberapa alasan tulisan manusia dapat dicurigai sebagai AI.
Gaya bahasa memang dapat menjadi faktor pengganggu bagi detector. Namun, penelitian menunjukkan persoalannya lebih kompleks karena perubahan gaya melalui professional editing dapat menghasilkan respons berbeda dari detector yang berbeda.
Memasukkan bahasa santai, membuat struktur sengaja tidak rapi, menambahkan typo, atau menyisipkan ekspresi personal bukan metode ilmiah untuk membuktikan sebuah teks ditulis manusia.
Tulisan akademik, berita, dokumen hukum, dan laporan teknis memang dapat memiliki struktur rapi dan bahasa formal karena tuntutan jenis tulisannya.
Baca Juga: Agen AI OpenAI Bobol Portal Medicare Australia Tanpa Perintah Manusia
False positive menjadi masalah nyata
Bias dalam AI detector sudah lama menjadi bahan penelitian. Stanford mencatat penelitian sebelumnya menemukan persoalan bias terhadap penulis bahasa Inggris non-native. Riset berikutnya juga mengembangkan benchmark khusus untuk menguji perbedaan performa detector berdasarkan dialek, tingkat pendidikan, formalitas, topik, dan faktor sosiolinguistik lainnya.
Implikasinya terasa di lingkungan pendidikan. Mahasiswa yang benar-benar menulis tugasnya sendiri dapat menghadapi kecurigaan hanya karena pola bahasanya menghasilkan skor tertentu pada sebuah detector. Skor rendah pun tidak otomatis membuktikan suatu teks pasti ditulis manusia.
Tidak semua AI detector dibangun dengan model, dataset pelatihan, ambang keputusan, dan metode penilaian yang sama. Sebuah artikel dapat memperoleh hasil berbeda ketika dimasukkan ke beberapa layanan.
Penelitian terhadap GPTZero yang diterbitkan pada 2025, misalnya, menemukan alat tersebut cukup berhasil mengenali banyak teks AI murni dalam dataset penelitian. Tetapi hasil terhadap esai manusia berfluktuasi dan terdapat false positive. Peneliti menyarankan pendidik berhati-hati jika menjadikan detector sebagai satu-satunya dasar penilaian.
Skor AI bukan rekaman proses menulis
Angka yang ditampilkan detector mudah disalahartikan. Label persentase AI tidak semestinya langsung dibaca sebagai bukti bahwa persentase yang sama dari isi dokumen dibuat menggunakan ChatGPT atau model AI lainnya.
Makna angka bergantung pada cara masing-masing layanan merancang sistem penilaiannya. AI detector melakukan klasifikasi atau estimasi berdasarkan karakteristik teks; alat tersebut tidak mempunyai rekaman proses ketika penulis mengetik dokumen.
Riwayat revisi, catatan riset, draf sebelumnya, sumber yang digunakan, metadata, dan kemampuan penulis menjelaskan bagaimana naskah dikembangkan dapat memberi konteks ketika kepengarangan dipersoalkan.
Penelitian terbaru juga menemukan semakin besar perubahan dalam professional editing, semakin terlihat hubungan dengan perubahan skor detector. Arahnya tidak selalu sama.
Kasus semacam ini makin rumit karena proses menulis modern tidak selalu terbagi bersih antara sepenuhnya manusia dan sepenuhnya AI. Seseorang bisa menulis seluruh isi sendiri tetapi menggunakan alat digital untuk koreksi tata bahasa. Ada pula yang menggunakan AI hanya untuk editing, bukan menghasilkan ide atau isi.
Baca Juga: Meta Perkenalkan Muse Charm, Perangkat AI Mungil yang Mengingatkan pada Tamagotchi
Jangan merusak tulisan demi mengejar skor detector
Munculnya AI detector juga melahirkan kebiasaan baru: penulis berusaha membuat tulisannya terlihat manusia. Cara tersebut bisa keliru arah.
Tidak ada alasan untuk sengaja memasukkan typo, membuat kalimat berantakan, menggunakan bahasa santai yang tidak sesuai konteks, atau mengubah tulisan yang sebenarnya sudah baik hanya untuk mengejar skor detector.
Temuan bahwa gaya dapat memengaruhi detector menunjukkan keterbatasan sistem klasifikasi, bukan alasan menurunkan kualitas tulisan.
Untuk artikel berita, bahasa yang rapi dan netral memang dibutuhkan. Skripsi memiliki konvensi akademik. Dokumen perusahaan bisa menggunakan struktur yang sangat konsisten. Keseragaman tertentu dapat muncul karena jenis dokumennya, bukan karena AI.
Riset tentang deteksi tulisan AI masih berkembang. Penelitian Stanford mengenai penggunaan LLM dalam karya ilmiah bahkan memilih pendekatan yang mengestimasi penggunaan AI pada tingkat kumpulan dokumen, bukan menentukan apakah seorang individu tertentu menggunakan AI, karena reliabilitas detector publik untuk klasifikasi individual telah banyak dipertanyakan.
Dalam lingkungan pendidikan atau pekerjaan, skor tinggi lebih tepat menjadi alasan untuk memeriksa proses pengerjaan, bukan otomatis menjadi bukti pelanggaran. Bagi penulis, menyimpan draf, catatan sumber, dan riwayat revisi dapat membantu ketika proses kepengarangan perlu dijelaskan.












