Model bahasa cenderung memilih CV yang dibuat oleh dirinya sendiri
5 Oktober 2026 · Baca 2 menit
Sebuah penelitian menunjukkan bahwa model bahasa secara sistematis lebih memilih teks yang dihasilkan oleh model itu sendiri, bahkan ketika teks buatan manusia dinilai lebih baik secara objektif. Temuan ini berkaitan dengan proses penyaringan surat lamaran kerja yang menggunakan kecerdasan buatan.
Penelitian dilakukan terhadap 2.200 surat lamaran kerja asli yang ditulis manusia dari platform LiveCareer sebelum era kecerdasan buatan generatif. Untuk setiap surat lamaran, dibuat versi yang dihasilkan oleh tujuh model berbeda, termasuk GPT-4o, DeepSeek-V3, LLaMA, Qwen, dan Mistral. Model-model yang sama kemudian diminta menilai surat lamaran mana yang lebih baik. Hasilnya, model memilih versi yang dibuat oleh dirinya sendiri dalam 67 hingga 82 persen kasus, bahkan setelah dilakukan kontrol kualitas isi. GPT-4o mencapai angka tertinggi, yaitu 82 persen.
Penilaian oleh manusia dengan metode buta menunjukkan bahwa surat lamaran buatan manusia sering kali dinilai lebih baik. Meskipun demikian, model tetap memilih versi yang dihasilkannya sendiri. Para peneliti menyebut fenomena ini sebagai pengenalan diri, yaitu kemampuan model mengenali gaya bahasanya sendiri, termasuk cara membangun kalimat, pemilihan kata, dan struktur argumen. Semakin baik model mengenali teksnya sendiri, semakin kuat kecenderungannya untuk memilih teks tersebut.
Para peneliti juga mensimulasikan jalur rekrutasi yang realistis untuk 24 bidang pekerjaan. Pelamar yang menggunakan model kecerdasan buatan yang sama dengan alat penyaringan memiliki peluang masuk daftar pendek 23 hingga 60 persen lebih besar dibandingkan pelamar yang setara namun menulis surat lamaran secara manual. Perbedaan terbesar muncul di bidang bisnis, seperti penjualan, akuntansi, dan keuangan, sedangkan perbedaan terkecil muncul di pertanian dan seni.
Peneliti menguji dua cara untuk mengurangi kecenderungan tersebut. Cara pertama adalah mengubah instruksi sistem sehingga model diminta mengabaikan asal teks dan hanya menilai isi. Cara kedua adalah menggunakan penilaian oleh tiga model sekaligus, termasuk model yang lebih kecil dengan kemampuan mengenali teksnya sendiri yang lebih lemah. Kedua cara tersebut mengurangi kecenderungan lebih dari 50 persen. GPT-4o turun dari 82 persen menjadi 30 persen. Perubahan ini tidak memerlukan arsitektur model yang baru atau implementasi yang mahal, cukup mengubah cara pengonfigurasian alat.