Model

Laboratorium Mengembangkan Tolok Ukur Mandiri untuk Memilih Model Bahasa Besar

6 Oktober 2026 · Baca 2 menit

Close-up of a piano keyboard with white keys
Kum Kobashi / Unsplash

Sebuah laboratorium telah membuat tolok ukur internal untuk menentukan model bahasa besar mana yang paling tepat untuk mengelola asisten kecerdasan buatan mereka. Asisten tersebut bertugas menjawab pertanyaan berdasarkan jurnal laboratorium elektronik yang berfungsi sebagai basis data untuk semua eksperimen dan pengukuran.

Pengembangan ini dilakukan karena peringkat publik dianggap tidak memadai untuk menilai bagaimana sebuah model menangani tugas spesifik laboratorium, seperti mengelola data yang mengandung kesalahan atau data yang berubah seiring waktu. Model yang diuji harus mampu menggunakan alat, menemukan sampel, membuka lampiran, membaca nilai, dan melakukan perhitungan.

Tolok ukur tersebut terdiri dari dua puluh empat pertanyaan yang dijalankan melalui mcp pada model DeepSeek, ChatGPT, dan Claude. Pertanyaan tersebut dibagi menjadi lima kelompok: lima pertanyaan navigasi untuk menemukan sampel, lima pertanyaan ekstraksi nilai dari berkas, lima pertanyaan penalaran multi langkah, lima pertanyaan jebakan, serta empat pertanyaan mengenai kejujuran dan penolakan.

Penilaian dilakukan berdasarkan tiga kriteria: kebenaran jawaban, adanya referensi ke objek atau berkas, dan kejujuran model dalam mengakui jika tidak menemukan informasi. Skor ketat hanya diberikan jika ketiga kriteria terpenuhi. Kelompok jebakan dan kejujuran diberikan bobot paling tinggi untuk membedakan asisten yang dapat dipercaya dari yang hanya mengarang jawaban.

Dalam pengujian, ditemukan variasi hasil yang signifikan antara kombinasi model dan upaya, dengan tingkat keberhasilan berkisar antara 75% hingga 100%. Biaya untuk menjalankan dua puluh empat pertanyaan tersebut juga sangat beragam, mulai dari dua belas sen hingga hampir lima dolar.

Contoh tugas jebakan mencakup identifikasi kegagalan termokopel ketika data suhu melonjak tidak wajar, serta pembersihan artefak pembacaan pada saluran daya. Model juga diuji kemampuannya dalam membedakan berkas yang benar dari berkas sampel lain yang berada di halaman yang sama, serta ketelitian dalam mengonversi satuan antara meter, nanometer, dan angstrom untuk menghindari kesalahan perhitungan sepuluh kali lipat.