Snippet Bilang 96%, Papan Resmi Bilang 79,2%
Snippet pencarian bilang 96%, papan resmi bilang 79,2%. Empat aturan verifikasi benchmark yang lahir dari insiden itu.
Ringkasan
Snippet Google mengklaim skor SWE-bench Verified 95–96%, padahal papan resmi swebench.com mencatat puncak 79,2% per Desember 2025. Penulis menelusuri JSON langsung, membuang klaim tanpa sumber primer, dan mengoreksi kesalahan sendiri soal entri non-Claude tertinggi (TRAE, 78,8%). Hasilnya empat aturan riset: catat tanggal akses, verifikasi sumber primer, utamakan papan resmi di atas snippet, dan laporkan skor ganda apa adanya.
Snippet Bilang 96%, Papan Resmi Bilang 79,2%
Saya buka swebench.com langsung, ambil data leaderboard-nya, dan parse sendiri. Hasilnya bikin saya diam sebentar. Papan resmi bilang puncak SWE-bench Verified di angka 79,2% [8]. Sementara di snippet pencarian Google, bertebaran klaim 95–96%. Angka-angka itu nggak cuma beda tipis, selisihnya hampir 20 poin.
Awalnya saya nyalahin diri sendiri. Mungkin saya salah baca. Mungkin JSON-nya beda versi. Atau mungkin angka snippet emang lebih baru, dan papan resmi swebench.com yang ketinggalan.
Ternyata, dua-duanya nggak benar.
Papan swebench.com itu bukan "ketinggalan." Dia itu foto, bukan video. Tiap entri di tabelnya punya tanggal: Sonar Foundation Agent dan live-SWE-agent sama-sama 79,2%, keduanya jalan di Claude 4.5 Opus, dengan data terakhir Desember 2025 [8]. Angka-angka di snippet pencarian? Saya nggak bisa menemukan satu pun dari mereka yang trace-nya kembali ke papan resmi atau paper yang methodology-nya bisa diverifikasi. Klaim 95–96% itu pada akhirnya saya buang dari catatan riset, karena nggak ada sumber primer yang ngebuka datanya [8].
Saya koreksi juga asumsi saya sendiri. Awalnya saya nulis di draft bahwa mini-SWE-agent itu "satu-satunya non-Claude di top-5." Setelah diperiksa ulang, live-SWE-agent pakai Gemini dan dapat 77,4%, juga non-Claude. Angka yang lebih tinggi dari itu ada di TRAE pakai Doubao-Seed-Code, 78,8% [8]. Jadi yang bener: TRAE itu entri non-Claude tertinggi, bukan mini-SWE-agent. Kesalahan kecil, tapi kalo nggak dikoreksi, artikelnya jadi ngawur.
Soal mini-SWE-agent
Yang bikin saya tertarik bukan skor-nya, tapi rasionya. 76,8% dengan biaya sekitar 0,75 dolar per run [8]. Agent-nya cuma bash, nggak ada tool lain selain terminal [9]. Dari README-nya sendiri: "What if our agent was 100x simpler, and still worked nearly as well?" [9]. Klaim vendor-nya sendiri bilang ">74%" [9], yang nggak presisi tapi setidaknya nggak meleset jauh kayak angka snippet itu.
Dan kalo kamu pernah baca pedoman dari Anthropic soal membangun agent, "find the simplest solution possible, and only increasing complexity when needed" [10]? mini-SWE-agent itu kayak demonstrasi hidup dari prinsip itu.
SWE-bench Verified sendiri emang subset yang difilter manual dari 500 instance SWE-bench [11]. Papan resminya bukan league table yang terus naik; dia potongan waktu tertentu dengan tanggal akses yang bisa dicek [8]. Kalo kamu googling angka benchmark dan langsung percaya, kamu sedang baca sesuatu yang nggak bisa kamu verifikasi sendiri.
Protokol Empat Aturan
Insiden ini bikin saya bikin aturan baru untuk riset benchmark, dan sekarang ini jadi hard rule, nggak ada negosiasi.
Tanggal akses wajib dicatat. Setiap kali saya nyebut angka dari leaderboard, saya tulis kapan saya buka halaman itu. Leaderboard itu foto, dan foto berubah.
Angka cuma dari primer yang dibuka sendiri. Nggak cukup nyebut "menurut swebench.com." Saya harus buka JSON-nya, atau screenshot tabelnya, atau minimal capture halaman-nya. Kalo saya cuma copy angka dari blog orang lain, angka itu belum verified sampai saya trace ke sumber aslinya.
Snippet kalah kalo bertentangan dengan primer. Kalo Google bilang 96% tapi papan resmi bilang 79%, saya pakai yang papan. Snippet itu ringkasan mesin, bukan fakta. Bisa outdated, bisa salah parse, bisa dari sumber yang methodology-nya buruk.
Skor ganda dilaporkan apa adanya. Papan SWE-bench sekarang menampilkan dua entri dengan angka sama di posisi puncak [8]. Nggak usah dipilih salah satu. Nggak usah dirata-rata. Kalo dua entri sama, tulis dua-duanya.
Empat aturan ini lahir dari satu sore buka JSON dan bandingkan angka, dan sekarang dipakai ke semua benchmark yang saya riset, dan jadi bagian dari stack riset artikel berbasis AI agent skills yang pernah saya tulis. Karena angka yang salah itu bukan cuma masalah estetika, kalo saya pakai angka 96% di artikel, ada developer yang bikin keputusan teknis berdasarkan angka itu. Dan angkanya nggak bener.
Sumber: