Pada 6 Oktober, OpenAI mendorong 719 makalah matematika dari model internal yang belum dirilis ke GitHub.
Seminggu sebelumnya, kelompok penasihat mereka sendiri meminta lab untuk menghentikan pengujian soal matematika tingkat lanjut pada model-model berpemilik.
Lebih dari 600 tanggapan survei membentuk panduan Panel IAS pada 29 September
Kelompok Penasihat tentang Matematika dan Kecerdasan Buatan berbasis di Institute for Advanced Study di Princeton, New Jersey. Pada 29 September, mereka menerbitkan rekomendasi yang didasarkan pada lebih dari 600 tanggapan survei.
“Kami ingin menyatakan dengan jelas sejak awal: kami tidak mendukung praktik ini, dan kami meminta mereka untuk berhenti menguji masalah matematika tingkat lanjut pada model-model berpemilik,” tulis kelompok tersebut.
Dokumen yang sama memperingatkan bahwa model internal yang dirahasiakan berisiko menciptakan sistem dua tingkat, di mana laboratorium melaju lebih cepat daripada pihak lain di bidang tersebut.
Dalam repositorinya, OpenAI menyatakan bahwa sebagai bagian dari pengembangan model, perusahaan menguji model-modelnya pada masalah penelitian terbuka. OpenAI memperluas pengujian tersebut setelah tolok ukur matematika yang sudah ada mencapai batasnya.
OpenAI mengatakan bahwa mereka berkonsultasi dengan kelompok tersebut dan memanfaatkan rekomendasinya untuk rilis itu. Dalam pernyataan yang dirilis pada 6 Oktober, kelompok tersebut mengatakan bahwa peran penasihatnya bukanlah “dukungan terhadap proses yang digunakan OpenAI untuk mendapatkannya.”
Kelompok tersebut menyerahkan penilaian kepatuhan kepada komunitas matematika yang lebih luas.
Kode Lean Navier-Stokes membuktikan klaim yang lebih lemah daripada makalah tertulisnya
OpenAI mengelompokkan 719 makalah itu ke dalam 372 rumpun matematika, yang masing-masing berpusat pada hasil utama beserta bukti-bukti terkaitnya. OpenAI memberikan sekitar 4.000 masalah kepada model proprieternya, dan rata-rata setiap hasil membutuhkan sekitar tiga jam komputasi penalaran ChatGPT Pro.
Kelompok tersebut meminta laboratorium AI untuk menerbitkan nama model, prompt, ringkasan rantai penalaran, waktu yang dibutuhkan, dan biaya komputasi untuk setiap hasil.
OpenAI menerbitkan 10 ringkasan penalaran, dan sekitar 42% hasil utama dilengkapi formalisasi Lean.
Lean adalah bahasa pemrograman yang dapat digunakan untuk memeriksa bukti dengan komputer. Jika kodenya berhasil dikompilasi, bukan berarti kode dan argumen tertulisnya sama. Itu hanya berarti bahwa pernyataan formal tersebut benar.
Alexander Bastounis, Fabian Circelli, dan Anders C. Hansen menelaah kesenjangan tersebut dalam makalah yang diunggah pada 6 Oktober. Mereka menyimpulkan bahwa makalah Navier-Stokes tertulis dari OpenAI membuat klaim yang lebih kuat daripada yang dibuktikan oleh kode Lean-nya, dan satu estimasi mengubah urutan turunan masukannya.
Para penulis mendeteksi kesalahan penerjemahan serupa dalam bukti Euler OpenAI. “Bukti tertulis OpenAI dan bukti Lean lain yang diformalisasi secara otomatis pada dasarnya tidak boleh dipercaya tanpa melalui proses penelaahan sejawat dan pemeriksaan yang sama seperti yang diterapkan pada bukti-bukti lain,” tulis mereka.
Hasil Navier-Stokes diumumkan OpenAI pada 8 September. Menurut Cryptopolitan, matematikawan NYU Tristan Buckmaster kemudian membantah uraian OpenAI tentang seberapa sedikit masukan manusia yang terlibat dalam pengerjaan tersebut.
Perusahaan tersebut menjanjikan dana untuk lokakarya, konferensi, dan program khusus terkait hasil-hasil AI yang penting.
Pada 6 Oktober, Terence Tao menulis bahwa orang yang membuat prompt AI sering kali memecahkan masalah lalu kehilangan minat pada bidang tersebut. Banyak di antara mereka tidak dapat menjawab pertanyaan atau memberikan ceramah tentang hasilnya, tulisnya. Unggahannya tidak menyebut OpenAI.
Perusahaan tersebut mengatakan bahwa para penasihatnya tidak memiliki suara dalam menentukan laju penelitiannya, lapor Cryptopolitan pada September.
Jika Anda membaca ini, berarti Anda sudah selangkah lebih maju. Tetaplah di depan dengan buletin kami.
