$GROK 4.5 MEMIMPIN BENCHMARK DENGAN BIAYA PER TUGAS TERENDAH 🔥

Grok 4.5 meraih 51,4% pada AutomationBench-AA, mengungguli Claude Fable 5 dengan 48,6% dan Claude Opus 4.8 dengan 48,5%. Model ini hanya menelan biaya $0,34 per tugas—sebagian kecil dari biaya Anthropic yang $1,35–$1,46—dan menggunakan kira-kira seperempat dari jumlah token output per tugas dibandingkan Opus 4.8.

Di bidang keuangan, domain paling sulit, Grok 4.5 memimpin dengan 71% penyelesaian tugas. Namun kepatuhan adalah trade-off: 0,63 pelanggaran guardrail per tugas, dibanding 0,55 untuk Opus 4.8. Kesenjangan ini penting bagi agen yang berada di dekat sistem keuangan yang berjalan secara langsung. Apakah Anda akan menukar efisiensi biaya dengan risiko kepatuhan yang lebih tinggi dalam produksi?

Bukan nasihat keuangan. Selalu kelola risiko Anda.

#GROK #AI #Benchmark #Grok45 #Enterprise

🔥