This is a comparison of frontier models in generative AI, according to aggregates of benchmarks.
This is a comparison of frontier models in generative AI, according to aggregates of benchmarks.
The Intelligence Index released by benchmarking firm Artificial Analysis aggregates nine benchmarks: GDPval-AA v2, đÂł-Banking, Terminal-Bench v2.1, SciCode, AA-LCR, AA-Omniscience, Humanity's Last Exam, GPQA Diamond, and CritPt.[1] Only the highest "effort" setting for each model is shown below.
Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.