ChengRang
EN

Artificial Analysis 热门 新增

AI 搜索研究 免费

独立的第三方 AI 模型评测站,Intelligence Index 由九项评测加权而成;v4.2 把私有测试集权重提到 40%,用于抑制针对公开榜单的调优

模型评测 基准测试 榜单 独立第三方 成本对比
访问 Artificial Analysis 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

Artificial Analysis 是一个第三方模型评测站,最常被引用的产出是 Intelligence Index,一个把多项评测加权合成的综合分。2026 年 9 月 4 日发布 v4.2,定位是 v5 之前的过渡版本,把原计划放在 v5 里的部分改动提前放了出来。

它同时给出分数、每任务成本与输出 token 效率三条曲线,很多团队拿它做选型的起点。

核心功能

适合谁用

以下类型的用户会特别受益于 Artificial Analysis:

优点亮点

价格与方案

网站内容开放浏览,免费。方法论与逐模型明细在 artificialanalysis.ai/methodology/intelligence-benchmarking 公布。

总结与建议

榜单的价值取决于它有多难被喂。Artificial Analysis 这一版的改动几乎全部指向同一件事——压缩厂商针对已知题目调优的空间。把私有集权重翻倍、退役已经饱和的 GPQA Diamond、给评分沙箱补漏,都是为了让分数更接近模型在陌生任务上的真实水平。v4.2 的结果里 Claude Fable 5.1 综合第一,GPT-6 Astra 第二并在 GDP.pdf 上以 33.2% 领先。需要注意分数会随评测版本变动,跨版本直接比大小容易失真。

版本演进

分类
AI 搜索研究
价格
免费
标签
模型评测 · 基准测试 · 榜单