研究Artificial Analysis·原文 2026年9月7日本站收录 2026年9月11日

Artificial Analysis发布Intelligence Index v4.3:新增AutomationBench-AA,私有题集权重升至 45%

Terminal-Bench升级到v4、AutomationBench-AA以 5% 权重取代 𝜏³-Banking,四个类别(Agents、Coding、General、Scientific Reasoning)权重维持 30%、20%、30%、20% 不变,私有测试集占比从v4.2的 40% 提高到 45%。

Artificial Analysis发布Intelligence Index v4.3,这是其Intelligence Index v5系列推进的一部分。

本次更新把Terminal-Bench升级到v4,并加入AutomationBench-AA——一个带私有测试集的智能体工作流自动化基准。根据来源摘要,这是v5推广过程中的延续动作。

类别权重保持不变:Agents占 30%,Coding占 20%,General占 30%,Scientific Reasoning占 20%。Terminal-Bench 4.0保持与Terminal-Bench 2.1相同的权重,AutomationBench-AA以 5% 权重取代 𝜏³-Banking。

带私有题目或答案的评测在Intelligence Index v4.3中占总权重的 45%,高于v4.2的 40%。

按来源给出的大类构成:Agents项下AA-Briefcase(私有)15%、GDPval-AA v2 10%、AutomationBench-AA(新加入,私有)5%;Coding项下Terminal-Bench v4.0(新加入)10%、SciCode 10%;General项下AA-Omniscience - Accuracy(私有)10%、AA-Omniscience - Non-hallucination(私有)5%、GDP.pdf 10%、AA-LCR v1.1 5%;Scientific Reasoning项下HLE 10%、CritPt(私有)10%。合计 100%。

来源表示,总分反映的是不同强项:Claude Fable 5.1在AA-Briefcase和SciCode上得分更高,GPT-6 Astra在Terminal-Bench v4.0和AutomationBench-AA上得分更高。

信息来源