研究AWS Machine Learning·原文 2026年9月12日

AWS发布开源基准测试框架:衡量OpenAI模型在Amazon Bedrock上的“正确一次成本”

AWS机器学习官方博客披露,gpt-5.6-luna在AIME每题正确答案成本为 0.0021 美元,低于gpt-5.4-mini的 0.0139 美元;在GDPval专业交付物测试中,luna通过率 56%,高于mini的 42%。

AWS于 2026 年 7 月 30 日后发布一篇技术博客,介绍开源基准测试框架openai-on-aws/benchmarks-openai,用于比较OpenAI模型在Amazon Bedrock和OpenAI API上的“每次成功结果成本”,而不只是每百万token单价。

博客作者Nick McCarthy称,测试覆盖Amazon Bedrock上的gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol,以及OpenAI API上作为成本优化基线的gpt-5.4-mini和gpt-5.4-nano。

测量分三类:AIME、GPQA Diamond、MMLU-Pro上的单次调用准确率与成本;DeepSearchQA实时网络研究任务上的多轮智能体轨迹;以及GDPval专业交付物的评分通过率与成本。

Amazon Bedrock上的模型关了推理,基线跑默认配置

博客明确说明,所有五个模型通过同一个Responses API客户端运行,切换后端和模型ID,评测逻辑保持一致。结果仍会反映模型、供应商基础设施和模型特定配置的差异。

Amazon Bedrock上的模型以关闭推理的方式运行,OpenAI API上的两个基线模型跑在各自默认配置下。作者称这是对实际部署配置的比较,不是对模型内在能力的受控估计。

评分结合确定性检查和LLM评判(gpt-5.5,不在被评测模型之列),提示词被冻结并在每个结果文件中记录哈希。每次运行写出带时间戳的结果JSON,博客中的数字和图表在构建时由这些文件生成。样本量为 48 到 198 条。

  • 五个模型:gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol、gpt-5.4-mini、gpt-5.4-nano
  • 同一个Responses API调用路径,切换后端和模型ID
  • Amazon Bedrock配置关闭推理;OpenAI API基线为默认配置
  • 样本量 48–198 条,小差距视为方向性

AIME每题正确成本:luna 0.0021美元,mini 0.0139美元

博客将模型在基准上的总花费(包括答对和答错的尝试)除以答对数量,估算“观察到的一次正确答案成本”。

在AIME数学竞赛题上,博客记录sol解出 75%,mini为 37%。作者同时提醒,如果尝试彼此独立且准确率不变,37% 的准确率意味着平均约 2.7 次尝试才能成功一次,但真实重试存在相关性,应按实际重试策略测量,而不是直接套用该估算。

作者称,即使按luna原价(约为mini的 1.5 倍),在该配置下它每个正确AIME答案已比mini便宜 25%,因为关闭推理后计费token少于按默认配置运行的mini。

在 2026 年 7 月 30 日Amazon Bedrock上GPT-5.6 Luna和Terra降价后(luna降 80%,terra降 20%),博客记录luna每个正确AIME答案成本为 0.0021 美元,mini为 0.0139 美元。作者称在这些样本中luna的观察到成本最低,包括对比nano,尽管nano的名义token单价略低。

  • AIME准确率:sol 75%,mini 37%;GPQA Diamond 68% 对 43%;MMLU-Pro 82% 对 59%
  • luna正确AIME答案成本 0.0021 美元,mini 0.0139美元
  • 结果文件当前使用价格:luna每百万输入/输出 0.22/1.32 美元;terra 2.20/13.20美元
  • 博客提醒发布前需按实时价格页面确认Amazon Bedrock推理档位和区域

多轮智能体:mini平均 7.6 轮,输入token是terra的 2.3 倍

博客称,其智能体工作负载使用客户端管理历史并设置store: false,每一轮都会重新发送系统提示、此前的工具结果和对话上下文,单轮上下文大致线性增长,累计计费输入可能随轮数近似二次增长。每一轮还会增加一次往返延迟。

在DeepSearchQA的 50 题分层样本上,通过真实web_search和fetch_page工具运行实时智能体循环,答案按F1 ≥ 0.7 判定通过。

博客记录mini平均每问轮数最多,为 7.6 轮,主要是反复搜索循环;每多一轮都会重发累计搜索结果的上下文,最终达到terra输入token量的 2.3 倍(每问 114k对 50k token)。

在这个样本中,terra更高的token价格被更少轮数和更高回答质量抵消:每个通过答案 0.31 美元,mini为 0.40 美元;平均F1分别为 0.50 和 0.39。三个GPT-5.6配置的平均F1都高于两个基线。luna每个通过答案 0.05 美元,nano为 0.07 美元,通过率为 18%。作者称 50 题样本下接近的差距应视为方向性。

  • DeepSearchQA 50题分层样本,F1 ≥ 0.7 判通过
  • mini平均 7.6 轮,输入 114k token/问;terra 50k token/问
  • terra每个通过答案 0.31 美元,mini 0.40美元
  • luna 0.05美元,nano 0.07美元

GDPval专业交付物:luna通过 27/48,mini 20/48

博客选取GDPval的 48 个任务切片:由平均 14 年经验的专业人士制作的真实职业交付物,每个按人类撰写的评分标准打分,达到加权评分点 70% 及以上算通过。

三个GPT-5.6配置的评分均高于关闭推理的mini和nano。博客称最大差异出现在法律、护理和财务建议任务上,这些评分标准要求具体限定条件、结构和完整性。作者标注每个类别样本量小,该模式应视为探索性。

luna在 48 个交付物中有 31 个得分高于mini,9 个低于,8 个持平;通过 27 个,mini通过 20 个。该工作负载是单次调用,不受轮数影响。降价前mini和nano每个通过交付物更便宜,GPT-5.6只买到通过率。降价后,博客记录luna每个通过交付物 0.010 美元,mini 0.030美元,nano 0.012美元,通过率分别为 56%、42%、35%。

作者提醒GDPval输出上限为 8192 token,截断了luna 6个、terra 9个、sol 7个、mini 0个、nano 1个交付物;提高上限可能改善质量,也可能增加成本,需要一起测试。

  • 48 个GDPval任务,70% 加权评分点算通过
  • luna通过 27/48,mini 20/48
  • 降价后每个通过交付物:luna 0.010美元,mini 0.030美元,nano 0.012美元
  • 8192 token上限截断了luna 6个、terra 9个、sol 7个交付物

延迟快照:Bedrock上luna中位首token时间低 21%

博客用同一流式测试工具测量了同一模型在两个平台上的延迟。2026 年 7 月的测试位于us-west-2、单区域、特定时间点,在 12 个匹配配置中,Amazon Bedrock上luna的中位首token时间平均低 21%,terra低 5%。作者称共享服务随负载变化,应视为快照并重新测量。

在输出至少 500 token时,luna在Amazon Bedrock上的吞吐平均高 43%,terra高 4%。观察到的最差首token时间与中位值之比,Amazon Bedrock为 2.1–2.5 倍,OpenAI API为 4.6–6.6 倍。作者说明这些最大值反映尾部波动,但不是p99延迟估计。

sol的表现不同:它是深度推理模型,首token时间天然较长且波动大,其Amazon Bedrock运行使用us-east-1。

  • 12 个匹配配置,us-west-2,2026 年 7 月单区域快照
  • luna中位TTFT低 21%,terra低 5%
  • ≥500 token输出时luna吞吐高 43%,terra高 4%
  • 最差/中位TTFT比:Bedrock 2.1–2.5 倍,OpenAI API 4.6–6.6 倍

决策框架与复现方式

博客给出按工作负载形状选择起点的表格:高并发低复杂度任务从gpt-5.6-luna开始;准确率重要且对延迟有SLO的交互应用,先对luna做基准测试;链式工具调用的智能体,基准测试luna和terra;质量门槛高的文档生产用luna;真正困难的工作且准确率是硬门槛时,测试sol。

作者强调结果反映其样本量和配置选择:每套 50–198 题(DeepSearchQA 50、AIME 60、MMLU-Pro 140、GPQA Diamond 198),48 个交付物,Amazon Bedrock上的模型关闭推理作为成本下限;启用推理会同时提高质量和花费。

复现步骤已给出:从GitHub克隆openai-on-aws/benchmarks-openai,安装依赖,设置OPENAI_API_KEY和AWS_REGION及AWS凭证,运行quality/quick_evals.py、quality/deepsearchqa/run_deepsearchqa.py、quality/gdpval_eval.py以及performance/run_all.sh。作者建议换成自己的 50–100 个任务和已知正确输出,在自己的账户上得到所在领域的每次成功成本。

  • 复现命令涉及quality/quick_evals.py、quality/deepsearchqa/run_deepsearchqa.py、quality/gdpval_eval.py、performance/run_all.sh
  • 作者建议换入 50–100 个自有任务
  • 每套样本:DeepSearchQA 50、AIME 60、MMLU-Pro 140、GPQA Diamond 198,GDPval 48
  • 结论:按成功结果归一化成本会改变模型排序,价格或工作负载变化后应重跑

信息来源