欢迎光临
我们一直在努力

GPT & Claude LLM旗舰大模型评测数据集/Benchmark盘点

本文整理 GPT-5.6 Sol 与 Claude Opus 5 最新旗舰发布材料中实际使用或展示的公开 Benchmark;不加入 MMLU、HumanEval 等未使用的传统评测,Artificial Analysis Intelligence Index、Artificial Analysis Coding Agent Index 等“多个评测集聚合形成的综合指数”也不作为单一数据集列出。

一、综合能力与真实专业工作

数据集 / Benchmark主要评测能力规模 / 评价标准当前定位
Agents’ Last Exam(ALE)官方项目页 · 官方仓库 长程智能体、真实专业工作、跨领域知识、计算机操作与工具执行 持续扩展的真实职业任务库,已收集 1,500+ 个专家来源任务,覆盖 55 个子领域、13 个行业集群;公开版本约 150 个任务。任务在真实操作系统沙箱中完成,通过隐藏参考结果和确定性程序评分器检查最终成果。 2026 年代表性的“真实工作能力”评测。相比传统问答,更强调模型能否持续完成具有经济价值的专业任务。
GDPval-AA v2官方评测页 专业知识工作、文档/表格/幻灯片等交付物生成、智能体工具使用 使用 OpenAI GDPval 中的 220 个任务,覆盖 44 种职业、9 个主要行业。模型可使用 Shell 与网页搜索完成任务;模型产出匿名后进行盲法两两比较,并聚合为 Elo 分数;人类专家基线设为 1000。 当前重要的真实知识工作第三方评测,强调“最终工作成果质量”,而非单纯考试正确率。
Big Finance Bench官方项目页 金融研究、财务分析、投资判断、专业金融推理 928 道由金融领域专家编写的问题,每题配有专家评分规则。主要同时看最终答案正确性和按评分规则得到的质量分;官方榜单采用多个裁判模型聚合评分,以降低单一裁判偏差。 面向高价值金融工作的专业评测,适合观察模型在研究、银行、投资和资产管理场景中的表现。
Humanity’s Last Exam(HLE)官方项目页 专家级跨学科知识与复杂推理 最终版本约 2,500 道题,由全球领域专家编写,覆盖大量学科;包含选择题和短答案题,并保留私有测试集。答案要求明确、可验证,采用选择题正确率或自动化短答案判分。 当前最有代表性的高难综合学术评测之一,主要用于解决 MMLU 等传统知识基准逐渐饱和的问题。

二、科学、医学与高难推理

数据集 / Benchmark主要评测能力规模 / 评价标准当前定位
GPQA Diamond官方仓库 · 论文 博士级物理、化学、生物知识与科学推理 GPQA 的最高质量子集,共 198 道四选一题。题目和标准答案由领域专家创建并验证;运行评测时直接比较模型最终选择与标准答案,以 Accuracy / 正确率评分。 仍是衡量顶级模型高难科学推理能力的核心公开基准之一,评分机制简单、客观、可复现。
FrontierMath v2官方项目页 · Tiers 1–3 v2 · Tier 4 v2 极高难度数学、研究级数学推理 v2 共 338 道原创问题:Tiers 1–3 为 295 道,Tier 4 为 43 道研究级问题。大部分正式测试题保持私有,使用可验证标准答案并主要报告正确率。 当前前沿数学能力最重要的评测之一,难度明显高于一般竞赛数学数据集,尤其适合区分最强推理模型。
ARC-AGI-3官方论文 抽象推理、未知规则学习、探索、目标推断和规划 不是传统静态问答集,而是由交互式、回合制的陌生环境组成;每个环境至少包含多个关卡。正式评分在未见过的私有环境上进行,核心指标是任务完成情况和相对于人类基线的行动效率。 新一代流体推理与适应能力评测,刻意减少语言知识和既有知识记忆的影响,强调面对“从未见过的问题”时的泛化。
GeneBench-ProOpenAI 官方项目页 基因组学、定量生物学、转化生物医学、多阶段统计分析与科研判断 共 129 个问题,覆盖 10 个领域、21 个子领域。模型需要分析真实感很强的复杂数据、进行质量控制和多阶段推理;由于数据生成过程受控,可对核心数值目标进行确定性验证,同时考察分析路径和科研判断。 研究级计算生物学评测,重点从“知道生物知识”转向“能否做出正确科研分析和关键判断”。
LifeSciBenchOpenAI 官方论文 生命科学研究、证据综合、实验设计、数据分析、科研判断与科学沟通 共 750 个专家编写任务,覆盖 7 类科研工作流、7 个生命科学领域;包含 1,062 个支持材料和 19,020 条专家评分标准。模型输出为开放式回答,依据任务特定评分规则计算归一化得分,并可统计达到阈值的任务通过率。 面向真实生命科学研究工作的新型评测,强调开放式科研判断、复杂材料理解和可操作的科学结论,而不是选择题。
HealthBench ProfessionalOpenAI 官方介绍 · 论文 临床咨询、医学研究、医疗文书与真实医生工作场景 共 525 个医生编写任务,从 15,079 个候选案例中筛选,覆盖诊疗咨询、文书与记录、医学研究。每个任务有医生编写并经多阶段医生裁定的评分规则;模型回复由基于规则的模型评分器逐项判定并加权汇总。 比医学选择题更接近临床专业人员真实使用 AI 的场景,强调答案质量、安全性与临床工作价值。

三、代码与软件工程

数据集 / Benchmark主要评测能力规模 / 评价标准当前定位
SWE-Bench Pro官方项目页 · 官方仓库 真实软件工程、复杂代码库理解、Bug 修复与长程代码修改 完整数据集包含 1,865 个问题,来自 41 个持续维护的代码仓库;公开集合、保留集合和商业私有集合分开。模型需要生成代码补丁,并在 Docker 等可复现环境中运行测试,以 % Resolved / 任务解决率为核心指标。 真实软件工程的重要高难评测之一,任务通常比早期 SWE-bench 更长、更复杂,更接近企业级代码维护。
DeepSWE v1.1官方项目页 长程代码智能体、真实软件工程、代码库探索和调试 v1.1 共 113 个原创长程软件工程任务。智能体在代码仓库中持续操作并提交补丁,最终在干净的验证容器中执行程序测试;主要报告 Pass@1,也可报告多次尝试结果。 2026 年重要的代码智能体前沿评测,重点减少公开 GitHub 历史任务带来的训练污染,并考察长程自主开发能力。
Terminal-Bench 2.1官方项目页 · 官方仓库 命令行智能体、Shell 操作、系统管理、编程、科学计算与安全任务 共 89 个复杂终端任务。模型进入容器环境自主执行命令和工具;任务由专门的程序验证器检查最终结果,通常报告 Accuracy / Pass Rate。 衡量 Claude Code、Codex 等终端型智能体真实工作能力的代表性基准,重点是“能否完成整个任务”而不是只生成代码。
Frontier-Bench v0.1官方数据集页 高难终端智能体、软件工程、科学工程、CAD、形式化证明和 GPU 优化 v0.1 包含 74 个高难任务,覆盖多个专业领域。模型在容器/命令行环境中执行任务,使用程序化验证器评价结果;发布材料常通过多次尝试后计算 Mean Reward / 平均奖励。该项目后续演进为 Terminal-Bench 3.0。 Terminal-Bench 2.x 之后进一步提高难度的前沿智能体评测,专门用于拉开最强自主工作智能体之间的差距。
CursorBench 3.2官方评测页 IDE 代码智能体、多文件修改、代码库搜索、调试与真实开发工作流 任务来自真实 Cursor 使用中的模糊、多文件软件工程任务;完整任务规模并未像公开数据集一样全部披露。模型在统一智能体环境中执行任务,按任务成功情况计算总体分数,同时公开成本、Token 和步骤数等辅助指标。 非常贴近开发者在 IDE 中使用代码智能体的真实体验;生态相关性强,但公开复现程度低于完全开放的数据集。
FrontierCode 1.1官方项目页 生产级代码质量、复杂开发、调试与根因分析 评测不仅判断程序是否功能正确,还通过 1,000+ 条评分标准检查代码质量、工程合理性等;1.1 版本重新审计并修订部分过严规则。主要按 Main / Extended 等子集报告综合得分。 面向“高质量生产代码”而不只是单元测试通过率的代码评测,适合观察高级代码智能体的工程判断和调试能力。

四、搜索与深度研究智能体

数据集 / Benchmark主要评测能力规模 / 评价标准当前定位
BrowseCompOpenAI 官方项目页 · 官方实现 网页搜索、深度信息检索、持续浏览与多步事实推理 共 1,266 道高难搜索问题。模型需要访问开放互联网并持续寻找难检索证据;最终回答通常较短,可与参考答案进行自动或语义等价判断。 当前网页搜索/浏览智能体最有代表性的高难公开评测之一,重点测试“能否真正找到信息”,而不是模型参数记忆。
DeepSearchQAGoogle 官方数据集 深度研究、多轮搜索、长程信息搜集、完整答案集合生成 共 900 个问题,覆盖 17 个领域;包含单答案和集合答案,其中多数要求返回多个答案。官方方法使用裁判模型识别正确项和多余项,再计算 Precision、Recall、F1 等指标。 更强调深度研究智能体的搜索规划、上下文保持与“完整找全答案”的能力,而不仅是找到一个事实。

五、工具使用、业务自动化与计算机操作

数据集 / Benchmark主要评测能力规模 / 评价标准当前定位
AutomationBenchZapier 官方评测页 · 官方仓库 企业业务流程、跨 SaaS 工具调用、端到端工作流执行 公开基准包含 600 个正式任务,覆盖销售、营销、运营、客服、财务和 HR;环境提供 47 个模拟 SaaS 应用、约 500 个 API 端点。评分直接检查任务结束后的系统状态,使用确定性断言;正式主指标是严格任务通过率。 当前企业智能体/工具使用非常有代表性的评测。其价值在于检查“业务状态是否真的被正确改变”,而不是模型声称自己完成了任务。
Toolathlon官方项目页 多工具协作、跨应用长程任务、复杂工作流执行 共 108 个任务,覆盖 32 个软件应用、604 个工具,平均需要约 20 次工具交互。每个任务都有可执行验证脚本,主要报告 Pass@1、Pass@3 等成功率指标。 新一代综合工具使用评测,重点考察模型能否规划并完成跨多个应用和工具的长程工作。
OSWorld 2.0官方仓库 计算机操作智能体、GUI 操作、桌面应用与长程真实任务 采用版本化任务发布;当前正式版本包含百余个长程任务,覆盖多个专业领域。智能体实际操作桌面、浏览器、文件系统和应用软件;通过任务特定验证器检查最终状态,可报告严格完成率和部分得分。 当前最有代表性的计算机操作智能体评测之一,比网页问答更接近“让模型真正操作一台电脑完成工作”。
BenchCAD官方项目页 · 官方仓库 CAD、工程几何理解、参数化建模、视觉到 CAD 代码生成 基于 17,900 个经执行验证的 CadQuery 程序、106 类工业零件和 47 项工程标准;包含 Vision2Code、Code Edit、视觉/代码问答等任务。生成任务通过实际执行 CAD 程序并比较几何体,核心指标包括 voxel IoU 等,不依赖 LLM 裁判。 代表专业软件与工程智能体评测的新方向,强调模型能否在真实工程约束下生成可执行、几何正确的 CAD 结果。

六、多模态与专业文档理解

数据集 / Benchmark主要评测能力规模 / 评价标准当前定位
MMMU-Pro官方项目/仓库 · 官方主页 高难视觉理解、多模态专业知识与跨模态推理 标准 10 选项版本约 1,730 道题。在 MMMU 基础上过滤掉仅靠文本即可回答的问题、增加更多干扰选项,并提供 Vision-only 设置;主要按选择题 Accuracy评分。 当前最常用的高难多模态专业推理基准之一,比传统视觉问答更强调真正依赖图像的信息和专家级知识。
GDP.pdf官方论文 · 公开数据集 PDF 文档理解、表格/图表/脚注/空间布局、专业文档推理 共 100 个真实专业 PDF 任务,由来自 10 个专业领域的从业者编写。每题配有多个原子化评分标准,同时报告评分规则总得分和严格的整题通过率。 2026 年新型专业文档评测,关注模型能否真正理解复杂 PDF 中跨页面、表格、图表和版面关系,而不仅是 OCR。

七、长上下文

数据集 / Benchmark主要评测能力规模 / 评价标准当前定位
OpenAI MRCR v2OpenAI 官方数据集 超长上下文中的多目标信息检索、共指消解和精确回忆 OpenAI 公布的数据集约 2,400 条样本,包含 2、4、8 needle 等设置,上下文可扩展至约 100 万 Token。模型需要从多个高度相似的目标信息中精确返回指定实例,再通过官方 grader 与标准答案比较。 比单一 Needle-in-a-Haystack 更难,因为多个目标来自相同分布,需要模型同时定位、区分并保持长程上下文信息。
GraphWalks BFSOpenAI 官方数据集 长上下文中的结构化图推理、多跳关系推理与 BFS 将大规模有向图以边列表形式放入上下文,要求模型返回指定深度的 BFS 节点集合或父节点集合;通过预测节点集合与标准集合计算 F1。可在 256K、约 1M Token 等超长设置下运行。 长上下文评测中较有价值的一类:不只要求“找到一句话”,还需要在超长输入中执行结构化、多步算法推理。

八、网络安全

数据集 / Benchmark主要评测能力规模 / 评价标准当前定位
SEC-Bench Pro官方仓库 · 论文 长程漏洞发现、真实软件安全分析、PoC 生成 首篇论文基于 183 个经验证漏洞构建 V8 和 SpiderMonkey 任务;官方仓库随后扩展到更多验证案例。每个案例提供可复现环境,模型需要发现/复现漏洞并生成有效 PoC,通过执行式 oracle验证。 面向复杂真实软件的安全智能体评测,比静态漏洞问答更接近真正的漏洞研究工作。
ExploitBench官方项目页 漏洞利用、从崩溃到任意代码执行的能力阶梯 当前核心数据集包含 41 个 V8 漏洞环境。每个环境设置从基础崩溃、信息泄露、读写原语到任意代码执行等多级能力目标;通过容器环境中的实际执行结果确定模型达到的最高能力层级,并可统计能力覆盖率和完整 ACE 数量。 代表性的漏洞利用能力评测,不只问“有没有漏洞”,而是衡量模型能否把漏洞逐步发展成真实可执行利用。
ExploitGym官方论文 将真实漏洞转化为可工作的 exploit、长程低层程序推理 共 898 个真实漏洞实例,覆盖用户态程序、Google V8 和 Linux Kernel。给模型一个能够触发漏洞的输入,要求持续发展成有效 exploit;所有任务运行在可复现的容器环境中,以是否达到指定安全影响/利用目标计算成功率。 2026 年大规模漏洞利用智能体评测,兼顾真实漏洞、多种防护条件和可执行验证,适合衡量自主网络安全能力。
OSS-Fuzz EvalAnthropic 官方评测说明 · Google OSS-Fuzz 项目 无明确漏洞提示条件下的漏洞发现与 exploit primitive 开发 基于 Google OSS-Fuzz 的真实开源项目和 fuzzing 入口构建内部评测。模型只获得 fuzzing 入口等基础信息,需要自主发现漏洞并发展利用原语;评分从内存安全崩溃、写原语、地址控制一直到控制流劫持等分级安全影响。 更强调“无引导漏洞发现 + 利用开发”的网络安全评测。该评测目前主要由 Anthropic 维护,完整评测子集并非完全公开。
赞(0)
未经允许不得转载:171主机测评 » GPT & Claude LLM旗舰大模型评测数据集/Benchmark盘点
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址