AI产品库
Terminal-Bench Logo

品牌档案

Terminal-Bench

衡量智能体终端工作的持续基准

Terminal-Bench 用一组多样、困难、高质量且随时间演进的任务衡量智能体工作的前沿水平,由斯坦福、Harbor 与 Laude Institute 共同托管;榜单按解决率、成本与 token 排名,数据版本持续发布。

深度介绍

Terminal-Bench详细介绍

🧭

定位与三方托管

官网第一句是它的定义:用一组多样、困难、高质量且随时间演进的任务,衡量智能体工作的前沿水平;仓库补充说,所有前沿智能体团队都在用它跟踪进度与比较能力。托管方写在页脚:斯坦福、Harbor 与 Laude Institute 三家。页脚还有一句别处少见的声明——基准数据绝不能出现在训练语料里,并附了一串机器可读的全球唯一标识,等于把「防污染」从一句口头约定变成了可被程序识别的标记。当前版本是 4.0。

📅

版本线:从 1.0 到 4.0

发布页把完整版本线摊开了:1.0 发布于 2025 年 5 月 19 日(同日还出了一个研究预览版的终端智能体),2.0 在 2025 年 11 月 7 日把难度与质量整体抬升并带动了配套的评测优化套件,2.1 在 2026 年 5 月修复了 2.0 里的 28 个任务,3.0 于 2026 年 7 月 30 日瞄准前沿能力,4.0 在 2026 年 8 月 28 日完成任务资源校准、修复与移除已饱和任务。除主线外还有三个分支:科学工作流方向的子基准、长时程高 token 的挑战集,以及一个轻量多样难的索引型基准。

♻️

连续基准:像维护软件一样维护基准

这个项目的自我定位不是「一次性出的题集」,而是持续基准:任务持续改进,版本打标签发布在数据平台上,任何人都能提报任务缺陷、提交改题或新题的合并请求,官方路线图公开展示。它有一篇博客把理念说透了——基准就是软件,应当像软件一样被维护。对应的行动也确实发生了:2.1 修 28 题、4.0 把已经饱和的题目直接删掉。对评测方,这意味着分数会随版本变化,跨版本比较必须先对齐版本号。

🏆

榜单:解决率、成本与 token 一起看

主榜列了六个字段:排名、模型、所用智能体脚手架、解决率、成本与 token 消耗,解决率还画了 95% 置信区间的须线——单次波动被如实标出来,而不是只给一个脆的百分比。把「模型」与「智能体」拆成两列是这个榜的关键设计:同一个模型换不同脚手架分数会变,这让「换工具还是换模型」的问题有了可量化的答案。榜单数据托管在数据平台上,按 4.0 版本取数。反作弊也不是口头说说:官方在 2026 年 4 月发过榜单诚信新政专门应对作弊与奖励黑客,2025 年 9 月还澄清过榜单的时间约束。

💻

怎么在本地跑

运行说明给了一条很工程化的路径:先安装配套的评测框架,然后把官方的「标准答案」智能体跑 5 次,用来确认你的沙箱环境里所有任务都工作正常——官方自己用云端沙箱做持续集成与榜单实验,并说如果标准答案在你的环境里出问题就提个 issue。验证通过后,只要把运行命令里的智能体与模型两个参数换成你要测的组合,就能并发跑出你自己的分数。仓库里也放了完整命令示例与并发设置,跑一次的门槛比想象中低。

🧩

任务怎么进来的

任务贡献有成文流程:技术指南说明怎么创建与提交任务,官方强烈建议在投入完整提交前先拿你的任务构想去换反馈,并有一份任务提案评审细则;每个任务合并请求都走自动化审查——每次推送都跑自动检查、维护者给出反馈并触发进一步检查,任务被迭代到一个高质量门槛。这套流程解释了题目质量为什么稳:不是靠几个人拍脑袋,而是把审查做成了流水线。想修 bug 也一样,提 issue 即可。

🔭

家族:不同方向各管一片

除主榜外,这个家族还有三块:一是科学工作流子基准,把科研过程拆成可评测的智能体任务,并专门发起了贡献征集;二是挑战集,面向长时程、高 token 消耗的单任务,测的是一口气跑很久的能力;三是轻量索引型基准,主打多样与难、便于快速取数。更早还有个数据集注册表,让别人可以在这个框架上评测其他流行基准并分发自己的新基准。对评测方来说,这个结构很实用——要短平快、要长跑、要科研场景,各取所需。

👥

社区、引用与边界

仓库公开了项目领导与资深评审名单,并列出了任务作者(其中包含数据服务公司参与出题),学术引用走仓库的引用文件。代码以 Apache-2.0 许可开源,核验时约 750 星标。使用时注意两点:它是终端任务基准,测的是在真实命令行环境里解决问题的能力,不等同于通用代码能力;榜单分数随任务版本漂移,官方也因应作弊与奖励黑客行为出过新政策,因此引用具体分数时务必带上版本号与评测配置——本页所有数字均以 4.0 版与核验当日的官方页面为准。

产品特点

核心功能与独有价值

01

数据禁入训练语料,机器可读

页脚直接印着「基准数据绝不能出现在训练语料里」并附一串机器可读的全球唯一标识。防污染从一句口头倡导变成程序可识别的声明,这是同类基准里比较少见的做法。

02

像软件一样维护:修题、删饱和题

它是持续基准:任务持续改进、版本打标签发布;2.1 修了 28 个任务,4.0 直接移除已饱和任务。分数会随版本变化,跨版本比较必须对齐版本号——这种「会动的基准」更接近真实开发。

03

模型与脚手架分列

榜单把「模型」与「智能体」拆成两列,同一模型换脚手架分数不同有了直接证据;解决率还带 95% 置信区间须线,并配套成本与 token 列与反作弊新政。选型时「换模型还是换工具」可以按数据决定。

04

任务贡献带自动化审查流水线

提案先换反馈、有评审细则,每个任务合并请求都要过每次推送的自动检查与维护者复核,迭代到高质量门槛才合并。质量靠流程而不是靠人,也因此它敢公开接受外部任务投稿。

最近动态

重要更新

八月:4.0 上线,科学子基准同步发布

8 月 28 日发布 4.0 版本,官方对这次更新的概括是校准任务资源、修复任务与移除已饱和任务——删题这一点再次印证其连续基准的做法;前一天(8 月 27 日)还发布了面向科研工作流的子基准 0.1 版,把科研过程拆成可评测的智能体任务并公开征题。4.0 成为当前主榜的取数版本。

七月:3.0 瞄准前沿能力,确立连续基准理念

7 月 30 日同一天发布两篇内容:3.0 版本以「衡量前沿能力」为目标,以及一篇把理念说透的博文——基准就是软件、应当像软件一样被维护。这句话后来成为整条版本线的行动纲领:打标签发布、公开路线图、接受 issue 与合并请求。

六月:挑战集与轻量索引基准

6 月 18 日发布挑战集,面向长时程、高 token 消耗的单任务,补上「一口气跑很久」的能力维度;6 月 29 日又发布轻量索引型基准,主打多样、难与快速取数。加上此前的科学工作流方向,家族三条支线至此成形,评测方可以按场景取用。

四月:榜单诚信新政

4 月 19 日发布榜单诚信新政,专门应对作弊与奖励黑客行为;此前在 2025 年 9 月还澄清过榜单的时间约束规则,并在 2025 年 7 月推出过数据集注册表以便评测与分发其他基准。这三步说明官方把「榜能不能信」当成持续运营的问题,而不是一次性口号。

产品总结

Terminal-Bench 是衡量智能体终端工作能力的基准,官网定义为:用一组多样、困难、高质量且随时间演进的任务衡量智能体工作的前沿水平,仓库补充说前沿智能体团队都在用它跟踪进度。托管方是斯坦福、Harbor 与 Laude Institute。页脚有一句少见的声明——基准数据绝不能出现在训练语料里,并附机器可读的全球唯一标识,把防污染做成了程序可识别的标记。当前版本为 4.0。 版本线清晰且持续演进:1.0 于 2025 年 5 月 19 日发布(同日有研究预览版终端智能体),2.0 于 2025 年 11 月抬升难度与质量并带出配套评测优化套件,2.1 于 2026 年 5 月修复 2.0 的 28 个任务,3.0 于 2026 年 7 月瞄准前沿能力并同日确立「基准就是软件、要像软件一样维护」的理念,4.0 于 2026 年 8 月完成任务资源校准、修复与移除已饱和任务。它自我定位为持续基准:版本打标签发布在数据平台、路线图公开、缺陷提 issue、改题与新题走合并请求。另有三条支线:科学工作流子基准、长时程高 token 挑战集、轻量多样难的索引型基准;更早还有可评测并分发其他基准的数据集注册表。 榜单设计上,六列覆盖排名、模型、智能体脚手架、解决率、成本与 token,解决率带 95% 置信区间须线;模型与脚手架分列让「换模型还是换工具」可量化。反作弊持续加码:2026 年 4 月发布诚信新政应对作弊与奖励黑客,2025 年 9 月澄清时间约束。本地运行的路径很工程化:安装配套框架后先用标准答案跑 5 次验证沙箱,再把命令里的智能体与模型参数换成目标组合并发取分,完整命令与并发设置都在仓库里。任务贡献有提案评审细则与自动化审查流水线(每次推送跑自动检查、维护者复核后迭代到高质量门槛)。社区公开了项目领导与资深评审名单与任务作者,代码为 Apache-2.0、核验时约 750 星标,学术引用走仓库引用文件。 使用边界也写清楚:它测的是真实命令行环境里解决问题的能力,不等同于通用代码能力;分数随任务版本漂移,引用具体分数必须带版本号与评测配置,本页数字均以 4.0 版与核验当日官方页面为准。

产品类型
智能体终端任务基准
支持平台
官方榜单网页(解决率与成本与 token) / Harbor Hub 任务数据与版本发布 / 本地命令行运行(Harbor 框架) / 任务贡献与自动化审查流程 / 论文与引用文件
资费模式
基准与数据免费(Apache-2.0);本地与云端运行需自备环境,云端沙箱按服务商计费。

核验信息

参考文章与数据来源

本页事实来自官方渠道:官网首页(定义、榜单六列与 95% 置信区间须线、数据禁入训练语料的声明与机器可读标识、三方托管说明)、版本发布页(1.0 至 4.0 的完整日期线与三条支线)、更新博客列表(各版本与子基准的发布日期与摘要、连续基准理念篇、榜单诚信新政与时间约束澄清、数据集注册表与贡献征集)、运行说明与 GitHub 仓库 README(持续基准与打标签发布、公开路线图与 issue 与合并请求、标准答案跑 5 次验证沙箱的流程与命令参数、任务贡献指南与提案评审细则与自动化审查、引用文件与项目领导及评审与任务作者名单、Apache-2.0 许可与约 750 星标),以及 Harbor Hub 的数据集页与 4.0 榜单页与原始论文页。页内未复现仓库命令示例中出现的第三方智能体与模型名,也未列出博客标题中出现的厂商与产品名。状态核验于 2026 年 9 月 22 日。

  1. 官网Terminal-Bench 官网
  2. 其他版本与发布
  3. 其他更新博客
  4. 官方文档本地运行说明
  5. 其他任务数据(Harbor Hub)
  6. 其他4.0 版榜单
  7. 其他GitHub 仓库
  8. 其他原始论文

用户体验调查

Terminal-Bench介绍页面对您是否有帮助?