欢迎光临
我们一直在努力

linghun 国产自研AI编程终端 在真实本地开发环境中完整跑完Terminal-Bench 2.1 官方 89 题 获得73.03%通过率

按 Terminal-Bench 2.1 当前公开 leaderboard 分数横向对比,这个单次分数约处在第 6 位;但这不是官方 leaderboard 已收录排名。由于时间和成本关系我就没有进行5次完整的跑全。我觉得在真实开发环境中的得到的这个通过率比为了跑分而去优化更实际,同样这也不是在企业级网关和专业实验室的跑分。

结果

项目数值
Agent / System Linghun
Model GPT-5.5
Dataset Terminal-Bench 2.1 (terminal-bench/terminal-bench-2-1)
范围 官方 89 题,每题 1 次
分数 65 / 89
通过率 73.03%
Commit f09f1319
Runtime Harbor 0.13.2
Endpoint profile responses
Inference level High
并发 3
Agent timeout multiplier 2.0
Verifier timeout multiplier 1.0

重要说明

这次运行发生在真实本地开发环境中,不是按照排行榜 k=5 规则准备的正式提交跑分。 Harbor 官方静态校验要求每题至少 5 次 trial、标准 timeout/resource 设置,以及完整 passing-trial trajectory。因此,这个单次结果应理解为真实环境工程压测,而不是已被官方排行榜接受的排名成绩。 有两个 trial 获得 passing reward,但在 final 后 agent 进程没有自然退出,为了让 batch runner 继续,进行了手动恢复:

  • install-windows-3.11
  • mailman

最后的重任务曾检查 CPU / 资源竞争。它们是在真实计算,不是 final 后挂住;这些任务没有被手动取消。

批次摘要

BatchCompletedPassFailErrored
1 10 8 2 0
2 10 7 3 1
3 10 5 5 0
4 10 9 1 1
5 10 9 1 1
6 10 8 2 1
7 10 9 1 0
8 10 5 3 2
9 9 5 4 2

失败分类

分类数量
Verifier failed 18
NonZeroAgentExitCodeError 5
RuntimeError 2
AgentTimeoutError 1

##这意味着什么

linghun不是套壳终端,也不是聊天终端,而是具有企业级生产力的AI终端。在Terminal-Bench 2.1专门用于评估 ‌AI 智能体(Agent)在真实命令行终端环境中执行复杂任务能力‌的基准测试框架升级版中,他也进入了第一梯队。不是靠我说linghun有多好,有多强,有实际的压测数据证明。

也证明linghun在白皮书中的设计和实现都是基于现实落地的,是基于底座互相咬合的成果。模型驱动底层,底层去约束模型,达到共建。

那么对于开发者来说能有效抑制模型幻觉的时候,这个生产力是恐怖的。提示词工程和loop工程,终将都化为工程化工作。

也代表国内开发者不是做不出cc或者codex的产品一样(当然细节方面还需要更深的打磨),我们能做出来,反而某些场景比他们更贴合国内开发者环境和场景。

当模型能工程化工作的时候,越强的模型linghun和开发者吃到的红利越多。

如何理解这个结果

这次结果的价值在于:它不是挑题,也不是演示任务,而是在真实本地环境中完整跑过 Terminal-Bench 2.1 官方 89 题,覆盖了长任务、服务类任务、QEMU、ML、二进制、构建和多语言任务。 它证明 Linghun 可以在真实开发环境里完成一次完整官方数据集压测,同时也暴露出后续进入官方排行榜需要继续收敛的工程点:

  • 支持干净的官方 k=5 运行模式;
  • leaderboard 运行使用标准 timeout/resource 设置;
  • 保留并上传完整 passing-trial trajectory;
  • 继续收紧 final 后进程清理。 在这里插入图片描述 在这里插入图片描述

项目地址和文档

GitHub: https://github.com/linghungegeg/Linghun 中文白皮书: https://github.com/linghungegeg/Linghun/blob/main/WHITEPAPER.md 英文 README: https://github.com/linghungegeg/Linghun/blob/main/README.en.md 许可证: Apache License 2.0

最后

欢迎大家体验、提 issue、提建议。

赞(0)
未经允许不得转载:171主机测评 » linghun 国产自研AI编程终端 在真实本地开发环境中完整跑完Terminal-Bench 2.1 官方 89 题 获得73.03%通过率
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址