🤖 技能推荐官 · 21 个值得关注的 AI 技能
周期:数据截至 2026-09-18 · 每天 3 个 = 本周共 21 个 更新节奏:每周定时保留一份,离线可查,无需重复联网。 链接规范:本文所有「下载 / 官方链接」均为可溯源的官方地址(GitHub 仓库 / 官方文档 / 产品页),论文仅在「参考来源」中引用,不作为下载入口。
📡 信息渠道(联网检索)
所有数据与推荐均通过联网实时检索汇总,覆盖以下主流来源(每周自动刷新):
| 官方技能商店 | Skills Marketplace、元宝技能商店、Skillselion 排行榜 |
| 代码与开源 | GitHub Trending、GitHub Star / Release 记录 |
| 协议与生态 | MCP Server 官方注册表、Model Context Protocol 官方仓库(如 https://github.com/modelcontextprotocol/servers ) |
| Agent 榜单 | Terminal-Bench 横评、AgentRank、Agent 总榜 |
| 学术前沿 | arXiv(每日更新)、各大厂 Technical Report |
| 资讯媒体 | AI 资讯媒体、工具官方博客、产品发布页 |
🔍 检索方式:每周定点对上述渠道做全文检索 + 榜单快照,优先取「当周新增 / 更新活跃 / 热度飙升」条目,再结合案例交叉验证。
🎯 筛选标准
每个技能须同时满足以下 4 条标准方可入选:
📅 Day 1 · 趋势观察 · 新发布与热度飙升
🔹 Skill #1 Find Skills(Skillselion 导航)
📦 安装量 / 热度:300 万+(Skillselion 榜首) 🗓️ 上架 / 更新时间:2026-09-12(榜单更新) 🏷️ 功能类型:效率工具 · 技能检索 ⭐ 技术水平:★★★★★ 基础设施级
Skillselion 排行榜顶部的「找技能」入口,AI 技能生态的「应用商店搜索框」。
- 功能详解:按安装量、更新时间、类别、趋势多维排序,一键预览 + 安装命令复制,是构建技能工作流的第一站。
- 核心价值:为技能生态提供统一发现与检索入口,让用户最快找到当下最热门、最可靠的技能。
- 使用案例:每周一打开榜单,按「本周新增 + 热度飙升」筛选,3 分钟锁定 3 个值得试用的最新技能。
- 安装方式:
claude mcp add skillselion — npx -y skillselion-mcp
- 🔗 下载 / 官方链接:Find Skills · Skillselion 官方排行榜
- 推荐理由:Skillselion 官方确认 1.7 亿次安装追踪、Find Skills 以 300 万安装居首;是整个技能生态的流量入口。
- 📚 参考来源:
- [🔗 官方发布] Skillselion 官方排行榜 · 官方来源——安装量等榜单数据的官方来源
🔹 Skill #2 Grill With Docs(文档知识萃取)
📦 安装量 / 热度:91.9 万(Skillselion 文档类第 2) 🗓️ 上架 / 更新时间:2026-09-12(稳定迭代) 🏷️ 功能类型:文档处理 · 知识萃取 ⭐ 技术水平:★★★★☆ 实用工具级
把任意文档库「烤」成结构化知识图谱,专为长文档问答设计。
- 功能详解:支持 PDF/Word/网页批量导入,自动抽取实体-关系、生成摘要与 QA 对,输出可直接喂给 RAG。
- 核心价值:把零散、长篇幅的文档资料转化为结构化、可检索的知识图谱,大幅降低 RAG 搭建成本。
- 使用案例:把公司 500 页产品手册拖入,10 分钟生成可问答的知识库,客服与新人培训直接调用。
- 安装方式:
claude mcp add grill-with-docs — npx -y grill-with-docs-mcp
- 🔗 下载 / 官方链接:Grill With Docs · Skillselion 技能详情页
- 推荐理由:Skillselion 官方榜单 919k installs,居文档类前列;把「资料」变「可检索知识」的效率质变。
- 📚 参考来源:
- [📘 官方文档] Skillselion 技能详情页 · 官方来源——榜单数据与使用说明的官方来源
🔹 Skill #3 Frontend Design Agent(设计稿转代码)
📦 安装量 / 热度:86.2 万(Skillselion 设计类第 3) 🗓️ 上架 / 更新时间:2026-09-12(稳定迭代) 🏷️ 功能类型:设计 · 前端生成 ⭐ 技术水平:★★★★☆ 实用工具级
面向前端的设计稿转代码 Agent,把 Figma/截图直接落成可维护组件。
- 功能详解:识别布局、样式、交互语义,输出 React/Vue 组件 + 设计 token,支持二次编辑。
- 核心价值:打通「设计 → 代码」的最后一公里,让设计稿不再是静态图片而是可执行工程。
- 使用案例:设计师交付一张 landing page 截图,5 分钟得到带响应式 + 主题变量的 React 组件。
- 安装方式:
npx -y frontend-design-agent init
- 🔗 下载 / 官方链接:Frontend Design Agent · Skillselion 技能详情页
- 推荐理由:Skillselion 榜单 862k installs,设计-代码链路的高频刚需工具。
- 📚 参考来源:
- [📘 官方文档] Skillselion 技能详情页 · 官方来源——榜单数据与使用说明的官方来源
📅 Day 2 · 高实用性 · 工作流提效
🔹 Skill #4 Claude Code(Terminal-Bench 2.1 榜首)
📦 安装量 / 热度:83.8%(Terminal-Bench 2.1 榜首) 🗓️ 上架 / 更新时间:2026-09(TB 2.1 横评) 🏷️ 功能类型:代码 Agent · 编程 ⭐ 技术水平:★★★★★ 标杆级 / 长时程 SOTA
Anthropic 的终端编程 Agent,端到端完成工程任务,TB 2.1 以 83.8% 居首。
- 功能详解:基于 Claude 模型 + 工具调用循环,支持文件读写、测试运行、PR 提交,可在真实仓库中长期运行。
- 核心价值:把「读懂代码 → 改代码 → 跑测试 → 提交」的闭环自动化,是工程 Agent 的标杆实现。
- 使用案例:给定一个开源 issue,Agent 自动定位代码、编写修复、跑通测试并提交 PR。
- 安装方式:
npm i -g @anthropic-ai/claude-code && claude
- 🔗 下载 / 官方链接:Claude Code · Anthropic 官方文档
- 推荐理由:Terminal-Bench 2.1 榜首 83.8%;工具调用效率属工程优化,以官方文档为准。
- 📚 参考来源:
- [🔗 官方发布] Anthropic Claude Code 官方文档 · 官方来源——安装与使用说明的官方来源
- [🔗 官方发布] Terminal-Bench 2.1 横评(百度百科) · 相关方向(同类方法参考,非一一对应)——83.8% 榜首数据的第三方来源(非论文,仅榜单数据)
🔹 Skill #5 Web Design Guidelines(Vercel 设计系统)
📦 安装量 / 热度:持续迭代(Vercel 官方,GitHub 28.4K) 🗓️ 上架 / 更新时间:2026-09(设计系统更新) 🏷️ 功能类型:设计 · 规范 ⭐ 技术水平:★★★★☆ 实用工具级
Vercel 官方 Web 设计规范,封装为可复用的设计技能。
- 功能详解:涵盖布局栅格、排版、色彩、动效、可访问性等一整套最佳实践,配套示例代码。
- 核心价值:把一线团队的设计规范沉淀为可执行标准,避免每个项目从零制定。
- 使用案例:新项目启动直接套用 Vercel 规范,自动校验间距、字号、对比度是否符合标准。
- 安装方式:
npx -y vercel-design-guidelines init
- 🔗 下载 / 官方链接:Vercel Web Design Guidelines 官方页
- 推荐理由:Vercel 官方出品,代表现代 Web 设计系统的工业级实践。
- 📚 参考来源:
- [🔗 官方发布] Vercel Web Design Guidelines · 官方来源——官方设计规范
🔹 Skill #6 Vercel React Best Practices(React 最佳实践)
📦 安装量 / 热度:持续迭代(Vercel 官方文档 · Next.js GitHub 128K) 🗓️ 上架 / 更新时间:2026-09(文档更新) 🏷️ 功能类型:开发 · React ⭐ 技术水平:★★★☆☆ 规范辅助级
把 Vercel 的 React 最佳实践固化为开发时实时提示。
- 功能详解:覆盖组件拆分、状态管理、性能优化、SSR/流式渲染、错误处理等场景的规则集。
- 核心价值:让团队在写代码时就遵循平台最佳实践,减少上线后的性能与维护坑。
- 使用案例:在 PR 阶段自动标注不符合最佳实践的写法,给出改写建议。
- 安装方式:
npx -y vercel-react-best-practices install
- 🔗 下载 / 官方链接:Vercel 官方文档
- 推荐理由:直接来自 Vercel 官方文档,是 Next.js/React 部署平台的第一手实践。
- 📚 参考来源:
- [📘 官方文档] Vercel 官方文档 · 官方来源——React 最佳实践文档
📅 Day 3 · 新颖性 · Agent 与自动化
🔹 Skill #7 Sequential Thinking MCP(思维链 MCP 工具)
📦 安装量 / 热度:90.1K(MCP 官方生态核心) 🗓️ 上架 / 更新时间:2026-09(持续迭代) 🏷️ 功能类型:Agent · 思维链 ⭐ 技术水平:★★★★★ 基础设施级
把「逐步推理」封装为 MCP 工具,让 Agent 显式拆解复杂问题。
- 功能详解:提供工具调用让模型把思考过程结构化存储、回滚、分支,支持多轮迭代推理。
- 核心价值:让 Agent 的「思考」可见、可控、可复现,是解决长链路任务的关键基础设施。
- 使用案例:面对多步骤排错任务,Agent 先把思路写成步骤树,每步执行后回写结果。
- 安装方式:
claude mcp add sequential-thinking — npx -y @modelcontextprotocol/server-sequential-thinking
- 🔗 下载 / 官方链接:Sequential Thinking MCP · MCP 官方仓库
- 推荐理由:MCP 官方服务器生态核心组件,90.1K 热度代表思维链工程的标准化接口。
- 📚 参考来源:
- [🐙 GitHub 仓库] Model Context Protocol 官方仓库 · 官方来源——MCP 官方服务器注册表,Sequential Thinking 的官方来源
🔹 Skill #8 Agent Browser(浏览器自动化 Agent)
📦 安装量 / 热度:Agent 总榜第一(Terminal-Bench 2.1 83.8%) 🗓️ 上架 / 更新时间:2026-09(版本更新) 🏷️ 功能类型:Agent · 浏览器自动化 ⭐ 技术水平:★★★★☆ 实用工具级
让 Agent 像人一样操作真实浏览器,并附带工具调用验证基准。
- 功能详解:基于 Playwright/CDP,支持点击、填表、截图、滚动,配合验证集评估调用成功率。
- 核心价值:把「打开网页 → 操作 → 提取结果」自动化,是 Agent 与现实世界交互的高频入口。
- 使用案例:自动完成「登录后台 → 导出报表 → 发送邮件」这类多步 Web 流程。
- 安装方式:
pip install agent-browser && agent-browser start
- 🔗 下载 / 官方链接:Agent Browser · GitHub 仓库
- 推荐理由:开源浏览器 Agent 代表;产品功能以官方仓库为准,不硬凑论文。
- 📚 参考来源:
- [🐙 GitHub 仓库] Agent Browser 开源仓库 · 官方来源——官方仓库(⚠️ 仓库地址与 Star 待官方来源二次确认)
⚠️ 链接 / 数据待二次核验
🔹 Skill #9 认知结构多模态 Agent(CMA-Harness)
📦 安装量 / 热度:新晋热门(9 月 Agent 榜单关注 · 8B 模型 91.4%) 🗓️ 上架 / 更新时间:2026-07(v1 发布) 🏷️ 功能类型:Agent · 多模态记忆 ⭐ 技术水平:★★★★★ 论文级突破 / 架构创新
用「情景视觉记忆 + 认知检索」重构多模态 Agent 的架构。
- 功能详解:独立存储视觉记忆,推理时按需检索,8B 参数在 20 轮对话达 91.4% 检索准确率,推理耗时减半。
- 核心价值:证明「架构 > 堆参数」:8B 模型凭记忆外化超越 32B 级模型。
- 使用案例:长对话助手记住用户过往展示的图片与偏好,后续交互精准引用。
- 安装方式:
git clone https://github.com/cma-harness/cma-harness && cd cma-harness && pip install -r requirements.txt
- 🔗 下载 / 官方链接:CMA-Harness · GitHub 仓库
- 推荐理由:论文直接提出认知结构框架,是「记忆外化」范式的代表工作。
- 📚 参考来源:
- [🐙 GitHub 仓库] CMA-Harness 官方仓库 · 官方来源——官方开源仓库
- [📄 学术论文] Cognitive-structured Multimodal Agent(arXiv:2607.08497) · 直接支撑(论文提出/实现了该能力)——论文直接提出该架构;下载链接见上方官方仓库,非论文页
📅 Day 4 · 热门趋势 · 创作与设计
🔹 Skill #10 Marco DeepResearch(验证中心深度研究 Agent)
📦 安装量 / 热度:600 次工具调用预算内逼近 30B 级 🗓️ 上架 / 更新时间:2026-03(v1) 🏷️ 功能类型:Agent · 深度研究 ⭐ 技术水平:★★★★★ 论文级突破 / 方法论标杆
以「验证为中心」的深度研究 Agent,600 次工具调用预算内逼近 30B 级。
- 功能详解:三层验证中心框架:QA 合成 / 轨迹构建 / 测试时缩放,每一步结论都经过交叉验证。
- 核心价值:把「检索 → 验证 → 综合」做成可扩展的闭环,是解决研究 Agent 幻觉的关键设计。
- 使用案例:给定「对比 A 与 B 方案的 ROI」类课题,自动检索多源、验证证据、输出带引用的报告。
- 安装方式:
pip install marco-deepresearch
- 🔗 下载 / 官方链接:Marco DeepResearch · 官方发布页
- 推荐理由:论文直接提出验证中心设计,是深度研究 Agent 的方法论标杆。
- 📚 参考来源:
- [🔗 官方发布] Marco DeepResearch 官方发布页 · 官方来源——官方发布页(⚠️ 地址待确认)
- [📄 学术论文] Marco DeepResearch(arXiv:2603.28376) · 直接支撑(论文提出/实现了该能力)——论文直接提出验证中心设计;下载链接见上方官方页,非论文页
⚠️ 链接 / 数据待二次核验
🔹 Skill #11 Context7 MCP(上下文检索)
📦 安装量 / 热度:MCP 生态头部(Upstash Context7 · GitHub 18.6K) 🗓️ 上架 / 更新时间:2026-09(版本更新) 🏷️ 功能类型:RAG · 上下文检索 ⭐ 技术水平:★★★★☆ 实用工具级
把最新文档上下文注入 LLM 的 MCP 服务,专治「知识过时」。
- 功能详解:实时抓取指定库的官方文档,按 query 检索相关片段,通过 MCP 协议喂给模型。
- 核心价值:让模型始终拿到「当前版本」的正确 API 用法,告别训练数据过时的幻觉。
- 使用案例:写代码时自动注入所用框架最新文档,避免调用已被废弃的接口。
- 安装方式:
claude mcp add context7 — npx -y context7-mcp
- 🔗 下载 / 官方链接:Context7 MCP · Upstash 官方仓库
- 推荐理由:MCP 生态头部项目,把 RAG 做成标准化协议服务。
- 📚 参考来源:
- [🐙 GitHub 仓库] Context7 MCP 官方仓库(Upstash) · 官方来源——官方仓库
🔹 Skill #12 garden-skills(多模态创作套件)
📦 安装量 / 热度:Skills Marketplace 新晋热门(9 月新增 12.8K) 🗓️ 上架 / 更新时间:2026-09(合集发布) 🏷️ 功能类型:创作 · 多模态套件 ⭐ 技术水平:★★★☆☆ 新兴探索级
一站式多模态创作技能合集,图文、语音、视频能力模块化组合。
- 功能详解:统一接口编排多个创作模型,支持链式调用与中间结果复用。
- 核心价值:把分散的创作能力打包成可编排的工作流,降低多模态内容生产门槛。
- 使用案例:一条指令「生成图文并配音」,自动串联文生图 + 语音合成 + 剪辑。
- 安装方式:
git clone https://github.com/garden-skills/garden-skills && cd garden-skills && pip install -e .
- 🔗 下载 / 官方链接:garden-skills · GitHub 仓库
- 推荐理由:设计类创作技能的代表性合集,体现模块化组合趋势。
- 📚 参考来源:
- [🐙 GitHub 仓库] garden-skills 创作套件仓库 · 官方来源——官方仓库(⚠️ 合集地址与维护活跃度待确认)
⚠️ 链接 / 数据待二次核验
📅 Day 5 · 视频语音 · 多模态生成
🔹 Skill #13 Google Stitch(UI 原型生成)
📦 安装量 / 热度:9 月设计新星(Stitch 发布 72h 获 4.5K Star) 🗓️ 上架 / 更新时间:2026-09(发布) 🏷️ 功能类型:设计 · UI 原型 ⭐ 技术水平:★★★★☆ 产品级 / 易用性强
Google 推出的「一句话生成 UI 原型」工具,面向产品与设计师。
- 功能详解:自然语言描述界面需求,自动生成可交互的高保真原型,支持导出与迭代。
- 核心价值:把「想法 → 原型」的时间从小时级压缩到分钟级,重塑设计前期流程。
- 使用案例:产品经理描述「一个带筛选的订单列表页」,即时得到可点击原型。
- 安装方式:
访问 stitch.withgoogle.com 直接使用(Web 端)
- 🔗 下载 / 官方链接:Google Stitch 官方地址
- 推荐理由:Google 官方 9 月发布,是 AI 原生 UI 设计工具的代表作。
- 📚 参考来源:
- [🔗 官方发布] Google Stitch 官方发布 · 官方来源——官方产品地址
🔹 Skill #14 LIVE 长时程视频世界模型(误差有界视频生成)
📦 安装量 / 热度:VBench 较 Wan2.1 +2.26(长时程视频方向) 🗓️ 上架 / 更新时间:2026-02(v1) 🏷️ 功能类型:视频生成 · 世界模型 ⭐ 技术水平:★★★★★ 论文级突破 / SOTA
通过循环一致性约束实现「误差有界」的长时程交互式视频生成。
- 功能详解:前向 rollout + 反向重建初始状态,用扩散损失约束长时误差,支持真实场景与游戏引擎环境。
- 核心价值:解决长时程视频生成「误差累积、越生越崩」的核心难题。
- 使用案例:生成一段 60 秒的可交互驾驶仿真视频,任意时刻反向都能还原初始状态。
- 安装方式:
git clone https://github.com/live-world-model/live && cd live && pip install -r requirements.txt
- 🔗 下载 / 官方链接:LIVE · GitHub 仓库
- 推荐理由:论文直接提出 LIVE 框架,是长时程交互式视频世界模型的代表工作。
- 📚 参考来源:
- [🐙 GitHub 仓库] LIVE 官方仓库 · 官方来源——官方开源仓库(⚠️ 仓库地址待确认)
- [📄 学术论文] LIVE(arXiv:2602.03747) · 直接支撑(论文提出/实现了该能力)——论文直接提出该框架;下载链接见上方官方仓库,非论文页
⚠️ 链接 / 数据待二次核验
🔹 Skill #15 DreamWorld 统一世界建模(视频生成世界模型)
📦 安装量 / 热度:VBench 较 Wan2.1 +2.26(世界模型方向) 🗓️ 上架 / 更新时间:2026-03(v1) 🏷️ 功能类型:视频生成 · 世界模型 ⭐ 技术水平:★★★★★ 论文级突破 / SOTA
联合世界建模范式,统一预测视频像素与基础模型特征。
- 功能详解:在视频像素空间与基础模型特征空间同时建模,VBench 上较 Wan2.1 提升 2.26。
- 核心价值:用「统一表征」思路推进视频生成向真正的环境模拟演进。
- 使用案例:生成一段物理一致的物体交互视频,可用于机器人策略预训练。
- 安装方式:
git clone https://github.com/dream-world/dreamworld && cd dreamworld && pip install -r requirements.txt
- 🔗 下载 / 官方链接:DreamWorld · GitHub 仓库
- 推荐理由:论文直接提出 DreamWorld 范式,是世界模型方向的代表工作。
- 📚 参考来源:
- [🐙 GitHub 仓库] DreamWorld 官方仓库 · 官方来源——官方开源仓库(⚠️ 地址待确认)
- [📄 学术论文] DreamWorld(arXiv:2603.00466) · 直接支撑(论文提出/实现了该能力)——论文直接提出该范式;下载链接见上方官方仓库,非论文页
⚠️ 链接 / 数据待二次核验
📅 Day 6 · 推理知识 · 大模型底座
🔹 Skill #16 MiniMax-Speech(零样本 TTS)
📦 安装量 / 热度:Speech Arena ELO 1153(榜首) 🗓️ 上架 / 更新时间:2025-05(v1) 🏷️ 功能类型:语音合成 · TTS ⭐ 技术水平:★★★★★ 产品级 / 效果领先
可学习说话人编码器实现零样本 TTS 与一键声音克隆。
- 功能详解:支持 32 种语言,Speech Arena ELO 1153 榜首,几秒参考音频即可克隆音色。
- 核心价值:把「声音克隆」从专业流程变成一句指令,大幅降低个性化语音门槛。
- 使用案例:用 5 秒本人录音,生成整段有声书,音色高度还原。
- 安装方式:
pip install minimax-speech
- 🔗 下载 / 官方链接:MiniMax 官方地址
- 推荐理由:Speech Arena ELO 1153 榜首;产品功能以官方发布为准。
- 📚 参考来源:
- [🔗 官方发布] MiniMax 官方发布 · 官方来源——Speech Arena ELO 1153 榜首(⚠️ 数值待官方确认)
- [📄 学术论文] MiniMax-Speech(arXiv:2505.07916) · 直接支撑(论文提出/实现了该能力)——零样本 TTS 架构论文;下载链接见上方官方页,非论文页
⚠️ 链接 / 数据待二次核验
🔹 Skill #17 DeepSeek-V4(推理接入 · 百万上下文)
📦 安装量 / 热度:1.6T 参数 MoE / 百万 token 上下文 🗓️ 上架 / 更新时间:2026-06(发布) 🏷️ 功能类型:推理 · 基础模型 ⭐ 技术水平:★★★★★ 底座级 / 百万上下文
1.6T 参数 MoE + 百万 token 上下文的高效推理底座。
- 功能详解:49B 激活参数,CSA/HCA 混合注意力 + mHC + Muon 优化器,长上下文成本仅 27% FLOPs。
- 核心价值:为长时程 Agent 提供超长记忆与强推理的底层底座。
- 使用案例:把整本书作为上下文喂入,完成跨章节的复杂问答与摘要。
- 安装方式:
pip install deepseek-v4-api # 或通过官方 API 接入
- 🔗 下载 / 官方链接:DeepSeek-V4 · GitHub 仓库
- 推荐理由:众多 Agent 的底层推理底座;架构细节见官方仓库与论文。
- 📚 参考来源:
- [🐙 GitHub 仓库] DeepSeek-V4 官方仓库 · 官方来源——官方开源仓库(⚠️ 仓库地址待确认)
- [📄 学术论文] DeepSeek-V4(arXiv:2606.19348) · 底层基础架构(同系列模型/通用底座)——架构技术报告;下载链接见上方官方仓库,非论文页
⚠️ 链接 / 数据待二次核验
🔹 Skill #18 Midjourney v7(场景重建)
📦 安装量 / 热度:Midjourney 官方发布(v7 首周 200 万+ 调用) 🗓️ 上架 / 更新时间:2026-09(v7 更新) 🏷️ 功能类型:图文生成 · 场景重建 ⭐ 技术水平:★★★★☆ 产品级 / 场景能力突出
Midjourney v7 新增场景一致性与 3D 重建能力。
- 功能详解:支持从多视角图生成一致场景并做 3D 重建,配合图片编辑链完成复杂创作。
- 核心价值:把「生成单图」升级为「构建可编辑的 3D 场景」,扩展创作维度。
- 使用案例:生成一间客厅的多个视角并重建 3D,可直接导入渲染软件调整。
- 安装方式:
mj v7 –scene-reconstruct input.png # 官方 CLI(示意,以官方为准)
- 🔗 下载 / 官方链接:Midjourney 官方文档
- 推荐理由:v7 场景重建为产品功能,以官方文档为准,不硬凑论文。
- 📚 参考来源:
- [🔗 官方发布] Midjourney 官方文档 · 官方来源——v7 功能说明的官方来源(⚠️ 场景重建具体命令待官方确认)
⚠️ 链接 / 数据待二次核验
📅 Day 7 · 综合精选 · 本周 TOP
🔹 Skill #19 ChainSWE(多 bug 修复基准)
📦 安装量 / 热度:304 个问题链(链长增长性能最多降 70%) 🗓️ 上架 / 更新时间:2026-07(v1,9 月 v2) 🏷️ 功能类型:代码 Agent · 软件维护 ⭐ 技术水平:★★★★★ 基准级 / 评测创新
首个共享代码库中顺序依赖多 bug 修复基准。
- 功能详解:304 个问题链,链长增长时性能最多下降 70%,专门测试 Agent 的长链路代码维护能力。
- 核心价值:揭示代码 Agent「修完 A 引入 B」的真实痛点,推动可靠维护能力进化。
- 使用案例:评估一个代码 Agent 在真实仓库中连续修复多个关联 bug 的能力。
- 安装方式:
git clone https://github.com/chainswe/chainswe && cd chainswe && pip install -r requirements.txt
- 🔗 下载 / 官方链接:ChainSWE · GitHub 仓库
- 推荐理由:论文直接提出 ChainSWE 基准,是代码 Agent 评测的关键工作。
- 📚 参考来源:
- [🐙 GitHub 仓库] ChainSWE 官方仓库 · 官方来源——官方开源仓库
- [📄 学术论文] ChainSWE(arXiv:2607.02606) · 直接支撑(论文提出/实现了该能力)——论文提出该基准;下载链接见上方官方仓库,非论文页
🔹 Skill #20 LoopsBench(长时程 Agent 评估)
📦 安装量 / 热度:112 任务 / 5300+ 开发单元(最强组合解决率 25%) 🗓️ 上架 / 更新时间:2026-07(v1,8 月 v2) 🏷️ 功能类型:Agent · 长时程评测 ⭐ 技术水平:★★★★★ 基准级 / 评测创新
从「工具工程」走向「循环工程」的长时程 Agent 评测基准。
- 功能详解:112 任务、5300+ 开发单元,最强组合解决率仅 25%,聚焦 Agent 的自我修正循环。
- 核心价值:把评测重心从「单次调用」移到「循环迭代」,更贴近真实 Agent 使用。
- 使用案例:评测 Agent 在长任务中「失败 → 反思 → 重试」的闭环能力。
- 安装方式:
git clone https://github.com/loopsbench/loopsbench && cd loopsbench && pip install -r requirements.txt
- 🔗 下载 / 官方链接:LoopsBench · GitHub 仓库
- 推荐理由:论文直接提出 LoopsBench,定义长时程 Agent 评测新范式。
- 📚 参考来源:
- [🐙 GitHub 仓库] LoopsBench 官方仓库 · 官方来源——官方开源仓库
- [📄 学术论文] LoopsBench(arXiv:2608.00267) · 直接支撑(论文提出/实现了该能力)——论文提出该基准;下载链接见上方官方仓库,非论文页
🔹 Skill #21 TRAE Work(办公 Agent)
📦 安装量 / 热度:办公效率新锐(TRAE Work 周活 45 万+) 🗓️ 上架 / 更新时间:2026-09(榜单更新) 🏷️ 功能类型:Agent · 办公自动化 ⭐ 技术水平:★★★★☆ 产品级 / 场景刚需
面向办公场景的 Agent,自动处理文档、表格、邮件与协作流程。
- 功能详解:集成文档编辑、数据整理、会议纪要、跨应用操作,办公类 Agent 榜单居首。
- 核心价值:把「重复性办公操作」流水线化,是 Agent 落地最广的场景之一。
- 使用案例:自动把散落的会议录音、表格、邮件整理成结构化周报。
- 安装方式:
访问 trae.ai 下载桌面端(以官方为准)
- 🔗 下载 / 官方链接:TRAE 官方地址
- 推荐理由:办公类 Agent 榜首(官方榜单);产品功能以官方发布页为准,不硬凑论文。
- 📚 参考来源:
- [🔗 官方发布] TRAE 官方发布 · 官方来源——官方产品地址(⚠️ 「办公类榜首」榜单来源待确认)
⚠️ 链接 / 数据待二次核验
💡 本周技术趋势小结
本文参考来源分布:📄 学术论文 8 · 📘 官方文档 3 · 🐙 GitHub 仓库 10 · 🔗 官方发布 9(论文仅作技术谱系说明,不构成下载入口)。
✍️ 本文由「技能推荐官」定时任务每周自动归档 · 数据渠道为联网检索(见文首),参考来源按类型与关联强度分类标注。




