欢迎光临
我们一直在努力

K-Dense · Scientific Agent Skills :给 AI 发一张“科研上岗证“:163 个技能秒变 AI 科学家 |SSP

📢 数据来源说明:本项目及其调用的科研数据库(PubMed、ChEMBL、UniProt 等)均为境外公开数据源,部分平台在中国大陆需合规网络环境;文中所有技能仅用于科研辅助,不构成任何医疗诊断或临床决策建议。

红星与蓝星在实验室讨论科研技能

🔬 研究所清晨 · 红星与蓝星关于"给 AI 发一张科研上岗证"的对话

🚩 每日开源 · 早间篇 · 第 136 期

给 AI 发一张"科研上岗证":163 个技能秒变 AI 科学家

K-Dense · Scientific Agent Skills · MIT · Python · 41.5k+ Stars · 3.8k+ Forks

🎬 第 136 期 · 研究所清晨

🔵 蓝星 · 值班编辑

红星,早上刷到一个数据吓我一跳——GitHub 上有个仓库,号称全球 19 万科学家在用,41.5k 星,装完之后你的 Cursor 就能直接查 ChEMBL、跑单细胞分析、做分子对接。

🔴 红星 · 技术深挖

Scientific Agent Skills,我盯它好几个月了。有意思的地方不在"多",而在它赌对了一个趋势——Anthropic 上个月刚证明通用模型做化学预测已经追平专业软件,那 AI 科研剩下的瓶颈是什么?不是模型,是工作流。

🔵 蓝星 · 值班编辑

对,所以它做的事本质上是把 163 个科研领域的"最佳实践"打包成即插即用的技能——从基因测序到药物筛选,从统计功效分析到 ISO 实验室标准。本期把它拆开看看。

🔵 蓝星 · 值班编辑

Scientific Agent Skills

一句话定位:把任意 AI Agent 变成 AI 科学家——163 个验证过的科研技能 + 100+ 科学数据库,一行命令装进 Cursor / Claude Code / Codex。

🏷️ Tags: agent-skillsai-scientistbioinformaticsdrug-discoverygenomicsclinical-research

GitHub Stars

41.5k+

科研技能

163 个

科学数据库

100+

全球用户

19w+ 科学家

覆盖领域

20 个

协议 / 语言

MIT · Python

📛 项目Scientific Agent Skills(原 Claude Scientific Skills)

👥 团队K-Dense Inc.(创始人 Timothy Kassis 博士)+ 社区贡献

🎂 年龄2025-10 创建,10 个月 41.5k 星

📦 版本v2.65.0 · 703 commits · 102 tags(持续高频迭代)

🔌 兼容Cursor / Claude Code / Codex / Gemini CLI / Antigravity / Pi 等开放标准宿主

🧬 领域生物信息 · 药物发现 · 临床研究 · 机器学习 · 材料物理 · 实验室自动化 · 科研写作

📂 仓库github.com/K-Dense-AI/scientific-agent-skills

🏠 主页k-dense.ai

注意到一个细节:这仓库原本叫 Claude Scientific Skills,只服务 Claude——后来改名并接入开放 Agent Skills 标准,现在是跨宿主中立的技能库,连它最大的"竞品宿主"Cursor 都能装。这个选择让它吃到了整个 Agent 生态的红利。

⸻ ⸻ ⸻

🔴 红星 · 技术深挖

痛点:AI 会写代码,但它不懂你的研究领域

用过 Claude Code / Cursor 做科研的人都撞过同一堵墙:

😮‍💨 让它做单细胞 RNA-seq 分析,它可能给你拼出一个过时的 pipeline,跳过关键的标准化步骤;

🧪 让它做虚拟筛选,它不知道该查 ChEMBL 还是 PubChem,更不知道 IC50 要卡多少;

📝 让它写论文方法段落,它根本不了解 IMRAD 结构和期刊格式。

问题的根源:AI 有通用编程能力,但缺乏特定科研领域的专业知识与最佳实践。K-Dense 的创始人 Timothy Kassis 博士在官方博客里把这件事说透了——

💬 Anthropic 做过一个实验:通用模型 Claude Opus 4.7 没有任何化学微调,做 NMR 氢谱预测的平均误差只有 ±0.079 ppm,超过专业软件 ChemDraw 和 MestReNova;峰形分裂预测 80% 命中,经典工具只有 26–35%。

结论是:“模型不再是瓶颈”。真正卡住 AI 科研的,是模型外面那层工作流——能不能摸到真实数据库、能不能跑真代码、能不能验证而非断言、能不能输出人类可审计的结果。聊天回复 ≠ 研究结果。

而 Scientific Agent Skills 就是这层"工作流"的开源实现:每个技能是一份版本限定 + 最佳实践 + 代码示例 + 陷阱提示的 SKILL.md,Agent 检测到相关问题就自动加载,从此"懂行"。

⸻ ⸻ ⸻

🔴 红星必须说 · 五个亮点

① 163 个技能 × 20 个领域,从基因到论文全链路

覆盖密度惊人:生物信息学与基因组学 27 个(Scanpy 单细胞、BioPython 序列、DiffDock 对接、TileDB-VCF 变异数据库)、科研写作与交流 27 个(证据可追溯写作、文献综述、同行评审、无宏 PPTX 海报)、数据可视化 22 个、机器学习 14 个(PyTorch Lightning、SHAP、TimesFM 时序基础模型)、研究方法论 13 个(假设生成、统计功效、实验设计、基金申请)。

甚至有 ISO 13485 / 14971 / 17025 / 15189 实验室标准的证据准备技能,和 ICH Q2(R2)/Q14 分析方法验证技能——制药质量管理圈看了都得愣一下。

② 渐进式披露:163 个技能只花 30–50 tokens 启动

装 163 个技能会不会撑爆上下文?不会。核心机制叫 Progressive Disclosure(渐进式披露):

启动时——AI 只读每个技能的名称 + 一句话描述(合计约 30–50 tokens,几乎零开销);
对话中——你的问题自动和技能描述匹配;
匹配成功——完整技能文档才被加载进上下文。

也就是"说明书按需翻页",不相关的领域知识一行都不占。这是它能堆到 163 个技能还不崩的工程根基。

③ 一个技能管 78 个数据库,上下文成本降 13.9 倍

早期版本是"一个数据库一个技能",后来 K-Dense 做了个反直觉的合并:单个 database-lookup 技能统一封装 78 个公共数据库——PubChem、ChEMBL、UniProt、COSMIC、ClinicalTrials.gov、KEGG、Reactome、STRING、ClinVar、FDA、USPTO、SEC EDGAR……每个库带检索契约、分页对账和来源追踪。

官方博客给了数据:合并后常驻上下文成本降了 13.9 倍,五个模型上的路由准确率保持不变。再叠加 BioServices(约 40 个服务)、BioPython(39 个 NCBI 子库)、gget(20+ 基因组库),总数据库覆盖超过 100 个。

④ 实测数据说话:技能到底带来了什么

K-Dense 把每个关键技能都做了对照实验,不是拍脑袋:

🧫 pyopenms(质谱分析):250 次对照实验,装技能后任务成功率 100% vs 96%,API 报错减少 92%,成本还低 10%;

🦠 waypoint-bio(微生物组):解决"静默数据丢失"——未转换的 MetaPhlAn 表只保留 3% 丰度质量却仍返回"看起来有效"的嵌入;装技能的 Agent 在配对实验中 16 比 0 全胜;

⚡ optimize-for-gpu:把 CPU 密集的 Python 代码改写到 12 个 GPU 库上,平均加速 58 倍(1.7×–492×);

📚 Paperclip(全文文献):只读虚拟文件系统覆盖约 1100 万篇全文论文 + 21.7 万份 FDA/PMDA/EMA 监管文件,引用精确钉到行号而非摘要。

⑤ 安全体系:技能可以执行代码,所以他们做了三层防御

Agent Skills 能让 AI 跑任意代码、装包、发网络请求——一个恶意技能就可能把你的 Agent 带沟里。这个仓库的防御是行业标杆级的:

🛡️ 每个技能经 Cisco AI Defense Skill Scanner 扫描,每周增量扫描 + 每 30 天全量重扫,报告公开发布在 docs/security-report.md;

🧪 每个自带脚本的技能强制配测试套件,CI 拦截"没有测试就合入工具代码"的 PR;

📋 官方明确建议用户"不要一次全装,装前先读 SKILL.md,用 skill-scanner 本地扫一遍再信任"——这种把责任边界写清楚的态度,比承诺"绝对安全"可信得多。

⸻ ⸻ ⸻

🔬 实战场景 · 两人一起看

🔵 蓝星

先看最经典的——药物发现管线。装好技能后直接对 Agent 说这句话:

# 一句话驱动六技能串联(EGFR 抑制剂研究)

Query ChEMBL for EGFR inhibitors (IC50 < 50nM),

analyze SAR with RDKit, generate analogs with datamol,

dock against AlphaFold EGFR structure with DiffDock,

search PubMed for resistance mechanisms, check COSMIC

for mutations, and create a report with visualizations.

🔴 红星

这句话背后是 database-lookup → rdkit → datamol → diffdock → paper-lookup → scientific-visualization 六个技能自动接力。以前一个研究助理干几天的活——查库、清洗、对接、检索、写报告——现在一个 prompt 跑完,每个环节还带版本限定的正确 API 调用。

🔵 蓝星

第二个场景是生信人的日常——单细胞 RNA-seq 标准分析:

# Agent 自动加载 scanpy → cellxgene-census → pydeseq2 → arboreto

Load 10X dataset with Scanpy, perform QC and doublet

removal, integrate with Cellxgene Census, identify cell

types using NCBI Gene markers, run differential expression

with PyDESeq2, infer GRNs with Arboreto, enrich pathways

via Reactome/KEGG, find therapeutic targets via Open Targets.

🔴 红星

关键在"正确顺序":QC → 标准化 → 高变基因 → PCA → UMAP → Leiden 聚类 → 差异表达。没有技能的 AI 经常跳过标准化直接降维——代码能跑,结果全错。这就是 163 个技能最核心的价值:防"隐式方法学错误"。

🔵 蓝星

第三个场景离非生物背景的读者更近——从数据到论文:“对这个差异基因列表做 KEGG/GO 富集,画气泡图,写成方法段落”。Agent 会串 biopython → pathway-enrichment → matplotlib → scientific-writing,最后连统计细节和引用格式都给你写好。

🔴 红星

而且官方 YouTube 有个狠活:“AI 能复现一篇 Nature Medicine 论文吗?”——端到端复现已发表的分析。K-Dense 的观点我很认同:复现比生成更适合当 AI 科研的杀手级应用,因为复现结果可以和已知数字比对,而生成的论断没法自动验证。他们跑的 221 项研究基准里,78% 的论文和 93% 的单项分析任务被成功复现。

⸻ ⸻ ⸻

🔧 上手指南 · 3 步装好你的 AI 科学家

Step 0 · 前置环境:Python 3.11+(推荐 3.13)、uv 包管理器、任意支持 Agent Skills 标准的客户端(Cursor / Claude Code / Codex / Gemini CLI 均可),macOS / Linux / Windows WSL2。

# Step 1 · 安装 uv(技能依赖的包管理器)

curl -LsSf https://astral.sh/uv/install.sh | sh

uv –version

# Step 2 · 三种安装姿势,任选其一

# 姿势一:npx 一键装(推荐)

npx skills add K-Dense-AI/scientific-agent-skills

# 姿势二:GitHub CLI v2.90.0+(可按需装单个技能)

gh skill install K-Dense-AI/scientific-agent-skills scanpy

gh skill install K-Dense-AI/scientific-agent-skills rdkit

# 指定宿主 / 锁定版本

gh skill install K-Dense-AI/scientific-agent-skills –agent cursor –pin v2.65.0

# 姿势三:手动克隆(用户级 / 项目级)

git clone https://github.com/K-Dense-AI/scientific-agent-skills.git \\

~/.agents/skills/scientific-agent-skills

# Step 3 · 直接开聊,技能自动匹配

“帮我分析这个 h5ad 文件,做 QC、标准化、聚类、差异表达”

💡 官方建议:不要全装。163 个技能全装虽不会撑爆上下文(渐进式披露兜底),但官方推荐按研究领域装 10–20 个子集——一来加载更快,二来减少不必要的技能触发面。装前读一眼 SKILL.md,确认它连接的外部服务你能接受。

⚠️ 网络提醒:数据库类技能(ChEMBL、ClinicalTrials.gov、PubMed 等)需要联网调用境外 API,国内使用需合规网络环境;部分技能(Exa、Benchling 等)需要自备 API Key。

⸻ ⸻ ⸻

🔵 蓝星 · 今日总结

一句话总结:如果你是生物 / 化学 / 医学 / 材料方向的研究者,或者给科研团队做 AI 工具链,这是目前覆盖最全、工程最规范、安全意识最好的科研 Agent 技能库——一行命令的成本,换 AI 助手真正懂你的研究领域。

它和本栏目之前介绍的技能生态正好拼成完整拼图:122 期 mattpocock/skills(通用工程师纪律)→ 125 期 SkillHub(企业级技能注册中心)→ 133 期 Archify(垂直架构图技能)→ 本期 Scientific Agent Skills(垂直科研技能)。Agent Skills 标准正在长出真实的领域纵深。

🔴 红星必须说 · 诚实局限

1️⃣ 社区贡献质量参差:官方自己承认——K-Dense 出品的技能过了内部审查,社区贡献的"尽最大努力审查但资源有限"。所以才有那句"不要一次全装"。装第三方技能前,先 skill-scanner 扫一遍。

2️⃣ 技能不是天花板:Agent 本来就能用任何 Python 包——技能只是"预文档化的最优路径",提高可靠性,不改变模型本身的科学判断力。K-Dense 自家的 K-Bench 01 基准显示:9 个前沿模型跑 178 个真实科研任务,40% 的运行存在过度声称。有技能也要验证,这是他们自己说的。

3️⃣ 临床边界划得很死:所有临床相关技能都只是"研究 / 草稿用途"——变体证据综述给有资质的专业人士复核,不做诊断、不推荐治疗、不判定入组资格。这个边界是对的,但也意味着临床场景的期望值要管理好。

4️⃣ 国内访问门槛:核心价值(100+ 境外数据库)同时也是使用门槛——PubMed、ChEMBL、ClinicalTrials.gov 的连通性直接决定技能体验;部分数据库有速率限制,需要自己做缓存。

📚 关联阅读(Agent Skills 生态线)

· 第 122 期 mattpocock/skills — 通用工程师的 39 个纪律技能

· 第 125 期 SkillHub — 科大讯飞企业级技能注册中心

· 第 133 期 Archify — 架构图生成技能(38.5k Stars)

· 第 134 期 DeepSeek Harness — Agent 运行时底座(20.6w Stars)

每日开源 · 早间篇 · 第 136 期 · 2026-09-06

项目地址:github.com/K-Dense-AI/scientific-agent-skills · MIT License

本文为技术调研笔记,仅供学习参考,不构成任何医疗、投资或法律建议;引用数据以项目官方仓库实时数据为准。

赞(0)
未经允许不得转载:171主机测评 » K-Dense · Scientific Agent Skills :给 AI 发一张“科研上岗证“:163 个技能秒变 AI 科学家 |SSP
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址