在 AI 应用快速发展的今天,大多数智能体产品仍停留在"对话框 + 文本回复"的初级形态,用户难以对智能体的工作过程进行有效检查和干预。BuilderIO 推出的开源 TypeScript 框架 Agent-Native 试图从根本上解决这一问题——它不只是给智能体配一个网页壳子,而是重新定义了智能体应用的架构范式。
从对话窗到工作空间:Agent-Native 的设计哲学
传统智能体应用的设计思路通常是将 LLM 的对话能力嵌入到一个聊天界面中,用户通过自然语言描述需求,智能体给出文字回复或代码片段。这种模式的局限在于:工作过程对用户来说是一个黑盒,用户只能看到结果,无法中途介入、审核或调整。
Agent-Native 的核心理念正是打破这一限制。它强调智能体不应仅依赖文本框,而应通过专属 UI 展示上下文、工具、文件和预览,让用户可以检查、编辑、审批和共享智能体的工作成果 [original]。这意味着智能体不再是一个孤立的对话代理,而是成为了一个嵌入在丰富视觉环境中、可被用户深度参与的协作伙伴。
这一理念背后是对 AI 辅助工作方式的一个关键洞察:真正有价值的智能体应用,不是替代人类思考,而是将人类的判断力与机器的执行力相结合,形成一个人机协同的工作流。专属 UI 的存在,就是为了让人类的判断能够及时、准确地注入到工作流中。
Shared Actions:统一能力层的核心架构
Shared Actions(共享动作机制)是 Agent-Native 最核心的技术创新之一。在这一架构中,每个业务动作只定义一次为 action,智能体可以作为工具调用它,UI 也可以作为代码来调用它,两者共享相同的验证、权限和实现逻辑 [original]。
这一设计解决了以往智能体应用中普遍存在的"双重实现"问题。在传统架构下,开发者往往需要分别实现智能体可调用工具和前端可操作组件,两个版本容易出现逻辑不一致、权限不同步等问题。Shared Actions 从根源上消除了这一隐患——无论是由智能体发起调用还是由前端代码发起调用,执行的都是同一份逻辑。
更关键的一点是:智能体不通过点击 UI 来操作界面,而是通过同一 action 层工作 [original]。这意味着智能体不是一个需要操控浏览器的机器人,而是一个与前端组件处于同一抽象层次的智能体工具。这种设计带来了几个重要优势:
- 结果一致性:智能体和 UI 调用同一 action,保证了无论从哪个入口触发,最终产生的数据状态是完全一致的。
- 单一事实源:验证逻辑、权限检查、错误处理都集中在 action 定义处,维护成本大幅降低。
- 可组合性:action 可以被智能体自由组合调用,也可以被前端按需调用,形成灵活的工作流编排。
统一多通道暴露:一个 Action,多种消费方式
Agent-Native 在能力暴露层面实现了高度的统一。一个 action 可以同时暴露给以下多种通道:
- 智能体工具:LLM 通过 function calling 机制调用,执行具体任务。
- React Hooks:前端组件通过类型安全的 Hook 直接调用,获得响应式更新。
- HTTP API:支持 REST 或 GraphQL 接口,方便外部系统集成。
- MCP(Model Context Protocol):通过标准化协议暴露能力,可被其他 MCP 兼容的智能体发现和使用。
- A2A(Agent-to-Agent)协议:支持智能体之间的直接通信和能力调用。
- CLI:命令行调用能力,便于脚本化和自动化。
这一设计让同一个业务能力可以在不同场景中无缝切换使用方式。例如,一个"创建演示文稿"的 action,智能体可以通过 LLM function calling 自动调用,前端用户可以通过 UI 按钮触发,运维人员可以通过 CLI 脚本批量执行,其他智能体也可以通过 MCP/A2A 协议调用它。所有通道共享同一套实现,任何一处修改都会在所有通道中立即生效。
内置功能模块:开箱即用的智能体基础设施
Agent-Native 不仅提供了能力层的设计模式,还内置了一套完整的智能体应用基础设施:
- 智能体对话:内置对话管理组件,支持多轮对话和历史记录。
- 认证与权限控制:用户身份验证和细粒度权限管理,确保智能体操作的安全边界。
- 技能与记忆系统:智能体可以通过技能(Skills)扩展能力,通过记忆(Memory)保持上下文连续性。
- 自动化调度:支持定时任务和事件驱动的自动化工作流。
- 智能体团队协作:多个智能体可以协同完成复杂任务。
- 数据库支持:生产环境使用 PostgreSQL,本地开发环境使用 PGlite(浏览器内运行的 SQLite),两者共享同一套 schema 和迁移方案。
框架提供的数据库方案尤其值得注意。PGlite 是 Emscripten 编译的 SQLite 运行于浏览器中,使得开发者可以在本地开发时使用零配置的嵌入式数据库,而部署时无缝切换到 PostgreSQL 生产数据库,无需编写任何适配代码。
开箱即用模板:覆盖常见智能体场景
Agent-Native 提供了多种预建智能体模板,帮助开发者快速上手:
| 模板 | 用途 | 说明 ||——|——|——|| Clips | 会议录制理解 | 自动解析会议视频内容,生成摘要和待办事项 || Design | 交互设计生成 | 根据需求生成 UI 设计方案和原型 || Slides | 品牌演示文稿 | 自动生成符合品牌规范的演示文稿 || Analytics | 数据问答仪表盘 | 自然语言查询数据,生成可视化图表 || Calendar | 日程管理 | 智能整理和推荐日程安排 || Mail | 邮件处理 | 自动分类、摘要和回复邮件 |
这些模板不仅展示了各种智能体应用的典型形态,也为开发者提供了可直接参考的架构模式。
快速启动:从零到第一个智能体应用
Agent-Native 提供了极简的项目初始化体验。通过一条 npx 命令即可创建完整的项目:
npx create-agent-native-app my-agent
框架支持 standalone 模式(完整的 Web 应用)和 chat 模板(轻量级对话界面),开发者可以根据需求选择合适的启动方式。官方入门指南提供了详细的配置说明,帮助用户在几分钟内运行第一个智能体应用。
设计启示与思考
Agent-Native 的架构思想为智能体应用开发带来了几点重要的启示:
首先,智能体应用的本质不是"对话",而是"工作协作"。将智能体定位为工作协作者而非聊天机器人,意味着我们需要为它构建 richer 的交互界面,让用户能够理解和干预工作过程。
其次,能力层的一致性是系统可靠性的基石。通过 Shared Actions 让智能体和前端共享同一套能力实现,从根本上消除了逻辑分歧的可能性。
最后,统一的多通道暴露策略为智能体的集成和复用打开了大门。当一个 action 可以被 MCP、A2A、HTTP API 等多种协议访问时,它就从一个应用的内部实现变成了可复用的能力单元,为更大规模的智能体生态奠定了基础。
小结
Agent-Native 代表了一种更为成熟的智能体应用开发思路:不再将智能体视为孤立的对话代理,而是将其嵌入到带有丰富 UI 的工作流中,通过 Shared Actions 统一能力层,通过多通道暴露实现灵活集成。对于正在探索智能体应用开发的团队而言,这一框架提供了一个既具前瞻性又切实可用的参考实现。




