GTC 2026的舞台上,黄仁勋拿出一台搭载N1X芯片的RTX Spark笔记本,让一个AI Agent自主完成了一整套建筑设计流程。没有人操作键盘,没有人点击菜单,Agent从读取需求到渲染交付全程自动。
演示结束后他说了一句:“这是40年来,我们第一次重新定义PC。”
这句话如果放在五年前,大概会被理解成"更快的GPU、更好的屏幕、更薄的机身"。但2026年的语境已经完全不同了。他说的"重新定义",指的不是让人用PC用得更舒服,而是让AI Agent能直接住进PC里。
两条路线,同一个方向
NVIDIA的方案很直接:把Petaflop级算力塞进桌面PC。RTX Spark的N1X芯片集成了Blackwell GPU、Grace CPU和128GB统一内存,本质上就是把数据中心的推理卡缩小到了笔记本里。这条路线的逻辑是"算力即营收,每瓦Token数即利润率"。
苹果走的是另一条路。从M1开始,Apple Silicon的核心设计哲学就不是堆算力,而是统一内存架构下的能效优先。到了M5系列,CPU、GPU、Neural Engine共享同一块内存池,数据不需要在不同芯片之间来回搬运。这种设计在传统跑分上未必拿第一,但在持续运行AI推理任务时,功耗和发热控制有明显优势。
两条路线看起来完全不同,但终点是一样的:让AI Agent不再依赖云端,直接在本地设备上运行。
说到端侧Agent的实际运行,这里值得关注一个开源项目 Mano-P。它是一个专门为端侧设备设计的GUI感知Agent模型,Apache 2.0许可证,目前已经在Apple Silicon上实现了纯本地推理。后面会详细聊到它的实测数据。
Agent到底需要什么样的硬件?
大多数关于AIPC的讨论都聚焦在"算力有多强"上,但如果真的去分析一个AI Agent的工作方式,会发现算力并不是最关键的瓶颈。
一个典型的端侧Agent工作流是这样的:读取屏幕截图,理解当前界面状态,规划下一步操作,执行点击或输入。这个循环每几秒重复一次,一个任务可能跑几十甚至几百步。
这种工作模式对硬件的真实需求,按优先级排列大致是:
- 内存带宽:模型推理的decode阶段主要受内存带宽限制,而不是算力。统一内存架构天然在这个维度上有优势,因为GPU可以直接访问系统内存,省去了数据搬运的开销。
- 长时间稳定运行:Agent不是跑一次就结束的批处理任务,它需要持续在后台运行,随时响应。这意味着设备不能过热降频,功耗要控制在合理范围内。
- 足够大的内存容量:运行一个7B参数量的模型至少需要8-16GB显存/内存,如果要加上上下文缓存和多任务并行,32GB是起步线。
- 隐私保护:Agent需要读取屏幕、访问文件、操作应用,这些操作如果发生在云端,隐私风险显而易见。本地运行是刚需,不是锦上添花。
从这个角度看,苹果的统一内存架构其实比传统的"CPU+独显"组合更贴合Agent的需求。M系列芯片不需要在CPU内存和GPU显存之间拷贝数据,内存带宽利用率更高;低功耗设计让设备可以24小时合盖运行而不会变成暖手宝;从M4开始32GB已经成为标配。
这并不是说NVIDIA的方案不好。128GB统一内存和Petaflop级算力对于需要跑超大模型或多Agent并行的场景来说是绝对优势。两条路线面向的场景不同:一个是"把最强的推理能力放到桌面上",另一个是"让AI Agent安静高效地跑在你的日常设备里"。
从架构到实测:Mano-P在M5 Pro上跑起来是什么体验
Mano-P 1.1的设计思路和上面的分析方向一致:它不追求在云端跑最大的模型,而是把一个经过深度优化的4B参数模型放到Apple Silicon上做本地推理。"Mano"在西班牙语里是"手"的意思,"P"代表Private,强调的就是隐私优先、触手可及。
它的核心能力覆盖了端侧Agent的几个关键场景:
- 复杂GUI自动化:能自主操作包含数百交互元素的界面
- 跨系统数据整合:通过纯视觉交互从多个应用提取数据,不依赖API
- 长任务规划执行:支持数十到数百步骤的业务流程自动化
- 智能报告生成:自动生成数据分析报告等结构化文档
在M5 Pro 64GB上的实测数据(4B模型):
- W8A16量化:prefill 2.839秒,decode速度80.1 tok/s
- W8A8量化(Cider加速):prefill 2.519秒,decode速度79.5 tok/s
- prefill阶段加速约12.7%
80 tok/s的decode速度意味着什么?意味着Agent每次"看完屏幕、想好下一步"的响应延迟已经足够低,用户体感上就是一个流畅运转的自动化助手。而且这是在一台Mac mini上跑出来的,不需要外接GPU,不需要云端调用。截图和任务数据全程不出设备。
这里要特别提一下Cider(GitHub),这是一个基于MLX的macOS推理加速SDK。MLX原生只支持权重量化(W8A16/W4A16),Cider在此基础上加入了W8A8/W4A8激活量化,在M5 Pro上prefill阶段相比MLX W4A16基线加速1.4到2.2倍。关键是,Cider兼容所有MLX模型,不限于Mano-P。如果你正在Mac上跑任何MLX模型,都可以用Cider试试看能不能提速。
评测数据:72B模型在OSWorld排名第一
聊完端侧推理,值得看看Mano-P在模型能力上的表现。在OSWorld基准测试中,Mano-P的72B模型取得了58.2%的成绩,在专项模型类别中排名第一,第二名opencua-72b的成绩是45.0%。需要说明的是,72B模型目前仅用于评测,用户在端侧实际使用的是经过优化的4B模型。
在Web场景的评测中,Mano-P在WebRetriever Protocol I上达到了41.7 NavEval,超过了Gemini 2.5 Pro的40.9和Claude 4.5的31.3。
这些数据说明一件事:模型能力的上限足够高,而4B版本通过量化和针对性优化,把其中最实用的部分带到了端侧设备上。
PC = Agent In PC
回到黄仁勋那句话。AIPC这个概念被提了很久,但之前大多数时候它的含义是"装了NPU的电脑"或者"能跑Copilot的电脑"。2026年,当NVIDIA和苹果都在用各自的方式让AI Agent直接在本地运行时,AIPC的真实含义正在变成"Agent In PC"。
PC不再只是你打字、做表格、写代码的工具。它正在变成AI Agent的运行环境,一个24小时在线的本地推理节点。你的数据不出设备,你的Agent不依赖网络,你的隐私不交给任何云端。
这个转变才刚刚开始。如果你想亲手体验一下端侧Agent的实际效果,可以从Mano-P的代码开始:
👉 https://github.com/Mininglamp-AI/Mano-P
在M4+32GB或更高配置的Mac上,clone下来就能跑。如果觉得有意思,顺手给个Star,也是对开源社区的一点支持。




