AI 前沿资讯周报 · 2026 年第 34 周
-
- 本周核心判断
- 一、AI Coding
-
- 1. [官方发布] DeepSeek V4 Pro 正式版(0813)上线,8/17 启动峰谷定价
- 2. [官方发布] Qwen3.8-Max 开源权重落地:2.4T 旗舰首度开放,采用收入分成 License
- 3. [官方发布] 智谱发布 GLM-5.3:7430 亿参数,后训练 +50%,补齐网络安全能力
- 4. [官方发布] xAI 发布 Grok 4.6:面向 long-running agents,AA Index 61 追平 GPT-5.6 Sol
- 5. [官方发布] 微软首发自研推理模型 MAI-Thinking-1,强化"去 OpenAI 依赖"
- 二、AI Agent / 安全
-
- 6. [官方发布] OpenAI 推出 GPT-5.6-Cyber 与 Daybreak Red:95% 高级网络任务完成率,发现 Chrome V8 零日漏洞
- 7. [行业新闻] Manus 恢复独立运营、与 Meta 分拆,部分用户数据将删除
- 三、具身智能
-
- 8. [官方发布] 宇树科技 8/19 科创板上市在即:A 股"人形机器人第一股"
- 9. [行业新闻] SAG 2026 H1 报告:全球人形机器人出货 1.91 万台,智元反超宇树
- 四、arXiv 论文快筛
-
- 10. [学术前沿] G0.5:推理与动作统一于单一自回归流
- 11. [学术前沿] StellaVLA:测试时检索单条结构化演示实现跨场景泛化
- 12. [学术前沿] RIFT:世界-动作模型无需 rollout 即可"想象"未来
- 13. [学术前沿] ForeWAM:不解码未来视频即为动作头提供动态上下文
- 14. [学术前沿] FACT:让失败动作也成为训练目标,缓解成功偏置幻觉
- 五、快速扫描
- 六、本周观察
-
- 开源/国产旗舰"同一周阅兵",API 定价转向峰谷分层
- 安全治理进入"实操":同一周内"放行"与"叫停"并存
- 具身智能:从"估值锚"到"出货量锚 + 资本锚"双锚定
窗口: 2026-08-10 00:00 → 2026-08-16 23:59(UTC+8) 方向: AI Coding · AI Agent · 具身智能 信源: P0 官方一手 + P1 高信噪媒体 + P2 国际对照锚点
本周核心判断
本周呈现三条清晰主线:
一、AI Coding
1. [官方发布] DeepSeek V4 Pro 正式版(0813)上线,8/17 启动峰谷定价
时间: 2026-08-12 深夜上线,8-13 公告一波三折,8-17 调价生效 标签: [官方发布] [产品更新] [行业新闻]
DeepSeek 在 API 文档中悄然将 deepseek-v4-pro 切换至 DeepSeek-V4-Pro-0813,随后官网公告一度撤回、当晚重新官宣全线上线。关键事实:
- 架构不变,后训练跃迁: 总参数 1.6T MoE、激活约 490 亿、1M 上下文、最高 384K 输出;与预览版相比仅强化后训练与 Agent 能力。
- 官方基准(多家媒体交叉核验): Terminal-Bench 2.1 得 87.9(距 Claude Fable 5 的 88.0 仅差 0.1);DeepSWE 从 12.8 飙升至 62.7(高于 Opus 4.8 的 58.0);DSBench-Hard 翻倍至 67.2;Cybergym 83.3 反超同档。LiveCodeBench 93.5。
- 第三方评测: Artificial Analysis 智能指数 53 分,高于 V4-Flash 的 40–50 分,但低于 Fable 5(62)、Grok 4.6(61)、Kimi K3(60),与 GLM-5.2 同档。
- 峰谷定价(8-17 00:00 生效): 高峰时段(9–12、14–18 点)V4 Pro 输出 27 元/百万 token(涨 350%)、输入未命中 9 元(涨 200%)、缓存命中 0.30 元(涨 1100%);空闲时段价格为高峰一半。V4-Flash 高峰输出 9 元、空闲 4.5 元。
- 波折与争议: 上线首日社区实测出现"思考时间不足十秒、长流程任务提前收尾",8-13 白天公告一度撤回;官方未就配置调整作说明。同期 DeepSeek 注册"DeepSeek Harness 团队"公众号,对标 Claude Code 的自主执行框架即将发布。
来源: 腾讯新闻 · 中新经纬/QQ 新闻 · 新浪/模型得分分析 · 新浪/性价比分析
2. [官方发布] Qwen3.8-Max 开源权重落地:2.4T 旗舰首度开放,采用收入分成 License
时间: 2026-08-12 夜(HuggingFace / ModelScope 同步开放) 标签: [官方发布] [开源权重] [产品更新]
阿里巴巴 Qwen 团队在魔搭社区与 Hugging Face 同步开放 Qwen3.8-2.4T-A95B 权重,这是 Qwen-Max 级别旗舰首次开放权重。关键事实:
- 规格: 稀疏 MoE,总参数 2.4 万亿、每 token 激活 95B;原生 1M 上下文(991K 最大输入 / 131K 最大输出);原生多模态(文本、图像、视频同调用)。
- 开源意义: 此前 Qwen-Max/3.6-Max/3.7-Max 均为托管闭源,本次打破惯例。社区用 Unsloth 动态量化可将 4.9TB 原始权重压至约 397GB 本地运行;配套 Qwen3.8-27B 可在 17GB 显存本地部署。
- License: 采用类似 Kimi K3 的收入分成条款——企业可下载、微调、自部署,但大规模商用产生收入需与阿里分成。
- 基准(厂商口径): Terminal-Bench 2.1 86.6、SWE-bench Pro 67.7、PaperBench 93.0、OSWorld-Verified 86.1。API 定价 $2/$6 每百万 token,缓存读取 $0.25。
来源: The Neural Feed · Davarion · SeventNews · Pondero
3. [官方发布] 智谱发布 GLM-5.3:7430 亿参数,后训练 +50%,补齐网络安全能力
时间: 2026-08-14 标签: [官方发布] [开源权重] [产品更新]
智谱发布新一代基座模型 GLM-5.3。关键事实:
- 参数不变,后训练跃迁: 总参数 7430 亿(与 GLM-5.2 相同,未如传闻升级至万亿);全部提升来自后训练——IndexShare 架构、SAO(单轨迹异步优化)与强化学习框架 slime。
- 编程与 Agent 跃升(厂商口径): Terminal-Bench 3.0 从 4.6 升至 28.3;DeepSWE v1.1 从 46.2 升至 66.9;Agents’ Last Exam 从 23.8 升至 28.5;GDPval-AA v2 得分 1769。
- Z.ai Code Bench(自研): High 档准确率 31.4%,超过 Claude Opus 4.8 最大档 29.5%,且每项任务平均仅约 5 万 tokens(Opus 4.8 约 12 万)。体感评测较 GLM-5.2 提升约 50%。
- 网络安全补齐: 漏洞发现基准 CyberGym 取得 84.5%,略高于 Anthropic Mythos 5 的 83.8%(中信建投研报口径)。支持 100 万 token 上下文、最高 128K 输出。
- 可用性与合规: 已上线 ZCode、AutoClaw 及多家第三方编程平台;API 即将推出,完整权重将在安全加固后两周内开源(限制潜在攻击能力、保留防御价值)。
来源: 上海证券报/华为云 · AIBase · 中信建投研报/腾讯
4. [官方发布] xAI 发布 Grok 4.6:面向 long-running agents,AA Index 61 追平 GPT-5.6 Sol
时间: 2026-08-12 标签: [官方发布] [产品更新]
SpaceXAI(xAI)发布 Grok 4.6,定位为面向"长程智能体"的模型。关键事实:
- 规格: 500K 上下文窗口,支持文本+图像输入、函数调用、结构化输出、四档推理强度(Low/Medium/High/XHigh,默认 High)。参数量官方未公布。
- 定价: 标准 API 输入 $2 / 缓存输入 $0.50 / 输出 $6 每百万 token;提示超 200K token 后三项均翻倍(输入 $4 / 缓存 $1 / 输出 $12)。Fast 变体价格翻倍。
- 基准(厂商口径,第三方分数取自各厂商系统卡): Artificial Analysis Intelligence Index 61,与 GPT-5.6 Sol Max 同分、低于 Fable 5 Max 的 62、高于 Grok 4.5 的 56。DeepSWE v1.1 65.9%、CursorBench v3.2 69.9%、FrontierCode 61.3%、APEX-Agents 57.5%;但 Terminal-Bench 仅 26%,低于 GPT-5.6 Sol 与 Fable 5。
- 产品矩阵: 同步提供 Grok Build(本地编码 Agent,TUI/Headless/ACP 三形态)、Grok Bot(持久云端 AI 队友,8-11 文档发布)。首周在 Grok Build 与 Cursor 提供双倍包含用量。
- 训练侧重: 在知识工作、通用编码、内核优化、Web 开发、CAD 等环境中强化后训练与 Agent 强化学习;xAI 观察其在长轨迹中更常主动自测,但属厂商内部观察而非独立统一基准。
来源: xAI 官方公告 · xAI 开发者文档 · The Decoder 交叉报道(多源聚合)
5. [官方发布] 微软首发自研推理模型 MAI-Thinking-1,强化"去 OpenAI 依赖"
时间: 2026-08-12 / 08-13(Microsoft Foundry 公开预览) 标签: [官方发布] [产品更新]
微软 AI CEO Mustafa Suleyman 宣布首个从零自研的推理模型 MAI-Thinking-1 进入 Microsoft Foundry 公开预览。关键事实:
- 架构: 稀疏 MoE,约 35B 激活 / 1T 总参,256K 上下文,支持函数调用与 Chat Completions API;未使用任何第三方模型蒸馏,基于干净、可追溯、企业级数据训练。
- 基准(微软口径): SWE-Bench Pro 约 52.8(微软称与 Claude Opus 4.6 同档);AIME 2025 97.0%、AIME 2026 94.5%;在 Surge 盲测(1276 项任务)中优于 Claude Sonnet 4.6。
- 战略意义: 这是微软在 Copilot 之外首个完全自主训练栈的推理模型,配合 6 月 Build 公布的 MAI 模型家族(推理/编码/图像/语音/转录),将 Azure 推理选型从"OpenAI/Anthropic/Google"扩展至"微软体系内自研"。GitHub Copilot 此前已切换至自研 MAI-Code-1-Flash。
- 边界: 闭源、托管式、中型推理足迹;定价未公开,需以 Foundry 实际 SKU 为准;仍为预览而非 GA。
来源: Microsoft AI 官方 · explainx.ai 解析 · The Win Central
二、AI Agent / 安全
6. [官方发布] OpenAI 推出 GPT-5.6-Cyber 与 Daybreak Red:95% 高级网络任务完成率,发现 Chrome V8 零日漏洞
时间: 2026-08-10 官宣,8-11 上线 Amazon Bedrock 标签: [官方发布] [产品更新] [学术前沿]
OpenAI 扩展 Daybreak 网络安全计划,推出专用安全模型 GPT-5.6-Cyber,仅通过 Daybreak Red 提供给通过审查的防御方。关键事实:
- 能力数据(OpenAI 内部评测): 在涉及漏洞利用链、认证绕过、权限提升的请求上完成率 95%;对比 GPT-5.6 Sol 标准护栏 1.5%、Daybreak Blue(Sol 降护栏)2.0%、上代 GPT-5.5-Cyber 57.3%。
- 真实战果: 研究人员用该模型发现 Chrome V8 JavaScript 引擎中两个此前未知漏洞,可串联破坏内存并逃逸 V8 堆沙箱;Google 修复并分配 CVE-2026-15903。另发现某移动 OS ≥5 个漏洞、某数据库 3 个严重漏洞、某 OS 内核 400+ 权限提升漏洞(多处于协同披露中)。
- Preparedness 评级: GPT-5.6-Cyber 评估为 High(高危但未达 Critical)——与同期被暂停的 Astra(疑似触及 Critical)形成对照。Daybreak Red 自 9/1 起强制硬件安全密钥。
- 可用性: 8-11 登陆 Amazon Bedrock(美东弗吉尼亚),需经 Trusted Access for Cyber 审查;合作伙伴含 Accenture、IBM、CrowdStrike、Palo Alto、Cisco 等。
来源: Quartz · Business Standard · Help Net Security · unite.ai/Bedrock
7. [行业新闻] Manus 恢复独立运营、与 Meta 分拆,部分用户数据将删除
时间: 2026-08-11 标签: [行业新闻] [融资/人事]
Manus 在官网发布《致用户的一封信》,宣布即将恢复以独立公司身份运营,作为与 Meta 分拆的一部分。关键事实:
- 监管背景: 2025-12-29 Meta 收购 Manus;2026-04 国家发改委外商投资安全审查机制办公室作出禁止投资决定,要求撤销该收购交易。
- 数据安排: 2025-12-29 当天及之后产生的部分用户数据,将于新加坡时间 8-23 08:00 至 8-24 被删除;受影响用户可在 8-23 07:59 前备份,8-25 08:00 起恢复入口开放。官方强调与数据泄露/安全事件无关,备份期免订阅费并提供回归奖励。
- 产品定位: Manus 为通用 AI Agent(2025-03 推出),曾披露 ARR 破 1 亿美元、累计处理超 147 万亿 tokens、创建超 8000 万个虚拟计算机实例。
来源: 澎湃新闻 · 新浪财经 · 今日头条/新黄河
三、具身智能
8. [官方发布] 宇树科技 8/19 科创板上市在即:A 股"人形机器人第一股"
时间: 2026-08-10 认购,预计 8-19 上市(上交所尚未正式确认) 标签: [官方发布] [融资/人事] [行业新闻]
宇树科技科创板 IPO 进入最后倒计时。关键事实:
- 发行与估值: 发行价 150.80 元/股,发行 40,446,434 股(占发行后 10%),募资约 61 亿元,隐含估值约 610 亿元(约 90 亿美元);代码 688836.SH(宇树科技-W)。
- 审核速度: 3-20 受理至 7 月初注册生效仅 104 天,创科创板预审机制以来最快完整周期。
- 业绩: 2025 营收 16.99 亿元(同比 +335%)、毛利率 60.27%、扣非净利 5.91 亿元;人形机器人出货 5500+ 台、全球份额 32.4% 居首。2026 H1 扣非净利预计同比下滑 6%–22%(研发费用与销售费用上升)。
- 外部变量: 招股书披露科研教育占收入 73.6%、工业仅 9%(W33 已述);美国在人形/四足机器人进口限制清单将宇树最大海外市场的其中之一关闭。另有报道称宇树 8-14 公布累计双足机器人下线 1.8 万台以回应出货量质疑。
- 状态提示: 行业共识指向 8-19 上市,但上交所尚未发布官方确认,交易窗口预计落在 8-17 至 8-21 之间。
来源: Gate/IPO 解析 · ODaily · Gate 中文
9. [行业新闻] SAG 2026 H1 报告:全球人形机器人出货 1.91 万台,智元反超宇树
时间: 2026-08-10 标签: [行业新闻] [待核验]
美国加州研究公司 Smart Analytics Global(SAG)发布 2026 上半年行业数据。关键事实:
- 总量: 全球人形机器人出货量约 1.91 万台,为去年同期 5100 台的三倍多(同比超 200%);中国厂商占 97%+。
- 格局: 智元机器人约 8400 台(44%,第一),宇树科技约 5900 台(31%,第二),两家合计约 75%,远超特斯拉、Figure AI、Agility Robotics 等美国头部企业。
- 场景结构: 工业及商业应用占比超 70%(2025 H1 约 50%),制造业、物流、仓储成为主要商业化路径。
- 预测: 2026 全年全球约 6 万台,2030 年约 50 万台。SAG 创始人 Linda Sui 提示监管不确定性与地缘政治风险可能影响下一阶段。
- 备注: 97% 为 2026 H1 最新测算,此前 Omdia、摩根士丹利对 2025 全年估算普遍在 85%–90% 区间,TrendForce 口径更审慎;本数据源自彭博转述 SAG,已标注待核验。
来源: QQ 新闻/彭博转述 · 腾讯新闻 · 香港商报 · 凤凰网
四、arXiv 论文快筛
本周从 arXiv cs.RO/cs.AI/cs.CL/cs.LG 中筛选与 VLA、世界模型、具身智能相关的预印本(提交于 2026-08-10 至 08-16),保留 5 篇。
10. [学术前沿] G0.5:推理与动作统一于单一自回归流
- arXiv: 2608.11739(cs.RO,提交于 2026-08-12,Galaxea 等)
- 核心: 主流 VLA 将预训练 VLM 与独立训练的 flow-matching 动作专家耦合,使 VLM 退化为上下文编码器。G0.5 用单一 Transformer decoder 在同一目标下输出推理 token 与动作 token,配套跨本体动作分词器、原生思维链流、多秒视觉记忆模块。
- 结果: 7 项独立基准超越 SOTA——真实机器人微调 76.7%(vs π0.5 53.3%、GR00T-N1.7 24.4%)、2025 BEHAVIOR 挑战 50 项长程任务 31.4%、LIBERO 98.9%、RoboTwin 2.0 93.3%、DROID 零样本迁移 82.5%。
- 意义: 推理与动作共享权重,预训练 VLM 能力直接迁移到物理行为,提示词即可调动作粒度与任务时长,无需重训。
11. [学术前沿] StellaVLA:测试时检索单条结构化演示实现跨场景泛化
- arXiv: 2608.11671(cs.RO,提交于 2026-08-11/12)
- 核心: VLA 在场景/视角/物体变化时易失效,通常需重采数据微调。StellaVLA 在测试时仅检索一条演示,由离线管线自动转为任务计划、子目标描述与口语化 3D 运动(传达"为何这样做"而非像素轨迹),可跨本体(真实机器人、人手、XR)复用,推理时仅动作专家运行、无额外延迟。
- 结果: VLA-Arena 排行榜总分 0.63(π0.5 为 0.44),LIBERO 平均成功率 98.8%。
12. [学术前沿] RIFT:世界-动作模型无需 rollout 即可"想象"未来
- arXiv: 2608.11521(cs.RO,提交于 2026-08-12)
- 核心: 世界-动作模型(WAM)靠逐帧生成未来视频决策,部署时延高。作者在 4 个 WAM、40 个 LIBERO 任务上做闭环干预,发现复用固定未来 K/V 缓存几乎不影响执行;RIFT 用可学习预期 token 单次前向构造完整未来缓存,将"消费缓存"与"生产缓存"解耦。
- 结果: LIBERO 成功率 98.8%(与 rollout 法一致),动作块时延降低 68.2%–89.1%。
13. [学术前沿] ForeWAM:不解码未来视频即为动作头提供动态上下文
- arXiv: 2608.11605(cs.RO,提交于 2026-08-11)
- 核心: 显式未来帧 WAM 需迭代去噪视频、代价高;直接策略 WAM 快但无预测动力学接口。ForeWAM 提出无需在部署时显式生成未来视频、即可为动作生成提供预测性上下文的直接策略 WAM。
14. [学术前沿] FACT:让失败动作也成为训练目标,缓解成功偏置幻觉
- arXiv: 2608.10232(cs.RO/cs.LG,提交于 2026-08-13,含 Nicklas Hansen、Xiaolong Wang)
- 核心: WAM 几乎只在成功演示上训练,无从学习"坏动作导致什么",推理时易幻觉出成功未来。FACT 改为以实际执行的动作所条件化的未来视频与任务进度为预测目标,将失败 rollout 转为合法监督信号;进度预测器同时见成功与失败结果,推理时对候选动作打分。
- 结果: 仿真与真实双臂实验中,随失败数据加入持续改进,坏动作下的成功偏置幻觉显著下降。
来源: arXiv 2608.11739 · arXiv 2608.11671 · arXiv 2608.11521 · arXiv 2608.11605 · arXiv 2608.10232 · FutureX Physical AI Daily #88
五、快速扫描
以下条目为本周监测到但未展开的重要信号,供后续追踪。
| 1 | Gemini 3.5 Pro 仍处 “coming soon” 状态:截至 8-10/8-12 未正式GA,官方模型页仅标"coming soon",8-12 传闻发布未获 Google 确认(预测市场/泄露口径),2M 上下文与 Deep Think 均未被官方证实 | AI Coding | andrew.ooo · geotoolbox |
| 2 | 美团 LongCat-2.0 开源国产卡推理代码:1.6T/平均激活48B MoE,业界首个在五万卡国产算力集群(华为昇腾级)跑通推理的万亿模型,主打 Agentic Coding,配套 LSA 稀疏注意力与 N-gram Embedding | AI Coding | 美团技术 · 美团技术博客 |
| 3 | 智源发布 AREX 自主研究智能体并开源权重:首创"研究→验证→再研究"双循环递归框架,10B 激活参数在多项基准达/超部分闭源旗舰 | AI Agent | 智源/公开报道 |
| 4 | Claude Code Auto Mode 如期于 8-14 成为默认权限模式(W33 已预告,本周落地):分类器替代人工审批 | AI Coding | ClaudeKit |
| 5 | Anthropic 为 Claude 生成文本嵌入隐形水印,以遵守 8-2 生效的欧盟《人工智能法》透明度规范 | AI Agent/政策 | 公开报道 |
| 6 | Claude in Chrome 升级为 Claude Cowork 会话:跨桌面/网页/移动端同步历史、技能与连接器 | AI Agent | 公开报道 |
| 7 | 研究者发现可读取 ChatGPT/Claude/Gemini 加密推理(hidden reasoning)的 API 漏洞:扫描约 7000 条公开会话发现 62 个 API 密钥、33 个邮箱与 33 个密码 | AI Agent/安全 | 公开报道 |
| 8 | 英伟达据称研发 Nemotron 4 开源模型(最大 ≥1T 参数),同期开源 Nemotron 3.5 Lightning(30B MoE,本地智能体) | AI Coding | 公开报道 |
| 9 | LTX-2.5 视频模型:2 张 GB200 生成 10 秒 720P 视频仅需 6.8 秒,单条成本约 0.90 美元 | AI Agent | 公开报道 |
| 10 | 宇树累计双足机器人下线 1.8 万台(8-14 公布),回应出货量口径质疑 | 具身智能 | 公开报道 |
六、本周观察
开源/国产旗舰"同一周阅兵",API 定价转向峰谷分层
8/10–8/13 是罕见的模型发布密集期:DeepSeek V4 Pro、Qwen3.8-Max 开源权重、GLM-5.3、Grok 4.6、微软 MAI-Thinking-1 在五天之内集中落地。它们的共同点不是"更大",而是后训练 + 长程 Agent 执行力——V4 Pro 仅靠后训练把 DeepSWE 从 12.8 拉到 62.7,GLM-5.3 在 7430 亿参数不变下做到体感 +50%,Qwen3.8-Max 2.4T 权重开放意味着"旗舰级开源"不再是例外。
值得关注的是定价格局:DeepSeek 8/17 启动峰谷定价(高峰输出涨 350%),标志"绝对低价普惠"时代的结束。当国产模型性能逼近 Fable 5 而价格仍低一个数量级时,算力稀缺驱动的市场化分层成为必然——模型能力的竞争正从"谁更强"收敛为"性能够用前提下谁更便宜、更能干"。
安全治理进入"实操":同一周内"放行"与"叫停"并存
本周 OpenAI 同时做了两件方向相反的事:将 GPT-5.6-Cyber(High 级、95% 完成率、已发现 CVE)经 Daybreak Red 严谨管控后放行;而对疑似触及 Critical 门槛的 Astra 维持暂停。这是 Preparedness Framework 首次在"放行/叫停"两个方向上同时被实操。Manus 因监管禁令与 Meta 分拆、恢复独立运营,则把"合规"从政策文本推入资本结构——安全与合规已从纸面框架进入产品形态与公司治理。
具身智能:从"估值锚"到"出货量锚 + 资本锚"双锚定
SAG 报告首次给出可对比的半年度出货量数字(全球 1.91 万台、智元 8400 反超宇树 5900),宇树 8/19 科创板上市在即将行业送上第一个公开市场估值基准。两条信息叠加,使具身智能从"讲故事"进入"用数字说话"的阶段。但需注意结构性温差仍在:宇树招股书披露科研教育占 73.6%、工业仅 9%,美国进口限制又关闭其重要海外市场;SAG 同时提示 97% 的中国占比与地缘政治风险——出货量领先不等于商业化健康,工业占比能否从 9% 爬升才是下一阶段真正的观察点。


