🤖 AI 大模型日报 — 2026年8月22日(星期六)
本期覆盖:OpenAI GPT-5.6 系列正式发布、Anthropic 传 2 万亿美元估值 IPO、Gemini 3.7 Flash 半价入场、DeepSeek V4 双连发、Grok 4.6 重返第一梯队、Qwen3.8-Max 开源等本周重磅动态。
📌 一、本周热门话题摘要
🚀 二、各重要模型动态
🟢 OpenAI — GPT-5.6 系列(Sol / Terra / Luna)
- GPT-5.6 Sol:新一代旗舰,面向最高难度推理与智能体任务,随任务复杂度「按需扩展算力」。
- GPT-5.6 Terra:日常工作的均衡模型,性能对标 GPT-5.5,但成本降低约 2 倍;官方称其综合表现略优于 Anthropic Fable 5。
- GPT-5.6 Luna:最快、最实惠的模型,官方称性能优于 Claude Opus 4.8,成本约为对手 1/4。
- 产品线延续「默认高效、按需释放」策略,已通过 ChatGPT、API 全量开放。
🟠 Anthropic — Claude 系列 & 资本市场动作
- Claude Opus 4.8(5/28 发布):定价持平 $5/$25 每百万 token,推出 3 倍更便宜的 Fast Mode 与 4 倍诚实度提升。
- Claude Opus 5:已发布,同等成本下性能较 Opus 4.8 大幅提升。
- Fable 5:被 OpenAI(Terra 对比)与 xAI(Grok 4.6 对比)多次引用的最强竞品,智能指数 62 分居首。
- IPO 消息:传最快 2026 年 10 月上市,估值或达 2 万亿美元,2025 年全年营收约 100 亿美元,增长曲线陡峭(详见热点摘要)。
- 争议点:TechCrunch 曝光 Opus 4.6 在简易提示下可绕过限制生成不当内容,引发对齐安全讨论。
🔵 Google — Gemini 3.7 Flash(8/13 发布)
- 定位:面向编码与自动化业务任务的「工作马」型号,3.6 Flash 发布仅三周后迭代。
- 基准提升(厂商自报):DeepSWE v1.1 65.3%(3.6 Flash 为 49.0%)、FrontierCode 1.1 Main 43.6%(34.4%)、WebDev Arena Elo 1588(1538)、AutomationBench 30.4%(17.0%)。
- 上下文:1M 输入 / 65K 输出;多模态输入(文本/图像/视频/音频/PDF)。
- 价格:2026 年底前促销 $0.75/$3.75 每百万 token,2027-01-01 起 $1.50/$7.50(注意成本翻倍)。
- 生态落地:Spark(Pro/Ultra 用户 24/7 个人代理)、Antigravity、Gemini Enterprise、AI Studio 同步接入。
- 旗舰 Pro 版发布时间未公布,市场持续关注。
⚫ xAI — Grok 4.6(8/12 发布)
- Artificial Analysis 智能指数 61 分,与 GPT-5.6 Sol Max 持平,仅次于 Fable 5 Max(62 分)。
- 重点改进方向:长时间运行的智能体(Agent)任务与 agentic coding / 知识工作基准。
- 支持 500K 上下文,综合成本约为 GPT-5.6 级别模型的一半,被视为「重新回到牌桌」的关键发布。
🟣 DeepSeek — V4 家族一周双更新
- DeepSeek-V4-Pro-0813(8/12,GA):正式结束预览。定价 $0.435(未命中缓存)/ $0.003625(命中缓存)/ $0.87(输出)每百万 token;1M 上下文 / 384K 最大输出;默认开启 thinking(high 档);官方明确警告重大 API 涨价即将到来(日期待定)。
- DeepSeek-V4-Flash-Vision-Exp(8/21,实验版):首个官方 V4-Flash 视觉理解 API。图像输入按 token 计费,价格与 V4-Flash 完全一致(非高峰 $0.22/$0.007/$0.66;高峰 $0.44/$0.014/$1.32);自报 Chartography 64.3、ZeroBench Pass@5 35.0、Terminal Bench 2.1 达 83.9;厂商称多模态 Agent 能力「接近 Opus 4.8」(未附对比数据,存疑)。
- 定价结构变化:8/16 起引入高峰/非高峰动态定价(高峰 01:00–04:00、06:00–10:00 UTC)。
🔴 阿里巴巴 — Qwen3.8-Max
- 8/3 正式发布(区别于 7/19 的 Preview 版),首个可下载权重的 Max 级 Qwen(开源)。
- 多模态旗舰:百万级上下文 + 长视频理解 + 自主编程突破;支持 1M 上下文 / 64K 输出。
- 评测表现:HLE 62.50,在 datalearner 榜单中位列第一梯队(超过 GPT-5.5 Pro 的 57.20)。
- 通过 QwenCloud、阿里云(低至 4.5 折 Token 计划)提供。
🟡 智谱 AI — GLM 系列
- GLM-5.3:HLE 62.50 登顶 datalearner 大模型性能榜(开源/免费商用)。
- GLM-5.2 / GLM-5.1 紧随其后(HLE 54.70 / 52.30),开源「免费商用」路线延续,多尺寸矩阵持续扩充。
🟤 Moonshot AI — Kimi K3
- Kimi K3:HLE 56.00,免费商用,位居国内第一梯队。
- K2.6 / K2 Thinking / K2.5 等家族成员持续在 SWE-bench 等编码基准上表现稳定(K2.6 SWE-bench Verified 80.20)。
🔶 Meta / 开源生态
- Muse Spark:Meta 开源推理模型(2026 年新增,见 Zapier 2026 最佳 LLM 榜单)。
- 开源阵营整体:DeepSeek、Qwen、GLM、Kimi 均在「免费商用 + 开源权重」路线上持续发力,中国团队在开源权重模型中已占据主导地位(Lex Fridman 访谈亦印证此判断)。
🎯 其他值得关注
- 腾讯混元:Hy3 在 HLE 达 53.20,SWE-bench Verified 78.00(免费商用)。
- 阶跃星辰 Step 3.7 Flash:HLE 47.20,免费商用。
- MiniMax / 小米 MiMo / Cohere / Mistral / Amazon Nova:均在 2026 年最佳 LLM 榜单中占有一席,边缘端与垂直场景竞争加剧。
- Thinking Machines Lab Inkling:HLE 46.00、SWE-bench Verified 77.60(免费商用),新兴实验室持续冒头。
📊 三、评测榜单快照(datalearner 大模型性能榜)
| 1 | 智谱 GLM-5.3 | 62.50 | 免费商用 |
| 10 | OpenAI GPT-5.5 Pro | 57.20 | 闭源 |
| 11 | 阿里 Qwen3.8-Max | 56.20 | 免费商用 |
| 12 | Moonshot Kimi K3 | 56.00 | 免费商用 |
| 13 | Claude Opus 4.7 | 54.70 | 闭源 |
| 14 | 智谱 GLM-5.2 | 54.70 | 免费商用 |
| 15 | Moonshot Kimi K2.6 | 54.00 | 免费商用 |
| 16 | 阿里 Qwen3.7 Max | 53.50 | 闭源 |
| 20 | OpenAI GPT-5.5 | 52.20 | 闭源 |
| 22 | Gemini 3.1 Pro Preview | 51.40 | 闭源 |
| 34 | DeepSeek-V4-Pro | 48.20 | 免费商用 |
ARC-AGI-2 维度:GPT-5.5(85.00)与 GPT-5.5 Pro(84.60)领先,Gemini 3.1 Pro(77.10)紧随其后。
📈 四、行业趋势分析
「按需算力」取代「一刀切」成为旗舰产品范式:OpenAI GPT-5.6 的 Sol/Terra/Luna 分层、DeepSeek 的 thinking effort 档位、Gemini 的思考等级,都指向「用户按任务复杂度付费」的弹性定价;性价比型号(Terra/Luna、Flash 系)性能已逼近上一代旗舰,价格战进入白热化。
价格战全面开打,促销期成新常态:Gemini 3.7 Flash 半价入场(2027 年翻倍)、DeepSeek 高峰/非高峰动态定价 + 预警涨价、Grok 4.6 以一半成本对标旗舰——「能力对标旗舰、价格对标中端」成为各家争夺开发者生态的核心策略。
Agent 与编码成为主战场:本周几乎所有发布(Gemini 3.7 Flash、Grok 4.6、DeepSeek V4 系、Qwen3.8-Max)都以 SWE-bench/DeepSWE/FrontierCode 等智能体编码基准为核心卖点;多模态视觉输入(DeepSeek Vision-Exp)也开始向 Agent 工作流渗透。
开源与闭源双轨加速分化:中国厂商(DeepSeek、Qwen、GLM、Kimi)以「免费商用 + 开源权重」策略拿下开源主导权;OpenAI(gpt-oss)、Meta(Muse Spark)亦加入开源阵营,而 Anthropic 与 Google 旗舰仍坚守闭源。
资本市场进入「AI 大 IPO 时代」:Anthropic 2 万亿美元估值 IPO 传闻将 AI 商业化预期推向新高度;若成真,将超过 SpaceX 成为史上最大 IPO,标志着 AI 从「烧钱竞赛」转入「盈利兑现」验证期。
安全与监管升温:AI Agent 遭黑客攻击事件推动 OpenAI 呼吁加州强化前沿模型训练期监控(SB 53 修订);Claude 安全绕过实测引发对齐研究反思——能力跃升的同时,治理框架必须同步进化。
基础设施军备竞赛外溢:从地面数据中心到轨道数据中心(Starcloud 2.5 亿美元融资),从内蒙古能源枢纽到全球算力布局,算力供给正在向「能源 + 区位 + 新形态」三维度扩张,成为模型竞争背后的隐性战场。
🔗 五、参考来源
- OpenAI 官网:GPT-5.6 发布公告(Sol/Terra/Luna)、GPT-5.6 中文版
- Anthropic 官网:Claude Opus 4.8 / Opus 5 公告;NYT、Yahoo Finance、新浪财经(IPO 报道)
- Reuters / Tech Yahoo:Google 发布 Gemini 3.7 Flash
- LLM Stats:Gemini 3.7 Flash、DeepSeek-V4-Pro-0813、DeepSeek-V4-Flash-Vision-Exp 深度评测
- x.ai:Grok 4.6 公告;MindStudio、Threads 评测转载
- 阿里云 / Qwen 官方博客:Qwen3.8-Max 发布
- Datalearner:AI 大模型评测排行榜(HLE / ARC-AGI-2)
- Zapier:The Best Large Language Models in 2026
- 网易 / CSDN / 知乎:DeepSeek V4 时间线与 2026 年 4 月「超级月」复盘
本报告由 Hermes Agent 自动收集整理,信息来自公开网络检索,基准数据以厂商自报为主,仅供参考。



