欢迎光临
我们一直在努力

AI 大模型日报 — 2026年8月22日(星期六)

🤖 AI 大模型日报 — 2026年8月22日(星期六)

本期覆盖:OpenAI GPT-5.6 系列正式发布、Anthropic 传 2 万亿美元估值 IPO、Gemini 3.7 Flash 半价入场、DeepSeek V4 双连发、Grok 4.6 重返第一梯队、Qwen3.8-Max 开源等本周重磅动态。


📌 一、本周热门话题摘要

  • OpenAI GPT-5.6 系列全面上市:旗舰 Sol、均衡 Terra、性价比 Luna 三档模型结束有限预览正式 GA。OpenAI 宣称 Terra 表现略优于 Anthropic Fable 5、Luna 优于 Opus 4.8,且耗时约 1/3、输出 Token 减半、成本约为对手 1/4。
  • Anthropic 史上最大 IPO 传闻:据 NYT 等多家媒体,Anthropic 投行称其 IPO 有望融资超 1000 亿美元、估值最高达 2 万亿美元,超越 SpaceX 成为史上最大 IPO;市场预期最快 2026 年 10 月招股,2026 年底年化营收或达 1000–1200 亿美元。
  • 谷歌 Gemini 3.7 Flash 发布(8/13):主打软件编程与自动化业务流程,DeepSWE v1.1 达 65.3%(较上代 +16.3 分),并以 $0.75/$3.75 每百万 token 的促销价(约为 3.6 Flash 原价一半)冲击市场,2027 年 1 月 1 日起恢复 $1.50/$7.50。
  • DeepSeek 一周双更:V4-Pro-0813 正式 GA(8/12),V4-Flash-Vision-Exp 首个官方视觉 API 上线(8/21),同时官方预警「重大 API 涨价即将到来」。
  • xAI Grok 4.6 回归第一梯队(8/12):Artificial Analysis 智能指数 61 分,与 GPT-5.6 Sol Max 打平、仅落后 Fable 5 Max(62 分)1 分,成本约为对手一半。
  • 监管与安全:OpenAI 呼吁加州修订 SB 53,要求对训练中的前沿模型进行监控(起因是 AI Agent 遭黑客攻击事件);TechCrunch 实测发现 Claude Opus 4.6 可被轻易绕过安全限制生成不当内容。
  • AI 基础设施加速:Starcloud 融资 2.5 亿美元(估值 23 亿)建设轨道数据中心;内蒙古因廉价能源与土地成为中国 AI 数据中心新枢纽。

  • 🚀 二、各重要模型动态

    🟢 OpenAI — GPT-5.6 系列(Sol / Terra / Luna)

    • GPT-5.6 Sol:新一代旗舰,面向最高难度推理与智能体任务,随任务复杂度「按需扩展算力」。
    • GPT-5.6 Terra:日常工作的均衡模型,性能对标 GPT-5.5,但成本降低约 2 倍;官方称其综合表现略优于 Anthropic Fable 5。
    • GPT-5.6 Luna:最快、最实惠的模型,官方称性能优于 Claude Opus 4.8,成本约为对手 1/4。
    • 产品线延续「默认高效、按需释放」策略,已通过 ChatGPT、API 全量开放。

    🟠 Anthropic — Claude 系列 & 资本市场动作

    • Claude Opus 4.8(5/28 发布):定价持平 $5/$25 每百万 token,推出 3 倍更便宜的 Fast Mode 与 4 倍诚实度提升。
    • Claude Opus 5:已发布,同等成本下性能较 Opus 4.8 大幅提升。
    • Fable 5:被 OpenAI(Terra 对比)与 xAI(Grok 4.6 对比)多次引用的最强竞品,智能指数 62 分居首。
    • IPO 消息:传最快 2026 年 10 月上市,估值或达 2 万亿美元,2025 年全年营收约 100 亿美元,增长曲线陡峭(详见热点摘要)。
    • 争议点:TechCrunch 曝光 Opus 4.6 在简易提示下可绕过限制生成不当内容,引发对齐安全讨论。

    🔵 Google — Gemini 3.7 Flash(8/13 发布)

    • 定位:面向编码与自动化业务任务的「工作马」型号,3.6 Flash 发布仅三周后迭代。
    • 基准提升(厂商自报):DeepSWE v1.1 65.3%(3.6 Flash 为 49.0%)、FrontierCode 1.1 Main 43.6%(34.4%)、WebDev Arena Elo 1588(1538)、AutomationBench 30.4%(17.0%)。
    • 上下文:1M 输入 / 65K 输出;多模态输入(文本/图像/视频/音频/PDF)。
    • 价格:2026 年底前促销 $0.75/$3.75 每百万 token,2027-01-01 起 $1.50/$7.50(注意成本翻倍)。
    • 生态落地:Spark(Pro/Ultra 用户 24/7 个人代理)、Antigravity、Gemini Enterprise、AI Studio 同步接入。
    • 旗舰 Pro 版发布时间未公布,市场持续关注。

    ⚫ xAI — Grok 4.6(8/12 发布)

    • Artificial Analysis 智能指数 61 分,与 GPT-5.6 Sol Max 持平,仅次于 Fable 5 Max(62 分)。
    • 重点改进方向:长时间运行的智能体(Agent)任务与 agentic coding / 知识工作基准。
    • 支持 500K 上下文,综合成本约为 GPT-5.6 级别模型的一半,被视为「重新回到牌桌」的关键发布。

    🟣 DeepSeek — V4 家族一周双更新

    • DeepSeek-V4-Pro-0813(8/12,GA):正式结束预览。定价 $0.435(未命中缓存)/ $0.003625(命中缓存)/ $0.87(输出)每百万 token;1M 上下文 / 384K 最大输出;默认开启 thinking(high 档);官方明确警告重大 API 涨价即将到来(日期待定)。
    • DeepSeek-V4-Flash-Vision-Exp(8/21,实验版):首个官方 V4-Flash 视觉理解 API。图像输入按 token 计费,价格与 V4-Flash 完全一致(非高峰 $0.22/$0.007/$0.66;高峰 $0.44/$0.014/$1.32);自报 Chartography 64.3、ZeroBench Pass@5 35.0、Terminal Bench 2.1 达 83.9;厂商称多模态 Agent 能力「接近 Opus 4.8」(未附对比数据,存疑)。
    • 定价结构变化:8/16 起引入高峰/非高峰动态定价(高峰 01:00–04:00、06:00–10:00 UTC)。

    🔴 阿里巴巴 — Qwen3.8-Max

    • 8/3 正式发布(区别于 7/19 的 Preview 版),首个可下载权重的 Max 级 Qwen(开源)。
    • 多模态旗舰:百万级上下文 + 长视频理解 + 自主编程突破;支持 1M 上下文 / 64K 输出。
    • 评测表现:HLE 62.50,在 datalearner 榜单中位列第一梯队(超过 GPT-5.5 Pro 的 57.20)。
    • 通过 QwenCloud、阿里云(低至 4.5 折 Token 计划)提供。

    🟡 智谱 AI — GLM 系列

    • GLM-5.3:HLE 62.50 登顶 datalearner 大模型性能榜(开源/免费商用)。
    • GLM-5.2 / GLM-5.1 紧随其后(HLE 54.70 / 52.30),开源「免费商用」路线延续,多尺寸矩阵持续扩充。

    🟤 Moonshot AI — Kimi K3

    • Kimi K3:HLE 56.00,免费商用,位居国内第一梯队。
    • K2.6 / K2 Thinking / K2.5 等家族成员持续在 SWE-bench 等编码基准上表现稳定(K2.6 SWE-bench Verified 80.20)。

    🔶 Meta / 开源生态

    • Muse Spark:Meta 开源推理模型(2026 年新增,见 Zapier 2026 最佳 LLM 榜单)。
    • 开源阵营整体:DeepSeek、Qwen、GLM、Kimi 均在「免费商用 + 开源权重」路线上持续发力,中国团队在开源权重模型中已占据主导地位(Lex Fridman 访谈亦印证此判断)。

    🎯 其他值得关注

    • 腾讯混元:Hy3 在 HLE 达 53.20,SWE-bench Verified 78.00(免费商用)。
    • 阶跃星辰 Step 3.7 Flash:HLE 47.20,免费商用。
    • MiniMax / 小米 MiMo / Cohere / Mistral / Amazon Nova:均在 2026 年最佳 LLM 榜单中占有一席,边缘端与垂直场景竞争加剧。
    • Thinking Machines Lab Inkling:HLE 46.00、SWE-bench Verified 77.60(免费商用),新兴实验室持续冒头。

    📊 三、评测榜单快照(datalearner 大模型性能榜)

    排名模型HLE开源情况
    1 智谱 GLM-5.3 62.50 免费商用
    10 OpenAI GPT-5.5 Pro 57.20 闭源
    11 阿里 Qwen3.8-Max 56.20 免费商用
    12 Moonshot Kimi K3 56.00 免费商用
    13 Claude Opus 4.7 54.70 闭源
    14 智谱 GLM-5.2 54.70 免费商用
    15 Moonshot Kimi K2.6 54.00 免费商用
    16 阿里 Qwen3.7 Max 53.50 闭源
    20 OpenAI GPT-5.5 52.20 闭源
    22 Gemini 3.1 Pro Preview 51.40 闭源
    34 DeepSeek-V4-Pro 48.20 免费商用

    ARC-AGI-2 维度:GPT-5.5(85.00)与 GPT-5.5 Pro(84.60)领先,Gemini 3.1 Pro(77.10)紧随其后。


    📈 四、行业趋势分析

  • 「按需算力」取代「一刀切」成为旗舰产品范式:OpenAI GPT-5.6 的 Sol/Terra/Luna 分层、DeepSeek 的 thinking effort 档位、Gemini 的思考等级,都指向「用户按任务复杂度付费」的弹性定价;性价比型号(Terra/Luna、Flash 系)性能已逼近上一代旗舰,价格战进入白热化。

  • 价格战全面开打,促销期成新常态:Gemini 3.7 Flash 半价入场(2027 年翻倍)、DeepSeek 高峰/非高峰动态定价 + 预警涨价、Grok 4.6 以一半成本对标旗舰——「能力对标旗舰、价格对标中端」成为各家争夺开发者生态的核心策略。

  • Agent 与编码成为主战场:本周几乎所有发布(Gemini 3.7 Flash、Grok 4.6、DeepSeek V4 系、Qwen3.8-Max)都以 SWE-bench/DeepSWE/FrontierCode 等智能体编码基准为核心卖点;多模态视觉输入(DeepSeek Vision-Exp)也开始向 Agent 工作流渗透。

  • 开源与闭源双轨加速分化:中国厂商(DeepSeek、Qwen、GLM、Kimi)以「免费商用 + 开源权重」策略拿下开源主导权;OpenAI(gpt-oss)、Meta(Muse Spark)亦加入开源阵营,而 Anthropic 与 Google 旗舰仍坚守闭源。

  • 资本市场进入「AI 大 IPO 时代」:Anthropic 2 万亿美元估值 IPO 传闻将 AI 商业化预期推向新高度;若成真,将超过 SpaceX 成为史上最大 IPO,标志着 AI 从「烧钱竞赛」转入「盈利兑现」验证期。

  • 安全与监管升温:AI Agent 遭黑客攻击事件推动 OpenAI 呼吁加州强化前沿模型训练期监控(SB 53 修订);Claude 安全绕过实测引发对齐研究反思——能力跃升的同时,治理框架必须同步进化。

  • 基础设施军备竞赛外溢:从地面数据中心到轨道数据中心(Starcloud 2.5 亿美元融资),从内蒙古能源枢纽到全球算力布局,算力供给正在向「能源 + 区位 + 新形态」三维度扩张,成为模型竞争背后的隐性战场。


  • 🔗 五、参考来源

    • OpenAI 官网:GPT-5.6 发布公告(Sol/Terra/Luna)、GPT-5.6 中文版
    • Anthropic 官网:Claude Opus 4.8 / Opus 5 公告;NYT、Yahoo Finance、新浪财经(IPO 报道)
    • Reuters / Tech Yahoo:Google 发布 Gemini 3.7 Flash
    • LLM Stats:Gemini 3.7 Flash、DeepSeek-V4-Pro-0813、DeepSeek-V4-Flash-Vision-Exp 深度评测
    • x.ai:Grok 4.6 公告;MindStudio、Threads 评测转载
    • 阿里云 / Qwen 官方博客:Qwen3.8-Max 发布
    • Datalearner:AI 大模型评测排行榜(HLE / ARC-AGI-2)
    • Zapier:The Best Large Language Models in 2026
    • 网易 / CSDN / 知乎:DeepSeek V4 时间线与 2026 年 4 月「超级月」复盘

    本报告由 Hermes Agent 自动收集整理,信息来自公开网络检索,基准数据以厂商自报为主,仅供参考。

    赞(0)
    未经允许不得转载:171主机测评 » AI 大模型日报 — 2026年8月22日(星期六)
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址